Artigo

Perplexity Sonar Domina a Avaliação da Nova Arena de Busca

Luz rompendo através de um piso geométrico e sólido

Resumo

  • Classificação #1: Sonar-Reasoning-Pro-High alcançou uma Pontuação Arena de 1136 (±21/−19), empatando estatisticamente em primeiro lugar com o Gemini-2.5-Pro-Grounding da Google (1142 +14/-17). Em batalhas diretas, Sonar-Reasoning-Pro-High venceu o Gemini-2.5-Pro-Grounding 53% das vezes.

  • Dominância Sonar: Os modelos da Perplexity garantiram as classificações de 1 a 4, superando significativamente outros modelos avaliados da Google e OpenAI.

  • Vantagem de Raciocínio: Modelos que incorporam habilidades de raciocínio (sonar-reasoning-pro e sonar-reasoning) ficaram mais bem classificados, alinhando-se com a preferência geral do usuário observada para modelos de raciocínio (top 3 no ranking).

  • Profundidade da Pesquisa: Os modelos Sonar realizam pesquisas mais profundas e consideram mais fontes, citando em média 2 a 3 vezes mais fontes do que os modelos Gemini comparáveis.

LM Arena acabou de lançar seu novo ranking do Search Arena comparando sistemas LLM aprimorados para busca com base na preferência humana. O modelo Sonar-Reasoning-Pro da Perplexity empatou em primeiro lugar com o Gemini-2.5-Pro-Grounding, com o restante dos modelos Sonar superando o Gemini-2.0-Flash-Grounding e todos os modelos de busca na web da OpenAI.

Benchmarking do Search Arena

Diferentemente do foco do SimpleQA na precisão factual restrita, o LM Arena avalia como os modelos se comportam em consultas reais de usuários em codificação, redação, pesquisa e recomendações. Com o Search Arena, a avaliação foca em eventos atuais e inclui prompts mais longos e complexos, coletando mais de 10.000 votos de preferência humana em 11 modelos. Entre 18 de março e 13 de abril de 2025, o Search Arena pediu aos usuários que dessem prompts e escolhessem qual resposta do modelo melhor satisfazia suas necessidades de informação.

Resultados de Performance dos Modelos Sonar

Os modelos Sonar da Perplexity superaram muitos dos modelos de última geração, incluindo Gemini 2.0 Flash e GPT 4o Search. Nosso modelo Sonar-Reasoning-Pro alcançou uma pontuação de 1136, empatando estatisticamente com o Gemini-2.5-Pro-Grounding (1142) na posição de topo.

Em batalhas diretas, Sonar-Reasoning-Pro-High venceu o Gemini-2.5-Pro-Grounding 53% das vezes.

A avaliação do Search Arena revelou três fatores fortemente correlacionados com a preferência humana:

  • Respostas mais longas (coef 0.255, p<0.05)

  • Maior número de citações (coef 0.234, p<0.05)

  • Citações de fontes web da comunidade

O ranking mostrou clara preferência do usuário por modelos aprimorados de raciocínio, com Sonar-Reasoning-Pro e Sonar-Reasoning ocupando duas das três primeiras posições. Experimentos de controle reforçaram essas descobertas, mostrando que o controle por citações fez com que os rankings dos modelos convergissem, sugerindo que a profundidade da pesquisa é um diferenciador de desempenho significativo.

Os modelos Sonar da Perplexity tiveram substancialmente maior profundidade de pesquisa, com ppl-sonar-pro-high citando 2 a 3 vezes mais fontes do que os modelos equivalentes Gemini.

O Que Isso Significa para os Usuários

Para os usuários da Perplexity, esses resultados confirmam que os modelos Sonar oferecem precisão líder de classe, atribuição abrangente de fontes e respostas de alta qualidade em uma ampla gama de tópicos.

Os usuários da Perplexity Pro podem continuar a se beneficiar desses modelos de alto desempenho configurando o Sonar como seu modelo padrão nas configurações. Os usuários da API podem acessar essas capacidades através de nossas ofertas de API Sonar com modos de pesquisa flexíveis para equilibrar desempenho e eficiência de custos.

Embora estejamos orgulhosos desta conquista, permanecemos focados na melhoria contínua. A avaliação do Search Arena fornece insights valiosos sobre as preferências dos usuários que irão informar nossos esforços de desenvolvimento contínuos.

Introdução ao Sonar

Junte-se ao co-fundador e CTO da Perplexity, Denis Yarats, para uma visão geral de nossa API em 24 de abril às 11h PT. Denis fornecerá uma visão geral das APIs da Perplexity, compartilhará resultados de benchmarks e casos de uso de API.

Inscreva-se aqui.

Comece com Sonar.

Interessado em moldar o futuro da nossa plataforma de API? Estamos contratando.

Junte-se à nossa comunidade de desenvolvedores para se manter atualizado sobre novos lançamentos, recursos e atualizações.

Interessado em moldar o futuro da nossa plataforma de API? Estamos contratando.

Junte-se à nossa comunidade de desenvolvedores para se manter atualizado sobre novos lançamentos, recursos e atualizações.

Interessado em moldar o futuro da nossa plataforma de API? Estamos contratando.

Junte-se à nossa comunidade de desenvolvedores para se manter atualizado sobre novos lançamentos, recursos e atualizações.