Perplexity Sonar domina nova avaliação Search Arena
Modelos Perplexity Sonar alcançam posições de destaque na avaliação de pesquisa

TL;DR
- Classificação nº 1: Sonar-Reasoning-Pro-High alcançou uma pontuação de arena de 1136 (±21/−19), empatando estatisticamente em primeiro lugar com o Gemini-2.5-Pro-Grounding do Google (1142 +14/-17). Em batalhas diretas, o Sonar-Reasoning-Pro-High superou o Gemini-2.5-Pro-Grounding em 53% das vezes.
- Domínio do Sonar: Os modelos da Perplexity garantiram as posições de 1 a 4, superando significativamente outros modelos avaliados do Google e da OpenAI.
- Vantagem de Raciocínio: Modelos que incorporam recursos de raciocínio (sonar-reasoning-pro e sonar-reasoning) foram classificados em posições mais altas, alinhando-se à preferência geral do usuário observada para modelos de raciocínio (top 3 na tabela de classificação).
- Profundidade de Pesquisa: Os modelos Sonar realizam pesquisas mais profundas e consideram mais fontes, citando, em média, 2 a 3 vezes mais fontes do que modelos Gemini comparáveis.
______
A LM Arena acabou de lançar sua nova tabela de classificação Search Arena, comparando sistemas de LLM com busca aumentada com base na preferência humana. O modelo Sonar-Reasoning-Pro da Perplexity empatou em primeiro lugar com o Gemini-2.5-Pro-Grounding, com os demais modelos Sonar superando o Gemini-2.0-Flash-Grounding e todos os modelos de pesquisa na web da OpenAI.

Benchmarking da Search Arena
Diferentemente do foco do SimpleQA em precisão factual restrita, a LM Arena avalia o desempenho dos modelos em consultas reais dos usuários envolvendo codificação, redação, pesquisa e recomendações. Com a Search Arena, a avaliação concentra-se em eventos atuais e inclui prompts mais longos e complexos, coletando mais de 10.000 votos de preferência humana em 11 modelos. Entre 18 de março e 13 de abril de 2025, a Search Arena solicitou aos usuários que realizassem prompts e selecionassem qual resposta do modelo atendia melhor às suas necessidades de informação.
Resultados de Desempenho do Modelo Sonar
Os modelos Sonar da Perplexity superaram muitos dos principais modelos de última geração, incluindo o Gemini 2.0 Flash e o GPT 4o Search. Nosso modelo Sonar-Reasoning-Pro alcançou uma pontuação de 1136, estatisticamente empatado com o Gemini-2.5-Pro-Grounding (1142) na primeira posição.

A avaliação da Search Arena revelou três fatores que se correlacionam fortemente com a preferência humana:
- Respostas mais longas (coef. 0,255, p<0,05)
- Contagens de citações mais altas (coef. 0,234, p<0,05)
- Citações de fontes da web da comunidade
A tabela de classificação mostrou uma clara preferência dos usuários por modelos com raciocínio aprimorado, com Sonar-Reasoning-Pro e Sonar-Reasoning ocupando duas das três primeiras posições. Experimentos de controle reforçaram essas descobertas, demonstrando que o controle de citações fez com que as classificações dos modelos convergissem, sugerindo que a profundidade da pesquisa é um diferencial significativo de desempenho.

O que isso significa para os usuários
Para os usuários da Perplexity, esses resultados confirmam que os modelos Sonar oferecem precisão de primeira linha, atribuição abrangente de fontes e respostas de alta qualidade em uma ampla gama de tópicos.
Os usuários do Perplexity Pro podem continuar a se beneficiar desses modelos de alto desempenho definindo o Sonar como seu modelo padrão em configurações. Usuários de API podem acessar esses recursos por meio de nossas ofertas de API Sonar com modos de pesquisa flexíveis para equilibrar desempenho e eficiência de custos
Embora estejamos orgulhosos dessa conquista, continuamos focados na melhoria contínua. A avaliação da Search Arena fornece insights valiosos sobre as preferências dos usuários que informarão nossos esforços de desenvolvimento contínuos.

Introdução ao Sonar
Junte-se ao cofundador e CTO da Perplexity, Denis Yarats, para uma visão geral da nossa API em 24 de abril, às 11h PT. Denis apresentará uma visão geral das APIs da Perplexity, compartilhará resultados de benchmark e casos de uso da API.
Registre-se aqui.