Perplexity Sonar domina a nova avaliación de Search Arena
Os modelos Sonar de Perplexity alcanzan postos clave na avaliación de busca

En resumo
- Posto #1: Sonar-Reasoning-Pro-High acadou unha puntuación na Arena de 1136 (±21/−19), empatando estatisticamente polo primeiro posto con Gemini-2.5-Pro-Grounding de Google (1142 +14/-17). En batallas directas cara a cara, Sonar-Reasoning-Pro-High superou a Gemini-2.5-Pro-Grounding o 53% das veces.
- Dominio de Sonar: Os modelos de Perplexity aseguráronse os postos do 1 ao 4, superando significativamente a outros modelos evaluados de Google e OpenAI.
- Vantaxe de razoamento: Os modelos que incorporan capacidades de razoamento (sonar-reasoning-pro e sonar-reasoning) obtiveron postos máis altos, o que coincide coa preferencia xeral dos usuarios observada para os modelos de razoamento (os 3 primeiros da clasificación).
- Profundidade de busca: Os modelos Sonar realizan buscas máis profundas e consideran máis fontes; de media, citan entre 2 e 3 veces máis fontes que os modelos Gemini comparables.
______
LM Arena ven de publicar a súa nova clasificación da Search Arena, que compara sistemas LLM aumentados por busca baseados na preferencia humana. O modelo Sonar-Reasoning-Pro de Perplexity empatou no primeiro posto con Gemini-2.5-Pro-Grounding, mentres que o resto dos modelos Sonar superaron a Gemini-2.0-Flash-Grounding e a todos os modelos de busca web de OpenAI.

Avalm. comparativa de Search Arena
A diferenza do enfoque de SimpleQA en precisións factuais restrinxidas, LM Arena avalía o rendemento dos modelos en consultas reais de usuarios sobre programación, redacción, investigación e recomendacións. Con Search Arena, a avaliación céntrase en eventos actuais e inclúe indicacións máis longas e complexas, recollendo máis de 10.000 votos de preferencia humana en 11 modelos. Entre o 18 de marzo e o 13 de abril de 2025, Search Arena pediu aos usuarios que introducesen indicacións e seleccionasen cal resposta do modelo satisfacía mellor as súas necesidades de información.
Resultados de rendemento dos modelos Sonar
Os modelos Sonar de Perplexity superaron moitos dos principais modelos avanzados, incluíndo Gemini 2.0 Flash e GPT 4o Search. O noso modelo Sonar-Reasoning-Pro acadou unha puntuación de 1136, empatando estatisticamente na primeira posición con Gemini-2.5-Pro-Grounding (1142).

A avaliación de Search Arena revelou tres factores que están fortemente relacionados coa preferencia humana:
- Respostas máis longas (coef. 0,255, p<0,05)
- Maior número de citas (coef. 0,234, p<0,05)
- Citas de fontes web da comunidade
A clasificación amosou unha clara preferencia dos usuarios polos modelos con capacidade de razoamento mellorada; Sonar-Reasoning-Pro e Sonar-Reasoning ocuparon dous dos tres primeiros postos. Os experimentos de control reforzaron estes descubrimentos, demostrando que o control das citas facía converxer as clasificacións dos modelos, o que suxire que a profundidade de busca é un factor diferenciador significativo do rendemento.

O que isto significa para os usuarios
Para os usuarios de Perplexity, estes resultados confirman que os modelos Sonar ofrecen a mellor precisión da súa categoría, atribución completa de fontes e respostas de alta-calidade nunha ampla gama de temas.
Os usuarios de Perplexity Pro poden seguir beneficiándose destes modelos de alto rendemento configurando Sonar como o seu modelo predeterminado en settings. Os usuarios da API poden acceder a estas capacidades a través das nosas ofertas de API de Sonar con modos de busca flexibles para equilibrar o rendemento e a eficiencia de custos.
Aínda que estamos orgullosos deste logro, seguimos centrados na mellora continua. A avaliación de Search Arena ofrece información valiosa sobre as preferencias dos usuarios que guiará os nosos esforzos de desenvolvemento en curso.

Introdución a Sonar
Únete ao cofundador e CTO de Perplexity, Denis Yarats, para ver unha visión xeral da nosa API o 24 de abril ás 11:00 PT. Denis ofrecerá unha visión xeral das APIs de Perplexity, compartirá resultados de avaliacións comparativas e casos de uso da API.
Rexistrarse aquí.