Perplexity Sonar domina la nueva evaluación de Search Arena
Los modelos Sonar de Perplexity ocupan los primeros puestos en la evaluación de búsqueda.

Resumen
- Clasificación n.º 1: Sonar-Reasoning-Pro-High obtuvo una puntuación Arena de 1136 (±21/−19), empatando estadísticamente en el primer lugar con Gemini-2.5-Pro-Grounding de Google (1142 +14/-17). En enfrentamientos directos, Sonar-Reasoning-Pro-High superó a Gemini-2.5-Pro-Grounding el 53 % de las veces.
- Dominio de Sonar: Los modelos de Perplexity ocuparon los puestos del 1 al 4, superando significativamente a otros modelos evaluados de Google y OpenAI.
- Ventaja del razonamiento: Los modelos que incorporan capacidades de razonamiento (sonar-reasoning-pro y sonar-reasoning) obtuvieron una clasificación superior, lo que concuerda con la preferencia general de los usuarios observada por los modelos de razonamiento (los 3 primeros en la tabla de clasificación).
- Profundidad de búsqueda: Los modelos Sonar realizan una búsqueda más profunda y consideran más fuentes, citando de media entre 2 y 3 veces más fuentes que modelos Gemini comparables.
______
LM Arena acaba de publicar su nueva tabla de clasificación de Search Arena, que compara sistemas de LLM con búsqueda aumentada basándose en la preferencia humana. El modelo Sonar-Reasoning-Pro de Perplexity ha empatado en el primer lugar con Gemini-2.5-Pro-Grounding, mientras que el resto de los modelos Sonar superaron a Gemini-2.0-Flash-Grounding y a todos los modelos de búsqueda web de OpenAI.

Evaluación comparativa de Search Arena
A diferencia del enfoque de SimpleQA en la precisión fáctica limitada, LM Arena evalúa el rendimiento de los modelos ante consultas reales de los usuarios en áreas como programación, redacción, investigación y recomendaciones. Con Search Arena, la evaluación se centra en eventos actuales e incluye prompts más largos y complejos, recopilando más de 10 000 votos de preferencia humana entre 11 modelos. Entre el 18 de marzo y el 13 de abril de 2025, Search Arena solicitó a los usuarios que enviaran prompts y seleccionaran qué respuesta del modelo satisfacía mejor sus necesidades de información.
Resultados de rendimiento del modelo Sonar
Los modelos Sonar de Perplexity superaron a muchos de los principales modelos de vanguardia, incluidos Gemini 2.0 Flash y GPT 4o Search. Nuestro modelo Sonar-Reasoning-Pro obtuvo una puntuación de 1136, empatando estadísticamente con Gemini-2.5-Pro-Grounding (1142) en la primera posición.

La evaluación de Search Arena reveló tres factores con una fuerte correlación con la preferencia humana:
- Respuestas más largas (coef. 0,255, p<0,05)
- Mayor número de citas (coef. 0,234, p<0,05)
- Citas de fuentes web comunitarias
La tabla de clasificación mostró una clara preferencia de los usuarios por los modelos con razonamiento mejorado, ocupando Sonar-Reasoning-Pro y Sonar-Reasoning dos de las tres primeras posiciones. Los experimentos de control reforzaron estos hallazgos, demostrando que al controlar las citas, las clasificaciones de los modelos convergían, lo que sugiere que la profundidad de la búsqueda es un factor determinante significativo del rendimiento.

Qué significa esto para los usuarios
Para los usuarios de Perplexity, estos resultados confirman que los modelos Sonar ofrecen la mejor precisión de su clase, una atribución completa de las fuentes y respuestas de alta calidad en una amplia gama de temas.
Los usuarios de Perplexity Pro pueden seguir aprovechando estos modelos de alto rendimiento configurando Sonar como su modelo predeterminado en configuración. Los usuarios de la API pueden acceder a estas capacidades a través de nuestras ofertas de la API de Sonar con modos de búsqueda flexibles para equilibrar el rendimiento y la eficiencia de costes.
Aunque estamos orgullosos de este logro, seguimos centrados en la mejora continua. La evaluación de Search Arena proporciona información valiosa sobre las preferencias de los usuarios que guiará nuestros esfuerzos de desarrollo en curso.

Introducción a Sonar
Acompañe al cofundador y CTO de Perplexity, Denis Yarats, en una presentación general de nuestra API el 24 de abril a las 11:00 h PT. Denis ofrecerá una visión general de las API de Perplexity, compartirá los resultados de la evaluación comparativa y los casos de uso de la API.
Regístrese aquí.