Artículo
Perplexity Sonar domina la nueva evaluación del campo de búsqueda

En Resumen
Posición #1: Sonar-Reasoning-Pro-High logró un puntaje Arena de 1136 (±21/−19), empatado estadísticamente en el primer lugar con el modelo de Google's Gemini-2.5-Pro-Grounding (1142 +14/-17). En enfrentamientos directos, Sonar-Reasoning-Pro-High superó a Gemini-2.5-Pro-Grounding el 53% de las veces.
Dominio de Sonar: Los modelos de Perplexity aseguraron los puestos del 1 al 4, superando significativamente a otros modelos evaluados de Google y OpenAI.
Ventaja en Razón: Los modelos que incorporan capacidades de razonamiento (sonar-reasoning-pro y sonar-reasoning) obtuvieron clasificaciones más altas, alineándose con la preferencia general de los usuarios observada para los modelos de razonamiento (los 3 primeros en el ranking).
Profundidad de Búsqueda: Los modelos Sonar realizan búsquedas más profundas y consideran más fuentes, citando en promedio de 2 a 3 veces más fuentes que los modelos comparables de Gemini.
LM Arena acaba de lanzar su nuevo ranking de Search Arena comparando sistemas LLM con capacidad de búsqueda según la preferencia humana. El modelo Sonar-Reasoning-Pro de Perplexity ha empatado en el primer lugar con Gemini-2.5-Pro-Grounding, mientras que el resto de los modelos Sonar superan a Gemini-2.0-Flash-Grounding y todos los modelos de búsqueda web de OpenAI.

Benchmarking de Search Arena
A diferencia del enfoque de SimpleQA en la precisión factual estrecha, LM Arena evalúa cómo los modelos se desempeñan en consultas reales de usuarios en codificación, escritura, investigación y recomendaciones. Con Search Arena, la evaluación se centra en eventos actuales e incluye indicaciones más largas y complejas, recopilando más de 10,000 votos de preferencia humana entre 11 modelos. Entre el 18 de marzo y el 13 de abril de 2025, Search Arena solicitó a los usuarios que propusieran y seleccionaran qué respuesta de modelo satisfacía mejor sus necesidades de información.
Resultados de Desempeño de los Modelos Sonar
Los modelos Sonar de Perplexity superaron a muchos de los modelos más avanzados, incluidos Gemini 2.0 Flash y GPT 4o Search. Nuestro modelo Sonar-Reasoning-Pro logró un puntaje de 1136, empatado estadísticamente con Gemini-2.5-Pro-Grounding (1142) en la posición más alta.
En enfrentamientos directos, Sonar-Reasoning-Pro-High superó a Gemini-2.5-Pro-Grounding el 53% de las veces.

La evaluación de Search Arena reveló tres factores que se correlacionan fuertemente con la preferencia humana:
Respuestas más largas (coeficiente 0.255, p<0.05)
Mayor cantidad de citas (coeficiente 0.234, p<0.05)
Citas de fuentes comunitarias web
El ranking mostró claramente la preferencia de los usuarios por modelos mejorados en razonamiento, con Sonar-Reasoning-Pro y Sonar-Reasoning ocupando dos de las tres primeras posiciones. Los experimentos de control reforzaron estos hallazgos, mostrando que al controlar las citas se causó la convergencia de las clasificaciones de modelos, sugiriendo que la profundidad de búsqueda es un diferenciador significativo de desempeño.

Los modelos Sonar de Perplexity tenían una profundidad de búsqueda sustancialmente mayor, con ppl-sonar-pro-high citando de 2 a 3 veces más fuentes que los modelos equivalentes de Gemini.
Lo Que Esto Significa Para los Usuarios
Para los usuarios de Perplexity, estos resultados confirman que los modelos Sonar proporcionan precisión de primera clase, atribución de fuentes completa y respuestas de alta calidad en un amplio rango de temas.
Los usuarios de Perplexity Pro pueden seguir beneficiándose de estos modelos de alto rendimiento configurando Sonar como su modelo predeterminado en configuración. Los usuarios de API pueden acceder a estas capacidades a través de nuestras ofertas de API de Sonar con modos de búsqueda flexibles para equilibrar rendimiento y eficiencia de costos.
Si bien estamos orgullosos de este logro, seguimos enfocados en la mejora continua. La evaluación de Search Arena proporciona valiosos insights sobre las preferencias del usuario que informarán nuestros esfuerzos de desarrollo continuos.

Introducción a Sonar
Únase al cofundador y CTO de Perplexity, Denis Yarats, para una visión general de nuestra API el 24 de abril a las 11am PT. Denis proporcionará un resumen de las APIs de Perplexity, compartirá los resultados de los benchmarks y casos de uso de APIs.
Regístrese aquí.