Article
Perplexity Sonar domine l'évaluation de la nouvelle arène de recherche

Résume (TL;DR)
Co #1 Classement : Sonar-Reasoning-Pro-High a atteint un score Arena de 1136 (±21/−19), statistiquement à égalité pour la première place avec le Gemini-2.5-Pro-Grounding de Google (1142 +14/-17). Dans des matchs en face à face, Sonar-Reasoning-Pro-High a battu Gemini-2.5-Pro-Grounding 53% du temps.
Dominance de Sonar : Les modèles Perplexity ont obtenu les rangs 1 à 4, surpassant significativement les autres modèles évalués de Google et OpenAI.
Avantage de Raisonnement : Les modèles intégrant des capacités de raisonnement (sonar-reasoning-pro et sonar-reasoning) se classent plus haut, en accord avec la préférence générale des utilisateurs observée pour les modèles de raisonnement (top 3 du classement).
Profondeur de Recherche : Les modèles Sonar effectuent une recherche plus approfondie et considèrent plus de sources, citant en moyenne 2 à 3 fois plus de sources que les modèles Gemini comparables.
LM Arena vient de publier leur nouveau classement Search Arena comparant les systèmes LLM augmentés par la recherche en fonction de la préférence humaine. Le modèle Sonar-Reasoning-Pro de Perplexity est à égalité pour la première place avec Gemini-2.5-Pro-Grounding, alors que le reste des modèles Sonar surpasse Gemini-2.0-Flash-Grounding et tous les modèles de recherche web d'OpenAI.

Étalonnage Search Arena
Contrairement à l'accent de SimpleQA sur une précision factuelle étroite, LM Arena évalue la performance des modèles sur des requêtes d'utilisateurs réels couvrant le codage, l'écriture, la recherche et les recommandations. Avec Search Arena, l'évaluation se concentre sur les événements actuels et inclut des invites plus longues et complexes, recueillant plus de 10 000 votes de préférence humaine à travers 11 modèles. Entre le 18 mars et le 13 avril 2025, Search Arena a demandé aux utilisateurs de proposer et de sélectionner quelle réponse de modèle satisfaisait mieux leurs besoins d'information.
Résultats de performance des modèles Sonar
Les modèles Sonar de Perplexity ont surpassé de nombreux modèles de pointe, y compris Gemini 2.0 Flash et GPT 4o Search. Notre modèle Sonar-Reasoning-Pro a obtenu un score de 1136, à égalité statistique avec Gemini-2.5-Pro-Grounding (1142) en tête du classement.
Dans les matchs en face à face, Sonar-Reasoning-Pro-High a battu Gemini-2.5-Pro-Grounding 53% du temps.

L'évaluation de Search Arena a révélé trois facteurs corrélant fortement avec la préférence humaine :
Réponses plus longues (coeff 0,255, p<0,05)
Comptes de citation plus élevés (coeff 0,234, p<0,05)
Citations provenant de sources Web communautaires
Le classement a montré une nette préférence des utilisateurs pour les modèles améliorés par le raisonnement, avec Sonar-Reasoning-Pro et Sonar-Reasoning occupant deux des trois premières positions. Des expériences de contrôle ont renforcé ces résultats, montrant que la maîtrise des citations a causé une convergence des classements des modèles, suggérant que la profondeur de recherche est un différenciateur de performance significatif.

Les modèles Sonar de Perplexity avaient une profondeur de recherche substantiellement plus élevée, avec ppl-sonar-pro-high citant 2 à 3 fois plus de sources que les modèles Gemini équivalents.
Ce que cela signifie pour les utilisateurs
Pour les utilisateurs de Perplexity, ces résultats confirment que les modèles Sonar offrent une précision de premier ordre, une attribution de sources complète et des réponses de haute qualité sur un large éventail de sujets.
Les utilisateurs Pro de Perplexity peuvent continuer à bénéficier de ces modèles performants en définissant Sonar comme leur modèle par défaut dans les paramètres. Les utilisateurs de l'API peuvent accéder à ces capacités via nos offres API Sonar avec des modes de recherche flexibles pour équilibrer performance et efficacité des coûts.
Bien que nous soyons fiers de cet accomplissement, nous restons concentrés sur l'amélioration continue. L'évaluation de Search Arena fournit des informations précieuses sur les préférences des utilisateurs qui informeront nos efforts de développement continus.

Introduction à Sonar
Rejoignez Denis Yarats, cofondateur et CTO de Perplexity, pour une vue d'ensemble de notre API le 24 avril à 11h PT. Denis fournira un aperçu des API de Perplexity, partagera les résultats de référence et les cas d'utilisation de l'API.
Inscrivez-vous ici.