Perplexity Sonar domine la nouvelle évaluation de Search Arena
Les modèles Sonar de Perplexity s'emparent des sommets de l'évaluation

En bref
- 1er rang : Sonar-Reasoning-Pro-High a obtenu un score de 1136 dans l'arène (±21/−19), ce qui le place à égalité statistique pour la première place avec le modèle Gemini-2.5-Pro-Grounding de Google (1142 +14/-17). Dans les duels directs, Sonar-Reasoning-Pro-High l'a emporté sur Gemini-2.5-Pro-Grounding dans 53 % des cas.
- Domination de Sonar : Les modèles de Perplexity ont obtenu les rangs 1 à 4, surpassant largement les autres modèles évalués de Google et d'OpenAI.
- Avantage du raisonnement : Les modèles intégrant des capacités de raisonnement (sonar-reasoning-pro et sonar-reasoning) ont obtenu un rang supérieur, ce qui correspond à la préférence générale des utilisateurs observée pour les modèles de raisonnement (top 3 du classement).
- Profondeur de recherche : Les modèles Sonar effectuent des recherches plus approfondies et prennent en compte un plus grand nombre de sources, citant en moyenne 2 à 3 fois plus de sources que les modèles Gemini comparables.
______
LM Arena vient de publier son nouveau classement Search Arena qui compare les systèmes de LLM augmentés par la recherche en fonction des préférences humaines. Le modèle Sonar-Reasoning-Pro de Perplexity est arrivé à égalité à la première place avec Gemini-2.5-Pro-Grounding, tandis que les autres modèles Sonar ont surpassé Gemini-2.0-Flash-Grounding ainsi que tous les modèles de recherche Web d'OpenAI.

Évaluation comparative Search Arena
Contrairement à SimpleQA qui se concentre sur l'exactitude factuelle étroite, LM Arena évalue les performances des modèles sur des requêtes d'utilisateurs réels en matière de programmation, de rédaction, de recherche et de recommandations. Avec Search Arena, l'évaluation met l'accent sur les actualités et comprend des invites plus longues et plus complexes, recueillant plus de 10 000 votes de préférences humaines sur 11 modèles. Entre le 18 mars et le 13 avril 2025, Search Arena a demandé aux utilisateurs d'entrer des invites et de sélectionner la réponse du modèle qui satisfaisait le mieux leurs besoins d'information.
Résultats de performance des modèles Sonar
Les modèles Sonar de Perplexity ont surpassé bon nombre des meilleurs modèles de pointe, y compris Gemini 2.0 Flash et GPT 4o Search. Notre modèle Sonar-Reasoning-Pro a atteint un score de 1136, à égalité statistique avec Gemini-2.5-Pro-Grounding (1142) au sommet du classement.

L'évaluation de Search Arena a révélé trois facteurs fortement corrélés aux préférences des utilisateurs :
- Réponses plus longues (coeff. 0,255, p<0,05)
- Nombre de citations plus élevé (coeff. 0,234, p<0,05)
- Citations provenant de sources Web de la communauté
Le classement a montré une nette préférence des utilisateurs pour les modèles dotés de capacités de raisonnement améliorées, Sonar-Reasoning-Pro et Sonar-Reasoning occupant deux des trois premières places. Des expériences de contrôle ont renforcé ces observations, démontrant que le contrôle des citations entraînait la convergence des classements des modèles, ce qui suggère que la profondeur de la recherche est un facteur de différenciation important des performances.

Ce que cela signifie pour les utilisateurs
Pour les utilisateurs de Perplexity, ces résultats confirment que les modèles Sonar offrent une exactitude de premier ordre, une attribution complète des sources et des réponses de haute qualité sur un large éventail de sujets.
Les utilisateurs de Perplexity Pro peuvent continuer à profiter de ces modèles hautement performants en définissant Sonar comme leur modèle par défaut dans les paramètres. Les utilisateurs de l'API peuvent accéder à ces fonctionnalités par l'entremise de nos offres d'API Sonar dotées de modes de recherche flexibles pour équilibrer performance et rentabilité.
Bien que nous soyons fiers de cette réussite, nous demeurons concentrés sur l'amélioration continue. L'évaluation de Search Arena fournit des renseignements précieux sur les préférences des utilisateurs qui guideront nos efforts de développement en cours.

Introduction à Sonar
Joignez-vous à Denis Yarats, cofondateur et directeur de la technologie (CTO) de Perplexity, pour un aperçu de notre API le 24 avril à 11 h (HP). Denis présentera un aperçu des API de Perplexity, partagera les résultats des analyses comparatives et abordera les cas d'utilisation de l'API.
Inscrivez-vous ici.