Artikel

Perplexity Sonar Dominates Nieuwe Evaluatie van Zoekarena

Licht dat door een geometrische en solide vloer breekt

TL;DR

  • #1 Rang: Sonar-Redeneren-Pro-Hoog behaalde een Arena-score van 1136 (±21/−19), statistisch gelijk met Google's Gemini-2.5-Pro-Gronding (1142 +14/-17). In directe head-to-head gevechten versloeg Sonar-Redeneren-Pro-Hoog Gemini-2.5-Pro-Gronding 53% van de tijd.

  • Sonar Dominantie: Perplexity-modellen behaalden de posities 1 tot en met 4, waarmee ze aanzienlijk beter presteerden dan andere geëvalueerde modellen van Google en OpenAI.

  • Redeneervoordeel: Modellen met redeneringscapaciteiten (sonar-redeneren-pro en sonar-redeneren) scoorden hoger, wat overeenkomt met de algemene gebruikersvoorkeur die werd waargenomen voor redeneringsmodellen (top 3 op het leaderboard).

  • Zoekdiepte: Sonar-modellen voeren diepere zoekopdrachten uit en overwegen meer bronnen, gemiddeld verwijzend naar 2-3x meer bronnen dan vergelijkbare Gemini-modellen.

LM Arena heeft net hun nieuwe Search Arena leaderboard vrijgegeven waarin zoek-verrijkte LLM-systemen worden vergeleken op basis van menselijke voorkeur. Perplexity's Sonar-Redeneren-Pro model heeft een gedeelde eerste plaats met Gemini-2.5-Pro-Gronding, terwijl de rest van de Sonar-modellen beter presteert dan Gemini-2.0-Flash-Gronding en alle webzoekmodellen van OpenAI.

Benchmarking van Search Arena

In tegenstelling tot de focus van SimpleQA op nauwe feitelijke nauwkeurigheid, evalueert LM Arena hoe modellen presteren op echte gebruikersvragen over codering, schrijven, onderzoek en aanbevelingen. Met Search Arena ligt de focus van de evaluatie op actuele gebeurtenissen en omvat het langere, complexere prompts, waarbij meer dan 10.000 menselijke voorkeurstemmen worden verzameld over 11 modellen. Tussen 18 maart en 13 april 2025 vroeg Search Arena gebruikers om een prompt en selecteerden ze welk modelantwoord beter voldeed aan hun informatiebehoeften.

Sonar Modelprestaties Resultaten

De Sonar-modellen van Perplexity presteerden beter dan veel van de topmodellen, inclusief Gemini 2.0 Flash en GPT 4o Search. Ons Sonar-Redeneren-Pro model behaalde een score van 1136, statistisch gelijk met Gemini-2.5-Pro-Gronding (1142) op de toppositie.

In directe head-to-head gevechten versloeg Sonar-Redeneren-Pro-Hoog Gemini-2.5-Pro-Gronding 53% van de tijd.

De evaluatie van Search Arena onthulde drie factoren die sterk correleerden met menselijke voorkeur:

  • Langere antwoorden (coeff 0.255, p<0.05)

  • Hogere referentieaantallen (coeff 0.234, p<0.05)

  • Referenties uit gemeenschapswebbronnen

Het leaderboard toonde een duidelijke gebruikersvoorkeur voor met redenering-verrijkte modellen, waarbij Sonar-Redeneren-Pro en Sonar-Redeneren twee van de top drie posities innamen. Controle-experimenten versterkten deze bevindingen, waarbij werd aangetoond dat controle voor verwijzingen ervoor zorgde dat modelranglijsten convergeerden, wat suggereert dat zoekdiepte een significante prestatieonderscheider is.

De Sonar-modellen van Perplexity hadden een aanzienlijk hogere zoekdiepte, met ppl-sonar-pro-hoog die 2-3x meer bronnen citeerde dan equivalente Gemini-modellen.

Wat Dit Betekent voor Gebruikers

Voor gebruikers van Perplexity bevestigen deze resultaten dat Sonar-modellen de beste in zijn klasse nauwkeurigheid, uitgebreide bronvermelding en hoogwaardige reacties bieden over een breed scala aan onderwerpen.

Gebruikers van Perplexity Pro kunnen blijven profiteren van deze topmodellen door Sonar in te stellen als hun standaardmodel in instellingen. API-gebruikers hebben toegang tot deze mogelijkheden via onze Sonar API-aanbiedingen met flexibele zoekmodi om de prestaties en kostenefficiëntie in balans te brengen.

Hoewel we trots zijn op deze prestatie, blijven we ons richten op continue verbetering. De evaluatie van Search Arena biedt waardevolle inzichten in gebruikersvoorkeuren die onze doorlopende ontwikkelingsinspanningen zullen informeren.

Introductie tot Sonar

Sluit je aan bij Perplexity mede-oprichter & CTO, Denis Yarats, voor een overzicht van onze API op 24 april om 11:00 uur PT. Denis zal een overzicht geven van de APIs van Perplexity, benchmarkresultaten delen en API-gebruiksvoorbeelden.

Registreer je hier.

Begin met Sonar.

Geïnteresseerd in het vormgeven van de toekomst van ons API Platform? We zijn aan het werven.

Word lid van onze ontwikkelaarsgemeenschap om op de hoogte te blijven van nieuwe releases, functies en updates.

Geïnteresseerd in het vormgeven van de toekomst van ons API Platform? We zijn aan het werven.

Word lid van onze ontwikkelaarsgemeenschap om op de hoogte te blijven van nieuwe releases, functies en updates.

Geïnteresseerd in het vormgeven van de toekomst van ons API Platform? We zijn aan het werven.

Word lid van onze ontwikkelaarsgemeenschap om op de hoogte te blijven van nieuwe releases, functies en updates.