Článek
Perplexity Sonar ovládá hodnocení v nové aréně vyhledávání

Krátká verze
Co #1 Umístění: Sonar-Reasoning-Pro-High dosáhl skóre Arena 1136 (±21/−19), statisticky se umístil na prvním místě spolu s Gemini-2.5-Pro-Grounding od Googlu (1142 +14/-17). Ve vzájemných soubojích porazil Sonar-Reasoning-Pro-High Gemini-2.5-Pro-Grounding ve 53 % případů.
Dominance Sonar: Modely Perplexity obsadily první až čtvrté místo, výrazně překonaly ostatní hodnocené modely Google a OpenAI.
Výhoda v logice: Modely zahrnující logické schopnosti (sonar-reasoning-pro a sonar-reasoning) se umístily výše, což odpovídá obecnému uživatelskému preferenčnímu trendu pro modely s logikou (horní 3 na žebříčku).
Hloubka vyhledávání: Modely Sonar provádějí hlubší vyhledávání a berou v úvahu více zdrojů, průměrně citují 2-3x více zdrojů než srovnatelné modely Gemini.
LM Arena právě zveřejnila nový žebříček Search Arena porovnávající systémy LLM rozšířené o vyhledávání na základě lidských preferencí. Model Sonar-Reasoning-Pro společnosti Perplexity se umístil na prvním místě spolu s Gemini-2.5-Pro-Grounding, zatímco všechny ostatní modely Sonar překonaly Gemini-2.0-Flash-Grounding a všechny webové vyhledávací modely OpenAI.

Benchmarking Search Arena
Na rozdíl od zaměření SimpleQA na úzkou faktickou přesnost LM Arena hodnotí, jak modely reagují na skutečné dotazy uživatelů napříč kódováním, psaním, výzkumem a doporučeními. S Search Arena se hodnocení soustředí na aktuální události a zahrnuje delší, složitější prompty, které shromáždily více než 10 000 hlasů lidských preferencí napříč 11 modely. Mezi 18. březnem a 13. dubnem 2025 Search Arena požádala uživatele, aby navrhli a vybrali, která reakce modelu lépe uspokojila jejich informační potřeby.
Výsledky výkonu modelů Sonar
Sonarové modely Perplexity překonaly mnoho z nejlepších state-of-the-art modelů včetně Gemini 2.0 Flash a GPT 4o Search. Náš model Sonar-Reasoning-Pro dosáhl skóre 1136, statisticky se umístil na stejné úrovni s Gemini-2.5-Pro-Grounding (1142) na nejvyšší pozici.
Ve vzájemných soubojích Sonar-Reasoning-Pro-High porazil Gemini-2.5-Pro-Grounding ve 53 % případů.

Hodnocení Search Arena odhalilo tři faktory silně korelující s preferencemi uživatelů:
Delší odpovědi (koeficient 0.255, p<0.05)
Vyšší počet citací (koeficient 0.234, p<0.05)
Citace ze zdrojů webové komunity
Žebříček ukázal jasnou uživatelskou preferenci pro modely obohacené o logiku, přičemž Sonar-Reasoning-Pro a Sonar-Reasoning obsadily dvě ze tří nejlepších míst. Kontrolní experimenty tyto výsledky potvrdily, ukazující, že kontrola citací způsobila sbližování hodnocení modelů, což naznačuje, že hloubka vyhledávání je významný diferenciátor výkonu.

Modely Sonar od Perplexity měly výrazně vyšší hloubku vyhledávání, přičemž ppl-sonar-pro-high citoval 2-3x více zdrojů než ekvivalentní modely Gemini.
Co to znamená pro uživatele
Pro uživatele Perplexity tyto výsledky potvrzují, že modely Sonar poskytují nejlepší ve své třídě přesnost, komplexní atributaci zdrojů a vysoce kvalitní odpovědi napříč širokou škálou témat.
Uživatelé Perplexity Pro mohou nadále těžit z těchto výkonných modelů nastavením Sonar jako jejich výchozího modelu v nastaveních. Uživatelé API mohou využívat tyto schopnosti prostřednictvím nabídek Sonar API s flexibilními režimy vyhledávání pro vyvážení výkonu a nákladové efektivity.
I když jsme na tento úspěch hrdí, zůstáváme soustředěni na neustálé zlepšování. Hodnocení Search Arena poskytuje cenné informace o preferencích uživatelů, které budou informovat naše pokračující úsilí o vývoj.

Úvod do Sonar
Join Perplexity spoluzakladatel & CTO Denis Yarats pro přehled naší API 24. dubna v 11 hod PT. Denis poskytne přehled o API Perplexity, podělí se o výsledky benchmarku a případy použití API.
Zaregistrujte se zde.