Perplexity Sonar dominerar nya Search Arena-utvärderingen
Perplexity Sonar-modellerna tar topplaceringar i sökutvärdering

Sammanfattning
- Delad 1:a plats: Sonar-Reasoning-Pro-High uppnådde en arenapoäng på 1136 (±21/−19), vilket är statistiskt oavgjort för förstaplatsen med Googles Gemini-2.5-Pro-Grounding (1142 +14/-17). I direkta dueller vann Sonar-Reasoning-Pro-High över Gemini-2.5-Pro-Grounding 53 % av gångerna.
- Sonar-dominans: Perplexity-modellerna knep plats 1 till 4, vilket är en betydligt bättre prestation än de övriga utvärderade modellerna från Google och OpenAI.
- Resonemangsfördel: Modeller som innehåller resonemangsfunktioner (sonar-reasoning-pro och sonar-reasoning) rankades högre, vilket ligger i linje med den generella användarpreferens som observerats för resonemangsmodeller (topp 3 på rankinglistan).
- Sökdjup: Sonar-modellerna utför djupare sökningar och beaktar fler källor, och hänvisar i genomsnitt till 2–3 gånger fler källor än jämförbara Gemini-modeller.
______
LM Arena har precis släppt sin nya Search Arena-rankinglista som jämför sökutökade LLM-system baserat på mänskliga preferenser. Perplexity-modellen Sonar-Reasoning-Pro har placerat sig på delad förstaplats med Gemini-2.5-Pro-Grounding, medan resten av Sonar-modellerna presterar bättre än Gemini-2.0-Flash-Grounding och alla OpenAIs webbsökningsmodeller.

Utvärdering i Search Arena
Till skillnad från SimpleQA, som fokuserar på snäv faktabaserad noggrannhet, utvärderar LM Arena hur modeller presterar på verkliga användarfrågor inom programmering, skrivande, forskning och rekommendationer. Med Search Arena fokuserar utvärderingen på aktuella händelser och inkluderar längre, mer komplexa prompter, vilket samlar in över 10 000 mänskliga preferensröster över 11 modeller. Mellan den 18 mars och 13 april 2025 ombads användare i Search Arena att skriva prompter och välja vilken modells svar som bäst tillgodosåg deras informationsbehov.
Prestandaresultat för Sonar-modeller
Perplexity-modellerna i Sonar-serien presterade bättre än många av de ledande toppmodellerna, inklusive Gemini 2.0 Flash och GPT 4o Search. Vår modell Sonar-Reasoning-Pro uppnådde en poäng på 1136, vilket är statistiskt oavgjort i toppen med Gemini-2.5-Pro-Grounding (1142).

Search Arenas utvärdering avslöjade tre faktorer som starkt korrelerar med mänskliga preferenser:
- Längre svar (koefficient 0,255, p<0,05)
- Högre antal källhänvisningar (koefficient 0,234, p<0,05)
- Källhänvisningar från community-webbkällor
Rankinglistan visade en tydlig användarpreferens för resonemangsförbätfrade modeller, där Sonar-Reasoning-Pro och Sonar-Reasoning tog två av de tre främsta platserna. Kontrollexperiment förstärkte dessa fynd och visade att kontroll för källhänvisningar gjorde att modellrankningarna konvergerade, vilket tyder på att sökdjup är en betydande prestandadifferentierare.

Vad detta innebär för användare
För Perplexity-användare bekräftar dessa resultat att Sonar-modellerna erbjuder klassens bästa noggrannhet, omfattande källhänvisningar och högkvalitativa svar inom ett brett spektrum av ämnen.
Perplexity Pro-användare kan fortsätta att dra nytta av dessa toppresterande modeller genom att ställa in Sonar som sin standardmodell i inställningarna. API-användare kan få tillgång till dessa funktioner genom våra Sonar API-erbjudanden med flexibla söklägen för att balansera prestanda och kostnadseffektivitet
Även om vi är stolta över denna prestation är vi fortsatt fokuserade på kontinuerlig förbättring. Utvärderingen i Search Arena ger värdefulla insikter om användarnas preferenser som kommer att vägleda våra pågående utvecklingsinsatser.

Introduktion till Sonar
Följ med Perplexity medgrundare och CTO, Denis Yarats, för en genomgång av vårt API den 24 april kl. 11.00 PT. Denis kommer att ge en översikt över Perplexity-API:erna, dela med sig av benchmarkresultat och berätta om API-användningsfall.
Registrera dig här.