Articolo
Perplexity Sonar domina la valutazione della nuova arena di ricerca

TL;DR
Classifica #1: Sonar-Reasoning-Pro-High ha raggiunto un Arena Score di 1136 (±21/−19), statisticamente pari al primo posto con il Gemini-2.5-Pro-Grounding di Google (1142 +14/-17). Nei confronti diretti, Sonar-Reasoning-Pro-High ha battuto Gemini-2.5-Pro-Grounding nel 53% dei casi.
Dominio di Sonar: i modelli di Perplexity hanno ottenuto i ranghi dal 1 al 4, superando significativamente gli altri modelli valutati di Google e OpenAI.
Vantaggio nel Ragionamento: i modelli che incorporano capacità di ragionamento (sonar-reasoning-pro e sonar-reasoning) si sono classificati più in alto, in linea con la preferenza generale degli utenti osservata per i modelli di ragionamento (i primi 3 nella classifica).
Profondità della Ricerca: i modelli Sonar effettuano una ricerca più profonda e considerano più fonti, in media citando 2-3 volte più fonti rispetto ai modelli Gemini comparabili.
LM Arena ha appena rilasciato la sua nuova classifica Search Arena confrontando i sistemi LLM arricchiti con la ricerca basati sulla preferenza umana. Il modello Sonar-Reasoning-Pro di Perplexity si è piazzato al primo posto insieme a Gemini-2.5-Pro-Grounding, con gli altri modelli Sonar che hanno superato Gemini-2.0-Flash-Grounding e tutti i modelli di ricerca web di OpenAI.

Benchmarking Search Arena
Al contrario dell'attenzione di SimpleQA sulla stretta accuratezza fattuale, LM Arena valuta come i modelli si comportano su query reali degli utenti in codifica, scrittura, ricerca e raccomandazioni. Con Search Arena, la valutazione si concentra sugli eventi attuali e include prompt più lunghi e complessi, raccogliendo oltre 10.000 voti di preferenza umana su 11 modelli. Tra il 18 marzo e il 13 aprile 2025, Search Arena ha chiesto agli utenti di suggerire e selezionare quale risposta del modello soddisfacesse meglio le loro necessità informative.
Risultati delle Prestazioni del Modello Sonar
I modelli Sonar di Perplexity hanno superato molti dei modelli all'avanguardia, inclusi Gemini 2.0 Flash e GPT 4o Search. Il nostro modello Sonar-Reasoning-Pro ha ottenuto un punteggio di 1136, pari statisticamente con Gemini-2.5-Pro-Grounding (1142) al vertice.
Nei confronti diretti, Sonar-Reasoning-Pro-High ha battuto Gemini-2.5-Pro-Grounding nel 53% dei casi.

La valutazione di Search Arena ha rivelato tre fattori fortemente correlati con la preferenza umana:
Risposte più lunghe (coeff 0.255, p<0.05)
Numero di citazioni più alto (coeff 0.234, p<0.05)
Citazioni da fonti web comunitarie
La classifica ha mostrato una chiara preferenza degli utenti per i modelli arricchiti nel ragionamento, con Sonar-Reasoning-Pro e Sonar-Reasoning che occupano due delle prime tre posizioni. Esperimenti di controllo hanno rafforzato questi risultati, mostrando che controllando le citazioni le classifiche dei modelli tendevano a convergere, suggerendo che la profondità della ricerca è un importante differenziatore di prestazioni.

I modelli Sonar di Perplexity avevano una profondità di ricerca sostanzialmente maggiore, con ppl-sonar-pro-high che citava 2-3 volte più fonti rispetto ai modelli Gemini equivalenti.
Cosa Significa per gli Utenti
Per gli utenti di Perplexity, questi risultati confermano che i modelli Sonar offrono precisione di classe migliore, un'attribuzione completa delle fonti e risposte di alta qualità su una vasta gamma di argomenti.
Gli utenti di Perplexity Pro possono continuare a beneficiare di questi modelli ad alte prestazioni impostando Sonar come modello predefinito nelle impostazioni. Gli utenti dell'API possono accedere a queste capacità attraverso le nostre offerte API Sonar con modalità di ricerca flessibili per bilanciare efficienza delle prestazioni e dei costi.
Anche se siamo orgogliosi di questo risultato, rimaniamo concentrati sul miglioramento continuo. La valutazione di Search Arena fornisce preziose informazioni sulle preferenze degli utenti che guideranno i nostri sforzi di sviluppo continui.

Introduzione a Sonar
Unisciti al co-fondatore e CTO di Perplexity, Denis Yarats, per una panoramica della nostra API il 24 aprile alle 11:00 PT. Denis fornirà una panoramica delle API di Perplexity, condividerà risultati di benchmarking e usi dell'API.
Registrati qui.