Perplexity Sonar domina la nuova valutazione Search Arena

I modelli Perplexity Sonar conquistano i vertici nelle valutazioni di ricerca

In sintesi

  • Classifica n. 1: Sonar-Reasoning-Pro-High ha ottenuto un punteggio Arena di 1136 (±21/−19), classificandosi statisticamente al primo posto a pari merito con Gemini-2.5-Pro-Grounding di Google (1142 +14/-17). Negli scontri diretti, Sonar-Reasoning-Pro-High ha superato Gemini-2.5-Pro-Grounding nel 53% dei casi.
  • Dominio di Sonar: I modelli Perplexity si sono assicurati le posizioni dalla 1 alla 4, superando significativamente altri modelli valutati di Google e OpenAI.
  • Vantaggio del ragionamento: I modelli che incorporano capacità di ragionamento (sonar-reasoning-pro e sonar-reasoning) si sono classificati più in alto, allineandosi con la preferenza generale degli utenti osservata per i modelli di ragionamento (tra i primi 3 in classifica).
  • Profondità di ricerca: I modelli Sonar eseguono una ricerca più approfondita e considerano più fonti, citando in media 2-3 volte più fonti rispetto ai modelli Gemini comparabili.

______

LM Arena ha appena rilasciato la sua nuova classifica Search Arena, che confronta i sistemi LLM con ricerca aumentata in base alle preferenze degli utenti. Il modello Sonar-Reasoning-Pro di Perplexity ha raggiunto il primo posto a pari merito con Gemini-2.5-Pro-Grounding, mentre gli altri modelli Sonar hanno superato Gemini-2.0-Flash-Grounding e tutti i modelli di ricerca web di OpenAI.

Benchmarking di Search Arena

A differenza di SimpleQA, che si concentra su una ristretta accuratezza fattuale, LM Arena valuta le prestazioni dei modelli su query utente reali che spaziano tra programmazione, scrittura, ricerca e consigli. Con Search Arena, la valutazione si concentra su eventi attuali e include prompt più lunghi e complessi, raccogliendo oltre 10.000 voti di preferenza da parte degli utenti su 11 modelli. Tra il 18 marzo e il 13 aprile 2025, Search Arena ha chiesto agli utenti di fornire prompt e selezionare quale risposta del modello soddisfacesse meglio le loro esigenze informative.

Risultati delle prestazioni del modello Sonar

I modelli Sonar di Perplexity hanno superato molti dei migliori modelli allo stato dell'arte, inclusi Gemini 2.0 Flash e GPT 4o Search. Il nostro modello Sonar-Reasoning-Pro ha ottenuto un punteggio di 1136, statisticamente a pari merito con Gemini-2.5-Pro-Grounding (1142) al primo posto.

Negli scontri diretti, Sonar-Reasoning-Pro-High ha superato Gemini-2.5-Pro-Grounding nel 53% dei casi.

La valutazione di Search Arena ha rivelato tre fattori che correlano fortemente con le preferenze degli utenti:

  • Risposte più lunghe (coeff 0.255, p<0.05)
  • Conteggio citazioni più elevato (coeff 0.234, p<0.05)
  • Citazioni da fonti web della comunità

La classifica ha mostrato una chiara preferenza degli utenti per i modelli potenziati dal ragionamento, con Sonar-Reasoning-Pro e Sonar-Reasoning che occupano due delle prime tre posizioni. Gli esperimenti di controllo hanno confermato questi risultati, mostrando che il controllo delle citazioni ha causato la convergenza delle classifiche dei modelli, suggerendo che la profondità di ricerca sia un differenziatore significativo delle prestazioni.

I modelli Sonar di Perplexity hanno una profondità di ricerca sostanzialmente maggiore, con ppl-sonar-pro-high che cita 2-3 volte più fonti rispetto ai modelli Gemini equivalenti.

Cosa significa per gli utenti

Per gli utenti di Perplexity, questi risultati confermano che i modelli Sonar forniscono un'accuratezza ai vertici della categoria, un'attribuzione completa delle fonti e risposte di alta qualità su una vasta gamma di argomenti.

Gli utenti di Perplexity Pro possono continuare a beneficiare di questi modelli ad alte prestazioni impostando Sonar come modello predefinito nelle impostazioni. Gli utenti API possono accedere a queste funzionalità tramite le nostre offerte Sonar API con modalità di ricerca flessibili per bilanciare prestazioni ed efficienza dei costi.

Sebbene siamo orgogliosi di questo risultato, restiamo concentrati sul miglioramento continuo. La valutazione di Search Arena fornisce preziose informazioni sulle preferenze degli utenti che guideranno i nostri continui sforzi di sviluppo.

Introduzione a Sonar

Unisciti al co-fondatore e CTO di Perplexity, Denis Yarats, per una panoramica delle nostre API il 24 aprile alle 11:00 PT. Denis fornirà una panoramica delle API di Perplexity, condividerà i risultati dei benchmark e i casi d'uso delle API.

Registrati qui.

Inizia con Sonar.