Articolo

Perplexity Sonar domina la valutazione della nuova arena di ricerca

Luce che penetra attraverso un pavimento solido e geometrico

TL;DR

  • Classifica #1: Sonar-Reasoning-Pro-High ha raggiunto un Arena Score di 1136 (±21/−19), statisticamente pari al primo posto con il Gemini-2.5-Pro-Grounding di Google (1142 +14/-17). Nei confronti diretti, Sonar-Reasoning-Pro-High ha battuto Gemini-2.5-Pro-Grounding nel 53% dei casi.

  • Dominio di Sonar: i modelli di Perplexity hanno ottenuto i ranghi dal 1 al 4, superando significativamente gli altri modelli valutati di Google e OpenAI.

  • Vantaggio nel Ragionamento: i modelli che incorporano capacità di ragionamento (sonar-reasoning-pro e sonar-reasoning) si sono classificati più in alto, in linea con la preferenza generale degli utenti osservata per i modelli di ragionamento (i primi 3 nella classifica).

  • Profondità della Ricerca: i modelli Sonar effettuano una ricerca più profonda e considerano più fonti, in media citando 2-3 volte più fonti rispetto ai modelli Gemini comparabili.

LM Arena ha appena rilasciato la sua nuova classifica Search Arena confrontando i sistemi LLM arricchiti con la ricerca basati sulla preferenza umana. Il modello Sonar-Reasoning-Pro di Perplexity si è piazzato al primo posto insieme a Gemini-2.5-Pro-Grounding, con gli altri modelli Sonar che hanno superato Gemini-2.0-Flash-Grounding e tutti i modelli di ricerca web di OpenAI.

Benchmarking Search Arena

Al contrario dell'attenzione di SimpleQA sulla stretta accuratezza fattuale, LM Arena valuta come i modelli si comportano su query reali degli utenti in codifica, scrittura, ricerca e raccomandazioni. Con Search Arena, la valutazione si concentra sugli eventi attuali e include prompt più lunghi e complessi, raccogliendo oltre 10.000 voti di preferenza umana su 11 modelli. Tra il 18 marzo e il 13 aprile 2025, Search Arena ha chiesto agli utenti di suggerire e selezionare quale risposta del modello soddisfacesse meglio le loro necessità informative.

Risultati delle Prestazioni del Modello Sonar

I modelli Sonar di Perplexity hanno superato molti dei modelli all'avanguardia, inclusi Gemini 2.0 Flash e GPT 4o Search. Il nostro modello Sonar-Reasoning-Pro ha ottenuto un punteggio di 1136, pari statisticamente con Gemini-2.5-Pro-Grounding (1142) al vertice.

Nei confronti diretti, Sonar-Reasoning-Pro-High ha battuto Gemini-2.5-Pro-Grounding nel 53% dei casi.

La valutazione di Search Arena ha rivelato tre fattori fortemente correlati con la preferenza umana:

  • Risposte più lunghe (coeff 0.255, p<0.05)

  • Numero di citazioni più alto (coeff 0.234, p<0.05)

  • Citazioni da fonti web comunitarie

La classifica ha mostrato una chiara preferenza degli utenti per i modelli arricchiti nel ragionamento, con Sonar-Reasoning-Pro e Sonar-Reasoning che occupano due delle prime tre posizioni. Esperimenti di controllo hanno rafforzato questi risultati, mostrando che controllando le citazioni le classifiche dei modelli tendevano a convergere, suggerendo che la profondità della ricerca è un importante differenziatore di prestazioni.

I modelli Sonar di Perplexity avevano una profondità di ricerca sostanzialmente maggiore, con ppl-sonar-pro-high che citava 2-3 volte più fonti rispetto ai modelli Gemini equivalenti.

Cosa Significa per gli Utenti

Per gli utenti di Perplexity, questi risultati confermano che i modelli Sonar offrono precisione di classe migliore, un'attribuzione completa delle fonti e risposte di alta qualità su una vasta gamma di argomenti.

Gli utenti di Perplexity Pro possono continuare a beneficiare di questi modelli ad alte prestazioni impostando Sonar come modello predefinito nelle impostazioni. Gli utenti dell'API possono accedere a queste capacità attraverso le nostre offerte API Sonar con modalità di ricerca flessibili per bilanciare efficienza delle prestazioni e dei costi.

Anche se siamo orgogliosi di questo risultato, rimaniamo concentrati sul miglioramento continuo. La valutazione di Search Arena fornisce preziose informazioni sulle preferenze degli utenti che guideranno i nostri sforzi di sviluppo continui.

Introduzione a Sonar

Unisciti al co-fondatore e CTO di Perplexity, Denis Yarats, per una panoramica della nostra API il 24 aprile alle 11:00 PT. Denis fornirà una panoramica delle API di Perplexity, condividerà risultati di benchmarking e usi dell'API.

Registrati qui.

Inizia con Sonar.

Interessato a plasmare il futuro della nostra piattaforma API? Stiamo assumendo.

Unisciti alla nostra community di sviluppatori per rimanere aggiornato su nuove versioni, funzionalità e aggiornamenti.

Interessato a plasmare il futuro della nostra piattaforma API? Stiamo assumendo.

Unisciti alla nostra community di sviluppatori per rimanere aggiornato su nuove versioni, funzionalità e aggiornamenti.

Interessato a plasmare il futuro della nostra piattaforma API? Stiamo assumendo.

Unisciti alla nostra community di sviluppatori per rimanere aggiornato su nuove versioni, funzionalità e aggiornamenti.