Perplexity Sonar mendominasi evaluasi Search Arena baru
Model Perplexity Sonar klaim posisi teratas dalam evaluasi pencarian

Intinya
- Peringkat Co #1: Sonar-Reasoning-Pro-High meraih Skor Arena 1136 (±21/−19), berbagi tempat pertama secara statistik dengan Gemini-2.5-Pro-Grounding milik Google (1142 +14/-17). Dalam pertarungan langsung, Sonar-Reasoning-Pro-High mengungguli Gemini-2.5-Pro-Grounding sebesar 53% dari waktu.
- Dominasi Sonar: Model Perplexity mengamankan peringkat 1 hingga 4, jauh mengungguli model lain yang dievaluasi dari Google dan OpenAI.
- Keunggulan Daya Nalar: Model yang menyertakan kemampuan penalaran (sonar-reasoning-pro dan sonar-reasoning) mendapat peringkat lebih tinggi, sejalan dengan preferensi umum pengguna yang diamati untuk model bernalar (3 teratas di papan peringkat).
- Kedalaman Pencarian: Model Sonar melakukan pencarian yang lebih mendalam dan mempertimbangkan lebih banyak sumber, dengan rata-rata menyitir 2-3x lebih banyak sumber dibandingkan model Gemini yang sebanding.
______
LM Arena baru saja merilis papan peringkat Search Arena baru yang membandingkan sistem LLM dengan perluasan pencarian berdasarkan preferensi pengguna. Model Sonar-Reasoning-Pro dari Perplexity menempati peringkat pertama bersama Gemini-2.5-Pro-Grounding, sementara model Sonar lainnya mengungguli Gemini-2.0-Flash-Grounding dan seluruh model pencarian web OpenAI.

Pengujian Search Arena
Tidak seperti SimpleQA yang berfokus pada akurasi faktual sempit, LM Arena mengevaluasi kinerja model pada kueri pengguna nyata di bidang pemrograman, penulisan, riset, dan rekomendasi. Melalui Search Arena, evaluasi berfokus pada peristiwa terkini dan mencakup perintah yang lebih panjang serta kompleks, mengumpulkan lebih dari 10.000 suara preferensi pengguna di 11 model. Antara 18 Maret dan 13 April 2025, Search Arena meminta pengguna untuk memberikan perintah dan memilih respons model mana yang paling memenuhi kebutuhan informasi mereka.
Hasil Kinerja Model Sonar
Model Sonar Perplexity mengungguli banyak model mutakhir teratas termasuk Gemini 2.0 Flash dan GPT 4o Search. Model Sonar-Reasoning-Pro kami meraih skor 1136, yang secara statistik setara dengan Gemini-2.5-Pro-Grounding (1142) di posisi teratas.

Evaluasi Search Arena mengungkap tiga faktor yang memiliki korelasi kuat dengan preferensi pengguna:
- Respons yang lebih panjang (koefisien 0.255, p<0.05)
- Jumlah sitasi yang lebih tinggi (koefisien 0.234, p<0.05)
- Sitasi dari sumber web komunitas
Papan peringkat menunjukkan preferensi pengguna yang jelas terhadap model yang ditingkatkan daya nalarnya, dengan Sonar-Reasoning-Pro dan Sonar-Reasoning menempati dua dari tiga posisi teratas. Eksperimen kontrol memperkuat temuan ini, menunjukkan bahwa pengontrolan terhadap sitasi menyebabkan peringkat model konvergen, yang mengindikasikan bahwa kedalaman pencarian adalah pembeda kinerja yang signifikan.

Artinya bagi Pengguna
Bagi pengguna Perplexity, hasil ini menegaskan bahwa model Sonar menghadirkan akurasi terbaik di kelasnya, atribusi sumber yang komprehensif, dan respons berkualitas tinggi di berbagai topik.
Pengguna Perplexity Pro dapat terus menikmati manfaat dari model-model berkinerja tinggi ini dengan mengatur Sonar sebagai model default mereka di pengaturan. Pengguna API dapat mengakses kemampuan ini melalui penawaran API Sonar kami dengan mode pencarian fleksibel untuk menyeimbangkan kinerja dan efisiensi biaya
Meskipun kami bangga dengan pencapaian ini, kami tetap fokus pada perbaikan berkelanjutan. Evaluasi Search Arena memberikan wawasan berharga tentang preferensi pengguna yang akan memandu upaya pengembangan kami kedepan.

Pengenalan Sonar
Bergabunglah dengan salah satu pendiri & CTO Perplexity, Denis Yarats, untuk tinjauan umum mengenai API kami pada tanggal 24 April pukul 11 pagi PT. Denis akan memberikan gambaran umum tentang API Perplexity, membagikan hasil benchmark, serta kasus penggunaan API.
Daftar di sini.