Artikel

Sonar Perplexity Menguasai Evaluasi Arena Pencarian Baru

Cahaya menerobos melalui lantai geometris dan padat

Ringkasan Singkat

  • Peringkat #1: Sonar-Reasoning-Pro-High mencapai Skor Arena sebesar 1136 (±21/−19), secara statistik berada di urutan pertama bersama Gemini-2.5-Pro-Grounding dari Google (1142 +14/-17). Dalam pertarungan head-to-head langsung, Sonar-Reasoning-Pro-High mengalahkan Gemini-2.5-Pro-Grounding 53% dari waktu.

  • Dominasi Sonar: Model Perplexity mengamankan peringkat 1 hingga 4, secara signifikan mengungguli model lain yang dievaluasi dari Google dan OpenAI.

  • Keunggulan Penalaran: Model yang menggabungkan kemampuan penalaran (sonar-reasoning-pro dan sonar-reasoning) mendapatkan peringkat lebih tinggi, sejalan dengan preferensi umum pengguna yang diamati untuk model penalaran (teratas 3 di papan peringkat).

  • Kedalaman Pencarian: Model Sonar melakukan pencarian yang lebih dalam dan mempertimbangkan lebih banyak sumber, rata-rata mengutip 2-3 kali lebih banyak sumber daripada model Gemini yang sebanding.

LM Arena baru saja merilis papan peringkat Search Arena yang baru yang membandingkan sistem LLM yang diperkuat pencarian berdasarkan preferensi manusia. Model Sonar-Reasoning-Pro dari Perplexity telah berbagi posisi pertama dengan Gemini-2.5-Pro-Grounding dengan sisa model Sonar mengungguli Gemini-2.0-Flash-Grounding dan semua model penelusuran web OpenAI.

Benchmarking Search Arena

Tidak seperti SimpleQA yang berfokus pada akurasi faktual yang sempit, LM Arena mengevaluasi bagaimana model berfungsi pada kueri pengguna nyata dalam kode, penulisan, penelitian, dan rekomendasi. Dengan Search Arena, evaluasi berfokus pada peristiwa terkini dan mencakup prompt yang lebih panjang dan lebih kompleks, mengumpulkan lebih dari 10.000 suara preferensi manusia di 11 model. Antara 18 Maret dan 13 April 2025, Search Arena meminta pengguna untuk memberi perintah dan memilih respons model mana yang lebih memenuhi kebutuhan informasi mereka.

Hasil Kinerja Model Sonar

Model Sonar dari Perplexity melebihi banyak model mutakhir termasuk Gemini 2.0 Flash dan GPT 4o Search. Model Sonar-Reasoning-Pro kami mencapai skor 1136, secara statistik diikat dengan Gemini-2.5-Pro-Grounding (1142) di posisi teratas.

Dalam pertarungan head-to-head langsung, Sonar-Reasoning-Pro-High mengalahkan Gemini-2.5-Pro-Grounding 53% dari waktu.

Evaluasi Search Arena mengungkapkan tiga faktor yang sangat berkorelasi dengan preferensi manusia:

  • Respon lebih panjang (koeff 0.255, p<0.05)

  • Jumlah kutipan lebih tinggi (koeff 0.234, p<0.05)

  • Kutipan dari sumber web komunitas

Papan peringkat menunjukkan preferensi pengguna yang jelas untuk model yang ditingkatkan dengan penalaran, dengan Sonar-Reasoning-Pro dan Sonar-Reasoning mengambil dua dari tiga posisi teratas. Eksperimen kontrol memperkuat temuan ini, menunjukkan bahwa pengendalian kutipan menyebabkan peringkat model berkumpul, menunjukkan bahwa kedalaman pencarian adalah pembeda kinerja yang signifikan.

Model Sonar dari Perplexity memiliki kedalaman pencarian yang secara substansial lebih tinggi, dengan ppl-sonar-pro-high mengutip 2-3 kali lebih banyak sumber daripada model Gemini yang setara.

Apa Artinya Ini untuk Pengguna

Bagi pengguna Perplexity, hasil ini menegaskan bahwa model Sonar memberikan akurasi terbaik di kelasnya, atribusi sumber yang komprehensif, dan respons berkualitas tinggi di berbagai topik.

Pengguna Perplexity Pro dapat terus mendapatkan manfaat dari model top-performer ini dengan mengatur Sonar sebagai model default di pengaturan. Pengguna API dapat mengakses kemampuan ini melalui penawaran API Sonar kami dengan mode pencarian fleksibel untuk menyeimbangkan kinerja dan efisiensi biaya.

Walaupun kami bangga dengan pencapaian ini, kami tetap fokus pada peningkatan yang berkelanjutan. Evaluasi Search Arena memberikan wawasan yang berharga tentang preferensi pengguna yang akan menginformasikan upaya pengembangan kami yang berkesinambungan.

Pengenalan Sonar

Bergabunglah dengan co-founder & CTO Perplexity, Denis Yarats, untuk tinjauan singkat tentang API kami pada tanggal 24 April pukul 11 siang PT. Denis akan memberikan tinjauan singkat tentang API Perplexity, berbagi hasil benchmark, dan kasus penggunaan API.

Daftar di sini.

Mulai dengan Sonar.

Tertarik membentuk masa depan Platform API kami? Kami sedang membuka lowongan.

Bergabunglah dengan komunitas pengembang kami untuk tetap mendapatkan informasi terbaru tentang rilis, fitur, dan pembaruan.

Tertarik membentuk masa depan Platform API kami? Kami sedang membuka lowongan.

Bergabunglah dengan komunitas pengembang kami untuk tetap mendapatkan informasi terbaru tentang rilis, fitur, dan pembaruan.

Tertarik membentuk masa depan Platform API kami? Kami sedang membuka lowongan.

Bergabunglah dengan komunitas pengembang kami untuk tetap mendapatkan informasi terbaru tentang rilis, fitur, dan pembaruan.