लेख
पेर्प्लेक्सिटी सोनार नई खोज क्षेत्र मूल्यांकन में हावी

संक्षेप में
संख्या #1 रैंक: Sonar-Reasoning-Pro-High ने एरीना स्कोर 1136 (±21/−19) हासिल किया, जो Google के Gemini-2.5-Pro-Grounding (1142 +14/-17) के साथ पहले स्थान के लिए सांख्यिकी रूप से जुड़ा है। सीधे मुकाबले में, Sonar-Reasoning-Pro-High ने Gemini-2.5-Pro-Grounding को 53% समय हराया।
Sonar प्रभुत्व: Perplexity मॉडलों ने 1 से 4 स्थानों को सुरक्षित किया, और Google तथा OpenAI के अन्य मूल्यांकित मॉडलों को महत्वपूर्ण रूप से पीछे छोड़ दिया।
विवेक लाभ: विवेक क्षमता वाले मॉडल (sonar-reasoning-pro और sonar-reasoning) उच्च रैंक पर आए, जो विवेक मॉडलों के लिए देखी गई सामान्य उपयोगकर्ता प्राथमिकता के अनुरूप है (नेतृत्व बोर्ड पर शीर्ष 3)।
खोज की गहराई: Sonar मॉडल गहरी खोज करते हैं और अधिक स्रोतों पर विचार करते हैं, औसतन 2-3x अधिक स्रोत की सूचना देते हैं तुलना लिए गए Gemini मॉडलों की।
LM एरीना ने हाल ही में अपना नया खोज एरीना नेतृत्व बोर्ड जारी किया है जो मानव प्राथमिकता के आधार पर खोज-वर्धित LLM सिस्टम की तुलना करता है। Perplexity का Sonar-Reasoning-Pro मॉडल प्रथम स्थान के लिए Gemini-2.5-Pro-Grounding के साथ जुड़ा हुआ है, जबकि शेष Sonar मॉडल Gemini-2.0-Flash-Grounding और OpenAI के सभी वेब खोज मॉडल को पछाड़ देते हैं।

खोज एरीना बेंचमार्किंग
सरलफ़ाका के संकीर्ण तथ्यात्मक सटीकता पर ध्यान केंद्रित करने के विपरीत, LM एरीना यह मूल्यांकन करता है कि मॉडल कोडिंग, लेखन, शोध और अनुशंसाओं में वास्तविक उपयोगकर्ता प्रश्नों पर कैसे प्रतिक्रिया देते हैं। खोज एरीना के साथ, मूल्यांकन मौजूदा घटनाओं पर केंद्रित है और इसमें लंबी, अधिक जटिल प्रॉम्प्ट शामिल हैं, 11 मॉडलों में से 10,000 से अधिक मानव प्राथमिकता वोट इकट्ठा करते हैं। 18 मार्च से 13 अप्रैल, 2025 के बीच, खोज एरीना ने उपयोगकर्ताओं से पूछा कि कौन सा मॉडल प्रतिक्रिया उनके सूचना आवश्यकताओं को बेहतर संतुष्ट करती है।
Sonar मॉडल प्रदर्शन परिणाम
Perplexity के Sonar मॉडल ने कई शीर्ष स्तरीय मॉडल्स को पीछे छोड़ दिया है जिनमें Gemini 2.0 Flash और GPT 4o Search शामिल हैं। हमारे Sonar-Reasoning-Pro मॉडल ने 1136 का स्कोर हासिल किया, जो शीर्ष स्थान पर Gemini-2.5-Pro-Grounding (1142) के साथ सांख्यिकी रूप से जुड़ा था।
प्रत्यक्ष हेड-टू-हेड मुकाबलों में, Sonar-Reasoning-Pro-High ने Gemini-2.5-Pro-Grounding को 53% समय हराया।

खोज एरीना के मूल्यांकन से तीन कारक प्रकट हुए जो मानव प्राथमिकता के साथ मजबूत संबंध रखते हैं:
लंबे उत्तर (गुंजामान 0.255, p<0.05)
अधिक उद्धरण संख्या (गुंजामान 0.234, p<0.05)
समुदायिक वेब स्रोतों से उद्धरण
नेतृत्व बोर्ड ने स्पष्ट रूप से विवेक-वर्धित मॉडलों के लिए उपयोगकर्ता वरीयता दिखाई, जिसमें Sonar-Reasoning-Pro और Sonar-Reasoning ने शीर्ष तीन पदों में से दो पर कब्जा किया। नियंत्रण प्रयोगों ने इन निष्कर्षों को मजबूत किया, यह दिखाते हुए कि उद्धरणों के लिए नियंत्रण करने से मॉडल रैंकिंग अभिसरण हुई, सुझाव देता है कि खोज गहराई एक महत्वपूर्ण प्रदर्शन विभेदक है।

Perplexity के Sonar मॉडल में काफी उच्च खोज गहराई थी, जिसमें ppl-sonar-pro-high समान Gemini मॉडलों की तुलना में 2-3x अधिक स्रोत उद्धृत करता था।
उपयोगकर्ताओं के लिए इसका क्या अर्थ है
Perplexity उपयोगकर्ताओं के लिए, ये परिणाम पुष्टि करते हैं कि Sonar मॉडल सबसे उच्च कोटि की सटीकता, व्यापक स्रोत की सूचना और विषयों की व्यापक रेंज पर उच्च-गुणवत्ता वाले प्रतिक्रियाएं प्रदान करते हैं।
Perplexity Pro उपयोगकर्ता ये सुप्रदर्शन मॉडल्स का लाभ उठा सकते हैं द्वारा Sonar को अपनी डिफ़ॉल्ट मॉडल के रूप में सेट करने के सेटिंग्स में। API उपयोगकर्ता हमारे Sonar API प्रस्तावों के माध्यम से इन क्षमताओं तक पहुंच सकते हैं, लचीली खोज मोड के साथ प्रदर्शन और लागत दक्षता में संतुलन बनाने के लिए।
जबकि हम इस उपलब्धि पर गर्व महसूस करते हैं, हम सतत सुधार पर केंद्रित रहते हैं। खोज एरीना मूल्यांकन उपयोगकर्ता पसंद पर मूल्यवान अंतर्दृष्टि प्रदान करता है जो हमारे चल रहे विकास प्रयासों को सूचित करेगा।

Sonar का परिचय
Perplexity के सह-संस्थापक एवं CTO, डेनिस यारटस से 24 अप्रैल को सुबह 11 बजे PT पर हमारे API के अवलोकन के लिए जुड़ें। डेनिस Perplexity के APIs, बेंचमार्क परिणामों और API उपयोग मामलों का अवलोकन देंगे।