مقالة

تسيطر بيربلكسيتي سونار على تقييم مجال البحث الجديد

الضوء يخترق أرضية هندسية وصلبة

لمحة سريعة

  • التصنيف الأول #1: سونار-ريزننج-برو-هاي حقق نقاط أرينا 1136 (±21/−19)، تعادل إحصائيًا مع جوجل جيميني-2.5-برو-جروندينج (1142 +14/-17). في المواجهات المباشرة، تفوق سونار-ريزننج-برو-هاي على جيميني-2.5-برو-جروندينج بنسبة 53% من الوقت.

  • هيمنة سونار: نموذج بيربلكسيتي حل في المراكز من 1 إلى 4، وتفوق بشكل ملحوظ على النماذج الأخرى التي قامت بتقييمها جوجل وOpenAI.

  • ميزة التفكير: النماذج التي تدمج قدرات التفكير (سونار-ريزننج-برو وسونار-ريزننج) سجلت درجات أعلى، بما يتماشى مع التفضيل العام المستخدم للنماذج القائمة على التفكير (أعلى 3 على لوحة النتائج).

  • عمق البحث: تقوم نماذج سونار بإجراء بحث أعمق وتعتبر المزيد من المصادر، مستشهدة في المتوسط بمرتين إلى ثلاث مرات أكثر من النماذج القابلة للمقارنة مع جيميني.

أطلقت LM أرينا للتو لوحة نتائج جديدة لأرينا البحث تقارن بين نظم LLM المعززة بالبحث بناءً على تفضيل الإنسان. نموذج سونار-ريزننج-برو من بيربلكسيتي تعادل في المركز الأول مع جيميني-2.5-برو-جروندينج، بينما تفوقت باقي نماذج سونار على جيميني-2.0-فلاش-جروندينج وجميع نماذج بحث الويب الخاصة بـ OpenAI.

معايير أرينا البحث

على عكس تركيز SimpleQA على الدقة الواقعية الضيقة، تقيم LM أرينا كيفية أداء النماذج على استفسارات المستخدم الفعلية عبر الترميز، والكتابة، والبحث، والتوصيات. مع أرينا البحث، يركز التقييم على الأحداث الحالية ويتضمن مطالبات أطول وأكثر تعقيداً، حيث تم جمع أكثر من 10,000 صوت تفضيل بشري عبر 11 نموذجاً. بين 18 مارس و13 أبريل 2025، طلب أرينا البحث من المستخدمين تقديم اقتراحات وتحديد أي استجابة نموذجية أفضل لتلبية احتياجاتهم المعلوماتية.

نتائج أداء نموذج سونار

تفوق نماذج سونار من بيربلكسيتي على العديد من النماذج الرائدة في هذا المجال بما في ذلك جيميني 2.0 فلاش وGPT 4o سيرش. حصل نموذج سونار-ريزننج-برو على درجة 1136، متساويًا إحصائيًا مع جيميني-2.5-برو-جروندينج (1142) في المركز الأول.

في المواجهات المباشرة، سونار-ريزننج-برو-هاي تغلب على جيميني-2.5-برو-جروندينج بنسبة 53% من الوقت.

كشف تقييم أرينا البحث عن ثلاثة عوامل ترتبط بقوة بتفضيل الإنسان:

  • ردود أطول (معامل 0.255، p<0.05)

  • ارتفاع عدد الاقتباسات (معامل 0.234، p<0.05)

  • اقتباسات من مصادر ويب مجتمعية

أظهرت لوحة النتائج تفضيل المستخدم الواضح للنماذج القائمة على التفكير، حيث احتل سونار-ريزننج-برو وسونار-ريزننج مكانين ضمن المراكز الثلاثة الأولى. أكدت التجارب المعملية هذه النتائج، حيث أظهرت أن التحكم في الاقتباسات جعل التصنيفات تتقارب، مما يشير إلى أن عمق البحث هو عامل تمييز رئيسي في الأداء.

كانت نماذج سونار من بيربلكسيتي تمتلك عمق بحث أعلى بكثير، حيث استشهد ppl-sonar-pro-high بمصادر أكثر من ضعفين إلى ثلاثة أضعاف مقارنة بنماذج جيميني المكافئة.

ما يعنيه هذا للمستخدمين

لمستخدمي بيربلكسيتي، تؤكد هذه النتائج أن نماذج سونار توفر دقة من الدرجة الأولى، وعزو مصادر شامل، واستجابات عالية الجودة عبر مجموعة واسعة من المواضيع.

يمكن لمستخدمي بيربلكسيتي برو الاستمرار في الاستفادة من هذه النماذج الرائدة عبر ضبط سونار كنموذجهم الافتراضي في الإعدادات. يمكن لمستخدمي API الوصول إلى هذه القدرات من خلال عروض Sonar API مع أوضاع بحث مرنة للتوازن بين الأداء وكفاءة التكلفة.

بينما نفخر بهذا الإنجاز، نظل مركّزين على التحسين المستمر. يوفر تقييم أرينا البحث رؤى قيمة حول تفضيلات المستخدم التي ستوجه جهود التطوير المستمرة لدينا.

مقدمة إلى سونار

انضم إلى دينيس ياراتس، الشريك المؤسس والمدير التقني في بيربلكسيتي، للحصول على نظرة عامة عن واجهة برمجة التطبيقات لدينا في 24 أبريل الساعة 11ص بتوقيت المحيط الهادئ. سوف يقدم دينيس نظرة عامة على واجهات برمجة تطبيقات بيربلكسيتي، ونتائج المعايير، وحالات استخدام API.

سجل هنا.

ابدأ مع سونار.

مهتم بالمساهمة في تشكيل مستقبل منصة API الخاصة بنا؟ نحن نوظف.

انضم إلى مجتمع المطورين لدينا للبقاء على اطلاع دائم بالإصدارات الجديدة والميزات والتحديثات.

مهتم بالمساهمة في تشكيل مستقبل منصة API الخاصة بنا؟ نحن نوظف.

انضم إلى مجتمع المطورين لدينا للبقاء على اطلاع دائم بالإصدارات الجديدة والميزات والتحديثات.

مهتم بالمساهمة في تشكيل مستقبل منصة API الخاصة بنا؟ نحن نوظف.

انضم إلى مجتمع المطورين لدينا للبقاء على اطلاع دائم بالإصدارات الجديدة والميزات والتحديثات.