تقديم نماذج PPLX اللغوية الكبيرة المتصلة بالإنترنت

أول واجهة برمجة تطبيقات (API) لنموذج لغوي كبير متصل بالإنترنت من نوعها

Perplexity releases first "Live" LLM

أول واجهة برمجة تطبيقات (API) لنموذج لغوي كبير (LLM) متصل بالإنترنت من نوعها.

يسعدنا الإعلان عن نموذجين جديدين من نماذج PPLX: pplx-7b-online و pplx-70b-online! تركز نماذجنا المتصلة بالإنترنت على تقديم إجابات مفيدة ومحدثة ومستندة إلى الحقائق، وهي متاحة للعامة عبر pplx-api، مما يجعلها واجهة برمجة تطبيقات الأولى من نوعها. كما يتوفر النموذجان pplx-7b-online و pplx-70b-online من خلال Perplexity Labs، منصة النماذج اللغوية الكبيرة الخاصة بنا للتجارب.

لقد أحدثت النماذج اللغوية الكبيرة (LLMs) ثورة في طريقة بحثنا عن المعلومات. ومع ذلك، هناك تحديان رئيسيان تواجه معظم النماذج اللغوية الكبيرة اليوم:

الحداثة: غالباً ما تواجه النماذج اللغوية الكبيرة صعوبة في مشاركة معلومات محدثة.

الهلوسة: يمكن أن تُخرج النماذج اللغوية الكبيرة أيضاً بيانات غير دقيقة.

تعالج نماذجنا pplx-7b-online و pplx-70b-online القيود الحالية من خلال توفير معلومات إضافية مفيدة ومستندة إلى الحقائق ومحدثة في ردودها.

نماذج PPLX اللغوية الكبيرة المتصلة بالإنترنت

نماذجنا اللغوية الكبيرة، pplx-7b-online و pplx-70b-online، هي نماذج لغوية كبرى متصلة بالإنترنت لأنها تستطيع استخدام المعرفة من الإنترنت، وبالتالي يمكنها الاستفادة من أحدث المعلومات عند صياغة الرد. من خلال تزويد نماذجنا اللغوية الكبيرة بالمعرفة من الويب، تستجيب نماذجنا بدقة للاستعلامات المرتبطة بالوقت، مما يتيح الوصول إلى معرفة تتجاوز مجموعة بيانات تدريبها. هذا يعني أن النماذج اللغوية الكبيرة المتصلة بالإنترنت من Perplexity يمكنها الإجابة على استعلامات مثل "ما هي نتيجة مباراة غولدن ستيت ووريورز الليلة الماضية؟" والتي تشكل تحدياً للنماذج غير المتصلة بالإنترنت. على مستوى عالٍ، هذه هي طريقة عمل نموذجنا اللغوي الكبير المتصل بالإنترنت:

  1. الاستفادة من النماذج مفتوحة المصدر: تعتمد نماذج PPLX الخاصة بنا على النماذج الأساسية mistral-7b و llama2-70b.
  2. تكنولوجيا البحث الداخلية: تتيح لنا بنية البحث والفهرسة والزحف الداخلية الخاصة بنا تعزيز النماذج اللغوية الكبيرة بأكثر المعلومات صلة وتحديثاً وقيمة. فهرس البحث لدينا كبير، ويتم تحديثه بانتظام، ويستخدم خوارزميات ترتيب متطورة لضمان إعطاء الأولوية للمواقع عالية الجودة وغير الموجهة لمحركات البحث (SEO). يتم توفير مقتطفات من مواقع الويب، والتي نسميها "مقتطفات" (snippets)، لنماذجنا pplx-online لتمكين الردود بأحدث المعلومات.
  3. الضبط الدقيق (Fine-tuning): تم ضبط نماذج PPLX لدينا بدقة لاستخدام المقتطفات بفعالية لإعلام ردودها. باستخدام متعاقدي البيانات الداخليين لدينا، نقوم بعناية بتنسيق مجموعات تدريب عالية الجودة ومتنوعة وكبيرة من أجل تحقيق أداء عالٍ في محاور مختلفة مثل الإفادة، والدقة، والحداثة. يتم ضبط نماذجنا بانتظام لتحسين الأداء بشكل مستمر.

تقييم النماذج اللغوية الكبيرة المتصلة بالإنترنت من Perplexity

تتمثل مهمة Perplexity في بناء أفضل محرك إجابات في العالم - وهو محرك يثق به الناس لاكتشاف وتوسيع معرفتهم. لتحقيق ذلك، نحن نركز بشكل عميق على توفير معلومات مفيدة ودقيقة ومحدثة. لقياس أداء نماذجنا اللغوية الكبيرة على هذه المحاور، قمنا بتنسيق مجموعات بيانات تقييم تعكس حالات استخدام صعبة ولكنها واقعية لمحركات الإجابات. لكل استعلام في كل مجموعة تقييم، تم منح المتعاقدين استجابتين للنموذج وتم توجيههم لاختيار الاستجابة التي أدت بشكل أفضل للمعايير التالية:

  • الإفادة: أي رد يجيب على الاستعلام ويتبع التعليمات المحددة بشكل أفضل؟
  • الدقة: أي رد يقدم إجابات أكثر دقة بدون هلوسة، حتى للأسئلة التي تتطلب معرفة دقيقة جداً أو متخصصة؟
  • الحداثة (مستوحاة من FreshLLMs): أي رد يحتوي على معلومات أكثر تحديثاً؟ يتفوق النموذج في هذا المعيار إذا كان قادراً على الإجابة على الاستعلامات بمعلومات "حديثة".

بالإضافة إلى المعايير الثلاثة المذكورة أعلاه، تم تقييم ردود النموذج بشكل شمولي. لتقييم الردود بشكل شمولي، طُلب من المقيمين اختيار الرد الذي يفضلون تلقيه من مساعد بشري يساعد في الاستعلام.

تنسيق مجموعة التقييم

لهذا التقييم، قمنا بعناية بتنسيق مجموعة متنوعة من الأوامر بهدف تقييم الإفادة والدقة والحداثة بفعالية. تم اختيار كل أمر يدوياً، مما đảm مستوى عالٍ من التحكم في جودة البيانات ومدى صلتها. تمتد مجموعة البيانات عبر مجموعة واسعة من مطالبات محركات الإجابات وتضم نظرة عامة شاملة على ما نريد أن تتفوق فيه Perplexity. هذا أمر بالغ الأهمية لكي تتمتع تقييمات أداء نموذجنا بإشارة عالية.

تحتوي كل من مجموعات التقييم الثلاث على 50 أمراً. تتضمن بعض الأمثلة من هذه المجموعات:

  • الإفادة: أنشئ جدولاً لجميع لاعبي كرة القدم في الولايات المتحدة الذين لعبوا في نهائيات كأس العالم وقم بعمل أعمدة لإحصائياتهم مثل الأهداف والتمريرات الحاسمة وما إلى ذلك.
  • الدقة: اشرح صلابة فولاذ AISI 1015 و AISI 1040.
  • التحديث: ما هي شركة السيارات ذاتية القيادة التي تم حظرها من سان فرانسيسكو في عام 2023؟

توليد ردود النماذج

قمنا بتقييم أربعة نماذج:

pplx-7b-online: نموذج Perplexity، والذي يتضمن إمكانية الوصول إلى المعلومات من الإنترنت. تم ضبط هذا النموذج بدقة باستخدام mistral-7b.

pplx-70b-online: نموذج Perplexity، والذي يتضمن إمكانية الوصول إلى المعلومات من الإنترنت. تم ضبط هذا النموذج بدقة باستخدام llama2-70b.

gpt-3.5-turbo-1106: نموذج OpenAI، الذي يتم الوصول إليه عبر واجهة برمجة التطبيقات (API) ودون أي تعزيزات إضافية. لاحظ أننا أجرنا هذا التقييم باستخدام أحدث نموذج gpt-3.5.

llama2-70b-chat: نموذج Meta AI، الذي يتم الوصول إليه عبر pplx-api الخاص بنا ودون أي تعزيزات إضافية.

لكل أمر، تم توفير نفس نتائج البحث والمقتطفات لنموذجي pplx-7b-online و pplx-70b-online. تم إنشاء جميع الردود باستخدام نفس المعلمات الفائقة وأمر النظام.

أمر النظام

plaintext
Current date: Monday, November 20, 2023.

ترتيب ردود النماذج باستخدام التقييم البشري

لكل مقارنة زوجية، تم تزويد المتعاقدين الداخليين بالأمر نفسه، ومعايير التقييم (أي الإفادة، أو الدقة، أو الحداثة)، وردود النموذج المعروضة جنباً إلى جنب. تم عشوائية ترتيب الردود في كل دور، ولم يتم الكشف عن النماذج المصدر للمقيم. توجيه المقيمين لاختيار الاستجابة التي يفضلونها بشكل شمولي، وكذلك أي منها يؤدي بشكل أفضل في معيار التقييم المحدد، مع السماح بالتعادل لكليهما. أخيراً، يُسمح للمقيمين باستخدام بحث الإنترنت للتحقق من دقة الردود. لقد أنشأنا أداة ترتيب التفضيلات الداخلية الخاصة بنا لإجراء هذا التقييم.

نتائج التقييم

نحن نستخدم ترتيبات التفضيلات الزوجية التي تم جمعها من التقييم البشري لحساب درجات إلو (Elo) لكل مهمة لكل نموذج. تُستخدم درجات إلو بشكل شائع لتصنيف مجموعة من اللاعبين في مسابقات على طراز البطولات قياساً للأداء النسبي للاعبين. عند تطبيقها على النماذج اللغوية الكبيرة، توفر هذه الدرجات تنبؤاً بمدى احتمالية تفضيل المقيّم البشري لمخرجات نموذج على آخر.

بينما يتم حساب درجات إلو عادة لسلسلة من المقارنات لمراعاة التغيرات في قدرات اللاعبين، فإننا نهدف إلى قياس أداء النماذج التي لا يمكن أن تتغير قدراتها. وفقاً لذلك، نعتمد منهجية Bootstrap Elo الموصوفة في Duan et al والتي تستخدمها أيضاً lmsys لـ Chatbot Arena الخاصة بها، والتي تتضمن حساب درجات إلو للعديد من التبادلات العشوائية للمقارنات. لحساباتنا، قمنا بحساب درجات إلو على 5000 تبادل واستخدمنا توزيعات درجات إلو هذه لحساب فترات ثقة بنسبة 95%.

تظهر النتائج، المعروضة في الشكل 1، أن نماذج PPLX الخاصة بنا يمكنها مطابقة بل وحتى تجاوز أداء gpt-3.5 في حالات الاستخدام المتعلقة بـ Perplexity. على وجه الخصوص، يفضل المقيمون البشريون ردود نموذج pplx-7b-online و pplx-70b-online على ردود نموذج gpt-3.5 و llama2-70b لإجاباتهما الدقيقة والمحدثة.

يؤدي pplx-7b-online و pplx-70b-online أداءً أفضل من gpt-3.5 و llama2-70b، بناءً على معايير الحداثة و الدقة و الشمولية.

الشكل 1. درجات إلو المقدرة وفترات الثقة بنسبة 95% لـ pplx-7b (-online)، و pplx-70b (-online)، و llama2-70b، و gpt-3.5 عبر أربع مجموعات تقييم مختلفة. على سبيل المثال، على محور الحداثة، يؤدي pplx-7b و pplx-70b أداءً أفضل من gpt-3.5 و llama2-70b، بدرجة إلو مقدرة تبلغ 1100.6 و 1099.6 مقابل 879.3 و 920.3 على التوالي.

لقد قمنا أيضاً بحساب معدلات الفوز الزوجية من التقييم. توضح النتائج، المعروضة في الشكل 2، ربما ليس من المستغرب، أن ردود نموذج pplx المتصل بالإنترنت يُفضل على غيره في معيار الحداثة و الدقة.

الشكل 2. معدلات الفوز للنماذج على المحور الرأسي مقابل النماذج على المحور الأفقي. على سبيل المثال، تم تقييم ردود pplx-70b (-online) على أنها متفوقة شمولياً على ردود gpt-3.5 في 64% من الاستعلامات، وتم تقييم ردود gpt-3.5 على أنها متفوقة شمولياً على pplx-70b (-online) في 24% من الاستعلامات.

إليك مثال من مجموعة بيانات تقييم الحداثة لدينا.

الأمر: كم عدد الأشخاص في الولايات المتحدة الذين لديهم رخصة قيادة؟

pplx-7b-online

في عام 2023، هناك 243.4 مليون سائق مرخص متوقع في الولايات المتحدة، والذي يشمل 89% من البالغين في الولايات المتحدة. وقد زاد هذا الرقم من 238.6 مليون في عام 2022. تختلف نسبة السائقين المرخصين عبر الفئات العمرية المختلفة والولايات. على سبيل المثال، في عام 2019، كان لدى 84.1% من سكان الولايات المتحدة رخصة قيادة. أعلى نسبة من السائقين المرخصين هي بين أولئك الذين تتراوح أعمارهم بين 25 و 49 عاماً، حيث يمتلك 90.1% من السكان رخصة قيادة. في كاليفورنيا، كان هناك 27 مليون سائق مرخص، مما يجعلها الولاية التي تضم أعلى عدد من السائقين المرخصين.

pplx-70b-online

في عام 2021، كان حوالي 233 مليون شخص يحملون رخص قيادة سارية في الولايات المتحدة. بحلول عام 2023، من المتوقع أن يصل عدد السائقين المرخصين في الولايات المتحدة إلى 243.4 مليون، والذي يشمل 89% من البالغين في الولايات المتحدة. يمثل هذا زيادة من 238.6 مليون في عام 2022.

gpt-3.5

ك نموذج لغوي للذكاء الاصطناعي، ليس لدي إمكانية الوصول إلى البيانات في الوقت الفعلي. ومع ذلك، اعتباراً من عام 2021، قُدر أن حوالي 227 مليون شخص في الولايات المتحدة يحملون رخصة قيادة سارية. يُرجى ملاحظة أن هذا الرقم قد يكون قد تغير منذ ذلك الحين، لذلك من الأفضل دائماً الرجوع إلى أحدث الإحصاءات الرسمية للحصول على المعلومات الأكثر دقة.

llama2-70b

ليس لدي إمكانية الوصول إلى البيانات في الوقت الفعلي، ولكن يمكنني تقديم بعض المعلومات حول العدد التقريبي للأشخاص في الولايات المتحدة الذين لديهم رخصة قيادة. وفقاً لإدارة الطرق السريعة الفيدرالية، كان هناك ما يقرب من 227.8 مليون سائق مرخص في الولايات المتحدة اعتباراً من عام 2020. يتضمن هذا الرقم السائقين التجاريين وغير التجارين. تجدر الإشارة إلى أن هذا الرقم ربما يكون تقديرًا أقل من الواقع، لأنه لا يأخذ في الاعتبار الأفراد الذين قد يكون لديهم رخصة قيادة ولكنهم لا يقودون بانتظام أو على الإطلاق. بالإضافة إلى ذلك، لا يتضمن هذا الرقم الأفراد غير المؤهلين للحصول على رخصة قيادة، مثل أولئك الذين تقل أعمارهم عن 16 عاماً أو لديهم إعاقات معينة. من المهم أيضاً ملاحظة أن عدد السائقين المرخصين يمكن أن يختلف حسب الولاية، حيث تحتوي بعض الولايات على نسبة أعلى من السائقين المرخصين مقارنة بغيرها.

بشكل عام، تظهر نتائج التقييم أن نماذج PPLX الخاصة بنا يمكنها مطابقة بل وحتى التفوق على gpt-3.5 و llama2-70b في حالات الاستخدام المتعلقة بـ Perplexity، لا سيما لتقديم ردود دقيقة ومحدثة.

الوصول إلى النماذج المتصلة بالإنترنت من Perplexity

يسعدنا أن نعلن أن pplx-api ينتقل من مرحلة التجربة (Beta) إلى الإصدار العام الرسمي! هذه هي المرة الأولى التي يمكن فيها الوصول إلى نماذجنا pplx-7b-online و pplx-70b-online عبر pplx-api. بالإضافة إلى ذلك، خرجت نماذجنا pplx-7b-chat و pplx-70b-chat من مرحلة الألفا، وهي متاحة الآن مع الإصدار العام.

مع ذلك، نقدم هيكل تسعير جديد قائم على الاستخدام. نحن متحمسون لأن يكتشف مستخدمونا بنيتنا التحتية المتطورة، والتي تستخدم NVIDIA H100s لتوفير استدلال فائق السرعة. سيتلقى مستخدمو Pro رصيد pplx-api شهري متجدد بقيمة 5 دولارات. لجميع المستخدمين الآخرين، سيتم تحديد التسعير بناءً على الاستخدام. للاشتراك كمستخدم Pro، انقر هنا. تواصل معنا عبر api@perplexity.ai للاستفسارات التجارية.

لوحة تحكم نموذج PPLX اللغوي الكبير المتصل بالإنترنت

موارد إضافية:

  • ابدأ مع pplx-api من هنا.
  • جرب نماذجنا المتصلة بالإنترنت مجاناً مع Perplexity Labs.
  • تعرف على المزيد حول واجهة برمجة تطبيقات (API) عبر وثائق pplx-api.
  • هل أنت مهتم بالعمل في فريق عالي التأثير وعالي السرعة يبني أفضل محرك إجابات؟ انضم إلينا!
  • انضم إلى مجتمع Discord المتنامي لدينا!

المساهمون:

لورين يانغ، كيفن هو، آرش حيدري، غرادي وانغ، ديمتري بيرفوخين، نيكهيل ثوتا، ألكسندر ياريتس، ماكس موروزوف، دينيس ياريتس