PPLX ऑनलाइन LLMs का परिचय

अपनी तरह का पहला ऑनलाइन LLM API

Perplexity releases first "Live" LLM

अपनी तरह का पहला ऑनलाइन LLM API।

हमें दो नए PPLX मॉडल साझा करते हुए बहुत खुशी हो रही है: pplx-7b-online और pplx-70b-online! हमारे ऑनलाइन मॉडल उपयोगी, अद्यतित और तथ्यात्मक प्रतिक्रियाएँ देने पर केंद्रित हैं, और pplx-api के माध्यम से सार्वजनिक रूप से उपलब्ध हैं, जो इसे अपनी तरह का पहला API बनाता है। pplx-7b-online और pplx-70b-online को हमारे LLM प्लेग्राउंड, Perplexity Labs के माध्यम से भी एक्सेस किया जा सकता है।

LLMs ने जानकारी खोजने के हमारे तरीके को बदल दिया है। हालाँकि, आज अधिकांश LLMs के साथ दो सीमाएँ हैं:

नवीनता: LLMs अक्सर अद्यतित जानकारी साझा करने में संघर्ष करते हैं।

मतिभ्रम (Hallucinations): LLMs गलत बयान भी दे सकते हैं।

हमारे pplx-7b-online और pplx-70b-online मॉडल अपनी प्रतिक्रियाओं में उपयोगी, तथ्यात्मक और अद्यतित जानकारी प्रदान करके वर्तमान सीमाओं को संबोधित करते हैं।

PPLX ऑनलाइन LLMs

हमारे LLMs, pplx-7b-online और pplx-70b-online, ऑनलाइन LLMs हैं क्योंकि वे इंटरनेट से ज्ञान का उपयोग कर सकते हैं, और इस प्रकार प्रतिक्रिया तैयार करते समय सबसे अद्यतित जानकारी का लाभ उठा सकते हैं। हमारे LLMs को वेब से ज्ञान प्रदान करके, हमारे मॉडल समय-संवेदनशील प्रश्नों का सटीक रूप से उत्तर देते हैं, और अपने प्रशिक्षण डेटासेट से परे ज्ञान को अनलॉक करते हैं। इसका मतलब है कि Perplexity के ऑनलाइन LLMs “कल रात वॉरियर्स का खेल स्कोर क्या था?” जैसे उन प्रश्नों का उत्तर दे सकते हैं जो ऑफलाइन मॉडल के लिए चुनौतीपूर्ण हैं। उच्च स्तर पर, हमारा ऑनलाइन LLM इस प्रकार काम करता है:

  1. ओपन सोर्स मॉडल का लाभ उठाना: हमारे PPLX मॉडल mistral-7b और llama2-70b बेस मॉडल पर निर्मित हैं।
  2. इन-हाउस सर्च तकनीक: हमारी इन-हाउस सर्च, इंडेक्सिंग और क्रॉलिंग इंफ्रास्ट्रक्चर हमें सबसे प्रासंगिक, अद्यतित और मूल्यवान जानकारी के साथ LLMs को बढ़ाने की अनुमति देता है। हमारा सर्च इंडेक्स बड़ा है, इसे नियमित आधार पर अपडेट किया जाता है, और यह सुनिश्चित करने के लिए परिष्कृत रैंकिंग एल्गोरिदम का उपयोग करता है कि उच्च गुणवत्ता वाली, गैर-SEO साइटों को प्राथमिकता दी जाए। वेबसाइट के अंश, जिन्हें हम "स्निपेट्स" कहते हैं, हमारे pplx-online मॉडल को सबसे अद्यतित जानकारी के साथ प्रतिक्रिया देने में सक्षम बनाने के लिए प्रदान किए जाते हैं।
  3. फाइन-ट्यूनिंग: हमारे PPLX मॉडलों को उनकी प्रतिक्रियाओं को सूचित करने के लिए स्निपेट्स का प्रभावी ढंग से उपयोग करने के लिए फाइन-ट्यून किया गया है। हमारे इन-हाउस डेटा ठेकेदारों का उपयोग करके, हम उपयोगिता, तथ्यात्मकता और नवीनता जैसे विभिन्न मानकों पर उच्च प्रदर्शन प्राप्त करने के लिए उच्च गुणवत्ता, विविध और बड़े प्रशिक्षण सेटों को सावधानीपूर्वक तैयार करते हैं। प्रदर्शन में निरंतर सुधार करने के लिए हमारे मॉडलों को नियमित रूप से फाइन-ट्यून किया जाता है।

Perplexity के ऑनलाइन LLMs का मूल्यांकन

Perplexity का मिशन दुनिया का सर्वश्रेष्ठ उत्तर इंजन बनाना है - जिस पर लोग अपने ज्ञान की खोज और विस्तार करने के लिए भरोसा करते हैं। इसे प्राप्त करने के लिए, हम उपयोगी, तथ्यात्मक और अद्यतित जानकारी प्रदान करने पर गहराई से केंद्रित हैं। इन मानकों पर हमारे LLMs के प्रदर्शन को बेंचमार्क करने के लिए, हमने उत्तर इंजन के लिए चुनौतीपूर्ण लेकिन यथार्थवादी उपयोग के मामलों को प्रतिबिंबित करने के लिए मूल्यांकन डेटासेट तैयार किए। प्रत्येक मूल्यांकन सेट में प्रत्येक प्रश्न के लिए, ठेकेदारों को दो मॉडल प्रतिक्रियाएँ दी गईं और उन्हें निम्नलिखित मानदंडों के लिए बेहतर प्रदर्शन करने वाली प्रतिक्रिया का चयन करने का निर्देश दिया गया:

  • उपयोगिता: कौन सी प्रतिक्रिया प्रश्न का उत्तर देती है और निर्दिष्ट निर्देशों का बेहतर पालन करती है?
  • तथ्यात्मकता: कौन सी प्रतिक्रिया बिना मतिभ्रम के अधिक सटीक उत्तर प्रदान करती है, यहाँ तक कि उन प्रश्नों के लिए भी जिनके लिए बहुत सटीक या विशिष्ट ज्ञान की आवश्यकता होती है?
  • नवीनता (FreshLLMs से प्रेरित): कौन सी प्रतिक्रिया में अधिक अद्यतित जानकारी है? एक मॉडल इस मानदंड में तब उत्कृष्ट होता है यदि वह “नवीन” जानकारी के साथ प्रश्नों का उत्तर देने में सक्षम हो।

उपरोक्त तीन मानदंडों के अलावा, मॉडल प्रतिक्रियाओं का समग्र रूप से भी मूल्यांकन किया गया। प्रतिक्रियाओं का समग्र रूप से मूल्यांकन करने के लिए, मूल्यांकनकर्ताओं से वह प्रतिक्रिया चुनने के लिए कहा गया जिसे वे उस मानव सहायक से प्राप्त करना पसंद करेंगे जो प्रश्न के साथ मदद कर रहा है।

मूल्यांकन सेट तैयार करना

इस मूल्यांकन के लिए, हमने उपयोगिता, तथ्यात्मकता और नवीनता का प्रभावी ढंग से मूल्यांकन करने के लक्ष्य के साथ संकेतों का एक विविध सेट सावधानीपूर्वक तैयार किया। प्रत्येक संकेत को मैन्युअल रूप से चुना गया था, जिससे डेटा की गुणवत्ता और प्रासंगिकता पर उच्च स्तर का नियंत्रण सुनिश्चित हुआ। डेटासेट में उत्तर इंजन संकेतों की एक विस्तृत श्रृंखला शामिल है और यह व्यापक अवलोकन प्रदान करता है कि हम Perplexity में किस चीज़ में उत्कृष्ट होना चाहते हैं। यह हमारे लिए हमारे मॉडल प्रदर्शन मूल्यांकन के उच्च सिग्नल के लिए महत्वपूर्ण है।

तीनों मूल्यांकन सेटों में से प्रत्येक में 50 संकेत हैं। इन सेटों के कुछ उदाहरणों में शामिल हैं:

  • उपयोगिता: विश्व कप फाइनल में खेलने वाले सभी यूएसए फुटबॉल खिलाड़ियों की एक तालिका बनाएँ और उनके आँकड़ों जैसे गोल, सहायता आदि के लिए कॉलम बनाएँ।
  • तथ्यात्मकता: AISI 1015 और AISI 1040 स्टील्स की कठोरता की व्याख्या करें।
  • अद्यतनता: 2023 में किस स्वायत्त कार कंपनी को सैन फ्रांसिस्को से प्रतिबंधित किया गया था?

मॉडल प्रतिक्रियाएँ उत्पन्न करना

हमने चार मॉडलों का मूल्यांकन किया:

pplx-7b-online: Perplexity का मॉडल, जिसमें इंटरनेट से जानकारी तक पहुँच शामिल है। इस मॉडल को mistral-7b का उपयोग करके फाइन-ट्यून किया गया था।

pplx-70b-online: Perplexity का मॉडल, जिसमें इंटरनेट से जानकारी तक पहुँच शामिल है। इस मॉडल को llama2-70b का उपयोग करके फाइन-ट्यून किया गया था।

gpt-3.5-turbo-1106: OpenAI का मॉडल, जिसे API के माध्यम से एक्सेस किया गया और इसमें कोई अतिरिक्त वृद्धि नहीं की गई। ध्यान दें कि हमने नवीनतम gpt-3.5 मॉडल का उपयोग करके यह मूल्यांकन किया है।

llama2-70b-chat: Meta AI का मॉडल, जिसे हमारे pplx-api के माध्यम से एक्सेस किया गया और इसमें कोई अतिरिक्त वृद्धि नहीं की गई।

प्रत्येक संकेत के लिए, वही खोज परिणाम और स्निपेट pplx-7b-online और pplx-70b-online मॉडल को प्रदान किए गए थे। सभी प्रतिक्रियाएँ समान हाइपरपैरामीटर और सिस्टम संकेत का उपयोग करके उत्पन्न की गई थीं।

सिस्टम संकेत

plaintext
Current date: Monday, November 20, 2023.

मानव मूल्यांकन के साथ मॉडल प्रतिक्रियाओं की रैंकिंग

प्रत्येक जोड़ीदार तुलना के लिए, हमारे इन-हाउस ठेकेदारों को संकेत, मूल्यांकन मानदंड (अर्थात, उपयोगिता, तथ्यात्मकता, या नवीनता), और साइड-बाय-साइड प्रदर्शित मॉडल प्रतिक्रियाएँ प्रदान की गईं। प्रतिक्रियाओं का क्रम प्रत्येक मोड़ पर यादृच्छिक था, और स्रोत मॉडल का खुलासा मूल्यांकनकर्ता के सामने नहीं किया गया था। मूल्यांकनकर्ताओं को उस प्रतिक्रिया का चयन करने का निर्देश दिया गया जिसे वे समग्र रूप से पसंद करते हैं, साथ ही यह भी कि विशिष्ट मूल्यांकन मानदंड पर कौन बेहतर प्रदर्शन करता है, दोनों के लिए टाई की अनुमति थी। अंत में, मूल्यांकनकर्ताओं को प्रतिक्रियाओं की सटीकता को सत्यापित करने के लिए इंटरनेट खोज का उपयोग करने की अनुमति थी। हमने इस मूल्यांकन को करने के लिए अपना इन-हाउस प्राथमिकता रैंकिंग टूल बनाया।

मूल्यांकन परिणाम

हम प्रत्येक मॉडल के लिए प्रति-कार्य Elo स्कोर की गणना करने के लिए मानव मूल्यांकन से एकत्र की गई जोड़ीदार प्राथमिकता रैंकिंग का उपयोग करते हैं। Elo स्कोर का उपयोग आमतौर पर खिलाड़ियों के सापेक्ष प्रदर्शन को मापने के लिए टूर्नामेंट-शैली प्रतियोगिताओं में खिलाड़ियों की आबादी को रैंक करने के लिए किया जाता है। जब बड़े भाषा मॉडलों पर लागू किया जाता है, तो ये स्कोर एक भविष्यवाणी प्रदान करते हैं कि मानव मूल्यांकनकर्ता एक मॉडल के आउटपुट को दूसरे से कितना अधिक पसंद कर सकते हैं।

जबकि Elo स्कोर आमतौर पर खिलाड़ियों की क्षमताओं में बदलाव के लिए तुलनाओं के अनुक्रम के लिए गणना की जाती है, हमारा उद्देश्य उन मॉडलों के प्रदर्शन को मापना है जिनकी क्षमताएं बदल नहीं सकती हैं। तदनुसार, हम Duan et al में वर्णित बूटस्ट्रैप Elo पद्धति को अपनाते हैं, जिसका उपयोग lmsys द्वारा उनके Chatbot Arena के लिए भी किया जाता है, जिसमें तुलनाओं के कई यादृच्छिक क्रमपरिवर्तनों के लिए Elo स्कोर की गणना करना शामिल है। हमारी गणनाओं के लिए, हमने 5000 क्रमपरिवर्तनों पर Elo स्कोर की गणना की और 95% विश्वास अंतराल की गणना करने के लिए इन Elo स्कोर के वितरण का उपयोग किया।

चित्र 1 में दिखाए गए परिणाम बताते हैं कि हमारे PPLX मॉडल Perplexity-संबंधित उपयोग के मामलों में gpt-3.5 प्रदर्शन से मेल खा सकते हैं और उसे पीछे भी छोड़ सकते हैं। विशेष रूप से, मानव मूल्यांकनकर्ता pplx-7b-online और pplx-70b-online मॉडल प्रतिक्रियाओं को उनके सटीक और अद्यतित उत्तरों के लिए gpt-3.5 और llama2-70b मॉडल प्रतिक्रियाओं से अधिक पसंद करते हैं।

pplx-7b-online और pplx-70b-online, नवीनता, तथ्यात्मकता और समग्र मानदंडों पर gpt-3.5 और llama2-70b से बेहतर प्रदर्शन करते हैं।

चित्र 1. चार अलग-अलग मूल्यांकन सेटों में pplx-7b (-online), pplx-70b (-online), llama2-70b, और gpt-3.5 के लिए अनुमानित Elo स्कोर और 95% विश्वास अंतराल। उदाहरण के लिए, नवीनता अक्ष पर, pplx-7b और pplx-70b, gpt-3.5 और llama2-70b से बेहतर प्रदर्शन करते हैं, जिसका अनुमानित Elo स्कोर क्रमशः 1100.6 और 1099.6 बनाम 879.3 और 920.3 है।

हमने मूल्यांकन से जोड़ीदार जीत दर की भी गणना की। चित्र 2 में दिखाए गए परिणाम यह दर्शाते हैं कि शायद आश्चर्यजनक नहीं, कि pplx ऑनलाइन मॉडल प्रतिक्रियाओं को नवीनता और तथ्यात्मकता पर दूसरों की तुलना में अधिक पसंद किया जाता है।

चित्र 2. क्षैतिज अक्ष पर मॉडलों के विरुद्ध ऊर्ध्वाधर अक्ष पर मॉडलों की जीत दर। उदाहरण के लिए, pplx-70b (-online) प्रतिक्रियाओं को 64% प्रश्नों पर gpt-3.5 की तुलना में समग्र रूप से बेहतर दर्जा दिया गया और gpt-3.5 की प्रतिक्रियाओं को 24% प्रश्नों पर pplx-70b (-online) की तुलना में समग्र रूप से बेहतर दर्जा दिया गया।

यहाँ हमारे नवीनता मूल्यांकन डेटासेट का एक उदाहरण है।

संकेत: यूएसए में कितने लोगों के पास ड्राइविंग लाइसेंस है?

pplx-7b-online

2023 में, संयुक्त राज्य अमेरिका में अनुमानित 243.4 मिलियन लाइसेंस प्राप्त ड्राइवर हैं, जिसमें 89% अमेरिकी वयस्क शामिल हैं। यह संख्या 2022 में 238.6 मिलियन से बढ़ गई है। लाइसेंस प्राप्त ड्राइवरों का प्रतिशत विभिन्न आयु समूहों और राज्यों में भिन्न होता है। उदाहरण के लिए, 2019 में, अमेरिकी आबादी का 84.1% के पास ड्राइवर का लाइसेंस था। लाइसेंस प्राप्त ड्राइवरों का उच्चतम प्रतिशत 25 से 49 वर्ष की आयु के लोगों में है, जिसमें 90.1% आबादी के पास ड्राइवर का लाइसेंस है। कैलिफोर्निया में, 27 मिलियन लाइसेंस प्राप्त ड्राइवर थे, जो इसे उच्चतम संख्या में लाइसेंस प्राप्त ड्राइवरों वाला राज्य बनाता है।

pplx-70b-online

2021 में, संयुक्त राज्य अमेरिका में लगभग 233 मिलियन लोगों के पास वैध ड्राइविंग लाइसेंस थे। 2023 तक, अमेरिका में लाइसेंस प्राप्त ड्राइवरों की संख्या 243.4 मिलियन तक पहुंचने का अनुमान है, जिसमें 89% अमेरिकी वयस्क शामिल हैं। यह 2022 में 238.6 मिलियन से वृद्धि का प्रतिनिधित्व करता है।

gpt-3.5

एक AI भाषा मॉडल के रूप में, मेरे पास वास्तविक समय के डेटा तक पहुँच नहीं है। हालाँकि, 2021 तक, यह अनुमान लगाया गया था कि संयुक्त राज्य अमेरिका में लगभग 227 मिलियन लोगों के पास वैध ड्राइवर का लाइसेंस है। कृपया ध्यान दें कि यह संख्या तब से बदल सकती है, इसलिए सबसे सटीक जानकारी के लिए नवीनतम आधिकारिक आँकड़ों का उल्लेख करना हमेशा सबसे अच्छा होता है।

llama2-70b

मेरे पास वास्तविक समय के डेटा तक पहुँच नहीं है, लेकिन मैं संयुक्त राज्य अमेरिका में ड्राइवर का लाइसेंस रखने वाले लोगों की अनुमानित संख्या के बारे में कुछ जानकारी प्रदान कर सकता हूँ। फेडरल हाईवे एडमिनिस्ट्रेशन के अनुसार, 2020 तक संयुक्त राज्य अमेरिका में लगभग 227.8 मिलियन लाइसेंस प्राप्त ड्राइवर थे। इस संख्या में वाणिज्यिक और गैर-वाणिज्यिक दोनों ड्राइवर शामिल हैं। यह ध्यान देने योग्य है कि यह संख्या संभवतः कम करके आंकी गई है, क्योंकि इसमें उन व्यक्तियों का हिसाब नहीं है जिनके पास ड्राइवर का लाइसेंस हो सकता है लेकिन वे नियमित रूप से या बिल्कुल भी गाड़ी नहीं चलाते हैं। इसके अतिरिक्त, इस संख्या में वे व्यक्ति शामिल नहीं हैं जो ड्राइवर के लाइसेंस के लिए पात्र नहीं हैं, जैसे कि 16 वर्ष से कम आयु के या कुछ विकलांगता वाले लोग। यह भी ध्यान रखना महत्वपूर्ण है कि लाइसेंस प्राप्त ड्राइवरों की संख्या राज्य के अनुसार भिन्न हो सकती है, कुछ राज्यों में दूसरों की तुलना में लाइसेंस प्राप्त ड्राइवरों का प्रतिशत अधिक है।

कुल मिलाकर, मूल्यांकन परिणाम प्रदर्शित करते हैं कि हमारे PPLX मॉडल Perplexity-संबंधित उपयोग के मामलों में gpt-3.5 और llama2-70b से मेल खा सकते हैं और उससे बेहतर प्रदर्शन कर सकते हैं, विशेष रूप से सटीक और अद्यतित प्रतिक्रियाएँ प्रदान करने के लिए।

Perplexity के ऑनलाइन मॉडल तक पहुँचना

हमें यह घोषणा करते हुए बहुत खुशी हो रही है कि pplx-api बीटा से हटकर सामान्य सार्वजनिक रिलीज़ में जा रहा है! यह पहली बार है जब हमारे pplx-7b-online और pplx-70b-online मॉडल pplx-api के माध्यम से सुलभ हैं। इसके अतिरिक्त, हमारे pplx-7b-chat और pplx-70b-chat मॉडल अल्फा से बाहर हो गए हैं, और अब हमारी सामान्य रिलीज़ के साथ सुलभ हैं।

इसके साथ, हम एक नई उपयोग-आधारित मूल्य निर्धारण संरचना पेश कर रहे हैं। हम अपने उपयोगकर्ताओं के लिए हमारे अत्याधुनिक इंफ्रास्ट्रक्चर का उपयोग करने के लिए उत्साहित हैं, जो शानदार तेज़ अनुमान प्रदान करने के लिए NVIDIA H100s का उपयोग करता है। Pro उपयोगकर्ताओं को $5 का मासिक pplx-api क्रेडिट प्राप्त होगा। अन्य सभी उपयोगकर्ताओं के लिए, मूल्य निर्धारण उपयोग के आधार पर निर्धारित किया जाएगा। Pro उपयोगकर्ता के रूप में साइन अप करने के लिए, यहाँ क्लिक करें। व्यावसायिक पूछताछ के लिए api@perplexity.ai पर संपर्क करें।

PPLX-ऑनलाइन llm डैशबोर्ड

अतिरिक्त संसाधन:

  • pplx-api के साथ शुरुआत करें यहाँ
  • Perplexity Labs के साथ हमारे ऑनलाइन मॉडलों को मुफ्त में आज़माएँ।
  • pplx-api प्रलेखन के माध्यम से हमारे API के बारे में अधिक जानें।
  • सर्वश्रेष्ठ उत्तर इंजन बनाने वाली उच्च-प्रभाव, उच्च-वेग वाली टीम में काम करने के इच्छुक हैं? हमसे जुड़ें!
  • हमारे बढ़ते Discord समुदाय से जुड़ें!

योगदानकर्ता:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats