PPLX ऑनलाईन एलएलएम ची ओळख
अशा प्रकारची पहिलीच ऑनलाईन एलएलएम एपीआय

अशा प्रकारची पहिलीच ऑनलाईन एलएलएम (LLM) एपीआय (API).
आम्हाला दोन नवीन पीपीएलएक्स (PPLX) मॉडेल्स शेअर करताना आनंद होत आहे: pplx-7b-online आणि pplx-70b-online! आमची ऑनलाईन मॉडेल्स उपयुक्त, अद्ययावत आणि तथ्यपूर्ण प्रतिसाद देण्यावर केंद्रित आहेत आणि pplx-api द्वारे सार्वजनिकरीत्या उपलब्ध आहेत, ज्यामुळे ही अशा प्रकारची पहिलीच एपीआय (API) ठरते. pplx-7b-online आणि pplx-70b-online हे आमचे एलएलएम (LLM) प्लेग्राउंड असलेल्या Perplexity Labs द्वारे देखील उपलब्ध आहेत.
एलएलएम (LLMs) ने आपण माहिती शोधण्याच्या पद्धतीत बदल केला आहे. तथापि, आजच्या बहुतेक एलएलएम (LLMs) मध्ये दोन मर्यादा आहेत:
अद्ययावतपणा: एलएलएम (LLMs) ला सहसा अद्ययावत माहिती शेअर करताना अडचणी येतात.
भ्रम (Hallucinations): एलएलएम (LLMs)चुकीची विधाने देखील देऊ शकतात.
आमचे pplx-7b-online आणि pplx-70b-online मॉडेल्स प्रतिसादांमध्ये उपयुक्त, तथ्यपूर्ण आणि अद्ययावत माहिती अतिरिक्तरीत्या प्रदान करून सध्याच्या मर्यादा दूर करतात.
पीपीएलएक्स (PPLX) ऑनलाईन एलएलएम (LLMs)
आमचे एलएलएम (LLMs), pplx-7b-online आणि pplx-70b-online, हे ऑनलाइन एलएलएम (online LLMs) आहेत कारण ते इंटरनेटवरील ज्ञानाचा वापर करू शकतात आणि त्यामुळे प्रतिसाद तयार करताना सर्वात अद्ययावत माहितीचा लाभ घेऊ शकतात. आमच्या एलएलएम (LLMs) ला वेबवरील ज्ञान प्रदान करून, आमचे मॉडेल्स वेळेच्या संदर्भातील प्रश्नांना अचूक प्रतिसाद देतात, ज्यामुळे त्यांच्या प्रशिक्षण कॉर्पसपलीकडील ज्ञान खुले होते. याचा अर्थ Perplexity चे ऑनलाईन एलएलएम (LLMs) “काल रात्री वॉरियर्सच्या सामन्याचा स्कोअर किती होता?” सारख्या प्रश्नांची उत्तरे देऊ शकतात, जे ऑफलाईन मॉडेल्ससाठी आव्हानात्मक असतात. उच्च पातळीवर, आमचे ऑनलाईन एलएलएम (LLM) कसे कार्य करते ते येथे आहे:
- ओपन सोर्स मॉडेल्सचा लाभ घ्या: आमची PPLX मॉडेल्स
mistral-7bआणिllama2-70bबेस मॉडेल्सवर आधारित आहेत. - इन-हाऊस शोध तंत्रज्ञान: आमची इन-हाऊस शोध, इंडेक्सिंग आणि क्रॉलिंग इन्फ्रास्ट्रक्चर आम्हाला एलएलएम (LLMs) ला सर्वात संबंधित, अद्ययावत आणि मूल्यवान माहितीसह सुसज्ज करण्याची परवानगी देते. आमचा शोध इंडेक्स मोठा आहे, नियमित कालावधीत अद्ययावत केला जातो आणि उच्च दर्जाची, एसईओ (SEO) न केलेली сайts प्राधान्याने दिली जातील याची खात्री करण्यासाठी अत्याधुनिक रँकिंग अल्गोरिदम वापरतो. वेबसाईटचे उतारे, ज्यांना आपण “स्निपेट्स” म्हणतो, सर्वात अद्ययावत माहितीसह प्रतिसाद सक्षम करण्यासाठी आमच्या
pplx-onlineमॉडेल्सना प्रदान केले जातात. - फाईन-ट्यूनिंग: आमची PPLX मॉडेल्स त्यांच्या प्रतिसादांची माहिती देण्यासाठी स्निपेट्सचा प्रभावीपणे वापर करण्यासाठी फाईन-ट्यून करण्यात आली आहेत. आमच्या इन-हाऊस डेटा कंत्राटदारांचा वापर करून, उपयुक्तता, तथ्यक्षमता आणि ताजेपणा यांसारख्या विविध अक्षांवर उच्च कार्यक्षमता प्राप्त करण्यासाठी आम्ही काळजीपूर्वक उच्च दर्जाचे, वैविध्यपूर्ण आणि मोठे प्रशिक्षण संच तयार करतो. कार्यक्षमता सतत सुधारण्यासाठी आमची मॉडेल्स नियमितपणे फाईन-ट्यून केली जातात.
Perplexity च्या ऑनलाईन एलएलएम (LLMs) चे मूल्यांकन करणे
Perplexity चे ध्येय जगातील सर्वोत्तम उत्तर देणारे इंजिन तयार करणे हे आहे - ज्यावर लोक त्यांच्या ज्ञानाचा शोध घेण्यासाठी आणि विस्तार करण्यासाठी विश्वास ठेवतात. हे साध्य करण्यासाठी, आम्ही उपयुक्त, तथ्यपूर्ण आणि अद्ययावत माहिती प्रदान करण्यावर गाркоपराने केंद्रित आहोत. या अक्षांवर आमच्या एलएलएम (LLMs) च्या कार्यक्षमतेचे मूल्यांकन करण्यासाठी, आम्ही उत्तर देणाऱ्या इंजिनांसाठी आव्हानात्मक परंतु वास्तववादी युझ केसेस प्रतिबिंबित करण्यासाठी मूल्यांकन डेटासेट तयार केले आहेत. प्रत्येक मूल्यांकन संचातील प्रत्येक क्वेरीसाठी, कंत्राटदारांना दोन मॉडेल प्रतिसाद दिले गेले आणि खालील निकषांसाठी कोणते मॉडेल चांगले कार्य करते ते निवडण्याच्या सूचना देण्यात आल्या:
- उपयुक्तता: कोणता प्रतिसाद क्वेरीचे उत्तर देतो आणि निर्दिष्ट केलेल्या सूचनांचे अधिक चांगले पालन करतो?
- तथ्यता: अतिशय अचूक किंवा विशिष्ट ज्ञानाची आवश्यकता असलेल्या प्रश्नांसाठीही, भ्रमांशिवाय कोणते प्रतिसाद अधिक अचूक उत्तरे देतात?
- ताजेपणा ( FreshLLMs द्वारे प्रेरित): कोणत्या प्रतिसादात अधिक अद्ययावत माहिती आहे? एखादे मॉडेल “ताज्या” माहितीसह प्रश्नांची उत्तरे देण्यास सक्षम असल्यास ते या निकषात उत्कृष्ट ठरते.
वरील तीन निकषांवतिरिक्त, मॉडेलच्या प्रतिसादांचे समग्रपणे मूल्यांकन देखील केले गेले. प्रतिसादांचे समग्रपणे मूल्यांकन करण्यासाठी, मूल्यांकनकर्त्यांना क्वेरीमध्ये मदत करणाऱ्या मानवी सहाय्यकाकडून त्यांना जो प्रतिसाद मिळावासा वाटेल तो प्रतिसाद निवडण्यास सांगण्यात आले.
मूल्यांकन संच तयार करणे
या मूल्यांकनासाठी, आम्ही उपयुक्तता, तथ्यक्षमता आणि ताजेपणा प्रभावीपणे मूल्यांकन करण्याच्या ध्येयासह विविध प्रॉम्प्ट्सचा एक संच काळजीपूर्वक तयार केला आहे. डेटाची गुणवत्ता आणि सुसंगतता यावर उच्च पातळीवरील नियंत्रण सुनिश्चित करून, प्रत्येक प्रॉम्प्ट व्यक्तिचलितपणे निवडला गेला. डेटासेट उत्तर इंजिन प्रॉम्प्ट्सच्या विस्तृत श्रेणीमध्ये पसरलेला आहे आणि Perplexity ने कशात उत्कृष्ट कामगिरी करावी असे आम्हाला वाटते त्याचे सर्वसमावेशक विहंगम दृश्य समाविष्ट करते. उच्च सिग्नल असण्यासाठी आमच्या मॉडेल कार्यप्रदर्शन मूल्यांकनांसाठी हे महत्त्वपूर्ण आहे.
तीन मूल्यांकन संचांपैकी प्रत्येक संचामध्ये 50 प्रॉम्प्ट्स आहेत. या संचांमधील काही उदाहरणांमध्ये हे समाविष्ट आहे:
- उपयुक्तता: विश्वचषक अंतिम फेरीत खेळलेल्या सर्व यूएसए (USA) फुटबॉल खेळाडूंची सारणी तयार करा आणि त्यांच्या सांख्यिकी जसे की गोल, असिस्ट इत्यादींसाठी स्तंभ बनवा.
- तथ्यता: AISI 1015 आणि AISI 1040 स्टील्सच्या कडकपणाचे वर्णन करा.
- अद्ययावतता: 2023 मध्ये कोणत्या स्वायत्त कार कंपनीला सॅन फ्रान्सिस्कोमधून प्रतिबंधित करण्यात आले होते?
मॉडेल प्रतिसाद तयार करणे
आमच्याकडे चार मॉडेल्सचे मूल्यांकन केले:
pplx-7b-online: Perplexity चे मॉडेल, ज्यामध्ये इंटरनेटवरील माहितीचा प्रवेश समाविष्ट आहे. हे मॉडेल mistral-7b वापरून फाईन-ट्यून केले गेले होते.
pplx-70b-online: Perplexity चे मॉडेल, ज्यामध्ये इंटरनेटवरील माहितीचा प्रवेश समाविष्ट आहे. हे मॉडेल llama2-70b वापरून फाईन-ट्यून केले गेले होते.
gpt-3.5-turbo-1106: OpenAI चे मॉडेल, एपीआय (API) द्वारे प्रवेश केलेले आणि कोणत्याही अतिरिक्त संवर्धनाशिवाय. लक्षात घ्या की आम्ही नवीनतम gpt-3.5 मॉडेल वापरून हे मूल्यांकन केले आहे.
llama2-70b-chat: Meta AI चे मॉडेल, आमच्या pplx-api द्वारे प्रवेश केलेले आणि कोणत्याही अतिरिक्त संवर्धनाशिवाय.
प्रत्येक प्रॉम्प्टसाठी, pplx-7b-online आणि pplx-70b-online मॉडेल्सना समान शोध परिणाम आणि स्निपेट्स प्रदान केले गेले. सर्व प्रतिसाद समान हायपरपॅरामीटर्स आणि सिस्टम प्रॉम्प्ट वापरून तयार केले गेले.
सिस्टम प्रॉम्प्ट
Current date: Monday, November 20, 2023.मानवी मूल्यांकनासह मॉडेल प्रतिसादांचे रँकिंग करणे
प्रत्येक जोडणीच्या तुलनेसाठी, आमच्या इन-हाऊस कंत्राटदारांना प्रॉम्प्ट स्वतः, मूल्यांकन निकष (उदा. उपयुक्तता, तथ्यता किंवा ताजेपणा), आणि बाजूला दाखवलेले मॉडेल प्रतिसाद प्रदान केले गेले. प्रत्येक वळीवर प्रतिसादांची क्रमवारी यादृच्छिक केली गेली, आणि स्त्रोत मॉडेल्स मूल्यांकनकर्त्यासमोर उघड केले गेले नाहीत. मूल्यांकनकर्त्यांना त्यांचा समग्रपणे पसंतीचा असलेला प्रतिसाद निवडण्याचे तसेच विशिष्ट मूल्यांकन निकषावर कोणते चांगले कार्य करते हे निवडण्याचे निर्देश देण्यात आले, ज्यामध्ये दोन्हीसाठी टाय (ties) ला परवानगी होती. शेवटी, मूल्यांकनकर्त्यांना प्रतिसादांच्या अचूकतेची पडताळणी करण्यासाठी इंटरनेट शोध वापरण्याची परवानगी होती. हे मूल्यांकन करण्यासाठी आम्ही आमचे स्वतःचे इन-हाऊस पसंती रँकिंग साधन तयार केले.
मूल्यांकन परिणाम
प्रत्येक मॉडेलसाठी प्रति-कार्य एलो (Elo) स्कोअरची गणना करण्यासाठी आम्ही मानवी मूल्यांकनावरून गोळा केलेल्या जोडणीच्या पसंतीच्या क्रमवारीचा वापर करतो. खेळाडूंच्या सापेक्ष कार्यक्षमतेचे मोजमाप करण्यासाठी स्पर्धा-शैलीतील स्पर्धांमध्ये खेळाडूंच्या लोकसंख्येला रँक करण्यासाठी एलो (Elo) स्कोअरचा सामान्यतः वापर केला जातो. मोठ्या भाषा मॉडेल्सवर लागू केल्यावर, हे स्कोअर मानवी मूल्यांकनकर्ता एका मॉडेलच्या आउटपुटला दुसऱ्या मॉडेलपेक्षा किती प्राधान्य देईल याची शक्यता भाकीत करतात.
खेळाडूंच्या क्षमतेमधील बदलांचा हिशोब करण्यासाठी एलो (Elo) स्कोअर सामान्यतः तुलनेच्या अनुक्रमासाठी मोजले जात असताना, आमचे ध्येय अशा मॉडेल्सच्या कार्यक्षमतेचे प्रमाण ठरवणे आहे ज्यांची क्षमता बदलू शकत नाही. त्यानुसार, आम्ही Duan et al मध्ये वर्णित आणि lmsys द्वारे त्यांच्या Chatbot Arena साठी वापरलेली बूटस्ट्रॅप एलो (Bootstrap Elo) पद्धती स्वीकारतो, ज्यामध्ये तुलनेच्या अनेक यादृच्छिक पर्म्युटेशन्ससाठी एलो (Elo) स्कोअरची गणना करणे समाविष्ट आहे. आमच्या गणनेसाठी, आम्ही 5000 पर्म्युटेशन्सवर एलो (Elo) स्कोअर मोजले आणि 95% आत्मविश्वास अंतराची गणना करण्यासाठी या एलो (Elo) स्कोअरच्या वितरणाचा वापर केला.
आकृती 1 मध्ये दर्शविलेले परिणाम दर्शवतात की आमची PPLX मॉडेल्स Perplexity-संबंधित युझ केसेसवर gpt-3.5 च्या कार्यक्षमतेशी जुळवून घेऊ शकतात आणि त्याहून सरळ ठरू शकतात. विशेषतः, pplx-7b-online आणि pplx-70b-online मॉडेल प्रतिसाद त्यांच्या अचूक आणि अद्ययावत उत्तरांसाठी मानवी मूल्यांकनकर्त्यांद्वारे gpt-3.5 आणि llama2-70b मॉडेल प्रतिसादांपेक्षा प्राधान्य दिले जातात.
pplx-7b-online आणि pplx-70b-online ताजेपणा, तथ्यता आणि समग्र निकषांवर gpt-3.5 आणि llama2-70b पेक्षा चांगले कार्य करतात.

आम्ही मूल्यांकनातून जोडणीच्या जिंकण्याच्या दरांची देखील गणना केली. आकृती 2 मध्ये दर्शविलेले परिणाम कदाचित आश्चर्यकारक नाहीत, ताजेपणा आणि तथ्यता वर pplx ऑनलाईन मॉडेलचे प्रतिसाद इतरांपेक्षा पसंतीस उतरतात.

आमच्या ताजेपणा मूल्यांकन डेटासेटचे एक उदाहरण येथे आहे.
प्रॉम्प्ट: यूएसए (USA) मध्ये किती लोकांकडे ड्रायव्हिंग लायन्स आहे?
pplx-7b-online
2023 मध्ये, युनायटेड स्टेट्समध्ये अंदाजे 243.4 दशलक्ष परवानाधारक चालक आहेत, ज्यामध्ये यूएस प्रौढांच्या 89% समाविष्ट आहेत. ही संख्या 2022 मधील 238.6 दशलक्षवरून वाढली आहे. परवानाधारक चालकांची टक्केवारी वेगवेगळ्या वयोगटात आणि राज्यांमध्ये बदलते. उदाहरणार्थ, 2019 मध्ये, यूएस लोकसंख्येच्या 84.1% लोकांकडे ड्रायव्हर लायन्स होते. परवानाधारक चालकांची सर्वाधिक टक्केवारी 25 ते 49 वयोगटातील लोकांमध्ये आहे, ज्यांच्या लोकसंख्येच्या 90.1% लोकांकडे ड्रायव्हर लायन्स आहे. कॅलिफोर्नियामध्ये, 27 दशलक्ष परवानाधारक चालक होते, ज्यामुळे ते सर्वाधिक परवानाधारक चालक असलेले राज्य बनले.
pplx-70b-online
2021 मध्ये, युनायटेड स्टेट्समध्ये सुमारे 233 दशलक्ष लोकांकडे वैध ड्रायव्हिंग लायन्स होते. 2023 पर्यंत, यूएस मधील परवानाधारक चालकांची संख्या 243.4 दशलक्ष पर्यंत पोहोचण्याचा अंदाज आहे, ज्यामध्ये यूएस प्रौढांच्या 89% समाविष्ट आहेत. हे 2022 मधील 238.6 दशलक्ष वरून वाढ दर्शवते.
gpt-3.5
एक एआय (AI) भाषा मॉडेल म्हणून, माझ्याकडे रिअल-टाइम डेटाचा प्रवेश नाही. तथापि, 2021 पर्यंत, असा अंदाज होता की युनायटेड स्टेट्समध्ये सुमारे 227 दशलक्ष लोकांकडे वैध ड्रायव्हर लायन्स होता. कृपया लक्षात ठेवा की त्यानंतर ही संख्या बदलली असेल, त्यामुळे सर्वात अचूक माहितीसाठी नेहमी नवीनतम अधिकृत आकडेवारीचा संदर्भ घेणे सर्वोत्तम आहे.
llama2-70b
माझ्याकडे रिअल-टाइम डेटाचा प्रवेश नाही, परंतु मी युनायटेड स्टेट्समध्ये ड्रायव्हर लायन्स असलेल्या लोकांच्या अंदाजे संख्येबद्दल काही माहिती प्रदान करू शकतो. फेडरल हायवे प्रशासनानुसार, 2020 पर्यंत युनायटेड स्टेट्समध्ये अंदाजे 227.8 दशलक्ष परवानाधारक चालक होते. या संख्येत व्यावसायिक आणि गैर-व्यावसायिक दोन्ही चालक समाविष्ट आहेत. हे लक्षात घेण्यासारखे आहे की ही संख्या बहुधा कमी लेखली गेली आहे, कारण त्यात अशा व्यक्तींचा समावेश नाही ज्यांच्याकडे ड्रायव्हर लायन्स असू शकतो परंतु जे नियमितपणे किंवा अजिबात ड्राइव्ह करत नाहीत. याव्यतिरिक्त, या संख्येत अशा व्यक्तींचा समावेश नाही जे ड्रायव्हर लायन्ससाठी पात्र नाहीत, जसे की जे 16 वर्षांपेक्षा कमी वयाचे आहेत किंवा ज्यांना काही अपंगत्व आहे. हे देखील लक्षात घेणे महत्त्वाचे आहे की परवानाधारक चालकांची संख्या राज्यानुसार बदलू शकते, काही राज्यांमध्ये इतरांपेक्षा परवानाधारक चालकांची उच्च टक्केवारी असते.
एकंदरीत, मूल्यांकन परिणाम दर्शवतात की आमची PPLX मॉडेल्स अचूक आणि अद्ययावत प्रतिसाद प्रदान करण्यासाठी, विशेषतः Perplexity-संबंधित युझ केसेसवर gpt-3.5 आणि llama2-70b शी जुळवून घेऊ शकतात आणि त्याहून सरळ ठरू शकतात.
Perplexity च्या ऑनलाईन मॉडेल्समध्ये प्रवेश करणे
pplx-api बीटा टप्प्यातून बाहेर पडून सामान्य सार्वजनिक रिलीजमध्ये प्रवेश करत आहे हे जाहीर करताना आम्हाला अत्यंत आनंद होत आहे! प्रथमच आमचे pplx-7b-online आणि pplx-70b-online मॉडेल्स pplx-api द्वारे प्रवेशयोग्य आहेत. याव्यतिरिक्त, आमचे pplx-7b-chat आणि pplx-70b-chat मॉडेल्स अल्फा मधून बाहेर आले आहेत आणि आता आमच्या सामान्य रिलीजसह प्रवेशयोग्य आहेत.
या सह, आम्ही वापरावर आधारित नवीन किंमत रचना सादर करत आहोत. जलद इन्फरन्स प्रदान करण्यासाठी NVIDIA H100s वापरणाऱ्या आमच्या अत्याधुनिक इन्फ्रास्ट्रक्चरचा वापर आमच्या वापरकर्त्यांनी करावा यासाठी आम्ही उत्सुक आहोत. प्रो (Pro) वापरकर्त्यांना दरमहा आवर्ती $5 चे मासिक pplx-api क्रेडिट्स मिळतील. इतर सर्व वापरकर्त्यांसाठी, किंमत वापराच्या आधारावर ठरवली जाईल. प्रो (Pro) वापरकर्ता म्हणून साइन अप करण्यासाठी, येथे क्लिक करा. व्यावसायिक चौकशीसाठी api@perplexity.ai वर संपर्क साधा.

अतिरिक्त संसाधने:
- pplx-api सह सुरुवात करा येथे.
- Perplexity Labs सह आमची ऑनलाईन मॉडेल्स विनामूल्य वापरून पहा.
- pplx-api दस्तऐवजीकरण द्वारे आमच्या एपीआय (API) बद्दल अधिक जाणून घ्या.
- सर्वोत्तम उत्तर देणारे इंजिन तयार करणार्या उच्च-प्रभाव, उच्च-गती असलेल्या टीमवर काम करण्यास उत्सुक आहात? आमच्यात सामील व्हा!
- आमच्या वाढत्या Discord कम्युनिटीमध्ये सामील व्हा!
योगदानकर्ते:
लॉरेन यांग, केव्हिन हू, आरश हेदरादी, ग्रेडी वांग, दिमित्री पेर्वुखिन, निखिल थोटा, अलेक्झांडर यारॅट्स, मॅक्स मोरोज़ोव, डेनिस यारॅट्स