PPLX онлайн LLM модельдерін таныстыру

Өз түріндегі алғашқы Онлайн LLM API

Perplexity releases first "Live" LLM

Өз түріндегі алғашқы Онлайн LLM API.

Біз екі жаңа PPLX моделін ұсынып жатқанымызға қуаныштымыз: pplx-7b-online және pplx-70b-online! Біздің онлайн модельдеріміз пайдалы, өзекті және шынайы жауаптарды беруге бағытталған және pplx-api арқылы көпшілікке қолжетімді, бұл оны өз түріндегі алғашқы API етеді. Сондай-ақ pplx-7b-online және pplx-70b-online модельдеріне біздің LLM ортамыз Perplexity Labs арқылы да қол жеткізуге болады.

LLM модельдері ақпаратты табу жолымызды өзгертті. Дегенмен, бүгінгі таңда көптеген LLM модельдерінде екі шектеу бар:

Өзектілік: LLM модельдері жиі заманауи ақпаратты бөлісу кезінде қиналады.

Галлюцинациялар: LLM модельдері сондай-ақ қате мәлімдемелер шығаруы мүмкін.

Біздің pplx-7b-online және pplx-70b-online модельдеріміз жауаптарында пайдалы, нақты және заманауи ақпаратты қосымша беру арқылы ағымдағы шектеулерді шешеді.

PPLX Онлайн LLM модельдері

Біздің pplx-7b-online және pplx-70b-online LLM модельдеріміз онлайн LLM модельдері болып табылады, өйткені олар интернеттен алынған білімді пайдалана алады және осылайша жауап құру кезінде ең заманауи ақпаратты тиімді пайдалана алады. LLM модельдерімізді веб-деректермен қамтамасыз ету арқылы біздің модельдер уақытқа тәуелді сұрауларға дәл жауап беріп, оларды оқыту жиынтығынан тыс білімді ашады. Бұл Perplexity онлайн LLM модельдері офлайн модельдер үшін қиын болатын “Кешегі «Уорриорз» ойынының есебі қандай болды?” сияқты сұрауларға жауап бере алатынын білдіреді. Жалпы алғанда, біздің онлайн LLM моделіміз мынадай жұмыс істейді:

  1. Ашық бастапқы кодты модельдерді пайдалану: біздің PPLX модельдеріміз mistral-7b және llama2-70b базалық модельдеріне негізделген.
  2. Меншікті іздеу технологиясы: біздің меншікті іздеу, индекстеу және сканерлеу инфрақұрылымымыз LLM модельдерін ең өзекті, заманауи және құнды ақпаратпен толықтыруға мүмкіндік береді. Біздің іздеу индексіміз үлкен, тұйінді түрде жаңартылып отырады және жоғары сапалы, SEO оңтайландырылмаған сайттардың басымдыққа ие болуын қамтамасыз ету үшін күрделі рейтинг алгоритмдерін пайдаланады. Ең заманауи ақпаратпен жауап беруге мүмкіндік беру үшін «үзінділер» (snippets) деп аталатын веб-сайт үзінділері біздің pplx-online модельдерімізге беріледі.
  3. Дәл баптау (Fine-tuning): біздің PPLX модельдеріміз жауаптарын жеткізу үшін үзінділерді тиімді пайдалану мақсатында дәл бапталған. Пайдалылық, нақтылық және өзектілік сияқты әртүрлі бағыттарда жоғары өнімділікке қол жеткізу үшін біз ішкі деректер мердігерлерімізді пайдалана отырып, жоғары сапалы, әртүрлі және үлкен оқыту жиындарын мұқият жасаймыз. Модельдеріміздің өнімділігін үздіксіз жақсарту үшін олар үнемі дәл баптанып отырады.

Perplexity компаниясының онлайн LLM модельдерін бағалау

Perplexity миссиясы – адамдар білімді табу және кеңейту үшін сене алатын әлемдегі ең жақсы жауаптар қозғалтқышын (answer engine) құру. Бұған қол жеткізу үшін біз пайдалы, шынайы және заманауи ақпаратты беруге ерекше назар аударамыз. LLM модельдеріміздің өнімділігін осы бағыттар бойынша өлшеу үшін біз жауаптар қозғалтқыштары үшін күрделі, бірақ шынайы қолдану жағдайларын көрсететін бағалау жиындарын құрдық. Әрбір бағалау жиынындағы әрбір сұрау үшін мердігерлерге екі модельдің жауабы берілді және келесі өлшем шарттары бойынша жақсырақ жұмыс істеген жауапты таңдау тапсырылды:

  • Пайдалылық: қай жауап сұрауға жақсырақ жауап береді және көрсетілген нұсқауларды жақсырақ орындайды?
  • Нақтылық: қай жауап тіпті өте дәл немесе арнайы білімді қажет ететін сұрақтардың өзінде галлюцинациясыз дәлірек жауаптар береді?
  • Өзектілік (FreshLLMs шабыттандырған): қай жауапта көбірек заманауи ақпарат бар? Егер модель «жаңа» ақпаратпен сұрауларға жауап бере алса, ол осы өлшем шарттары бойынша ерекшеленеді.

Жоғарыдағы үш өлшем шарттарына қоса, модель жауаптары сондай-ақ тұтастай бағаланды. Жауаптарды тұтастай бағалау үшін бағалаушылардан сұрау бойынша көмектесіп жатқан адам көмекшісінен алғысы келетін жауапты таңдау сұралды.

Бағалау жиынын құрастыру

Бұл бағалау үшін біз пайдалылықты, нақтылықты және өзектілікті тиімді бағалау мақсатында әртүрлі шақырулар жиынын мұқият құрастырдық. Әрбір шақыру қолмен таңдалып, деректердің сапасы мен өзектілігін жоғары деңгейде бақылау қамтамасыз етілді. Деректер жиыны жауаптар қозғалтқышы шақыруларының кең ауқымын қамтиды және Perplexity қызметінің ерекшеленуін қалайтын тұстарымыздың жан-жақты шолуын қамтиды. Бұл модель өнімділігін бағалаудың жоғары деңгейге ие болуы үшін біз үшін өте маңызды.

Үш бағалау жиынының әрқайсысы 50 шақыруды қамтиды. Осы жиындардың кейбір мысалдары мыналарды қамтиды:

  • Пайдалылық: Әлем чемпионатының финалдарында ойнаған АҚШ-тың барлық футболшыларының кестесін жасаңыз және олардың голдар, нәтижелі пастар сияқты статистикасы үшін бағандар жасаңыз.
  • Нақтылық: AISI 1015 және AISI 1040 болаттарының беріктігін түсіндіріңіз.
  • Заманауилық: Қай автономды көлік компаниясына 2023 жылы Сан-Францискода тыйым салынды?

Модель жауаптарын жасау

Біз төрт модельді бағаладық:

pplx-7b-online: Интернеттегі ақпаратқа қол жеткізуді қамтитын Perplexity моделі. Бұл модель mistral-7b көмегімен дәл бапталған.

pplx-70b-online: Интернеттегі ақпаратқа қол жеткізуді қамтитын Perplexity моделі. Бұл модель llama2-70b көмегімен дәл бапталған.

gpt-3.5-turbo-1106: API арқылы қол жеткізілетін және қосымша толықтырулары жоқ OpenAI моделі. Бұл бағалауды ең соңғы gpt-3.5 моделін қолдана отырып жүргізгенімізді ескеріңіз.

llama2-70b-chat: pplx-api арқылы қол жеткізілетін және ешқандай қосымша толықтырулары жоқ Meta AI моделі.

Әрбір шақыру үшін pplx-7b-online және pplx-70b-online модельдеріне бірдей іздеу нәтижелері мен үзінділері берілді. Барлық жауаптар бірдей гиперпараметрлер мен жүйелік шақыру арқылы жасалды.

Жүйелік шақыру

plaintext
Current date: Monday, November 20, 2023.

Адам тарапынан бағалау арқылы модель жауаптарының рейтингін жасау

Әрбір жұптық салыстыру үшін біздің ішкі мердігерлерімізге шақырудың өзі, бағалау өлшем шарттары (яғни, пайдалылық, нақтылық немесе өзектілік) және қатар қойылған модель жауаптары берілді. Жауаптардың реті әр қадам сайын кездейсоқ түрде өзгертіліп отырды және бастапқы модельдер бағалаушыға көрсетілмеді. Бағалаушыларға өздері тұтастай қалайтын жауапты, сондай-ақ екі жауап үшін де тең нәтижеге рұқсат етіліп, нақты бағалау өлшем шарттары бойынша қайсысы жақсырақ жұмыс істейтінін таңдау тапсырылды. Соңында бағалаушыларға жауаптардың дәлдігін тексеру үшін интернеттен іздеуді пайдалануға рұқсат етілді. Осы бағалауды жүргізу үшін біз өзіміздің меншікті артықшылық рейтинг құралын жасадық.

Бағалау нәтижелері

Біз әр модель үшін тапсырма бойынша Elo ұпайларын есептеу үшін адам тарапынан бағалаудан жиналған жұптық артықшылық рейтингтерін пайдаланамыз. Elo ұпайлары ойыншылардың салыстырмалы өнімділігін өлшеу үшін турнирлік жарыстарда ойыншылардың популяциясының рейтингін жасау үшін жиі қолданылады. Үлкен тілдік модельдерге қолданылған кезде бұл ұпайлар адам бағалаушысының бір модельдің нәтижесін басқасына қарағанда қаншалықты мақұлдауы мүмкін екендігі туралы болжам береді.

Elo ұпайлары әдетте ойыншылардың қабілеттеріндегі өзгерістерді ескеру үшін салыстырулар тізбегі үшін есептелсе де, біз қабілеттері өзгере алмайтын модельдердің өнімділігін сандық түрде көрсетуді мақсат етеміз. Сәйкесінше, біз Duan және басқалар сипаттаған және сондай-ақ lmsys өздерінің Chatbot Arena үшін пайдаланған Bootstrap Elo әдістемесін қабылдаймыз, бұл салыстырулардың көптеген кездейсоқ ауысулары үшін Elo ұпайларын есептеуді қамтиды. Біздің есептеулеріміз үшін біз 5000 ауысу бойынша Elo ұпайларын есептедік және 95% сенімділік интервалдарын есептеу үшін осы Elo ұпайларының таралуын пайдаландық.

1-суретте көрсетілген нәтижелер біздің PPLX модельдеріміз Perplexity-ге қатысты қолдану жағдайларында gpt-3.5 өнімділігіне сәйкес келе алатынын және тіпті асып түсетінін көрсетеді. Атап айтқанда, pplx-7b-online және pplx-70b-online модельдерінің жауаптарын адам бағалаушылар дәл және заманауи жауаптары үшін gpt-3.5 және llama2-70b модельдерінің жауаптарына қарағанда артық көреді.

pplx-7b-online және pplx-70b-online өзектілік, нақтылық және тұтас өлшем шарттары бойынша gpt-3.5 және llama2-70b қарағанда жақсырақ жұмыс істейді.

1-сурет. Төрт түрлі бағалау жиыны бойынша pplx-7b (-online), pplx-70b (-online), llama2-70b және gpt-3.5 үшін есептелген Elo ұпайлары мен 95% сенімділік интервалдары. Мысалы, өзектілік бағытында pplx-7b және pplx-70b модельдері gpt-3.5 және llama2-70b модельдеріне қарағанда жақсырақ жұмыс істейді, тиісінше 1100.6 және 1099.6 қарсы 879.3 және 920.3 болатын есептелген Elo ұпайына ие.

Біз сондай-ақ бағалау нәтижелерінен жұптық жеңіс көрсеткіштерін есептедік. 2-суретте көрсетілген нәтижелер, мүмкін таңқаларлық емес, pplx онлайн моделінің жауаптары өзектілік және нақтылық бойынша басқалардың жауаптарынан артық көрінетінін көрсетеді.

2-сурет. Горизонталь осьтегі модельдерге қарсы вертикаль осьтегі модельдердің жеңіс көрсеткіштері. Мысалы, pplx-70b (-online) жауаптары сұраулардың 64% бойынша gpt-3.5 жауаптарына қарағанда тұтастай жоғары деп бағаланды және gpt-3.5 жауаптары сұраулардың 24% бойынша pplx-70b (-online) жауаптарына қарағанда тұтастай жоғары деп бағаланды.

Міне, біздің өзектілікті бағалау деректер жиынынан алынған мысал.

Шақыру: АҚШ-та қанша адамда жүргізуші куәлігі бар?

pplx-7b-online

2023 жылы Америка Құрама Штаттарында болжам бойынша 243,4 миллион лицензияланған жүргізуші бар, бұл АҚШ ересектерінің 89%-ын қамтиды. Бұл сан 2022 жылғы 238,6 миллионнан өсті. Лицензияланған жүргізушілердің пайызы әртүрлі жас топтары мен штаттар бойынша өзгереді. Мысалы, 2019 жылы АҚШ халқының 84,1%-ында жүргізуші куәлігі болған. Лицензияланған жүргізушілердің ең жоғары пайызы 25 пен 49 жас аралығындағылардың үлесіне тиесілі, халықтың 90,1%-ында жүргізуші куәлігі бар. Калифорнияда 27 миллион лицензияланған жүргізуші болды, бұл оны лицензияланған жүргізушілердің ең көп саны бар штатқа айналдырады.

pplx-70b-online

2021 жылы Америка Құрама Штаттарында шамамен 233 миллион адамның жарамды жүргізуші куәлігі болды. 2023 жылға қарай АҚШ-тағы лицензияланған жүргізушілер саны 243,4 миллионға жетеді деп болжануда, бұл АҚШ ересектерінің 89%-ын қамтиды. Бұл 2022 жылғы 238,6 миллионнан өскенін білдіреді.

gpt-3.5

Жасанды интеллект тілі моделі ретінде менде нақты уақыттағы деректерге қолжетім жоқ. Дегенмен, 2021 жылғы жағдай бойынша Америка Құрама Штаттарында шамамен 227 миллион адамның жарамды жүргізуші куәлігі болғаны бағаланды. Бұл сан содан бері өзгеруі мүмкін екенін ескеріңіз, сондықтан ең дәл ақпарат алу үшін әрқашан соңғы ресми статистикаға жүгінген жөн.

llama2-70b

Менде нақты уақыттағы деректерге қолжетім жоқ, бірақ мен Америка Құрама Штаттарында жүргізуші куәлігі бар адамдардың шамамен саны туралы кейбір ақпарат бере аламын. Федералдық тас жолдар әкімшілігінің мәліметі бойынша, 2020 жылғы жағдай бойынша Америка Құрама Штаттарында шамамен 227,8 миллион лицензияланған жүргізуші болған. Бұл сан коммерциялық және коммерциялық емес жүргізушілерді де қамтиды. Бұл сан бағаланғаннан аз болуы ықтимал екенін атап өткен жөн, өйткені ол жүргізуші куәлігі болуы мүмкін, бірақ жүйелі түрде немесе мүлдем көлік жүргізбейтін адамдарды есепке алмайды. Сонымен қатар, бұл санға 16 жасқа толмағандар немесе белгілі бір мүгедектігі барлар сияқты жүргізуші куәлігін алуға құқығы жоқ адамдар кірмейді. Сондай-ақ лицензияланған жүргізушілердің саны штатқа байланысты өзгеруі мүмкін екенін атап өткен маңызды, кейбір штаттарда басқаларға қарағанда лицензияланған жүргізушілердің пайызы жоғары болады.

Жалпы алғанда, бағалау нәтижелері біздің PPLX модельдеріміз Perplexity-ге қатысты қолдану жағдайларында, әсіресе дәл және заманауи жауаптарды беру үшін gpt-3.5 және llama2-70b модельдеріне сәйкес келе алатынын және тіпті олардан асып түсетінін көрсетеді.

Perplexity компаниясының онлайн модельдеріне қол жеткізу

Біз pplx-api бета нұсқасынан жалпы көпшілік шығарылымға ауысып жатқанын хабарлауға қуаныштымыз! Бұл біздің pplx-7b-online және pplx-70b-online модельдеріміздің pplx-api арқылы қолжетімді болуының алғашқы реті. Сонымен қатар, біздің pplx-7b-chat және pplx-70b-chat модельдеріміз альфа нұсқасынан шықты және енді жалпы шығарылымымызбен қолжетімді.

Осы арқылы біз пайдалануға негізделген жаңа баға құрылымын енгізіп жатырмыз. Пайдаланушыларымыз өте жылдам қорытындыны қамтамасыз ету үшін NVIDIA H100s пайдаланатын озық инфрақұрылымымызды пайдаланатынына қуаныштымыз. Pro пайдаланушылары ай сайынғы қайталанатын $5 pplx-api кредиттер алады. Барлық басқа пайдаланушылар үшін баға пайдалану негізінде анықталады. Pro пайдаланушысы ретінде тіркелу үшін мына жерді басыңыз. Коммерциялық сұраулар үшін api@perplexity.ai мекенжайына хабарласыңыз.

PPLX-online llm бақылау тақтасы

Қосымша ресурстар:

Үлес қосқандар:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats