Представљање PPLX мрежних великих језичких модела (LLM)
Први по својој врсти АПИ за мрежне велике језичке моделе (LLM)

Први по својој врсти АПИ за мрежне велике језичке моделе (LLM).
Узбуђени смо што дијелимо два нова PPLX модела: pplx-7b-online и pplx-70b-online! Наши мрежни модели су усмјерени на пружање корисних, ажурних и чињеничних одговора, а јавно су доступни путем pplx-api, што га чини АПИ-јем првим ове врсте. pplx-7b-online и pplx-70b-online су такође доступни преко Perplexity Labs, нашег окружења за тестирање великих језичких модела (LLM).
Велики језички модели (LLM) су промијенили начин на који проналазимо информације. Међутим, постоје два ограничења код већине данашњих великих језичких модела (LLM):
Свјежина: Велики језички модели (LLM) често имају проблема са дијељењем ажурних информација.
Халуцинације: Велики језички модели (LLM) такође могу да дају нетачне изјаве.
Наши модели pplx-7b-online и pplx-70b-online рјешавају тренутна ограничења тако што додатно пружају корисне, чињеничне и ажурне информације у својим одговорима.
PPLX мрежни велики језички модели (LLM)
Наши велики језички модели (LLM), pplx-7b-online и pplx-70b-online, су мрежни велики језички модели (online LLM) зато што могу да користе знање са интернета, те стога могу да искористе најновије информације када формирају одговор. Пружањем знања са веба нашим великим језичким моделима (LLM), наши модели тачно одговарају на упите осјетљиве на вријеме, откључавајући знање изван свог корпуса за обуку. Ово значи да Perplexity-јеви мрежни велики језички модели (LLM) могу да одговоре на упите попут „Који је био резултат утакмице Вариорса синоћ?” који представљају изазов за ванмрежне моделе. На високом нивоу, ево како функционише наш мрежни велики језички модел (LLM):
- Искористите отворене моделе: наши PPLX модели се граде на врху
mistral-7bиllama2-70bбазних модела. - Интертехнологија претраге: наша интерна инфраструктура за претрагу, индексирање и претраживање омогућава нам да употпунимо велике језичке моделе (LLM) најрелевантнијим, најновијим и највриједнијим информацијама. Наш индекс претраге је велики, ажурира се редовно и користи софистициране алгоритме рангирања како би се осигурало да се да предност висококвалитетним сајтовима који нису SEO-вани. Одломци са веб-сајта, које називају „одломци”, обезбјеђују се нашим pplx-online</g2 моделима како би омогућили одговоре са најновијим информацијама.
- Фино подешавање: наши PPLX модели су фино подешени да ефикасно користе одломке за информисање својих одговора. Користећи наше интерне извођаче података, пажљиво курирамо висококвалитетне, разноврсне и велике скупове за обуку како бисмо постигли високе перформансе на различитим осама као што су корисност, чињеничност и свјежина. Наши модели се редовно фино подешавају како би се континуирано побољшале перформансе.
Вредновање Perplexity-јевих мрежних великих језичких модела (LLM)
Мисија компаније Perplexity је изградња најбољег свјетског мотора за одговоре — оног којем људи вјерују да би открили и проширили своје знање. Да бисмо то постигли, дубоко смо фокусирани на пружање корисних, чињеничних и ажурних информација. Да бисмо утврдили перформансе наших великих језичких модела (LLM) на овим осама, прикупили смо скупове података за вредновање како бисмо одразили изазовне, али реалне случајеве коришћења мотора за одговоре. За сваки упит у сваком скупу вредновања, извођачима су дата два одговора модела и упућени су да изаберу одговор који је боље радио за сљедеће критеријуме:
- Корисност: који одговор боље одговара на упит и прати наведена упутства?
- Чињеничност: који одговор пружа тачније одговоре без халуцинација, чак и за питања која захтијевају врло прецизно или нишно знање?
- Свјежина (инспирисано са FreshLLMs): који одговор садржи више ажурних информација? Модел се истиче у овом критеријуму ако је у стању да одговори на упите са „свјежим” информацијама.
Као додатак на три горе наведена критеријума, одговори модела су такође вредновани холистички. Да би се одговори вредновали холистички, од оцјењивача је тражено да одаберу одговор који би радје примили од људског асистента који помаже са упитом.
Курирање скупа вредновања
За ово вредновање, пажљиво смо курирали разноврстан скуп упита са циљем ефикасног вредновања корисности, чињеничности и свјежине. Сваки упит је ручно одабран, осигуравајући висок ниво контроле над квалитетом и релевантношћу података. Скуп података обухвата широк спектар упита мотора за одговоре и обухвата свеобухватан преглед онога у чему желимо да Perplexity се истиче. Ово је кључно за нас да наше оцјене перформанси модела имају висок сигнал.
Сваки од три скупа за вредновање садржи 50 упита. Неки примјери из ових скупова укључују:
- Корисност: Направите табелу свих америчких фудбалера који су играли у финалу Свјетског првенства и направите колоне за њихову статистику као што су голови, асистенције итд.
- Чињеничност: Објасните жилавост челика AISI 1015 и AISI 1040.
- Ажурност: Којој компанији за аутономне аутомобиле је забрањен рад у Сан Франциску 2023. године?
Генерисање одговора модела
Вредновали смо четири модела:
pplx-7b-online: Perplexity-јев модел, који укључује приступ информацијама са интернета. Овај модел је фино подешен коришћењем модела mistral-7b.
pplx-70b-online: Perplexity-јев модел, који укључује приступ информацијама са интернета. Овај модел је фино подешен коришћењем модела llama2-70b.
gpt-3.5-turbo-1106: OpenAI-јев модел, коме се приступа путем АПИ-ја и без додатних допуна. Имајте на уму да смо спровели ово вредновање користећи најновији gpt-3.5 модел.
llama2-70b-chat: Модел Meta AI-ја, коме се приступа преко нашег pplx-api и без додатних допуна.
За сваки упит, исти резултати претраге и одломци су обезбијеђени моделима pplx-7b-online и pplx-70b-online. Сви одговори су генерисани коришћењем истих хиперпараметара и системског упита.
Системски упит
Current date: Monday, November 20, 2023.Рангирање одговора модела уз помоћ људског вредновања
За свако упарено поређење, нашим инстерним извођачима су достављени сам упит, критеријуми вредновања (тј. корисност, чињеничност или свјежина), као и одговори модела приказани један поред другог. Редослијед одговора је био насумичан у сваком кораку, а изворни модели нису откривени оцјењивачу. Оцјењивачи су добили инструкције да одаберу одговор који холистички више воле, као и који боље ради на одређеном критеријуму вредновања, уз дозвољене изједначене резултате за оба. Коначно, оцјењивачима је било дозвољено да користе интернет претрагу како би провјерили тачност одговора. Изградили смо сопствену интрну алатку за рангирање преференција како бисмо спровели ово вредновање.
Резултати вредновања
Користимо рангирања упарених преференција прикупљена из људског вредновања да израчунамо Elo скорове по задатку за сваки модел. Elo скорови се обично користе за рангирање популације играча у такмичењима у стилу турнира како би се измјериле релативне перформансе играча. Када се примијене на велике језичке моделе, ови скорови пружају предвиђање колико је вјероватно да ће људски оцјењивач фаворизовати излаз једног модела над другим.
Док се Elo скорови обично израчунавају за низ поређења како би се узеле у обзир промјене у способностима играча, циљ нам је да квантификујемо перформансе модела чије способности не могу да се промијене. У складу са тим, усвајамо методологију Bootstrap Elo описану од стране Duan et al коју такође користи lmsys за свој Chatbot Arena, што подразумијева израчунавање Elo скорова за многе случајне пермутације поређења. За наше прорачуне, израчунали смо Elo скорове преко 5000 пермутација и користили дистрибуције ових Elo скорова за израчунавање 95% интервала повјерења.
Резултати, приказани на Слици 1, показују да наши PPLX модели могу да се подударе и чак надмаше перформансе gpt-3.5 на случајевима коришћења повезаним са Perplexity. Конкретно, одговори модела pplx-7b-online и pplx-70b-online су пожељнији од одговора модела gpt-3.5 и llama2-70b од стране људских оцјењивача због њихових тачних и ажурних одговора.
pplx-7b-online и pplx-70b-online раде боље од gpt-3.5 и llama2-70b, на критеријумима свјежине, чињеничности и холистичким критеријумима.

Такође смо израчунали стопе побједа у паровима из вредновања. Резултати, приказани на Слици 2, илуструју, можда не изненађујуће, да су одговори pplx мрежних модела пожељнији од других на пољу свјежине и чињеничности.

Ево примјера из нашег скупа података за вредновање свјежине.
Упит: Колико људи у САД има возачку дозволу?
pplx-7b-online
У 2023. години пројектовано је 243.4 милиона лиценцираних возача у Сједињеним Државама, што укључује 89% одраслих у САД. Овај број се повећао са 238.6 милиона у 2022. години. Проценат лиценцираних возача варира у различитим старосним групама и државама. На примјер, у 2019. години, 84.1% становништва САД је имало возачку дозволу. Највећи проценат лиценцираних возача је међу особама старости од 25 до 49 година, са 90.1% становништва које има возачку дозволу. У Калифорнији је било 27 милиона лиценцираних возача, што је чини државом са највећим бројем лиценцираних возача.
pplx-70b-online
У 2021. години око 233 милиона људи је посједовало важеће возачке дозволе у Сједињеним Државама. До 2023. године предвиђа се да ће број лиценцираних возача у САД достићи 243.4 милиона, што укључује 89% одраслих у САД. Ово представља повећање са 238.6 милиона у 2022. години.
gpt-3.5
Као модел вјештачке интелигенције, немам приступ подацима у реалном времену. Међутим, од 2021. године процијењено је да око 227 милиона људи у Сједињеним Државама посједује важећу возачку дозволу. Имајте на уму да се овај број можда промијенио од тада, тако да је увијек најбоље да се осврнете на најновије званичне статистике за најтачније информације.
llama2-70b
Немам приступ подацима у реалном времену, али могу да пружим неке информације о приближном броју људи у Сједињеним Државама који имају возачку дозволу. Према Савезној администрацији за аутопутеве, било је приближно 227.8 милиона лиценцираних возача у Сједињеним Државама од 2020. године. Овај број укључује и комерцијалне и некомерцијалне возаче. Вриједи напоменути да је овај број вјероватно потцијењен, јер не узима у обзир појединце који можда имају возачку дозволу али не возе редовно или уопште. Додатно, овај број не укључује појединце који не испуњавају услове за возачку дозволу, као што су они који су млађи од 16 година или имају одређене инвалидитете. Такође је важно напоменути да број лиценцираних возача може да варира по државама, при чему неке државе имају већи проценат лиценцираних возача од других.
Све у свему, резултати вредновања показују да наши PPLX модели могу да се подударе и чак надмаше gpt-3.5 и llama2-70b на случајевима коришћења повезаним са Perplexity, нарочито за пружање тачних и ажурних одговора.
Приступ Perplexity-јевим мрежним моделима
Одушевљени смо што објављујемо да pplx-api излази из фазе бета верзије у опште јавно издање! Ово је први пут да су наши модели pplx-7b-online и pplx-70b-online доступни путем pplx-api. Поред тога, наши модели pplx-7b-chat и pplx-70b-chat су изашли из алфа верзије и сада су доступни са нашим општим издањем.
Уз ово, уводимо нову структуру цијена засновану на коришћењу. Узбуђени смо што ће наши корисници користити нашу најсавременију инфраструктуру, која користи NVIDIA H100s за пружање изузетно брзог закључивања. Pro корисници ће добити редовни мјесечни кредит за pplx-api од 5 УСД. За све остале кориснике цијене ће бити одређене на основу коришћења. Да бисте се пријавили као Pro корисник, кликните овдје. Обратите се на api@perplexity.ai за комерцијалне упите.

Додатни ресурси:
- Започните са pplx-api овдје.
- Испробајте наше мрежне моделе бесплатно уз Perplexity Labs.
- Сазнајте више о нашем АПИ-ју путем pplx-api документације.
- Заинтересовани сте за рад у тиму са великим утицајем и високом брзином који гради најбољи мотор за одговоре? Придружите нам се!
- Придружите се нашој све већој Discord заједници!
Сарадници:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats