Iepazīstinām ar PPLX tiešsaistes LLM
Pirmā šāda veida tiešsaistes LLM API

Pirmā šāda veida tiešsaistes LLM API.
Mēs ar prieku iepazīstinām ar diviem jauniem PPLX modeļiem: pplx-7b-online un pplx-70b-online! Mūsu tiešsaistes modeļi ir vērsti uz noderīgu, aktuālu un faktoloģisku atbilžu sniegšanu, un tie ir publiski pieejami, izmantojot pplx-api, padarot to par pirmo šāda veida API. pplx-7b-online un pplx-70b-online ir pieejami arī, izmantojot mūsu LLM testēšanas vidi Perplexity Labs.
LLM ir mainījuši informācijas meklēšanas veidu. Tomēr vairumam pašreizējo LLM ir divi ierobežojumi:
Aktualitāte: LLM bieži vien saskaras ar grūtībām dalīties ar jaunāko informāciju.
Halucinācijas: LLM var arī sniegt neprecīzus apgalvojumus.
Mūsu pplx-7b-online un pplx-70b-online modeļi novērš pašreizējos ierobežojumus, savās atbildēs papildus sniedzot noderīgu, faktoloģisku un aktuālu informāciju.
PPLX tiešsaistes LLM
Mūsu LLM pplx-7b-online un pplx-70b-online ir tiešsaistes LLM, jo tie var izmantot zināšanas no interneta un tādējādi, veidojot atbildi, izmantot visjaunāko informāciju. Sniedzot mūsu LLM tīmekļa zināšanas, mūsu modeļi precīzi atbild uz laika ziņā jutīgiem vaicājumiem, atverot zināšanas ārpus to apmācības kopas. Tas nozīmē, ka Perplexity tiešsaistes LLM var atbildēt uz tādiem vaicājumiem kā “Kāds bija “Warriors” spēles rezultāts vakarvakarā?”, kas ir sarežģīti bezsaistes modeļiem. Augstākajā līmenī tas darbojas šādi:
- Izmantojiet atvērtā koda modeļus: mūsu PPLX modeļi balstās uz
mistral-7bunllama2-70bbāzes modeļiem. - Pašu izstrādāta meklēšanas tehnoloģija: mūsu pašu izstrādātā meklēšanas, indeksēšanas un pārlūkošanas infrastruktūra ļauj mums papildināt LLM ar visatbilstošāko, aktuālāko un vērtīgāko informāciju. Mūsu meklēšanas indekss ir liels, tiek regulāri atjaunināts un izmanto sarežģītus ranga noteikšanas algoritmus, lai nodrošinātu augstas kvalitātes vietņu bez SEO optimizācijas prioritāti. Mūsu
pplx-onlinemodeļiem tiek nodrošināti vietņu izvilkumi, kurus mēs saucam par “fragmentiem”, lai iespējotu atbildes ar visjaunāko informāciju. - Precizēšana: mūsu PPLX modeļi ir precizēti, lai efektīvi izmantotu fragmentus savu atbilžu pamatošanai. Izmantojot mūsu iekšējos datu līgumslēdzējus, mēs rūpīgi atlasām augstas kvalitātes, daudzveidīgas un lielas apmācības kopas, lai sasniegtu augstu veiktspēju dažādos aspektos, piemēram, noderībā, faktoloģijā un aktualitātē. Mūsu modeļi tiek regulāri precizēti, lai nepārtraukti uzlabotu veiktspēju.
Perplexity tiešsaistes LLM novērtēšana
Perplexity misija ir izveidot pasaulē labāko atbilžu dzinēju — tādu, kuram cilvēki uzticas, lai atklātu un paplašinātu savas zināšanas. Lai to sasniegtu, mēs dziļi koncentrējamies uz noderīgas, faktoloģiskas un aktuālas informācijas nodrošināšanu. Lai novērtētu mūsu LLM veiktspēju šajos aspektos, mēs izveidojām novērtēšanas datu kopas, lai atspoguļotu sarežģītus, bet reālistiskus atbilžu dzinēju lietošanas gadījumus. Katram vaicājumam katrā novērtēšanas kopā līgumslēdzējiem tika sniegtas divas modeļa atbildes un dots uzdevums izvēlēties atbildi, kuras sniegums bija labāks pēc šādiem kritērijiem:
- Noderība: kura atbilde labāk atbild uz vaicājumu un izpilda norādītās instrukcijas?
- Faktoloģija: kura atbilde sniedz precīzākas atbildes bez halucinācijām, pat uz jautājumiem, kam nepieciešamas ļoti precīzas vai specifiskas zināšanas?
- Aktualitāte (iedvesmojies no FreshLLMs): kura atbilde satur jaunāku informāciju? Modelis izceļas šajā kritērijā, ja tas spēj atbildēt uz vaicājumiem ar “svaigu” informāciju.
Papildus trim iepriekš minētajiem kritērijiem modeļa atbildes tika novērtētas arī holistiski. Lai novērtētu atbildes holistiski, vērtētāji tika lūgti izvēlēties atbildi, ko viņi labāk vēlētos saņemt no cilvēka asistenta, kurš palīdz ar vaicājumu.
Novērtēšanas kopas izveide
Šim novērtējumam mēs rūpīgi izveidojām daudzveidīgu uzvedņu kopu ar mērķi efektīvi novērtēt noderību, faktoloģiju un aktualitāti. Katra uzvedne tika manuāli izvēlēta, nodrošinot augstu datu kvalitātes un atbilstības kontroles līmeni. Datu kopa aptver plašu atbilžu dzinēja uzvedņu klāstu un ietver visaptverošu pārskatu par to, ko mēs vēlamies, lai Perplexity būtu izcils. Tas mums ir kritiski svarīgi, lai mūsu modeļa veiktspējas novērtējumiem būtu augsts signāls.
Katrā no trim novērtēšanas kopām ir 50 uzvednes. Daži piemēri no šīm kopām ietver:
- Noderība: izveidojiet visu ASV futbola spēlētāju, kuri spēlēja Pasaules kausa finālā, tabulu un izveidojiet kolonnas viņu statistikai, piemēram, vārtiem, rezultatīvām piespēlēm utt.
- Faktoloģija: paskaidrojiet AISI 1015 un AISI 1040 tērauda cietību.
- Aktualitāte: kurai autonomo automobiļu uzņēmumam 2023. gadā tika aizliegts darboties Sanfrancisko?
Modeļu atbilžu ģenerēšana
Mēs novērtējām četrus modeļus:
pplx-7b-online: Perplexity modelis, kas ietver piekļuvi informācijai no interneta. Šis modelis tika precizēts, izmantojot mistral-7b.
pplx-70b-online: Perplexity modelis, kas ietver piekļuvi informācijai no interneta. Šis modelis tika precizēts, izmantojot llama2-70b.
gpt-3.5-turbo-1106: OpenAI modelis, kuram piekļūst caur API un bez papildu papildinājumiem. Ņemiet vērā, ka mēs veicām šo novērtējumu, izmantojot jaunāko gpt-3.5 modeli.
llama2-70b-chat: Meta AI modelis, kuram piekļūst caur mūsu pplx-api un bez papildu papildinājumiem.
Katram vaicājumam pplx-7b-online un pplx-70b-online modeļiem tika nodrošināti vieni un tie paši meklēšanas rezultāti un fragmenti. Visas atbildes tika ģenerētas, izmantojot tos pašus hiperparametrus un sistēmas uzvedni.
Sistēmas uzvedne
Current date: Monday, November 20, 2023.Modeļu atbilžu sarindošana ar cilvēka novērtējumu
Katram salīdzinājumam pa pāriem mūsu iekšējiem līgumslēdzējiem tika sniegta pati uzvedne, novērtēšanas kritēriji (t. i., noderība, faktoloģija vai aktualitāte) un blakus attēlotās modeļu atbildes. Atbilžu secība katrā gājienā tika nejauši izvēlēta, un avota modeļi netika atklāti vērtētājam. Vērtētājiem tika uzdots izvēlēties atbildi, kuru viņi holistiski dod priekšroku, kā arī to, kura darbojas labāk attiecībā uz konkrēto novērtēšanas kritēriju, pieļaujot neizšķirtu rezultātu abiem. Visbeidzot, vērtētājiem bija atļauts izmantot interneta meklēšanu, lai pārbaudītu atbilžu precizitāti. Mēs izveidojām savu iekšējo preferenču sarindošanas rīku, lai veiktu šo novērtējumu.
Novērtēšanas rezultāti
Mēs izmantojam no cilvēka novērtējuma savāktās preferenču reitingus pa pāriem, lai aprēķinātu katra modeļa Elo rādītājus katram uzdevumam. Elo rādītāji tiek parasti izmantoti, lai sarindotu spēlētāju kopumu turnīra stila sacensībās, lai izmērītu spēlētāju relatīvo sniegumu. Ja tos piemēro lieliem valodas modeļiem, šie rādītāji sniedz prognozi par to, cik lielā mērā cilvēka vērtētājs varētu dot priekšroku viena modeļa izvadei salīdzinājumā ar citu.
Lai gan Elo rādītāji parasti tiek aprēķināti salīdzinājumu secībai, lai ņemtu vērā izmaiņas spēlētāju spējās, mūsu mērķis ir kvantificēt to modeļu sniegumu, kuru spējas nevar mainīties. Attiecīgi mēs pieņemam Duan u. c. aprakstīto Bootstrap Elo metodoloģiju, ko lmsys izmanto arī savai Chatbot Arena, kas ietver Elo rādītāju aprēķināšanu daudzām salīdzinājumu nejaušām permutācijām. Mūsu aprēķiniem mēs aprēķinājām Elo rādītājus vairāk nekā 5000 permutācijām un izmantojām šo Elo rādītāju sadalījumus, lai aprēķinātu 95% ticamības intervālus.
Rezultāti, kas parādīti 1. attēlā, parāda, ka mūsu PPLX modeļi var sacensties un pat pārspēt gpt-3.5 veiktspēju ar Perplexity saistītos lietošanas gadījumos. Jo īpaši cilvēku vērtētāji dod priekšroku pplx-7b-online un pplx-70b-online modeļu atbildēm salīdzinājumā ar gpt-3.5 un llama2-70b modeļu atbildēm to precīzo un aktuālo atbilžu dēļ.
pplx-7b-online un pplx-70b-online darbojas labāk nekā gpt-3.5 un llama2-70b attiecībā uz aktualitātes, faktoloģijas un holistiskiem kritērijiem.

Mēs arī aprēķinājām uzvaru rādītājus pa pāriem no novērtējuma. Rezultāti, kas parādīti 2. attēlā, ilustrē, iespējams, nav pārsteidzoši, ka pplx tiešsaistes modeļu atbildēm tiek dota priekšroka salīdzinājumā ar citiem attiecībā uz aktualitāti un faktoloģiju.

Šeit ir piemērs no mūsu aktualitātes novērtēšanas datu kopas.
Uzvedne: Cik cilvēku ASV ir autovadītāja apliecība?
pplx-7b-online
2023. gadā Amerikas Savienotajās Valstīs ir prognozēti 243,4 miljoni licencētu autovadītāju, kas ietver 89% no ASV pieaugušajiem. Šis skaitlis ir palielinājies no 238,6 miljoniem 2022. gadā. Licencēto autovadītāju procentuālais daudzums dažādās vecuma grupās un štatos atšķiras. Piemēram, 2019. gadā 84,1% ASV iedzīvotāju bija autovadītāja apliecība. Visaugstākais licencēto autovadītāju īpatsvars ir vecuma grupā no 25 līdz 49 gadiem, un 90,1% iedzīvotāju ir autovadītāja apliecība. Kalifornijā bija 27 miljoni licencētu autovadītāju, padarot to par štatu ar vislielāko licencēto autovadītāju skaitu.
pplx-70b-online
2021. gadā Amerikas Savienotajās Valstīs derīgas autovadītāja apliecības bija aptuveni 233 miljoniem cilvēku. Līdz 2023. gadam licencēto autovadītāju skaits ASV, prognozēts, sasniegs 243,4 miljonus, kas ietver 89% ASV pieaugušo. Tas ir pieaugums salīdzinājumā ar 238,6 miljoniem 2022. gadā.
gpt-3.5
Kā AI valodas modelim man nav piekļuves reāllaika datiem. Tomēr 2021. gadā tika lēsts, ka aptuveni 227 miljoniem cilvēku Amerikas Savienotajās Valstīs bija derīga autovadītāja apliecība. Lūdzu, ņemiet vērā, ka šis skaitlis kopš tā laika var būt mainījies, tāpēc vienmēr vislabāk ir atsaukties uz jaunāko oficiālo statistiku, lai iegūtu visprecīzāko informāciju.
llama2-70b
Man nav piekļuves reāllaika datiem, bet es varu sniegt zināmu informāciju par aptuveno cilvēku skaitu Amerikas Savienotajās Valstīs, kuriem ir autovadītāja apliecība. Saskaņā ar Federālās lielceļu administrācijas datiem no 2020. gada Amerikas Savienotajās Valstīs bija aptuveni 227,8 miljoni licencētu autovadītāju. Šis skaitlis ietver gan komerciālos, gan nekomerciālos autovadītājus. Ir vērts atzīmēt, ka šis skaitlis, visticamāk, ir par zemu novērtēts, jo tas neņem vērā personas, kurām var būt autovadītāja apliecība, bet kuras nevada automašīnu regulāri vai vispār. Turklāt šis skaitlis neietver personas, kuras nav tiesīgas saņemt autovadītāja apliecību, piemēram, tās, kuras ir jaunākas par 16 gadiem vai kurām ir noteikti traucējumi. Ir svarīgi arī atzīmēt, ka licencēto autovadītāju skaits var atšķirties pa štatiem, un dažos štatos ir lielāks licencēto autovadītāju īpatsvars nekā citos.
Kopumā novērtēšanas rezultāti parāda, ka mūsu PPLX modeļi var sacensties un pat pārspēt gpt-3.5 un llama2-70b ar Perplexity saistītos lietošanas gadījumos, jo īpaši, nodrošinot precīzas un aktuālas atbildes.
Piekļuve Perplexity tiešsaistes modeļiem
Mēs esam sajūsmā paziņot, ka pplx-api iziet no beta fāzes uz vispārēju publisko laidienu! Šī ir pirmā reize, kad mūsu pplx-7b-online un pplx-70b-online modeļi ir pieejami, izmantojot pplx-api. Turklāt mūsu pplx-7b-chat un pplx-70b-chat modeļi ir izgājuši no alfa fāzes un tagad ir pieejami ar mūsu vispārējo laidienu.
Līdz ar to mēs ieviešam jaunu uz izmantošanu balstītu cenu noteikšanas struktūru. Mēs priecājamies, ka mūsu lietotāji izmanto mūsu vismodernāko infrastruktūru, kas izmanto NVIDIA H100s, lai nodrošinātu ārkārtīgi ātru secināšanu. Pro lietotāji saņems atkārtotu ikmēneša $5 pplx-api kredīti. Visiem pārējiem lietotājiem cenas tiks noteiktas, pamatojoties uz izmantošanu. Lai reģistrētos kā Pro lietotājs, noklikšķiniet šeit. Sazinieties ar api@perplexity.ai komerciālos jautājumos.

Papildu resursi:
- Sāciet darbu ar pplx-api šeit.
- Izmēģiniet mūsu tiešsaistes modeļus bez maksas ar Perplexity Labs.
- Uzziniet vairāk par mūsu API, izmantojot pplx-api dokumentāciju.
- Vai vēlaties strādāt augstas ietekmes, augsta ātruma komandā, kas veido labāko atbilžu dzinēju? Pievienojieties mums!
- Pievienojieties mūsu augošajai Discord kopienai!
Līdzstrādnieki:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats