Tutvustame PPLX-i veebipõhiseid LLM-e
Oma tüübis esimene veebipõhine LLM-i API

Oma tüübis esimene veebipõhine LLM-i API.
Meil on hea meel tutvustada kahte uut PPLX-i mudelit: pplx-7b-online ja pplx-70b-online! Meie veebipõhised mudelid keskenduvad kasulike, ajakohaste ja faktipõhiste vastuste pakkumisele ning on avalikult saadaval pplx-api kaudu, mis teeb sellest omasuguste seas esimese API. pplx-7b-online ja pplx-70b-online on ligipääsetavad ka meie LLM-i testikeskkonna Perplexity Labs kaudu.
LLM-id on muutnud seda, kuidas me teavet leiame. Enamiku tänapäevaste LLM-ide puhul on aga kaks piirangut:
Värskus: LLM-idel on sageli raskusi ajakohase teabe jagamisega.
Hallutsinatsioonid: LLM-id võivad väljastada ka ebatäpseid väiteid.
Meie mudelid pplx-7b-online ja pplx-70b-online kõrvaldavad praegused piirangud, pakkudes oma vastustes lisaks kasulikku, faktipõhist ja ajakohast teavet.
PPLX-i veebipõhised LLM-id
Meie LLM-id, pplx-7b-online ja pplx-70b-online, on veebipõhised LLM-id, kuna need saavad kasutada internetist pärit teadmisi ja seeläbi vastuse koostamisel kõige ajakohasemat teavet rakendada. Varustades oma LLM-e veebiteadmistega, vastavad meie mudelid täpselt ajatundlikele päringutele, avades teadmisi väljaspool nende treeningkorpust. See tähendab, et Perplexity veebipõhised LLM-id saavad vastata sellistele päringutele nagu „Mis oli eilne Warriorsi mängu skoor?“, mis on võrguühenduseta mudelite jaoks keerulised. Üldjoontes töötab meie veebipõhine LLM järgmiselt:
- Avatud lähtekoodiga mudelite rakendamine: meie PPLX-i mudelid põhinevad
mistral-7bjallama2-70bbaasmudelitel. - Sisemine otsingutehnoloogia: meie sisemine otsingu-, indekseerimis- ja kaardistustaristu võimaldab meil täiendada LLM-e kõige asjakohasema, ajakohasema ja väärtuslikuma teabega. Meie otsinguindeks on suur, seda uuendatakse regulaarselt ja see kasutab keerukaid järjestusalgoritme, et tagada kvaliteetsete, SEO-ta saitide eelistamine. Meie mudelitele
pplx-onlineantakse veebisaitide väljavõtteid, mida nimetatakse „katkenditeks“, et võimaldada vastuseid kõige ajakohasema teabega. - Peenhäälestus: meie PPLX-i mudeleid on peenhäälestatud, et nad saaksid vastuste andmiseks katkendeid tõhusalt kasutada. Kasutades oma ettevõttesiseseid andmetöövõtjaid, kureerime hoolikalt kvaliteetseid, mitmekesiseid ja suuri treeningkomplekte, et saavutada suurepärane jõudlus erinevates aspektides, nagu kasulikkus, faktilisus ja värskus. Jõudluse pidevaks parandamiseks häälestatakse meie mudeleid regulaarselt.
Perplexity veebipõhiste LLM-ide hindamine
Perplexity missioon on luua maailma parim vastuste mootor – mootor, mida inimesed usaldavad teadmiste avardamiseks. Selle saavutamiseks keskendume sügavalt kasuliku, faktipõhise ja ajakohase teabe pakkumisele. Oma LLM-ide jõudluse võrdlemiseks nendes aspektides kureerisime hindamisandmestikud, mis kajastavad vastuste mootorite jaoks keerulisi, kuid realistlikke kasutusjuhte. Iga hindamiskomplekti iga päringu jaoks anti töövõtjatele kahe mudeli vastused ja neil paluti valida vastus, mis toimis järgmiste kriteeriumide alusel paremini:
- Kasulikkus: milline vastus vastab päringule ja järgib määratud juhiseid paremini?
- Faktipõhisus: milline vastus annab täpsemaid vastuseid ilma hallutsinatsioonideta, isegi küsimuste puhul, mis nõuavad väga täpseid või nišiteadmisi?
- Värskus (inspireeritud FreshLLMs poolt): milline vastus sisaldab ajakohasemat teavet? Mudel paistab selle kriteeriumi alusel silma, kui see suudab vastata päringutele värske teabega.
Lisaks ülaltoodud kolmele kriteeriumile hinnati mudelite vastuseid ka terviklikult. Vastuste terviklikuks hindamiseks paluti hindajatel valida vastus, mida nad eelistaksid saada inimassistendilt, kes päringuga abistab.
Hindamiskomplekti kureerimine
Selle hindamise jaoks kureerisime hoolikalt mitmekesise hulga viipasid eesmärgiga hinnata tõhusalt kasulikkust, faktilisust ja värskust. Iga viip valiti käsitsi, tagades kõrgetasemelise kontrolli andmete kvaliteedi ja asjakohasuse üle. Andmestik hõlmab mitmesuguseid vastuste mootori viipasid ja annab põhjaliku ülevaate sellest, milles me soovime, et Perplexity silma paistaks. See on meie jaoks kriitilise tähtsusega, et meie mudeli jõudluse hindamistel oleks kõrge signaalitase.
Iga kolm hindamiskomplekti sisaldab 50 viipa. Mõned näited nendest komplektidest on järgmised:
- Kasulikkus: looge tabel kõigist USA jalgpalluritest, kes mängisid jalgpalli maailmameistrivõistluste finaalis, ja tehke veerud nende statistika jaoks, nagu väravad, väravasöödud jne.
- Faktipõhisus: selgitage AISI 1015 ja AISI 1040 terase sitkust.
- Ajakohasus: Millisel autonoomsete autode ettevõttel keelati 2023. aastal San Franciscos tegutseda?
Mudelivastuste genereerimine
Hinnasime nelja mudelit:
pplx-7b-online: Perplexity mudel, mis sisaldab juurdepääsu internetis leiduvale teabele. Seda mudelit häälestati mudeli mistral-7b abil.
pplx-70b-online: Perplexity mudel, mis sisaldab juurdepääsu internetis leiduvale teabele. Seda mudelit häälestati mudeli llama2-70b abil.
gpt-3.5-turbo-1106: OpenAI mudel, millele pääseb juurde API kaudu ja millel ei ole täiendavaid täiendusi. Pange tähele, et teostasime selle hindamise uusima gpt-3.5 mudeliga.
llama2-70b-chat: Meta AI mudel, millele pääseb juurde meie pplx-api kaudu ja millel ei ole täiendavaid täiendusi.
Iga viipa jaoks anti mudelitele pplx-7b-online ja pplx-70b-online samad otsingutulemused ja katkendid. Kõik vastused genereeriti samade hüperparameetrite ja süsteemiviiba abil.
Süsteemiviip
Current date: Monday, November 20, 2023.Mudelivastuste järjestamine inimeste hinnangute alusel
Iga paarisvõrdluse jaoks anti meie ettevõttesisestele töövõtjatele viip ise, hindamiskriteeriumid (st kasulikkus, faktilisus või värskus) ja kõrvuti kuvatud mudeli vastused. Vastuste järjekord randomiseeriti igal korral ja lähtemudeleid hindajale ei avaldatud. Hindajatel kästi valida vastus, mida nad eelistavad tervikuna, samuti see, kumb toimib paremini konkreetsel hindamiskriteeriumil, kusjuures mõlema puhul on lubatud viigid. Lõpuks lubati hindajatel kasutada internetiotsingut vastuste täpsuse kontrollimiseks. Selle hindamise läbiviimiseks ehitasime oma sisemise eelistuste järjestamise tööriista.
Hindamistulemused
Kasutame inimeste hinnangutest kogutud paaris-eelistuste edetabeleid, et arvutada iga mudeli jaoks ülesandepõhised Elo skoorid. Elo skoore kasutatakse tavaliselt turniiristiilis võistlustel mängijate elanikkonna järjestamiseks, et mõõta mängijate suhtelist sooritust. Suurte keelemudelite puhul rakendatuna annavad need skoorid ennustuse selle kohta, kui tõenäoliselt eelistab inimhindaja ühe mudeli väljundit teisele.
Kuigi Elo skoore arvutatakse tavaliselt võrdluste jada jaoks, et võtta arvesse muutusi mängijate võimetes, on meie eesmärk kvantifitseerida nende mudelite jõudlust, mille võimed ei saa muutuda. Vastavalt sellele võtame kasutusele Bootstrap Elo metoodika, mida kirjeldavad Duan et al ja mida lmsys kasutab ka oma Chatbot Arena jaoks, mis hõlmab Elo skooride arvutamist võrdluste paljude juhuslike permutatsioonide jaoks. Oma arvutuste jaoks arvutasime Elo skoorid 5000 permutatsiooni põhjal ja kasutasime nende Elo skooride jaotusi 95% usaldusvahemike arvutamiseks.
Joonisel 1 esitatud tulemused näitavad, et meie PPLX-i mudelid suudavad Perplexityga seotud kasutusjuhtudel sobituda gpt-3.5 jõudlusega ja seda isegi ületada. Eelkõige eelistavad inimhindajad pplx-7b-online ja pplx-70b-online mudeli vastuseid gpt-3.5 ja llama2-70b mudeli vastustele nende täpsete ja ajakohaste vastuste tõttu.
Mudelid pplx-7b-online ja pplx-70b-online toimivad gpt-3.5 ja llama2-70b mudelitest paremini värskuse, faktipõhisuse ja holistiliste kriteeriumide osas.

Arvutasime hindamisest ka paarisvõitude määrad. Joonisel 2 toodud tulemused näitavad – võib-olla mitte üllatuslikult –, et pplx-i veebipõhise mudeli vastuseid eelistatakse teiste omadele värskuse ja faktipõhisuse osas.

Siin on näide meie värskuse hindamise andmestikust.
Viip: K Kui paljudel inimestel USA-s on juhiluba?
pplx-7b-online
2023. aastal on Ameerika Ühendriikides prognooside kohaselt 243,4 miljonit juhiloaga juhti, mis hõlmab 89% USA täiskasvanutest. See arv on kasvanud 238,6 miljonilt 2022. aastal. Juhiloaga juhtide osakaal on erinevates vanuserühmades ja osariikides erinev. Näiteks 2019. aastal oli juhiluba 84,1%-l USA elanikkonnast. Suurim juhiloaga juhtide osakaal on 25–49-aastaste seas, kusjuures juhiluba on 90,1%-l elanikkonnast. Californias oli 27 miljonit juhiloaga juhti, mis teeb sellest suurima juhiloaga juhtide arvuga osariigi.
pplx-70b-online
2021. aastal oli Ameerika Ühendriikides kehtiv juhiluba ligikaudu 233 miljonil inimesel. Aastaks 2023 on USA-s juhiloaga juhtide arv prognooside kohaselt jõudmas 243,4 miljonini, mis hõlmab 89% USA täiskasvanutest. See tähendab kasvu 238,6 miljonilt 2022. aastal.
gpt-3.5
Tehisintellekti keelemudelina puudub mul juurdepääs reaalajas andmetele. Siiski hinnati 2021. aasta seisuga, et Ameerika Ühendriikides oli kehtiv juhiluba umbes 227 miljonil inimesel. Pange tähele, et see arv võib sellest ajast alates muutuda, seega on kõige täpsema teabe saamiseks alati kõige parem tutvuda viimaste ametlike statistikatega.
llama2-70b
Mul ei ole juurdepääsu reaalajas andmetele, kuid ma saan esitada teavet selle kohta, kui palju inimesi Ameerika Ühendriikides umbes juhiluba omab. Föderaalse maanteeameti andmetel oli Ameerika Ühendriikides 2020. aasta seisuga ligikaudu 227,8 miljonit juhiloaga juhti. See arv sisaldab nii kommerts- kui ka mittekommertsjuhte. Väärib märkimist, et see arv on tõenäoliselt alahinnatud, kuna see ei võta arvesse isikuid, kellel võib olla juhiluba, kuid kes ei sõida regulaarselt või üldse mitte. Lisaks ei sisalda see arv isikuid, kes ei ole juhiloa saamiseks kõlblikud, näiteks alla 16-aastaseid või teatud puuetega inimesi. Samuti on oluline märkida, et juhiloaga juhtide arv võib osariigiti erineda, kusjuures mõnes osariigis on juhiloaga juhtide osakaal suurem kui teistes.
Üldiselt näitavad hindamistulemused, et meie PPLX-i mudelid suudavad Perplexityga seotud kasutusjuhtudel sobituda mudelitega gpt-3.5 ja llama2-70b ning neid isegi ületada, eelkõige täpsete ja ajakohaste vastuste pakkumisel.
Juurdepääs Perplexity veebipõhistele mudelitele
Meil on hea meel teatada, et pplx-api väljub beetatestist ja on jõudmas üldisse avalikku kasutusse! See on esimene kord, kui meie mudelid pplx-7b-online ja pplx-70b-online on pplx-api kaudu kättesaadavad. Lisaks on meie pplx-7b-chat ja pplx-70b-chat mudelid alfafaasist väljas ja on nüüd üldises väljalases kättesaadavad.
Sellega võtame kasutusele uue kasutususpõhise hinnastruktuuri. Meil on hea meel, et meie kasutajad saavad kasutada meie tipptasemel taristut, mis kasutab välkkiire järelduse tagamiseks NVIDIA H100 graafikakaarte. Pro-kasutajad saavad korduva 5-dollarise igakuise pplx-api krediidi. Kõigi teiste kasutajate puhul määratakse hindamine kasutuse põhjal. Pro-kasutajaks registreerumiseks klõpsake siin. Äriküsimustes pöörduge aadressil api@perplexity.ai.

Lisaturud:
- Alustage pplx-api kasutamist siin.
- Proovige meie veebipõhiseid mudeleid tasuta Perplexity Labs abil.
- Lisateave meie API kohta pplx-api dokumentatsiooni kaudu.
- Kas olete huvitatud töötamisest suure mõjuga ja kiire tempoga meeskonnas, mis loob parimat vastuste mootorit? Liituge meiega!
- Liituge meie kasvava Discordi kogukonnaga!
Kaasautorid:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats