Predstavujeme online LLM PPLX
Prvé online rozhranie LLM API svojho druhu

Prvé online rozhranie LLM API svojho druhu.
S nadšením predstavujeme dva nové modely PPLX: pplx-7b-online a pplx-70b-online! Naše online modely sa zameriavajú na poskytovanie užitočných, aktuálnych a faktických odpovedí a sú verejne dostupné prostredníctvom pplx-api, čo z neho robí API svojho druhu. Modely pplx-7b-online a pplx-70b-online sú dostupné aj cez Perplexity Labs, naše testovacie prostredie pre LLM.
Modely LLM zmenili spôsob, akým vyhľadávame informácie. Väčšina dnešných modelov LLM však má dve obmedzenia:
Aktuálnosť: Modely LLM majú často problém zdieľať aktuálne informácie.
Halucinácie: Modely LLM môžu taktiež produkovať nepresné vyhlásenia.
Naše modely pplx-7b-online a pplx-70b-online riešia súčasné obmedzenia tým, že vo svojich odpovediach navyše poskytujú užitočné, faktické a aktuálne informácie.
Online LLM PPLX
Naše modely LLM, pplx-7b-online a pplx-70b-online, sú online LLM, pretože dokážu využívať znalosti z internetu, a tak pri vytváraní odpovede čerpať z najaktuálnejších informácií. Poskytovaním znalostí z webu našim modelom LLM naše modely presne odpovedajú na dopyty závislé od času, čím sprístupňujú znalosti presahujúce ich trénovací korpus. To znamená, že online LLM Perplexity dokážu odpovedať na otázky typu „Aké bolo skóre zápasu Warriors včera večer?“, ktoré sú pre offline modely náročné. Na vysokej úrovni funguje náš online LLM takto:
- Využitie open-source modelov: naše modely PPLX stavajú na základných modeloch
mistral-7ballama2-70b. - Vlastná technológia vyhľadávania: naša vlastná infraštruktúra vyhľadávania, indexovania a prechádzania webu nám umožňuje rozširovať modely LLM o najrelevantnejšie, najaktuálnejšie a najcennejšie informácie. Náš vyhľadávací index je rozsiahly, pravidelne aktualizovaný a využíva sofistikované hodnotiace algoritmy na zabezpečenie uprednostnenia vysokokvalitných stránok bez SEO optimalizácie. Úryvky z webových stránok, ktoré nazývame „úryvky“, sa poskytujú našim modelom
pplx-online, čo umožňuje odpovede s najaktuálnejšími informáciami. - Doladenie: naše modely PPLX boli doladené tak, aby efektívne využívali úryvky na informovanie svojich odpovedí. S využitím našich interných dodávateľov údajov starostlivo vyberáme vysoko kvalitné, rôznorodé a rozsiahle trénovacie sady s cieľom dosiahnuť vysoký výkon v rôznych oblastiach, ako je užitočnosť, faktickosť a aktuálnosť. Naše modely sú pravidelne dolaďované s cieľom neustále zlepšovať výkon.
Vyhodnocovanie online LLM Perplexity
Poslaním Perplexity je vybudovať najlepší vyhľadávač odpovedí na svete – taký, ktorému ľudia dôverujú pri objavovaní a rozširovaní svojich vedomostí. Aby sme to dosiahli, kladieme veľký dôraz na poskytovanie užitočných, faktických a aktuálnych informácií. Na porovnanie výkonu našich modelov LLM v týchto oblastiach sme vytvorili hodnotiace súbory údajov, ktoré odrážajú náročné, ale realistické prípady použitia pre vyhľadávače odpovedí. Pre každý dopyt v každej hodnotiacej sade dostali dodávatelia dve odpovede modelu a mali za úlohu vybrať odpoveď, ktorá dosiahla lepšie výsledky podľa nasledujúcich kritérií:
- Užitočnosť: ktorá odpoveď lepšie reaguje na dopyt a dodržiava zadané pokyny?
- Faktickosť: ktorá odpoveď poskytuje presnejšie odpovede bez halucinácií, a to aj na otázky vyžadujúce si veľmi presné alebo špecifické znalosti?
- Aktuálnosť (inšpirované FreshLLMs): ktorá odpoveď obsahuje aktuálnejšie informácie? Model vyniká v tomto kritériu, ak dokáže odpovedať na otázky „čerstvými“ informáciami.
Okrem troch vyššie uvedených kritérií sa odpovede modelov hodnotili aj celkovo. Na celkové hodnotenie odpovedí boli hodnotitelia požiadaní, aby vybrali odpoveď, ktorú by radšej dostali od ľudského asistenta, ktorý pomáha s dopytom.
Príprava hodnotiacej sady
Pre toto hodnotenie sme starostlivo vytvorili rôznorodú sadu výziev s cieľom efektívne vyhodnotiť užitočnosť, faktickosť a aktuálnosť. Každá výzva bola vybraná manuálne, čo zabezpečilo vysokú úroveň kontroly nad kvalitou a relevanciou údajov. Súbor údajov pokrýva širokú škálu výziev pre vyhľadávače odpovedí a zahŕňa komplexný prehľad o tom, v čom chceme, aby Perplexity vynikalo. To je pre nás kľúčové, aby naše hodnotenia výkonu modelov mali vysokú vypovedaciu schopnosť.
Každá z troch hodnotiacich sád obsahuje 50 výziev. Niekoľko príkladov z týchto sád zahŕňa:
- Užitočnosť: Vytvorte tabuľku všetkých amerických futbalistov, ktorí hrali vo finále MS, a vytvorte stĺpce pre ich štatistiky, ako sú góly, asistencie atď.
- Faktickosť: Vysvetlite húževnatosť ocelí AISI 1015 a AISI 1040.
- Aktuálnosť: Ktorá spoločnosť zaoberajúca sa autonómnymi vozidlami dostala v roku 2023 zákaz v San Franciscu?
Generovanie odpovedí modelu
Vyhodnotili sme štyri modely:
pplx-7b-online: Model Perplexity, ktorý zahŕňa prístup k informáciám z internetu. Tento model bol doladený pomocou mistral-7b.
pplx-70b-online: Model Perplexity, ktorý zahŕňa prístup k informáciám z internetu. Tento model bol doladený pomocou llama2-70b.
gpt-3.5-turbo-1106: Model OpenAI, ku ktorému sa pristupuje cez API a bez dodatočných rozšírení. Upozorňujeme, že toto hodnotenie sme vykonali s použitím najnovšieho modelu gpt-3.5.
llama2-70b-chat: Model Meta AI, prístupný prostredníctvom nášho pplx-api a bez dodatočných rozšírení.
Pre každý dopyt boli modelom pplx-7b-online a pplx-70b-online poskytnuté rovnaké výsledky vyhľadávania a úryvky. Všetky odpovede boli vygenerované pomocou rovnakých hyperparametrov a systémovej výzvy.
Systémová výzva
Current date: Monday, November 20, 2023.Hodnotenie odpovedí modelov pomocou ľudského hodnotenia
Pre každé párové porovnanie boli našim interným dodávateľom poskytnuté samotná výzva, hodnotiace kritériá (t. j. užitočnosť, faktickosť alebo aktuálnosť) a odpovede modelov zobrazené vedľa seba. Poradie odpovedí bolo pri každom kole náhodne vybrané a zdrojové modely neboli hodnotiteľovi odhalené. Hodnotitelia dostali pokyn, aby vybrali odpoveď, ktorú celkovo uprednostňujú, ako aj to, ktorá dosahuje lepšie výsledky v konkrétnom hodnotiacom kritériu, pričom pre oboe boli povolené remízy. Nakoniec mohli hodnotitelia použiť internetové vyhľadávanie na overenie presnosti odpovedí. Na vykonanie tohto hodnotenia sme vytvorili vlastnícky nástroj na hodnotenie preferencií.
Výsledky hodnotenia
Na výpočet skóre Elo pre jednotlivé úlohy pre každý model používame rebríčky párových preferencií zhromaždené z ľudského hodnotenia. Skóre Elo sa bežne používa na hodnotenie skupiny hráčov v súťažiach turnajového typu na meranie relatívneho výkonu hráčov. Po aplikovaní na veľké jazykové modely poskytujú tieto skóre predpoveď toho, do akej miery môže ľudský hodnotiteľ uprednostniť výstup jedného modelu pred druhým.
Zatiaľ čo skóre Elo sa zvyčajne vypočítava pre sekvenciu porovnaní, aby sa zohľadnili zmeny schopností hráčov, naším cieľom je kvantifikovať výkon modelov, ktorých schopnosti sa nemôžu zmeniť. Z tohto dôvodu preberáme metódu Bootstrap Elo opísanú v Duan a kol. , ktorú využíva aj lmsys pre svoju Chatbot Arenu, čo zahŕňa výpočet skóre Elo pre mnoho náhodných permutácií porovnaní. Pre naše výpočet sme vypočítali skóre Elo pre 5000 permutácií a použili sme distribúcie týchto skóre Elo na výpočet 95% intervalov spoľahlivosti.
Výsledky, zobrazené na obrázku 1, ukazujú, že naše modely PPLX sa vyrovnajú a dokonca prekonajú výkon gpt-3.5 v prípadoch použitia súvisiacich s Perplexity. Odpovede modelov pplx-7b-online a pplx-70b-online sú obzvlášť uprednostňované pred odpoveďami modelov gpt-3.5 a llama2-70b ľudskými hodnotiteľmi kvôli ich presným a aktuálnym odpovediam.
Modely pplx-7b-online a pplx-70b-online fungujú lepšie ako gpt-3.5 a llama2-70b v kritériách aktuálnosti, faktickosti a celkového hodnotenia.

Z hodnotenia sme vypočítali aj miery výhier v pároch. Výsledky zobrazené na obrázku 2 ukazujú, že odpovede online modelov pplx sú – možno neprekvapivo – uprednostňované pred ostatnými v oblasti aktuálnosti a faktickosti.

Tu je príklad z našej hodnotiacej sady pre aktuálnosť.
Výzva: Koľko ľudí v USA má vodičský preukaz?
pplx-7b-online
V roku 2023 sa v Spojených štátoch predpokladá 243,4 milióna držiteľov vodičského preukazu, čo zahŕňa 89 % dospelých v USA. Tento počet vzrástol z 238,6 milióna v roku 2022. Percento držiteľov vodičského preukazu sa líši v závislosti od vekových skupín a štátov. Napríklad v roku malo 2019 84,1 % obyvateľov USA vodičský preukaz. Najvyššie percento držiteľov vodičského preukazu je vo vekovej skupine 25 až 49 rokov, pričom vodičský preukaz má 90,1 % obyvateľov. V Kalifornii bolo 27 miliónov držiteľov vodičského preukazu, čo z nej robí štát s najvyšším počtom držiteľov vodičského preukazu.
pplx-70b-online
V roku 2021 malo v Spojených štátoch platný vodičský preukaz približne 233 miliónov ľudí. Do roku 2023 sa predpokladá, že počet držiteľov vodičského preukazu v USA dosiahne 243,4 milióna, čo zahŕňa 89 % dospelých v USA. Predstavuje to nárast z 238,6 milióna v roku 2022.
gpt-3.5
Ako jazykový model AI nemám prístup k údajom v reálnom čase. Od roku 2021 sa však odhadovalo, že platný vodičský preukaz malo v Spojených štátoch približne 227 miliónov ľudí. Upozorňujeme, že toto číslo sa odtrefy mohlo zmeniť, preto je vždy najlepšie obrátiť sa na najnovšie oficiálne štatistiky, kde nájdete najpresnejšie informácie.
llama2-70b
Nemám prístup k údajom v reálnom čase, ale môžem poskytnúť určité informácie o približnom počte ľudí v Spojených štátoch, ktorí majú vodičský preukaz. Podľa Federálnej diaľničnej správy bolo v Spojených štátoch k roku 2020 približne 227,8 milióna držiteľov vodičského preukazu. Toto číslo zahŕňa komerčných aj nekomerčných vodičov. Stojí za zmienku, že toto číslo je pravdepodobne podhodnotené, pretože nezohľadňuje jednotlivcov, ktorí môžu mať vodičský preukaz, ale jazdia pravidelne alebo vôbec nie. Toto číslo navyše nezahŕňa jednotlivcov, ktorí nespĺňajú podmienky na získanie vodičského preukazu, napríklad osoby mladšie ako 16 rokov alebo osoby s určitým zdravotným postihnutím. Je tiež dôležité poznamenať, že počet držiteľov vodičského preukazu sa môže líšiť v závislosti od štátu, pričom niektoré štáty majú vyššie percento držiteľov vodičského preukazu ako iné.
Celkovo výsledky hodnotenia ukazujú, že naše modely PPLX sa môžu vyrovnať a dokonca prekonať gpt-3.5 a llama2-70b v prípadoch použitia súvisiacich s Perplexity, najmä pri poskytovaní presných a aktuálnych odpovedí.
Prístup k online modelom Perplexity
Sme nadšení, že môžeme oznámiť, že pplx-api prechádza z fázy beta do všeobecného verejného vydania! Toto je prvýkrát, čo sú naše modely pplx-7b-online a pplx-70b-online dostupné prostredníctvom pplx-api. Okrem toho sú naše modely pplx-7b-chat a pplx-70b-chat mimo fázy alfa a sú teraz dostupné s naším všeobecným vydaním.
S týmto zavádzame novú štruktúru cien založenú na využití. Sme nadšení, že naši používatelia môžu využívať našu špičkovú infraštruktúru, ktorá využíva NVIDIA H100s na poskytovanie bleskovo rýchlej inferencie. Používatelia Pro získajú opakovaný mesačný kredit pplx-api vo výške 5 USD. Pre všetkých ostatných používateľov sa ceny určia na základe využitia. Ak sa chcete zaregistrovať ako používateľ Pro, kliknite sem. V prípade obchodných dotazov nás kontaktujte na adrese api@perplexity.ai.

Ďalšie zdroje:
- Začnite s pplx-api tu.
- Vyskúšajte naše online modely zadarmo s Perplexity Labs.
- Viac informácií o našom API nájdete v dokumentácii pplx-api.
- Máte záujem pracovať v tíme s vysokým vplyvom a rýchlym tempom, ktorý buduje najlepší vyhľadávač odpovedí? Pridajte sa k nám!
- Pridajte sa do našej rastúcej komunity na Discorde!
Prispievatelia:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats