Představujeme online LLM PPLX
První online LLM API svého druhu

První online LLM API svého druhu.
S radostí představujeme dva nové modely PPLX: pplx-7b-online a pplx-70b-online! Naše online modely se zaměřují na poskytování užitečných, aktuálních a faktických odpovědí a jsou veřejně dostupné prostřednictvím pplx-api, což z něj činí API svého druhu. pplx-7b-online a pplx-70b-online jsou také přístupné přes Perplexity Labs, náš LLM playground.
LLM proměnily způsob, jakým vyhledáváme informace. Většina současných LLM však má dvě omezení:
Aktuálnost: LLM mají často potíže s poskytováním aktuálních informací.
Halucinace: LLM mohou také generovat nepřesná tvrzení.
Naše modely pplx-7b-online a pplx-70b-online řeší současná omezení tím, že ve svých odpovědích navíc poskytují užitečné, faktické a aktuální informace.
Online LLM PPLX
Naše LLM, pplx-7b-online a pplx-70b-online, jsou online LLM, protože dokážou využívat znalosti z internetu, a mohou tak při vytváření odpovědí čerpat z nejaktuálnějších informací. Tím, že našim LLM poskytujeme znalosti z webu, naše modely přesně odpovídají na dotazy závislé na čase a odemykají znalosti nad rámec jejich tréninkového korpusu. To znamená, že online LLM od Perplexity dokážou odpovídat na dotazy jako „Jaké bylo včera skóre zápasu Warriors?“, které jsou pro offline modely náročné. Zde je ve zkratce fungování našeho online LLM:
- Využití open-source modelů: naše modely PPLX staví na základních modelech
mistral-7ballama2-70b. - Vlastní vyhledávací technologie: naše vlastní vyhledávací, indexovací a crawlovací infrastruktura nám umožňuje doplňovat LLM o ty nejrelevantnější, nejaktuálnější a nejcennější informace. Náš vyhledávací index je rozsáhlý, pravidelně aktualizovaný a používá sofistikované hodnící algoritmy, které zajišťují prioritu pro vysoce kvalitní weby bez SEO manipulací. Úryvky z webových stránek, kterým říkáme „snippetky“, jsou poskytovány našim modelům
pplx-online, aby umožnily odpovědi s nejaktuálnějšími informacemi. - Jemné dolaďování (fine-tuning): naše modely PPLX byly doladěny tak, aby efektivně využívaly úryvky k informování svých odpovědí. Pomocí našich interních dodavatelů dat pečlivě vybíráme vysoce kvalitní, různorodé a rozsáhlé trénovací sady, abychom dosáhli vysokého výkonu v různých oblastech, jako je užitečnost, faktičnost a aktuálnost. Naše modely jsou pravidelně dolaďovány, aby se jejich výkon neustále zlepšoval.
Vyhodnocení online LLM od Perplexity
Posláním Perplexity je vybudovat nejlepší vyhledávač odpovědí na světě – takový, kterému lidé důvěřují při objevování a rozšiřování svých znalostí. Abychom toho dosáhli, zaměřujeme se na poskytování užitečných, faktických a aktuálních informací. K otestování výkonu našich LLM v těchto oblastech jsme sestavili evaluační datové sady, které odrážejí náročné, avšak realistické případy použití pro vyhledávače odpovědí. Pro každý dotaz v každé evaluační sadě dostali dodavatelé dvě odpovědi modelu a měli za úkol vybrat odpověď, která si vedla lépe podle následujících kritérií:
- Užitečnost: která odpověď lépe odpovídá na dotaz a dodržuje zadané pokyny?
- Faktičnost: která odpověď poskytuje přesnější odpovědi bez halucinací, a to i pro otázky vyžadující velmi přesné nebo úzce zaměřené znalosti?
- Aktuálnost (inspirováno FreshLLMs): která odpověď obsahuje aktuálnější informace? Model v tomto kritériu vyniká, pokud dokáže odpovídat na dotazy pomocí „čerstvých“ informací.
Kromě tří výše uvedených kritérií byly odpovědi modelů hodnoceny také holisticky. Pro holistické hodnocení byli hodnotitelé požádáni, aby vybrali odpověď, kterou by raději dostali od lidského asistenta, jenž s dotazem pomáhá.
Sestavení evaluační sady
Pro toto hodnocení jsme pečlivě vybrali různorodou sadu promptů s cílem efektivně vyhodnotit užitečnost, faktičnost a aktuálnost. Každý prompt byl vybrán ručně, což zajišťuje vysokou míru kontroly nad kvalitou a relevancí dat. Datová sada pokrývá širokou škálu promptů pro vyhledávače odpovědí a zahrnuje komplexní přehled toho, v čem chceme, aby Perplexity vynikalo. To je pro nás zásadní, aby hodnocení výkonu našeho modelu mělo vysokou vypovídací hodnotu.
Každá ze tří evaluačních sad obsahuje 50 promptů. Některé příklady z těchto sad zahrnují:
- Užitečnost: Vytvořte tabulku všech amerických fotbalových hráčů, kteří hráli ve finále mistrovství světa, a vytvořte sloupce pro jejich statistiky, jako jsou góly, asistence atd.
- Faktičnost: Vysvětlete houževnatost ocelí AISI 1015 a AISI 1040.
- Aktuálnost: Která společnost zabývající se autonomními vozy dostala v roce 2023 v San Francisu zákaz?
Generování odpovědí modelů
Vyhodnotili jsme čtyři modely:
pplx-7b-online: Model od Perplexity, který zahrnuje přístup k informacím z internetu. Tento model byl doladěn pomocí mistral-7b.
pplx-70b-online: Model od Perplexity, který zahrnuje přístup k informacím z internetu. Tento model byl doladěn pomocí llama2-70b.
gpt-3.5-turbo-1106: Model od OpenAI, přístupný přes API a bez dalších vylepšení. Všimněte si, že toto hodnocení jsme provedli pomocí nejnovějšího modelu gpt-3.5.
llama2-70b-chat: Model od Meta AI, přístupný přes naše pplx-api a bez dalších vylepšení.
Pro každý prompt byly modelům pplx-7b-online a pplx-70b-online poskytnuty stejné výsledky vyhledávání a úryvky. Všechny odpovědi byly generovány pomocí stejných hyperparametrů a systémového promptu.
Systémový prompt
Current date: Monday, November 20, 2023.Hodnocení odpovědí modelů pomocí lidského hodnocení
Pro každé párové porovnání dostali naši interní dodavatelé samotný prompt, evaluační kritéria (tj. užitečnost, faktičnost nebo aktuálnost) a odpovědi modelů zobrazené vedle sebe. Pořadí odpovědí bylo v každém kole náhodně promícháno a zdrojové modely nebyly hodnotiteli odhaleny. Hodnotitelé dostali pokyn vybrat odpověď, kterou globálně preferují, a také to, která si vede lépe v konkrétním evaluačním kritériu, přičemž u obou byla povolena remíza. Nakonec mohli hodnotitelé k ověření přesnosti odpovědí použít internetové vyhledávání. K provedení tohoto hodnocení jsme vytvořili vlastní interní nástroj pro hodnocení preferencí.
Výsledky hodnocení
K výpočtu skóre Elo pro jednotlivé úkoly pro každý model používáme žebříčky párových preferencí shromážděné z lidského hodnocení. Skóre Elo se běžně používá k řazení populace hráčů v turnajových soutěžích za účelem měření relativního výkonu hráčů. Při použití na velké jazykové modely poskytují tato skóre předpověď toho, jak moc by lidský hodnotitel mohl upřednostnit výstup jednoho modelu před druhým.
Zatímco skóre Elo se obvykle počítá pro sekvenci porovnání, aby se zohlednily změny schopností hráčů, naším cílem je kvantifikovat výkon modelů, jejichž schopnosti se měnit nemohou. Proto přψjímáme metodiku Bootstrap Elo popsanou v Duan a kol. a rovněž využívanou lmsys pro jejich Chatbot Arenu, což obnáší výpočet skóre Elo pro mnoho náhodných permutací porovnání. Pro naše výpočty jsme spočítali skóre Elo pro 5 000 permutací a pomocí distribucí těchto skóre Elo jsme vypočítali 95% intervaly spolehlivosti.
Výsledky zobrazené na obrázku 1 ukazují, že naše modely PPLX se vyrovnají výkonu gpt-3.5 v případech použití souvisejících s Perplexity a mohou jej dokonce překonat. Zejména odpovědi modelů pplx-7b-online a pplx-70b-online jsou lidskými hodnotiteli upřednostňovány před odpovědmi modelů gpt-3.5 a llama2-70b pro jejich přesné a aktuální odpovědi.
pplx-7b-online a pplx-70b-online fungují lépe než gpt-3.5 a llama2-70b v kritériích aktuálnosti, faktičnosti a holistického hodnocení.

Z hodnocení jsme rovněž vypočítali míru výher v párových srovnáních. Výsledky, které jsou znázorněny na obrázku 2, možná nepřekvapivě ilustrují, že odpovědi online modelů pplx jsou preferovány před ostatními v oblasti aktuálnosti a faktičnosti.

Zde je příklad z naší evaluační sady zaměřené na aktuálnost.
Prompt: Kolik lidí v USA má řidičský průkaz?
pplx-7b-online
V roce 2023 se v USA předpokládá 243,4 milionu řidičů s platným řidičským průkazem, což zahrnuje 89 % dospělých v USA. Tento počet se zvýšil z 238,6 milionu v roce 2022. Procento držitelů řidičského průkazu se liší podle věkových skupin a států. Například v roce 2019 mělo řidičský průkaz 84,1 % populace USA. Nejvyšší procento držitelů řidičského průkazu je ve věkové skupině 25 až 49 let, kde řidičský průkaz vlastní 90,1 % populace. V Kalifornii bylo 27 milionů řidičů s platným průkazem, což z ní činí stát s nejvyšším počtem držitelů řidičského průkazu.
pplx-70b-online
V roce 2021 mělo ve Spojených státech platný řidičský průkaz přibližně 233 milionů lidí. Do roku 2023 se předpokládá, že počet řidičů s řidičským průkazem v USA dosáhne 243,4 milionu, což zahrnuje 89 % dospělých v USA. To představuje nárůst z 238,6 milionu v roce 2022.
gpt-3.5
Jako jazykový model AI nemám přístup k datům v reálném čase. Od roku 2021 se však odhadovalo, že platný řidičský průkaz ve Spojených státech vlastní přibližně 227 milionů lidí. Vezměte prosím na vědomí, že toto číslo se od té doby mohlo změnit, takže pro nejaktuálnější informace je vždy nejlepší nahlédnout do nejnovějších oficiálních statistik.
llama2-70b
Nemám přístup k datům v reálném čase, ale mohu poskytnout určité informace o přibližném počtu lidí ve Spojených státech, kteří mají řidičský průkaz. Podle Federální správní rady pro dálnice (Federal Highway Administration) bylo v USA k roku 2020 přibližně 227,8 milionu držitelů řidičského průkazu. Toto číslo zahrnuje komerční i nekomerční řidiče. Stojí za zmínku, že toto číslo je pravděpodobně podhodnocené, protože nezohledňuje jedince, kteří mohou mít řidičský průkaz, ale neřídí pravidelně nebo vůbec. Toto číslo navíc nezahrnuje osoby, které nemají na řidičský průkaz nárok, například osoby mladší 16 let nebo osoby s určitým postižením. Je také důležité si uvědomit, že počet držitelů řidičského průkazu se může v jednotlivých státech lišit, přičemž některé státy mají vyšší procento držitelů řidičského průkazu než jiné.
Celkově výsledky hodnocení ukazují, že naše modely PPLX se mohou vyrovnat gpt-3.5 a llama2-70b v případech použití souvisejících s Perplexity a dokonce je překonat, zejména v poskytování přesných a aktuálních odpovědí.
Přístup k online modelům Perplexity
S nadšením oznamujeme, že pplx-api přechází z fáze beta do ostrého provozu pro širokou veřejnost! Poprvé jsou naše modely pplx-7b-online a pplx-70b-online přístupné prostřednictvím pplx-api. Naše modely pplx-7b-chat a pplx-70b-chat jsou navíc venku z fáze alfa a jsou nyní dostupné v rámci běžného vydání.
Současně zavádíme novou cenovou strukturu založenou na využívání. Těší nás, že naši uživatelé budou moci využívat naši špičkovou infrastrukturu, která využívá NVIDIA H100 k zajištění bleskově rychlé inference. Uživatelé verze Pro obdrží opakující se měsíční kredit ve výši 5 $ pro pplx-api. Pro všechny ostatní uživatele bude cena určena na základě využití. Chcete-li se zaregistrovat jako uživatel Pro, klikněte sem. V případě komerčních dotazů nás kontaktujte na adrese api@perplexity.ai.

Další zdroje:
- Začněte s pplx-api zde.
- Vyzkoušejte naše online modely zdarma s Perplexity Labs.
- Zjistěte více o našem API prostřednictvím dokumentace k pplx-api.
- Máte zájem pracovat v týmu s vysokým dopadem a tempem, který buduje ten nejlepší vyhledávač odpovědí? Připojte se k nám!
- Připojte se k naší rostoucí komunitě na Discordu!
Přispěvatelé:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats