Bemutatkoznak a PPLX online LLM-ek
A maga nemében az első Online LLM API

A maga nemében az első Online LLM API.
Örömmel mutatunk be két új PPLX modellt: pplx-7b-online és pplx-70b-online! Online modelljeink célja, hogy hasznos, naprakész és tényeken alapuló válaszokat adjanak, és a pplx-api-n keresztül nyilvánosan elérhetőek, ami a maga nemében az első ilyen API. A pplx-7b-online és a pplx-70b-online a Perplexity Labs felületén, az LLM játszóterünkön keresztül is elérhető.
Az LLM-ek átalakították az információkeresés módját. A legtöbb mai LLM-nek azonban van két korlátja:
Frissesség: Az LLM-ek gyakran küzdenek a naprakész információk megosztásával.
Halucinációk: Az LLM-ek pontatlan állításokat is kiadhatnak.
A pplx-7b-online és pplx-70b-online modelljeink a válaszaikban hasznos, tényeken alapuló és naprakész információk biztosításával orvosolják a jelenlegi korlátokat.
PPLX Online LLM-ek
LLM-jeink, a pplx-7b-online és a pplx-70b-online, azért online LLM-ek, mert képesek felhasználni az interneten található ismereteket, így a válaszadás során a legnaprakészebb információkra támaszkodhatnak. Azáltal, hogy LLM-jeinket a webes ismeretekkel látjuk el, modelljeink pontosan válaszolnak az időérzékeny lekérdezésekre, feltárva a betanítási korpuszukon túli tudást. Ez azt jelenti, hogy a Perplexity online LLM-jei képesek olyan lekérdezésekre válaszolni, mint a „Mennyi volt a Warriors meccs eredménye tegnap este?”, amelyek nehézséget okoznak az offline modelleknek. Nagy vonalakban így működik az online LLM-ünk:
- Nyílt forráskódú modellek alkalmazása: PPLX modelljeink a
mistral-7bésllama2-70balapmodellekre épülnek. - Saját fejlesztésű keresési technológia: saját fejlesztésű kereső-, indexelő- és webbejáró-infrastruktúránk lehetővé teszi számunkra, hogy az LLM-eket a legrelevánsabb, legfrissebb és legértékesebb információkkal egészítsük ki. Keresési indexünk nagy méretű, rendszeresen frissül, és kifinomult rangsorolási algoritmusokat használ annak biztosítására, hogy a kiváló minőségű, nem SEO-alapú oldalak élvezzenek elsőbbséget. A
pplx-onlinemodelljeink számára webhelyrészleteket – amelyeket „snippeteknek” nevezünk – biztosítunk, hogy a legnaprakészebb információkkal szolgálhassanak. - Finomhangolás: PPLX modelljeinket úgy finomhangoltuk, hogy hatékonyan használják a snippeteket a válaszaik alátámasztására. Saját adatszolgáltatóink segítségével gondosan válogatunk ki magas minőségű, változatos és nagy méretű betanítási készleteket annak érdekében, hogy magas teljesítményt érjünk el olyan szempontok mentén, mint a hasznos jelleg, a ténybeliség és a frissesség. Modelljeinket rendszeresen finomhangoljuk a teljesítmény folyamatos javítása érdekében.
A Perplexity online LLM-jeinek értékelése
A Perplexity küldetése, hogy megépítse a világ legjobb válaszadó motorját – egy olyan motort, amelyben az emberek megbíznak tudásuk felfedezése és bővítése érdekében. Ennek elérése érdekében kiemelten fókuszálunk a hasznos, tényeken alapuló és naprakész információk nyújtására. Annak érdekében, hogy mérjük LLM-jeink teljesítményét ezeken a szempontokon, olyan értékelési adatkészleteket állítottunk össze, amelyek tükrözik a válaszadó motorok kihívást jelentő, de valósághű use case-eit. Az egyes értékelési készletek minden egyes lekérdezése esetében a külsős munkatársak két modellválasztst kaptak, és arra kaptak utasítást, hogy válasszák ki azt a választ, amely jobban teljesített a következő szempontok alapján:
- Hasznos jelleg: melyik válasz felel meg jobban a lekérdezésnek és a megadott utasításoknak?
- Ténybeliség: melyik válasz ad pontosabb válaszokat halucinációk nélkül, még a nagyon precíz vagy réspiaci tudást igénylő kérdések esetén is?
- Frissesség (a FreshLLMs mintájára): melyik válasz tartalmaz frissebb információkat? Egy modell ebben a szempontban akkor jeleskedik, ha képes „friss” információkkal megválaszolni a lekérdezéseket.
A fenti három szempont mellett a modellválaszokat holisztikusan is értékeltük. A válaszok holisztikus értékeléséhez az értékelőket arra kértük, hogy válasszák ki azt a választ, amelyet inkább elfadnának egy emberi asszisztenstől, aki segít a lekérdezésben.
Az értékelési adatkészlet összeállítása
Ehhez az értékeléshez gondosan válogattunk össze egy változatos promptkészletet azzal a céllal, hogy hatékonyan értékeljük a hasznosságot, a ténybeliséget és a frissességet. Minden egyes promptot manuálisan választottunk ki, ami magas szintű ellenőrzést biztosít az adatok minősége és relevanciája felett. Az adatkészlet a válaszadó motorok promptjainak széles skáláját öleli fel, és átfogó áttekintést nyújt arról, hogy miben szeretnénk, hogy a Perplexity kitűnjön. Ez elengedhetetlen ahhoz, hogy a modellteljesítmény-értékeléseink magas jelszinttel rendelkezzenek.
A három értékelési készlet mindegyike 50 promptot tartalmaz. Néhány példa ezekből a készletekből:
- Hasznos jelleg: Készítsen táblázatot az összes olyan USA-beli labdarúgóról, aki játszott a vb-döntőben, és hozzon létre oszlopokat a statisztikáikhoz, például gólok, gólpasszok stb.
- Ténybeliség: Magyarázza el az AISI 1015 és az AISI 1040 acélok szívósságát.
- Naprakészség: Melyik önvezető autókat gyártó céget tiltották ki San Franciscóból 2023-ban?
Modellválaszok generálása
Négy modellt értékeltünk:
pplx-7b-online: A Perplexity modellje, amely hozzáférést biztosít az interneten található információkhoz. Ezt a modellt a mistral-7b felhasználásával finomhangolták.
pplx-70b-online: A Perplexity modellje, amely hozzáférést biztosít az interneten található információkhoz. Ezt a modellt a llama2-70b felhasználásával finomhangolták.
gpt-3.5-turbo-1106: Az OpenAI modellje, amely API-n keresztül érhető el, további kiegészítések nélkül. Ne feledje, hogy ezt az értékelést a legújabb gpt-3.5 modellel végeztük el.
llama2-70b-chat: A Meta AI modellje, amely a pplx-api-nkon keresztül érhető el, további kiegészítések nélkül.
Minden egyes prompthoz ugyanazokat a keresési eredményeket és snippeteket adtuk meg a pplx-7b-online és a pplx-70b-online modelleknek. Minden választ ugyanazon hiperparaméterek és rendszerprompt felhasználásával generáltunk.
Rendszerprompt
Current date: Monday, November 20, 2023.Modellválaszok rangsorolása emberi értékeléssel
Minden egyes párhuzamos összehasonlítás során a házon belüli munkatársaink megkapták magát a promptot, az értékelési szempontokat (azaz a hasznos jelleget, a ténybeliséget vagy a frissességet), valamint egymás mellett megjelenítve a modellválaszokat. A válaszok sorrendjét minden fordulóban véletlenszerűvé tettük, és a forrásmodelleket nem árultuk el az értékelőnek. Az értékelőket arra utasítottuk, hogy válasszák ki azt a választ, amelyet holisztikusan előnyben részesítenek, valamint azt, amelyik jobban teljesít az adott értékelési szempont szerint, mindkét esetben megengedve a döntetlent. Végül az értékelők használhatják az internetes keresést a válaszok pontosságának ellenőrzésére. Az értékelés elvégzéséhez saját, házon belüli preferencia-rangsoroló eszközt hoztunk létre.
Értékelési eredmények
Az emberi értékelésből összegyűjtött páros preferencia-rangsorok alapján számítjuk ki az egyes modellek feladatonkénti Elo-pontszámait. Az Elo-pontszámokat általában arra használják, hogy egy bajnokság jellegű versenyben rangsorolják a játékosok populációját a játékosok relatív teljesítményének mérésére. A nagy nyelvi modellekre alkalmazva ezek a pontszámok előrejelzést adnak arra vonatkozóan, hogy egy emberi értékelő mekkora valószínűséggel részesíti előnyben az egyik modell kimenetét egy másikkal szemben.
Míg az Elo-pontszámokat jellemzően az összehasonlítások sorozatára számítják ki a játékosok képességeinek változásainak figyelembevétele érdekében, mi olyan modellek teljesítményét kívánjuk számszerűsíteni, amelyek képességei nem változhatnak. Ennek megfelelően átvesszük a Duan és mtsai. által leírt és a lmsys által a Chatbot Arena keretében is alkalmazott Bootstrap Elo módszertant, amely magában foglalja az Elo-pontszámok kiszámítását az összehasonlítások számos véletlenszerű permutációjára. Számításainkhoz 5000 permutáción keresztül számítottuk ki az Elo-pontszámokat, és ezen Elo-pontszámok eloszlását használtuk fel a 95%-os konfidenciaintervallumok kiszámításához.
Az 1. ábrán látható eredmények azt mutatják, hogy a PPLX modelljeink képesek felvenni a versenyt, sőt felülmúlni a gpt-3.5 teljesítményét a Perplexity-vel kapcsolatos use case-ek terén. Az emberi értékelők különösen a pplx-7b-online és a pplx-70b-online modell válaszait részesítik előnyben a gpt-3.5 és a llama2-70b modell válaszaival szemben a pontos és naprakész válaszaik miatt.
A pplx-7b-online és a pplx-70b-online jobban teljesít, mint a gpt-3.5 és a llama2-70b, a frissesség, a ténybeliség és a holisztikus szempontok terén.

Kiszámítottuk az értékelésből származó páros győzelmi arányokat is. A 2. ábrán látható eredmények – talán nem meglepő módon – azt illusztrálják, hogy a pplx online modell válaszait részesítik előnyben másokéval szemben a frissesség és a ténybeliség tekintetében.

Íme egy példa a frissesség értékelési adatkészletünkből.
Prompt: Hány embernek van vezetői engedélye az USA-ban?
pplx-7b-online
2023-ban az Egyesült Államokban a becslések szerint 243,4 millió engedéllyel rendelkező járművezető van, ami az USA felnőtt lakosságának 89%-át foglalja magában. Ez a szám a 2022-es 238,6 millióról nőtt. Az engedéllyel rendelkező járművezetők aránya a különböző korosztályok és államok szerint változik. Például 2019-ben az USA lakosságának 84,1%-ának volt jogosítványa. Az engedéllyel rendelkező járművezetők aránya a 25–49 évesek körében a legmagasabb, a lakosság 90,1%-ának van jogosítványa. Kaliforniában 27 millió engedéllyel rendelkező járművezető volt, így ez az állam rendelkezik a legtöbb engedéllyel rendelkező sofőrrel.
pplx-70b-online
2021-ben mintegy 233 millió ember rendelkezett érvényes jogosítvánnyal az Egyesült Államokban. 2023-ra az USA-ban a jogosítvánnyal rendelkező járművezetők száma a előrejelzések szerint eléri a 243,4 milliót, ami az USA felnőtt lakosságának 89%-át foglalja magában. Ez növekedést jelent a 2022-es 238,6 millióhoz képest.
gpt-3.5
Mesterséges intelligencia nyelvi modellként nincs hozzáférésem valós idejű adatokhoz. 2021-ben azonban a becslések szerint mintegy 227 millió ember rendelkezett érvényes jogosítvánnyal az Egyesült Államokban. Felhívjuk figyelmét, hogy ez a szám azóta változhatott, ezért a legpontosabb információkért mindig érdemes a legfrissebb hivatalos statisztikákra támaszkodni.
llama2-70b
Nincs hozzáférésem valós idejű adatokhoz, de tudok szolgálni néhány információval az Egyesült Államokban jogosítvánnyal rendelkező emberek megközelítőleges számáról. A Szövetségi Autópálya-igazgatóság (Federal Highway Administration) szerint 2020-tól kezdődően körülbelül 227,8 millió engedéllyel rendelkező járművezető volt az Egyesült Államokban. Ez a szám magában foglalja a kereskedelmi és a nem kereskedelmi célú járművezetőket is. Érdemes megjegyezni, hogy ez a szám valószínűleg alulbecslés, mivel nem veszi figyelembe azokat a személyeket, akiknek lehet, hogy van jogosítványuk, de nem vezetnek rendszeresen vagy egyáltalán nem vezetnek. Emellett ez a szám nem tartalmazza azokat a személyeket, akik nem jogosultak vezetői engedélyre, például a 16 év alattiakat vagy bizonyos fogyatékossággal élőket. Azt is fontos megjegyezni, hogy az engedéllyel rendelkező járművezetők száma államonként eltérő lehet, és egyes államokban magasabb az engedéllyel rendelkező sofőrök aránya, mint másokban.
Összességében az értékelési eredmények azt mutatják, hogy a PPLX modelljeink képesek felvenni a versenyt, sőt felülmúlni a gpt-3.5 és a llama2-70b teljesítményét a Perplexity-vel kapcsolatos use case-ek terén, különösen a pontos és naprakész válaszok biztosítása tekintetében.
A Perplexity online modelljeinek elérése
Örömmel jelentjük be, hogy a pplx-api elhagyja a béta fázist, és megkezdi az általános nyilvános kiadást! Most először érhető el a pplx-7b-online és a pplx-70b-online modellünk a pplx-api-n keresztül. Emellett a pplx-7b-chat és pplx-70b-chat modelljeink is túljutottak az alfa fázison, és mostantól az általános kiadással érhetők el.
Ezzel együtt bevezetünk egy új, használatalapú árazási struktúrát. Izgatottan várjuk, hogy felhasználóink kihasználják a legmodernebb infrastruktúránkat, amely NVIDIA H100 egységeket használ a villámgyors inferencia biztosításához. A Pro felhasználók havi megújuló 5 dolláros pplx-api kreditekben részesülnek. Minden más felhasználó számára az árak a használat alapján kerülnek meghatározásra. Pro felhasználóként való regisztrációhoz kattintson ide. Kereskedelmi jellegű megkeresésekkel az api@perplexity.ai címen léphet kapcsolatba velünk.

További források:
- Ismerkedjen meg a pplx-api használatával itt.
- Próbálja ki online modelljeinket ingyenesen a Perplexity Labs segítségével.
- Tudjon meg többet az API-nkról a pplx-api dokumentációjában.
- Szeretne egy nagy hatású, dinamikus csapatban dolgozni, amely a legjobb válaszadó motort építi? Csatlakozzon hozzánk!
- Csatlakozzon növekvő Discord közösségünkhöz!
Közreműködők:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats