Predstavljanje PPLX mrežnih LLM-ova

Prvi mrežni LLM API te vrste

Perplexity releases first "Live" LLM

Prvi mrežni LLM API te vrste.

Uzbuđeni smo što možemo podijeliti dva nova PPLX modela: pplx-7b-online i pplx-70b-online! Naši mrežni modeli usmjereni su na pružanje korisnih, ažurnih i činjeničnih odgovora te su javno dostupni putem pplx-api-ja, što ga čini API-jem prve vrste. pplx-7b-online i pplx-70b-online također su dostupni putem Perplexity Labs, našeg LLM poligona.

LLM-ovi su promijenili način na koji pronalazimo informacije. Međutim, većina današnjih LLM-ova ima dva ograničenja:

Ažurnost: LLM-ovi se često bore s dijeljenjem ažurnih informacija.

Halucinacije: LLM-ovi također mogu dati netočne izjave.

Naši modeli pplx-7b-online i pplx-70b-online rješavaju trenutačna ograničenja tako što dodatno pružaju korisne, činjenične i ažurne informacije u svojim odgovorima.

PPLX mrežni LLM-ovi

Naši LLM-ovi, pplx-7b-online i pplx-70b-online, mrežni su LLM-ovi jer mogu koristiti znanje s interneta i stoga mogu iskoristiti najnovije informacije prilikom formiranja odgovora. Pružanjem znanja s weba našim LLM-ovima, naši modeli točno odgovaraju na upite osjetljive na vrijeme, otključavajući znanje izvan svog korpusa za obuku. To znači da Perplexityjevi mrežni LLM-ovi mogu odgovoriti na upite poput „Kakav je bio rezultat utakmice Warriorsa sinoć?” koji predstavljaju izazov za izvanmrežne modele. Na visokoj razini, ovako funkcionira naš mrežni LLM:

  1. Iskoristite modele otvorenog koda: naši se PPLX modeli grade na temeljnim modelima mistral-7b i llama2-70b.
  2. Vlastita tehnologija pretraživanja: naša vlastita infrastruktura za pretraživanje, indeksiranje i indeksiranje sadržaja omogućuje nam obogaćivanje LLM-ova najrelevantnijim, najnovijim i najvrijednijim informacijama. Naš indeks pretraživanja je velik, redovito se ažurira i koristi sofisticirane algoritme rangiranja kako bi se osiguralo davanje prioriteta visokokvalitetnim stranicama koje nisu SEO-optimizirane. Ulomci web-mjesta, koje nazivamo „isječci”, pružaju se našim modelima pplx-online kako bi se omogućili odgovori s najnovijim informacijama.
  3. Fino podešavanje: naši su PPLX modeli fino podešeni kako bi učinkovito koristili isječke za informiranje svojih odgovora. Koristeći naše vlastite ugovorne izvođače radova, pažljivo biramo visokokvalitetne, raznolike i velike skupove za obuku kako bismo postigli visoke performanse u različitim osima kao što su korisnost, činjeničnost i svježina. Naši se modeli redovito fino podešavaju kako bi se kontinuirano poboljšavale performanse.

Procjena Perplexityjevih mrežnih LLM-ova

Misija Perplexityja je izgraditi najbolji svjetski sustav za odgovore – onaj kojem ljudi vjeruju da bi otkrili i proširili svoje znanje. Kako bismo to postigli, duboko smo usredotočeni na pružanje korisnih, činjeničnih i ažurnih informacija. Kako bismo ocijenili performanse naših LLM-ova na tim osima, pripremili Mo skupove podataka za procjenu koji odražavaju izazovne, ali realistične slučajeve upotrebe za tražilice s odgovorima. Za svaki upit u svakom skupu za procjenu, izvođačima su dani odgovori dva modela i upućeni su da odaberu odgovor koji ima bolje performanse za sljedeće kriterije:

  • Korisnost: koji odgovor bolje odgovara na upit i slijedi navedene upute?
  • Činjeničnost: koji odgovor daje točnije odgovore bez halucinacija, čak i za pitanja koja zahtijevaju vrlo precizno ili nišno znanje?
  • Ažurnost (inspirirano FreshLLMs-om): koji odgovor sadrži ažurnije informacije? Model se ističe u ovom kriteriju ako je u stanju odgovoriti na upite s „svježim” informacijama.

Uz gornja tri kriterija, odgovori modela ocijenjeni su i holistički. Kako bi holistički ocijenili odgovore, od ocjenjivača se tražilo da odaberu odgovor koji bi radije primili od ljudskog asistenta koji pomaže u vezi s upitom.

Kodiranje skupa za procjenu

Za ovu procjenu pažljivo smo odabrali raznolik skup upita s ciljem učinkovite procjene korisnosti, činjeničnosti i svježine. Svaki je upit ručno odabran, čime se osigurava visoka razina kontrole nad kvalitetom i relevantnošću podataka. Skup podataka obuhvaća širok raspon upita sustava za odgovore i obuhvaća sveobuhvatan pregled onoga u čemu želimo da Perplexity bude izvrstan. To nam je ključno kako bi naše procjene performansi modela imale visok signal.

Svaki od tri skupa za procjenu sadrži 50 upita. Neki primjeri iz ovih skupova uključuju:

  • Korisnost: Izradite tablicu svih američkih nogometaša koji su igrali u finalu Svjetskog prvenstva i napravite stupce za njihovu statistiku kao što su golovi, asistencije itd.
  • Činjeničnost: Objasnite žilavost čelika AISI 1015 i AISI 1040.
  • Ažurnost: Kojoj je tvrtki za autonomne automobile zabranjen rad u San Franciscu 2023. godine?

Generiranje odgovora modela

Ocijenili smo četiri modela:

pplx-7b-online: Perplexityjev model, koji uključuje pristup informacijama s interneta. Ovaj model je fino podešen pomoću mistral-7b.

pplx-70b-online: Perplexityjev model, koji uključuje pristup informacijama s interneta. Ovaj model je fino podešen pomoću llama2-70b.

gpt-3.5-turbo-1106: OpenAI-jev model, kojem se pristupa putem API-ja i bez dodatnih proširenja. Imajte na umu da smo ovu procjenu proveli koristeći najnoviji model gpt-3.5.

llama2-70b-chat: Model Meta AI-ja, kojem se pristupa putem našeg pplx-api-ja i bez dodatnih proširenja.

Za svaki upit, isti rezultati pretraživanja i isječci su dostavljeni modelima pplx-7b-online i pplx-70b-online. Svi su odgovori generirani korištenjem istih hiperparametara i sistemskog upita.

Sistemski upit

plaintext
Current date: Monday, November 20, 2023.

Rangiranje odgovora modela uz ljudsku procjenu

Za svaku parnu usporedbu, našim internim izvođačima dostavljen je sam upit, kriteriji ocjenjivanja (tj. korisnost, činjeničnost ili svježina) i odgovori modela prikazani jedan pored drugog. Redoslijed odgovora bio je nasumičan u svakom krugu, a izvorni modeli nisu bili otkriveni ocjenjivaču. Ocjenjivači su upućeni da odaberu odgovor koji holistički preferiraju, kao i koji ima bolje performanse prema određenom kriteriju ocjenjivanja, pri čemu su izjednačeni rezultati dopušteni za oba. Konačno, ocjenjivačima je bilo dopušteno koristiti internetsku pretragu kako bi provjerili točnost odgovora. Izgradili smo vlastiti interni alat za rangiranje preferencija za provođenje ove procjene.

Rezultati procjene

Koristimo rangiranja parnih preferencija prikupljena iz ljudske procjene za izračun Elo rezultata po zadatku za svaki model. Elo rezultati obično se koriste za rangiranje populacije igrača u natjecanjima u stilu turnira kako bi se izmjerila relativna izvedba igrača. Kada se primijene na velike jezične modele, ovi rezultati pružaju predviđanje o tome koliko bi ljudski ocjenjivač vjerojatno mogao preferirati izlaz jednog modela u odnosu na drugi.

Iako se Elo rezultati obično izračunavaju za niz usporedbi kako bi se uzele u obzir promjene u sposobnostima igrača, cilj nam je kvantificirati izvedbu modela čije se sposobnosti ne mogu promijeniti. S tim u vezi, usvajamo Bootstrap Elo metodologiju opisanu u Duan i sur. a koju također koristi lmsys za svoju Chatbot Arenu, što podrazumijeva izračunavanje Elo rezultata za mnoge nasumične permutacije usporedbi. Za naše izračune, izračunali smo Elo rezultate preko 5000 permutacija i koristili distribucije tih Elo rezultata za izračun 95%-tnih intervala pouzdanosti.

Rezultati, prikazani na slici 1, pokazuju da naši PPLX modeli mogu parirati i čak nadmašiti performanse gpt-3.5 na slučajevima upotrebe vezanim uz Perplexity. Konkretno, ljudski ocjenjivači preferiraju odgovore modela pplx-7b-online i pplx-70b-online u odnosu na odgovore modela gpt-3.5 i llama2-70b zbog njihovih točnih i ažurnih odgovora.

pplx-7b-online i pplx-70b-online rade bolje od gpt-3.5 i llama2-70b prema kriterijima svježine, činjeničnosti i holističnosti.

Slika 1. Procijenjeni Elo rezultati i 95%-tni intervali pouzdanosti za pplx-7b (-online), pplx-70b (-online), llama2-70b i gpt-3.5 kroz četiri različita skupa za procjenu. Na primjer, na osi svježine, pplx-7b i pplx-70b rade bolje od gpt-3.5 i llama2-70b, s procijenjenim Elo rezultatom od 1100,6 i 1099,6 u odnosu na 879,3 odnosno 920,3.

Također smo izračunali stope pobjeda u parovima iz procjene. Rezultati, prikazani na slici 2, ilustriraju, možda i ne iznenađujuće, da se odgovori pplx mrežnih modela preferiraju u odnosu na druge u pogledu svježine i činjeničnosti.

Slika 2. Stope pobjeda modela na okomitoj osi u odnosu na modele na vodoravnoj osi. Na primjer, odgovori pplx-70b (-online) ocijenjeni su kao holistički superiorniji u odnosu na gpt-3.5 na 64% upita, a odgovori gpt-3.5 ocijenjeni su kao holistički superiorniji u odnosu na pplx-70b (-online) na 24% upita.

Ovo je primjer iz našeg skupa podataka za procjenu svježine.

Upit: Koliko ljudi u SAD-u ima vozačku dozvolu?

pplx-7b-online

U 2023. godini predviđa se 243,4 milijuna vozača s dozvolom u Sjedinjenim Američkim Državama, što uključuje 89% odraslih u SAD-u. Taj se broj povećao s 238,6 milijuna u 2022. Postotak vozača s dozvolom razlikuje se među različitim dobnim skupinama i saveznim državama. Na primjer, u 2019. godini 84,1% stanovništva SAD-a imalo je vozačku dozvolu. Najveći postotak vozača s dozvolom je među osobama u dobi od 25 do 49 godina, pri čemu 90,1% stanovništva ima vozačku dozvolu. U Kaliforniji je bilo 27 milijuna vozača s dozvolom, što je čini saveznom državom s najvećim brojem vozača s dozvolom.

pplx-70b-online

Godine 2021. oko 233 milijuna ljudi posjedovalo je važeće vozačke dozvole u Sjedinjenim Američkim Državama. Do 2023. godine predviđa se da će broj vozača s dozvolom u SAD-u dosegnuti 243,4 milijuna, što uključuje 89% odraslih u SAD-u. To predstavlja porast s 238,6 milijuna u 2022.

gpt-3.5

Kao AI jezični model, nemam pristup podacima u stvarnom vremenu. Međutim, od 2021. procjenjuje se da je oko 227 milijuna ljudi u Sjedinjenim Američkim Državama posjedovalo važeću vozačku dozvolu. Imajte na umu da se ovaj broj možda otada promijenio, pa je uvijek najbolje pogledati najnovije službene statistike za najtočnije informacije.

llama2-70b

Nemam pristup podacima u stvarnom vremenu, ali mogu pružiti neke informacije o približnom broju ljudi u Sjedinjenim Američkim Državama koji imaju vozačku dozvolu. Prema Saveznoj upravi za autoceste, u Sjedinjenim Američkim Državama bilo je približno 227,8 milijuna vozača s dozvolom od 2020. godine. Ovaj broj uključuje i komercijalne i nekomercijalne vozače. Vrijedi napotomenuti da je ovaj broj vjerojatno podcijenjen jer ne uzima u obzir pojedince koji možda imaju vozačku dozvolu, ali ne voze redovito ili uopće. Osim toga, ovaj broj ne uključuje pojedince koji ne ispunjavaju uvjete za vozačku dozvolu, kao što su mlađi od 16 godina ili osobe s određenim invaliditetom. Također je važno napomenuti da se broj vozača s dozvolom može razlikovati ovisno o saveznoj državi, pri čemu neke savezne države imaju veći postotak vozača s dozvolom od drugih.

Sve u svemu, rezultati procjene pokazuju da naši PPLX modeli mogu parirati i čak nadmašiti gpt-3.5 i llama2-70b na slučajevima upotrebe vezanim uz Perplexity, posebno u pružanju točnih i ažurnih odgovora.

Pristup Perplexityjevim mrežnim modelima

Oduševljeni smo što možemo objaviti da pplx-api prelazi iz beta faze u opće javno izdanje! Ovo je prvi put da su naši modeli pplx-7b-online i pplx-70b-online dostupni putem pplx-api-ja. Dodatno, naši modeli pplx-7b-chat i pplx-70b-chat izašli su iz alfa faze i sada su dostupni s našim općim izdanjem.

Uz ovo, uvodimo novu strukturu cijena koja se temelji na korištenju. Uzbuđeni smo što će naši korisnici koristiti našu najsuvremeniju infrastrukturu, koja koristi NVIDIA H100 grafičke procesore za pružanje munjevito brze inferencije. Pro korisnici dobit će stalni mjesečni pplx-api kredit u iznosu od 5 USD. Za sve ostale korisnike cijene će se određivati na temelju korištenja. Da biste se registrirali kao Pro korisnik, kliknite ovdje. Obratite nam se na api@perplexity.ai za komercijalne upite.

PPLX mrežna LLM nadzorna ploča

Dodatni resursi:

Doprinositelji:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats