Predstavljamo PPLX mrežne LLM-ove
Prvi API za mrežne LLM-ove ove vrste

Prvi API za mrežne LLM-ove ove vrste.
Sa uzbuđenjem delimo dva nova PPLX modela: pplx-7b-online i pplx-70b-online! Naši mrežni modeli usmereni su na pružanje korisnih, ažurnih i činjeničnih odgovora i javno su dostupni putem pplx-api interfejsa, što ga čini API-jem prve vrste te vrste. pplx-7b-online i pplx-70b-online su takođe dostupni preko Perplexity Labs okruženja za testiranje LLM-ova.
LLM-ovi su transformisali način na koji pronalazimo informacije. Međutim, postoje dva ograničenja kod većine današnjih LLM-ova:
Ažurnost: LLM-ovi se često bore sa deljenjem ažurnih informacija.
Halucinacije: LLM-ovi takođe mogu davati netačne izjave.
Naši modeli pplx-7b-online i pplx-70b-online rešavaju trenutna ograničenja tako što u svojim odgovorima dodatno pružaju korisne, činjenične i ažurne informacije.
PPLX mrežni LLM-ovi
Naši LLM-ovi, pplx-7b-online i pplx-70b-online, jesu mrežni LLM-ovi zato što mogu koristiti znanje sa interneta, te stoga mogu iskoristiti najnovije informacije prilikom formiranja odgovora. Pružanjem znanja sa veba našim LLM-ovima, naši modeli precizno odgovaraju na upite osetljive na vreme, otključavajući znanje izvan njihovog korpusa za obuku. To znači da Perplexity-jevi mrežni LLM-ovi mogu odgovoriti na upite poput „Kakav je bio rezultat utakmice Voriorsa sinoc?“, koji predstavljaju izazov za vanmrežne modele. Na višem nivou, ovako funkcioniše naš mrežni LLM:
- Iskorišćavanje modela otvorenog koda: naši PPLX modeli se grade na vrhu osnovnih modela
mistral-7billama2-70b. - Sopstvena tehnologija pretrage: naša sopstvena infrastruktura za pretragu, indeksiranje i pretraživanje omogućava nam da obogatimo LLM-ove najrelevantnijim, najnovijim i najvrednijim informacijama. Naš indeks pretrage je veliki, redovno se ažurira i koristi sofisticirane algoritme rangiranja kako bi se osiguralo da se prioritet dâ visokokvalitetnim sajtovima koji nisu optimizovani za pretraživače (SEO). Izvodi sa veb-sajtova, koje nazivamo „isječcima“, obezbeđuju se našim
pplx-onlinemodelima kako bi se omogućili odgovori sa najnovijim informacijama. - Naknadno podešavanje (Fine-tuning): naši PPLX modeli su naknadno podešeni da efikasno koriste isečke za informisanje svojih odgovora. Korišćenjem naših internih ugovarača podataka, pažljivo pripremamo visokokvalitetne, raznovrsne i velike skupove podataka za obuku kako bismo postigli visoke performanse u različitim segmentima kao što su korisnost, činjeničnost i svežina. Naši modeli se redovno fino podešavaju kako bi se kontinuirano poboljšavale performanse.
Procena Perplexity-jevih mrežnih LLM-ova
Misija kompanije Perplexity je da izgradi najbolji mašinski sistem za odgovore na svetu – onaj kome ljudi veruju da otkriju i prošire svoje znanje. Da bismo to postigli, duboko smo fokusirani na pružanje korisnih, činjeničnih i ažurnih informacija. Da bismo uporedili performanse naših LLM-ova po ovim kriterijumima, pripremilićemo skupove podataka za procenu kako bismo odrazili izazovne, ali realne slučajeve korišćenja za sisteme za odgovore. Za svaki upit u svakom skupu za procenu, ugovaračima su dati odgovori dva modela i instruisani su da izaberu odgovor koji je ostvario bolje rezultate prema sledećim kriterijumima:
- Korisnost: koji odgovor bolje odgovara na upit i prati navedena uputstva?
- Činjeničnost: koji odgovor pruža tačnije odgovore bez halucinacija, čak i za pitanja koja zahtevaju vrlo precizno ili nišno znanje?
- Svežina (inspirisana FreshLLMs): koji odgovor sadrži ažurnije informacije? Model se ističe u ovom kriterijumu ako je u stanju da odgovori na upite sa „svežim“ informacijama.
Pored tri gornja kriterijuma, odgovori modela su takođe procenjeni holistički. Da bi se odgovori procenili holistički, od procenjivača je zatraženo da izaberu odgovor koji bi radije primili od ljudskog asistenta koji pomaže u vezi sa upitom.
Priprema skupa za procenu
Za ovu procenu pažljivo smo pripremili raznovrstan skup upita sa ciljem da efikasno procenimo korisnost, činjeničnost i svežinu. Svaki upit je ručno izabran, čime se obezbeđuje visok nivo kontrole nad kvalitetom i relevantnošću podataka. Skup podataka obuhvata širok spektar upita za mašinske sisteme za odgovore i obuhvata sveobuhvatan pregled onoga u čemu želimo da Perplexity bude izvanredan. Ovo je ključno za nas kako bi naše procene performansi modela imale visok signal.
Svaki od tri skupa za procenu sadrži 50 upita. Neki primeri iz ovih skupova uključuju:
- Korisnost: Napravite tabelu svih američkih fudbalera koji su igrali u finalu Svetskog prvenstva i napravite kolone za njihovu statistiku kao što su golovi, asistencije itd.
- Činjeničnost: Objasnite žilavost čelika AISI 1015 i AISI 1040.
- Ažurnost: Koja kompanija za autonomne automobile je zabranjena u San Francisku 2023. godine?
Generisanje odgovora modela
Procena je izvršena za četiri modela:
pplx-7b-online: Perplexity-jev model, koji uključuje pristup informacijama sa interneta. Ovaj model je fino podešen korišćenjem modela mistral-7b.
pplx-70b-online: Perplexity-jev model, koji uključuje pristup informacijama sa interneta. Ovaj model je fino podešen korišćenjem modela llama2-70b.
gpt-3.5-turbo-1106: OpenAI model, kome se pristupa preko API-ja i bez dodatnih proširenja. Imajte na umu da smo ovu procenu sproveli koristeći najnoviji model gpt-3.5.
llama2-70b-chat: Model kompanije Meta AI, kome se pristupa preko našeg pplx-api interfejsa i bez dodatnih proširenja.
Za svaki upit, isti rezultati pretrage i isečci obezbeđeni su modelima pplx-7b-online i pplx-70b-online. Svi odgovori su generisani korišćenjem istih hiperparametara i sistemskog upita.
Sistemski upit
Current date: Monday, November 20, 2023.Rangiranje odgovora modela pomoću ljudske procene
Za svako upoređivanje u parovima, našim internim ugovaračima su obezbeđeni sam upit, kriterijumi procene (tj. korisnost, činjeničnost ili svežina) i odgovori modela prikazani jedni pored drugih. Redosled odgovora je nasumično određen u svakom krugu, a izvorni modeli nisu otkriveni procenjivaču. Procenjivači su dobili uputstvo da izaberu odgovor koji holistički preferiraju, kao i koji model bolje obavlja zadatak prema specifičnom kriterijumu procene, pri čemu su izjednačeni ishodi dozvoljeni za oba. Konačno, procenjivačima je bilo dozvoljeno da koriste internet pretragu kako bi proverili tačnost odgovora. Izgradili smo sopstveni interni alat za rangiranje preferencija za sprovođenje ove procene.
Rezultati procene
Koristimo rangiranja preferencija u parovima prikupljena iz ljudske procene da bismo izračunali Elo rezultate po zadatku za svaki model. Elo rezultati se obično koriste za rangiranje populacije igrača u takmičenjima turnirskog tipa radi merenja relativnih performansi igrača. Kada se primene na velike jezičke modele, ovi rezultati pružaju predviđanje o tome kolika je verovatnoća da će ljudski procenjivač dati prednost izlaznim podacima jednog modela u odnosu na drugi.
Dok se Elo rezultati obično izračunavaju za niz poređenja kako bi se uzele u obzir promene u sposobnostima igrača, mi težimo da kvantifikujemo performanse modela čije se sposobnosti ne mogu menjati. Shodno tome, usvajamo Bootstrap Elo metodologiju opisšanu u Duan i sar. a koju takođe koristi lmsys za svoju Chatbot Arenu, što podrazumeva izračunavanje Elo rezultata za mnoge nasumične permutacije poređenja. Za naše proračune, izračunali smo Elo rezultate preko 5000 permutacija i koristili distribucije ovih Elo rezultata za izračunavanje intervala poverenja od 95%.
Rezultati prikazani na slici 1 pokazuju da naši PPLX modeli mogu da se nose sa performansama modela gpt-3.5 i čak ih premaše u slučajevima korišćenja u vezi sa sistemom Perplexity. Konkretno, ljudski procenjivači daju prednost odgovorima modela pplx-7b-online i pplx-70b-online u odnosu na odgovore modela gpt-3.5 i llama2-70b zbog njihovih tačnih i ažurnih odgovora.
Modeli pplx-7b-online i pplx-70b-online rade bolje od modela gpt-3.5 i llama2-70b prema kriterijumima svežine, činjeničnosti i holističkog pristupa.

Takođe smo izračunali stopu pobeda u parovima iz procene. Rezultati, prikazani na slici 2, ilustruju, možda bez iznenađenja, da su odgovori mrežnog modela pplx poželjniji u odnosu na druge na polju svežine i činjeničnosti.

Evo primera iz našeg skupa podataka za procenu svežine.
Upit: Koliko ljudi u SAD ima vozačku dozvolu?
pplx-7b-online
Godine 2023. procenjuje se da u Sjedinjenim Američkim Državama ima 243,4 miliona vozača sa dozvolom, što obuhvata 89% odraslih u SAD. Ovaj broj je porastao sa 238,6 miliona u 2022. godini. Procenat vozača sa dozvolom varira u različitim starosnim grupama i saveznim državama. Na primer, 2019. godine 84,1% stanovništva SAD imalo je vozačku dozvolu. Najveći procenat vozača sa dozvolom je među osobama starosti od 25 do 49 godina, pri čemu 90,1% stanovništva ima vozačku dozvolu. U Kaliforniji je bilo 27 miliona vozača sa dozvolom, što je čini saveznom državom sa najvećim brojem vozača sa dozvolom.
pplx-70b-online
Godine 2021. oko 233 miliona ljudi posedovalo je važeće vozačke dozvole u Sjedinjenim Američkim Državama. Do 2023. godine predviđa se da će broj vozača sa dozvolom u SAD dostignuti 243,4 miliona, što uključuje 89% odraslih u SAD. Ovo predstavlja povećanje sa 238,6 miliona u 2022. godini.
gpt-3.5
Kao model veštačke inteligencije, nemam pristup podacima u realnom vremenu. Međutim, od 2021. godine procenjuje se da je oko 227 miliona ljudi u Sjedinjenim Američkim Državama posedovalo važeću vozačku dozvolu. Imajte na umu da se ovaj broj možda promenilo od tada, pa je uvek najbolje da se obratite najnovijim zvaničnim statistikama za najtačnije informacije.
llama2-70b
Nemam pristup podacima u realnom vremenu, ali mogu da pružim neke informacije o približnom broju ljudi u Sjedinjenim Američkim Državama koji imaju vozačku dozvolu. Prema podacima Savezne uprave za puteve, u Sjedinjenim Američkim Državama je od 2020. godine bilo približno 227,8 miliona vozača sa dozvolom. Ovaj broj obuhvata i komercijalne i nekomercijalne vozače. Vredi napomenuti da je ovaj broj verovatno potcenjen, pošto ne uzima u obzir pojedince koji možda imaju vozačku dozvolu ali ne voze redovno ili uopšte ne voze. Pored toga, ovaj broj ne uključuje pojedince koji ne ispunjavaju uslove za vozačku dozvolu, kao što su oni mlađi od 16 godina ili sa određenim invaliditetom. Takođe je važno napomenuti da broj vozača sa dozvolom može varirati u zavisnosti od savezne države, pri čemu neke savezne države imaju veći procenat vozača sa dozvolom od drugih.
Sve u svemu, rezultati procene pokazuju da naši PPLX modeli mogu da se nose i čak nadmaše gpt-3.5 i llama2-70b u slučajevima korišćenja u vezi sa sistemom Perplexity, posebno u pogledu pružanja tačnih i ažurnih odgovora.
Pristup mrežnim modelima sistema Perplexity
Sa zadovoljstvom objavljujemo da pplx-api izlazi iz beta faze i prelazi u opštu javnu distribuciju! Ovo je prvi put da su naši modeli pplx-7b-online i pplx-70b-online dostupni preko interfejsa pplx-api. Pored toga, naši modeli pplx-7b-chat i pplx-70b-chat su izašli iz alfa faze i sada su dostupni u okviru naše opšte distribucije.
Uz ovo, uvodimo novu strukturu cena zasnovanu na korišćenju. Uzbuđeni smo što će naši korisnici iskoristiti našu vrhunsku infrastrukturu, koja koristi NVIDIA H100s jedinice za pružanje izuzetno brzog zaključivanja. Pro korisnici će dobiti mesečni kredit za pplx-api u iznosu od 5 dolara koji se obnavlja. Za sve ostale korisnike, cena će se određivati na osnovu korišćenja. Da biste se registrovali kao Pro korisnik, kliknite ovde. Za komercijalne upite obratite nam se na api@perplexity.ai.

Dodatni resursi:
- Započnite sa radom uz pplx-api ovde.
- Isprobajte naše mrežne modele besplatno uz Perplexity Labs.
- Saznajte više o našem API-ju putem dokumentacije za pplx-api.
- Zainteresovani ste za rad u timovima sa velikim uticajem i visokom brzinom rada koji grade najbolji sistem za odgovore? Pridružite nam se!
- Pridružite se našoj rastućoj Discord zajednici!
Dobrinosioci:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats