Pristatome PPLX internetinius LLM

Pirmoji tokio pobūdžio internetinė LLM API

Perplexity releases first "Live" LLM

Pirmoji tokio pobūdžio internetinė LLM API.

Džiaugiamės galėdami pristatyti du naujus PPLX modelius: pplx-7b-online ir pplx-70b-online! Mūsų internetiniai modeliai orientuoti į naudingų, naujausių ir faktiškų atsakymų teikimą, o viešai jie prieinami per pplx-api, todėl tai yra pirmasis toks API. pplx-7b-online ir pplx-70b-online taip pat pasiekiami per Perplexity Labs – mūsų LLM testavimo aplinką.

LLM pakeitė informacijos paieškos būdus. Tačiau dauguma šiuolaikinių LLM turi du apribojimus:

Nauja informacija: LLM dažnai sunkiai sekasi dalytis naujausia informacija.

Haliucinacijos: LLM taip pat gali pateikti netikslių teiginių.

Mūsų pplx-7b-online ir pplx-70b-online modeliai pašalina esamus apribojimus, atsakymuose papildomai pateikdami naudingos, pagrįstos faktais ir naujausios informacijos.

PPLX internetiniai LLM

Mūsų LLM, pplx-7b-online ir pplx-70b-online, yra internetiaris LLM, nes jie gali naudotis interneto žiniomis, todėl kurdami atsakymą gali pasitelkti naujausią informaciją. Suteikdami savo LLM žinių iš saityno, mūsų modeliai tiksliai atsako į laiko atžvilgiu jautrias užklausas, atverdami žinias, esančias už jų mokymo korpuso ribų. Tai reiškia, kad Perplexity internetiniai LLM gali atsakyti į tokias užklausas kaip „Koks buvo vakar vakaro „Warriors“ rungtynių rezultatas?“, kurios yra sudėtingos neprisijungus veikiantiems modeliams. Apibendrinant, štai kaip veikia mūsų internetinis LLM:

  1. Pasitelkite atvirojo kodo modelius: mūsų PPLX modeliai kuriami mistral-7b ir llama2-70b bazinių modelių pagrindu.
  2. Vidinė paieškos technologijos: mūsų vidinė paieškos, indeksavimo ir nuskaitymo infrastruktūra leidžia papildyti LLM patiems aktualiausiems, naujausiems ir vertingiausiems duomenims. Mūsų paieškos rodyklė yra didelė, reguliariai atnaujinama ir naudoja sudėtingus reitingavimo algoritmus, kad būtų teikiama pirmenybė aukštos kokybės svetainėms, kuriose nenaudojama SEO optimizacija. Svetainių ištraukos, kurias vadiname ištraukomis („snippets“), teikiamos mūsų pplx-online modeliams, kad būtų galima pateikti atsakymus su naujausia informacija.
  3. Tikslusis derinimas: mūsų PPLX modeliai buvo tiksliai suderinti, kad veiksmingai naudotų ištraukas savo atsakymams pagrįsti. Naudodamiesi savo vidiniais duomenų rangovais, mes kruopščiai atrenkame aukštos kokybės, įvairius ir didelius mokymo rinkinius, kad pasiektume puikių rezultatų įvairiais aspektais, tokiais kaip naudingumas, pagrįstumas faktais ir nauja informacija. Mūsų modeliai reguliariai tiksliai suderinami, kad būtų nuolat gerinamas jų veikimas.

Perplexity internetinių LLM vertinimas

Perplexity misija – sukurti geriausią pasaulyje atsakymų variklį, kuriuo žmonės pasitikėtų atrasdami ir plėsdami savo žinias. Kad to pasiektume, mes daug dėmesio skiriame naudingos, faktiškos ir naujausios informacijos teikimui. Kad galėtume palyginti savo LLM veiksmingumą pagal šiuos kriterijus, parengėme vertinimo duomenų rinkinius, atspindinčius sudėtingus, bet realistiškus atsakymų variklių naudojimo atvejus. Kiekvienai užklausai kiekviename vertinimo rinkinyje rangovai gavo du modelio atsako variantus ir turėjo pasirinkti tą, kuris geriau atliko užduotį pagal šiuos kriterijus:

  • Naudingumas: kuris atsakymas geriau atsako į užklausą ir vykdo nurodytas instrukcijas?
  • Faktiškumas: kuris atsakymas pateikia tikslesnius atsakymus be haliucinacijų, net ir į klausimus, reikalaujančius labai tikslių ar nišinių žinių?
  • Nauja informacija (įkvėpta FreshLLMs): kuriame atsakyme pateikiama naujesnė informacija? Modelis pasižymi šiame kriterijuje, jei sugeba atsakyti į užklausas „šviežia“ informacija.

Be trijų aukščiau išvardytų kriterijų, modelio atsakymai taip pat buvo vertinami holistiškai. Norėdami holistiškai įvertinti atsakymus, vertintojų buvo paprašyta pasirinkti atsakymą, kurį jie mieliau gautų iš žmogiškojo padėjėjo, padedančio spręsti užklausą.

Vertinimo rinkinio sudarymas

Šiam vertinimui kruopščiai atrinkome įvairių raginimų rinkinį, kurio tikslas – veiksmingai įvertinti naudingumą, faktiškumą ir naujumą. Kiekvienas raginimas buvo atrinktas rankiniu būdu, užtikrinant aukštą duomenų kokybės ir aktualumo kontrolės lygį. Duomenų rinkinys apima plačią atsakymų variklio raginimų skritį ir apima išsamią mūsų norimų „Perplexity“ pranašumų apžvalgą. Tai labai svarbu norint, kad mūsų modelio našumo vertinimai turėtų didelį signalą.

Kiekviename iš trijų vertinimo rinkinių yra 50 raginimų. Kai kurie pavyzdžiai iš šių rinkinių:

  • Naudingumas: sukurkite visų JAV futbolo žaidėjų, žaidusių Pasaulio taurės finaluose, lentelę ir sukurkite stulpelius jų statistikai, pavyzdžiui, įvarčiams, rezultatyviems perdavimams ir t. t.
  • Faktiškumas: paaiškinkite AISI 1015 ir AISI 1040 plienų kietumą.
  • Nauja informacija: Kuri autonominių automobilių įmonė 2023 metais buvo uždrausta San Fransiske?

Modelio atsakymų generavimas

Įvertinome keturis modelius:

pplx-7b-online: „Perplexity“ modelis, apimantis prieigą prie interneto informacijos. Šis modelis buvo iš naujo suderintas naudojant mistral-7b.

pplx-70b-online: „Perplexity“ modelis, apimantis prieigą prie interneto informacijos. Šis modelis buvo iš naujo suderintas naudojant llama2-70b.

gpt-3.5-turbo-1106: „OpenAI“ modelis, pasiekiamas per API ir be jokių papildomų patobulinimų. Atminkite, kad šį vertinimą atlikome naudodami naujausią gpt-3.5 modelį.

llama2-70b-chat: „Meta AI“ modelis, pasiekiamas per mūsų pplx-api ir be jokių papildomų patobulinimų.

Kiekvienam raginimui pplx-7b-online ir pplx-70b-online modeliams buvo pateikti tie patys paieškos rezultatai ir ištraukos. Visi atsakymai buvo sugeneruoti naudojant tuos pačius hiperparametrus ir sistemos raginimą.

Sistemos raginimas

plaintext
Current date: Monday, November 20, 2023.

Modelio atsakymų reitingavimas atliekant žmogiškąjį vertinimą

Kiekvienam poriniam palyginimui mūsų vidaus rangovams buvo pateiktas pats raginimas, vertinimo kriterijai (t. y. naudingumas, faktiškumas arba naujumas) ir šalia vienas kito rodomi modelio atsakymai. Atsakymų eiliškumas kiekvienu atveju buvo atsitiktinai parinktas, o šaltinio modeliai vertintojui nebuvo atskleisti. Vertintojams buvo nurodyta pasirinkti atsakymą, kuriam jie teikia pirmenybę holistiškai, taip pat nurodyti, kuris geriau veikia pagal konkretų vertinimo kriterijų, leidžiant lygiosioms abiem atvejais. Galiausiai vertintojams buvo leista naudotis internetine paieška, kad patikrintų atsakymų tikslumą. Šiam vertinimui atlikti sukūrėme savo vidinį pirmenybės reitingavimo įrankį.

Vertinimo rezultatai

Kad apskaičiuotume kiekvienos užduoties Elo balus kiekvienam modeliui, naudojame porinio pirmenybės reitingo duomenis, surinktus atliekant žmogiškąjį vertinimą. Elo balai dažniausiai naudojami reitinguojant žaidėjų populiaciją turnyro tipo varžybose, siekiant išmatuoti santykinį žaidėjų pasirodymą. Pritaikyti dideliems kalbos modeliams, šie balai leidžia numatyti, kiek tikėtina, kad žmogus vertintojas teiks pirmenybę vieno modelio išvestiai, o ne kito.

Nors Elo balai paprastai apskaičiuojami palyginimų sekai, siekiant atsižvelgti į žaidėjų gebėjimų pokyčius, mes siekiame įvertinti modelių, kurių gebėjimai negali keistis, veiksmingumą. Atitinkamai mes pritaikome Duan ir kt. aprašytą „Bootstrap Elo“ metodiką, kurią taip pat naudoja lmsys savo Chatbot Arena, o tai reiškia Elo balų apskaičiavimą daugeliui atsitiktinių palyginimų permutacijų. Mūsų skaičiavimams apskaičiavome Elo balus per 5000 permutacijų ir naudojome šių Elo balų pasiskirstymą 95 % pasikliautinuosiams intervalams apskaičiuoti.

Rezultatai, parodyti 1 paveiksle, rodo, kad mūsų PPLX modeliai gali prilygti ir net pranokti gpt-3.5 našumą su Perplexity susijusių naudojimo atvejų srityje. Visų pirma, žmonės vertintojai teikia pirmenybę pplx-7b-online ir pplx-70b-online modelių atsakymams, palyginti su gpt-3.5 ir llama2-70b modelių atsakymais, dėl jų tikslių ir naujausių atsakymų.

pplx-7b-online ir pplx-70b-online veikia geriau nei gpt-3.5 ir llama2-70b pagal naujausios informacijos, faktiškumo ir holistinius kriterijus.

1 pav. Apskaičiuoti Elo balai ir 95 % pasikliautinieji intervalai modeliams pplx-7b (-online), pplx-70b (-online), llama2-70b ir gpt-3.5 keturiuose skirtinguose vertinimo rinkiniuose. Pavyzdžiui, naujausios informacijos ašyje pplx-7b ir pplx-70b veikia geriau nei gpt-3.5 ir llama2-70b, o numatomi Elo balai atitinkamai yra 1100,6 ir 1099,6 lyginant su 879,3 ir 920,3.

Taip pat apskaičiavome porinius laimėjimo rodiklius iš vertinimo. Rezultatai, parodyti 2 paveiksle, rodo, kas galbūt nenuostabu, kad pplx internetinio modelio atsakymai yra pageidaujami kitiems pagal naujausios informacijos ir faktiškumo kriterijus.

2 pav. Vertikaliojoje ašyje esančių modelių laimėjimo rodikliai horizontaliosios ašies modelių atžvilgiu. Pavyzdžiui, pplx-70b (-online) atsakymai buvo įvertinti kaip holistiškai pranašesni už gpt-3.5 64 % užklausų, o gpt-3.5 atsakymai buvo įvertinti kaip holistiškai pranašesni už pplx-70b (-online) 24 % užklausų.

Štai pavyzdys iš mūsų naujausios informacijos vertinimo duomenų rinkinio.

Raginimas: Kiek žmonių JAV turi vairuotojo pažymėjimą?

pplx-7b-online

Prognozuojama, kad 2023 metais Jungtinėse Valstijose bus 243,4 milijono licencijuotų vairuotojų, o tai apima 89 % JAV suaugusiųjų. Šis skaičius padidėjo nuo 238,6 milijono 2022 metais. Licencijuotų vairuotojų procentinė dalis skiriasi įvairiose amžiaus grupėse ir valstijose. Pavyzdžiui, 2019 metais vairuotojo pažymėjimą turėjo 84,1 % JAV gyventojų. Didžiausias licencijuotų vairuotojų procentas yra tarp 25–49 metų amžiaus asmenų – 90,1 % gyventojų turi vairuotojo pažymėjimą. Kalifornijoje buvo 27 milijonai licencijuotų vairuotojų, todėl ji yra valstija, turinti daugiausiai licencijuotų vairuotojų.

pplx-70b-online

2021 metais Jungtinėse Valstijose galiojančius vairuotojo pažymėjimus turėjo apie 233 milijonai žmonių. Prognozuojama, kad iki 2023 metų licencijuotų vairuotojų skaičius JAV pasieks 243,4 milijono, o tai apima 89 % JAV suaugusiųjų. Tai yra padidėjimas nuo 238,6 milijono 2022 metais.

gpt-3.5

Kaip dirbtinio intelekto kalbos modelis, neturiu prieigos prie realaus laiko duomenų. Tačiau apskaičiuota, kad 2021 metais Jungtinėse Valstijose galiojantį vairuotojo pažymėjimą turėjo apie 227 milijonai žmonių. Atminkite, kad nuo tol šis skaičius galėjo pasikeisti, todėl norint gauti tiksliausią informaciją visuomet geriausia kreiptis į naujausią oficialią statistiką.

llama2-70b

Neturiu prieigos prie realaus laiko duomenų, bet galiu pateikti šiek tiek informacijos apie apytikslį žmonių, turinčių vairuotojo pažymėjimą Jungtinėse Valstijose, skaičių. Federalinės greitkelių administracijos duomenimis, 2020 metais Jungtinėse Valstijose buvo maždaug 227,8 milijono licencijuotų vairuotojų. Šis skaičius apima tiek komercinius, tiek nekomercinius vairuotojus. Verta paminėti, kad šis skaičius tikriausiai yra per mažas, nes jame neatsižvelgta į asmenis, kurie gali turėti vairuotojo pažymėjimą, bet vairuoja nereguliariai arba iš viso nevairuoja. Be to, į šį skaičių neįtraukti asmenys, kurie neturi teisės gauti vairuotojo pažymėjimo, pavyzdžiui, jaunesni nei 16 metų amžiaus ar turintys tam tikrą negalią asmenys. Taip pat svarbu pažymėti, kad licencijuotų vairuotojų skaičius gali skirtis priklausomai nuo valstijos, o kai kuriose valstijose licencijuotų vairuotojų procentas yra didesnis nei kitose.

Apskritai vertinimo rezultatai rodo, kad mūsų PPLX modeliai gali prilygti ir net pranokti gpt-3.5 ir llama2-70b su Perplexity susijusių naudojimo atvejų srityje, ypač teikiant tikslius ir naujausius atsakymus.

Prieiga prie Perplexity internetinių modelių

Esame sužavėti galėdami pranešti, kad pplx-api baigia beta fazę ir pereina prie bendrojo viešojo leidimo! Tai pirmas kartas, kai mūsų pplx-7b-online ir pplx-70b-online modeliai yra pasiekiami per pplx-api. Be to, mūsų pplx-7b-chat ir pplx-70b-chat modeliai baigė alfa fazę ir dabar yra pasiekiami su bendruoju leidimu.

Kartu su tuo pristatome naują naudojimu pagrįstą kainų struktūrą. Džiaugiamės, kad mūsų vartotojai naudojasi mūsų pažangiausia infrastruktūra, kurioje naudojami NVIDIA H100s, užtikrinantys itin greitą išvedimą. „Pro“ vartotojai gaus pasikartojančius 5 JAV dolerių mėnesinius pplx-api kreditus. Visiems kitiems vartotojams kaina bus nustatoma pagal naudojimą. Norėdami užsiregistruoti kaip „Pro“ vartotojas, spustelėkite čia. Dėl komercinių užklausų kreipkitės adresu api@perplexity.ai.

PPLX internetinis LLM skydelis

Papildomi ištekliai:

Pagalbininkai:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats