Vă prezentăm modelele LLM online PPLX
Primul API de modele lingvistice mari online de acest gen

Primul API de modele lingvistice mari (LLM) online de acest gen.
Suntem încântați să vă prezentăm două noi modele PPLX: pplx-7b-online și pplx-70b-online! Modelele noastre online se concentrează pe furnizarea de răspunsuri utile, actualizate și bazate pe fapte și sunt disponibile public prin intermediul pplx-api, fiind primul API de acest gen. pplx-7b-online și pplx-70b-online pot fi accesate și prin intermediul Perplexity Labs, mediul nostru de testare pentru modele lingvistice mari.
Modelele lingvistice mari (LLM) au transformat modul în care găsim informații. Cu toate acestea, există două limitări pentru majoritatea modelelor LLM de astăzi:
Actualizare: modelele LLM întâmpină adesea dificultăți în partajarea de informații actualizate.
Halucinații: de asemenea, modelele LLM pot genera afirmații inexacte.
Modelele noastre pplx-7b-online și pplx-70b-online abordează limitările actuale oferind suplimentar informații utile, bazate pe fapte și actualizate în răspunsurile lor.
Modele LLM online PPLX
Modelele noastre LLM, pplx-7b-online și pplx-70b-online, sunt modele LLM online deoarece pot utiliza cunoștințe de pe internet și, prin urmare, pot valorifica cele mai actualizate informații atunci când formulează un răspuns. Oferind modelelor noastre LLM cunoștințe de pe web, modelele noastre răspund cu precizie la interogări sensibile la timp, deblocând cunoștințe dincolo de corpusul lor de antrenament. Aceasta înseamnă că modelele LLM online ale Perplexity pot răspunde la interogări precum „Care a fost scorul meciului echipei Warriors aseară?”, care sunt dificile pentru modelele offline. La un nivel înalt, așa funcționează modelul nostru LLM online:
- Utilizarea modelelor open source: modelele noastre PPLX se bazează pe modelele de bază
mistral-7bșillama2-70b. - Tehnologie de căutare proprie: infrastructura noastră proprie de căutare, indexare și explorare ne permite să completăm modelele LLM cu cele mai relevante, actualizate și valoroase informații. Indexul nostru de căutare este mare, actualizat periodic și utilizează algoritmi de clasificare sofisticați pentru a se asigura că site-urile de înaltă calitate și care nu sunt optimizate pentru motoarele de căutare (SEO) au prioritate. Fragmentele de site-uri web, pe care le numim „fragmente”, sunt furnizate modelelor noastre
pplx-onlinepentru a permite obținerea de răspunsuri cu cele mai actualizate informații. - Ajustare fină: modelele noastre PPLX au fost ajustate fin pentru a utiliza în mod eficient fragmentele pentru a-și fundamenta răspunsurile. Folosind contractorii noștri de date interni, selectăm cu atenție seturi de antrenament de înaltă calitate, diverse și mari, pentru a obține o performanță ridicată pe diverse axe, cum ar fi utilitatea, exactitatea și prospețimea. Modelele noastre sunt ajustate fin în mod regulat pentru a îmbunătăți continuu performanța.
Evaluarea modelelor LLM online ale Perplexity
Misiunea Perplexity este de a construi cel mai bun motor de răspuns din lume — unul în care oamenii au încredere pentru a descoperi și a-și extinde cunoștințele. Pentru a realiza acest lucru, ne concentrăm profund pe furnizarea de informații utile, bazate pe fapte și actualizate. Pentru a măsura performanța modelelor noastre LLM pe aceste axe, am selectat seturi de date de evaluare care să reflecte cazuri de utilizare dificile, dar realiste, pentru motoarele de răspuns. Pentru fiecare interogare din fiecare set de evaluare, contractorii au primit două răspunsuri ale modelelor și au fost instruiți să selecteze răspunsul care a funcționat mai bine pentru următoarele criterii:
- Utilitate: care răspuns răspunde mai bine la interogare și respectă instrucțiunile specificate?
- Corectitudine: care răspuns oferă răspunsuri mai exacte, fără halucinații, chiar și pentru întrebări care necesită cunoștințe foarte precise sau de nișă?
- Actualitate (inspirat de FreshLLMs): care răspuns conține informații mai actualizate? Un model excelează la acest criteriu dacă este capabil să răspundă la interogări cu informații „proaspete”.
Pe lângă cele trei criterii de mai sus, răspunsurile modelelor au fost evaluate și în mod holistic. Pentru a evalua răspunsurile în mod holistic, evaluatorilor li s-a cerut să aleagă răspunsul pe care ar prefera să îl primească de la un asistent uman care ajută la interogare.
Selectarea setului de evaluare
Pentru această evaluare, am selectat cu atenție un set divers de prompturi cu scopul de a evalua în mod eficient utilitatea, exactitatea și actualitatea. Fiecare prompt a fost selectat manual, asigurând un nivel ridicat de control asupra calității și relevanței datelor. Setul de date acoperă o gamă largă de prompturi pentru motoarele de răspuns și cuprinde o prezentare generală cuprinzătoare a ceea ce dorim ca Perplexity să exceleze. Acest lucru este esențial pentru ca evaluările performanței modelului nostru să aibă un semnal puternic.
Fiecare dintre cele trei seturi de evaluare conține 50 de prompturi. Câteva exemple din aceste seturi includ:
- Utilitate: creați un tabel cu toți jucătorii de fotbal din SUA care au jucat în finalele Cupei Mondiale și creați coloane pentru statisticile acestora, cum ar fi goluri, pase de gol etc.
- Corectitudine: explicați duritatea oțelurilor AISI 1015 și AISI 1040.
- Actualitate: Care companie de mașini autonome a primit interdicție în San Francisco în 2023?
Generarea răspunsurilor modelului
Am evaluat patru modele:
pplx-7b-online: modelul Perplexity, care include acces la informații de pe internet. Acest model a fost ajustat fin folosind mistral-7b.
pplx-70b-online: modelul Perplexity, care include acces la informații de pe internet. Acest model a fost ajustat fin folosind llama2-70b.
gpt-3.5-turbo-1106: modelul OpenAI, accesat prin intermediul API-ului și fără îmbunătățiri suplimentare. Rețineți că am efectuat această evaluare utilizând cel mai recent model gpt-3.5.
llama2-70b-chat: modelul Meta AI, accesat prin intermediul pplx-api și fără îmbunătățiri suplimentare.
Pentru fiecare prompt, modelelor pplx-7b-online și pplx-70b-online li s-au furnizat aceleași rezultate de căutare și fragmente. Toate răspunsurile au fost generate folosind aceleași hiperparametri și prompt de sistem.
Prompt de sistem
Current date: Monday, November 20, 2023.Clasificarea răspunsurilor modelului cu ajutorul evaluării umane
Pentru fiecare comparație în perechi, contractorilor noștri interni li s-au furnizat promptul în sine, criteriile de evaluare (adică utilitatea, exactitatea sau actualitatea) și răspunsurile modelului afișate alăturat. Ordinea răspunsurilor a fost randomizată la fiecare tură, iar modelele sursă nu au fost dezvăluite evaluatorului. Evaluatorii au fost instruiți să selecteze răspunsul pe care îl preferă în mod holistic, precum și cel care are o performanță mai bună la criteriul de evaluare specific, fiind permise egalități pentru ambele. În cele din urmă, evaluatorilor li s-a permis să utilizeze căutarea pe internet pentru a verifica acuratețea răspunsurilor. Am creat propriul nostru instrument intern de clasificare a preferințelor pentru a efectua această evaluare.
Rezultatele evaluării
Folosim clasamentele preferințelor în perechi colectate din evaluarea umană pentru a calcula scorurile Elo per sarcină pentru fiecare model. Scorurile Elo sunt utilizate în mod obișnuit pentru a clasifica o populație de jucători în competiții de tip turneu pentru a măsura performanța relativă a jucătorilor. Atunci când sunt aplicate la modele lingvistice mari, aceste scoruri oferă o predicție a probabilității ca un evaluator uman să favorizeze rezultatul unui model în detrimentul altuia.
În timp ce scorurile Elo sunt de obicei calculate pentru o secvență de comparații pentru a ține cont de schimbările în abilitățile jucătorilor, scopul nostru este să cuantificăm performanța modelelor ale căror abilități nu se pot schimba. În consecință, adoptăm metodologia Bootstrap Elo descrisă de Duan et al și utilizată, de asemenea, de lmsys pentru Chatbot Arena, care presupune calcularea scorurilor Elo pentru multe permutări aleatorii ale comparațiilor. Pentru calculele noastre, am calculat scorurile Elo pe 5000 de permutări și am utilizat distribuțiile acestor scoruri Elo pentru a calcula intervale de încredere de 95%.
Rezultatele, prezentate în Figura 1, demonstrează că modelele noastre PPLX pot egala și chiar depăși performanța gpt-3.5 în cazurile de utilizare legate de Perplexity. În special, răspunsurile modelelor pplx-7b-online și pplx-70b-online sunt preferate în detrimentul răspunsurilor modelelor gpt-3.5 și llama2-70b de către evaluatorii umani pentru răspunsurile lor exacte și actualizate.
Modelele pplx-7b-online și pplx-70b-online au o performanță mai bună decât gpt-3.5 și llama2-70b, pe criteriile de actualitate, corectitudine și holistice.

De asemenea, am calculat ratele de câștig în perechi din evaluare. Rezultatele, prezentate în Figura 2, ilustrează, poate deloc surprinzător, că răspunsurile modelului online pplx sunt preferate celorlalte în ceea ce privește actualitatea și corectitudinea.

Iată un exemplu din setul nostru de date de evaluare a actualității.
Prompt: Câți oameni din SUA au permis de conducere?
pplx-7b-online
În 2023, sunt proiectați 243,4 milioane de șoferi cu permis în Statele Unite, ceea ce include 89% dintre adulții din SUA. Acest număr a crescut de la 238,6 milioane în 2022. Procentul șoferilor cu permis variază în funcție de grupele de vârstă și de state. De exemplu, în 2019, 84,1% din populația SUA avea permis de conducere. Cel mai mare procent de șoferi cu permis se înregistrează în rândul persoanelor cu vârsta cuprinsă între 25 și 49 de ani, 90,1% din populație având permis de conducere. În California, au existat 27 de milioane de șoferi cu permis, fiind statul cu cel mai mare număr de șoferi cu permis.
pplx-70b-online
În 2021, în jur de 233 de milioane de oameni dețineau permise de conducere valabile în Statele Unite. Până în 2023, numărul șoferilor cu permis în SUA este estimat să ajungă la 243,4 milioane, ceea ce include 89% dintre adulții din SUA. Aceasta reprezintă o creștere față de 238,6 milioane în 2022.
gpt-3.5
Ca model lingvistic AI, nu am acces la date în timp real. Cu toate acestea, începând din 2021, s-a estimat că în jur de 227 de milioane de oameni din Statele Unite dețineau un permis de conducere valabil. Vă rugăm să rețineți că este posibil ca acest număr să se fi schimbat de atunci, așa că este întotdeauna cel mai bine să consultați cele mai recente statistici oficiale pentru cele mai exacte informații.
llama2-70b
Nu am acces la date în timp real, dar vă pot oferi câteva informații despre numărul aproximativ de oameni din Statele Unite care au un permis de conducere. Potrivit Administrației Federale a Autostrăzilor, existau aproximativ 227,8 milioane de șoferi cu permis în Statele Unite începând din 2020. Acest număr include atât șoferi comerciali, cât și necomerciali. Este demn de remarcat faptul că acest număr este probabil o subestimare, deoarece nu ia în considerare persoanele care ar putea avea un permis de conducere, dar nu conduc în mod regulat sau deloc. În plus, acest număr nu include persoanele care nu sunt eligibile pentru un permis de conducere, cum ar fi cele cu vârsta sub 16 ani sau care au anumite dizabilități. De asemenea, este important de reținut că numărul șoferilor cu permis poate varia în funcție de stat, unele state având un procent mai mare de șoferi cu permis decât altele.
În general, rezultatele evaluării demonstrează că modelele noastre PPLX pot egala și chiar depăși gpt-3.5 și llama2-70b în cazurile de utilizare legate de Perplexity, în special în ceea ce privește furnizarea de răspunsuri exacte și actualizate.
Accesarea modelelor online ale Perplexity
Suntem încântați să anunțăm că pplx-api trece de la stadiul de beta la lansarea publică generală! Aceasta este prima dată când modelele noastre pplx-7b-online și pplx-70b-online pot fi accesate prin intermediul pplx-api. În plus, modelele noastre pplx-7b-chat și pplx-70b-chat au ieșit din faza de alfa și pot fi acum accesate odată cu lansarea noastră generală.
Odată cu aceasta, introducem o nouă structură de prețuri bazată pe utilizare. Suntem încântați ca utilizatorii noștri să folosească infrastructura noastră de ultimă generație, care utilizează NVIDIA H100s pentru a oferi o inferență extrem de rapidă. Utilizatorii Pro vor primi un credit lunar recurent de 5 USD pentru pplx-api. Pentru toți ceilalți utilizatori, prețurile vor fi stabilite în funcție de utilizare. Pentru a vă înscrie ca utilizator Pro, clic aici. Contactați api@perplexity.ai pentru întrebări comerciale.

Resurse suplimentare:
- Începeți cu pplx-api aici.
- Încercați gratuit modelele noastre online cu Perplexity Labs.
- Aflați mai multe despre API-ul nostru prin intermediul documentației pplx-api.
- Vă interesează să lucrați într-o echipă cu impact ridicat și viteză mare care construiește cel mai bun motor de răspuns? Alăturați-vă nouă!
- Alăturați-vă comunității noastre în creștere Discord!
Contribuitori:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats