Vi introduserer PPLX online LLM-er
Den første i sitt slag av online LLM-API-er

Den første i sitt slag av online LLM-API-er.
Vi er glade for å dele to nye PPLX-modeller: pplx-7b-online og pplx-70b-online! Våre onlinemodeller fokuserer på å levere nyttige, oppdaterte og faktuelle svar, og er tilgjengelige offentlig via pplx-api, noe som gjør det til et API uten like. pplx-7b-online og pplx-70b-online er også tilgjengelige via Perplexity Labs, vår LLM-sandkasse.
LLM-er har endret måten vi finner informasjon på. Det er imidlertid to begrensninger ved de fleste LLM-er i dag:
Ferskhet: LLM-er sliter ofte med å dele oppdatert informasjon.
Hallusinasjoner: LLM-er kan også produsere unøyaktige påstander.
Våre pplx-7b-online- og pplx-70b-online-modeller adresserer gjeldende begrensninger ved i tillegg å tilby nyttig, faktisk og oppdatert informasjon i sine svar.
PPLX Online LLM-er
Våre LLM-er, pplx-7b-online og pplx-70b-online, er online LLM-er fordi de kan bruke kunnskap fra internett, og dermed utnytte den mest oppdaterte informasjonen når de utformer et svar. Ved å forsyne våre LLM-er med kunnskap fra nettet, svarer modellene våre nøyaktig på tidsfølsomme forespørsler og låser opp kunnskap utover treningskorpuset. Dette betyr at Perplexity sine online LLM-er kan svare på spørsmål som "Hva ble resultatet i Warriors-kampen i natt?" som er utfordrende for offline modeller. Overordnet er dette slik vår online LLM fungerer:
- Utnytt open source-modeller: PPLX-modellene våre bygger på
mistral-7b- ogllama2-70b-basismodellene. - Intern søketeknologi: Vår interne søke-, indeks- og gjennomsøkingsinfrastruktur gjør at vi kan utvide LLM-er med den mest relevante, oppdaterte og verdifulle informasjonen. Søkeindeksen vår er stor, oppdateres jevnlig og bruker sofistikerte rangeringsalgoritmer for å sikre at nettsteder av høy kvalitet og uten SEO-fokus prioriteres. Utsnitt av nettsteder, som vi kaller «snutter», leveres til
pplx-online-modellene våre for å muliggjøre svar med den mest oppdaterte informasjonen. - Finjustering: PPLX-modellene våre har blitt finjustert for å bruke snutter effektivt til å informere svarene sine. Ved hjelp av våre interne dataleverandører kurerer vi nøye treningssett av høy kvalitet, varierte og store treningssett for å oppnå høy ytelse på ulike akser som hjelpsomhet, faktualitet og ferskhet. Modellene våre blir jevnlig finjustert for å forbedre ytelsen kontinuerlig.
Evaluering av Perplexity sine online LLM-er
Perplexitys misjon er å bygge verdens beste svarmotor – en som folk stoler på for å oppdage og utvide sin kunnskap. For å oppnå dette har vi et sterkt fokus på å tilby nyttig, faktisk og oppdatert informasjon. For å benchmarke LLM-enes ytelse på disse aksene, kuraterte vi evalueringsdatasett for å gjenspeile utfordrende, men realistiske brukstilfeller for svarmotorer. For hver forespørsel i hvert evalueringssett fikk leverandørene to svarmodeller og ble bedt om å velge den responsen som presterte bedre for følgende kriterier:
- Hjelpsomhet: Hvilket svar besvarer forespørselen og følger de angitte instruksjonene bedre?
- Faktualitet: Hvilket svar gir mer nøyaktige svar uten hallusinasjoner, selv for spørsmål som krever svært presis eller nisjekunnskap?
- Ferskhet (inspirert av FreshLLMs): Hvilket svar inneholder mer oppdatert informasjon? En modell utmerker seg i dette kriteriet hvis den er i stand til å svare på spørsmål med "fersk" informasjon.
I tillegg til de tre kriteriene ovenfor, ble modellsvarene også evaluert helhetlig. For å evaluere svarene helhetlig, ble evaluatorene bedt om å velge det svaret de helst ville fått fra en menneskelig assistent som hjelper til med forespørselen.
Kuratering av evalueringssettet
For denne evalueringen kuraterte vi nøye et variert sett med ledetekster med mål om effektivt å evaluere hjelpsomhet, faktualitet og ferskhet. Hver ledetekst ble manuelt valgt ut, noe som sikrer et høyt kontrollnivå over datakvaliteten og relevansen. Datasettet spenner over et bredt spekter av svarmotorledetekster og omfatter en omfattende oversikt over hva vi ønsker at Perplexity skal utmerke seg på. Dette er avgjørende for at modellytelsesevalueringene våre skal ha høy signalstyrke.
Hvert av de tre evalueringssettene inneholder 50 ledetekster. Noen eksempler fra disse settene inkluderer:
- Hjelpsomhet: Lag en tabell over alle de amerikanske fotballspillerne som spilte i VM-finalen, og lag kolonner for statistikken deres som mål, målgivende pasninger osv.
- Faktualitet: Forklar seigheten til AISI 1015- og AISI 1040-stål.
- Oppdaterthet: Hvilket selvkjørende bilselskap ble utestengt fra San Francisco i 2023?
Generering av modellsvar
Vi evaluerte fire modeller:
pplx-7b-online: Perplexitys modell, som inkluderer tilgang til informasjon fra Internett. Denne modellen ble finjustert ved hjelp av mistral-7b.
pplx-70b-online: Perplexitys modell, som inkluderer tilgang til informasjon fra Internett. Denne modellen ble finjustert ved hjelp av llama2-70b.
gpt-3.5-turbo-1106: OpenAIs modell, som nås via API-et og uten ekstra utvidelser. Merk at vi utførte denne evalueringen ved hjelp av den nyeste gpt-3.5-modellen.
llama2-70b-chat: Meta AIs modell, som nås via vår pplx-api og uten ekstra utvidelser.
For hver ledetekst ble de samme søkeresultatene og utsnittene levert til pplx-7b-online- og pplx-70b-online-modellene. Alle svar ble generert ved hjelp av de samme hyperparametrene og systemledetekstene.
Systemledetekst
Current date: Monday, November 20, 2023.Rangering av modellsvar med menneskelig evaluering
For hver parvise sammenligning ble våre interne leverandører gitt selve ledeteksten, evalueringskriteriene (dvs. hjelpsomhet, faktualitet eller ferskhet) og modellsvarene vist side om side. Rekkefølgen på svarene ble randomisert ved hver sving, og kildemodellene ble ikke avslørt for evaluatoren. Evaluatorene ble instruert til å velge det svaret de helhetlig foretrekker, samt hvilket som presterer bedre på det spesifikke evalueringskriteriet, med uavgjort tillatt for begge. Til slutt fikk evaluatorene bruke internetsøk for å bekrefte nøyaktigheten av svarene. Vi bygde vårt eget interne preferanserangeringsverktøy for å utføre denne evalueringen.
Evalueringsresultater
Vi bruker de parvise preferanserangeringene samlet inn fra menneskelig evaluering til å beregne oppgavevise Elo-skårer for hver modell. Elo-skårer brukes ofte til å rangere en populasjon av spillere i turneringsturneringer for å måle spillernes relative ytelse. Når disse skårene anvendes på store språkmodeller, gir de en prediksjon av hvor sannsynlig det er at en menneskelig evaluator vil foretrekke utdata fra en modell fremfor en annen.
Selv om Elo-skårer vanligvis beregnes for en sekvens av sammenligninger for å ta hensyn til endringer i spillernes evner, har vi som mål å kvantifisere ytelsen til modeller hvis evner ikke kan endre seg. Følgelig tar vi i bruk Bootstrap Elo-metoden beskrevet i Duan et al og også brukt av lmsys for deres Chatbot Arena, som innebærer å beregne Elo-skårer for mange tilfeldige permutasjoner av sammenligningene. For våre beregninger beregnet vi Elo-skårer over 5000 permutasjoner og brukte fordelingene av disse Elo-skårene til å beregne 95 % konfidensintervaller.
Resultatene, vist i figur 1, viser at våre PPLX-modeller kan matche og til og med overgå gpt-3.5-ytelsen på Perplexity-relaterte brukstilfeller. Spesielt foretrekkes pplx-7b-online- og pplx-70b-online-modellsvarene fremfor gpt-3.5- og llama2-70b-modellsvarene av menneskelige evaluatorer for sine nøyaktige og oppdaterte svar.
pplx-7b-online og pplx-70b-online presterer bedre enn gpt-3.5 og llama2-70b på kriteriene ferskhet, faktualitet og helhetlig.

Vi beregnet også de parvise seiersratene fra evalueringen. Resultatene, vist i figur 2, illustrerer kanskje ikke overraskende at pplx-online-modellsvarene foretrekkes fremfor andres på ferskhet og faktualitet.

Her er et eksempel fra vårt ferske evalueringsdatasett.
Ledetekst: Hvor mange mennesker i USA har førerkort?
pplx-7b-online
I 2023 er det anslått 243,4 millioner lisensierte sjåfører i USA, noe som inkluderer 89 % av amerikanske voksne. Dette tallet har økt fra 238,6 millioner i 2022. Andelen lisensierte sjåfører varierer mellom ulike aldersgrupper og stater. For eksempel hadde 84,1 % av den amerikanske befolkningen førerkort i 2019. Den høyeste anmodningen om førerkort er blant 25- til 49-åringer, med 90,1 % av befolkningen som har førerkort. I California var det 27 millioner lisensierte sjåfører, noe som gjør den til staten med flest lisensierte sjåfører.
pplx-70b-online
I 2021 hadde rundt 233 millioner mennesker gyldig førerkort i USA. Innen 2023 er antall lisensierte sjåfører i USA anslått å nå 243,4 millioner, noe som inkluderer 89 % av amerikanske voksne. Dette representerer en økning fra 238,6 millioner i 2022.
gpt-3.5
Som en AI-språkmodell har jeg ikke tilgang til sanntidsdata. Imidlertid ble det anslått at rundt 227 millioner mennesker i USA hadde gyldig førerkort fra og med 2021. Vær oppmerksom på at dette tallet kan ha endret seg siden den gang, så det er alltid best å henvise til den nyeste offisielle statistikken for mest mulig nøyaktig informasjon.
llama2-70b
Jeg har ikke tilgang til sanntidsdata, men jeg kan gi noen opplysninger om det omtrentlige antallet personer i USA som har førerkort. Ifølge Federal Highway Administration var det omtrent 227,8 millioner lisensierte sjåfører i USA fra og med 2020. Dette tallet inkluderer både kommersielle og ikke-kommersielle sjåfører. Det er verdt å merke seg at dette tallet sannsynligvis er en underestimering, da det ikke tar hensyn til enkeltpersoner som kan ha førerkort, men som ikke kjører regelmessig eller i det hele tatt. I tillegg inkluderer ikke dette tallet personer som ikke er berettiget til førerkort, for eksempel de som er under 16 år eller har visse funksjonshemninger. Det er også viktig å merke seg at antall lisensierte sjåfører kan variere etter stat, med noen stater som har en høyere prosentandel lisensierte sjåfører enn andre.
Totalt sett viser evalueringsresultatene at PPLX-modellene våre kan matche og til og med utkonkurrere gpt-3.5 og llama2-70b på Perplexity-relaterte brukstilfeller, spesielt for å gi nøyaktige og oppdaterte svar.
Tilgang til Perplexity sine onlinemodeller
Vi er svært glade for å kunngjøre at pplx-api går ut av beta-fasen og over i generell offentlig utgivelse! Dette er første gang pplx-7b-online- og pplx-70b-online-modellene våre er tilgjengelige via pplx-api. I tillegg er pplx-7b-chat- og pplx-70b-chat-modellene våre ute av alfa og er nå tilgjengelige med vår generelle utgivelse.
Med dette introduserer vi en ny bruksbasert prisstruktur. Vi gleder oss til at brukerne våre skal ta i bruk vår toppmoderne infrastruktur, som bruker NVIDIA H100 for å levere lynrask inferens. Pro-brukere vil motta en tilbakevendende månedlig pplx-api-kreditt på $5. For alle andre brukere vil prisene bli bestemt basert på bruk. For å registrere deg som Pro-bruker, klikk her. Ta kontakt med api@perplexity.ai for kommersielle henvendelser.

Flere ressurser:
- Kom i gang med pplx-api her.
- Prøv onlinemodellene våre gratis med Perplexity Labs.
- Finn ut mer om API-et vårt via pplx-api-dokumentasjonen.
- Er du interessert i å jobbe i et team med høy innvirkning og høyt tempo som bygger den beste svarmotoren? Bli med oss!
- Bli med i vårt voksende Discord-fellesskap!
Bidragsytere:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats