Vi introducerer PPLX online LLM'er
Den første af sin slags online LLM-API

Den første af sin slags online LLM-API.
Vi er glade for at kunne præsentere to nye PPLX-modeller: pplx-7b-online og pplx-70b-online! Vores online-modeller fokuserer på at levere nyttige, opdaterede og faktuelle svar og er offentligt tilgængelige via pplx-api, hvilket gør det til en API af sin egen slags. pplx-7b-online og pplx-70b-online er også tilgængelige via Perplexity Labs, vores LLM-sandkasse.
LLM'er har ændret den måde, vi finder information på. De fleste af nutidens LLM'er har dog to begrænsninger:
Aktualitet: LLM'er har ofte svært ved at dele opdateret information.
Hallucinationer: LLM'er kan også udsende unøjagtige udsagn.
Vores modeller pplx-7b-online og pplx-70b-online afhjælper de aktuelle begrænsninger ved desuden at levere nyttige, faktuelle og opdaterede oplysninger i deres svar.
PPLX Online LLM'er
Vores LLM'er, pplx-7b-online og pplx-70b-online, er online LLM'er, fordi de kan bruge viden fra internettet og dermed udnytte de mest opdaterede oplysninger, når de danner et svar. Ved at forsyne vores LLM'er med viden fra webben svarer vores modeller præcist på tidsfølsomme forespørgsler, hvilket låser op for viden ud over deres træningskorpus. Det betyder, at Perplexity's online LLM'er kan besvare forespørgsler som “Hvad var stillingen i Warriors-kampen i nat?”, som er udfordrende for offline-modeller. Overordnet set fungerer vores online LLM på følgende måde:
- Udnyt open source-modeller: vores PPLX-modeller bygger oven på
mistral-7b- ogllama2-70b-basismodellerne. - Intern søgeteknologi: vores interne søge-, indekserings- og gennemsøgningsinfrastruktur giver os mulighed for at udvide LLM'er med de mest relevante, opdaterede og værdifulde oplysninger. Vores søgeindeks er stort, opdateres regelmæssigt og bruger sofistikerede rangeringsalgoritmer til at sikre, at websteder af høj kvalitet, som ikke er SEO-optimerede, prioriteres. Webstedsuddrag, som vi kalder “snippets”, leveres til vores
pplx-online-modeller for at muliggøre svar med de mest opdaterede oplysninger. - Finjustering: vores PPLX-modeller er blevet finjusteret til effektivt at bruge utdrag til at informere deres svar. Ved hjælp af vores interne datakonsulenter sammensætter vi omhyggeligt træningssæt af høj kvalitet, der er mangfoldige og store, for at opnå høj ydeevne på forskellige akser som hjælpsomhed, faktualitet og friskhed. Vores modeller finjusteres regelmæssigt for løbende at forbedre ydeevnen.
Evaluering af Perplexity's Online LLM'er
Perplexity's mission er at bygge verdens bedste svarmaskine – en som folk stoler på, når de skal opdage og udvide deres viden. For at opnå dette har vi stor fokus på at levere nyttige, faktuelle og opdaterede oplysninger. For at benchmarke vores LLM'ers ydeevne på disse akser har vi sammensat evalueringَسæt, der afspejler udfordrende, men realistiske brugsscenarier for svarmaskiner. For hver forespørgsel i hvert evalueringssæt fik konsulenterne to modelsvar og blev instrueret i at vælge det svar, der præsterede bedre i forhold til følgende kriterier:
- Hjælpsomhed: hvilket svar besvarer forespørgslen og følger de angivne instruktioner bedst?
- Faktualitet: hvilket svar giver mere nøjagtige svar uden hallucinationer, selv på spørgsmål, der kræver meget præcis eller nicherettet viden?
- Aktualitet (inspireret af FreshLLMs): hvilket svar indeholder mere opdateret information? En model udmærker sig i dette kriterium, hvis den er i stand til at besvare forespørgsler med “frisk” information.
Ud over de tre ovenstående kriterier blev modelsvarene også evalueret helhedsorienteret. For at evaluere svar helhedsorienteret blev evaluatorerne bedt om at vælge det svar, de helst ville modtage fra en menneskelig assistent, der hjalp med forespørgslen.
Sammensætning af evalueringssættet
Til denne evaluering har vi omhyggeligt sammensat et mangfoldigt sæt af prompts med det formål effektivt at evaluere hjælpsomhed, faktualitet og aktualitet. Hver prompt blev udvalgt manuelt, hvilket sikrer en høj grad af kontrol over dataenes kvalitet og relevans. Datasættet spænder over en bred vifte af svarmaskine-prompts og omfatter en omfattende oversigt over det, vi ønsker, at Perplexity skal udmærke sig ved. Dette er afgørende for, at vores modelydelsesevalueringer har et højt signal.
Hvert af de tre evalueringssæt indeholder 50 prompts. Nogle eksempler fra disse sæt omfatter:
- Hjælpsomhed: Opret en tabel over alle de amerikanske fodboldspillere, der spillede i VM-finalerne, og lav kolonner for deres statistik såsom mål, assists osv.
- Faktualitet: Forklar sejheden af AISI 1015- og AISI 1040-stål.
- Aktualitet: Hvilket selvkørende bilfirma blev udelukket fra San Francisco i 2023?
Generering af modelsvar
Vi evaluerede fire modeller:
pplx-7b-online: Perplexity's model, som indeholder adgang til information fra internettet. Denne model blev finjusteret ved hjælp af mistral-7b.
pplx-70b-online: Perplexity's model, som indeholder adgang til information fra internettet. Denne model blev finjusteret ved hjælp af llama2-70b.
gpt-3.5-turbo-1106: OpenAI's model, som tilgås via API'en og uden yderligere udvidelser. Bemærk, at vi udførte denne evaluering ved hjælp af den nyeste gpt-3.5-model.
llama2-70b-chat: Meta AI's model, tilgået via vores pplx-api og uden yderligere udvidelser.
For hver prompt blev de samme søgeresultater og uddrag leveret til pplx-7b-online- og pplx-70b-online-modellerne. Alle svar blev genereret ved hjælp af de samme hyperparametre og systemprompt.
Systemprompt
Current date: Monday, November 20, 2023.Rangering af modelsvar med menneskelig evaluering
For hver parvis sammenligning fik vores interne konsulenter selve prompten, evalueringskriterierne (dvs. hjælpsomhed, faktualitet eller aktualitet) og modelsvarene vist side om side. Rækkefølgen af svarene blev randomiseret ved hver tur, og kildemodellerne blev ikke afsløret for evaluatoren. Evaluatorerne blev instrueret i at vælge det svar, de helhedsorienteret foretrak, samt hvilket der præsterede bedre på det specifikke evalueringskriterium, idet uafgjort var tilladt for begge. Endelig fik evaluatorer tilladelse til at bruge internetstik til at verificere nøjagtigheden af svar. Vi byggede vores eget interne præferencerangeringsværktøj til at udføre denne evaluering.
Evalueringsresultater
Vi bruger de parvise præferencerangeringer indsamlet fra menneskelig evaluering til at beregne opgave-specifikke Elo-scorer for hver model. Elo-scorer bruges almindeligvis til at rangere en population af spillere i turneringer for at måle spillernes relative præstation. Når disse scorer anvendes på store sprogmodeller, giver de en forudsigelse af, hvor sandsynligt det er, at en menneskelig evaluator vil foretrække outputtet fra én model frem for en anden.
Selvom Elo-scorer typisk beregnes for en sekvens af sammenligninger for at tage højde for ændringer i spillernes evner, sigter vi efter at kvantificere præstationen for modeller, hvis evner ikke kan ændre sig. Derfor vedtager vi Bootstrap Elo-metoden beskrevet i Duan et al og også brugt af lmsys til deres Chatbot Arena, hvilket indebærer beregning af Elo-scorer for mange tilfældige permutationer af sammenligningerne. Til vores beregninger beregnede vi Elo-scorer over 5000 permutationer og brugte fordelingerne af disse Elo-scorer til at beregne 95 % konfidensintervaller.
Resultaterne, vist i figur 1, viser, at vores PPLX-modeller kan matche og endda overgå gpt-3.5-præstationen på Perplexity-relaterede brugsscenarier. Især foretrækkes pplx-7b-online- og pplx-70b-online-modelsvar frem for gpt-3.5- og llama2-70b-modelsvar af menneskelige evaluatorer for deres nøjagtige og opdaterede svar.
pplx-7b-online og pplx-70b-online klarer sig bedre end gpt-3.5 og llama2-70b på kriterierne aktualitet, faktualitet og helhedsorientering.

Vi beregnede også de parvise vinderandele fra evalueringen. Resultaterne, vist i figur 2, illustrerer, måske ikke overraskende, at pplx online-modelsvarene foretrækkes frem for andres på aktualitet og faktualitet.

Her er et eksempel fra vores evalueringssæt for aktualitet.
Prompt: Hvor mange mennesker i USA har et kørekort?
pplx-7b-online
I 2023 er der et estimeret antal på 243,4 millioner licenserede bilister i USA, hvilket inkluderer 89 % af de amerikanske voksne. Dette tal er steget fra 238,6 millioner i 2022. Procentdelen af licenserede bilister varierer på tværs af forskellige aldersgrupper og stater. For eksempel havde 84,1 % af den amerikanske befolkning i 2019 et kørekort. Den højeste procentdel af licenserede bilister findes blandt 25- til 49-årige, hvor 90,1 % af befolkningen har et kørekort. I Californien var der 27 millioner licenserede bilister, hvilket gør det til den stat med det højeste antal licenserede bilister.
pplx-70b-online
I 2021 havde omkring 233 millioner mennesker et gyldigt kørekort i USA. I 2023 forventes antallet af licenserede bilister i USA at nå op på 243,4 millioner, hvilket inkluderer 89 % af de amerikanske voksne. Dette repræsenterer en stigning fra 238,6 millioner i 2022.
gpt-3.5
Som sprogmodel med kunstig intelligens har jeg ikke adgang til realtidsdata. Fra 2021 blev det dog anslået, at omkring 227 millioner mennesker i USA havde et gyldigt kørekort. Bemærk venligst, at dette tal kan have ændret sig siden da, så det er altid bedst at henvise til de seneste officielle statistikker for at få de mest nøjagtige oplysninger.
llama2-70b
Jeg har ikke adgang til realtidsdata, men jeg kan give nogle oplysninger om det omtrentlige antal mennesker i USA, der har et kørekort. Ifølge Federal Highway Administration var der ca. 227,8 millioner licenserede bilister i USA pr. 2020. Dette tal inkluderer både erhvervschauffører og ikke-erhvervschauffører. Det er værd at bemærke, at dette tal sandsynligvis er en underestimation, da det ikke tager højde for personer, der muligvis har et kørekort, men ikke kører regelmæssigt eller overhovedet. Derudover inkluderer dette tal ikke personer, der ikke er berettiget til et kørekort, såsom dem under 16 år eller med visse handicap. Det er også vigtigt at bemærke, at antallet af licenserede bilister kan variere fra stat til stat, hvor nogle stater har en højere procentdel af licenserede bilister end andre.
Overordnet set viser evalueringsresultaterne, at vores PPLX-modeller kan matche og endda overgå gpt-3.5 og llama2-70b på Perplexity-relaterede brugsscenarier, især når det gælder levering af nøjagtige og opdaterede svar.
Sådan får du adgang til Perplexity's online-modeller
Vi er begejstrede for at kunne annoncere, at pplx-api går ud af beta og overgår til almindelig offentlig udgivelse! Dette er første gang, vores pplx-7b-online- og pplx-70b-online-modeller er tilgængelige via pplx-api. Derudover er vores pplx-7b-chat- og pplx-70b-chat-modeller ude af alfa og er nu tilgængelige med vores almindelige udgivelse.
I forbindelse med dette introducerer vi en ny forbrugsbaseret prisstruktur. Vi glæder os til, at vores brugere kan udnytte vores avancerede infrastruktur, som bruger NVIDIA H100s til at levere lynhurtig inferens. Pro-brugere vil modtage en tilbagevendende månedlig pplx-api-kredit på 5 USD. For alle andre brugere vil prisen blive bestemt baseret på forbrug. For at tilmelde dig som Pro-bruger, klik her. Kontakt api@perplexity.ai for kommercielle forespørgsler.

Yderligere ressourcer:
- Kom i gang med pplx-api her.
- Prøv vores online-modeller gratis med Perplexity Labs.
- Lær mere om vores API via pplx-api-dokumentationen.
- Er du interesseret i at arbejde på et team med stor gennemslagskraft og højt tempo, der bygger den bedste svarmaskine? Tilmeld dig her!
- Bliv en del af vores voksende Discord-fællesskab!
Bidragydere:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats