Vi presenterar PPLX online-LLM:er

Det första online-LLM-API:et i sitt slag

Perplexity releases first "Live" LLM

Det första online-LLM-API:et i sitt slag.

Vi är glada över att kunna presentera två nya PPLX-modeller: pplx-7b-online och pplx-70b-online! Våra onlinemodeller fokuserar på att leverera hjälpsamma, aktuella och faktabaserade svar, och är allmänt tillgängliga via pplx-api, vilket gör det till ett API i sitt slag. pplx-7b-online och pplx-70b-online är också tillgängliga via Perplexity Labs, vår LLM-testmiljö.

LLM:er har förändrat sättet vi hittar information på. Det finns dock två begränsningar med de flesta LLM:er idag:

Aktualitet: LLM:er har ofta svårt att dela aktuell information.

Hallucinationer: LLM:er kan också ge felaktiga påståenden.

Våra modeller pplx-7b-online och pplx-70b-online adresserar nuvarande begränsningar genom att dessutom tillhandahålla hjälpsam, faktabaserad och aktuell information i sina svar.

PPLX Online LLM:er

Våra LLM:er, pplx-7b-online och pplx-70b-online, är online-LLM:er eftersom de kan använda kunskap från internet och därmed utnyttja den mest aktuella informationen när de formulerar ett svar. Genom att förse våra LLM:er med kunskap från webben svarar våra modeller exakt på tidsberoende frågor och låser upp kunskap utanför dess träningskorpus. Det innebär att Perplexitys online-LLM:er kan svara på frågor som "Vad blev ställningen i Warriors-matchen igår kväll?" som är utmanande för offline-modeller. På en övergripande nivå fungerar vår online-LLM på följande sätt:

  1. Utnyttja modeller med öppen källkod: våra PPLX-modeller bygger på basmodellerna mistral-7b och llama2-70b.
  2. Intern söksteknologi: vår interna infrastruktur för sökning, indexering och webbgenomsökning gör det möjligt för oss att utöka LLM:er med den mest relevanta, aktuella och värdefulla informationen. Vårt sökindex är stort, uppdateras regelbundet och använder sofistikerade rankningsalgoritmer för att säkerställa att webbplatser av hög kvalitet och utan SEO prioriteras. Utdrag från webbplatser, som vi kallas "snuttar", tillhandahålls till våra pplx-online-modeller för att möjliggöra svar med den mest aktuella informationen.
  3. Finjustering: våra PPLX-modeller har finjusterats för att effektivt använda utdrag för att informera sina svar. Med hjälp av våra interna dataleverantörer sammanställer vi noggrant högkvalitativa, mångsidiga och stora träningsset för att uppnå hög prestanda på olika axlar som hjälpsamhet, faktualitet och färskhet. Våra modeller finjusteras regelbundet för att kontinuerligt förbättra prestandan.

Utvärdering av Perplexitys Online-LLM:er

Perplexitys uppdrag är att bygga världens bästa svarstjänst – en som människor litar på för att upptäcka och utöka sin kunskap. För att uppnå detta är vi djupt fokuserade på att tillhandahålla hjälpsam, faktabaserad och aktuell information. För att mäta våra LLM:ers prestanda på dessa axlar sammanställde vi utvärderingsdatauppsättningar för att återspegla utmanande men realistiska användningsfall för svarstjänster. För varje fråga i varje utvärderingsuppsättning fick entreprenörer två svarsmodeller och instruerades att välja det svar som presterade bättre för följande kriterier:

  • Hjälpsamhet: vilket svar besvarar frågan och följer de angivna instruktionerna bättre?
  • Faktualitet: vilket svar ger mer korrekta svar utan hallucinationer, även för frågor som kräver mycket exakt eller nischad kunskap?
  • Aktualitet (inspirerad av FreshLLMs): vilket svar innehåller mer aktuell information? En modell utmärker sig i detta kriterium om den kan besvara frågor med "färsk" information.

Utöver de tre kriterierna ovan utvärderades även modellsvaren helhetssynmässigt. För att utvärdera svaren helhetssynmässigt ombads utvärderare att välja det svar de helst skulle vilja få från en mänsklig assistent som hjälper till med frågan.

Sammanställning av utvärderingsuppsättningen

För denna utvärdering sammanställde vi noggrant en mångsidig uppsättning prompter i syfte att effektivt utvärdera hjälpsamhet, faktualitet och aktualitet. Varje prompt valdes ut manuellt, vilket säkerställer en hög nivå av kontroll över datans kvalitet och relevans. Datamängden spänner över ett brett utbud av prompter för svarstjänster och omfattar en heltäckande översikt över vad vi vill att Perplexity ska utmärka sig på. Detta är avgörande för att våra utvärderingar av modellprestanda ska ha hög signal.

Var och en av de tre utvärderingsuppsättningarna innehåller 50 prompter. Några exempel från dessa uppsättningar inkluderar:

  • Hjälpsamhet: Skapa en tabell över alla amerikanska fotbollsspelare som spelade i VM-finalen och skapa kolumner för deras statistik som mål, assist etc.
  • Faktualitet: Förklara segheten hos stålsorterna AISI 1015 och AISI 1040.
  • Aktualitet: Vilket företag för autonoma bilar portades från San Francisco 2023?

Generera modellsvar

Vi utvärderade fyra modeller:

pplx-7b-online: Perplexitys modell, som inkluderar tillgång till information från internet. Denna modell finjusterades med hjälp av mistral-7b.

pplx-70b-online: Perplexitys modell, som inkluderar tillgång till information från internet. Denna modell finjusterades med hjälp av llama2-70b.

gpt-3.5-turbo-1106: OpenAIs modell, som nås via API:et och utan ytterligare utökningar. Observera att vi utförde denna utvärdering med den senaste gpt-3.5-modellen.

llama2-70b-chat: Meta AI:s modell, som nås via vårt pplx-api och utan ytterligare utökningar.

För varje prompt tillhandahölls samma sökresultat och utdrag till modellerna pplx-7b-online och pplx-70b-online. Alla svar genererades med samma hyperparametrar och systemprompt.

Systemprompt

plaintext
Current date: Monday, November 20, 2023.

Rangordna modellsvar med mänsklig utvärdering

För varje parvis jämförelse försågs våra interna entreprenörer med själva prompten, utvärderingskriterierna (dvs. hjälpsamhet, faktualitet eller aktualitet) och modellsvaren som visades sida vid sida. Svarens ordning slumpades vid varje tillfälle, och källmodellerna avslöjades inte för utvärderaren. Utvärderare instruerades att välja det svar de föredrar i sin helhet, samt vilket som presterar bättre på det specifika utvärderingskriteriet, med oavgjort tillåtet för båda. Slutligen tilläts utvärderare att använda internetnsökning för att verifiera svarens korrekthet. Vi byggde vårt eget interna verktyg för preferensrankning för att utföra denna utvärdering.

Utvärderingsresultat

Vi använder de parvisa preferensrankningarna som samlats in från mänsklig utvärdering för att beräkna per-uppgift Elo-poäng för varje modell. Elo-poäng används ofta för att rangordna en population av spelare i turneringsturneringar för att mäta spelarnas relativa prestanda. När de tillämpas på stora språkmodeller ger dessa poäng en förutsägelse om hur sannolikt det är att en mänsklig utvärderare gynnar utdata från en modell framför en annan.

Medan Elo-poäng vanligtvis beräknas för en sekvens av jämförelser för att ta hänsyn till förändringar i spelares förmågor, strävar vi efter att kvantifiera prestandan för modeller vars förmågor inte kan förändras. Följaktligen antar vi Bootstrap Elo-metoden som beskrivs av Duan et al och som också används av lmsys för deras Chatbot Arena, vilket innebär att man beräknar Elo-poäng för många slumpmässiga permutationer av jämförelserna. För våra beräkningar beräknade vi Elo-poäng över 5 000 permutationer och använde fördelningarna av dessa Elo-poäng för att beräkna 95 % konfidensintervall.

Resultaten, som visas i figur 1, visar att våra PPLX-modeller kan matcha och till och med överträffa gpt-3.5-prestanda på Perplexity-relaterade användningsfall. Särskilt föredras modellsvar från pplx-7b-online och pplx-70b-online framför modellsvar från gpt-3.5 och llama2-70b av mänskliga utvärderare för deras korrekta och aktuella svar.

pplx-7b-online och pplx-70b-online presterar bättre än gpt-3.5 och llama2-70b, på kriterierna aktualitet, faktualitet och helhet.

Figur 1. Beräknade Elo-poäng och 95 % konfidensintervall för pplx-7b (-online), pplx-70b (-online), llama2-70b och gpt-3.5 över fyra olika utvärderingsuppsättningar. Till exempel, på aktualitetsaxeln presterar pplx-7b och pplx-70b bättre än gpt-3.5 och llama2-70b, med en beräknad Elo-poäng på 1100.6 respektive 1099.6 jämfört med 879.3 och 920.3.

Vi beräknade också de parvisa vinstfrekvenserna från utvärderingen. Resultaten, som visas i figur 2, illustrerar, kanske inte så överraskande, att pplx-onlinemodellsvaren föredras framför andras vad gäller aktualitet och faktualitet.

Figur 2. Vinstfrekvenser för modeller på den vertikala axeln mot modellerna på den horisontella axeln. Till exempel bedömdes pplx-70b (-online)-svar som helhetssynmässigt överlägsna gpt-3.5:s på 64 % av frågorna och gpt-3.5:s svar bedömdes som helhetssynmässigt överlägsna pplx-70b (-online) på 24 % av frågorna.

Här är ett exempel från vår utvärderingsuppsättning för aktualitet.

Prompt: Hur många personer i USA har ett körkort?

pplx-7b-online

År 2023 beräknas det finnas 243,4 miljoner licensierade förare i USA, vilket inkluderar 89 % av de amerikanska vuxna. Detta antal har ökat från 238,6 miljoner år 2022. Andelen licensierade förare varierar mellan olika åldersgrupper och delstater. Till exempel hade 84,1 % av den amerikanska befolkningen ett körkort år 2019. Den högsta andelen licensierade förare finns bland 25- till 49-åringar, där 90,1 % av befolkningen har ett körkort. I Kalifornien fanns det 27 miljoner licensierade förare, vilket gör det till den delstat som har det högsta antalet licensierade förare.

pplx-70b-online

År 2021 innehade cirka 233 miljoner människor giltiga körkort i USA. År 2023 beräknas antalet licensierade förare i USA nå 243,4 miljoner, vilket inkluderar 89 % av de amerikanska vuxna. Detta innebär en ökning från 238,6 miljoner år 2022.

gpt-3.5

Som en AI-språkmodell har jag inte tillgång till realtidsdata. Från och med 2021 uppskattades det dock att cirka 227 miljoner människor i USA innehade ett giltigt körkort. Observera att detta antal kan ha förändrats sedan dess, så det är alltid bäst att hänvisa till den senaste officiella statistiken för den mest exakta informationen.

llama2-70b

Jag har inte tillgång till realtidsdata, men jag kan tillhandahålla viss information om det ungefärliga antalet personer i USA som har ett körkort. Enligt Federal Highway Administration fanns det uppskattningsvis 227,8 miljoner licensierade förare i USA från och med 2020. Detta antal inkluderar både yrkesförare och icke-yrkesförare. Det är värt att notera att denna siffra sannolikt är en underskattning, eftersom den inte tar hänsyn till individer som kan ha ett körkort men som inte kör regelbundet eller alls. Dessutom inkluderar denna siffra inte individer som inte är berättigade till ett körkort, såsom de som är under 16 år eller har vissa funktionsnedsättningar. Det är också viktigt att notera att antalet licensierade förare kan variera beroende på delstat, där vissa delstater har en högre andel licensierade förare än andra.

Sammantaget visar utvärderingsresultaten att våra PPLX-modeller kan matcha och till och med överträffa gpt-3.5 och llama2-70b på Perplexity-relaterade användningsfall, i synnerhet för att tillhandahålla korrekta och aktuella svar.

Åtkomst till Perplexitys Onlinemodeller

Vi är glada över att meddela att pplx-api går från beta till allmän offentlig utgåva! Detta är första gången som våra modeller pplx-7b-online och pplx-70b-online är tillgängliga via pplx-api. Dessutom har våra modeller pplx-7b-chat och pplx-70b-chat lämnat alfa-stadiet och är nu tillgängliga i vår allmänna utgåva.

I och med detta lanserar vi en ny användningsbaserad prisstruktur. Vi är glada över att våra användare ska kunna utnyttja vår toppmoderna infrastruktur, som använder NVIDIA H100s för att tillhandahålla blixtsnabb inferens. Pro-användare får en återkommande månatlig pplx-api-kredit på 5 USD. För alla andra användare fastställs prissättningen baserat på användning. För att registrera dig som Pro-användare, klicka här. Kontakta api@perplexity.ai för kommersiella förfrågningar.

PPLX-online llm-instrumentpanel

Ytterligare resurser:

Medarbetare:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats