Introductie van PPLX online LLM's
De eerste Online LLM API in zijn soort.

De eerste Online LLM API in zijn soort.
We zijn verheugd om twee nieuwe PPLX-modellen te introduceren: pplx-7b-online en pplx-70b-online! Onze online modellen zijn gericht op het leveren van behulpzame, actuele en feitelijke antwoorden en zijn openbaar beschikbaar via pplx-api, wat het tot een primeur maakt als API. pplx-7b-online en pplx-70b-online zijn ook toegankelijk via Perplexity Labs, onze LLM-speeltuin.
LLM's hebben de manier waarop we informatie vinden veranderd. Er zijn echter twee beperkingen bij de meeste huidige LLM's:
Actualiteit: LLM's hebben vaak moeite om actuele informatie te delen.
Hallucinaties: LLM's kunnen ook onnauwkeurige verklaringen genereren.
Onze pplx-7b-online en pplx-70b-online modellen pakken de huidige beperkingen aan door bovendien behulpzame, feitelijke en actuele informatie in hun antwoorden te verstrekken.
PPLX Online LLM's
Onze LLM's, pplx-7b-online en pplx-70b-online, zijn online LLM's omdat ze kennis van het internet kunnen gebruiken en daardoor bij het formuleren van een antwoord kunnen putten uit de meest actuele informatie. Door onze LLM's te voorzien van kennis van het web, kunnen onze modellen nauwkeurig reageren op tijdgevoelige zoekopdrachten, waardoor kennis buiten hun trainingscorpus wordt ontsloten. Dit betekent dat de online LLM's van Perplexity vragen kunnen beantwoorden zoals “Wat was de uitslag van de Warriors-wedstrijd gisteravond?”, wat uitdagend is voor offline modellen. Op hoofdlijnen werkt onze online LLM als volgt:
- Maak gebruik van open-source modellen: onze PPLX-modellen bouwen voort op de basismodellen
mistral-7benllama2-70b. - Eigen zoektechnologie: onze eigen infrastructuur voor zoeken, indexeren en crawlen stelt ons in staat om LLM's aan te vullen met de meest relevante, actuele en waardevolle informatie. Onze zoekindex is groot, wordt regelmatig bijgewerkt en gebruikt geavanceerde rangschikkingsalgoritmen om ervoor te zorgen dat niet-SEO-websites van hoge kwaliteit prioriteit krijgen. Websitefragmenten, die wij “snippets” noemen, worden aan onze
pplx-online-modellen verstrekt om antwoorden met de meest actuele informatie mogelijk te maken. - Fine-tuning: onze PPLX-modellen zijn getraind om effectief gebruik te maken van snippets om hun antwoorden te onderbouwen. Met behulp van onze interne datacontractanten cureren we zorgvuldig hoogwaardige, diverse en grote trainingssets om hoge prestaties te behalen op verschillende assen, zoals behulpzaamheid, feitelijkheid en actualiteit. Onze modellen worden regelmatig bijgeschaafd om de prestaties continu te verbeteren.
De online LLM's van Perplexity evalueren
De missie van Perplexity is om 's werelds beste antwoordenmachine te bouwen - een machine waarop mensen vertrouwen om hun kennis te ontdekken en uit te breiden. Om dit te bereiken, zijn we zeer gefocust op het leveren van behulpzame, feitelijke en actuele informatie. Om de prestaties van onze LLM's op deze assen te benchmarken, hebben we evaluatie-datasets samengesteld die uitdagende maar realistische gebruiksscenario's voor antwoordmachines weerspiegelen. Voor elke vraag in elke evaluatieset kregen contractanten twee modelantwoorden en kregen ze de opdracht het antwoord te selecteren dat beter presteerde op basis van de volgende criteria:
- Behulpzaamheid: welk antwoord beantwoordt de vraag en volgt de opgegeven instructies beter?
- Feitelijkheid: welk antwoord geeft nauwkeurigere antwoorden zonder hallucinaties, zelfs voor vragen die zeer precieze of nichekennis vereisen?
- Actualiteit (geïnspireerd door FreshLLMs): welk antwoord bevat meer actuele informatie? Een model blinkt uit in dit criterium als het in staat is om vragen te beantwoorden met “verse” informatie.
Naast de drie bovenstaande criteria werden de modelantwoorden ook holistisch geëvalueerd. Om antwoorden holistisch te evalueren, werd de beoordelaars gevraagd het antwoord te kiezen dat ze liever zouden ontvangen van een menselijke assistent die helpt met de vraag.
De evaluatieset cureren
Voor deze evaluatie hebben we zorgvuldig een diverse set prompts samengesteld met als doel effectief de behulpzaamheid, feitelijkheid en actualiteit te evalueren. Elke prompt werd handmatig geselecteerd, wat zorgt voor een hoge mate van controle over de kwaliteit en relevantie van de gegevens. De dataset omvat een breed scala aan prompts voor antwoordmachines en bevat een uitgebreid overzicht van waar we willen dat Perplexity in uitblinkt. Dit is cruciaal voor ons om onze modelevaluaties een hoog signaalgehalte te geven.
Elk van de drie evaluatiesets bevat 50 prompts. Enkele voorbeelden uit deze sets zijn:
- Behulpzaamheid: Maak een tabel van alle Amerikaanse voetballers die in de finale van het WK hebben gespeeld en maak kolommen voor hun statistieken zoals doelpunten, assists, enz.
- Feitelijkheid: Leg de taaiheid van AISI 1015 en AISI 1040 staal uit.
- Actualiteit: Welk autonoom autobedrijf werd in 2023 verbannen uit San Francisco?
Modelantwoorden genereren
We hebben vier modellen geëvalueerd:
pplx-7b-online: Het model van Perplexity, dat toegang bevat tot informatie van het internet. Dit model is getraind met behulp van mistral-7b.
pplx-70b-online: Het model van Perplexity, dat toegang bevat tot informatie van het internet. Dit model is getraind met behulp van llama2-70b.
gpt-3.5-turbo-1106: Het model van OpenAI, toegankelijk via de API en zonder aanvullende augmentaties. Merk op dat we deze evaluatie hebben uitgevoerd met het nieuwste gpt-3.5 model.
llama2-70b-chat: Het model van Meta AI, toegankelijk via onze pplx-api en zonder aanvullende augmentaties.
Voor elke prompt werden dezelfde zoekresultaten en snippets verstrekt aan de pplx-7b-online en pplx-70b-online modellen. Alle antwoorden werden gegenereerd met dezelfde hyperparameters en systeem-prompt.
Systeem-prompt
Current date: Monday, November 20, 2023.Modelantwoorden rangschikken met menselijke evaluatie
Voor elke paarsgewijze vergelijking kregen onze interne contractanten de prompt zelf, de evaluatiecriteria (d.w.z. behulpzaamheid, feitelijkheid of actualiteit) en de modelantwoorden die naast elkaar werden weergegeven. De volgorde van de antwoorden werd bij elke beurt gerandomiseerd en de bronmodellen werden niet onthuld aan de beoordelaar. Beoordelaars kregen de opdracht het antwoord te selecteren waar ze holistisch de voorkeur aan geven, evenals welk model beter presteert op het specifieke evaluatiecriterium, waarbij gelijke standen voor beide waren toegestaan. Ten slotte mochten beoordelaars internetonderzoek gebruiken om de juistheid van antwoorden te verifiëren. We hebben onze eigen interne tool voor voorkeursrangschikking gebouwd om deze evaluatie uit te voeren.
Evaluatieresultaten
We gebruiken de paarsgewijze voorkeursrangschikkingen die zijn verzameld door menselijke evaluatie om per-taak Elo-scores voor elk model te berekenen. Elo-scores worden vaak gebruikt om een populatie spelers in toernooistijlcompetities te rangschikken om de relatieve prestaties van de spelers te meten. Bij toepassing op grote taalmodellen bieden deze scores een voorspelling van hoe waarschijnlijk het is dat een menselijke beoordelaar de output van het ene model verkiest boven die van het andere.
Hoewel Elo-scores doorgaans worden berekend voor een reeks vergelijkingen om rekening te houden met veranderingen in de vaardigheden van spelers, streven we ernaar de prestaties te kwantificeren van modellen wiens vaardigheden niet kunnen veranderen. Daarom hanteren we de Bootstrap Elo-methodologie die wordt beschreven in Duan et al en ook door lmsys wordt gebruikt voor hun Chatbot Arena, wat inhoudt dat Elo-scores worden berekend voor veel willekeurige permutaties van de vergelijkingen. Voor onze berekeningen hebben we Elo-scores over 5000 permutaties berekend en de verdelingen van deze Elo-scores gebruikt om 95%-betrouwbaarheidsintervallen te berekenen.
De resultaten, getoond in Figuur 1, tonen aan dat onze PPLX-modellen de prestaties van gpt-3.5 kunnen evenaren en zelfs overtreffen in gebruiksscenario's die betrekking hebben op Perplexity. In het bijzonder krijgen modelantwoorden van pplx-7b-online en pplx-70b-online de voorkeur van menselijke beoordelaars boven modelantwoorden van gpt-3.5 en llama2-70b vanwege hun nauwkeurige en actuele antwoorden.
De pplx-7b-online en pplx-70b-online presteren beter dan gpt-3.5 en llama2-70b, op de actualiteit, feitelijkheid en holistische criteria.

We hebben ook de paarsgewijze winpercentages uit de evaluatie berekend. De resultaten, getoond in Figuur 2, illustreren wellicht niet verrassend, dat de online modelantwoorden van pplx de voorkeur krijgen boven die van anderen op actualiteit en feitelijkheid.

Hier is een voorbeeld uit onze evaluatiedataset voor actualiteit.
Prompt: Hoeveel mensen in de VS hebben een rijbewijs?
pplx-7b-online
In 2023 zijn er naar schatting 243,4 miljoen gelicentieerde bestuurders in de Verenigde Staten, wat 89% van de volwassenen in de VS omvat. Dit aantal is gestegen van 238,6 miljoen in 2022. Het percentage gelicentieerde bestuurders varieert per leeftijdsgroep en staat. Zo had in 2019 84,1% van de Amerikaanse bevolking een rijbewijs. Het hoogste percentage gelicentieerde bestuurders bevindt zich onder 25- tot 49-jarigen, waarbij 90,1% van de bevolking een rijbewijs heeft. In Californië waren er 27 miljoen gelicentieerde bestuurders, waardoor het de staat is met het hoogste aantal gelicentieerde bestuurders.
pplx-70b-online
In 2021 hadden ongeveer 233 miljoen mensen een geldig rijbewijs in de Verenigde Staten. Tegen 2023 zal het aantal gelicentieerde bestuurders in de VS naar verwachting 243,4 miljoen bereiken, wat 89% van de volwassenen in de VS omvat. Dit vertegenwoordigt een stijging van 238,6 miljoen in 2022.
gpt-3.5
Als AI-taalmodel heb ik geen toegang tot realtime gegevens. Echter, vanaf 2021 werd geschat dat ongeveer 227 miljoen mensen in de Verenigde Staten een geldig rijbewijs hadden. Houd er rekening mee dat dit aantal sindsdien veranderd kan zijn, dus het is altijd het beste om de meest recente officiële statistieken te raadplegen voor de meest nauwkeurige informatie.
llama2-70b
Ik heb geen toegang tot realtime gegevens, maar ik kan wel wat informatie geven over het geschatte aantal mensen in de Verenigde Staten met een rijbewijs. Volgens de Federal Highway Administration waren er vanaf 2020 ongeveer 227,8 miljoen gelicentieerde bestuurders in de Verenigde Staten. Dit aantal omvat zowel commerciële als niet-commerciële bestuurders. Het is vermeldenswaard dat dit aantal waarschijnlijk een onderschatting is, aangezien het geen rekening houdt met individuen die mogelijk wel een rijbewijs hebben maar niet regelmatig of helemaal niet rijden. Daarnaast omvat dit aantal niet individuen die niet in aanmerking komen voor een rijbewijs, zoals mensen jonger dan 16 jaar of mensen met bepaalde handicaps. Het is ook belangrijk op te merken dat het aantal gelicentieerde bestuurders per staat kan verschillen, waarbij sommige staten een hoger percentage gelicentieerde bestuurders hebben dan andere.
Over het geheel genomen tonen de evaluatieresultaten aan dat onze PPLX-modellen gpt-3.5 en llama2-70b kunnen evenaren en zelfs overtreffen in gebruiksscenario's die betrekking hebben op Perplexity, met name voor het verstrekken van nauwkeurige en actuele antwoorden.
Toegang krijgen tot de online modellen van Perplexity
We zijn verheugd aan te kondigen dat de pplx-api uit de bètafase treedt en algemeen beschikbaar wordt gesteld! Dit is de eerste keer dat onze modellen pplx-7b-online en pplx-70b-online toegankelijk zijn via de pplx-api. Daarnaast zijn onze modellen pplx-7b-chat en pplx-70b-chat uit de alfafase en zijn nu toegankelijk met onze algemene release.
Hiermee introduceren we een nieuwe prijsstructuur op basis van gebruik. We zijn enthousiast dat onze gebruikers onze state-of-the-art infrastructuur kunnen gebruiken, die NVIDIA H100s gebruikt om razendsnelle inferentie te bieden. Pro-gebruikers ontvangen een terugkerend maandelijks pplx-api-tegoed van $5. Voor alle andere gebruikers wordt de prijs bepaald op basis van gebruik. Om u aan te melden als Pro-gebruiker, klik hier. Neem contact op met api@perplexity.ai voor commerciële vragen.

Aanvullende bronnen:
- Ga aan de slag met pplx-api hier.
- Probeer onze online modellen gratis uit met Perplexity Labs.
- Lees meer over onze API via de pplx-api documentatie.
- Geïnteresseerd om in een high-impact, high-velocity team te werken aan het bouwen van de beste antwoordenmachine? Sluit je bij ons aan!
- Word lid van onze groeiende Discord Community!
Medewerkers:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats