Introduzione agli LLM online PPLX
La prima API LLM online del suo genere.

La prima API LLM online del suo genere.
Siamo entusiasti di condividere due nuovi modelli PPLX: pplx-7b-online e pplx-70b-online! I nostri modelli online si concentrano sulla fornitura di risposte utili, aggiornate e basate sui fatti, e sono disponibili pubblicamente tramite pplx-api, rendendola un'API unica nel suo genere. pplx-7b-online e pplx-70b-online sono accessibili anche tramite Perplexity Labs, il nostro ambiente di test LLM.
Gli LLM hanno trasformato il modo in cui troviamo le informazioni. Tuttavia, esistono due limitazioni comuni alla maggior parte degli LLM oggi:
Freschezza: gli LLM spesso faticano a condividere informazioni aggiornate.
Allucinazioni: gli LLM possono anche produrre dichiarazioni imprecise.
I nostri modelli pplx-7b-online e pplx-70b-online risolvono le attuali limitazioni fornendo, in aggiunta, informazioni utili, fattuali e aggiornate nelle loro risposte.
LLM online PPLX
I nostri LLM, pplx-7b-online e pplx-70b-online, sono LLM online perché possono utilizzare le conoscenze provenienti da Internet e, di conseguenza, possono sfruttare le informazioni più aggiornate durante la formulazione di una risposta. Fornendo ai nostri LLM le conoscenze del web, i nostri modelli rispondono accuratamente a query sensibili al tempo, sbloccando conoscenze al di fuori del loro corpus di addestramento. Ciò significa che gli LLM online di Perplexity possono rispondere a query come “Qual è stato il risultato della partita dei Warriors ieri sera?”, che risultano impegnative per i modelli offline. A livello generale, ecco come funziona il nostro LLM online:
- Sfruttare modelli open source: i nostri modelli PPLX si basano sui modelli base
mistral-7bellama2-70b. - Tecnologia di ricerca interna: la nostra infrastruttura interna di ricerca, indicizzazione e crawling ci consente di potenziare gli LLM con le informazioni più pertinenti, aggiornate e preziose. Il nostro indice di ricerca è ampio, aggiornato su base regolare e utilizza sofisticati algoritmi di ranking per garantire la priorità ai siti di alta qualità non orientati esclusivamente alla SEO. Gli estratti dei siti web, che chiamiamo “snippet”, vengono forniti ai nostri modelli
pplx-onlineper consentire risposte con le informazioni più aggiornate. - Fine-tuning: i nostri modelli PPLX sono stati sottoposti a fine-tuning per utilizzare efficacemente gli snippet per informare le proprie risposte. Avvalendoci dei nostri collaboratori interni per i dati, curiamo attentamente set di addestramento ampi, diversificati e di alta qualità per ottenere prestazioni elevate su vari assi come utilità, accuratezza fattuale e freschezza. I nostri modelli vengono regolarmente sottoposti a fine-tuning per migliorare continuamente le prestazioni.
Valutazione degli LLM online di Perplexity
La missione di Perplexity è costruire il miglior motore di ricerca basato su risposte al mondo, un motore di cui le persone si fidano per scoprire ed espandere le proprie conoscenze. Per raggiungere questo obiettivo, siamo profondamente concentrati sulla fornitura di informazioni utili, fattuali e aggiornate. Per confrontare le prestazioni dei nostri LLM su questi assi, abbiamo curato set di dati di valutazione che riflettono casi d'uso impegnativi ma realistici per i motori di ricerca. Per ogni query in ogni set di valutazione, ai collaboratori sono state fornite due risposte di modello ed è stato chiesto di selezionare la risposta che ha ottenuto prestazioni migliori in base ai seguenti criteri:
- Utilità: quale risposta risponde alla query e segue meglio le istruzioni specificate?
- Accuratezza fattuale: quale risposta fornisce risposte più precise senza allucinazioni, anche per domande che richiedono conoscenze molto precise o di nicchia?
- Freschezza (ispirata a FreshLLMs): quale risposta contiene informazioni più aggiornate? Un modello eccelle in questo criterio se è in grado di rispondere a query con informazioni “fresche”.
Oltre ai tre criteri sopra indicati, le risposte del modello sono state valutate anche in modo olistico. Per valutare le risposte in modo olistico, agli esperti è stato chiesto di scegliere la risposta che preferirebbero ricevere da un assistente umano che sta fornendo aiuto con la query.
Cura del set di valutazione
Per questa valutazione, abbiamo curato attentamente un set diversificato di prompt con l'obiettivo di valutare efficacemente utilità, accuratezza fattuale e freschezza. Ogni prompt è stato selezionato manualmente, garantendo un elevato livello di controllo sulla qualità e sulla pertinenza dei dati. Il set di dati copre una vasta gamma di prompt per motori di ricerca e racchiude una panoramica completa di ciò in cui vogliamo che Perplexity eccella. Questo è fondamentale affinché le nostre valutazioni sulle prestazioni del modello abbiano un alto grado di attendibilità.
Ognuno dei tre set di valutazione contiene 50 prompt. Alcuni esempi da questi set includono:
- Utilità: Crea una tabella di tutti i giocatori di calcio statunitensi che hanno giocato nelle finali della Coppa del Mondo e crea colonne per le loro statistiche come gol, assist, ecc.
- Accuratezza fattuale: Spiega la tenacità degli acciai AISI 1015 e AISI 1040.
- Aggiornamento: Quale azienda di auto autonome è stata bandita da San Francisco nel 2023?
Generazione delle risposte del modello
Abbiamo valutato quattro modelli:
pplx-7b-online: Il modello di Perplexity, che include l'accesso alle informazioni da Internet. Questo modello è stato sottoposto a fine-tuning utilizzando mistral-7b.
pplx-70b-online: Il modello di Perplexity, che include l'accesso alle informazioni da Internet. Questo modello è stato sottoposto a fine-tuning utilizzando llama2-70b.
gpt-3.5-turbo-1106: Il modello di OpenAI, a cui si accede tramite API e senza ulteriori potenziamenti. Si noti che abbiamo condotto questa valutazione utilizzando l'ultimo modello gpt-3.5.
llama2-70b-chat: Il modello di Meta AI, a cui si accede tramite la nostra pplx-api e senza ulteriori potenziamenti.
Per ogni prompt, gli stessi risultati di ricerca e snippet sono stati forniti ai modelli pplx-7b-online e pplx-70b-online. Tutte le risposte sono state generate utilizzando gli stessi iperparametri e prompt di sistema.
Prompt di sistema
Current date: Monday, November 20, 2023.Classifica delle risposte del modello tramite valutazione umana
Per ogni confronto a coppie, ai nostri collaboratori interni sono stati forniti il prompt stesso, i criteri di valutazione (ovvero utilità, accuratezza fattuale o freschezza) e le risposte del modello visualizzate fianco a fianco. L'ordine delle risposte è stato randomizzato a ogni turno e i modelli di origine non sono stati rivelati al valutatore. Agli esperti è stato chiesto di selezionare la risposta che preferiscono a livello olistico, oltre a quella che ottiene risultati migliori in base al criterio di valutazione specifico, consentendo pareggi in entrambi i casi. Infine, ai valutatori è stato consentito di utilizzare la ricerca su Internet per verificare l'accuratezza delle risposte. Abbiamo creato il nostro strumento interno di classificazione delle preferenze per condurre questa valutazione.
Risultati della valutazione
Utilizziamo le classifiche delle preferenze a coppie raccolte dalla valutazione umana per calcolare i punteggi Elo per attività per ciascun modello. I punteggi Elo sono comunemente utilizzati per classificare una popolazione di giocatori in competizioni in stile torneo per misurare le prestazioni relative dei giocatori. Quando applicati a modelli linguistici di grandi dimensioni, questi punteggi forniscono una previsione di quanto sia probabile che un valutatore umano possa favorire l'output di un modello rispetto a un altro.
Sebbene i punteggi Elo siano generalmente calcolati per una sequenza di confronti per tenere conto dei cambiamenti nelle abilità dei giocatori, miriamo a quantificare le prestazioni di modelli le cui abilità non possono cambiare. Di conseguenza, adottiamo la metodologia Bootstrap Elo descritta in Duan et al e utilizzata anche da lmsys per la loro Chatbot Arena, che comporta il calcolo dei punteggi Elo per molte permutazioni casuali dei confronti. Per i nostri calcoli, abbiamo calcolato i punteggi Elo su 5000 permutazioni e utilizzato le distribuzioni di questi punteggi Elo per calcolare intervalli di confidenza al 95%.
I risultati, mostrati nella Figura 1, dimostrano che i nostri modelli PPLX possono eguagliare e persino superare le prestazioni di gpt-3.5 nei casi d'uso relativi a Perplexity. In particolare, le risposte dei modelli pplx-7b-online e pplx-70b-online sono preferite dai valutatori umani rispetto a quelle dei modelli gpt-3.5 e llama2-70b per le loro risposte accurate e aggiornate.
pplx-7b-online e pplx-70b-online offrono prestazioni migliori rispetto a gpt-3.5 e llama2-70b in base ai criteri di freschezza, accuratezza fattuale e valutazione olistica.

Abbiamo anche calcolato i tassi di vincita a coppie dalla valutazione. I risultati, mostrati nella Figura 2, illustrano, forse non sorprendentemente, che le risposte dei modelli online pplx sono preferite rispetto ad altre per freschezza e accuratezza fattuale.

Ecco un esempio dal nostro set di dati di valutazione della freschezza.
Prompt: Quante persone negli Stati Uniti hanno una patente di guida?
pplx-7b-online
Nel 2023, si prevedono 243,4 milioni di conducenti in possesso di patente negli Stati Uniti, cifra che include l'89% degli adulti statunitensi. Questo numero è aumentato rispetto ai 238,6 milioni del 2022. La percentuale di conducenti con patente varia a seconda delle diverse fasce d'età e stati. Ad esempio, nel 2019, l'84,1% della popolazione statunitense possedeva una patente di guida. La percentuale più alta di conducenti con patente si riscontra tra i 25 e i 49 anni, con il 90,1% della popolazione in possesso di patente di guida. In California, c'erano 27 milioni di conducenti con patente, rendendolo lo stato con il maggior numero di conducenti patentati.
pplx-70b-online
Nel 2021, circa 233 milioni di persone possedevano una patente di guida valida negli Stati Uniti. Entro il 2023, si prevede che il numero di conducenti con patente negli Stati Uniti raggiungerà i 243,4 milioni, cifra che include l'89% degli adulti statunitensi. Ciò rappresenta un aumento rispetto ai 238,6 milioni del 2022.
gpt-3.5
Come modello linguistico AI, non ho accesso a dati in tempo reale. Tuttavia, al 2021, si stimava che circa 227 milioni di persone negli Stati Uniti possedessero una patente di guida valida. Si noti che questo numero potrebbe essere cambiato da allora, quindi è sempre meglio fare riferimento alle ultime statistiche ufficiali per ottenere le informazioni più accurate.
llama2-70b
Non ho accesso a dati in tempo reale, ma posso fornire alcune informazioni sul numero approssimativo di persone negli Stati Uniti che possiedono una patente di guida. Secondo la Federal Highway Administration, c'erano circa 227,8 milioni di conducenti con patente negli Stati Uniti al 2020. Questo numero include sia conducenti commerciali che non commerciali. Vale la pena notare che questo numero è probabilmente una sottostima, poiché non tiene conto delle persone che potrebbero possedere una patente di guida ma non guidano regolarmente o affatto. Inoltre, questo numero non include le persone che non hanno i requisiti per una patente di guida, come coloro che hanno meno di 16 anni o presentano determinate disabilità. È anche importante notare che il numero di conducenti con patente può variare in base allo stato, con alcuni stati che hanno una percentuale più alta di conducenti patentati rispetto ad altri.
Nel complesso, i risultati della valutazione dimostrano che i nostri modelli PPLX possono eguagliare e persino superare gpt-3.5 e llama2-70b nei casi d'uso relativi a Perplexity, in particolare per fornire risposte accurate e aggiornate.
Accesso ai modelli online di Perplexity
Siamo entusiasti di annunciare che la pplx-api sta uscendo dalla fase beta per il rilascio pubblico generale! Questa è la prima volta che i nostri modelli pplx-7b-online e pplx-70b-online sono accessibili tramite la pplx-api. Inoltre, i nostri modelli pplx-7b-chat e pplx-70b-chat sono usciti dalla fase alpha e sono ora accessibili con il nostro rilascio generale.
Con questo, introduciamo una nuova struttura di prezzi basata sull'utilizzo. Siamo entusiasti che i nostri utenti utilizzino la nostra infrastruttura all'avanguardia, che sfrutta NVIDIA H100 per fornire un'inferenza estremamente rapida. Gli utenti Pro riceveranno un credito ricorrente di 5 $ al mese per pplx-api. Per tutti gli altri utenti, i prezzi saranno determinati in base all'utilizzo. Per registrarsi come utente Pro, clicca qui. Contatta api@perplexity.ai per richieste commerciali.

Risorse aggiuntive:
- Inizia con pplx-api qui.
- Prova gratuitamente i nostri modelli online con Perplexity Labs.
- Scopri di più sulla nostra API tramite la documentazione pplx-api.
- Ti interessa lavorare in un team ad alto impatto e ad alta velocità che costruisce il miglior motore di ricerca? Unisciti a noi!
- Unisciti alla nostra comunità Discord!
Contributori:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats