Présentation des LLM en ligne PPLX
La première API LLM en ligne en son genre.

La première API LLM en ligne en son genre.
Nous sommes ravis de vous présenter deux nouveaux modèles PPLX : pplx-7b-online et pplx-70b-online ! Nos modèles en ligne visent à fournir des réponses utiles, à jour et factuelles. Ils sont accessibles au public via pplx-api, ce qui en fait une API unique en son genre. pplx-7b-online et pplx-70b-online sont également accessibles via Perplexity Labs, notre environnement de test LLM.
Les LLM ont transformé notre manière de trouver des informations. Cependant, la plupart des LLM actuels présentent deux limites :
Actualité : les LLM peinent souvent à partager des informations à jour.
Hallucinations : les LLM peuvent également produire des déclarations inexactes.
Nos modèles pplx-7b-online et pplx-70b-online corrigent ces limites actuelles en fournissant également des informations utiles, factuelles et actualisées dans leurs réponses.
LLM PPLX en ligne
Nos LLM, pplx-7b-online et pplx-70b-online, sont des LLM en ligne car ils peuvent utiliser les connaissances disponibles sur Internet et ainsi exploiter les informations les plus récentes lors de la formulation d'une réponse. En dotant nos LLM de connaissances issues du Web, nos modèles répondent avec précision aux requêtes sensibles au facteur temps, débloquant des connaissances au-delà de leur corpus d'entraînement. Cela signifie que les LLM en ligne de Perplexity peuvent répondre à des requêtes comme « Quel était le score du match des Warriors hier soir ? », ce qui est complexe pour les modèles hors ligne. Globalement, voici comment fonctionne notre LLM en ligne :
- Exploitation de modèles open source : nos modèles PPLX reposent sur les modèles de base
mistral-7betllama2-70b. - Technologie de recherche interne : notre infrastructure interne de recherche, d'indexation et d'exploration nous permet d'augmenter les LLM avec les informations les plus pertinentes, actualisées et précieuses. Notre index de recherche est vaste, mis à jour régulièrement et utilise des algorithmes de classement sophistiqués pour garantir la priorité aux sites de haute qualité, sans SEO abusif. Des extraits de sites Web, que nous appelons « snippets », sont fournis à nos modèles
pplx-onlinepour permettre des réponses contenant les informations les plus à jour. - Fine-tuning : nos modèles PPLX ont été ajustés pour utiliser efficacement les snippets afin d'étayer leurs réponses. Grâce à nos collaborateurs de données internes, nous élaborons soigneusement des ensembles d'entraînement diversifiés et de haute qualité afin d'atteindre des performances élevées sur divers axes tels que l'utilité, la véracité et la fraîcheur. Nos modèles sont régulièrement réajustés pour améliorer continuellement leurs performances.
Évaluation des LLM en ligne de Perplexity
La mission de Perplexity est de construire le meilleur moteur de réponse au monde, un moteur auquel les utilisateurs font confiance pour découvrir et élargir leurs connaissances. Pour y parvenir, nous nous concentrons intensément sur la fourniture d'informations utiles, factuelles et à jour. Afin d'évaluer les performances de nos LLM sur ces axes, nous avons constitué des ensembles de données d'évaluation reflétant des cas d'utilisation complexes mais réalistes pour les moteurs de réponse. Pour chaque requête dans chaque ensemble d'évaluation, les collaborateurs ont reçu deux réponses de modèles et ont été chargés de sélectionner la réponse la plus performante selon les critères suivants :
- Utilité : quelle réponse répond mieux à la requête et suit mieux les instructions spécifiées ?
- Véracité : quelle réponse fournit des réponses plus précises sans hallucinations, même pour des questions nécessitant des connaissances très précises ou spécialisées ?
- Actualité (inspiré de FreshLLMs) : quelle réponse contient des informations plus à jour ? Un modèle excelle selon ce critère s'il est capable de répondre aux requêtes avec des informations « fraîches ».
Outre les trois critères ci-dessus, les réponses des modèles ont également été évaluées de manière holistique. Pour ce faire, les évaluateurs ont été invités à choisir la réponse qu'ils préféreraient recevoir de la part d'un assistant humain aidant à traiter la requête.
Constitution de l'ensemble d'évaluation
Pour cette évaluation, nous avons soigneusement sélectionné un ensemble diversifié de prompts dans le but d'évaluer efficacement l'utilité, la véracité et l'actualité. Chaque prompt a été sélectionné manuellement, garantissant un haut niveau de contrôle sur la qualité et la pertinence des données. L'ensemble de données couvre un large éventail de requêtes de moteur de réponse et englobe un aperçu complet de ce que nous voulons que Perplexity maîtrise. Ceci est essentiel pour que nos évaluations de performance de modèle aient un signal fort.
Chacun des trois ensembles d'évaluation contient 50 prompts. Quelques exemples issus de ces ensembles incluent :
- Utilité : Créez un tableau de tous les joueurs de football américains ayant disputé les finales de la Coupe du Monde et ajoutez des colonnes pour leurs statistiques telles que les buts, les passes décisives, etc.
- Véracité : Expliquez la ténacité des aciers AISI 1015 et AISI 1040.
- Actualité : Quelle entreprise de voitures autonomes a été bannie de San Francisco en 2023 ?
Génération des réponses des modèles
Nous avons évalué quatre modèles :
pplx-7b-online : Modèle de Perplexity, incluant l'accès à des informations provenant d'Internet. Ce modèle a été ajusté en utilisant mistral-7b.
pplx-70b-online : Modèle de Perplexity, incluant l'accès à des informations provenant d'Internet. Ce modèle a été ajusté en utilisant llama2-70b.
gpt-3.5-turbo-1106 : Modèle d'OpenAI, accédé via API et sans augmentations supplémentaires. Notez que nous avons mené cette évaluation en utilisant le dernier modèle gpt-3.5.
llama2-70b-chat : Modèle de Meta AI, accédé via notre pplx-api et sans augmentations supplémentaires.
Pour chaque prompt, les mêmes résultats de recherche et snippets ont été fournis aux modèles pplx-7b-online et pplx-70b-online. Toutes les réponses ont été générées en utilisant les mêmes hyperparamètres et le même prompt système.
Prompt système
Current date: Monday, November 20, 2023.Classement des réponses des modèles par évaluation humaine
Pour chaque comparaison par paire, nos collaborateurs internes ont reçu le prompt lui-même, les critères d'évaluation (utilité, véracité ou actualité) et les réponses des modèles affichées côte à côte. L'ordre des réponses a été randomisé à chaque étape, et les modèles sources n'ont pas été révélés à l'évaluateur. Les évaluateurs ont été chargés de sélectionner la réponse qu'ils préfèrent globalement, ainsi que celle qui est plus performante selon le critère d'évaluation spécifique, avec égalité autorisée pour les deux. Enfin, les évaluateurs ont été autorisés à utiliser la recherche Internet pour vérifier l'exactitude des réponses. Nous avons développé notre propre outil interne de classement des préférences pour mener cette évaluation.
Résultats de l'évaluation
Nous utilisons les classements de préférences par paire collectés à partir de l'évaluation humaine pour calculer les scores Elo par tâche pour chaque modèle. Les scores Elo sont couramment utilisés pour classer une population de joueurs dans des compétitions de style tournoi afin de mesurer la performance relative des joueurs. Appliqués aux grands modèles de langage, ces scores fournissent une prédiction de la probabilité qu'un évaluateur humain favorise la sortie d'un modèle par rapport à un autre.
Bien que les scores Elo soient généralement calculés pour une séquence de comparaisons afin de tenir compte des changements dans les capacités des joueurs, nous visons à quantifier la performance de modèles dont les capacités ne peuvent pas changer. Par conséquent, nous adoptons la méthodologie Bootstrap Elo décrite par Duan et al. et également utilisée par lmsys pour leur Chatbot Arena, ce qui implique le calcul des scores Elo pour de nombreuses permutations aléatoires des comparaisons. Pour nos calculs, nous avons calculé les scores Elo sur 5000 permutations et utilisé les distributions de ces scores pour calculer des intervalles de confiance à 95 %.
Les résultats, présentés dans la Figure 1, démontrent que nos modèles PPLX peuvent égaler et même surpasser les performances de gpt-3.5 sur des cas d'utilisation liés à Perplexity. En particulier, les réponses des modèles pplx-7b-online et pplx-70b-online sont préférées aux réponses des modèles gpt-3.5 et llama2-70b par les évaluateurs humains pour leurs réponses précises et à jour.
Les pplx-7b-online et pplx-70b-online sont plus performants que gpt-3.5 et llama2-70b selon les critères d'actualité, de véracité et holistique.

Nous avons également calculé les taux de victoire par paire issus de l'évaluation. Les résultats, présentés dans la Figure 2, illustrent, sans surprise, que les réponses du modèle en ligne PPLX sont préférées aux autres sur l'actualité et la véracité.

Voici un exemple issu de notre ensemble de données d'évaluation sur l'actualité.
Prompt : Combien de personnes aux États-Unis possèdent un permis de conduire ?
pplx-7b-online
En 2023, on projette 243,4 millions de conducteurs titulaires d'un permis aux États-Unis, ce qui inclut 89 % des adultes américains. Ce chiffre a augmenté par rapport aux 238,6 millions en 2022. Le pourcentage de conducteurs titulaires d'un permis varie selon les groupes d'âge et les États. Par exemple, en 2019, 84,1 % de la population américaine possédait un permis de conduire. Le pourcentage le plus élevé de titulaires de permis se trouve chez les 25-49 ans, avec 90,1 % de la population possédant un permis de conduire. En Californie, il y avait 27 millions de titulaires de permis, ce qui en fait l'État avec le plus grand nombre de conducteurs titulaires d'un permis.
pplx-70b-online
En 2021, environ 233 millions de personnes possédaient un permis de conduire valide aux États-Unis. D'ici 2023, le nombre de conducteurs titulaires d'un permis aux États-Unis devrait atteindre 243,4 millions, ce qui inclut 89 % des adultes américains. Cela représente une augmentation par rapport aux 238,6 millions en 2022.
gpt-3.5
En tant que modèle linguistique IA, je n'ai pas accès aux données en temps réel. Cependant, en 2021, il a été estimé qu'environ 227 millions de personnes aux États-Unis possédaient un permis de conduire valide. Veuillez noter que ce chiffre a pu changer depuis, il est donc toujours préférable de se référer aux dernières statistiques officielles pour obtenir les informations les plus précises.
llama2-70b
Je n'ai pas accès aux données en temps réel, mais je peux fournir quelques informations sur le nombre approximatif de personnes aux États-Unis possédant un permis de conduire. Selon la Federal Highway Administration, il y avait environ 227,8 millions de conducteurs titulaires d'un permis aux États-Unis en 2020. Ce nombre inclut les conducteurs commerciaux et non commerciaux. Il est à noter que ce chiffre est probablement une sous-estimation, car il ne prend pas en compte les individus qui peuvent posséder un permis de conduire mais ne conduisent pas régulièrement ou pas du tout. De plus, ce nombre n'inclut pas les individus qui ne sont pas éligibles à un permis de conduire, tels que ceux âgés de moins de 16 ans ou ayant certains handicaps. Il est également important de noter que le nombre de titulaires de permis peut varier selon l'État, certains États ayant un pourcentage plus élevé de conducteurs titulaires d'un permis que d'autres.
Globalement, les résultats de l'évaluation démontrent que nos modèles PPLX peuvent égaler et même surpasser gpt-3.5 et llama2-70b sur des cas d'utilisation liés à Perplexity, en particulier pour fournir des réponses précises et à jour.
Accès aux modèles en ligne de Perplexity
Nous sommes ravis d'annoncer que pplx-api sort de sa phase bêta pour une diffusion publique générale ! C'est la première fois que nos modèles pplx-7b-online et pplx-70b-online sont accessibles via pplx-api. De plus, nos modèles pplx-7b-chat et pplx-70b-chat ont quitté leur phase alpha et sont désormais accessibles avec notre version générale.
Avec cela, nous introduisons une nouvelle structure de tarification basée sur l'utilisation. Nous sommes impatients que nos utilisateurs exploitent notre infrastructure de pointe, qui utilise des NVIDIA H100s pour fournir une inférence ultra-rapide. Les utilisateurs Pro recevront un crédit récurrent de 5 $ par mois pour pplx-api. Pour tous les autres utilisateurs, la tarification sera déterminée en fonction de l'utilisation. Pour vous inscrire en tant qu'utilisateur Pro, cliquez ici. Contactez api@perplexity.ai pour toute demande commerciale.

Ressources supplémentaires :
- Démarrez avec pplx-api ici.
- Essayez nos modèles en ligne gratuitement avec Perplexity Labs.
- Apprenez-en davantage sur notre API via la documentation pplx-api.
- Intéressé par le travail au sein d'une équipe à fort impact et haute vélocité construisant le meilleur moteur de réponse ? Rejoignez-nous !
- Rejoignez notre communauté Discord grandissante !
Contributeurs :
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats