Présentation des GNL en ligne PPLX
La première API de GNL en ligne du genre

La première API de GNL en ligne du genre.
Nous sommes ravis de présenter deux nouveaux modèles PPLX : pplx-7b-online et pplx-70b-online ! Nos modèles en ligne visent à fournir des réponses utiles, actualisées et factuelles, et sont accessibles publiquement via pplx-api, ce qui en fait une API unique en son genre. pplx-7b-online et pplx-70b-online sont également accessibles via Perplexity Labs, notre environnement de test de GNL.
Les GNL ont transformé notre façon de trouver de l'information. Cependant, la plupart des GNL d'aujourd'hui présentent deux limites :
Actualité : les GNL ont souvent du mal à partager des informations à jour.
Hallucinations : les GNL peuvent également produire des déclarations inexactes.
Nos modèles pplx-7b-online et pplx-70b-online remédient aux limites actuelles en fournissant en outre des informations utiles, factuelles et actualisées dans leurs réponses.
GNL en ligne PPLX
Nos GNL, pplx-7b-online et pplx-70b-online, sont des GNL en ligne parce qu'ils peuvent utiliser les connaissances d'Internet et ainsi tirer parti des informations les plus récentes pour formuler une réponse. En fournissant à nos GNL des connaissances issues du Web, nos modèles répondent avec précision aux requêtes sensibles au facteur temps, libérant ainsi des connaissances au-delà de leur corpus d'entraînement. Cela signifie que les GNL en ligne de Perplexity peuvent répondre à des requêtes telles que « Quel a été le pointage du match des Warriors hier soir ? », qui s'avèrent difficiles pour les modèles hors ligne. De manière générale, voici comment fonctionne notre GNL en ligne :
- Tirer parti de modèles open source : nos modèles PPLX reposent sur les modèles de base
mistral-7betllama2-70b. - Technologie de recherche interne : notre infrastructure interne de recherche, d'indexation et d'exploration nous permet d'augmenter les GNL avec les informations les plus pertinentes, actuelles et précieuses. Notre index de recherche est vaste, mis à jour régulièrement et utilise des algorithmes de classement sophistiqués pour garantir que les sites de haute qualité sans optimisation pour les moteurs de recherche (SEO) sont priorisés. Des extraits de sites Web, que nous appelons « extraits », sont fournis à nos modèles
pplx-onlineafin de permettre des réponses avec les informations les plus récentes. - Réglage fin : nos modèles PPLX ont fait l'objet d'un réglage fin pour utiliser efficacement les extraits afin d'éclairer leurs réponses. En faisant appel à nos propres fournisseurs de données internes, nous organisons soigneusement des ensembles d'entraînement de grande qualité, diversifiés et vastes afin d'atteindre des performances élevées sur divers axes tels que l'utilité, la factualité et l'actualité. Nos modèles font l'objet d'un réglage fin régulier pour améliorer continuellement leurs performances.
Évaluation des GNL en ligne de Perplexity
La mission de Perplexity consiste à créer le meilleur moteur de réponse au monde, un moteur en qui les gens ont confiance pour découvrir et élargir leurs connaissances. Pour y parvenir, nous nous concentrons profondément sur la fourniture d'informations utiles, factuelles et actualisées. Pour évaluer les performances de nos GNL sur ces axes, nous avons organisé des ensembles de données d'évaluation pour refléter des cas d'utilisation difficiles mais réalistes pour les moteurs de réponse. Pour chaque requête de chaque ensemble d'évaluation, les fournisseurs ont reçu deux réponses de modèles et ont eu pour instruction de sélectionner la réponse ayant obtenu de meilleurs résultats selon les critères suivants :
- Utilité : quelle réponse répond le mieux à la requête et respecte les instructions spécifiées ?
- Factualité : quelle réponse fournit des réponses plus précises sans hallucinations, même pour les questions qui nécessitent des connaissances très précises ou de niche ?
- Actualité (inspirée par FreshLLMs) : quelle réponse contient les informations les plus récentes ? Un modèle excelle dans ce critère s'il est capable de répondre à des requêtes avec des informations « fraîches ».
En plus des trois critères ci-dessus, les réponses des modèles ont également été évaluées de manière holistique. Pour évaluer les réponses de manière holistique, il a été demandé aux évaluateurs de choisir la réponse qu'ils préféreraient recevoir d'un assistant humain qui aide avec la requête.
Organisation de l'ensemble d'évaluation
Pour cette évaluation, nous avons organisé avec soin un ensemble diversifié de invites dans le but d'évaluer efficacement l'utilité, la factualité et l'actualité. Chaque invite a été sélectionnée manuellement, garantissant un niveau élevé de contrôle sur la qualité et la pertinence des données. L'ensemble de données couvre un large éventail d'invites de moteurs de réponse et englobe un aperçu complet de ce que nous voulons que Perplexity réussisse à brillamment accomplir. Ceci est crucial pour que nos évaluations des performances des modèles présentent un signal élevé.
Chacun des trois ensembles d'évaluation contient 50 invites. Voici quelques exemples tirés de ces ensembles :
- Utilité : créez un tableau de tous les joueurs de soccer des États-Unis ayant joué lors de la finale de la Coupe du monde et créez des colonnes pour leurs statistiques telles que les buts, les passes décisives, etc.
- Factualité : expliquez la dureté des aciers AISI 1015 et AISI 1040.
- Actualité : quelle entreprise de voitures autonomes a été interdite à San Francisco en 2023 ?
Génération des réponses des modèles
Nous avons évalué quatre modèles :
pplx-7b-online : le modèle de Perplexity, qui comprend l'accès aux informations d'Internet. Ce modèle a fait l'objet d'un réglage fin à l'aide de mistral-7b.
pplx-70b-online : le modèle de Perplexity, qui comprend l'accès aux informations d'Internet. Ce modèle a fait l'objet d'un réglage fin à l'aide de llama2-70b.
gpt-3.5-turbo-1106 : le modèle d'OpenAI, accessible via l'API et sans augmentations supplémentaires. Notez que nous avons mené cette évaluation à l'aide du dernier modèle gpt-3.5.
llama2-70b-chat : le modèle de Meta AI, accessible via notre pplx-api et sans augmentations supplémentaires.
Pour chaque invite, les mêmes résultats de recherche et les mêmes extraits ont été fournis aux modèles pplx-7b-online et pplx-70b-online. Toutes les réponses ont été générées à l'aide des mêmes hyperparamètres et de la même invite système.
Invite système
Current date: Monday, November 20, 2023.Classement des réponses des modèles avec évaluation humaine
Pour chaque comparaison par paires, nos fournisseurs internes ont reçu l'invite elle-même, les critères d'évaluation (c'est-à-dire l'utilité, la factualité ou l'actualité) et les réponses des modèles affichées côte à côte. L'ordre des réponses a été randomisé à chaque tour, et les modèles sources n'ont pas été révélés à l'évaluateur. Les évaluateurs ont reçu pour instruction de sélectionner la réponse qu'ils préfèrent globalement, ainsi que celle qui obtient de meilleurs résultats sur le critère d'évaluation spécifique, les ex æquo étant autorisés pour les deux. Enfin, les évaluateurs ont été autorisés à utiliser la recherche sur Internet pour vérifier l'exactitude des réponses. Nous avons créé notre propre outil interne de classement des préférences pour mener cette évaluation.
Résultats de l'évaluation
Nous utilisons les classements de préférences par paires recueillis lors de l'évaluation humaine pour calculer les scores Elo par tâche pour chaque modèle. Les scores Elo sont couramment utilisés pour classer une population de joueurs dans des compétitions de type tournoi afin de mesurer la performance relative des joueurs. Lorsqu'ils sont appliqués à de grands modèles de langage, ces scores fournissent une prédiction de la probabilité qu'un évaluateur humain favorise la sortie d'un modèle par rapport à un autre.
Bien que les scores Elo soient généralement calculés pour une séquence de comparaisons afin de tenir compte des changements dans les capacités des joueurs, nous visons à quantifier la performance des modèles dont les capacités ne peuvent pas changer. Par conséquent, nous adoptons la méthodologie Bootstrap Elo décrite par Duan et al et également utilisée par lmsys pour leur Chatbot Arena, ce qui implique le calcul des scores Elo pour de nombreuses permutations aléatoires des comparaisons. Pour nos calculs, nous avons calculé les scores Elo sur 5 000 permutations et avons utilisé les distributions de ces scores Elo pour calculer des intervalles de confiance de 95 %.
Les résultats, illustrés à la figure 1, démontrent que nos modèles PPLX peuvent égaler et même dépasser les performances de gpt-3.5 sur les cas d'utilisation liés à Perplexity. En particulier, les réponses des modèles pplx-7b-online et pplx-70b-online sont préférées aux réponses des modèles gpt-3.5 et llama2-70b par les évaluateurs humains pour leurs réponses précises et actualisées.
Les modèles pplx-7b-online et pplx-70b-online obtiennent de meilleurs résultats que gpt-3.5 et llama2-70b, sur les critères d'<span>actualité</span> , de factualité et holistique.

Nous avons également calculé les taux de victoires par paires de l'évaluation. Les résultats, illustrés à la figure 2, montrent, sans surprise peut-être, que les réponses du modèle en ligne pplx sont préférées à celles des autres en matière d'actualité et de factualité.

Voici un exemple tiré de notre ensemble de données d'évaluation de l'actualité.
Invite : combien de personnes aux États-Unis possèdent un permis de conduire ?
pplx-7b-online
En 2023, on compte un nombre prévu de 243,4 millions de conducteurs titulaires d'un permis aux États-Unis, ce qui inclut 89 % des adultes américains. Ce nombre a augmenté par rapport aux 238,6 millions de 2022. Le pourcentage de conducteurs titulaires d'un permis varie selon les groupes d'âge et les États. Par exemple, en 2019, 84,1 % de la population américaine possédait un permis de conduire. Le pourcentage le plus élevé de conducteurs titulaires d'un permis se trouve chez les 25 à 49 ans, avec 90,1 % de la population possédant un permis de conduire. En Californie, il y avait 27 millions de conducteurs titulaires d'un permis, ce qui en fait l'État avec le plus grand nombre de conducteurs titulaires d'un permis.
pplx-70b-online
En 2021, environ 233 millions de personnes détenaient un permis de conduire valide aux États-Unis. D'ici 2023, le nombre de conducteurs titulaires d'un permis aux États-Unis devrait atteindre 243,4 millions, ce qui inclut 89 % des adultes américains. Cela représente une augmentation par rapport aux 238,6 millions de 2022.
gpt-3.5
En tant que modèle linguistique d'IA, je n'ai pas accès aux données en temps réel. Cependant, à partir de 2021, on estimait qu'environ 227 millions de personnes aux États-Unis détenaient un permis de conduire valide. Veuillez noter que ce nombre a peut-être changé depuis lors, il est donc toujours préférable de se référer aux dernières statistiques officielles pour obtenir les informations les plus précises.
llama2-70b
Je n'ai pas accès aux données en temps réel, mais je peux fournir quelques informations sur le nombre approximatif de personnes aux États-Unis qui possèdent un permis de conduire. Selon la Federal Highway Administration, il y avait environ 227,8 millions de conducteurs titulaires d'un permis aux États-Unis à compter de 2020. Ce nombre comprend les conducteurs commerciaux et non commerciaux. Il convient de noter que ce nombre est probablement une sous-estimation, car il ne tient pas compte des personnes qui peuvent avoir un permis de conduire mais qui ne conduisent pas régulièrement ou pas du tout. De plus, ce nombre n'inclut pas les personnes qui ne sont pas admissibles à un permis de conduire, telles que celles qui ont moins de 16 ans ou qui ont certains handicaps. Il est également important de noter que le nombre de conducteurs titulaires d'un permis peut varier selon l'État, certains États ayant un pourcentage plus élevé de conducteurs titulaires d'un permis que d'autres.
Dans l'ensemble, les résultats de l'évaluation démontrent que nos modèles PPLX peuvent égaler et même surpasser gpt-3.5 et llama2-70b sur les cas d'utilisation liés à Perplexity, en particulier pour fournir des réponses précises et actualisées.
Accès aux modèles en ligne de Perplexity
Nous sommes ravis d'annoncer que pplx-api passe de la version bêta à la version publique générale ! C'est la première fois que nos modèles pplx-7b-online et pplx-70b-online sont accessibles via pplx-api. De plus, nos modèles pplx-7b-chat et pplx-70b-chat ne sont plus en version alpha et sont désormais accessibles avec notre version générale.
Par conséquent, nous introduisons une nouvelle structure de tarification basée sur l'utilisation. Nous sommes ravis que nos utilisateurs utilisent notre infrastructure de pointe, qui utilise des processeurs NVIDIA H100 pour fournir une inférence ultra-rapide. Les utilisateurs Pro recevront un crédit pplx-api mensuel récurrent de 5 $. Pour tous les autres utilisateurs, la tarification sera déterminée en fonction de l'utilisation. Pour vous inscrire en tant qu'utilisateur Pro, cliquez ici. Contactez api@perplexity.ai pour toute demande commerciale.

Ressources supplémentaires :
- Commencez avec pplx-api ici.
- Essayez gratuitement nos modèles en ligne avec Perplexity Labs.
- Apprenez-en davantage sur notre API via la documentation de pplx-api.
- Vous souhaitez travailler au sein d'une équipe à fort impact et à forte vélocité qui crée le meilleur moteur de réponse ? Rejoignez-nous !
- Rejoignez notre communauté Discord en croissance rapidement !
Contributeurs :
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats