Einführung von PPLX Online-LLMs

Die erste Online-LLM-API ihrer Art.

Perplexity releases first "Live" LLM

Die erste Online-LLM-API ihrer Art.

Wir freuen uns, zwei neue PPLX-Modelle vorstellen zu können: pplx-7b-online und pplx-70b-online! Unsere Online-Modelle konzentrieren sich darauf, hilfreiche, aktuelle und faktengestützte Antworten zu liefern, und sind über die pplx-api öffentlich zugänglich, was sie zu einer API der ersten Stunde macht. pplx-7b-online und pplx-70b-online sind auch über Perplexity Labs, unsere LLM-Spielwiese, zugänglich.

LLMs haben die Art und Weise, wie wir Informationen finden, verändert. Dennoch gibt es bei den meisten heutigen LLMs zwei Einschränkungen:

Aktualität: LLMs haben oft Schwierigkeiten, aktuelle Informationen bereitzustellen.

Halluzinationen: LLMs können auch ungenaue Aussagen liefern.

Unsere Modelle pplx-7b-online und pplx-70b-online adressieren aktuelle Einschränkungen, indem sie zusätzlich hilfreiche, faktengestützte und aktuelle Informationen in ihren Antworten bereitstellen.

PPLX Online-LLMs

Unsere LLMs, pplx-7b-online und pplx-70b-online, sind Online-LLMs, da sie auf Wissen aus dem Internet zugreifen können und somit bei der Formulierung einer Antwort die aktuellsten Informationen nutzen können. Indem wir unsere LLMs mit Wissen aus dem Web versorgen, reagieren unsere Modelle präzise auf zeitkritische Anfragen und erschließen Wissen, das über ihr Trainingskorpus hinausgeht. Dies bedeutet, dass die Online-LLMs von Perplexity Anfragen wie „Wie war das Ergebnis des Warriors-Spiels letzte Nacht?“, die für Offline-Modelle eine Herausforderung darstellen, beantworten können. Auf einer übergeordneten Ebene funktioniert unser Online-LLM wie folgt:

  1. Nutzung von Open-Source-Modellen: unsere PPLX-Modelle bauen auf den Basismodellen mistral-7b und llama2-70b auf.
  2. In-House-Suchtechnologie: unsere hausinterne Infrastruktur für Suche, Indexierung und Crawling ermöglicht es uns, LLMs mit den relevantesten, aktuellsten und wertvollsten Informationen anzureichern. Unser Suchindex ist umfangreich, wird in regelmäßigen Abständen aktualisiert und verwendet ausgefeilte Ranking-Algorithmen, um sicherzustellen, dass qualitativ hochwertige, nicht auf SEO optimierte Websites priorisiert werden. Website-Auszüge, die wir „Snippets“ nennen, werden unseren pplx-online-Modellen zur Verfügung gestellt, um Antworten mit den aktuellsten Informationen zu ermöglichen.
  3. Feinabstimmung (Fine-tuning): unsere PPLX-Modelle wurden feinabgestimmt, um Snippets effektiv zur Unterfütterung ihrer Antworten zu nutzen. Unter Einsatz unserer internen Datenauftragnehmer kuratieren wir sorgfältig qualitativ hochwertige, vielfältige und große Trainingsdatensätze, um eine hohe Leistung in verschiedenen Bereichen wie Hilfsbereitschaft, Faktizität und Aktualität zu erzielen. Unsere Modelle werden regelmäßig feinabgestimmt, um die Leistung kontinuierlich zu verbessern.

Bewertung der Online-LLMs von Perplexity

Die Mission von Perplexity ist es, die weltweit beste Antwort-Engine zu bauen – eine, der Menschen bei der Suche nach und der Erweiterung ihres Wissens vertrauen. Um dies zu erreichen, konzentrieren wir uns intensiv darauf, hilfreiche, faktengestützte und aktuelle Informationen bereitzustellen. Um die Leistung unserer LLMs in diesen Bereichen zu bewerten, haben wir Evaluationsdatensätze kuratiert, die herausfordernde und dennoch realistische Anwendungsfälle für Antwort-Engines widerspiegeln. Für jede Abfrage in jedem Evaluationsset wurden den Auftragnehmern zwei Modellantworten vorgelegt, mit der Anweisung, die Antwort auszuwählen, die nach den folgenden Kriterien besser abschnitt:

  • Hilfsbereitschaft: welche Antwort beantwortet die Anfrage und befolgt die angegebenen Anweisungen besser?
  • Faktizität: welche Antwort bietet genauere Antworten ohne Halluzinationen, selbst bei Fragen, die sehr präzises oder nischenspezifisches Wissen erfordern?
  • Aktualität (inspiriert von FreshLLMs): welche Antwort enthält aktuellere Informationen? Ein Modell zeichnet sich in diesem Kriterium aus, wenn es in der Lage ist, Anfragen mit „frischen“ Informationen zu beantworten.

Zusätzlich zu den drei oben genannten Kriterien wurden die Modellantworten auch ganzheitlich bewertet. Um die Antworten ganzheitlich zu bewerten, wurden die Bewerter gebeten, die Antwort auszuwählen, die sie lieber von einem menschlichen Assistenten erhalten würden, der bei der Anfrage behilflich ist.

Kuratierung des Evaluationsdatensatzes

Für diese Bewertung haben wir sorgfältig eine vielfältige Menge an Prompts kuratiert, mit dem Ziel, Hilfsbereitschaft, Faktizität und Aktualität effektiv zu bewerten. Jeder Prompt wurde manuell ausgewählt, um ein hohes Maß an Kontrolle über Qualität und Relevanz der Daten zu gewährleisten. Der Datensatz umfasst ein breites Spektrum an Antwort-Engine-Prompts und deckt einen umfassenden Überblick darüber ab, worin Perplexity exzellieren soll. Dies ist für uns entscheidend, damit unsere Modellleistungsbewertungen eine hohe Aussagekraft haben.

Jedes der drei Evaluationssets enthält 50 Prompts. Einige Beispiele aus diesen Sets sind:

  • Hilfsbereitschaft: Erstelle eine Tabelle mit allen US-Fußballspielern, die im Finale der Weltmeisterschaft gespielt haben, und füge Spalten für ihre Statistiken wie Tore, Assists usw. hinzu.
  • Faktizität: Erkläre die Zähigkeit der Stähle AISI 1015 und AISI 1040.
  • Aktualität: Welches Unternehmen für autonome Fahrzeuge wurde 2023 aus San Francisco verbannt?

Generierung von Modellantworten

Wir haben vier Modelle bewertet:

pplx-7b-online: Das Modell von Perplexity, das den Zugriff auf Informationen aus dem Internet beinhaltet. Dieses Modell wurde unter Verwendung von mistral-7b feinabgestimmt.

pplx-70b-online: Das Modell von Perplexity, das den Zugriff auf Informationen aus dem Internet beinhaltet. Dieses Modell wurde unter Verwendung von llama2-70b feinabgestimmt.

gpt-3.5-turbo-1106: Das Modell von OpenAI, auf das über die API zugegriffen wird und das keine zusätzlichen Erweiterungen enthält. Beachten Sie, dass wir diese Bewertung unter Verwendung des neuesten gpt-3.5-Modells durchgeführt haben.

llama2-70b-chat: Das Modell von Meta AI, auf das über unsere pplx-api zugegriffen wird und das keine zusätzlichen Erweiterungen enthält.

Für jeden Prompt wurden den Modellen pplx-7b-online und pplx-70b-online dieselben Suchergebnisse und Snippets bereitgestellt. Alle Antworten wurden mit denselben Hyperparametern und demselben System-Prompt generiert.

System-Prompt

plaintext
Current date: Monday, November 20, 2023.

Ranking von Modellantworten durch menschliche Bewertung

Für jeden paarweisen Vergleich wurden unseren internen Auftragnehmern der Prompt selbst, die Bewertungskriterien (d. h. Hilfsbereitschaft, Faktizität oder Aktualität) und die Modellantworten nebeneinander angezeigt. Die Reihenfolge der Antworten wurde bei jeder Runde randomisiert, und die Quellmodelle wurden dem Bewerter nicht offenbart. Die Bewerter wurden angewiesen, die Antwort auszuwählen, die sie insgesamt bevorzugen, sowie diejenige, die bei dem spezifischen Bewertungskriterium besser abschneidet, wobei Unentschieden für beides zulässig waren. Schließlich durften die Bewerter die Internetsuche nutzen, um die Genauigkeit der Antworten zu überprüfen. Wir haben unser eigenes internes Tool zur Erstellung von Präferenzrankings entwickelt, um diese Bewertung durchzuführen.

Bewertungsergebnisse

Wir verwenden die aus der menschlichen Bewertung gesammelten paarweisen Präferenzrankings, um pro Aufgabe Elo-Scores für jedes Modell zu berechnen. Elo-Scores werden häufig verwendet, um eine Population von Spielern in Wettbewerben im Turnierstil zu bewerten, um die relative Leistung der Spieler zu messen. Wenn diese Scores auf große Sprachmodelle angewendet werden, liefern sie eine Vorhersage darüber, wie wahrscheinlich es ist, dass ein menschlicher Bewerter den Output eines Modells gegenüber einem anderen bevorzugt.

Während Elo-Scores normalerweise für eine Sequenz von Vergleichen berechnet werden, um Änderungen in den Fähigkeiten der Spieler zu berücksichtigen, zielen wir darauf ab, die Leistung von Modellen zu quantifizieren, deren Fähigkeiten sich nicht ändern können. Dementsprechend verwenden wir die Bootstrap-Elo-Methodik, die in Duan et al. beschrieben ist und auch von lmsys für ihre Chatbot Arena genutzt wird, was die Berechnung von Elo-Scores für viele zufällige Permutationen der Vergleiche beinhaltet. Für unsere Berechnungen haben wir Elo-Scores über 5000 Permutationen berechnet und die Verteilungen dieser Elo-Scores verwendet, um 95%-Konfidenzintervalle zu berechnen.

Die in Abbildung 1 gezeigten Ergebnisse demonstrieren, dass unsere PPLX-Modelle die Leistung von gpt-3.5 bei Perplexity-bezogenen Anwendungsfällen erreichen und sogar übertreffen können. Insbesondere werden die Modellantworten von pplx-7b-online und pplx-70b-online von menschlichen Bewertern aufgrund ihrer genauen und aktuellen Antworten gegenüber den Modellantworten von gpt-3.5 und llama2-70b bevorzugt.

Die pplx-7b-online und pplx-70b-online schneiden bei den Kriterien Aktualität, Faktizität und ganzheitliche Bewertung besser ab als gpt-3.5 und llama2-70b.

Abbildung 1. Geschätzte Elo-Scores und 95%-Konfidenzintervalle für pplx-7b (-online), pplx-70b (-online), llama2-70b und gpt-3.5 über vier verschiedene Evaluationssets hinweg. Zum Beispiel schneiden pplx-7b und pplx-70b auf der Achse der Aktualität besser ab als gpt-3.5 und llama2-70b, mit einem geschätzten Elo-Score von 1100,6 und 1099,6 gegenüber 879,3 bzw. 920,3.

Wir haben auch die paarweisen Gewinnraten aus der Bewertung berechnet. Die Ergebnisse, die in Abbildung 2 gezeigt werden, illustrieren – vielleicht nicht überraschend –, dass die Online-Modellantworten von pplx bei Aktualität und Faktizität gegenüber anderen bevorzugt werden.

Abbildung 2. Gewinnraten der Modelle auf der vertikalen Achse gegenüber den Modellen auf der horizontalen Achse. Zum Beispiel wurden die Antworten von pplx-70b (-online) bei 64 % der Anfragen als ganzheitlich überlegen gegenüber denen von gpt-3.5 bewertet, und die Antworten von gpt-3.5 wurden bei 24 % der Anfragen als ganzheitlich überlegen gegenüber pplx-70b (-online) bewertet.

Hier ist ein Beispiel aus unserem Evaluationsdatensatz zur Aktualität.

Prompt: Wie viele Menschen in den USA haben einen Führerschein?

pplx-7b-online

Im Jahr 2023 gibt es voraussichtlich 243,4 Millionen lizenzierte Fahrer in den Vereinigten Staaten, was 89 % der US-Erwachsenen entspricht. Diese Zahl ist von 238,6 Millionen im Jahr 2022 gestiegen. Der Prozentsatz der lizenzierten Fahrer variiert je nach Altersgruppe und Bundesstaat. Zum Beispiel hatten 2019 84,1 % der US-Bevölkerung einen Führerschein. Der höchste Prozentsatz an lizenzierten Fahrern liegt bei den 25- bis 49-Jährigen, wobei 90,1 % der Bevölkerung einen Führerschein besitzen. In Kalifornien gab es 27 Millionen lizenzierte Fahrer, was es zum Bundesstaat mit der höchsten Anzahl an lizenzierten Fahrern macht.

pplx-70b-online

Im Jahr 2021 besaßen etwa 233 Millionen Menschen in den Vereinigten Staaten einen gültigen Führerschein. Bis 2023 wird die Anzahl der lizenzierten Fahrer in den USA voraussichtlich 243,4 Millionen erreichen, was 89 % der US-Erwachsenen umfasst. Dies stellt einen Anstieg von 238,6 Millionen im Jahr 2022 dar.

gpt-3.5

Als KI-Sprachmodell habe ich keinen Zugriff auf Echtzeitdaten. Schätzungen aus dem Jahr 2021 zufolge besaßen jedoch etwa 227 Millionen Menschen in den Vereinigten Staaten einen gültigen Führerschein. Bitte beachten Sie, dass sich diese Zahl seitdem geändert haben könnte, daher ist es immer am besten, auf die neuesten offiziellen Statistiken zu verweisen, um die genauesten Informationen zu erhalten.

llama2-70b

Ich habe keinen Zugriff auf Echtzeitdaten, aber ich kann einige Informationen über die ungefähre Anzahl der Personen in den Vereinigten Staaten geben, die einen Führerschein besitzen. Laut der Federal Highway Administration gab es ab 2020 ungefähr 227,8 Millionen lizenzierte Fahrer in den Vereinigten Staaten. Diese Zahl umfasst sowohl gewerbliche als auch nicht-gewerbliche Fahrer. Es ist erwähnenswert, dass diese Zahl wahrscheinlich eine Unterschätzung darstellt, da sie Personen nicht berücksichtigt, die möglicherweise einen Führerschein besitzen, aber nicht regelmäßig oder gar nicht fahren. Darüber hinaus beinhaltet diese Zahl keine Personen, die nicht für einen Führerschein in Frage kommen, wie zum Beispiel diejenigen, die unter 16 Jahre alt sind oder bestimmte Behinderungen haben. Es ist auch wichtig zu beachten, dass die Anzahl der lizenzierten Fahrer je nach Bundesstaat variieren kann, wobei einige Bundesstaaten einen höheren Prozentsatz an lizenzierten Fahrern aufweisen als andere.

Insgesamt zeigen die Bewertungsergebnisse, dass unsere PPLX-Modelle gpt-3.5 und llama2-70b bei Perplexity-bezogenen Anwendungsfällen erreichen und sogar übertreffen können, insbesondere bei der Bereitstellung genauer und aktueller Antworten.

Zugriff auf die Online-Modelle von Perplexity

Wir freuen uns bekannt zu geben, dass die pplx-api die Beta-Phase verlässt und allgemein öffentlich zugänglich ist! Dies ist das erste Mal, dass unsere Modelle pplx-7b-online und pplx-70b-online über die pplx-api zugänglich sind. Zusätzlich haben unsere Modelle pplx-7b-chat und pplx-70b-chat die Alpha-Phase verlassen und sind jetzt mit unserer allgemeinen Version zugänglich.

Damit führen wir eine neue nutzungsbasierte Preisstruktur ein. Wir freuen uns, dass unsere Nutzer unsere hochmoderne Infrastruktur nutzen können, die NVIDIA H100s für blitzschnelle Inferenz verwendet. Pro-Nutzer erhalten ein wiederkehrendes monatliches pplx-api-Guthaben von 5 $. Für alle anderen Nutzer wird die Preisgestaltung basierend auf der Nutzung bestimmt. Um sich als Pro-Nutzer anzumelden, klicken Sie hier. Kontaktieren Sie api@perplexity.ai für geschäftliche Anfragen.

PPLX-Online-LLM-Dashboard

Zusätzliche Ressourcen:

Mitwirkende:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats