Wprowadzenie internetowych modeli LLM PPLX

Pierwsze w swoim rodzaju internetowe API LLM.

Perplexity releases first "Live" LLM

Pierwsze w swoim rodzaju internetowe API LLM.

Z radością udostępniamy dwa nowe modele PPLX: pplx-7b-online oraz pplx-70b-online! Nasze modele online koncentrują się na dostarczaniu pomocnych, aktualnych i opartych na faktach odpowiedzi i są publicznie dostępne za pośrednictwem pplx-api, co czyni je pierwszym tego typu API. Modele pplx-7b-online i pplx-70b-online są również dostępne za pośrednictwem Perplexity Labs, naszego środowiska testowego LLM.

Modele LLM zmieniły sposób, w jaki wyszukujemy informacje. Niemniej jednak większość dzisiejszych modeli LLM posiada dwa ograniczenia:

Aktualność: Modele LLM często mają trudności z udostępnianiem aktualnych informacji.

Halucynacje: Modele LLM mogą również generować niedokładne stwierdzenia.

Nasze modele pplx-7b-online i pplx-70b-online eliminują obecne ograniczenia, dodatkowo zapewniając w swoich odpowiedziach pomocne, oparte na faktach i aktualne informacje.

Modele PPLX Online LLM

Nasze modele LLM, pplx-7b-online i pplx-70b-online, to internetowe modele LLM, ponieważ mogą korzystać z wiedzy pochodzącej z Internetu, a tym samym wykorzystywać najbardziej aktualne informacje podczas formułowania odpowiedzi. Dostarczając naszym modelom LLM wiedzę z sieci, sprawiamy, że reagują one trafnie na zapytania wrażliwe na czas, odblokowując wiedzę wykraczającą poza ich korpus treningowy. Oznacza to, że internetowe modele LLM Perplexity potrafią odpowiadać na zapytania typu „Jaki był wynik meczu Warriors ostatniej nocy?”, które są wyzwaniem dla modeli offline. Na wysokim poziomie oto jak działa nasz internetowy model LLM:

  1. Wykorzystanie modeli open source: nasze modele PPLX bazują na modelach podstawowych mistral-7b oraz llama2-70b.
  2. Własna technologia wyszukiwania: nasza wewnętrzna infrastruktura wyszukiwania, indeksowania i indeksowania sieci pozwala nam wzbogacać modele LLM o najbardziej istotne, aktualne i cenne informacje. Nasz indeks wyszukiwania jest duży, regularnie aktualizowany i wykorzystuje zaawansowane algorytmy rankingowe w celu zapewnienia priorytetyzacji witryn o wysokiej jakości, niezoptymalizowanych pod kątem SEO. Fragmenty witryn, które nazywamy „snippetami”, są dostarczane do naszych modeli pplx-online, aby umożliwić odpowiedzi zawierające najbardziej aktualne informacje.
  3. Dostrajanie (fine-tuning): nasze modele PPLX zostały dostrojone w celu skutecznego wykorzystywania snippetów do formułowania odpowiedzi. Korzystając z naszych wewnętrznych kontrahentów danych, starannie przygotowujemy wysokiej jakości, różnorodne i duże zbiory treningowe, aby osiągnąć wysoką wydajność w różnych aspektach, takich jak użyteczność, faktyczność i aktualność. Nasze modele są regularnie dostrajane w celu ciągłej poprawy wydajności.

Ocena internetowych modeli LLM Perplexity

Misją Perplexity jest budowa najlepszego na świecie silnika odpowiedzi – takiego, któremu ludzie ufają, aby odkrywać i poszerzać swoją wiedzę. Aby to osiągnąć, kładziemy duży nacisk na dostarczanie pomocnych, opartych na faktach i aktualnych informacji. W celu zbadania wydajności naszych modeli LLM pod tym względem, stworzyliśmy zbiory ewaluacyjne, które odzwierciedlają wymagające, a jednocześnie realistyczne przypadki użycia silników odpowiedzi. Dla każdego zapytania w każdym zbiorze ewaluacyjnym kontrahentom przedstawiono dwie odpowiedzi modelu i poinstruowano ich, aby wybrali odpowiedź, która wypadła lepiej według następujących kryteriów:

  • Użyteczność: która odpowiedź lepiej odpowiada na zapytanie i realizuje określone instrukcje?
  • Faktyczność: która odpowiedź zapewnia dokładniejsze odpowiedzi bez halucynacji, nawet w przypadku pytań wymagających bardzo precyzyjnej lub niszowej wiedzy?
  • Aktualność (zainspirowana FreshLLMs): która odpowiedź zawiera bardziej aktualne informacje? Model wykazuje się w tym kryterium, jeśli jest w stanie odpowiadać na zapytania „świeżymi” informacjami.

Oprócz trzech powyższych kryteriów odpowiedzi modeli oceniano również całościowo. Aby ocenić odpowiedzi całościowo, poproszono ewaluatorów o wybranie odpowiedzi, którą woleliby otrzymać od ludzkiego asystenta pomagającego przy danym zapytaniu.

Przygotowanie zbioru ewaluacyjnego

Do tej oceny starannie wyselekcjonowaliśmy zróżnicowany zestaw zapytań, mając na celu skuteczną ocenę użyteczności, faktyczności i aktualności. Każde zapytanie zostało wybrane ręcznie, zapewniając wysoki poziom kontroli nad jakością i trafnością danych. Zbiór danych obejmuje szeroki zakres zapytań dla silników odpowiedzi i zawiera kompleksowy przegląd tego, w czym chcemy, aby Perplexity było najlepsze. Jest to dla nas kluczowe, aby oceny wydajności naszych modeli miały wysoki sygnał.

Każdy z trzech zestawów ewaluacyjnych zawiera 50 zapytań. Niektóre przykłady z tych zestawów obejmują:

  • Użyteczność: Utwórz tabelę wszystkich amerykańskich piłkarzy, którzy grali w finałach Mistrzostw Świata, i stwórz kolumny dla ich statystyk, takich jak gole, asysty itp.
  • Faktyczność: Wyjaśnij udarność stali AISI 1015 i AISI 1040.
  • Aktualność: Która firma zajmująca się autonomicznymi samochodami została objęta zakazem w San Francisco w 2023 roku?

Generowanie odpowiedzi modelu

Oceniliśmy cztery modele:

pplx-7b-online: Model Perplexity, który obejmuje dostęp do informacji z Internetu. Ten model został dostrojony przy użyciu mistral-7b.

pplx-70b-online: Model Perplexity, który obejmuje dostęp do informacji z Internetu. Ten model został dostrojony przy użyciu llama2-70b.

gpt-3.5-turbo-1106: Model OpenAI, dostępny przez API bez dodatkowych rozszerzeń. Należy zauważyć, że przeprowadziliśmy tę ocenę przy użyciu najnowszego modelu gpt-3.5.

llama2-70b-chat: Model Meta AI, dostępny za pośrednictwem naszego pplx-api bez dodatkowych rozszerzeń.

Dla każdego zapytania te same wyniki wyszukiwania i snippety zostały dostarczone do modeli pplx-7b-online oraz pplx-70b-online. Wszystkie odpowiedzi zostały wygenerowane przy użyciu tych samych hiperparametrów i promptu systemowego.

Prompt systemowy

plaintext
Current date: Monday, November 20, 2023.

Ranking odpowiedzi modelu z wykorzystaniem oceny ludzkiej

Dla każdego porównania parami nasi wewnętrzni kontrahenci otrzymali samo zapytanie, kryteria oceny (tj. użyteczność, faktyczność lub aktualność) oraz odpowiedzi modelu wyświetlone obok siebie. Kolejność odpowiedzi była losowana przy każdej turze, a modele źródłowe nie były ujawniane ewaluatorowi. Ewaluatorzy zostali poinstruowani, aby wybrać odpowiedź, którą preferują całościowo, a także wskazać, która lepiej wypada w określonym kryterium oceny, przy czym obie opcje dopuszczały remisy. Ostatecznie ewaluatorzy mogli korzystać z wyszukiwarki internetowej w celu weryfikacji dokładności odpowiedzi. Zbudowaliśmy własne wewnętrzne narzędzie do rankingu preferencji, aby przeprowadzić tę ocenę.

Wyniki oceny

Używamy rankingów preferencji parami zebranych z oceny ludzkiej do obliczenia wyników Elo na zadanie dla każdego modelu. Wyniki Elo są powszechnie stosowane do rankingu populacji graczy w zawodach typu turniejowego w celu pomiaru relatywnej wydajności graczy. W zastosowaniu do dużych modeli językowych wyniki te zapewniają prognozę prawdopodobieństwa, z jakim ludzki ewaluator mógłby faworyzować wynik jednego modelu nad drugim.

Podczas gdy wyniki Elo są zazwyczaj obliczane dla sekwencji porównań w celu uwzględnienia zmian w umiejętnościach graczy, dążymy do ilościowego określenia wydajności modeli, których umiejętności nie mogą się zmienić. W związku z tym przyjmujemy metodologię Bootstrap Elo opisaną w Duan et al , wykorzystywaną również przez lmsys dla ich Chatbot Arena, która polega na obliczaniu wyników Elo dla wielu losowych permutacji porównań. Do naszych obliczeń obliczyliśmy wyniki Elo dla 5000 permutacji i wykorzystaliśmy rozkłady tych wyników Elo do obliczenia 95% przedziałów ufności.

Wyniki przedstawione na Rysunku 1 wykazują, że nasze modele PPLX mogą dorównać, a nawet przewyższyć wydajność gpt-3.5 w przypadkach użycia związanych z Perplexity. W szczególności odpowiedzi modelu pplx-7b-online oraz pplx-70b-online są preferowane przez ludzkich ewaluatorów ponad odpowiedzi modelu gpt-3.5 oraz llama2-70b ze względu na ich dokładne i aktualne odpowiedzi.

Modele pplx-7b-online i pplx-70b-online radzą sobie lepiej niż gpt-3.5 i llama2-70b w kryteriach aktualności, faktyczności oraz całościowej oceny.

Rysunek 1. Szacowane wyniki Elo i 95% przedziały ufności dla pplx-7b (-online), pplx-70b (-online), llama2-70b oraz gpt-3.5 w czterech różnych zbiorach ewaluacyjnych. Na przykład w zakresie aktualności modele pplx-7b i pplx-70b radzą sobie lepiej niż gpt-3.5 i llama2-70b, z szacowanym wynikiem Elo 1100,6 i 1099,6 w porównaniu z 879,3 i 920,3 odpowiednio.

Obliczyliśmy również wskaźniki wygranych parami z oceny. Wyniki przedstawione na Rysunku 2 ilustrują, co być może nie jest zaskakujące, że odpowiedzi internetowego modelu pplx są preferowane nad innymi pod względem aktualności oraz faktyczności.

Rysunek 2. Wskaźniki wygranych modeli na osi pionowej w porównaniu z modelami na osi poziomej. Na przykład odpowiedzi pplx-70b (-online) oceniono jako całościowo lepsze od odpowiedzi gpt-3.5 w 64% zapytań, a odpowiedzi gpt-3.5 oceniono jako całościowo lepsze od odpowiedzi pplx-70b (-online) w 24% zapytań.

Oto przykład z naszego zbioru danych do oceny aktualności.

Zapytanie: Ile osób w USA posiada prawo jazdy?

pplx-7b-online

W 2023 roku w Stanach Zjednoczonych przewiduje się 243,4 miliona licencjonowanych kierowców, co stanowi 89% dorosłych mieszkańców USA. Liczba ta wzrosła z 238,6 miliona w 2022 roku. Odsetek licencjonowanych kierowców różni się w zależności od grup wiekowych i stanów. Na przykład w 2019 roku 84,1% populacji USA posiadało prawo jazdy. Najwyższy odsetek licencjonowanych kierowców występuje wśród osób w wieku od 25 do 49 lat, przy czym 90,1% populacji posiada prawo jazdy. W Kalifornii było 27 milionów licencjonowanych kierowców, co czyni ją stanem z największą liczbą licencjonowanych kierowców.

pplx-70b-online

W 2021 roku około 233 miliony ludzi w Stanach Zjednoczonych posiadały ważne prawo jazdy. Przewiduje się, że do 2023 roku liczba licencjonowanych kierowców w USA osiągnie 243,4 miliona, co obejmuje 89% dorosłych w USA. Stanowi to wzrost z 238,6 miliona w 2022 roku.

gpt-3.5

Jako model językowy AI nie mam dostępu do danych w czasie rzeczywistym. Jednak według stanu na 2021 rok szacowano, że około 227 milionów ludzi w Stanach Zjednoczonych posiadało ważne prawo jazdy. Proszę zauważyć, że ta liczba mogła od tamtego czasu ulec zmianie, więc zawsze najlepiej odwoływać się do najnowszych oficjalnych statystyk w celu uzyskania najbardziej dokładnych informacji.

llama2-70b

Nie mam dostępu do danych w czasie rzeczywistym, ale mogę podać pewne informacje na temat przybliżonej liczby osób w Stanach Zjednoczonych, które posiadają prawo jazdy. Według Federal Highway Administration, na koniec 2020 roku w Stanach Zjednoczonych było około 227,8 miliona licencjonowanych kierowców. Liczba ta obejmuje zarówno kierowców komercyjnych, jak i niekomercyjnych. Warto zauważyć, że liczba ta jest prawdopodobnie niedoszacowana, ponieważ nie uwzględnia osób, które mogą posiadać prawo jazdy, ale nie prowadzą pojazdów regularnie lub w ogóle. Ponadto liczba ta nie obejmuje osób, które nie kwalifikują się do uzyskania prawa jazdy, takich jak osoby poniżej 16 roku życia lub osoby z określonymi niepełnosprawnościami. Ważne jest również, aby zauważyć, że liczba licencjonowanych kierowców może się różnić w zależności od stanu, przy czym niektóre stany mają wyższy odsetek licencjonowanych kierowców niż inne.

Ogólnie rzecz biorąc, wyniki oceny wykazują, że nasze modele PPLX mogą dorównać, a nawet przewyższyć gpt-3.5 i llama2-70b w przypadkach użycia związanych z Perplexity, zwłaszcza w zakresie dostarczania dokładnych i aktualnych odpowiedzi.

Uzyskiwanie dostępu do modeli online Perplexity

Z radością ogłaszamy, że pplx-api wychodzi z fazy beta i trafia do ogólnego udostępnienia! To pierwszy raz, kiedy nasze modele pplx-7b-online oraz pplx-70b-online są dostępne za pośrednictwem pplx-api. Ponadto nasze modele pplx-7b-chat oraz pplx-70b-chat opuściły fazę alfa i są teraz dostępne w ramach ogólnego udostępnienia.

Wraz z tym wprowadzamy nową strukturę cenową opartą na wykorzystaniu. Cieszymy się, że nasi użytkownicy będą mogli korzystać z naszej najnowocześniejszej infrastruktury, która wykorzystuje NVIDIA H100s, aby zapewnić błyskawiczną inferencję. Użytkownicy Pro otrzymają cykliczny miesięczny kredyt pplx-api w wysokości 5 USD. W przypadku wszystkich pozostałych użytkowników ceny będą ustalane na podstawie zużycia. Aby zarejestrować się jako użytkownik Pro, kliknij tutaj. W sprawach handlowych prosimy o kontakt pod adresem api@perplexity.ai.

Pulpit nawigacyjny PPLX-online llm

Dodatkowe zasoby:

Współtwórcy:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats