Представяне на онлайн LLM моделите PPLX
Първият по рода си онлайн API за LLM

Първият по рода си онлайн API за LLM.
Радваме се да споделим два нови модела PPLX: pplx-7b-online и pplx-70b-online! Нашите онлайн модели са фокусорани върху предоставянето на полезни, актуални и фактологични отговори и са публично достъпни чрез pplx-api, което го прави първият по рода си API. pplx-7b-online и pplx-70b-online са достъпни и чрез Perplexity Labs, нашата среда за тестване на LLM.
Големите езикови модели (LLM) промениха начина, по който намираме информация. Въпреки това съществуват две ограничения при повечето съвременни LLM:
Актуалност: LLM често изпитват затруднения да споделят актуална информация.
Халюцинации: LLM могат също така да извеждат неточни твърдения.
Нашите модели pplx-7b-online и pplx-70b-online преодоляват текущите ограничения, като същевременно предоставят полезни, фактологични и актуални отговори.
Онлайн LLM модели PPLX
Нашите LLM модели, pplx-7b-online и pplx-70b-online, са онлайн LLM, защото могат да използват знания от интернет и следователно могат да се възползват от най-актуалната информация при формирането на отговор. Като предоставяме на нашите LLM знания от мрежата, нашите модели отговарят точно на времево чувствителни заявки, разгръщайки знания отвъд своя тренировъчен корпус. Това означава, че онлайн LLM моделите на Perplexity могат да отговарят на заявки като „Какъв беше резултатът от мача на Warriors снощи?“, които са предизвикателство за офлайн моделите. На високо ниво ето как работи нашият онлайн LLM:
- Използване на модели с отворен код: нашите модели PPLX надграждат базовите модели
mistral-7bиllama2-70b. - Собствена технология за търсене: нашата собствена инфраструктура за търсене, индексиране и обхождане ни позволява да обогатяваме LLM с най-релевантната, актуална и ценна информация. Нашият индекс за търсене е голям, актуализира се редовно и използва усъвършенствани алгоритми за класиране, за да се гарантира, че се дава приоритет на висококачествени сайтове извън SEO оптимизацията. Откъсите от уебсайтове, които наричаме „снипети“, се предоставят на нашите модели
pplx-online, за да се даде възможност за отговори с най-актуалната информация. - Фино настройване: нашите модели PPLX са фино настроени да използват ефективно снипетите за своите отговори. Използвайки нашите вътрешни експерти по данни, ние внимателно подбираме висококачествени, разнообразни и големи обучителни набори, за да постигнем висока производителност по различни показатели като полезност, фактологичност и актуалност. Нашите модели се фино настройват редовно за постоянно подобряване на производителността.
Оценка на онлайн LLM моделите на Perplexity
Мисията на Perplexity е да изгради най-добрата двигател за отговори в света – такъв, на който хората се доверяват, за да откриват и разширяват своите знания. За да постигнем това, ние сме изцяло фокусорани върху предоставянето на полезна, фактологична и актуална информация. За да направим бенчмарк на производителността на нашите LLM по тези показатели, подбрахме набор от данни за оценка, които отразяват предизвикателни, но реалистични случаи на употреба за двигатели за отговори. За всяка заявка във всеки набор за оценка на изпълнителите бяха дадени два моделни отговора и бяха инструктирани да избират отговора, който се представя по-добре по следните критерии:
- Полезност: кой отговор отговаря на заявката и следва посочените инструкции по-добре?
- Фактологичност: кой отговор предоставя по-точни отговори без халюцинации, дори за въпроси, изискващи много прецизни или нишови знания?
- Актуалност (вдъхновено от FreshLLMs): кой отговор съдържа по-актуална информация? Един модел се отличава по този критерий, ако е способен да отговаря на заявки с „пресна“ информация.
В допълнение към трите критерия по-горе, отговорите на моделите бяха оценени и холистично. За да се оценят отговорите холистично, оценителите бяха помолени да изберат отговора, който биха предпочели да получат от човешки асистент, помагащ със заявката.
Подбор на набора за оценка
За тази оценка внимателно подбрахме разнообразен набор от промптове с цел ефективно оценяване на полезността, фактологичността и актуалността. Всеки промпт беше ръчно подбран, което гарантира високо ниво на контрол върху качеството и релевантността на данните. Наборът от данни обхваща широк спектър от промптове за двигатели за отговори и обхваща изчерпателен преглед на това в какво искаме Perplexity да се отличава. Това е от критично значение за нашите оценки на производителността на моделите, за да имат висок сигнал.
Всеки от трите набора за оценка съдържа 50 промпта. Някои примери от тези набори включват:
- Полезност: Създайте таблица на всички американски футболисти, които са играли във финалите на Световната купа, и направете колони за тяхната статистика като голове, асистенции и др.
- Фактологичност: Обяснете здравината на стоманите AISI 1015 и AISI 1040.
- Актуалност: Коя компания за автономни автомобили беше забранена в Сан Франциско през 2023 г.?
Генериране на моделни отговори
Оценихме четири модела:
pplx-7b-online: Моделът на Perplexity, който включва достъп до информация от интернет. Този модел беше фино настроен с помощта на mistral-7b.
pplx-70b-online: Моделът на Perplexity, който включва достъп до информация от интернет. Този модел беше фино настроен с помощта на llama2-70b.
gpt-3.5-turbo-1106: Моделът на OpenAI, достъпен през API и без допълнителни надграждания. Имайте предвид, че извършихме тази оценка, използвайки най-новия модел gpt-3.5.
llama2-70b-chat: Моделът на Meta AI, достъпен чрез нашия pplx-api и без допълнителни надграждания.
За всеки промпт на моделите pplx-7b-online и pplx-70b-online бяха предоставени едни и същи резултати от търсенето и снипети. Всички отговори бяха генерирани с помощта на едни и същи хиперпараметри и системен промпт.
Системен промпт
Current date: Monday, November 20, 2023.Класиране на моделните отговори с човешка оценка
За всяко попарно сравнение на нашите вътрешни изпълнители бяха предоставени самият промпт, критериите за оценка (т.е. полезност, фактологичност или актуалност) и отговорите на моделите, показани един до друг. Редът на отговорите беше разбъркан на случаен принцип при всяко завъртане, а изходните модели не бяха разкрити на оценяващия. Оценяващите бяха инструктирани да избират отговора, който предпочитат холистично, както и кой се представя по-добре по специфичния критерий за оценка, като се допускат равни резултати и за двете. И накрая, на оценителите беше позволено да използват интернет търсене, за да проверяват точността на отговорите. Създадохме собствен вътрешен инструмент за класиране по предпочитания, за да проведем тази оценка.
Резултати от оценката
Използваме попарните класирания по предпочитания, събрани от човешка оценка, за да изчислим Elo резултати за всяка задача за всеки модел. Elo резултатите обикновено се използват за класиране на популация от играчи в състезания в стил турнир, за да се измери относителното представяне на играчите. Когато се приложат към големи езикови модели, тези резултати дават предсказание за това колко е вероятно човешки оценяващ да предпочете изхода на един модел пред друг.
Въпреки че Elo резултатите обикновено се изчисляват за последователност от сравнения, за да се отчетат промените в способностите на играчите, ние се стремим да квантифицираме представянето на модели, чиито способности не могат да се променят. Съответно приемаме методологията Bootstrap Elo, описана в Duan et al и използвана също от lmsys за тяхната Chatbot Arena, която включва изчисляване на Elo резултати за много случайни пермутации на сравненията. За нашите изчисления изчислихме Elo резултати за 5000 пермутации и използвахме разпределенията на тези Elo резултати, за да изчислим 95% доверителни интервали.
Резултатите, показани на Фигура 1, показват, че нашите модели PPLX могат да се сравняват и дори да надминат производителността на gpt-3.5 по отношение на свързаните с Perplexity случаи на употреба. По-конкретно, отговорите на моделите pplx-7b-online и pplx-70b-online са предпочитани пред отговорите на моделите gpt-3.5 и llama2-70b от човешки оценители заради техните точни и актуални отговори.
Моделите pplx-7b-online и pplx-70b-online се представят по-добре от gpt-3.5 и llama2-70b по критериите за актуалност, фактологичност и холистичност.

Изчислихме също и процентите на победи в попарните сравнения от оценката. Резултатите, показани на Фигура 2, илюстрират, макар и вероятно без изненада, че отговорите на онлайн моделите pplx се предпочитат пред тези на другите по отношение на актуалността и фактологичността.

Ето пример от нашия набор от данни за оценка на актуалността.
Промпт: Колко души в САЩ имат шофьорска книжка?
pplx-7b-online
През 2023 г. се прогнозират 243,4 милиона лицензирани шофьори в Съединените щати, което включва 89% от възрастните в САЩ. Този брой се е увеличил от 238,6 милиона през 2022 г. Процентът на лицензираните шофьори варира в различните възрастови групи и щати. Например през 2019 г. 84,1% от населението на САЩ е имало шофьорска книжка. Най-висок процент на лицензирани шофьори има сред хората на възраст от 25 до 49 години, като 90,1% от населението има шофьорска книжка. В Калифорния има 27 милиона лицензирани шофьори, което я прави щатът с най-голям брой лицензирани шофьори.
pplx-70b-online
През 2021 г. около 233 милиона души притежават валидни шофьорски книжки в Съединените щати. До 2023 г. се прогнозира броят на лицензираните шофьори в САЩ да достигне 243,4 милиона, което включва 89% от възрастните в САЩ. Това представлява увеличение спрямо 238,6 милиона през 2022 г.
gpt-3.5
Като езиков модел с изкуствен интелект нямам достъп до данни в реално време. Въпреки това към 2021 г. се изчислява, че около 227 милиона души в Съединените щати притежават валидна шофьорска книжка. Моля, имайте предвид, че този брой може да се е променил оттогава, така че винаги е най-добре да правите справка с най-новите официални статистики за най-точна информация.
llama2-70b
Нямам достъп до данни в реално време, но мога да предоставя малко информация относно приблизителния брой хора в Съединените щати, които имат шофьорска книжка. Според Федералната магистрална администрация в Съединените щати има приблизително 227,8 милиона лицензирани шофьори към 2020 г. Този брой включва както професионални, така и непрофесионални шофьори. Струва си да се отбележи, че този брой вероятно е подценен, тъй като не отчита лицата, които може да притежават шофьорска книжка, но не шофират редовно или изобщо. Освен това този брой не включва лица, които нямат право на шофьорска книжка, като например тези под 16-годишна възраст или с определени увреждания. Важно е също така да се отбележи, че броят на лицензираните шофьори може да варира в различните щати, като някои щати имат по-висок процент лицензирани шофьори от други.
Като цяло резултатите от оценката показват, че нашите модели PPLX могат да се сравняват и дори да надминат gpt-3.5 и llama2-70b по отношение на свързаните с Perplexity случаи на употреба, особено за предоставяне на точни и актуални отговори.
Достъп до онлайн моделите на Perplexity
Имаме удоволствието да обявим, че pplx-api излиза от фазата на бета версия в общ публичен релиз! Това е първият път, когато нашите модели pplx-7b-online и pplx-70b-online са достъпни чрез pplx-api. Освен това нашите модели pplx-7b-chat и pplx-70b-chat излязоха от алфа версия и вече са достъпни с нашия общ релиз.
С това въвеждаме нова структура на ценообразуване на базата на употребата. Радваме се нашите потребители да се възползват от нашата съвременна инфраструктура, която използва NVIDIA H100s, за да осигури изключително бърз инференс. Професионалните потребители ще получават повтарящ се месечен кредит за pplx-api на стойност 5 долара. За всички останали потребители ценообразуването ще се определя въз основа на употребата. За да се регистрирате като Pro потребител, кликнете тук. За търговски запитвания се свържете с api@perplexity.ai.

Допълнителни ресурси:
- Започнете с pplx-api тук.
- Изпробвайте нашите онлайн модели безплатно с Perplexity Labs.
- Научете повече за нашия API чрез документацията на pplx-api.
- Интересувате ли се да работите в екип с голямо въздействие и висока скорост, който изгражда най-добрия двигател за отговори? Присъединете се към нас!
- Присъединете се към нашата нарастваща Discord общност!
Сътрудници:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats