Представляем онлайн-LLM PPLX

Первый в своем роде онлайн-API для больших языковых моделей.

Perplexity releases first "Live" LLM

Первый в своем роде онлайн-API для больших языковых моделей (LLM).

Мы рады представить две новые модели PPLX: pplx-7b-online и pplx-70b-online! Наши онлайн-модели ориентированы на предоставление полезных, актуальных и достоверных ответов и общедоступны через pplx-api, что делает его первым в своем роде API. Модели pplx-7b-online и pplx-70b-online также доступны через Perplexity Labs, нашу платформу для тестирования LLM.

LLM изменили способ поиска информации. Однако у большинства современных LLM есть два ограничения:

Актуальность: LLM часто испытывают трудности с предоставлением актуальной информации.

Галлюцинации: LLM также могут выдавать неточные утверждения.

Наши модели pplx-7b-online и pplx-70b-online решают текущие ограничения, дополнительно предоставляя полезную, фактическую и актуальную информацию в своих ответах.

Онлайн-LLM PPLX

Наши LLM, pplx-7b-online и pplx-70b-online, являются онлайн-LLM, поскольку они могут использовать знания из интернета и, следовательно, применять самую актуальную информацию при формировании ответа. Предоставляя нашим LLM доступ к знаниям из интернета, наши модели точно отвечают на чувствительные ко времени запросы, открывая доступ к знаниям за пределами их обучающей выборки. Это означает, что онлайн-LLM Perplexity могут отвечать на такие запросы, как «Какой был счет в игре Warriors прошлой ночью?», которые сложны для оффлайн-моделей. На высоком уровне, вот как работает наша онлайн-LLM:

  1. Использование моделей с открытым исходным кодом: наши модели PPLX основаны на базовых моделях mistral-7b и llama2-70b.
  2. Собственная технология поиска: наша внутренняя инфраструктура поиска, индексации и сканирования позволяет нам дополнять LLM наиболее релевантной, актуальной и ценной информацией. Наш поисковый индекс велик, регулярно обновляется и использует сложные алгоритмы ранжирования, чтобы обеспечить приоритет высококачественных сайтов, не оптимизированных под поисковые системы (non-SEOed). Фрагменты веб-сайтов, которые мы называем «сниппетами», предоставляются нашим моделям pplx-online для обеспечения ответов с самой актуальной информацией.
  3. Дообучение (Fine-tuning): наши модели PPLX были дообучены для эффективного использования сниппетов при формировании своих ответов. С помощью наших штатных подрядчиков по данным мы тщательно курируем качественные, разнообразные и большие наборы обучающих данных, чтобы достичь высокой производительности по различным критериям, таким как полезность, достоверность и актуальность. Наши модели регулярно дообучаются для постоянного улучшения производительности.

Оценка онлайн-LLM Perplexity

Миссия Perplexity заключается в создании лучшего в мире поискового движка, которому люди доверяют при поиске и расширении своих знаний. Для достижения этой цели мы глубоко сосредоточены на предоставлении полезной, достоверной и актуальной информации. Чтобы оценить производительность наших LLM по этим критериям, мы составили оценочные наборы данных, отражающие сложные, но реалистичные сценарии использования поисковых движков. Для каждого запроса в каждом оценочном наборе подрядчикам предоставлялись два ответа модели, и им поручалось выбрать ответ, который лучше справился с задачей по следующим критериям:

  • Полезность: какой ответ лучше отвечает на запрос и следует указанным инструкциям?
  • Достоверность: какой ответ предоставляет более точные сведения без галлюцинаций, даже для вопросов, требующих очень точных или нишевых знаний?
  • Актуальность (вдохновлено FreshLLMs): какой ответ содержит более актуальную информацию? Модель превосходит других по этому критерию, если способна отвечать на запросы «свежей» информацией.

В дополнение к трем вышеуказанным критериям ответы моделей также оценивались комплексно. Для комплексной оценки оценщиков просили выбрать ответ, который они предпочли бы получить от человека-ассистента, помогающего с запросом.

Курирование оценочного набора

Для этой оценки мы тщательно отобрали разнообразный набор промптов с целью эффективной проверки полезности, достоверности и актуальности. Каждый промпт был выбран вручную, что обеспечило высокий уровень контроля над качеством и релевантностью данных. Набор данных охватывает широкий спектр промптов для поисковых движков и включает в себя всесторонний обзор того, в чем мы хотим, чтобы Perplexity преуспевала. Это критически важно для того, чтобы наши оценки производительности моделей имели высокий уровень достоверности.

Каждый из трех оценочных наборов содержит 50 промптов. Некоторые примеры из этих наборов включают:

  • Полезность: Создайте таблицу всех игроков сборной США по футболу, которые играли в финалах Чемпионата мира, и создайте столбцы для их статистики, такой как голы, результативные передачи и т. д.
  • Достоверность: Объясните ударную вязкость сталей AISI 1015 и AISI 1040.
  • Актуальность: Какая компания по производству беспилотных автомобилей была запрещена в Сан-Франциско в 2023 году?

Генерация ответов моделей

Мы оценили четыре модели:

pplx-7b-online: Модель Perplexity, включающая доступ к информации из интернета. Эта модель была дообучена с использованием mistral-7b.

pplx-70b-online: Модель Perplexity, включающая доступ к информации из интернета. Эта модель была дообучена с использованием llama2-70b.

gpt-3.5-turbo-1106: Модель OpenAI, доступная через API без дополнительных расширений. Обратите внимание, что мы провели эту оценку с использованием последней версии модели gpt-3.5.

llama2-70b-chat: Модель Meta AI, доступная через наш pplx-api без дополнительных расширений.

Для каждого промпта модели pplx-7b-online и pplx-70b-online получили одни и те же результаты поиска и сниппеты. Все ответы были сгенерированы с использованием одних и тех же гиперпараметров и системного промпта.

Системный промпт

plaintext
Current date: Monday, November 20, 2023.

Ранжирование ответов моделей с помощью оценки людьми

Для каждого парного сравнения нашим штатным подрядчикам предоставлялись сам промпт, критерии оценки (т. е. полезность, достоверность или актуальность) и ответы моделей, отображаемые рядом. Порядок ответов был рандомизирован на каждом этапе, а исходные модели не раскрывались оценщику. Оценщикам было поручено выбрать ответ, который они предпочитают комплексно, а также указать, какой из них лучше работает по конкретному критерию оценки, при этом в обоих случаях допускались ничьи. Наконец, оценщикам было разрешено использовать интернет-поиск для проверки точности ответов. Мы создали собственный инструмент ранжирования предпочтений для проведения этой оценки.

Результаты оценки

Мы используем парные рейтинги предпочтений, собранные в результате оценки людьми, для расчета Elo-баллов для каждой задачи для каждой модели. Elo-баллы обычно используются для ранжирования совокупности игроков в турнирных соревнованиях для измерения относительной производительности игроков. При применении к большим языковым моделям эти баллы дают прогноз того, насколько вероятно, что человеческий оценщик отдаст предпочтение выводу одной модели перед другой.

Хотя Elo-баллы обычно рассчитываются для последовательности сравнений, чтобы учесть изменения в способностях игроков, мы стремимся количественно оценить производительность моделей, чьи способности не могут меняться. Соответственно, мы применяем методологию Bootstrap Elo, описанную в Duan et al и также используемую lmsys для их Chatbot Arena, которая предполагает расчет Elo-баллов для множества случайных перестановок сравнений. Для наших расчетов мы вычислили Elo-баллы по 5000 перестановок и использовали распределения этих Elo-баллов для расчета 95% доверительных интервалов.

Результаты, показанные на Рисунке 1, демонстрируют, что наши модели PPLX могут соответствовать и даже превосходить производительность gpt-3.5 в сценариях использования, связанных с Perplexity. В частности, ответы моделей pplx-7b-online и pplx-70b-online предпочитаются человеческими оценщиками по сравнению с ответами моделей gpt-3.5 и llama2-70b за их точные и актуальные ответы.

Модели pplx-7b-online и pplx-70b-online работают лучше, чем gpt-3.5 и llama2-70b, по критериям актуальности, достоверности и комплексной оценки.

Рисунок 1. Оценочные Elo-баллы и 95% доверительные интервалы для pplx-7b (-online), pplx-70b (-online), llama2-70b и gpt-3.5 по четырем различным оценочным наборам. Например, по оси актуальности pplx-7b и pplx-70b работают лучше, чем gpt-3.5 и llama2-70b, с оценочным Elo-баллом 1100.6 и 1099.6 против 879.3 и 920.3 соответственно.

Мы также рассчитали парные показатели побед на основе оценки. Результаты, показанные на Рисунке 2, иллюстрируют, что, возможно, неудивительно, ответы онлайн-моделей pplx предпочтительнее ответов других моделей по актуальности и достоверности.

Рисунок 2. Показатели побед моделей по вертикальной оси против моделей по горизонтальной оси. Например, ответы pplx-70b (-online) были оценены как комплексно превосходящие ответы gpt-3.5 в 64% запросов, а ответы gpt-3.5 были оценены как комплексно превосходящие ответы pplx-70b (-online) в 24% запросов.

Вот пример из нашего набора данных для оценки актуальности.

Промпт: Сколько людей в США имеют водительские права?

pplx-7b-online

В 2023 году в Соединенных Штатах насчитывается ориентировочно 243,4 миллиона водителей с правами, что составляет 89% взрослых американцев. Это число увеличилось с 238,6 миллионов в 2022 году. Процент водителей с правами варьируется в разных возрастных группах и штатах. Например, в 2019 году 84,1% населения США имели водительские права. Наивысший процент водителей с правами наблюдается среди лиц в возрасте от 25 до 49 лет — 90,1% населения имеют водительские права. В Калифорнии было 27 миллионов водителей с правами, что делает этот штат лидером по количеству водителей с правами.

pplx-70b-online

В 2021 году около 233 миллионов человек имели действительные водительские права в Соединенных Штатах. К 2023 году число водителей с правами в США, по прогнозам, достигнет 243,4 миллиона, что составляет 89% взрослых американцев. Это представляет собой увеличение с 238,6 миллионов в 2022 году.

gpt-3.5

Как ИИ-языковая модель, я не имею доступа к данным в реальном времени. Однако по состоянию на 2021 год оценивалось, что около 227 миллионов человек в Соединенных Штатах имели действительные водительские права. Пожалуйста, обратите внимание, что это число могло измениться с тех пор, поэтому всегда лучше обращаться к последним официальным статистическим данным для получения наиболее точной информации.

llama2-70b

Я не имею доступа к данным в реальном времени, но могу предоставить некоторую информацию о примерном количестве людей в Соединенных Штатах, имеющих водительские права. По данным Федерального управления шоссейных дорог, по состоянию на 2020 год в Соединенных Штатах было около 227,8 миллиона водителей с правами. Это число включает как коммерческих, так и некоммерческих водителей. Стоит отметить, что это число, вероятно, занижено, так как оно не учитывает лиц, которые могут иметь водительские права, но не ездят регулярно или вовсе не водят. Кроме того, это число не включает лиц, которые не имеют права на получение водительских прав, например тех, кто моложе 16 лет или имеет определенные ограничения по здоровью. Также важно отметить, что количество водителей с правами может варьироваться в зависимости от штата: в некоторых штатах процент водителей с правами выше, чем в других.

В целом, результаты оценки демонстрируют, что наши модели PPLX могут соответствовать и даже превосходить gpt-3.5 и llama2-70b в сценариях использования, связанных с Perplexity, особенно в предоставлении точных и актуальных ответов.

Доступ к онлайн-моделям Perplexity

Мы рады объявить, что pplx-api выходит из бета-версии в общедоступный релиз! Впервые наши модели pplx-7b-online и pplx-70b-online доступны через pplx-api. Кроме того, наши модели pplx-7b-chat и pplx-70b-chat вышли из стадии альфа-тестирования и теперь доступны в рамках общего релиза.

В связи с этим мы вводим новую структуру ценообразования, основанную на использовании. Мы рады, что наши пользователи будут применять нашу современную инфраструктуру, которая использует NVIDIA H100s для обеспечения сверхбыстрого вывода (inference). Пользователи Pro получат ежемесячный возобновляемый кредит на pplx-api в размере 5 долларов. Для всех остальных пользователей ценообразование будет определяться на основе использования. Чтобы зарегистрироваться как пользователь Pro, нажмите здесь. По коммерческим вопросам обращайтесь по адресу api@perplexity.ai.

Дашборд онлайн-LLM PPLX

Дополнительные ресурсы:

Авторы:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats