Представляємо онлайнові мовні моделі PPLX
Перший у своєму роді API онлайнових мовних моделей

Перший у своєму роді API онлайнових мовних моделей.
Ми раді представити дві нові моделі PPLX: pplx-7b-online та pplx-70b-online! Наші онлайнові моделі орієнтовані на надання корисних, актуальних і фактичних відповідей та загальнодоступні за допомогою pplx-api, що робить його першим у своєму роді API. Моделі pplx-7b-online та pplx-70b-online також доступні через Perplexity Labs, наш майданчик для тестування мовних моделей.
Мовні моделі змінили спосіб пошуку інформації. Проте більшість сучасних мовних моделей мають два обмеження:
Актуальність: мовні моделі часто стикаються з труднощами при наданні актуальної інформації.
Галюцинації: мовні моделі також можуть видавати неточні твердження.
Наші моделі pplx-7b-online та pplx-70b-online вирішують поточні обмеження, додатково надаючи корисну, фактичну та актуальну інформацію у своїх відповідях.
Онлайнові мовні моделі PPLX
Наші мовні моделі pplx-7b-online та pplx-70b-online є онлайновими мовними моделями, оскільки вони можуть використовувати знання з інтернету і таким чином застосовувати найактуальнішу інформацію під час формування відповіді. Надаючи нашим мовним моделям знання з мережі, вони точно відповідають на запити, залежні від часу, відкриваючи знання поза межами їхнього навчального корпусу. Це означає, що онлайнові мовні моделі Perplexity можуть відповідати на такі запити, як «Яким був рахунок у вчорашньому матчі Ворріорз?», які є складними для офлайнових моделей. Загалом це працює так:
- Використання моделей з відкритим кодом: наші моделі PPLX створені на базі базових моделей
mistral-7bтаllama2-70b. - Власна пошукова технологія: наша власна інфраструктура пошуку, індексування та сканування дозволяє нам доповнювати мовні моделі найрелевантнішою, актуальною та цінною інформацією. Наш пошуковий індекс є великим, оновлюється регулярно та використовує складні алгоритми ранжування для забезпечення пріоритетності високоякісних сайтів без SEO-оптимізації. Витяги з вебсайтів, які ми називаємо «сніпетами», надаються нашим моделям
pplx-online, щоб забезпечити відповіді з найактуальнішою інформацією. - Тонке настроювання: наші моделі PPLX були тонко настроєні для ефективного використання сніпетів для формування відповідей. Використовуючи наших внутрішніх підрядників з обробки даних, ми ретельно куруємо якісні, різноманітні та великі навчальні набори для досягнення високої продуктивності за різними критеріями, такими як корисність, фактичність та актуальність. Наші моделі регулярно проходять тонке настроювання для постійного покращення продуктивності.
Оцінювання онлайнових мовних моделей Perplexity
Місія Perplexity полягає в створенні найкращого у світі пошукового рушія відповідей — такого, якому люди довіряють для пошуку та розширення своїх знань. Для досягнення цієї мети ми зосереджені на наданні корисної, фактичної та актуальної інформації. Щоб протестувати продуктивність наших мовних моделей за цими критеріями, ми підготували набори даних для оцінювання, які відображають складні, але реалістичні сценарії використання для рушіїв відповідей. Для кожного запиту в кожному наборі оцінювання підрядникам надавалися дві відповіді моделі та інструкція вибрати ту відповідь, яка краще відповідає таким критеріям:
- Корисність: яка відповідь краще відповідає на запит і дотримується зазначених інструкцій?
- Фактичність: яка відповідь містить точніші відповіді без галюцинацій, навіть для запитань, які вимагають дуже точних або вузькоспеціалізованих знань?
- Актуальність (надихнуто FreshLLMs): яка відповідь містить більш актуальну інформацію? Модель досягає успіху за цим критерієм, якщо вона здатна відповідати на запити за допомогою «свіжої» інформації.
На додаток до трьох наведених вище критеріїв, відповіді моделей також оцінювалися комплексно. Для комплексного оцінювання евальваторів просили вибрати відповідь, яку вони б хотіли отримати від людини-асистента, що допомагає з цим запитом.
Курування набору для оцінювання
Для цього оцінювання ми ретельно підготували різноманітний набір підказок з метою ефективного оцінювання корисності, фактичності та актуальності. Кожна підказка була вибрана вручну, що забезпечило високий рівень контролю якості та релевантності даних. Набір даних охоплює широкий спектр підказок для рушіїв відповідей і містить вичерпний огляд того, у чому ми хочемо, щоб Perplexity досягала успіху. Це критично важливо для того, щоб наші оцінки продуктивності моделей мали високий рівень сигналу.
Кожен із трьох наборів для оцінювання містить 50 підказок. Серед прикладів із цих наборів:
- Корисність: Створіть таблицю всіх американських футболістів, які грали у фіналах Чемпіонату світу, і зробіть стовпчики для їхньої статистики, такої як голи, гольові передачі тощо.
- Фактичність: Поясніть в'язкість сталей AISI 1015 та AISI 1040.
- Актуальність: Якій компанії з виробництва безпілотних автомобілів заборонили працювати в Сан-Франциско у 2023 році?
Генерація відповідей моделі
Ми оцінили чотири моделі:
pplx-7b-online: модель Perplexity, яка включає доступ до інформації з інтернету. Ця модель була донавчена за допомогою mistral-7b.
pplx-70b-online: модель Perplexity, яка включає доступ до інформації з інтернету. Ця модель була донавчена за допомогою llama2-70b.
gpt-3.5-turbo-1106: модель OpenAI, до якої здійснюється доступ через API і без додаткових розширень. Зауважте, що ми провели це оцінювання за допомогою найновішої моделі gpt-3.5.
llama2-70b-chat: модель Meta AI, до якої здійснюється доступ через наш pplx-api і без додаткових розширень.
Для кожної підказки моделям pplx-7b-online та pplx-70b-online надавалися однакові результати пошуку та сніпети. Усі відповіді були згенеровані з використанням однакових гіперпараметрів і системної підказки.
Системна підказка
Current date: Monday, November 20, 2023.Ранжування відповідей моделі за допомогою оцінювання людиною
Для кожного порівняння пар нашим внутрішнім підрядникам надавалась саму підказка, критерії оцінювання (тобто корисність, фактичність чи актуальність) та відповіді моделей, які відображалися пліч-о-пліч. Порядок відповідей випадковим чином змінювався на кожному етапі, а вихідні моделі не розголошувалися евальватору. Евальваторам було доручено вибрати відповідь, якій вони віддають перевагу загалом, а також ту, яка краще працює за конкретним критерієм оцінювання, причому для обох варіантів дозволялося оголошувати нічию. Нарешті, евальваторам дозволялося використовувати пошук в інтернеті для перевірки точності відповідей. Ми створили власний інструмент ранжування вподобань для проведення цього оцінювання.
Результати оцінювання
Ми використовуємо ранжування парних вподобань, зібране на основі оцінювання людиною, для обчислення балів Ело для кожного завдання для кожної моделі. Бали Ело зазвичай використовуються для ранжування гравців у змаганнях у стилі турнірів для вимірювання відносної продуктивності гравців. У застосуванні до великих мовних моделей ці бали дають передбачення того, наскільки ймовірно, що евальватор-людина віддасть перевагу виводу однієї моделі над іншою.
Хоча бали Ело зазвичай обчислюються для послідовності порівнянь, щоб врахувати зміни в здібностях гравців, ми прагнемо кількісно оцінити продуктивність моделей, чиї здібності не можуть змінюватися. Відповідно, ми застосовуємо методологію Bootstrap Elo, описану Duan та ін. також використану lmsys для їхньої платформи Chatbot Arena, яка передбачає обчислення балів Ело для багатьох випадкових перестановок порівнянь. Для наших обчислень ми обчислили бали Ело за 5000 перестановок і використали розподіли цих балів Ело для обчислення 95% довірчих інтервалів.
Результати, показані на рисунку 1, демонструють, що наші моделі PPLX можуть відповідати і навіть перевершувати продуктивність gpt-3.5 у випадках використання, пов'язаних із Perplexity. Зокрема, евальватори-люди надають перевагу відповідям моделей pplx-7b-online та pplx-70b-online порівняно з відповідями моделей gpt-3.5 та llama2-70b через їхні точні та актуальні відповіді.
Моделі pplx-7b-online та pplx-70b-online працюють краще, ніж gpt-3.5 та llama2-70b, за критеріями актуальності, фактичності та комплексності.

Ми також обчислили показники перемог у парах на основі оцінювання. Результати, показані на рисунку 2, ілюструють, можливо, не дивно, що відповіді онлайнової моделі pplx перевершують інші за критеріями актуальності та фактичності.

Ось приклад з нашого набору даних для оцінювання актуальності.
Підказка: Скільки людей у США мають водійське посвідчення?
pplx-7b-online
У 2023 році в Сполучених Штатах прогнозується 243,4 мільйона водіїв з посвідченнями, що становить 89% дорослого населення США. Це число зросло з 238,6 мільйона у 2022 році. Відсоток водіїв з посвідченнями різниться в різних вікових групах і штатах. Наприклад, у 2019 році 84,1% населення США мало водійське посвідчення. Найвищий відсоток водіїв з посвідченнями спостерігається серед людей віком від 25 до 49 років (90,1% населення має водійське посвідчення). У Каліфорнії було 27 мільйонів водіїв з посвідченнями, що робить її штатом із найбільшою кількістю водіїв з посвідченнями.
pplx-70b-online
У 2021 році близько 233 мільйонів людей мали дійсні водійські посвідчення в Сполучених Штатах. До 2023 року кількість водіїв з посвідченнями в США, за прогнозами, досягне 243,4 мільйона, що включає 89% дорослого населення США. Це свідчить про зростання порівняно з 238,6 мільйона у 2022 році.
gpt-3.5
Як мовна модель штучного інтелекту, я не маю доступу до даних у реальному часі. Проте станом на 2021 рік оцінювалося, що близько 227 мільйонів людей у Сполучених Штатах мали дійсне водійське посвідчення. Будь ласка, зауважте, що це число могло змінитися з того часу, тому завжди найкраще звертатися до найновішої офіційної статистики для отримання найточнішої інформації.
llama2-70b
Я не маю доступу до даних у реальному часі, але можу надати певну інформацію про приблизну кількість людей у Сполучених Штатах, які мають водійське посвідчення. За даними Федерального управління шосейних доріг, станом на 2020 рік у Сполучених Штатах налічувалося приблизно 227,8 мільйона водіїв з посвідченнями. Це число включає як комерційних, так і некомерційних водіїв. Варто зазначити, що це число, ймовірно, є заниженим, оскільки воно не враховує осіб, які можуть мати водійське посвідчення, але не керують автомобілем регулярно або взагалі. Крім того, це число не включає осіб, які не мають права на отримання водійського посвідчення, наприклад тих, кому не виповнилося 16 років або які мають певні інвалідності. Також важливо зазначити, що кількість водіїв з посвідченнями може відрізнятися залежно від штату, причому в деяких штатах відсоток водіїв з посвідченнями вищий, ніж в інших.
Загалом результати оцінювання демонструють, що наші моделі PPLX можуть зрівнятися і навіть перевершити gpt-3.5 та llama2-70b у випадках використання, пов'язаних із Perplexity, зокрема щодо надання точних та актуальних відповідей.
Доступ до онлайнових моделей Perplexity
Ми раді повідомити, що pplx-api виходить із бета-тестування у загальнодоступний реліз! Це перший випадок, коли наші моделі pplx-7b-online та pplx-70b-online доступні через pplx-api. Крім того, наші моделі pplx-7b-chat та pplx-70b-chat вийшли з альфа-тестування і тепер доступні у нашому загальному релізі.
З огляду на це, ми запроваджуємо нову структуру ціноутворення на основі використання. Ми раді, що наші користувачі використовуватимуть нашу ультрасучасну інфраструктуру, яка використовує NVIDIA H100s для забезпечення неймовірно швидкого виведення. Професійні користувачі отримуватимуть щомісячний кредит pplx-api на суму 5 доларів, що поновлюється. Для всіх інших користувачів ціноутворення визначатиметься на основі використання. Щоб зареєструватися як професійний користувач, натисніть тут. З питань комерційної співпраці звертайтеся за адресою api@perplexity.ai.

Додаткові ресурси:
- Почніть роботу з pplx-api тут.
- Випробуйте наші онлайнові моделі безплатно за допомогою Perplexity Labs.
- Дізнайтеся більше про наш API в документації pplx-api.
- Бажаєте працювати у високопродуктивній і динамічній команді, яка створює найкращий рушій відповідей? Приєднуйтеся до нас!
- Приєднуйтеся до нашої зростаючої спільноти Discord!
Учасники:
Лорен Янг (Lauren Yang), Кевін Ху (Kevin Hu), Аараш Гейдарі (Aarash Heydari), Ґрейді Ван (Gradey Wang), Дмитро Первухін, Нікхіл Тота (Nikhil Thota), Александр Ярац (Alexandr Yarats), Макс Морозов (Max Morozov), Денис Ярац (Denis Yarats)