Локальний агент для приватної та економічно ефективної розумової праці
Обв'язка та модель, спільно спроєктовані для локальної розумової праці, що працюють на пристрої та отримують віддалені можливості на вимогу.
Perplexity Portable Computer — це агент, орієнтований на локальну роботу.
Увесь стек за замовчуванням працює локально. Модель, обв'язка, діалог і траєкторія розміщуються на комп'ютері користувача. Робота, яка потребує зовнішнього світу (наприклад, веб-пошук, конектори або ескалація до сильнішої моделі-радника в хмарі), викликається лише за потреби й завжди контролюється користувачем. Тому конфіденційні дані ніколи не залишають пристрій без дозволу, а локальні моделі не передбачають комісії за виведення: система створена приватною та економічно ефективною за своєю суттю.
Ефективний агент, орієнтований на локальну роботу, вимагає спільного проєктування моделі та обв'язки. Універсальні обв'язки розраховані на передову модель, здатну сприймати довгі контексти, опрацьовувати широкий спектр інструментів і планувати на тривалі періоди. Локальні моделі менш надійні за таких вимог. Замість того щоб змушувати невелику модель керувати обв'язкою, створеною для великої, ми налаштували їх одну під одну: обв'язку, адаптовану до профілю можливостей моделі, та модель, донавчену для ефективного використання цієї обв'язки.
Вступ
В останні місяці можливості агентів стрімко розвивалися в широкому спектрі завдань із розумової праці. Хоча ці досягнення забезпечують значне зростання продуктивності та ефективності, вони також створюють два виклики.
Споживання токенів стрімко зростає, а разом із ним і загальні витрати. Коли інтелект доступний через API моделей з відкритим вихідним кодом, що працюють на віддалених кластерах, конфіденційна інформація та інтелектуальна власність залишають пристрій користувача з кожним запитом. З масируванням агентів у межах окремих робочих процесів і цілих організацій витрати токенів та переміщення даних стають дедалі складнішими для керування.
Водночас моделі з відкритим вихідним кодом вдосконалюються ще швидшими темпами. Прогрес найбільш помітний у дуже малих та ефективних моделях, таких як NVIDIA Nemotron 3.5 Lightning (30 млрд загальних параметрів), Qwen 3.6 (35 млрд) та Qwen 3.8 (27 млрд). Ці невеликі моделі перевершують очікування і тепер здатні виконувати складні робочі процеси агентів. Апаратне забезпечення для локального виведення розвивається паралельно: такі системи, як NVIDIA DGX Spark, тепер можуть запускати ці моделі локально. Разом ці тенденції роблять повністю автономну роботу практичною, водночас дозволяючи користувачам за потреби підключати зовнішні можливості, такі як веб-пошук, конектори чи ескалація до хмарних моделей.
Цей підхід із пріоритетом локальної роботи забезпечує значну економію коштів, оскільки локальне виведення дозволяє уникнути комісій API за кожен токен. Він також природним чином вирішує проблеми конфіденційності та інтелектуальної власності: конфіденційні токени ніколи не передаються на віддалені кластери та залишаються в безпеці в межах локального пристрою.
У червні ми представили перший гібридний оркестратор локально-серверного виведення, який визначає, яка робота має виконуватися на пристрої, а яка має передаватися агентам у хмарі. Тут ми пояснюємо, як ми створили такого локально-орієнтованого агента, зокрема обв'язку та моделі, оптимізовані одна під одну.
Ми наводимо огляд ключових проєктних рішень, оцінюємо Computer порівняно з популярними універсальними обв'язками з відкритим вихідним кодом (Hermes і Pi) на трьох публічних бенчмарках і нашому внутрішньому бенчмарку Local Knowledge Work Bench. На нашому бенчмарку з моделлю Qwen 3.8 27B, що працює на NVIDIA DGX Spark, Computer досягає найвищого бала — 82,6% проти 77,6% для Pi та 74,0% для Hermes. PPLX 27B, наша модель, донавчена поверх Qwen 3.8 27B, підвищує цей бал до 85,4%.
Проєктування обв'язки навколо локальної моделі
Хоча компактні моделі на пристроях вже є досить потужними, вони все ще поступаються більшим передовим моделям у продуктивності. Для ефективного керування цими моделями та подолання їхніх обмежень необхідна ретельно розроблена обв'язка.
Популярні обв'язки з відкритим вихідним кодом, такі як Pi та Hermes, довели свою універсальність: вони добре працюють із найрізноманітнішими моделями різних розмірів і класів. Проте вони не оптимізовані під можливості моделей на пристроях. Ми розробили локальну обв'язку спеціально для цих умов, спираючись на кілька ключових принципів.
Ефективність контексту
Основна увага під час проєктування нашої обв'язки приділялася найкращому використанню контексту моделі.
Хоча моделі на пристроях, такі як Qwen 3.8 27B, пропонують контекстні вікна на 260 тис. токенів, ми емпірично встановили, що вони починають працювати гірше за межею 100 тис. токенів. Тому ми тримаємо основну обв'язку лаконічною: мінімальний системний промпт і невеликий набір базових інструментів.
Усі інші можливості модублізовано у вигляді навичок на вимогу, які завантажуються та вивантажуються протягом траєкторії. Ми розробили ці навички для поширених завдань розумової праці: дослідження, наука про дані, візуалізація даних, створення документів, розробка програмного забезпечення тощо.
Обв'язка також підтримує стиснення контексту, підсумовуючи застарілий контекст у разі подовження траєкторії, щоб модель залишалася в межах свого ефективного вікна.
Конектори як інструменти командного рядка
Повсякденна розумова праця часто вимагає таких конекторів, як Gmail, GitHub, Outlook і Google Calendar. Зазвичай вони надаються обв'язці як сервери MCP, великі визначення інструментів яких споживають значну частину контексту. Натомість ми перетворили найпопулярніші MCP на компактні та зручні інструменти командного рядка, доповнені спеціальними навичками, які набагато ефективніше використовують обмежений ефективний контекст.
Самоперевірка
Продуктивність також покращується, коли агент перевіряє власну роботу. Перевірка додає додаткові кроки, але вона суттєво покращує кінцеві результати та значно скорочує розрив із передовими моделями. Вона може ініціюватися самою моделлю або набором перехоплювачів, які стежать за станом траєкторії та запитують самоперевірку, якщо щось іде не так.
Виконання в пісочниці
Обв'язка виконує інструменти в пісочниці рівня ОС на пристрої користувача. Межі обмежують процеси, шляхи до файлів і доступ до мережі відповідно до політики. Це обмежує радіус ураження помилкової команди. Якщо пісочниця недоступна, обв'язка вимикається перед будь-якими викликами інструментів, замість того щоб переходити на виконання без пісочниці.
Це відрізняється від обв'язок із відкритим вихідним кодом, таких як Pi та Hermes, які за замовчуванням запускають команди безпосередньо з дозволами користувача. У Computer ізоляція ввімкнена завжди, не потребує налаштування, і інструменти не можуть працювати без неї.
Наведена нижче діаграма показує, як ці принципи поєднуються в циклі виконання. Оркестратор — це детермінований код обв'язки, а не Велика мовна модель (LLM): він підтримує цикл, збирає контекст і забезпечує дотримання політик. Локальна модель пропонує наступну дію; оркестратор виконує затверджені виклики інструментів у пісочниці та повертає їхні результати моделі. Веб-пошук, конектори та виклики радника перетинають межу пристрою лише тоді, коли вони увімкнені та схвалені.
Локальна обв'язка витискає більше з тієї самої моделі
Використовуючи ту саму базову модель на пристрої, ми порівнюємо нашу локальну обв'язку з універсальними альтернативами щодо веб-досліджень та мультимодального розуміння документів. Усі обв'язки використовують модель Qwen 3.8 27B із середнім рівнем міркувань, що працює на NVIDIA DGX Spark. Це порівняння ізолює можливості, які забезпечує сама обв'язка, до будь-якого донавчання моделі.
Ми зосереджуємося на цих двох можливостях, оскільки розумова праця часто поєднує приватні документи на пристрої користувача з публічною інформацією з веб для створення обґрунтованого артефакту. Веб-пошук вимагає підключення до мережі, але виведення моделі та обробка приватних документів залишаються локальними. Локальні файли слугують авторитетним джерелом, публічні джерела додають контекст, а користувачі можуть повністю вимкнути веб-пошук для роботи в автономному режимі.
Веб-дослідження
Ми створюємо нашу локальну обв'язку разом із пошуковою системою Perplexity, яка посіла провідні місця в незалежних оцінюваннях. Обв'язка звертається до неї через інтерфейс Search as Code.
Ми оцінюємо якість досліджень на 1266 завданнях BrowseComp. Computer використовує пошукову інфраструктуру Perplexity разом із нашою локальною обв'язкою, тоді як Pi та Hermes покладаються на Brave — рекомендованого ними постачальника пошуку. Computer досягає точності 66,7% порівняно з 50,2% для Pi та 43,9% для Hermes.
Computer також має найнижчий середній записаний час виконання та використання токенів: 402,1 секунди та 852 тис. токенів на завдання, порівняно з 1020,9 секунди та 1,01 мільйона токенів для Hermes і 826,0 секунди та 2,82 мільйона токенів для Pi. Таким чином, Computer використовує на 61% менше часу та на 16% менше токенів, ніж Hermes, і на 51% менше часу та на 70% менше токенів, ніж Pi.
Мультимодальне розуміння документів на пристрої
Багато документів містять візуальну інформацію, яку важко розібрати як звичайний текст: PDF-файли, скановані сторінки, знімки екрана, діаграми та презентації. Ці робочі процеси залежать від OCR та розуміння зображень, і найбільше виграють від нативно мультимодальної моделі.
Обв'язка передає сторінки документів та зображення безпосередньо моделі, яка розуміє їх і поєднує візуальні дані з витягнутим текстом. Обробка цих файлів на пристрої зберігає конфіденційність чутливих документів та їхнього витягнутого вмісту.
Ми оцінюємо мультимодальне розуміння документів на ParseBench-100, підмножині з 100 завдань із бенчмарка ParseBench, що містить по 20 завдань для діаграм, макетів, таблиць, текстового вмісту та форматування.
Computer досягає середнього бала 65,1% порівняно з 34,6% для Hermes та 13,9% для Pi. Він також виконує завдання за найменший час і з найменшою кількістю токенів: у середньому 60,6 секунди та 20,1 тис. токенів на завдання, порівняно з 108,3 секунди та 32,1 тис. токенів для Hermes і 410,5 секунди та 829,1 тис. токенів для Pi. Computer лідирує в усіх п'яти категоріях документів, причому найбільша перевага спостерігається на діаграмах. Маккети залишаються складними для всіх трьох обв'язок.
Таблиця 1. Середній бал ParseBench-100 за категоріями документів для обв'язок Computer, Hermes і Pi з моделлю Qwen 3.8 27B на пристрої. Computer лідирує в усіх п'яти категоріях.
Обв'язка | Діаграма | Макет | Таблиця | Текстовий вміст | Форматування |
Computer | 76,5% | 16,2% | 72,7% | 87,9% | 72,4% |
Hermes | 29,3% | 2,9% | 44,1% | 61,5% | 35,2% |
Pi | 2,5% | 0,1% | 11,0% | 29,7% | 26,1% |
Скорочення розриву з передовими моделями за допомогою ескалації до радника
Навіть за наявності ретельно розробленої обв'язки найскладніші завдання все ще перевищують можливості компактної моделі на пристрої. Для таких завдань обв'язка надає інструмент радника: локальна модель може проконсультуватися з потужнішою передовою моделлю, коли їй потрібна допомога з плануванням, розв'язанням неоднозначностей, відновленням після повторних збоїв або перевіркою кінцевого результату.
Локальна модель вирішує, коли запитувати пораду, тоді як оркестратор обв'язки зберігає повноваження щодо інструментів і контролює, який контекст надсилається. Ескалація є необов'язковою. Користувач вирішує, чи вмикати її та чи схвалювати кожен виклик радника вручну або автоматично.
Перед викликом радника обв'язка вибирає відповідний контекст, застосовує класифікатор PII для позначення конфіденційної інформації та показує користувачеві, що саме залишить пристрій. Радник отримує лише затверджений контекст і повертає текстові вказівки; він не має прямого доступу до файлів, інструментів чи розмов на пристрої. Це покращує як вартість, так і конфіденційність, і ми плануємо подальше дослідження цього напряму в майбутній роботі.
Ми тестуємо цей підхід на складних завданнях із розробки програмного забезпечення, які вимагають серйозних міркувань і де локальна модель найчастіше зазнає труднощів. Для цього ми використовуємо Terminal Bench 2.1, популярний бенчмарк із 89 завдань для агентів програмування.
Ми хочемо відповісти на два запитання: яку частину розриву з передовою моделлю може закрити ескалація до радника та якою ціною. Запуск повністю локальних моделей не коштує практично нічого, оскільки виведення відбувається на апаратному забезпеченні користувача. Проте як тільки модель починає викликати радника, виникають витрати на API.
Як базовий показник продуктивності передових моделей ми використовуємо Claude Opus 5, що працює в локальній обв'язці; локальна модель — Qwen 3.8 27B. Нарешті, ми поєднуємо їх: Qwen 3.8 27B виконує завдання та передає його раднику Claude Opus 5, коли потрібна допомога. Ми не оцінюємо ескалацію до радника з Pi чи Hermes, оскільки жодна з них не надає еквівалентного інструменту радника; додавання такого інструменту вимагало б зміни поверхні його інструментів та логіки оркестрації, тож результат більше не представляв би готову обв'язку.
Ескалація до радника підвищує бал Computer із 59,6% до 73,0% (зростання на 13,5 відсоткового пункту) за орієнтовної вартості API $0,415 за запуск. Запуск лише Claude Opus 5 досягає 82,4% за $0,65 за запуск. Таким чином, ескалація відновлює приблизно три п'ятих розриву до передової моделі приблизно за дві третини її вартості, а користувач вирішує, чи варто йти на такий компроміс.
Донавчання для обв'язки та розумової праці
Досі ми залишали локальну модель незмінною, щоб ізолювати внесок обв'язки. Після створення дизайну обв'язки найбільші подальші покращення надходять від адаптації самої моделі. Дані використання Perplexity Computer показують нам, що люди насправді роблять для розумової праці, і ми використовуємо їх для синтезу навчальних даних. Ми донавчаємо локальну модель усередині обв'язки Computer, спираючись на реальний розподіл завдань, які виконують користувачі.
Конкретно ми визначаємо різноманітний набір сценаріїв використання, які задіюють різні можливості моделі, інструменти та конектори. На основі цих сценаріїв ми синтезуємо реалістичні середовища для навчання з підкріпленням і визначаємо складні, але перевірювані завдання: кожне завдання складається з інструкції, середовища та перевіряльника, який оцінює кінцевий результат, причому середовищем є контейнер Docker, у якому працює обв'язка. Важливо те, що оскільки завдання є синтетичними, вони не містять жодних реальних документів чи інформації про користувача.
Ми використовуємо ці середовища для двоетапного навчання: донавчання на основі відхилення з подальшим навчанням із підкріпленням. На першому етапі ми запускаємо модель для кожного завдання кілька разів, вибираємо найкращі траєкторії за оцінкою перевіряльника та тренуємося на них за допомогою навчання з учителем. Цей етап ініціалізує модель для конкретної обв'язки та розподілу завдань. На другому етапі навчання з підкріпленням додатково донавчає модель, роблячи її стійкішою.
Підмножина завдань виключається з навчання та використовується для остаточного оцінювання; ми називаємо цей відкладений набір Local Knowledge Work Bench: 53 завдання, що охоплюють сім категорій повсякденної розумової праці, від глибокого дослідження до створення документів. Незабаром ми опублікуємо технічний звіт із детальним описом навчання моделі та плануємо відкрити вихідний код цього бенчмарка для оцінювання.
Ми донавчили Qwen 3.8 27B за допомогою цього підходу, створивши модель PPLX 27B, і оцінили її на бенчмарку Local Knowledge Work Bench. З базовою моделлю Qwen 3.8 27B Computer досягає найвищого бала (82,6% порівняно з 77,6% для Pi та 74,0% для Hermes) і використовує найменше токенів (520 тис. проти 681 тис. для Pi та 634 тис. для Hermes). Pi виконує завдання найшвидше — за 176 секунд на завдання, порівняно з 218 секундами для Computer і 292 секундами для Hermes. PPLX 27B підвищує бал Computer до 85,4%, ціною більшої кількості токенів (678 тис. проти 520 тис.). Його орієнтовний час виконання становить 250 секунд.
Таблиця 2. Категорії завдань Local Knowledge Work Bench.
Категорія | Завдання | Частка | Опис |
Глибоке дослідження | 20 | 37,7% | Відповіді на складні запитання, що вимагають багатоетапного веб-дослідження, публічних наборів даних, статистики та перевірки джерел. |
Дані, фінанси та закупівлі | 9 | 17,0% | Очищення наборів даних, згорка даних, аудит витрат, аналіз інвестицій, оцінка постачальників та розрахунок фінансових показників. |
Документи, презентації та дизайн | 7 | 13,2% | Створення якісних PDF-файлів, рахунків, матеріалів для адаптації (onboarding), матеріалів для заходів та бізнес-презентацій. |
Інженерія, IT та інциденти | 5 | 9,4% | Розслідування інцидентів, аналіз логів, написання планів відновлення, оцінка готовності до релізу та синтез технічної документації. |
Контракти, докази та дотримання вимог (compliance) | 5 | 9,4% | Перевірка контрактів, аналіз доказів, розслідування відкликань, редагування чутливих документів та перевірка вимог щодо дотримання нормативних актів. |
Панелі керування, програмне забезпечення та візуалізація | 4 | 7,5% | Створення інтерактивних панелей керування, освітніх мікросайтів, діаграм та візуалізацій проєктів. |
Люди, проєкти та наради | 3 | 5,7% | Перегляд резюме, узагальнення рішень нарад та ведення систем відстеження завдань проєкту. |
Усього | 53 | 100% |
Висновок
Наше дослідження показує, що потужна модель з відкритим вихідним кодом у поєднанні з продуктивним локальним апаратним забезпеченням та створеною для них обв'язкою може виконувати реальну розумову працю за майже нульової вартості виведення, не вимагаючи передачі конфіденційних даних із пристрою.
У різних бенчмарках Computer відповідала або перевершувала Hermes та Pi за точністю, працюючи з Qwen 3.8 27B на NVIDIA DGX Spark. Серед трьох бенчмарків, що повідомляють затримку та використання токенів, Computer була найшвидшою на BrowseComp і ParseBench-100 та використала найменше токенів у всіх трьох; Pi була найшвидшою на Local Knowledge Work Bench.
Приріст продуктивності став результатом наших рішень. Ми створили лаконічну локальну обв'язку з навичками, які завантажуються на вимогу. Ми перетворили конектори на компактні інструменти CLI замість серверів MCP. Виконання було ізольоване в пісочниці задля безпеки.
Результати також показують, де компактні моделі мають простір для вдосконалення. Наприклад, у складних завданнях програмування в Terminal Bench 2.1 локальна модель поступається передовій моделі в усіх трьох обв'язках. Ескалація до радника звужує, але повністю не закриває цей розрив; для подальшого підвищення продуктивності все ще необхідні постійні вдосконалення можливостей моделей та локального обладнання.
Мета створення обв'язки та моделі під локальні обмеження полягає в тому, щоб надати користувачам явний контроль над тим, яка інформація залишає їхні комп'ютери. Для користувача також існують переваги в ціні. Ми розглядаємо це як частину ширшого здвигу, в межах якого дедалі потужніші агенти переходять від віддаленої інфраструктури до індивідуальних і локальних пристроїв. Ми очікуємо, що вдосконалення чіпів, моделей і пристроїв постійно розширюватиме діапазон і якість розумової праці, яку Portable Computer обробляє локально.