Локальный агент для приватной и экономичной интеллектуальной работы

Обвязка и модель, созданные совместно для локальной интеллектуальной работы, выполняемые на устройстве и обращающиеся к удаленным возможностям по запросу.

АвторыPerplexity Research

Perplexity Portable Computer — это агент, ориентированный на локальное выполнение.

Весь стек по умолчанию работает локально. Модель, обвязка, диалог и траектория — все это находится на машине пользователя. Работа, требующая обращения к внешнему миру, такая как веб-поиск, коннекторы или эскалация к более мощной модели-советнику в облаке, вызывается только при необходимости и всегда контролируется пользователем. Таким образом, конфиденциальные данные никогда не покидают устройство без разрешения, а локальные модели не требуют платы за инференс: система является приватной и экономичной по своей сути.

Для создания эффективного агента, ориентированного на локальное выполнение, необходимо проектировать модель и обвязку одновременно. Универсальные обвязки рассчитаны на пограничную модель, способную обрабатывать длинный контекст, работать с широким набором инструментов и строить планы на большой горизонт. Локальные модели менее надежны при таких требованиях. Вместо того чтобы заставлять маленькую модель управлять обвязкой, созданной для большой, мы спроектировали их друг под друга: обвязку, адаптированную под профиль возможностей модели, и модель, прошедшую дообучение для эффективного использования этой обвязки.

Введение

В последние месяцы возможности агентов стремительно развивались в самых разных задачах интеллектуальной работы. Хотя эти достижения приносят значительный прирост производительности и эффективности, они также создают две проблемы.

Потребление токенов быстро растет, а вместе с ним и общие расходы. Когда к интеллекту обращаются через API моделей с закрытым исходным кодом, работающих на удаленных кластерах, частная информация и интеллектуальная собственность покидают устройство пользователя с каждым запросом. По мере того как агенты масштабируются на отдельные рабочие процессы и целые организации, расход токенов и перемещение данных становится все труднее контролировать.

В то же время модели с открытым исходным кодом совершенствуются еще быстрее. Наиболее заметен прогресс в очень маленьких и эффективных моделях, таких как NVIDIA Nemotron 3.5 Lightning (30 млрд параметров в сумме), Qwen 3.6 (35 млрд) и Qwen 3.8 (27 млрд). Эти небольшие модели превосходят ожидания и теперь способны выполнять сложные агентские рабочие процессы. Параллельно развивается оборудование для локального инференса: такие системы, как NVIDIA DGX Spark, теперь могут запускать эти модели локально. Все эти тенденции делают полностью работу на устройстве практичной, позволяя пользователям при необходимости подключать внешние возможности, такие как веб-поиск, коннекторы или эскалация к облачным моделям.

Такой подход с приоритетом локального выполнения обеспечивает значительную экономию средств, поскольку локальный инференс избавляет от платы за API на основе токенов. Он также естественным образом решает проблемы конфиденциальности и интеллектуальной собственности: приватные токены никогда не передаются на удаленные кластеры и остаются в безопасности в пределах локального устройства.

В июне мы представили первый гибридный оркестратор локально-серверного инференса, который решает, какую работу выполнять на устройстве, а какую передавать агентам в облаке. Здесь мы рассказываем, как создали такого агента с приоритетом локального выполнения, включая обвязку и модели, оптимизированные друг для друга.

Мы даем обзор ключевых конструктивных решений, сравниваем Computer с популярными универсальными обвязками с открытым исходным кодом (Hermes и Pi) на трех публичных бенчмарках и нашем внутреннем бенчмарке Local Knowledge Work Bench. На нашем бенчмарке с моделью Qwen 3.8 27B, работающей на NVIDIA DGX Spark, Computer достигает наивысшего результата — 82,6% против 77,6% у Pi и 74,0% у Hermes. PPLX 27B, наша модель, дообученная поверх Qwen 3.8 27B, поднимает этот показатель еще выше — до 85,4%.

Столбчатая диаграмма результатов Local Knowledge Work Bench: обвязки Computer, Pi и Hermes с Qwen 3.8 27B, а также Computer с PPLX 27B, которая показывает наивысший результат в 85,4%.
Оценки на Local Knowledge Work Bench — нашем бенчмарке из 53 типичных задач повседневной интеллектуальной работы. Каждый столбец представляет комбинацию обвязки и модели, работающую на NVIDIA DGX Spark; PPLX 27B — наша дообученная модель. Три попытки на задачу; усы показывают 95-процентные доверительные интервалы.

Проектирование обвязки под локальную модель

Хотя компактные модели на устройствах уже весьма способны, они все же уступают по производительности более крупным пограничным моделям. Для эффективного управления этими моделями и преодоления их ограничений необходима тщательно спроектированная обвязка.

Популярные обвязки с открытым исходным кодом, такие как Pi и Hermes, доказали свою универсальность: они хорошо работают с самыми разными моделями разных размеров и классов. Но они не оптимизированы под возможности моделей на устройствах. Мы разработали локальную обвязку специально для этого сценария, опираясь на несколько ключевых принципов.

Эффективность контекста

Основным фокусом при проектировании нашей обвязки было максимальное использование контекста модели.

Хотя модели на устройствах, такие как Qwen 3.8 27B, предоставляют окна контекста в 260 тыс. токенов, эмпирически мы выяснили, что они начинают испытывать трудности при превышении 100 тыс. токенов. Поэтому мы поддерживаем основную обвязку лаконичной: минимальный системный промпт и небольшой набор основных инструментов.

Все остальные возможности модурированы в виде навыков по запросу, которые загружаются и выгружаются в течение всей траектории. Мы разработали эти навыки для распространенных задач интеллектуальной работы: исследований, науки о данных, визуализации данных, создания документов, разработки ПО и многого другого.

Обвязка также поддерживает компактификацию контекста, суммируя устаревший контекст по мере удлинения траектории, чтобы модель оставалась в пределах своего эффективного окна.

Коннекторы как инструменты командной строки

Повседневная интеллектуальная работа часто требует использования таких коннекторов, как Gmail, GitHub, Outlook и Google Calendar. Обычно они предоставляются обвязке в виде серверов MCP, чьи большие определения инструментов потребляют значительную долю контекста. Вместо этого мы преобразовали наиболее часто используемые MCP в компактные и простые в использовании инструменты командной строки, дополненные пользовательскими навыками, которые гораздо эффективнее используют ограниченный эффективный контекст.

Самопроверка

Производительность также повышается, когда агент проверяет свою собственную работу. Проверка добавляет дополнительные шаги, но она значительно улучшает конечные результаты и существенно сокращает разрыв с пограничными моделями. Она может инициироваться самой моделью или набором хуков, которые отслеживают состояние траектории и запрашивают самопроверку при возникновении сбоев.

Выполнение в песочнице

Обвязка выполняет инструменты в песочнице на уровне ОС на устройстве пользователя. Эта граница ограничивает процессы, пути файловой системы и доступ к сети в соответствии с политикой. Это снижает радиус поражения при ошибочной команде. Если песочница недоступна, обвязка отключается до любых вызовов инструментов, а не переходит к выполнению без песочницы.

Это отличает данное решение от обвязок с открытым исходным кодом, таких как Pi и Hermes, которые по умолчанию запускают команды напрямую с правами пользователя. В Computer изоляция включена всегда, не требует настройки, и инструменты не могут работать без нее.

На приведенной ниже схеме показано, как эти принципы сочетаются в цикле выполнения. Оркестратор представляет собой детерминированный код обвязки, а не LLM: он поддерживает цикл, собирает контекст и обеспечивает соблюдение политик. Локальная модель предлагает следующее действие; оркестратор выполняет одобренные вызовы инструментов в песочнице и возвращает их результаты модели. Веб-поиск, коннекторы и вызовы советника пересекают границу устройства только тогда, когда они включены и одобрены.

Схема цикла выполнения локальной обвязки: детерминированный код оркестратора собирает контекст и запускает инструменты в песочнице, локальная модель предлагает действия, а внешние службы являются опциональными и управляются пользователем.
Как локальная обвязка выполняет задачу. Детерминированный код обвязки управляет циклом и инструментами в песочнице; локальная модель предлагает действия. Внешние службы опциональны и управляются пользователем.

Локальная обвязка позволяет извлечь больше из той же модели

Используя ту же базовую модель на устройстве, мы сравниваем нашу локальную обвязку с универсальными альтернативами в веб-исследованиях и мультимодальном понимании документов. Все обвязки используют модель Qwen 3.8 27B со средним уровнем рассуждений, работающую на NVIDIA DGX Spark. Это сравнение позволяет изолировать возможности, привнесенные самой обвязкой, до какого-либо дообучения модели.

Мы фокусируемся на этих двух возможностях, поскольку интеллектуальная работа часто объединяет личные документы на устройстве пользователя с общедоступной информацией из интернета для создания обоснованного артефакта. Веб-поиск требует подключения к сети, но инференс модели и обработка личных документов остаются локальными. Локальные файлы служат авторитетным источником, публичные источники добавляют контекст, а пользователи могут полностью отключить веб-поиск для работы в режиме офлайн.

Веб-исследования

Мы создаем нашу локальную обвязку вместе с поисковой системой Perplexity, которая заняла лидирующие позиции в независимых оценках. Обвязка обращается к ней через интерфейс Search as Code.

Мы оцениваем качество исследований на 1266 задачах BrowseComp. Computer использует поисковую инфраструктуру Perplexity вместе с нашей локальной обвязкой, в то время как Pi и Hermes полагаются на Brave, рекомендуемого ими провайдера поиска. Computer достигает точности 66,7% по сравнению с 50,2% у Pi и 43,9% у Hermes.

Computer также имеет наименьшее среднее записанное время выполнения и использование токенов: 402,1 секунды и 852 тыс. токенов на задачу по сравнению с 1 020,9 секундами и 1,01 млн токенов для Hermes и 826,0 секундами и 2,82 млн токенов для Pi. Таким образом, Computer использует на 61% меньше времени выполнения и на 16% меньше токенов, чем Hermes, а также на 51% меньше времени выполнения и на 70% меньше токенов, чем Pi.

Диаграмма рассеяния результатов BrowseComp в сравнении со средним временем выполнения задачи для Computer, Hermes и Pi с Qwen 3.8 27B; Computer достигает наивысшего балла за меньшее время и с меньшим количеством токенов.
Результаты BrowseComp с моделью Qwen 3.8 27B на устройстве: балл в зависимости от среднего времени выполнения задачи для обвязок Computer, Hermes и Pi; подметки точек показывают среднее количество токенов на задачу. Неполные результаты оцениваются нулем, а средние значения времени и токенов не включают запуски без зафиксированных измерений. Усы представляют 95-процентные доверительные интервалы Уилсона для оценки.

Мультимодальное понимание документов на устройстве

Многие документы содержат информацию в визуальном виде, и их трудно анализировать как простой текст: PDF-файлы, сканированные страницы, скриншоты, диаграммы и презентации. Эти рабочие процессы зависят от распознавания текста (OCR) и понимания изображений и получают наибольшую выгоду от изначально мультимодальной модели.

Обвязка передает страницы документов и изображения напрямую модели, которая понимает их и объединяет визуальные свидетельства с извлеченным текстом. Обработка этих файлов на устройстве сохраняет конфиденциальность чувствительных документов и их извлеченного содержимого.

Мы оцениваем мультимодальное понимание документов на ParseBench-100 — подмножестве бенчмарка ParseBench, состоящем из 100 задач (по 20 задач на диаграммы, макет, таблицы, текстовое содержимое и форматирование).

Computer достигает среднего балла 65,1% по сравнению с 34,6% у Hermes и 13,9% у Pi. Он также выполняет задачи за меньшее время и с меньшим количеством токенов: в среднем 60,6 секунды и 20,1 тыс. токенов на задачу против 108,3 секунды и 32,1 тыс. токенов у Hermes и 410,5 секунды и 829,1 тыс. токенов у Pi. Computer лидирует во всех пяти категориях документов, причем наибольшее преимущество он имеет в диаграммах. Макет остается сложным для всех трех обвязок.

Диаграмма рассеяния результатов OCR ParseBench-100 в зависимости от среднего времени выполнения задачи для Computer, Hermes и Pi с Qwen 3.8 27B; Computer достигает наивысшего балла за меньшее время и с меньшим количеством токенов.
Результаты OCR ParseBench-100 с моделью Qwen 3.8 27B на устройстве: оценка в зависимости от среднего времени выполнения задачи для обвязок Computer, Hermes и Pi; метки точек показывают среднее количество токенов на задачу. В средних значениях токенов используются запуски с записанными измерениями. Усы показывают 95-процентные доверительные интервалы.

Таблица 1. Средний балл ParseBench-100 по категориям документов для обвязок Computer, Hermes и Pi с моделью Qwen 3.8 27B на устройстве. Computer лидирует во всех пяти категориях.

Обвязка

Диаграмма

Макет

Таблица

Текстовое содержимое

Форматирование

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Сокращение разрыва с пограничными моделями с помощью эскалации к советнику

Даже при тщательно спроектированной обвязке самые сложные задачи все равно превосходят возможности компактной модели на устройстве. Для таких задач обвязка предоставляет инструмент советника: локальная модель может проконсультироваться с более мощной пограничной моделью, когда ей нужна помощь с планированием, разрешением неопределенности, восстановлением после повторяющихся сбоев или проверкой конечного результата.

Локальная модель решает, когда запрашивать совет, в то время как оркестратор обвязки сохраняет полномочия по управлению инструментами и контролирует отправку контекста. Эскалация опциональна. Пользователь решает, включать ли ее и одобрять ли каждый вызов советника вручную или автоматически.

Перед вызовом советника обвязка выбирает релевантный контекст, применяет классификатор PII для выявления конфиденциальной информации и показывает пользователю, что покинет устройство. Советник получает только одобренный контекст и возвращает текстовые рекомендации; у него нет прямого доступа к файлам, инструментам или диаграммам устройства. Это повышает как экономичность, так и конфиденциальность, и мы планируем и дальше развивать это направление в будущем.

Схема эскалации к советнику: оркестратор обвязки сохраняет полномочия по управлению инструментами и отправляет модели-советнику только утвержденный контекст, возвращающий текстовые рекомендации без прямого доступа к инструментам или файлам.
Удаленные рекомендации, локальный контроль. Оркестратор обвязки сохраняет полномочия по управлению инструментами и отправляет только контекст, утвержденный для эскалации. У советника нет прямого доступа к инструментам, файлам или каналу ответов; он возвращает текстовые рекомендации, которые может использовать локальная модель.

Мы тестируем этот подход на сложных задачах разработки ПО, которые требуют развитых рассуждений и в которых локальная модель чаще всего терпит неудачу. Для этого мы используем Terminal Bench 2.1, популярный бенчмарк из 89 задач для агентов написания кода.

Мы хотим ответить на два вопроса: какую часть разрыва с пограничной моделью может закрыть эскалация к советнику и ценой каких затрат. Запуск полностью локальных моделей практически ничего не стоит, поскольку инференс происходит на оборудовании пользователя. Однако как только модель начинает вызывать советника, возникают расходы на API.

В качестве базовой линии для пограничной производительности мы используем Claude Opus 5 в локальной обвязке; локальная модель — Qwen 3.8 27B. Наконец, мы объединяем их: Qwen 3.8 27B выполняет задачу и при необходимости обращается к советнику Claude Opus 5. Мы не оцениваем эскалацию к советнику с Pi или Hermes, поскольку ни одна из них не предоставляет эквивалентный инструмент советника; добавление такового потребовало бы изменения интерфейса инструментов и логики оркестрации, поэтому результат больше не представлял бы готовую обвязку.

Эскалация к советнику повышает оценку Computer с 59,6% до 73,0% (прирост на 13,5 процентных пункта) при оценочной стоимости API в $0,415 за один запуск. Запуск только Claude Opus 5 достигает 82,4% при стоимости $0,65 за запуск. Таким образом, эскалация компенсирует примерно три пятых разрыва до пограничного уровня примерно при двух третях затрат пограничной модели, и пользователь решает, стоит ли этот компромисс того.

Диаграмма рассеяния оценки Terminal Bench 2.1 в зависимости от стоимости API за один запуск: Qwen 3.8 27B полностью локальная, Qwen 3.8 27B с советником Claude Opus 5 и отдельно Claude Opus 5 — все в обвязке Computer.
Соотношение затрат и производительности в Terminal Bench 2.1 по 89 задачам: балл в зависимости от стоимости API за один запуск. Все точки используют обвязку Computer: Qwen 3.8 27B полностью локальная, Qwen 3.8 27B с эскалацией к советнику Claude Opus 5 и Claude Opus 5 отдельно. Штриховые линии показывают Pi и Hermes, работающие с той же локальной моделью при нулевой стоимости API. Усы — 95-процентные доверительные интервалы на основе бутстрапа задач; незавершенные запуски оцениваются нулем.

Дообучение обвязки и интеллектуальной работы

До сих пор мы оставляли локальную модель неизменной, чтобы изолировать вклад самой обвязки. После разработки обвязки наибольший прирост достигается за счет адаптации самой модели. Данные использования Perplexity Computer показывают, что люди реально делают для интеллектуальной работы, и мы используем их для синтеза обучающих данных. Мы дообучаем локальную модель внутри обвязки Computer, ориентируясь на реальное распределение задач, выполняемых пользователями.

В частности, мы определяем разнообразный набор вариантов использования, задействующих различные возможности модели, инструменты и коннекторы. На основе этих сценариев мы синтезируем реалистичные среды обучения с подкреплением и определяем сложные, но проверяемые задачи: каждая задача состоит из инструкции, среды и верификатора, оценивающего конечный результат, причем средой является контейнер Docker, в котором работает обвязка. Важно отметить, что поскольку задачи являются синтетическими, они не содержат реальных документов или информации пользователя.

Мы используем эти среды для двухэтапного обучения: тонкой настройки с отсеиванием (rejection fine-tuning) с последующим обучением с подкреплением. На первом этапе мы запускаем модель для каждой задачи несколько раз, выбираем лучшие траектории по оценке верификатора и обучаем на них с учителем. Этот этап инициализирует модель под конкретную обвязку и распределение задач. На втором этапе обучение с подкреплением дополнительно дорабатывает модель, делая ее более устойчивой.

Часть задач исключается из обучения и используется для финальной оценки; мы называем этот отложенный набор Local Knowledge Work Bench: 53 задачи, охватывающие семь категорий повседневной интеллектуальной работы — от глубокого исследования до создания документов. Мы скоро опубликуем технический отчет с подробным описанием обучения модели и планируем сделать этот бенчмарк оценки открытым.

Мы дообучили Qwen 3.8 27B с использованием этого подхода, создав модель под названием PPLX 27B, и оценили ее на Local Knowledge Work Bench. С базовой моделью Qwen 3.8 27B Computer достигает наивысшего балла (82,6% против 77,6% у Pi и 74,0% у Hermes) и использует наименьшее количество токенов (520 тыс. против 681 тыс. у Pi и 634 тыс. у Hermes). Pi быстрее всех выполняет задачи — за 176 секунд на задачу по сравнению с 218 секундами для Computer и 292 секундами для Hermes. PPLX 27B повышает балл Computer до 85,4% ценой большего количества токенов (678 тыс. против 520 тыс.). Предполагаемое время выполнения составляет 250 секунд.

Диаграмма рассеяния результатов Local Knowledge Work Bench в зависимости от среднего времени выполнения задачи; PPLX 27B в обвязке Computer достигает наивысшего балла в 85,4%.
Результаты дообучения на Local Knowledge Work Bench: оценка в зависимости от среднего времени выполнения задачи; метки точек показывают обвязку, модель и среднее количество токенов на задачу. PPLX 27B — наша дообученная модель, работающая в Computer. Усы представляют 95-процентные доверительные интервалы по 53 задачам с тремя попытками каждая.

Таблица 2. Категории задач Local Knowledge Work Bench.

Категория

Задачи

Доля

Описание

Глубокое исследование

20

37,7%

Ответы на сложные вопросы, требующие многоэтапного веб-исследования, публичных наборов данных, статистики и проверки источников.

Данные, финансы и закупки

9

17,0%

Очистка наборов данных, сверка записей, аудит расходов, анализ инвестиций, оценка поставщиков и расчет финансовых метрик.

Документы, презентации и дизайн

7

13,2%

Создание качественных PDF-файлов, счетов, материалов для адаптации, сопутствующих материалов для мероприятий и бизнес-презентаций.

Инжиниринг, ИТ и инциденты

5

9,4%

Расследование инцидентов, анализ логов, написание планов восстановления, оценка готовности к релизу и синтез технической документации.

Контракты, доказательства и комплаенс

5

9,4%

Анализ контрактов, проверка доказательств, расследование отзывов продукции, цензурирование конфиденциальных документов и проверка требований соответствия.

Дашборды, ПО и визуализация

4

7,5%

Создание интерактивных дашбордов, образовательных микросайтов, диаграмм и визуализаций проектов.

Люди, проекты и встречи

3

5,7%

Просмотр резюме, консолидация решений встреч и ведение трекеров задач проектов.

Итого

53

100%

Заключение

Наше исследование показывает, что мощная модель с открытым исходным кодом, работающая на производительном локальном оборудовании в сочетании со специально созданной обвязкой, может справляться с реальной интеллектуальной работой при практически нулевой стоимости инференса без необходимости передачи конфиденциальных данных за пределы устройства.

По результатам различных бенчмарков Computer не уступает или превосходит Hermes и Pi по точности при работе с Qwen 3.8 27B на NVIDIA DGX Spark. Среди трех бенчмарков, фиксирующих задержку и использование токенов, Computer показал лучшие результаты по скорости на BrowseComp и ParseBench-100, а также использовал меньше всего токенов во всех трех бенчмарках; Pi оказался самым быстрым на Local Knowledge Work Bench.

Преимущества были достигнуты благодаря принятым нами решениям. Мы создали лаконичную локальную обвязку с навыками, загружаемыми по запросу. Мы преобразовали коннекторы в компактные инструменты командной строки вместо серверов MCP. Для безопасности выполнение было помещено в песочницу.

Результаты также показывают, в чем компактным моделям еще есть куда расти. Например, в сложных задачах написания кода в Terminal Bench 2.1 локальная модель отстает от пограничной модели во всех трех обвязках. Эскалация к советнику сокращает, но не полностью устраняет этот разрыв; для дальнейшего повышения производительности по-прежнему необходимы постоянные улучшения возможностей моделей и локального оборудования.

Цель создания обвязки и модели с учетом локальных ограничений состоит в том, чтобы дать пользователям явный контроль над тем, какая информация покидает их машины. Для пользователя также есть преимущества в стоимости. Мы рассматриваем это как часть более широкой тенденции, в рамках которой все более способные агенты переходят с удаленной инфраструктуры на индивидуальные и локальные устройства. Мы ожидаем, что развитие чипов, моделей и устройств будет постоянно расширять спектр задач интеллектуальной работы, с которыми Portable Computer может справляться локально.