Агент с приоритет локално изпълнение за поверителна и рентабилна познавателна работа
Каркас и модел, съвместно проектирани за локална познавателна работа, работещи на устройството и достъпващи отдалечени възможности при поискване.
Perplexity Portable Computer е агент с приоритет локално изпълнение.
Цялата структура работи локално по подразбиране. Моделът, каркасът, разговорът и траекторията се намират на машината на потребителя. Работата, която се нуждае от външния свят – като уеб търсене, конектори или ескалация към по-мощен модел съветник в облака – се извиква само когато е необходимо и винаги се контролира от потребителя. По този начин чувствителните данни никога не напускат устройството без разрешение, а локалните модели нямат такса за инференция: системата е проектирана така, че да бъде поверителна и рентабилна.
Ефективният агент с приоритет локално изпълнение изисква моделът и каркасът да бъдат проектирани съвместно. Универсалните каркаси предполагат модерен модел, който може да поема дълги контексти, да навигира в голяма повърхност от инструменти и да планира в дългосрочен план. Локалните модели са по-малко надеждни при тези изисквания. Вместо да изискваме малък модел да управлява каркас, създаден за голям, ние съобразихме двете части една с друга: каркас, съобразен с профила на възможностите на модела, и модел, допълнително обучен да използва този каркас ефективно.
Въведение
Възможностите за агенти напреднаха бързо през последните месеци в широк спектър от задачи, свързани с познавателна работа. Въпреки че тези постижения носят големи ползи по отношение на продуктивността и ефективността, те поставят и две предизвикателства.
Консумацията на токени нараства бързо, а с нея и общите разходи. Когато интелигентността се достъпва през API на затворени модели, работещи в отдалечени клъстери, личната информация и интелектуалната собственост напускат устройството на потребителя при всяка заявка. С мащабирането на агентите в рамките на отделни работни процеси и цели организации, разходите за токени и движението на данни стават все по-трудни за управление.
В същото време моделите с отворен код се подобриха с още по-бързи темпове. Напредъкът е най-видим при много малките и ефективни модели като NVIDIA Nemotron 3.5 Lightning (30 милиарда общи параметри), Qwen 3.6 (35 милиарда) и Qwen 3.8 (27 милиарда). Тези малки модели показват резултати над очакванията за теглото си и вече са способни на сложни работни процеси с агенти. Хардуерът за локална инференция се развива паралелно: системи като NVIDIA DGX Spark вече могат да изпълняват тези модели локално. В комбинация тези тенденции правят напълно устройството-базираната операция практична, като същевременно позволяват на потребителите да се включат към външни възможности при нужда, като уеб търсене, конектори или ескалация към облачен модел.
Този подход с приоритет локално изпълнение позволява значителни икономии на разходи, тъй като локалната инференция избягва API таксите на база токени. Той също така естествено разрешава проблемите с поверителността и интелектуалната собственост: личните токени никога не трябва да се предават към отдалечени клъстери и остават сигурно в границите на локалното устройство.
През юни представихме първия хибриден локално-сървърен оркестратор за инференция, който решава коя работа трябва да се изпълнява на устройството и коя да отиде при агентите в облака. Тук обясняваме как изградихме такъв агент с приоритет локално изпълнение, включително каркаса и съвместно оптимизираните за целта модели.
Даваме общ преглед на ключовите дизайнерски решения, като оценяваме Computer спрямо популярни универсални каркаси с отворен код (Hermes и Pi) в три публични бенчмарка и нашия вътрешен Local Knowledge Work Bench. На нашия бенчмарк, с модела Qwen 3.8 27B, работещ на NVIDIA DGX Spark, Computer постига най-висок резултат – 82.6%, в сравнение със 77.6% за Pi и 74.0% за Hermes. PPLX 27B, нашият модел, допълнително обучен върху Qwen 3.8 27B, повишава резултата още повече до 85.4%.
Проектиране на каркаса около локалния модел
Въпреки че компактните модели на устройството вече са доста способни, те все още отстъпват на по-големите модерни модели по производителност. Необходим е внимателно проектиран каркас за ефективно насочване на тези модели и преодоляване на техните ограничения.
Популярните каркаси с отворен код като Pi и Hermes са се доказали като универсални: те работят добре с голямо разнообразие от модели с различни размери и класове. Но те не са оптимизирани за възможностите на моделите, работещи на устройството. Проектирахме локалния каркас специално за тази среда, около няколко ключови принципа.
Контекстна ефективност
Основният фокус при проектирането на нашия каркас беше да се извлече максимална полза от контекста на модела.
Въпреки че моделите на устройството като Qwen 3.8 27B предлагат контекстни прозорци от 260K токена, емпирично установихме, че те започват да изпитват затруднения след 100K токена. Затова поддържаме основния каркас кратък и ясен: минимална системна инструкция и малък набор от основни инструменти.
Всички останали възможности са модуларизирани в умения при поискване, които се зареждат и освобождават през цялата траектория. Проектирахме тези умения за често срещани задачи за познавателна работа: проучване, наука за данните, визуализация на данни, създаване на документи, софтуерно инженерство и др.
Каркасът също така поддържа компресия на контекста, като обобщава остарелия контекст, когато траекторията стане дълга, така че моделът да остане в рамките на ефективния си прозорец.
Конектори като инструменти за командния ред
Ежедневната познавателна работа често изисква конектори като Gmail, GitHub, Outlook и Google Calendar. Те обикновено се предоставят на каркаса като MCP сървъри, чиито големи дефиниции на инструменти заемат значителен дял от контекста. Вместо това превърнахме най-използваните MCP в компактни и лесни за използване инструменти за командния ред, допълнени с персонализирани умения, които оползотворяват много по-добре ограничения ефективен контекст.
Самопроверка
Производителността също се подобрява, когато агентът проверява собствената си работа. Проверката добавя допълнителни стъпки, но значително подобрява крайните резултати и съществено намалява разликата спрямо модерните модели. Тя може да бъде задействана от самия модел или от набор от хукове, които следять здравето на траекторията и изискват самопроверка, когато нещо се обърка.
Изпълнение в пясъчна кутия
Каркасът изпълнява инструменти в пясъчна кутия на ниво ОС на устройството на потребителя. Границата ограничава процесите, пътищата към файловата система и мрежовия достъп според правилата. Това ограничава радиуса на поражение при погрешна команда. Ако пясъчната кутия е недостъпна, каркасът се деактивира преди всяко извикване на инструмент, вместо да преминава към изпълнение извън пясъчна кутия.
Това се различава от каркасите с отворен код като Pi и Hermes, които изпълняват команди директно с разрешенията на потребителя по подразбиране. В Computer изолацията е винаги включена, не изисква конфигурация и инструментите не могат да работят без нея.
Диаграмата по-долу показва как тези принципи се съчетават в цикъла на изпълнение. Оркестраторът е детерминиран код на каркас, а не езиков модел (LLM): той поддържа цикъла, сглобява контекста и налага правилата. Локалният модел предлага следващото действие; оркестраторът изпълнява одобрените извиквания на инструменти в пясъчната кутия и връща резултатите им на модела. Уеб търсенето, конекторите и извикванията на съветник преминават границата на устройството само когато са активирани и одобрени.
Локалният каркас извлича повече от същия модел
Използвайки същия базисен модел на устройството, сравняваме нашия локален каркас с универсални алтернативи по отношение на уеб проучванията и мултимодалното разбиране на документи. Всички каркаси използват модела Qwen 3.8 27B със средно ниво на разсъждения, работещ на NVIDIA DGX Spark. Това сравнение изолира възможностите, принесени от самия каркас, преди всякакво допълнително обучение на модела.
Фокусираме се върху тези две възможности, защото познавателната работа често съчетава лични документи на устройството на потребителя с публична информация от уеб пространството, за да се създаде обоснован артефакт. Уеб търсенето изисква свързаност, но инференцията на модела и обработката на лични документи остават локални. Локалните файлове служат като авторитетен източник, публичните източници добавт контекст, а потребителите могат да изключат уеб търсенето напълно за работа в напълно офлайн режим.
Уеб проучване
Изграждаме нашия локален каркас заедно с търсачката на Perplexity, която постига челни места в независими оценки. Каркасът осъществява достъп до нея чрез интерфейса Search as Code.
Оценяваме качеството на проучванията върху 1266 задачи BrowseComp. Computer използва инфраструктурата за търсене на Perplexity заедно с нашия локален каркас, докато Pi и Hermes разчитат на Brave – препоръчвания от тях доставчик на търсене. Computer достига 66.7% точност в сравнение с 50.2% за Pi и 43.9% за Hermes.
Computer има и най-ниското средно отчетено реално време и използване на токени: 402.1 секунди и 852k токена на задача, в сравнение с 1020.9 секунди и 1.01 милиона токена за Hermes и 826.0 секунди и 2.82 милиона токена за Pi. Следователно Computer използва 61% по-малко реално време и 16% по-малко токени от Hermes, както и 51% по-малко реално време и 70% по-малко токени от Pi.
Мултимодално разбиране на документи на устройството
Много документи носят информация визуално и се анализират трудно като обикновен текст: PDF файлове, сканирани страници, екранни снимки, диаграми и презентации. Тези работни процеси зависят от OCR и разбиране на изображения и се възползват най-много от нативно мултимодален модел.
Каркасът подава страници на документи и изображения директно на модела, който ги разбира и съчетава визуалните доказателства с извлечения текст. Обработката на тези файлове на устройството запазва поверителността на чувствителните документи и тяхното извлечено съдържание.
Оценяваме мултимодалното разбиране на документи на ParseBench-100 – подмножество от 100 задачи от бенчмарка ParseBench, с по 20 задачи за диаграми, оформление (layout), таблици, текстово съдържание и форматиране.
Computer достига среден резултат от 65.1%, в сравнение с 34.6% за Hermes и 13.9% за Pi. Той също така завършва задачите с най-малко време и най-малко токени: средно 60.6 секунди и 20.1k токена на задача, спрямо 108.3 секунди и 32.1k токена за Hermes и 410.5 секунди и 829.1k токена за Pi. Computer води във всички пет категории документи, като най-голямо е предимството му при диаграмите. Оформлението остава трудно за всички три каркаса.
Таблица 1. Среден резултат по категории документи за каркасите Computer, Hermes и Pi с модела Qwen 3.8 27B на устройството. Computer води и в петте категории.
Каркас | Диаграма | Оформление | Таблица | Текстово съдържание | Форматиране |
Computer | 76.5% | 16.2% | 72.7% | 87.9% | 72.4% |
Hermes | 29.3% | 2.9% | 44.1% | 61.5% | 35.2% |
Pi | 2.5% | 0.1% | 11.0% | 29.7% | 26.1% |
Намаляване на разликата с модерните модели чрез ескалация към съветник
Дори с внимателно проектиран каркас, най-трудните задачи все още надхвърлят възможностите на компактния модел на устройството. За такива задачи каркасът предоставя инструмент съветник: локалният модел може да се консултира с по-мощен модел, когато се нуждае от помощ при планиране, разрешаване на двусмислия, възстановяване от повтарящи се грешки или проверка на крайния резултат.
Локалният модел решава кога да поиска съвет, докато оркестраторът на каркаса запазва правото върху инструментите и контролира какъв контекст се изпраща. Ескалацията е опционална. Потребителят решава дали да я активира и дали да одобрява всяко извикване на съветник ръчно или автоматично.
Преди извикване на съветник каркасът избира съответния контекст, прилага PII класификатор за маркиране на чувствителна информация и показва на потребителя какво би напуснало устройството. Съветникът получава само одобрения контекст и връща текстови насоки; той няма директен достъп до файловете, инструментите или разговорите на устройството. Това подобрява както разходите, така и поверителността, и планираме да проучим тази посока допълнително в бъдеща работа.
Тестваме този подход върху предизвикателни задачи по софтуерно инженерство, които изискват силни разсъждения и при които локалният модел най-често се затруднява. За целта използваме Terminal Bench 2.1 – популярен бенчмарк с 89 задачи за агенти за програмиране.
Искаме да отговорим на два въпроса: каква част от разликата спрямо модерен модел може да заличи ескалацията към съветник и на каква цена. Напълно локалните модели не струват почти нищо за изпълнение, тъй като инференцията се случва върху хардуера на потребителя. Въпреки това, щом моделът започне да извиква съветника, той започва да трупа разходи за API.
Като базова линия за производителността на модерните модели използваме Claude Opus 5, работещ в локалния каркас; локалният модел е Qwen 3.8 27B. И накрая, съчетаваме двете: Qwen 3.8 27B изпълнява задачата и ескалира към съветник Claude Opus 5, когато се нуждае от помощ. Не оценяваме ескалацията към съветник с Pi или Hermes, тъй като нито един от тях не предоставя еквивалентен инструмент съветник; добавянето на такъв би изисквало модифициране на повърхността му за инструменти и логиката на оркестрация, така че резултатът вече няма да представлява стандартен готов каркас.
Ескалацията към съветник повишава резултата на Computer от 59.6% на 73.0%, което е ръст от 13.5 процентни пункта, при прогнозна цена на API от $0.415 на стартиране. Самостоятелното изпълнение на Claude Opus 5 достига 82.4% при $0.65 на стартиране. По този начин ескалацията възстановява приблизително три пети от разликата до съвременните модели на около две трети от тяхната цена, а потребителят решава кога си струва да направи тази сделка.
Допълнително обучение за каркаса и познавателната работа
Дотук запазихме локалния модел непроменен, за да изолираме приноса на каркаса. След като дизайнът на каркаса е налице, най-големите оставащи подобрения идват от адаптирането на самия модел. Данните за използването на Perplexity Computer ни показват какво реално правят хората за познавателна работа, които използваме за синтезиране на тренировъчни данни. Допълнително обучаваме локалния модел в рамките на каркаса на Computer, водени от реалното разпределение на задачите, които потребителите изпълняват.
Конкретно идентифицираме разнообразен набор от случаи на употреба, които упражняват различни възможности на модела, инструменти и конектори. От тези случаи на употреба синтезираме реалистични среди за обучение с подсилване и дефинираме предизвикателни, но проверими задачи: всяка задача се състои от инструкция, среда и верификатор, който оценява крайния резултат, като средата е Docker контейнер, в който работи каркасът. Важно е да се отбележи, че тъй като задачите са синтетични, те не съдържат реални документи или потребителска информация.
Използваме тези среди за двуетапно обучение: фино настройване чрез отхвърляне (rejection fine-tuning), последвано от обучение с подсилване. В първия етап пускаме модела срещу всяка задача няколко пъти, избираме най-добрите траектории според оценката на верификатора и го обучаваме с учител (supervised learning). Този етап инициализира модела за конкретния каркас и разпределение на задачите. Във втория етап обучението с подсилване доусъвършенства модела, като го прави по-устойчив.
Подмножество от задачи е запазено извън обучението и се използва за крайна оценка; наричаме този отделен набор Local Knowledge Work Bench: 53 задачи, обхващащи седем категории ежедневна познавателна работа – от задълбочено проучване до създаване на документи. Скоро ще публикуваме технически отчет, описващ подробно обучението на модела, и планираме да направим този бенчмарк за оценка с отворен код.
Допълнително обучихме Qwen 3.8 27B с този подход, създавайки модел, който наричаме PPLX 27B, и го оценихме на Local Knowledge Work Bench. С базовия модел Qwen 3.8 27B Computer постига най-висок резултат (82.6%, в сравнение със 77.6% за Pi и 74.0% за Hermes) и използва най-малко токени (520k спрямо 681k за Pi и 634k за Hermes). Pi завършва задачите най-бързо за 176 секунди на задача, спрямо 218 секунди за Computer и 292 секунди за Hermes. PPLX 27B повишава резултата на Computer до 85.4%, с цената на повече токени (678k срещу 520k). Неговото прогнозно реално време е 250 секунди.
Таблица 2. Категории задачи в Local Knowledge Work Bench.
Категория | Задачи | Дял | Описание |
Задълбочено проучване | 20 | 37.7% | Отговор на сложни въпроси, изискващи уеб проучване в множество стъпки, публични набори от данни, статистика и проверка на източниците. |
Данни, финанси и доставки | 9 | 17.0% | Почистване на набори от данни, съгласуване на записи, одитиране на разходи, анализ на инвестиции, оценка на доставчици и изчисляване на финансови показатели. |
Документи, презентации и дизайн | 7 | 13.2% | Създаване на изпипани PDF файлове, фактури, материали за въвеждане на нови служители, събитийни материали и бизнес презентации. |
Инженеринг, ИТ и инциденти | 5 | 9.4% | Разслідване на инциденти, анализ на логове, писане на планове за възстановяване, оценка на готовността за пускане и синтезиране на техническа документация. |
Договори, доказателства и съответствие | 5 | 9.4% | Преглед на договори, преглед на доказателства, разследване на изтегляния на продукти от пазара, заличаване на чувствителна информация в документи и проверка на изискванията за съответствие. |
Табла за управление, софтуер и визуализация | 4 | 7.5% | Изграждане на интерактивни табла за управление, образователни минисайтове, диаграми и проектни визуализации. |
Хора, проекти и срещи | 3 | 5.7% | Преглед на автобиографии, консолидиране на решения от срещи и поддържане на тракери за действия по проекти. |
Общо | 53 | 100% |
Заключение
Нашето проучване показва, че силен модел с отворен код, с способен локален хардуер и каркас, изграден за тях, може да се справи с реална познавателна работа при почти нулеви разходи за инференция, без да изисква чувствителни данни да напускат устройството.
В различните бенчмаркове Computer съответства или надминава Hermes и Pi по точност, докато изпълнява Qwen 3.8 27B на NVIDIA DGX Spark. Сред трите бенчмарка, които отчитат латентност и използване на токени, Computer беше най-бърз при BrowseComp и ParseBench-100 и използва най-малко токени и за трите; Pi беше най-бърз на Local Knowledge Work Bench.
Ползите дойдоха от изборите, които направихме. Изградихме кратък локален каркас с умения, които се зареждат при поискване. Превърнахме конекторите в компактни CLI инструменти вместо MCP сървъри. Изпълнението беше поставено в пясъчна кутия с цел сигурност.
Резултатите също така показват къде компактните модели имат място за подобрение. Например при предизвикателните задачи по програмиране в Terminal Bench 2.1 локалният модел отстъпва на съвременния модел във всичките три каркаса. Ескалацията към съветник тесно стеснява, но не затваря напълно разликата; все още са необходими непрекъснати подобрения във възможностите на моделите и локалния хардуер, за да се тласне производителността още напред.
Целта на изграждането на каркаса и модела за локални ограничения е да се даде на потребителите изричен контрол върху това коя информация напуска техните машини. Има и ползи за разходите на потребителя. Възприемаме това като част от по-широка промяна, при която все по-способни агенти се преместват от отдалечената инфраструктура към индивидуални и локални устройства. Очакваме, че напредъкът при чиповете, моделите и устройствата постоянно ще разширява обхвата и качеството на познавателната работа, с която Portable Computer се справя локално.