Локални агент за приватан и исплатив рад са знањем

Окружење и модел заједно дизајнирани за локални рад са знањем, који се извршавају на уређају и приступају удаљеним способностима на захтјев.

АуториPerplexity Research

Perplexity Portable Computer је агент који је првенствено усмјерен на локални рад.

Цијели стеку се по подразумијеваној вриједности извршава локално. Модел, хардверско окружење, разговор и путања живе на машини корисника. Рад којем је потребан спољашњи свијет, као што су претрага веба, конектори или ескалација на снажнији савјетодавни модел у облаку, покреће се само када је то неопходно и увијек уз одобрење корисника. Стога осјетљиви подаци никада не напуштају уређај без дозволе, а локални модели немају накнаду за инференцију: систем је приватан и исплатив сам по себи.

Ефикасан локални агент захтијева да модел и хардверско окружење буду дизајнирани заједно. Хардверска окружења опште намјене подразумијевају модел границе који може да апсорбује дугачке контексте, управља широком површином алата и планира у дугим хоризонтима. Локални модели су мање поуздани под тим захтјевима. Умјесто да тражимо од малог модела да управља окружењем направљеним за великог, обликовали смо их једно око другог: окружење прилагођено профилу способности модела и модел накнадно обучен да ефикасно користи то окружење.

Увод

Способности агената су посљедњих мјесеци брзо напредовале у широком спектру задатака везаних за рад са знањем. Иако ова напредовања доносе велике добитке у продуктивности и ефикасности, она такође постављају два изазова.

Потрошња токена брзо расте, а са њом и укупни трошкови. Када се интелигенцији приступа преко АПИ-ја затворених модела који се извршавају на удаљеним кластерима, приватне информације и интелектуална својина напуштају уређај корисника са сваким захтјевом. Како агенти скалирају кроз појединачне токове рада и читаве организације, потрошња токена и кретање података постају све тежи за управљање.

Истовремено, модели отвореног кода су се побољшали још бржом стопом. Напредак је највидљивији у веома малим и ефикасним моделима као што су NVIDIA Nemotron 3.5 Lightning (укупно 30 милијарди параметара), Qwen 3.6 (35B) и Qwen 3.8 (27B). Ови мали модели пружају резултате изнад своје категорије и сада су способни за сложене токове рада са агентима. Хардвер за локалну инференцију напредује паралелно: системи као што је NVIDIA DGX Spark сада могу локално да извршавају ове моделе. Заједно ови трендови чине потпуни рад на уређају практичним док омогућавају корисницима да се укључе у спољне способности када је то потребно, као што су претрага веба, конектори или ескалација модела у облаку.

Овај приступ који је првенствено усмјерен на локални рад омогућава значајне уштеде трошкова, пошто локална инференција избјегава АПИ накнаде по токену. Он такође природно рјешава питања приватности и интелектуалне својине: приватни токени никада не морају бити пренесени на удаљене кластере и остају безбедни у границама локалног уређаја.

У јуну смо представили први хибридни оркестратор локалне инференције на серверу који одлучује који посао треба да се извршава на уређају, а који посао треба да иде агентима у облаку. Овдје објашњавамо како смо изградили такав локални агент, укључујући хардверско окружење и моделе ко-оптимизоване један за други.

Дајемо преглед кључних избора дизајна, вреднујемо Computer у односу на популарна хардверска окружења опште намјене отвореног кода (Hermes и Pi) кроз три јавна бенчмарка и наш интерни бенчмарк за локални рад са знањем (Local Knowledge Work Bench). На нашем бенчмарку, са моделом Qwen 3.8 27B који се извршава на NVIDIA DGX Spark-у, Computer постиже највиши резултат, 82,6% у поређењу са 77,6% за Pi и 74,0% за Hermes. PPLX 27B, наш модел накнадно обучен на врху модела Qwen 3.8 27B, додатно подиже резултат на 85,4%.

Тракасти графикон резултата бенчмарка Local Knowledge Work Bench: окружења Computer, Pi и Hermes са моделом Qwen 3.8 27B, и Computer са PPLX 27B, који постиже највиши резултат од 85,4%.
Резултати на бенчмарку Local Knowledge Work Bench, нашем бенчмарку од 53 репрезентативна задатка рада са знањем. Свака трака представља комбинацију окружења и модела која се извршава на NVIDIA DGX Spark-у; PPLX 27B је наш накнадно обучени модел. Три покушаја по задатку; цртице представљају 95% интервале повјерења.

Дизајнирајте хардверско окружење око локалног модела

Иако су компактни модели на уређају већ прилично способни, они и даље заостају за већим моделима границе у перформансама. Пажљиво дизајнирано окружење је неопходно да би се ови модели ефикасно усмјеравали и да би се ријешила њихова ограничења.

Популарна хардверска окружења отвореног кода као што су Pi и Hermes показала су се као општа: добро раде са широким спектром модела различитих величина и класа. Али они нису оптимизовани за могућности модела на уређају. Дизајнирали смо локално окружење посебно за ово окружење, око неколико кључних принципа.

Ефикасност контекста

Главни фокус у дизајнирању нашег окружења био је да се на најбољи начин искористи контекст модела.

Иако модели на уређају као што је Qwen 3.8 27B нуде прозоре контекста од 260K токена, емпиријски смо утврдили да почињу да се муче преко 100K токена. Због тога језгро окружења одржавамо језгровитим: минимални системски упит и мали скуп основних алата.

Све остале способности су модуларизоване у вјештине на захтјев које се учитавају и уклањају током цијеле путање. Дизајнирали смо ове вјештине за уобичајене задатке рада са знањем: истраживање, науку о подацима, визуализацију података, креирање докумената, софтверско инжењерство и још много тога.

Окружење такође подржава сажимање контекста, сумирајући застарели контекст када путања постане дугачка како би модел остао у оквиру свог ефикасног прозора.

Конектори као алати командне линије

Свакодневни рад са знањем често захтијева конекторе као што су Gmail, GitHub, Outlook и Google Calendar. Они су обично изложени окружењу као MCP сервери, чије велике дефиниције алата троше значајан дио контекста. Умјесто тога, конвертовали смо најкоришћеније MCP сервере у компактне алате командне линије лаке за коришћење, допуњене прилагођеним вјештинама које много боље користе ограничени ефективни контекст.

Самопровјера

Перформансе се такође побољшавају када агент самостално провјери свој рад. Провјера додаје додатне кораке, али значајно побољшава коначне резултате и значајно смањује јаз до модела границе. Може је покренути сам модел или скуп кука (hooks) које надгледају здравље путање и захтијевају самопровјеру када нешто крене наопако.

Извршавање у сандбок окружењу

Окружење извршава алате у сандбок окружењу на нивоу оперативног система на уређају корисника. Граница ограничава процесе, путање фајл система и мрежни приступ у складу са политиком. Ово ограничава радијус удара погрешне команде. Ако сандбок окружење није доступно, окружење се самоонемогућава прије било каквих позива алата умјесто да пређе на извршавање без сандбок окружења.

Ово се разликује од окружења отвореног кода као што су Pi и Hermes, који по подразумијеваној вриједности извршавају команде директно са дозволама корисника. У Computer-у је изолација увијек укључена, не захтијева никакву конфигурацију и алати не могу да се извршавају без ње.

Дијаграм испод приказује како се ови принципи уклапају у петљу извршавања. Оркестратор је детерминистички код окружења, а не језички модел (LLM): он одржава петљу, саставља контекст и примјењује политику. Локални модел предлаже сљедећу акцију; оркестратор извршава одобрене позиве алата у сандбок окружењу и враћа њихове резултате моделу. Претрага веба, конектори и позиви савјетнику прелазе границу уређаја само када су омогућени и одобрени.

Дијаграм петље извршавања локалног окружења: детерминистички код оркестратора саставља контекст и извршава алате у сандбок окружењу, локални модел предлаже акције, а услуге ван уређаја су опционе и контролисане од стране корисника.
Како локално окружење извршава задатак. Детерминистички код окружења контролише петљу и алате у сандбок окружењу; локални модел предлаже акције. Услуге ван уређаја су опционе и контролисане од стране корисника.

Локално окружење извлачи више из истог модела

Користећи исти основни модел на уређају, поредимо наше локално окружење са алтернативама опште намјене на веб истраживању и мултимодалном разумјевању докумената. Сва окружења користе модел Qwen 3.8 27B са средњим расуђивањем, који се извршава на NVIDIA DGX Spark-у. Ово поређење изоловује способности које доприноси само окружење, прије било какве накнадне обуке модела.

Фокусирамо се на ове двије способности зато што рад са знањем често комбинује приватне документе на уређају корисника са јавним информацијама са веба ради производње утемељеног артефакта. Претрага веба захтијева повезаност, али инференција модела и обрада приватних докумената остају локални. Локални фајлови служе као мјеродавни извор, јавни извори додају контекст, а корисници могу потпуно онемогућити претрагу веба за рад који је у потпуности ван мреже.

Веб истраживање

Градимо наше локално окружење заједно са претраживачем компаније Perplexity, који је постигао врхунске рангове у независним оцјенама</g1. Окружењу му приступа преко интерфејса Search as Code.

Вреднујемо квалитет истраживања на 1.266 BrowseComp задатака. Computer користи инфраструктуру претраге компаније Perplexity заједно са нашим локалним окружењем, док се Pi и Hermes ослањају на Brave, свог препорученог добављача претраге. Computer достигавши 66,7% тачности, у поређењу са 50,2% за Pi и 43,9% за Hermes.

Computer такође има најкраће просјечно забиљежено стварно вријеме и потрошњу токена: 402,1 секунди и 852 хиљада токена по задатку, у поређењу са 1.020,9 секунди и 1,01 милион токена за Hermes, и 826,0 секунди и 2,82 милиона токена за Pi. Computer стога користи 61% мање стварног времена и 16% мање токена од Hermes-а, и 51% мање стварног времена и 70% мање токена од Pi-ја.

Дијаграм расејања резултата BrowseComp у односу на просјечно стварно вријеме по задатку за Computer, Hermes и Pi са моделом Qwen 3.8 27B; Computer достиже највиши резултат са најмање времена и најмање токена.
Резултати BrowseComp са моделом Qwen 3.8 27B на уређају: резултат у односу на просјечно стварно вријеме по задатку за окружења Computer, Hermes и Pi; ознаке тачака приказују просјечан број токена по задатку. Непотпуни исходи носе нула бодова, а просјеци времена и токена искључују покретања без забиљежених мјерења. Цртице представљају 95% Wilson интервале повјерења за резултат.

Мултимодално разумјевање докумената на уређају

Многи документи носе информације визуелно и тешко их је парсирати као обичан текст: PDF фајлови, скениране странице, снимци екрана, графикони и презентације. Ови токови рада зависе од OCR-а и разумјевања слика, и највише имају koristi од изворно мултимодалног модела.

Окружење прослеђује странице докумената и слике директно моделу, који их разумије и комбинује визуелне доказе са екстрахованим текстом. Обрада ових фајлова на уређају чува осјетљиве документе и њихов екстраховани садржај приватним.

Вреднујемо мултимодално разумјевање докумената на ParseBench-100, подскупу од 100 задатака бенчмарка ParseBench, са по 20 задатака за графиконе, распоред, табеле, садржај текста и форматирање.

Computer достиже просјечан резултат од 65,1%, у поређењу са 34,6% за Hermes и 13,9% за Pi. Он такође завршава задатке са најмање времена и најмање токена: у просјеку 60,6 секунди и 20,1 хиљада токена по задатку, у поређењу са 108,3 секунди и 32,1 хиљада токена за Hermes, и 410,5 секунди и 829,1 хиљада токена за Pi. Computer води у свих пет категорија докумената, са својом највећом предношћу на графиконима. Распоред остаје тежак за сва три окружења.

Дијаграм расејања OCR резултата ParseBench-100 у односу на просјечно стварно вријеме по задатку за Computer, Hermes и Pi са моделом Qwen 3.8 27B; Computer достиже највиши резултат са најмање времена и најмање токена.
OCR резултати ParseBench-100 са моделом Qwen 3.8 27B на уређају: резултат у односу на просјечно стварно вријеме по задатку за окружења Computer, Hermes и Pi; ознаке тачака приказују просјечан број токена по задатку. Просјеци токена користе покретања са забиљеженим мјерењима. Цртице представљају 95% интервале повјерења.

Табела 1. Просјечан резултат ParseBench-100 по категорији документа за окружења Computer, Hermes и Pi са моделом Qwen 3.8 27B на уређају. Computer води у свих пет категорија.

Окружење

Графикон

Распоред

Табела

Садржај текста

Форматирање

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Смањење јаза до границе помоћу ескалације савјетнику

Чак и са пажљиво дизајнираним окружењем, најтежи задаци и даље превазилазе способности компактног модела на уређају. За такве задатке, окружење излаже алат савјетника: локални модел може да се консултује са јачим моделом границе када му је потребна помоћ око планирања, рјешавања нејасноћа, опоравка од поновљених неуспјеха или провјере коначног резултата.

Локални модел одлучује када да затражи савјет, док оркестратор окружења задржава ауторитет над алатима и контролише који се контекст шаље. Ескалација је опциона. Корисник одлучује да ли ће је омогућити и да ли ће одобрити сваки позив савјетнику ручно или аутоматски.

Прије позива савјетнику, окружење бира релевантан контекст, примјењује PII класификатор да означи осјетљиве информације и показује кориснику шта би напустило уређај. Савјетник прима само одобрени контекст и враћа текстуалне смјернице; нема директан приступ фајловима, алатима или разговорима уређаја. Ово побољшава и трошкове и приватност, и планирамо да даље истражимо овај смјер у будућем раду.

Дијаграм ескалације савјетнику: оркестратор окружења задржава ауторитет над алатима и шаље само одобрени контекст моделу савјетника, који враћа текстуалне смјернице без директног приступа алатима или фајловима.
Удаљене смјернице, локална контрола. Оркестратор окружења задржава ауторитет над алатима и шаље само контекст одобрен за ескалацију. Савјетник нема директан приступ алатима, фајловима или каналу одговора; он враћа текстуалне смјернице које локални модел може да користи.

Тестирамо овај приступ на изазовним задацима софтверског инжењерства, који захтијевају снажно расуђивање и гдје локални модел најчешће подбацује. За ово користимо Terminal Bench 2.1, популарни бенчмарк од 89 задатака за агенте за програмирање.

Желимо да одговоримо на два питања: колико јаза до модела границе ескалација савјетнику може да смањи, и по коју цијену. Потпуно локални модели коштају практично ништа за рад, пошто се инференција одвија на хардверу корисника. Међутим, када модел почне да позива савјетника, почиње да ствара АПИ трошкове.

Као референтну вриједност за перформансе границе, користимо Claude Opus 5 који ради у локалном окружењу; локални модел је Qwen 3.8 27B. На крају, упарујемо то двоје: Qwen 3.8 27B извршава задатак и ескалира на савјетника Claude Opus 5 када му је потребна помоћ. Не вреднујемо ескалацију савјетнику са Pi или Hermes-ом зато што ниједан не пружа еквивалентан алат савјетника; додавање истог захтијевало би модификовање његове површине алата и логике оркестрације, тако да резултат више не би представљао стандардно окружење.

Ескалација савјетнику подиже резултат Computer-а са 59,6% на 73,0%, што је добитак од 13,5 процентних поена, уз процијењени АПИ трошак од 0,415 долара по покретању. Самостално извршавање Claude Opus 5 достиже 82,4% по цијени од 0,65 долара по покретању. Ескалација тако надокнађује отприлике три петине јаза до границе по отприлике двије трећине цијене границе, а корисник одлучује када је та размјена вриједна труда.

Дијаграм расејања резултата Terminal Bench 2.1 у односу на АПИ трошак по покретању: Qwen 3.8 27B потпуно локални, Qwen 3.8 27B са савјетником Claude Opus 5, и самостални Claude Opus 5, сви у окружењу Computer.
Однос цијене и перформанси за Terminal Bench 2.1 на 89 задатака: резултат у односу на АПИ трошак по покретању. Све тачке користе окружење Computer: Qwen 3.8 27B потпуно локални, Qwen 3.8 27B који ескалира на савјетника Claude Opus 5, и самостални Claude Opus 5. Испрекидане линије приказују Pi и Hermes како извршавају исти локални модел уз нулте АПИ трошкове. Цртице су 95% интервали повјерења добијени бустрапом задатака; непотпуна покретања носе нула бодова.

Накнадна обука за окружење и рад са знањем

До сада смо задржали локални модел непромијењеним како бисмо изоловали оно што окружење доприноси. Са дизајном окружења на мјесту, највећи преостали добици долазе од прилагођавања самог модела. Подаци о коришћењу Perplexity Computer-а нам показују шта људи заправо раде за рад са знањем, које користимо за синтезу података за обуку. Накнадно обучавамо локални модел у оквиру Computer окружења, вођени стварном расподјелом задатака које корисници обављају.

Конкретно, идентификујемо разноврстан скуп случајева коришћења који користе различите способности модела, алате и конекторе. Из ових случајева коришћења синтетишемо реална окружења за учење са поткрепљењем и дефинишемо изазовне али провјерљиве задатке: сваки задатак се састоји од упутства, окружења и провјеривача који оцјењује коначни резултат, при чему је окружење Docker контејнер у којем окружење ради. Важно је да, пошто су задаци синтентички, они не садрже праве документе или информације о кориснику.

Користимо ова окружења за двостепену обуку: фино подешавање одбацивањем праћено учењем са поткрепљењем. У првој фази, покрећемо модел за сваки задатак више пута, бирамо најбоље путање према оцјени провјеривача и обучавамо их уз надгледано учење. Ова фаза иницијализује модел за специфично окружење и расподјелу задатака. У другој фази, учење са поткрепљењем даље фино подешава модел, чинећи га робуснијим.

Подскуп задатака се издваја из обуке и користи се за коначну оцјену; овај издвојени скуп називамо Local Knowledge Work Bench: 53 задатка која обухватају седам категорија свакодневног рада са знањем, од дубинског истраживања до креирања докумената. Ускоро ћемо објавити технички извештај који детаљно описује обуку модела, и планирамо да овај бенчмарк за оцјену учинимо отвореног кода.

Накнадно смо обучили Qwen 3.8 27B са овим приступом, производећи модел који називамо PPLX 27B, и вредновали смо га на бенчмарку Local Knowledge Work Bench. Са основним моделом Qwen 3.8 27B, Computer постиже највиши резултат (82,6%, у поређењу са 77,6% за Pi и 74,0% за Hermes) и користи најмање токена (520 хиљада, у поређењу са 681 хиљада за Pi и 634 хиљада за Hermes). Pi завршава задатке најбрже са 176 секунди по задатку, у поређењу са 218 секунди за Computer и 292 секунди за Hermes. PPLX 27B подиже резултат Computer-а на 85,4%, по цијену више токена (678 хиљада у поређењу са 520 хиљада). Његово процијењено стварно вријеме је 250 секунди.

Дијаграм расејања резултата бенчмарка Local Knowledge Work Bench у односу на просјечно стварно вријеме по задатку; PPLX 27B који се извршава у окружењу Computer достиже највиши резултат од 85,4%.
Резултати накнадне обуке на бенчмарку Local Knowledge Work Bench: резултат у односу на просјечно стварно вријеме по задатку; ознаке тачака приказују окружење, модел и просјечан број токена по задатку. PPLX 27B је наш накнадно обучени модел, који се извршава у окружењу Computer. Цртице представљају 95% интервале повјерења на 53 задатка са три покушаја сваки.

Табела 2. Категорије задатака бенчмарка Local Knowledge Work Bench.

Категорија

Задаци

Удјео

Опис

Дубински истраживање

20

37,7%

Одговорите на сложена питања која захтијевају веб истраживање са више скокова, јавне скупове података, статистику и провјеру извора.

Подаци, финансије и набавка

9

17,0%

Очистите скупове података, ускладите евиденције, ревидирајте трошкове, анализирајте инвестиције, оцијените добављаче и израчунајте финансијске показатеље.

Документи, презентације и дизајн

7

13,2%

Произведите дотеране PDF фајлове, фактуре, материјале за увођење у посао, промотивни материјал за догађаје и пословне презентације.

Инжењерство, ИТ и инциденти

5

9,4%

Истражите инциденте, анализирајте евиденције, напишите планове опоравка, оцијените спремност за пуштање у рад и синтетишите техничку документацију.

Уговори, докази и усклађеност

5

9,4%

Прегледајте уговоре, прегледајте доказе, истражите опозиве, редигујте осјетљиве документе и провјерите захтјеве усклађености.

Контролне табле, софтвер и визуализација

4

7,5%

Изградите интерактивне контролне табле, образовне микросајтове, графиконе и визуализације пројеката.

Људи, пројекти и састанци

3

5,7%

Прегледајте биографије, консолидујте одлуке са састанака и одржавајте праћење активности пројекта.

Укупно

53

100%

Закључак

Наше истраживање показује да снажан модел отвореног кода, са способним локалним хардвером и окружењем направљеним за њих, може да се носи са стварним радом са знањем уз цијену инференције блиску нули без потребе да осјетљиви подаци напусте уређај.

Кроз различите бенчмарке, Computer се подударао са Hermes-ом и Pi-јем или их је премашио у тачности док је извршавао Qwen 3.8 27B на NVIDIA DGX Spark-у. Међу три бенчмарка који извештавају о кашњењу и потрошњи токена, Computer је био најбржи на BrowseComp и ParseBench-100 и користио је најмање токена на сва три; Pi је био најбржи на бенчмарку Local Knowledge Work Bench.

Добици су дошли од избора које смо направили. Изградили смо језгровито локално окружење са вјештинама које се учитавају на захтјев. Конвертовали смо конекторе у компактне CLI алате умјесто MCP сервера. Извршавање је било у сандбок окружењу ради безбједности.

Резултати такође показују гдје компактни модели имају простора за побољшање. На примјер, на изазовним задацима програмирања у Terminal Bench 2.1, локални модел заостаје за моделом границе кроз сва три окружења. Ескалација савјетнику сужава али не затвара у потпуности јаз; континуирана побољшања у способностима модела и локалном хардверу су и даље неопходна да би се перформансе помериле даље.

Сврха изградње хардверског окружења и модела за локална ограничења је да се корисницима да експлицитна контрола над тим које информације напуштају њихове машине. Постоје и финансијске бенефиције за корисника. Ми ово видимо као дио шире промјене у којој све способнији агенти прелазе са удаљене инфраструктуре на појединачне и локалне уређаје. Очекујемо да ће напредак у чиповима, моделима и уређајима континуирано проширивати опсег и квалитет рада са знањем који Portable Computer обрађује локално.