Lokálne orientovaný agent pre súkromnú a cenovo výhodnú prácu s vedomosťami
Rámec a model spoločne navrhnuté pre lokálnu prácu s vedomosťami, ktoré bežia v zariadení a podľa potreby pristupujú k vzdialeným funkciám.
Perplexity Portable Computer je lokálne orientovaný agent.
Celý zásobník štandardne beží lokálne. Model, rámec, konverzácia a trajektória – to všetko sídli v zariadení používateľa. Práca, ktorá vyžaduje vonkajší svet, ako je webové vyhľadávanie, konektory alebo eskalácia na silnejší model poradcu v cloude, sa vyvolá iba v prípade potreby a vždy je riadená používateľom. Citlivé údaje preto nikdy neopustia zariadenie bez súhlasu a lokálne modely so sebou nenesú žiadny poplatok za inferenciu: systém je súkromný a nákladovo efektívny už zo svojej podstaty.
Efektívny lokálne orientovaný agent vyžaduje, aby model a rámec boli navrhnuté spoločne. Všeobecné rámce predpokladajú špičkový model, ktorý dokáže spracovať dlhé kontexty, orientovať sa v širokom spektre nástrojov a plánovať vo veľkom horizonte. Lokálne modely sú pri takýchto požiadavkách menej spoľahlivé. Namiesto toho, aby sme od malého modelu chceli, aby spravoval rámec postavený pre veľký model, vytvarovali sme oba okolo seba navzájom: rámec prispôsobený profilu schopností modelu a model dodatočne vyškolený na efektívne používanie tohto rámca.
Úvod
Schopnosti agentov v posledných mesiacoch rýchlo pokročili v širokej škále úloh spojených s prácou s vedomosťami. Hoci tento pokrok prináša veľké prírastky v produktivite a efektivite, predstavuje aj dve výzvy.
Spotreba tokenov rýchlo rastie a s ňou aj celkové výdavky. Keď sa k inteligencii pristupuje prostredníctvom rozhraní API modelov s uzatvoreným zdrojovým kódom, ktoré bežia na vzdialených clusteroch, súkromné informácie a duševné vlastníctvo opúšťajú zariadenie používateľa pri každej požiadavke. Keďže agenti sa rozrastajú v rámci individuálnych pracovných postupov a celých organizácií, výdavky na tokeny a presun údajov sú čoraz náročnejšie na riadenie.
Modely s otvoreným zdrojovým kódom sa zároveň zlepšujú ešte rýchlejším tempom. Pokrok je najviditeľnejší vo veľmi malých a účinných modeloch, ako sú NVIDIA Nemotron 3.5 Lightning (celkovo 30B parametrov), Qwen 3.6 (35B) a Qwen 3.8 (27B). Tieto malé modely podávajú výkony nad svoje pomery a teraz sú schopné zvládať zložité pracovné postupy agentov. Hardvér pre lokálnu inferenciu napreduje paralelne: systémy ako NVIDIA DGX Spark teraz dokážu spúšťať tieto modely lokálne. Tieto trendy spolu robia plne lokálnu prevádzku praktickou a zároveň umožňujú používateľom v prípade potreby zvoliť si externé schopnosti, ako je webové vyhľadávanie, konektory alebo eskalácia na cloudový model.
Tento lokálne orientovaný prístup umožňuje výraznú úsporu nákladov, pretože lokálna inferencia eliminuje poplatky za rozhranie API na základe tokenov. Prirodzene tiež rieši obavy o súkromie a duševné vlastníctvo: súkromné tokeny sa nikdy nemusia prenášať do vzdialených clusterov a zostávajú bezpečne v rámci hraníc lokálneho zariadenia.
V júni sme predstavili prvý hybridný orchester inferencie medzi lokálnym serverom, ktorý rozhoduje o tom, aká práca má prebiehať v zariadení a aká práca má ísť agentom v cloude. Tu vysvetľujeme, ako sme takého lokálne orientovaného agenta vytvorili, vrátane rámca a modelov vzájomne optimalizovaných pre seba.
Prinášame prehľad kľúčových možností návrhu, pričom hodnotíme Computer oproti populárnym všeobecným rámcom s otvoreným zdrojovým kódom (Hermes a Pi) naprieč tromi verejnými benchmarkmi a naším interným benchmarkom lokálnej práce s vedomosťami (Local Knowledge Work Bench). V našom bencchmarku s modelom Qwen 3.8 27B spusteným na zariadení NVIDIA DGX Spark dosahuje Computer najvyššie skóre 82,6 % oproti 77,6 % pre Pi a 74,0 % pre Hermes. PPLX 27B, náš model dodatočne vyškolený nad modelom Qwen 3.8 27B, zvyšuje skóre ďalej na 85,4 %.
Navrhnite rámec okolo lokálneho modelu
Hoci sú kompaktné modely v zariadeniach už pomerne schopné, vo výkone stále zaostávajú za väčšími špičkovými modelmi. Na efektívne usmerňovanie týchto modelov a riešenie ich obmedzení je potrebný starostlivo navrhnutý rámec.
Populárne rámce s otvoreným zdrojovým kódom, ako sú Pi a Hermes, sa ukázali ako všeobecné: fungujú dobre s veľkým množstvom modelov naprieč veľkosťami a triedami. Nie sú však optimalizované pre schopnosti modelov v zariadeniach. Lokálny rámec sme navrhli špeciálne pre toto prostredie, okolo niekoľkých kľúčových princípov.
Efektivita kontextu
Hlavným zameraním pri návrhu nášho rámca bolo čo najlepšie využitie kontextu modelu.
Hoci modely v zariadeniach, ako je Qwen 3.8 27B, ponúkajú kontextové okná s veľkosťou 260 tisíc tokenov, empiricky sme zistili, že nad 100 tisíc tokenov začínajú mať problémy. Preto udržiavame jadro rámca stručné: minimálny systémový prompt a malú sadu kľúčových nástrojov.
Všetky ostatné schopnosti sú modulované do zručností na požiadanie, ktoré sa načítavajú a uvoľňujú počas celej trajektórie. Tieto zručnosti sme navrhli pre bežné úlohy spojené s prácou s vedomosťami: výskum, dátová veda, vizualizácia údajov, tvorba dokumentov, softvérové inžinierstvo a ďalšie.
Rámec podporuje aj kompaktáciu kontextu, pričom zhrňuje zastaraný kontext, keď sa trajektória predĺži, aby model zostal v rámci svojho efektívneho okna.
Konektory ako nástroje príkazového riadka
Každodenná práca s vedomosťami často vyžaduje konektory ako Gmail, GitHub, Outlook a Google Calendar. Tie sa zvyčajne sprístupňujú do rámca ako servery MCP, ktorých veľké definície nástrojov spotrebúvajú podstatnú časť kontextu. Namiesto toho sme najpoužívanejšie protokoly MCP konvertovali na kompaktné, ľahko použiteľné nástroje príkazového riadka doplnené o vlastné zručnosti, ktoré oveľa lepšie využívajú obmedzený efektívny kontext.
Samooverenie
Výkon sa zlepšuje aj vtedy, keď agent overuje svoju vlastnú prácu. Overenie pridáva ďalšie kroky, ale výrazne zlepšuje konečné výsledky a podstatne zmenšuje medzeru oproti špičkovým modelom. Môže byť spustené samotným modelom alebo súborom háčikov, ktoré monitorujú stav trajektórie a vyžadujú samooverenie, keď sa niečo pokazí.
Vykonávanie v sandboxe
Rámec spúšťa nástroje v sandboxe na úrovni operačného systému v zariadení používateľa. Táto hranica obmedzuje procesy, cesty k súborom a prístup k sieti podľa pravidiel. To obmedzuje rozsah škôd v prípade chybného príkazu. Ak je sandbox nedostupný, rámec sa pred akýmkoľvek volaním nástrojov sám vypne, namiesto toho, aby prešiel na vykonávanie bez sandboxu.
To sa líši od rámcov s otvoreným zdrojovým kódom, ako sú Pi a Hermes, ktoré štandardne spúšťajú príkazy priamo s oprávneniami používateľa. V aplikácii Computer je izolácia vždy zapnutá, nevyžaduje žiadnu konfiguráciu a nástroje bez nej nemôžu fungovať.
Nižšie uvedený diagram ukazuje, ako tieto princípy do seba zapadajú v slučke vykonávania. Orchester je deterministický kód rámca, nie LLM: udržiava slučku, zostavuje kontext a vynucuje pravidlá. Lokálny model navrhuje ďalšiu akciu; orchester vykonáva schválené volania nástrojov v sandboxe a vracia ich výsledky modelu. Webové vyhľadávanie, konektory a volania poradcu prekračujú hranicu zariadenia iba vtedy, keď sú povolené a schválené.
Lokálny rámec vyťaží z rovnakého modelu viac
Pomocou rovnakého základného modelu v zariadení porovnávame náš lokálny rámec so všeobecnými alternatívami v oblasti webového výskumu a multimodálneho porozumenia dokumentov. Všetky rámce používajú model Qwen 3.8 27B so stredným uvažovaním, ktorý beží na zariadení NVIDIA DGX Spark. Toto porovnanie izoluje schopnosti, ktoré prináša samotný rámec, pred akýmkoľvek dodatočným trénovaním modelu.
Zameriavame sa na tieto dve schopnosti, pretože práca s vedomosťami často kombinuje súkromné dokumenty v zariadení používateľa s verejnými informáciami z webu, aby sa vytvoril podložený artefakt. Webové vyhľadávanie vyžaduje pripojenie, ale inferencia modelu a spracovanie súkromných dokumentov zostávajú lokálne. Lokálne súbory slúžia ako autoritatívny zdroj, verejné zdroje pridávajú kontext a používatelia môžu webové vyhľadávanie úplne vypnúť pre prácu úplne offline.
Webový výskum
Náš lokálny rámec budujeme spoločne s vyhľadávačom Perplexity, ktorý dosiahol popredné miesta v nezávislých hodnoteniach. Rámec k nemu pristupuje prostredníctvom rozhrania Search as Code.
Kvalitu výskumu hodnotíme na 1 266 úlohách BrowseComp. Computer používa vyhľadávaciu infraštruktúru Perplexity spolu s naším lokálnym rámcom, zatiaľ čo Pi a Hermes sa spoliehajú na Brave, svojho odporúčaného poskytovateľa vyhľadávania. Computer dosahuje presnosť 66,7 % v porovnaní s 50,2 % pre Pi a 43,9 % pre Hermes.
Computer má tiež najnižší priemerný zaznamenaný skutočný čas a spotrebu tokenov: 402,1 sekundy a 852 tisíc tokenov na úlohu v porovnaní s 1 020,9 sekundami a 1,01 milióna tokenov pre Hermes a 826,0 sekundami a 2,82 milióna tokenov pre Pi. Computer tak využíva o 61 % kratší skutočný čas a o 16 % menej tokenov ako Hermes a o 51 % kratší skutočný čas a o 70 % menej tokenov ako Pi.
Multimodálne porozumenie dokumentov v zariadení
Mnohé dokumenty nesú informácie vizuálne a je ťažké ich analyzovať ako čistý text: súbory PDF, naskenované strany, snímky obrazovky, grafy a prezentácie. Tieto pracovné postupy závisia od OCR a porozumenia obrazu a najviac profitujú z natívne multimodálneho modelu.
Rámec odovzdáva stránky dokumentov a obrázky priamo modelu, ktorý im rozumie a kombinuje vizuálne dôkazy s extrahovaným textom. Spracovanie týchto súborov v zariadení udržuje citlivé dokumenty a ich extrahovaný obsah v súkromí.
Multimodálne porozumenie dokumentov hodnotíme na benchmarku ParseBench-100, čo je podmnožina benchmarku ParseBench so 100 úlohami, pričom pre grafy, rozloženie, tabuľky, textový obsah a formátovanie je vyhradených po 20 úloh.
Computer dosahuje priemerné skóre 65,1 % v porovnaní s 34,6 % pre Hermes a 13,9 % pre Pi. Úlohy tiež dokončuje s najmenším časom a najmenším počtom tokenov: v priemere 60,6 sekundy a 20,1 tisíca tokenov na úlohu v porovnaní so 108,3 sekundami a 32,1 tisíca tokenov pre Hermes a 410,5 sekundami a 829,1 tisíca tokenov pre Pi. Computer vedie vo všetkých piatich kategóriách dokumentov, pričom najväčšiu výhodu má pri grafoch. Rozloženie zostáva ťažké pre všetky tri rámce.
Tabuľka 1. Priemerné skóre ParseBench-100 podľa kategórie dokumentu pre rámce Computer, Hermes a Pi s modelom Qwen 3.8 27B v zariadení. Computer vedie vo všetkých piatich kategóriách.
Rámec | Graf | Rozloženie | Tabuľka | Textový obsah | Formátovanie |
Computer | 76,5 % | 16,2 % | 72,7 % | 87,9 % | 72,4 % |
Hermes | 29,3 % | 2,9 % | 44,1 % | 61,5 % | 35,2 % |
Pi | 2,5 % | 0,1 % | 11,0 % | 29,7 % | 26,1 % |
Zmenšovanie medzery voči špičke pomocou eskalácie na poradcu
Dokonca aj so starostlivo navrhnutým rámcom najťažšie úlohy stále presahujú možnosti kompaktného lokálneho modelu. Pre takéto úlohy rámec sprístupňuje nástroj poradcu: lokálny model sa môže poradiť so silnejším špičkovým modelom, keď potrebuje pomoc s plánovaním, riešením nejednoznačnosti, zotavovaním sa z opakovaných zlyhaní alebo overovaním konečného výsledku.
Lokálny model rozhoduje o tom, kedy požiadať o radu, zatiaľ čo orchester rámca si zachováva autoritu nad nástrojmi a kontroluje, aký kontext sa odosiela. Eskalácia je voliteľná. Používateľ rozhoduje, či ju povolí a či každé volanie poradcu schváli manuálne alebo automaticky.
Pred zavolaním poradcu rámec vyberie relevantný kontext, použije klasifikátor PII na označenie citlivých informácií a ukáže používateľovi, čo opustí zariadenie. Poradca prijíma iba schválený kontext a vracia textové pokyny; nemá žiadny priamy prístup k súborom, nástrojom ani konverzáciám zariadenia. To zlepšuje náklady aj súkromie a tento smer plánujeme ďalej preskúmať v budúcej práci.
Tento prístup testujeme na náročných úlohách softvérového inžinierstva, ktoré vyžadujú silné uvažovanie a kde lokálny model najčastejšie zlyháva. Na tento účel používame Terminal Bench 2.1, populárny benchmark s 89 úlohami pre kódovacích agentov.
Chceme zodpovedať dve otázky: koľko z medzery k špičkovému modelu dokáže eskalácia na poradca uzavrieť a za akú cenu. Úplne lokálne modely stoja pri prevádzke prakticky nič, pretože inferencia prebieha na hardvéri používateľa. Akonáhle však model začne volať poradcu, začnú mu vznikať náklady na API.
Ako východisko pre špičkový výkon používame Claude Opus 5 fungujúci v lokálnom rámci; lokálny model je Qwen 3.8 27B. Nakoniec ich spojíme: Qwen 3.8 27B vykoná úlohu a v prípade potreby pomoci eskaluje na poradcu Claude Opus 5. Eskaláciu na poradcu s Pi ani Hermes nehodnotíme, pretože ani jeden neposkytuje ekvivalentný nástroj poradcu; pridanie tohto nástroja by si vyžadovalo úpravu jeho povrchu nástrojov a logiky orchesterovania, takže výsledok by už nepredstavoval hotový rámec.
Eskalácia na poradcu zvyšuje skóre Computeru z 59,6 % na 73,0 %, čo predstavuje nárast o 13,5 percentuálneho bodu, pri odhadovaných nákladoch na API vo výške 0,415 USD na jedno spustenie. Samotné spustenie Claude Opus 5 dosahuje 82,4 % pri 0,65 USD na spustenie. Eskalácia tak získava späť približne tri pätiny medzery k špičke pri približne dvoch tretinách nákladov špičky a používateľ rozhoduje, či sa tento kompromis oplatí urobit.
Dodatočné trénovanie pre rámec a prácu s vedomosťami
Doteraz sme udržiavali lokálny model nezmenený, aby sme izolovali to, čím prispieva rámec. S vytvoreným návrhom rámca pochádzajú najväčšie zostávajúce prírastky z prispôsobenia samotného modelu. Údaje o používaní Perplexity Computer nám ukazujú, čo ľudia v skutočnosti robia pri práci s vedomosťami, čo používame na syntézu tréningových údajov. Lokálny model dodatočne trénujeme v rámci Computeru, pričom sa riadime skutočnou distribúciou úloh, ktoré používatelia vykonávajú.
Konkrétne identifikujeme rôznorodú množinu prípadov použitia, ktoré precvičujú rôzne schopnosti modelu, nástroje a konektory. Z týchto prípadov použitia syntetizujeme realistické prostredia posilňovaného učenia a definujeme náročné, ale overiteľné úlohy: každá úloha sa skladá z inštrukcie, prostredia a overovača, ktorý boduje konečný výsledok, pričom prostredím je kontajner Docker, v ktorom rámec funguje. Dôležité je, že keďže úlohy sú syntetické, neobsahujú žiadne skutočné dokumenty ani informácie o používateľovi.
Tieto prostredia používame na dvojstupňové trénovanie: jemné doladenie odmietnutím, po ktorom nasleduje posilňované učenie. V prvom stupni spustíme model oproti každej úlohe viackrát, vyberieme najlepšie trajektórie podľa skóre overovača a trénujeme na nich pomocou supervidovaného učenia. Tento stupeň inicializuje model pre špecifický rámec a distribúciu úloh. V druhom stupni posilňované učenie ďalej jemne dolaďuje model a robí ho odolnejším.
Podmnožina úloh je vyňatá z trénovania a používa sa na konečné hodnotenie; túto vyňatú množinu nazývame Local Knowledge Work Bench: 53 úloh zahŕňajúcich sedem kategórií každodennej práce s vedomosťami, od hĺbkového výskumu až po tvorbu dokumentov. Čoskoro zverejníme technickú správu popisujúcu trénovanie modelu do podrobností a plánujeme tento hodnotiaci benchmark sprístupniť ako open-source.
Pomocou tohto prístupu sme dodatočne vytrénovali model Qwen 3.8 27B, čím sme vytvorili model s názvom PPLX 27B, a vyhodnotili sme ho na benchmarku Local Knowledge Work Bench. So základným modelom Qwen 3.8 27B dosahuje Computer najvyššie skóre (82,6 % v porovnaní s 77,6 % pre Pi a 74,0 % pre Hermes) a používa najmenej tokenov (520 tisíc oproti 681 tisíc pre Pi a 634 tisíc pre Hermes). Pi dokončuje úlohy najrýchlejšie za 176 sekúnd na úlohu v porovnaní s 218 sekundami pre Computer a 292 sekundami pre Hermes. PPLX 27B zvyšuje skóre Computeru na 85,4 % za cenu väčšieho počtu tokenov (678 tisíc oproti 520 tisíc). Jeho odhadovaný skutočný čas je 250 sekúnd.
Tabuľka 2. Kategórie úloh Local Knowledge Work Bench.
Kategória | Úlohy | Podiel | Popis |
Hĺbkový výskum | 20 | 37,7 % | Odpovedajte na zložité otázky vyžadujúce viacúrovňový webový výskum, verejné súbory údajov, štatistiky a overenie zdrojov. |
Údaje, financie a obstarávanie | 9 | 17,0 % | Čistite súbory údajov, usporadúvajte záznamy, auditujte výdavky, analyzujte investície, vyhodnocujte dodávateľov a počítajte finančné metriky. |
Dokumenty, prezentácie a dizajn | 7 | 13,2 % | Vytvárajte upravené súbory PDF, faktúry, materiály na zaučenie, propagačné materiály k podujatiam a obchodné prezentácie. |
Inžinierstvo, IT a incidenty | 5 | 9,4 % | Vyšetrujte incidenty, analyzujte záznamy, píšte plány obnovy, posudzujte pripravenosť na vydanie a syntetizujte technickú dokumentáciu. |
Zmluvy, dôkazy a súlad s predpismi | 5 | 9,4 % | Prehliadajte zmluvy, preverujte dôkazy, vyšetrujte stiahnutia produktov z obehu, redigujte citlivé dokumenty a overujte požiadavky na súlad s predpismi. |
Panelové zostavy, softvér a vizualizácia | 4 | 7,5 % | Budujte interaktívne panelové zostavy, vzdelávacie mikrostránky, grafy a vizualizácie projektov. |
Ľudia, projekty a stretnutia | 3 | 5,7 % | Preverujte životopisy, konsolidujte rozhodnutia zo stretnutí a spravujte sledovače akčných krokov projektov. |
Celkom | 53 | 100 % |
Záver
Náš výskum ukazuje, že silný model s otvoreným zdrojovým kódom, so schopným lokálnym hardvérom a rámcom preň postaveným, dokáže spracovať skutočnú prácu s vedomosťami pri takmer nulových nákladoch na inferenciu bez toho, aby vyžadoval odchod citlivých údajov zo zariadenia.
Naprieč rôznymi benchmarkmi Computer dosiahol alebo prekonal Hermes a Pi v presnosti pri spúšťaní modelu Qwen 3.8 27B na zariadení NVIDIA DGX Spark. Medzi tromi benchmarkmi, ktoré uvádzajú latenciu a využitie tokenov, bol Computer najrýchlejší na BrowseComp a ParseBench-100 a použil najmenej tokenov na všetkých troch; Pi bol najrýchlejší na Local Knowledge Work Bench.
Zisky vyplynuli z rozhodnutí, ktoré sme urobili. Postavili sme stručný lokálny rámec so zručnosťami, ktoré sa načítavajú na požiadanie. Namiesto serverov MCP sme skonvertovali konektory na kompaktné nástroje CLI. Vykonávanie bolo kvôli bezpečnosti umiestnené do sandboxu.
Výsledky tiež ukazujú, kde majú kompaktné modely priestor na zlepšenie. Napríklad pri náročných kódovacích úlohách v Terminal Bench 2.1 lokálny model zaostáva za špičkovým modelom vo všetkých troch rámcoch. Eskalácia na poradcu zmenšuje, ale úplne neuzatvára medzeru; na ďalšie posunutie výkonu sú stále potrebné neustále zlepšenia schopností modelu a lokálneho hardvéru.
Účelom vytvorenia rámca a modelu pre lokálne obmedzenia je poskytnúť používateľom výslovnú kontrolu nad tým, aké informácie opúšťajú ich stroje. Pre používateľa existujú aj výhody v podobe nákladov. Vnímame to ako súčasť širšieho posunu, v rámci ktorého čoraz schopnejší agenti prechádzajú zo vzdialenej infraštruktúry na individuálne a lokálne zariadenia. Očakávame, že pokrok v oblasti čipov, modelov a zariadení bude neustále rozširovať rozsah a kvalitu práce s vedomosťami, ktorú Portable Computer spracováva lokálne.