Lokálne orientovaný agent pre súkromnú a cenovo výhodnú prácu s vedomosťami

Rámec a model spoločne navrhnuté pre lokálnu prácu s vedomosťami, ktoré bežia v zariadení a podľa potreby pristupujú k vzdialeným funkciám.

AutoriPerplexity Research

Perplexity Portable Computer je lokálne orientovaný agent.

Celý zásobník štandardne beží lokálne. Model, rámec, konverzácia a trajektória – to všetko sídli v zariadení používateľa. Práca, ktorá vyžaduje vonkajší svet, ako je webové vyhľadávanie, konektory alebo eskalácia na silnejší model poradcu v cloude, sa vyvolá iba v prípade potreby a vždy je riadená používateľom. Citlivé údaje preto nikdy neopustia zariadenie bez súhlasu a lokálne modely so sebou nenesú žiadny poplatok za inferenciu: systém je súkromný a nákladovo efektívny už zo svojej podstaty.

Efektívny lokálne orientovaný agent vyžaduje, aby model a rámec boli navrhnuté spoločne. Všeobecné rámce predpokladajú špičkový model, ktorý dokáže spracovať dlhé kontexty, orientovať sa v širokom spektre nástrojov a plánovať vo veľkom horizonte. Lokálne modely sú pri takýchto požiadavkách menej spoľahlivé. Namiesto toho, aby sme od malého modelu chceli, aby spravoval rámec postavený pre veľký model, vytvarovali sme oba okolo seba navzájom: rámec prispôsobený profilu schopností modelu a model dodatočne vyškolený na efektívne používanie tohto rámca.

Úvod

Schopnosti agentov v posledných mesiacoch rýchlo pokročili v širokej škále úloh spojených s prácou s vedomosťami. Hoci tento pokrok prináša veľké prírastky v produktivite a efektivite, predstavuje aj dve výzvy.

Spotreba tokenov rýchlo rastie a s ňou aj celkové výdavky. Keď sa k inteligencii pristupuje prostredníctvom rozhraní API modelov s uzatvoreným zdrojovým kódom, ktoré bežia na vzdialených clusteroch, súkromné informácie a duševné vlastníctvo opúšťajú zariadenie používateľa pri každej požiadavke. Keďže agenti sa rozrastajú v rámci individuálnych pracovných postupov a celých organizácií, výdavky na tokeny a presun údajov sú čoraz náročnejšie na riadenie.

Modely s otvoreným zdrojovým kódom sa zároveň zlepšujú ešte rýchlejším tempom. Pokrok je najviditeľnejší vo veľmi malých a účinných modeloch, ako sú NVIDIA Nemotron 3.5 Lightning (celkovo 30B parametrov), Qwen 3.6 (35B) a Qwen 3.8 (27B). Tieto malé modely podávajú výkony nad svoje pomery a teraz sú schopné zvládať zložité pracovné postupy agentov. Hardvér pre lokálnu inferenciu napreduje paralelne: systémy ako NVIDIA DGX Spark teraz dokážu spúšťať tieto modely lokálne. Tieto trendy spolu robia plne lokálnu prevádzku praktickou a zároveň umožňujú používateľom v prípade potreby zvoliť si externé schopnosti, ako je webové vyhľadávanie, konektory alebo eskalácia na cloudový model.

Tento lokálne orientovaný prístup umožňuje výraznú úsporu nákladov, pretože lokálna inferencia eliminuje poplatky za rozhranie API na základe tokenov. Prirodzene tiež rieši obavy o súkromie a duševné vlastníctvo: súkromné tokeny sa nikdy nemusia prenášať do vzdialených clusterov a zostávajú bezpečne v rámci hraníc lokálneho zariadenia.

V júni sme predstavili prvý hybridný orchester inferencie medzi lokálnym serverom, ktorý rozhoduje o tom, aká práca má prebiehať v zariadení a aká práca má ísť agentom v cloude. Tu vysvetľujeme, ako sme takého lokálne orientovaného agenta vytvorili, vrátane rámca a modelov vzájomne optimalizovaných pre seba.

Prinášame prehľad kľúčových možností návrhu, pričom hodnotíme Computer oproti populárnym všeobecným rámcom s otvoreným zdrojovým kódom (Hermes a Pi) naprieč tromi verejnými benchmarkmi a naším interným benchmarkom lokálnej práce s vedomosťami (Local Knowledge Work Bench). V našom bencchmarku s modelom Qwen 3.8 27B spusteným na zariadení NVIDIA DGX Spark dosahuje Computer najvyššie skóre 82,6 % oproti 77,6 % pre Pi a 74,0 % pre Hermes. PPLX 27B, náš model dodatočne vyškolený nad modelom Qwen 3.8 27B, zvyšuje skóre ďalej na 85,4 %.

Stĺpcový graf skóre Local Knowledge Work Bench: rámce Computer, Pi a Hermes s modelom Qwen 3.8 27B a Computer s PPLX 27B, ktorý dosahuje najvyššie skóre 85,4 %.
Skóre v Local Knowledge Work Bench, našom benchmarku 53 reprezentatívnych každodenných úloh práce s vedomosťami. Každý stĺpec predstavuje kombináciu rámca a modelu spustenú na zariadení NVIDIA DGX Spark; PPLX 27B je náš dodatočne vytrénovaný model. Tri pokusy na úlohu; fúziky predstavujú 95 % intervaly spoľahlivosti.

Navrhnite rámec okolo lokálneho modelu

Hoci sú kompaktné modely v zariadeniach už pomerne schopné, vo výkone stále zaostávajú za väčšími špičkovými modelmi. Na efektívne usmerňovanie týchto modelov a riešenie ich obmedzení je potrebný starostlivo navrhnutý rámec.

Populárne rámce s otvoreným zdrojovým kódom, ako sú Pi a Hermes, sa ukázali ako všeobecné: fungujú dobre s veľkým množstvom modelov naprieč veľkosťami a triedami. Nie sú však optimalizované pre schopnosti modelov v zariadeniach. Lokálny rámec sme navrhli špeciálne pre toto prostredie, okolo niekoľkých kľúčových princípov.

Efektivita kontextu

Hlavným zameraním pri návrhu nášho rámca bolo čo najlepšie využitie kontextu modelu.

Hoci modely v zariadeniach, ako je Qwen 3.8 27B, ponúkajú kontextové okná s veľkosťou 260 tisíc tokenov, empiricky sme zistili, že nad 100 tisíc tokenov začínajú mať problémy. Preto udržiavame jadro rámca stručné: minimálny systémový prompt a malú sadu kľúčových nástrojov.

Všetky ostatné schopnosti sú modulované do zručností na požiadanie, ktoré sa načítavajú a uvoľňujú počas celej trajektórie. Tieto zručnosti sme navrhli pre bežné úlohy spojené s prácou s vedomosťami: výskum, dátová veda, vizualizácia údajov, tvorba dokumentov, softvérové inžinierstvo a ďalšie.

Rámec podporuje aj kompaktáciu kontextu, pričom zhrňuje zastaraný kontext, keď sa trajektória predĺži, aby model zostal v rámci svojho efektívneho okna.

Konektory ako nástroje príkazového riadka

Každodenná práca s vedomosťami často vyžaduje konektory ako Gmail, GitHub, Outlook a Google Calendar. Tie sa zvyčajne sprístupňujú do rámca ako servery MCP, ktorých veľké definície nástrojov spotrebúvajú podstatnú časť kontextu. Namiesto toho sme najpoužívanejšie protokoly MCP konvertovali na kompaktné, ľahko použiteľné nástroje príkazového riadka doplnené o vlastné zručnosti, ktoré oveľa lepšie využívajú obmedzený efektívny kontext.

Samooverenie

Výkon sa zlepšuje aj vtedy, keď agent overuje svoju vlastnú prácu. Overenie pridáva ďalšie kroky, ale výrazne zlepšuje konečné výsledky a podstatne zmenšuje medzeru oproti špičkovým modelom. Môže byť spustené samotným modelom alebo súborom háčikov, ktoré monitorujú stav trajektórie a vyžadujú samooverenie, keď sa niečo pokazí.

Vykonávanie v sandboxe

Rámec spúšťa nástroje v sandboxe na úrovni operačného systému v zariadení používateľa. Táto hranica obmedzuje procesy, cesty k súborom a prístup k sieti podľa pravidiel. To obmedzuje rozsah škôd v prípade chybného príkazu. Ak je sandbox nedostupný, rámec sa pred akýmkoľvek volaním nástrojov sám vypne, namiesto toho, aby prešiel na vykonávanie bez sandboxu.

To sa líši od rámcov s otvoreným zdrojovým kódom, ako sú Pi a Hermes, ktoré štandardne spúšťajú príkazy priamo s oprávneniami používateľa. V aplikácii Computer je izolácia vždy zapnutá, nevyžaduje žiadnu konfiguráciu a nástroje bez nej nemôžu fungovať.

Nižšie uvedený diagram ukazuje, ako tieto princípy do seba zapadajú v slučke vykonávania. Orchester je deterministický kód rámca, nie LLM: udržiava slučku, zostavuje kontext a vynucuje pravidlá. Lokálny model navrhuje ďalšiu akciu; orchester vykonáva schválené volania nástrojov v sandboxe a vracia ich výsledky modelu. Webové vyhľadávanie, konektory a volania poradcu prekračujú hranicu zariadenia iba vtedy, keď sú povolené a schválené.

Diagram slučky vykonávania lokálneho rámca: deterministický kód orchestrovacieho programu zostavuje kontext a spúšťa nástroje v sandboxe, lokálny model navrhuje akcie a služby mimo zariadenia sú voliteľné a riadené používateľom.
Ako lokálny rámec spúšťa úlohu. Deterministický kód rámca ovládá slučku a nástroje v sandboxe; lokálny model navrhuje akcie. Služby mimo zariadenia sú voliteľné a riadené používateľom.

Lokálny rámec vyťaží z rovnakého modelu viac

Pomocou rovnakého základného modelu v zariadení porovnávame náš lokálny rámec so všeobecnými alternatívami v oblasti webového výskumu a multimodálneho porozumenia dokumentov. Všetky rámce používajú model Qwen 3.8 27B so stredným uvažovaním, ktorý beží na zariadení NVIDIA DGX Spark. Toto porovnanie izoluje schopnosti, ktoré prináša samotný rámec, pred akýmkoľvek dodatočným trénovaním modelu.

Zameriavame sa na tieto dve schopnosti, pretože práca s vedomosťami často kombinuje súkromné dokumenty v zariadení používateľa s verejnými informáciami z webu, aby sa vytvoril podložený artefakt. Webové vyhľadávanie vyžaduje pripojenie, ale inferencia modelu a spracovanie súkromných dokumentov zostávajú lokálne. Lokálne súbory slúžia ako autoritatívny zdroj, verejné zdroje pridávajú kontext a používatelia môžu webové vyhľadávanie úplne vypnúť pre prácu úplne offline.

Webový výskum

Náš lokálny rámec budujeme spoločne s vyhľadávačom Perplexity, ktorý dosiahol popredné miesta v nezávislých hodnoteniach. Rámec k nemu pristupuje prostredníctvom rozhrania Search as Code.

Kvalitu výskumu hodnotíme na 1 266 úlohách BrowseComp. Computer používa vyhľadávaciu infraštruktúru Perplexity spolu s naším lokálnym rámcom, zatiaľ čo Pi a Hermes sa spoliehajú na Brave, svojho odporúčaného poskytovateľa vyhľadávania. Computer dosahuje presnosť 66,7 % v porovnaní s 50,2 % pre Pi a 43,9 % pre Hermes.

Computer má tiež najnižší priemerný zaznamenaný skutočný čas a spotrebu tokenov: 402,1 sekundy a 852 tisíc tokenov na úlohu v porovnaní s 1 020,9 sekundami a 1,01 milióna tokenov pre Hermes a 826,0 sekundami a 2,82 milióna tokenov pre Pi. Computer tak využíva o 61 % kratší skutočný čas a o 16 % menej tokenov ako Hermes a o 51 % kratší skutočný čas a o 70 % menej tokenov ako Pi.

Bodový graf skóre BrowseComp oproti priemernému skutočnému času na úlohu pre Computer, Hermes a Pi s modelom Qwen 3.8 27B; Computer dosahuje najvyššie skóre s najmenším časom a najmenším počtom tokenov.
Výsledky BrowseComp s modelom Qwen 3.8 27B v zariadení: skóre oproti priemernému skutočnému času na úlohu pre rámce Computer, Hermes a Pi; menovky bodov ukazujú priemerný počet tokenov na úlohu. Neúplné výsledky majú nulové skóre a priemery času a tokenov nezahŕňajú spustenia bez zaznamenaných meraní. Fúziky sú 95 % Wilsonove intervaly spoľahlivosti pre skóre.

Multimodálne porozumenie dokumentov v zariadení

Mnohé dokumenty nesú informácie vizuálne a je ťažké ich analyzovať ako čistý text: súbory PDF, naskenované strany, snímky obrazovky, grafy a prezentácie. Tieto pracovné postupy závisia od OCR a porozumenia obrazu a najviac profitujú z natívne multimodálneho modelu.

Rámec odovzdáva stránky dokumentov a obrázky priamo modelu, ktorý im rozumie a kombinuje vizuálne dôkazy s extrahovaným textom. Spracovanie týchto súborov v zariadení udržuje citlivé dokumenty a ich extrahovaný obsah v súkromí.

Multimodálne porozumenie dokumentov hodnotíme na benchmarku ParseBench-100, čo je podmnožina benchmarku ParseBench so 100 úlohami, pričom pre grafy, rozloženie, tabuľky, textový obsah a formátovanie je vyhradených po 20 úloh.

Computer dosahuje priemerné skóre 65,1 % v porovnaní s 34,6 % pre Hermes a 13,9 % pre Pi. Úlohy tiež dokončuje s najmenším časom a najmenším počtom tokenov: v priemere 60,6 sekundy a 20,1 tisíca tokenov na úlohu v porovnaní so 108,3 sekundami a 32,1 tisíca tokenov pre Hermes a 410,5 sekundami a 829,1 tisíca tokenov pre Pi. Computer vedie vo všetkých piatich kategóriách dokumentov, pričom najväčšiu výhodu má pri grafoch. Rozloženie zostáva ťažké pre všetky tri rámce.

Bodový graf skóre OCR ParseBench-100 oproti priemernému skutočnému času na úlohu pre Computer, Hermes a Pi s modelom Qwen 3.8 27B; Computer dosahuje najvyššie skóre s najmenším časom a najmenším počtom tokenov.
Výsledky OCR ParseBench-100 s modelom Qwen 3.8 27B v zariadení: skóre oproti priemernému skutočnému času na úlohu pre rámce Computer, Hermes a Pi; menovky bodov ukazujú priemerný počet tokenov na úlohu. Priemery tokenov využívajú spustenia so zaznamenanými meraniami. Fúziky predstavujú 95 % intervaly spoľahlivosti.

Tabuľka 1. Priemerné skóre ParseBench-100 podľa kategórie dokumentu pre rámce Computer, Hermes a Pi s modelom Qwen 3.8 27B v zariadení. Computer vedie vo všetkých piatich kategóriách.

Rámec

Graf

Rozloženie

Tabuľka

Textový obsah

Formátovanie

Computer

76,5 %

16,2 %

72,7 %

87,9 %

72,4 %

Hermes

29,3 %

2,9 %

44,1 %

61,5 %

35,2 %

Pi

2,5 %

0,1 %

11,0 %

29,7 %

26,1 %

Zmenšovanie medzery voči špičke pomocou eskalácie na poradcu

Dokonca aj so starostlivo navrhnutým rámcom najťažšie úlohy stále presahujú možnosti kompaktného lokálneho modelu. Pre takéto úlohy rámec sprístupňuje nástroj poradcu: lokálny model sa môže poradiť so silnejším špičkovým modelom, keď potrebuje pomoc s plánovaním, riešením nejednoznačnosti, zotavovaním sa z opakovaných zlyhaní alebo overovaním konečného výsledku.

Lokálny model rozhoduje o tom, kedy požiadať o radu, zatiaľ čo orchester rámca si zachováva autoritu nad nástrojmi a kontroluje, aký kontext sa odosiela. Eskalácia je voliteľná. Používateľ rozhoduje, či ju povolí a či každé volanie poradcu schváli manuálne alebo automaticky.

Pred zavolaním poradcu rámec vyberie relevantný kontext, použije klasifikátor PII na označenie citlivých informácií a ukáže používateľovi, čo opustí zariadenie. Poradca prijíma iba schválený kontext a vracia textové pokyny; nemá žiadny priamy prístup k súborom, nástrojom ani konverzáciám zariadenia. To zlepšuje náklady aj súkromie a tento smer plánujeme ďalej preskúmať v budúcej práci.

Diagram eskalácie na poradcu: orchester rámca si zachováva autoritu nástrojov a posiela modelovi poradcu iba schválený kontext, ktorý vrací textové pokyny bez priameho prístupu k nástrojom alebo súborom.
Vzdialené vedenie, lokálne ovládanie. Orchester rámca si zachováva autoritu nad nástrojmi a posiela iba kontext schválený na eskaláciu. Poradca nemá priamy prístup k nástrojom, súborom ani kanálu odozvy; vracia textové pokyny, ktoré môže lokálny model použiť.

Tento prístup testujeme na náročných úlohách softvérového inžinierstva, ktoré vyžadujú silné uvažovanie a kde lokálny model najčastejšie zlyháva. Na tento účel používame Terminal Bench 2.1, populárny benchmark s 89 úlohami pre kódovacích agentov.

Chceme zodpovedať dve otázky: koľko z medzery k špičkovému modelu dokáže eskalácia na poradca uzavrieť a za akú cenu. Úplne lokálne modely stoja pri prevádzke prakticky nič, pretože inferencia prebieha na hardvéri používateľa. Akonáhle však model začne volať poradcu, začnú mu vznikať náklady na API.

Ako východisko pre špičkový výkon používame Claude Opus 5 fungujúci v lokálnom rámci; lokálny model je Qwen 3.8 27B. Nakoniec ich spojíme: Qwen 3.8 27B vykoná úlohu a v prípade potreby pomoci eskaluje na poradcu Claude Opus 5. Eskaláciu na poradcu s Pi ani Hermes nehodnotíme, pretože ani jeden neposkytuje ekvivalentný nástroj poradcu; pridanie tohto nástroja by si vyžadovalo úpravu jeho povrchu nástrojov a logiky orchesterovania, takže výsledok by už nepredstavoval hotový rámec.

Eskalácia na poradcu zvyšuje skóre Computeru z 59,6 % na 73,0 %, čo predstavuje nárast o 13,5 percentuálneho bodu, pri odhadovaných nákladoch na API vo výške 0,415 USD na jedno spustenie. Samotné spustenie Claude Opus 5 dosahuje 82,4 % pri 0,65 USD na spustenie. Eskalácia tak získava späť približne tri pätiny medzery k špičke pri približne dvoch tretinách nákladov špičky a používateľ rozhoduje, či sa tento kompromis oplatí urobit.

Bodový graf skóre Terminal Bench 2.1 oproti nákladom na API na jedno spustenie: Qwen 3.8 27B úplne lokálne, Qwen 3.8 27B s poradcom Claude Opus 5 a samotný Claude Opus 5, všetko v rámci Computer.
Náklady a výkon v Terminal Bench 2.1 na 89 úlohách: skóre oproti nákladom na API na jedno spustenie. Všetky body používajú rámec Computer: Qwen 3.8 27B úplne lokálne, Qwen 3.8 27B eskalujúci na poradcu Claude Opus 5 a samotný Claude Opus 5. Prerušované čiary ukazujú Pi a Hermes spúšťajúce rovnaký lokálny model pri nulových nákladoch na API. Fúziky sú 95 % intervaly spoľahlivosti získané bootstrapom úloh; neúplné spustenia získavajú nulové skóre.

Dodatočné trénovanie pre rámec a prácu s vedomosťami

Doteraz sme udržiavali lokálny model nezmenený, aby sme izolovali to, čím prispieva rámec. S vytvoreným návrhom rámca pochádzajú najväčšie zostávajúce prírastky z prispôsobenia samotného modelu. Údaje o používaní Perplexity Computer nám ukazujú, čo ľudia v skutočnosti robia pri práci s vedomosťami, čo používame na syntézu tréningových údajov. Lokálny model dodatočne trénujeme v rámci Computeru, pričom sa riadime skutočnou distribúciou úloh, ktoré používatelia vykonávajú.

Konkrétne identifikujeme rôznorodú množinu prípadov použitia, ktoré precvičujú rôzne schopnosti modelu, nástroje a konektory. Z týchto prípadov použitia syntetizujeme realistické prostredia posilňovaného učenia a definujeme náročné, ale overiteľné úlohy: každá úloha sa skladá z inštrukcie, prostredia a overovača, ktorý boduje konečný výsledok, pričom prostredím je kontajner Docker, v ktorom rámec funguje. Dôležité je, že keďže úlohy sú syntetické, neobsahujú žiadne skutočné dokumenty ani informácie o používateľovi.

Tieto prostredia používame na dvojstupňové trénovanie: jemné doladenie odmietnutím, po ktorom nasleduje posilňované učenie. V prvom stupni spustíme model oproti každej úlohe viackrát, vyberieme najlepšie trajektórie podľa skóre overovača a trénujeme na nich pomocou supervidovaného učenia. Tento stupeň inicializuje model pre špecifický rámec a distribúciu úloh. V druhom stupni posilňované učenie ďalej jemne dolaďuje model a robí ho odolnejším.

Podmnožina úloh je vyňatá z trénovania a používa sa na konečné hodnotenie; túto vyňatú množinu nazývame Local Knowledge Work Bench: 53 úloh zahŕňajúcich sedem kategórií každodennej práce s vedomosťami, od hĺbkového výskumu až po tvorbu dokumentov. Čoskoro zverejníme technickú správu popisujúcu trénovanie modelu do podrobností a plánujeme tento hodnotiaci benchmark sprístupniť ako open-source.

Pomocou tohto prístupu sme dodatočne vytrénovali model Qwen 3.8 27B, čím sme vytvorili model s názvom PPLX 27B, a vyhodnotili sme ho na benchmarku Local Knowledge Work Bench. So základným modelom Qwen 3.8 27B dosahuje Computer najvyššie skóre (82,6 % v porovnaní s 77,6 % pre Pi a 74,0 % pre Hermes) a používa najmenej tokenov (520 tisíc oproti 681 tisíc pre Pi a 634 tisíc pre Hermes). Pi dokončuje úlohy najrýchlejšie za 176 sekúnd na úlohu v porovnaní s 218 sekundami pre Computer a 292 sekundami pre Hermes. PPLX 27B zvyšuje skóre Computeru na 85,4 % za cenu väčšieho počtu tokenov (678 tisíc oproti 520 tisíc). Jeho odhadovaný skutočný čas je 250 sekúnd.

Bodový graf skóre Local Knowledge Work Bench oproti priemernému skutočnému času na úlohu; PPLX 27B spustený v Computer dosahuje najvyššie skóre 85,4 %.
Výsledky dodatočného trénovania na Local Knowledge Work Bench: skóre oproti priemernému skutočnému času na úlohu; menovky bodov ukazujú rámec, model a priemerný počet tokenov na úlohu. PPLX 27B je náš dodatočne vytrénovaný model spustený v Computer. Fúziky predstavujú 95 % intervaly spoľahlivosti pre 53 úloh s tromi pokusmi pre každú.

Tabuľka 2. Kategórie úloh Local Knowledge Work Bench.

Kategória

Úlohy

Podiel

Popis

Hĺbkový výskum

20

37,7 %

Odpovedajte na zložité otázky vyžadujúce viacúrovňový webový výskum, verejné súbory údajov, štatistiky a overenie zdrojov.

Údaje, financie a obstarávanie

9

17,0 %

Čistite súbory údajov, usporadúvajte záznamy, auditujte výdavky, analyzujte investície, vyhodnocujte dodávateľov a počítajte finančné metriky.

Dokumenty, prezentácie a dizajn

7

13,2 %

Vytvárajte upravené súbory PDF, faktúry, materiály na zaučenie, propagačné materiály k podujatiam a obchodné prezentácie.

Inžinierstvo, IT a incidenty

5

9,4 %

Vyšetrujte incidenty, analyzujte záznamy, píšte plány obnovy, posudzujte pripravenosť na vydanie a syntetizujte technickú dokumentáciu.

Zmluvy, dôkazy a súlad s predpismi

5

9,4 %

Prehliadajte zmluvy, preverujte dôkazy, vyšetrujte stiahnutia produktov z obehu, redigujte citlivé dokumenty a overujte požiadavky na súlad s predpismi.

Panelové zostavy, softvér a vizualizácia

4

7,5 %

Budujte interaktívne panelové zostavy, vzdelávacie mikrostránky, grafy a vizualizácie projektov.

Ľudia, projekty a stretnutia

3

5,7 %

Preverujte životopisy, konsolidujte rozhodnutia zo stretnutí a spravujte sledovače akčných krokov projektov.

Celkom

53

100 %

Záver

Náš výskum ukazuje, že silný model s otvoreným zdrojovým kódom, so schopným lokálnym hardvérom a rámcom preň postaveným, dokáže spracovať skutočnú prácu s vedomosťami pri takmer nulových nákladoch na inferenciu bez toho, aby vyžadoval odchod citlivých údajov zo zariadenia.

Naprieč rôznymi benchmarkmi Computer dosiahol alebo prekonal Hermes a Pi v presnosti pri spúšťaní modelu Qwen 3.8 27B na zariadení NVIDIA DGX Spark. Medzi tromi benchmarkmi, ktoré uvádzajú latenciu a využitie tokenov, bol Computer najrýchlejší na BrowseComp a ParseBench-100 a použil najmenej tokenov na všetkých troch; Pi bol najrýchlejší na Local Knowledge Work Bench.

Zisky vyplynuli z rozhodnutí, ktoré sme urobili. Postavili sme stručný lokálny rámec so zručnosťami, ktoré sa načítavajú na požiadanie. Namiesto serverov MCP sme skonvertovali konektory na kompaktné nástroje CLI. Vykonávanie bolo kvôli bezpečnosti umiestnené do sandboxu.

Výsledky tiež ukazujú, kde majú kompaktné modely priestor na zlepšenie. Napríklad pri náročných kódovacích úlohách v Terminal Bench 2.1 lokálny model zaostáva za špičkovým modelom vo všetkých troch rámcoch. Eskalácia na poradcu zmenšuje, ale úplne neuzatvára medzeru; na ďalšie posunutie výkonu sú stále potrebné neustále zlepšenia schopností modelu a lokálneho hardvéru.

Účelom vytvorenia rámca a modelu pre lokálne obmedzenia je poskytnúť používateľom výslovnú kontrolu nad tým, aké informácie opúšťajú ich stroje. Pre používateľa existujú aj výhody v podobe nákladov. Vnímame to ako súčasť širšieho posunu, v rámci ktorého čoraz schopnejší agenti prechádzajú zo vzdialenej infraštruktúry na individuálne a lokálne zariadenia. Očakávame, že pokrok v oblasti čipov, modelov a zariadení bude neustále rozširovať rozsah a kvalitu práce s vedomosťami, ktorú Portable Computer spracováva lokálne.