Lokalni agent za privatni i isplativi rad sa znanjem

Okruženje i model su-dizajnirani za lokalni rad sa znanjem, koji se izvodi na uređaju i pristupa udaljenim mogućnostima na zahtjev.

AutoriPerplexity Research

Perplexity Portable Computer je lokalni agent.

Cijeli stog se prema zadanim postavkama izvodi lokalno. Model, okruženje, razgovor i putanja nalaze se na korisnikovom stroju. Posao koji zahtijeva vanjski svijet, kao što su web pretraživanje, konektori ili eskalacija na snažniji model savjetnika u oblaku, poziva se samo kada je to potrebno i uvijek uz odobrenje korisnika. Osjetljivi podaci stoga nikada ne napuštaju uređaj bez dopuštenja, a lokalni modeli nemaju naknadu za zaključivanje: sustav je privatan i isplativ samim svojim dizajnom.

Učinkovit lokalni agent zahtijeva da model i okruženje budu dizajnirani zajedno. Općenita okruženja pretpostavljaju model granice koji može apsorbirati duge kontekste, upravljati širokom površinom alata i planirati kroz duge horizonte. Lokalni modeli su manje pouzdani pod tim zahtjevima. Umjesto da tražimo od malog modela da upravlja okruženjem izgrađenim za veliki, oblikovali smo ovo dvoje oko one druge strane: okruženje prilagođeno profilu mogućnosti modela i model naknadno obučen za učinkovito korištenje tog okruženja.

Uvod

Mogućnosti agenata su se posljednjih mjeseci brzo napredovale u širokom rasponu zadataka rada sa znanjem. Iako ta napredovanja donose velika poboljšanja u produktivnosti i učinkovitosti,

Potrošnja tokena brzo raste, a s njom i ukupna potrošnja. Kada se inteligenciji pristupa putem API-ja zatvorenih modela koji se izvode na udaljenim klasterima, privatne informacije i intelektualno vlasništvo napuštaju korisnikov uređaj sa svakim zahtjevom. Kako agenti skaliraju kroz pojedinačne tijekove rada i cijele organizacije, trošak tokena i kretanje podataka postaju sve teži za upravljanje.

U isto vrijeme, modeli otvorenog koda su se poboljšali još bržom stopom. Napredak je najvidljiviji u vrlo malim i učinkovitim modelima kao što su NVIDIA Nemotron 3.5 Lightning (ukupno 30B parametara), Qwen 3.6 (35B) i Qwen 3.8 (27B). Ovi mali modeli nadmašuju svoju težinu i sada su sposobni za složene tijekove rada agenata. Hardver za lokalno zaključivanje napreduje paralelno: sustavi poput NVIDIA DGX Spark sada mogu lokalno izvoditi ove modele. Zajedno, ovi trendovi čine potpuno izvođenje na uređaju praktičnim dok korisnicima omogućuju odabir vanjskih mogućnosti kada je to potrebno, kao što su web pretraživanje, konektori ili eskalacija na model u oblaku.

Ovaj pristup s naglaskom na lokalno omogućuje značajne uštede troškova, budući da lokalno zaključivanje izbjegava API naknade po tokenu. Također prirodno rješava zabrinutosti oko privatnosti i intelektualnog vlasništva: privatni tokeni se nikada ne trebaju prenositi na udaljene klastere i ostaju sigurno unutar granica lokalnog uređaja.

U lipnju smo predstavili prvi hibridni orkestrator zaključivanja lokalnog poslužitelja koji odlučuje koji se posao treba izvoditi na uređaju, a koji bi trebao ići agentima u oblaku. Ovdje objašnjavamo kako smo izgradili takvog lokalnog agenta, uključujući okruženje i modele koji su međusobno optimizirani.

Dajemo pregled ključnih izbora dizajna, ocjenjujemo Computer u odnosu na popularna općenita okruženja otvorenog koda (Hermes i Pi) kroz tri javna referentna mjerila i našu internu Local Knowledge Work Bench. Na našem referentnom mjerilu, s modelom Qwen 3.8 27B koji se izvodi na NVIDIA DGX Spark, Computer postiže najviši rezultat, 82,6% u odnosu na 77,6% za Pi i 74,0% za Hermes. PPLX 27B, naš model naknadno obučen na vrhu Qwen 3.8 27B, podiže rezultat dodatno na 85,4%.

Trakasti grafikon rezultata Local Knowledge Work Bench: okruženja Computer, Pi i Hermes s Qwen 3.8 27B, te Computer s PPLX 27B, koji postiže najviši rezultat s 85,4%.
Rezultati na Local Knowledge Work Bench, našem referentnom mjerilu od 53 reprezentativna zadatka svakodnevnog rada sa znanjem. Svaka traka predstavlja kombinaciju okruženja i modela koja se izvodi na NVIDIA DGX Spark; PPLX 27B je naš model nakon obuke. Tri pokušaja po zadatku; brkovi su 95% intervali pouzdanosti.

Dizajnirajte okruženje oko lokalnog modela

Iako su kompaktni modeli na uređaju već prilično sposobni, oni i dalje zaostaju za većim modelima granice u performansama. Potrebno je pažljivo dizajnirano okruženje za učinkovito usmjeravanje ovih modela i rješavanje njihovih ograničenja.

Popularna okruženja otvorenog koda kao što su Pi i Hermes pokazala su se općenitima: dobro rade s širokim izborom modela različitih veličina i klasa. Ali nisu optimizirana za mogućnosti modela na uređaju. Dizajnirali smo lokalno okruženje posebno za ovu postavku, oko nekoliko ključnih načela.

Učinkovitost konteksta

Glavni fokus u dizajnu našeg okruženja bio je na najbolji način iskoristiti kontekst modela.

Iako modeli na uređaju kao što je Qwen 3.8 27B nude prozore konteksta od 260 tisuća tokena, empirijski smo utvrdili da počinju imati poteškoća iznad 100 tisuća tokena. Stoga osnovno okruženje održavamo sažetim: minimalni sistemski upit i mali skup osnovnih alata.

Sve ostale mogućnosti su modularizirane u vještine na zahtjev koje se učitavaju i isključuju tijekom cijele putanje. Dizajnirali smo ove vještine za uobičajene zadatke rada sa znanjem: istraživanje, podatkovnu znanost, vizualizaciju podataka, izradu dokumenata, računalno inženjerstvo i još mnogo toga.

Okruženje također podržava sažimanje konteksta, sažimajući zastarjeli kontekst kada putanja postane duga kako bi model ostao unutar svog učinkovitog prozora.

Konektori kao alati naredbenog retka

Svakodnevni rad sa znanjem često zahtijeva konektore kao što su Gmail, GitHub, Outlook i Google Kalendar. Oni su obično izloženi okruženju kao MCP poslužitelji, čije velike definicije alata troše značajan udio konteksta. Umjesto toga, pretvorili smo najčešće korištene MCP-ove u kompaktne alate naredbenog retka jednostavne za korištenje, dopunjene prilagođenim vještinama koje znatno bolje koriste ograničeni učinkoviti kontekst.

Samoprovjera

Performanse se također poboljšavaju kada agent provjerava vlastiti rad. Provjera dodaje dodatne korake, ali uvelike poboljšava konačne rezultate i značajno sužava jaz do modela granice. Može je pokrenuti sam model ili skup mehanizama koji prate zdravlje putanje i traže samoprovjeru kada nešto pođe po zlu.

Izvođenje u pješčaniku

Okruženje izvodi alate u pješčaniku na razini operativnog sustava na korisnikovom uređaju. Granica ograničava procese, putanje datoteka i mrežni pristup u skladu s pravilima. Ovo ograničava radijus udara pogrešne naredbe. Ako pješčanik nije dostupan, okruženje se onemogućuje prije bilo kakvih poziva alata umjesto da se svede na izvođenje bez pješčanika.

Ovo se razlikuje od okruženja otvorenog koda kao što su Pi i Hermes, koja prema zadanim postavkama izvode naredbe izravno s dopuštenjima korisnika. U Computeru je izolacija uvijek uključena, ne zahtijeva nikakvu konfiguraciju, a alati se ne mogu pokrenuti bez nje.

Dijagram u nastavku pokazuje kako se ova načela uklapaju u petlju izvođenja. Orkestrator je deterministički kod okruženja, a ne LLM: on održava petlju, sastavlja kontekst i provodi pravila. Lokalni model predlaže sljedeću radnju; orkestrator izvršava odobrene pozive alata u pješčaniku i vraća njihove rezultate modelu. Web pretraživanje, konektori i pozivi savjetnika prelaze granicu uređaja samo kada su omogućeni i odobreni.

Dijagram petlje izvođenja lokalnog okruženja: deterministički kod orkestratora sastavlja kontekst i pokreće alate u pješčaniku, lokalni model predlaže radnje, a usluge izvan uređaja su opcionalne i s korisničkim odobrenjem.
Kako lokalno okruženje izvršava zadatak. Deterministički kod okruženja kontrolira petlju i alate u pješčaniku; lokalni model predlaže radnje. Usluge izvan uređaja su opcionalne i s korisničkim odobrenjem.

Lokalno okruženje izvlači više iz istog modela

Koristeći isti osnovni model na uređaju, uspoređujemo naše lokalno okruženje s općim alternativama na web istraživanju i multimodalnom razumijevanju dokumenata. Sva okruženja koriste model Qwen 3.8 27B sa srednjim rasuđivanjem, koji se izvodi na NVIDIA DGX Spark. Ova usporedba izdvaja mogućnosti koje pruža samo okruženje, prije bilo kakvog naknadnog treniranja modela.

Fokusiramo se na ove dvije mogućnosti jer rad sa znanjem često kombinira privatne dokumente na korisnikovom uređaju s javnim informacijama s weba kako bi se proizveo utemeljeni artefakt. Web pretraživanje zahtijeva povezanost, ali zaključivanje modela i obrada privatnih dokumenata ostaju lokalni. Lokalne datoteke služe kao mjerodavni izvor, javni izvori dodaju kontekst, a korisnici mogu u potpunosti onemogućiti web pretraživanje za rad potpuno izvan mreže.

Web istraživanje

Gradimo naše lokalno okruženje uz Perplexityjev pretraživač, koji je postigao vrhunske rangove u neovisnim procjenama. Okruženje mu pristupa putem sučelja Search as Code.

Ocjenjujemo kvalitetu istraživanja na 1266 BrowseComp zadataka. Computer koristi Perplexityjevu infrastrukturu pretraživanja zajedno s našim lokalnim okruženjem, dok se Pi i Hermes oslanjaju na Brave, svog preporučenog pružatelja pretraživanja. Computer dostiže 66,7% točnosti, u usporedbi s 50,2% za Pi i 43,9% za Hermes.

Computer također ima najniže prosječno zabilježeno stvarno vrijeme i upotrebu tokena: 402,1 sekundu i 852 tisuće tokena po zadatku, u usporedbi s 1020,9 sekundi i 1,01 milijun tokena za Hermes te 826,0 sekundi i 2,82 milijuna tokena za Pi. Computer stoga koristi 61% manje stvarnog vremena i 16% manje tokena od Hermesa, te 51% manje stvarnog vremena i 70% manje tokena od Pija.

Raspršeni dijagram rezultata BrowseComp u odnosu na prosječno stvarno vrijeme po zadatku za Computer, Hermes i Pi s Qwen 3.8 27B; Computer dostiže najviši rezultat s najmanje vremena i najmanje tokena.
Rezultati BrowseComp s modelom Qwen 3.8 27B na uređaju: rezultat u odnosu na prosječno stvarno vrijeme po zadatku za okruženja Computer, Hermes i Pi; oznake točaka prikazuju prosječne tokene po zadatku. Nepotpuni ishodi boduju se nulom, a prosjeci vremena i tokena isključuju izvođenja bez zabilježenih mjerenja. Brkovi su 95% Wilsonovi intervali pouzdanosti za rezultat.

Multimodalno razumijevanje dokumenata na uređaju

Mnogi dokumenti nose informacije vizualno i teško ih je analizirati kao običan tekst: PDF-ovi, skenirane stranice, snimke zaslona, grafikoni i prezentacije. Ovi tijekovi rada ovise o OCR-u i razumijevanju slika, te najviše koriste od izvorno multimodalnog modela.

Okruženje prosljeđuje stranice dokumenata i slike izravno modelu, koji ih razumije i kombinira vizualne dokaze s izvučenim tekstom. Obrada tih datoteka na uređaju čuva osjetljive dokumente i njihov izvučeni sadržaj privatnima.

Ocjenjujemo multimodalno razumijevanje dokumenata na ParseBench-100, podskupu od 100 zadataka iz referentnog mjerila ParseBench, s po 20 zadataka za grafikone, raspored, tablice, sadržaj teksta i oblikovanje.

Computer dostiže prosječni rezultat od 65,1%, u usporedbi s 34,6% za Hermes i 13,9% za Pi. Također dovršava zadatke s najmanje vremena i najmanje tokena: u prosjeku 60,6 sekundi i 20,1 tisuću tokena po zadatku, u usporedbi s 108,3 sekunde i 32,1 tisuću tokena za Hermes, te 410,5 sekundi i 829,1 tisuću tokena za Pi. Computer vodi u svih pet kategorija dokumenata, s najvećom prednošću na grafikonima. Raspored ostaje težak za sva tri okruženja.

Raspršeni dijagram OCR rezultata ParseBench-100 u odnosu na prosječno stvarno vrijeme po zadatku za Computer, Hermes i Pi s Qwen 3.8 27B; Computer dostiže najviši rezultat s najmanje vremena i najmanje tokena.
OCR rezultati ParseBench-100 s modelom Qwen 3.8 27B na uređaju: rezultat u odnosu na prosječno stvarno vrijeme po zadatku za okruženja Computer, Hermes i Pi; oznake točaka prikazuju prosječne tokene po zadatku. Prosjeci tokena koriste izvođenja sa zabilježenim mjerenjima. Brkovi su 95% intervali pouzdanosti.

Tablica 1. Prosječni rezultat ParseBench-100 po kategoriji dokumenta za okruženja Computer, Hermes i Pi s modelom Qwen 3.8 27B na uređaju. Computer vodi u svih pet kategorija.

Okruženje

Grafikon

Raspored

Tablica

Sadržaj teksta

Oblikovanje

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Sužavanje jaza do granice s eskalacijom savjetnika

Čak i s pažljivo dizajniranim okruženjem, najteži zadaci i dalje premašuju mogućnosti kompaktnog modela na uređaju. Za takve zadatke okruženje izlaže alat savjetnika: lokalni model može se konzultirati sa snažnijim modelom granice kada mu je potrebna pomoć s planiranjem, rješavanjem dvosmislenosti, oporavkom od ponovljenih neuspjeha ili provjerom konačnog rezultata.

Lokalni model odlučuje kada će zatražiti savjet, dok orkestrator okruženja zadržava autoritet alata i kontrolira koji se kontekst šalje. Eskalacija je opcionalna. Korisnik odlučuje hoće li je omogućiti i hoće li svaki poziv savjetnika odobriti ručno ili automatski.

Prije poziva savjetnika, okruženje odabire relevantan kontekst, primjenjuje PII klasifikator za označavanje osjetljivih informacija i pokazuje korisniku što bi napustilo uređaj. Savjetnik prima samo odobreni kontekst i vraća tekstualne smjernice; nema izravan pristup datotekama, alatima ili razgovorima uređaja. Ovo poboljšava i trošak i privatnost, a planiramo dodatno istražiti ovaj smjer u budućem radu.

Dijagram eskalacije savjetnika: orkestrator okruženja zadržava autoritet alata i šalje samo odobreni kontekst modelu savjetnika, koji vraća tekstualne smjernice bez izravnog pristupa alatima ili datotekama.
Udaljeno vođenje, lokalna kontrola. Orkestrator okruženja zadržava autoritet alata i šalje samo kontekst odobren za eskalaciju. Savjetnik nema izravan pristup alatima, datotekama ili kanalu odgovora; vraća tekstualne smjernice koje lokalni model može koristiti.

Testiramo ovaj pristup na izazovnim zadacima računalnog inženjerstva, koji zahtijevaju snažno rasuđivanje i gdje lokalni model najčešće podbaci. Za to koristimo Terminal Bench 2.1, popularno referentno mjerilo s 89 zadataka za agente za kodiranje.

Želimo odgovoriti na dva pitanja: koliki dio jaza do modela granice može zatvoriti eskalacija savjetnika i uz koju cijenu. Potpuno lokalni modeli koštaju gotovo nula za izvođenje, budući da se zaključivanje odvija na korisnikovom hardveru. Međutim, jednom kada model počne pozivati savjetnika, počinje stvarati API troškove.

Kao osnovnu liniju za performanse granice koristimo Claude Opus 5 koji radi u lokalnom okruženju; lokalni model je Qwen 3.8 27B. Konačno, uparujemo to dvoje: Qwen 3.8 27B izvršava zadatak i eskalira na savjetnika Claude Opus 5 kada mu je potrebna pomoć. Ne ocjenjujemo eskalaciju savjetnika s Pi ili Hermesom jer nijedan ne nudi ekvivalentan alat savjetnika; dodavanje jednog zahtijevalo bi izmjenu površine njegovih alata i logike orkestracije, tako da rezultat više ne bi predstavljao gotove okruženje.

Eskalacija savjetnika podiže rezultat Computera s 59,6% na 73,0%, što je porast od 13,5 postotnih bodova, uz procijenjeni API trošak od 0,415 USD po izvođenju. Izvođenje samo Claude Opus 5 doseže 82,4% uz 0,65 USD po izvođenju. Eskalacija stoga nadoknađuje otprilike tri petine jaza do granice uz oko dvije trećine troška granice, a korisnik odlučuje kada se isplati napraviti tu trgovinu.

Raspršeni dijagram rezultata Terminal Bench 2.1 u odnosu na API trošak po izvođenju: Qwen 3.8 27B potpuno lokalno, Qwen 3.8 27B sa savjetnikom Claude Opus 5, i sam Claude Opus 5, sve u okruženju Computer.
Omjer troškova i performansi za Terminal Bench 2.1 na 89 zadataka: rezultat u odnosu na API trošak po izvođenju. Sve točke koriste okruženje Computer: Qwen 3.8 27B potpuno lokalno, Qwen 3.8 27B koji eskalira na savjetnika Claude Opus 5, i sam Claude Opus 5. Isprekidane linije prikazuju Pi i Hermes koji izvode isti lokalni model uz nulti API trošak. Brkovi su 95% intervali pouzdanosti dobiveni bootstrapom zadataka; nepotpuna izvođenja boduju se nulom.

Naknadno treniranje za okruženje i rad sa znanjem

Do sada smo zadržali lokalni model nepromijenjenim kako bismo izdvojili ono što okruženje doprinosi. S postavljenim dizajnom okruženja, najveći preostali dobici dolaze od prilagodbe samog modela. Podaci o korištenju Perplexity Computera pokazuju nam što ljudi zapravo rade za rad sa znanjem, što koristimo za sintetiziranje podataka za obuku. Naknadno obučavamo lokalni model unutar Computer okruženja, vodeći se stvarnom distribucijom zadataka koje korisnici obavljaju.

Konkretno, identificiramo raznolik skup slučajeva korištenja koji koriste različite mogućnosti modela, alate i konektore. Iz ovih slučajeva korištenja sintetiziramo realistična okruženja učenja potkrepljivanjem i definiramo izazovne, ali provjerljive zadatke: svaki se zadatak sastoji od uputa, okruženja i provjerivača koji ocjenjuje konačni rezultat, pri čemu je okruženje Docker spremnik u kojem okruženje radi. Važno je napomenuti da, budući da su zadaci sintetički, ne sadrže stvarne dokumente ili korisničke informacije.

Koristimo ova okruženja za dvostupanjsku obuku: fino podešavanje odbacivanjem praćeno učenjem potkrepljivanjem. U prvoj fazi, pokrećemo model protiv svakog zadatka više puta, odabiremo najbolje putanje prema ocjeni provjerivača i obučavamo se na njima uz nadzirano učenje. Ova faza inicijalizira model za određeno okruženje i distribuciju zadataka. U drugoj fazi, učenje potkrepljivanjem dodatno fino podešava model, čineći ga otpornijim.

Podskup zadataka se izostavlja iz obuke i koristi se za konačnu ocjenu; ovaj izostavljeni skup nazivamo Local Knowledge Work Bench: 53 zadatka koji obuhvaćaju sedam kategorija svakodnevnog rada sa znanjem, od dubinskog istraživanja do izrade dokumenata. Uskoro ćemo objaviti tehničko izvješće koje detaljno opisuje obuku modela, a planiramo i otvoriti kod ovog referentnog mjerila za ocjenjivanje.

Naknadno smo obučili Qwen 3.8 27B s ovim pristupom, stvarajući model koji zovemo PPLX 27B, i ocijenili ga na Local Knowledge Work Bench. S osnovnim modelom Qwen 3.8 27B, Computer postiže najviši rezultat (82,6%, u usporedbi sa 77,6% za Pi i 74,0% za Hermes) i koristi najmanje tokena (520 tisuća, naspram 681 tisuću za Pi i 634 tisuće za Hermes). Pi najbrže dovršava zadatke sa 176 sekundi po zadatku, u usporedbi s 218 sekundi za Computer i 292 sekunde za Hermes. PPLX 27B podiže rezultat Computera na 85,4%, uz cijenu više tokena (678 tisuća naspram 520 tisuća). Njegovo procijenjeno stvarno vrijeme je 250 sekundi.

Raspršeni dijagram rezultata Local Knowledge Work Bench u odnosu na prosječno stvarno vrijeme po zadatku; PPLX 27B koji se izvodi u Computeru dostiže najviši rezultat od 85,4%.
Rezultati naknadne obuke na Local Knowledge Work Bench: rezultat u odnosu na prosječno stvarno vrijeme po zadatku; oznake točaka prikazuju okruženje, model i prosječne tokene po zadatku. PPLX 27B je naš model nakon obuke, koji se izvodi u Computeru. Brkovi su 95% intervali pouzdanosti preko 53 zadatka s tri pokušaja svaki.

Tablica 2. Kategorije zadataka za Local Knowledge Work Bench.

Kategorija

Zadaci

Udio

Opis

Dubinsko istraživanje

20

37,7%

Odgovorite na složena pitanja koja zahtijevaju web istraživanje s više skokova, javne skupove podataka, statistiku i provjeru izvora.

Podaci, financije i nabava

9

17,0%

Očistite skupove podataka, uskladite evidencije, revidirajte troškove, analizirajte ulaganja, ocijenite dobavljače i izračunajte financijske pokazatelje.

Dokumenti, prezentacije i dizajn

7

13,2%

Izradite dotjerane PDF-ove, račune, materijale za uvođenje u posao, promotivne materijale za događaje i poslovne prezentacije.

Inženjerstvo, IT i incidenti

5

9,4%

Istražite incidente, analizirajte zapise, napišite planove oporavka, procijenite spremnost za izdanje i sintetizirajte tehničku dokumentaciju.

Ugovori, dokazi i usklađenost

5

9,4%

Pregledajte ugovore, pregledajte dokaze, istražite opozive, zacrnite osjetljive dokumente i provjerite zahtjeve usklađenosti.

Nadzorne ploče, softver i vizualizacija

4

7,5%

Izgradite interaktivne nadzorne ploče, obrazovne mikrostranice, grafikone i vizualizacije projekata.

Ljudi, projekti i sastanci

3

5,7%

Pregledajte životopise, konsolidirajte odluke sa sastanaka i održavajte praćenje radnji projekta.

Ukupno

53

100%

Zaključak

Naše istraživanje pokazuje da snažan model otvorenog koda, s sposobnim lokalnim hardverom i okruženjem izgrađenim za njih, može podnijeti stvarni rad sa znanjem uz trošak zaključivanja blizak nuli bez potrebe da osjetljivi podaci napuste uređaj.

Kroz različita referentna mjerila, Computer se podudarao s Hermesom i Pijem ili ih je premašivao u točnosti dok je izvodio Qwen 3.8 27B na NVIDIA DGX Spark. Među tri referentna mjerila koja izvještavaju o latenciji i upotrebi tokena, Computer je bio najbrži na BrowseComp i ParseBench-100 te je koristio najmanje tokena na sva tri; Pi je bio najbrži na Local Knowledge Work Bench.

Dobici su došli iz izbora koje smo napravili. Izgradili smo sažeto lokalno okruženje s vještinama koje se učitavaju na zahtjev. Pretvorili smo konektore u kompaktne CLI alate umjesto MCP poslužitelja. Izvođenje je bilo smješteno u pješčanik radi sigurnosti.

Rezultati također pokazuju gdje kompaktni modeli imaju prostora za poboljšanje. Na primjer, na izazovnim zadacima kodiranja Terminal Bench 2.1, lokalni model zaostaje za modelom granice kroz sva tri okruženja. Eskalacija savjetnika sužava, ali ne zatvara u potpunosti jaz; i dalje su potrebna stalna poboljšanja u mogućnostima modela i lokalnom hardveru kako bi se performanse pomaknule dalje.

Svrha izgradnje okruženja i modela za lokalna ograničenja je dati korisnicima eksplicitnu kontrolu nad time koje informacije napuštaju njihove strojeve. Postoje i koristi u troškovima za korisnika. Vidimo ovo kao dio šire promjene u kojoj sve sposobniji agenti prelaze s udaljene infrastrukture na pojedinačne i lokalne uređaje. Očekujemo da će napredak u čipovima, modelima i uređajima kontinuirano širiti raspon i kvalitetu rada sa znanjem kojim Portable Computer upravlja lokalno.