Lokalni agent za privatni i isplativ rad sa znanjem
Okruženje i model dizajnirani za lokalni rad sa znanjem, koji rade na uređaju i pristupaju udaljenim sposobnostima na zahtev.
Perplexity Portable Computer je agent sa primarnim fokusom na lokalno okruženje.
Ceo stak se podrazumevano izvršava lokalno. Model, okruženje za izvršavanje, konverzacija i putanja se nalaze na mašini korisnika. Rad koji zahteva spoljni svet, kao što su veb pretraga, konektori ili eskalacija na snažniji model savetnika u oblaku, pokreće se samo kada je neophodno i uvek uz odobrenje korisnika. Osetljivi podaci stoga nikada ne napuštaju uređaj bez dozvole, a lokalni modeli nemaju troškove zaključivanja: sistem je privatan i isplativ samom svojom konstrukcijom.
Efektivan agent sa primarnim fokusom na lokalno okruženje zahteva da model i okruženje za izvršavanje budu dizajnirani zajedno. Okruženja opšte namene podrazumevaju model na granici mogućnosti koji može da apsorbuje duge kontekste, da se kreće po širokoj površini alata i da planira na dugim horizontima. Lokalni modeli su manje pouzdani pod tim zahtevima. Umesto da tražimo od malog modela da upravlja okruženjem napravljenim za veliki, oblikovali smo to dvoje jedno oko drugog: okruženje prilagođeno profilu sposobnosti modela i model naknadno obučen da efikasno koristi to okruženje.
Uvod
Sposobnosti agenata su poslednjih meseci brzo napredovale u širokom spektru zadataka radnog znanja. Iako ovi napreci donose velika poboljšanja u produktivnosti i efikasnosti, oni takođe donose dva izazova.
Potrošnja tokena brzo raste, a sa njom i ukupni troškovi. Kada se inteligenciji pristupa preko API-ja modela zatvorenog koda koji se izvršavaju na udaljenim klasterima, privatne informacije i intelektualna svojina napuštaju korisnikov uređaj sa svakim zahtevom. Kako agenti skaliraju kroz pojedinačne radne tokove i čitave organizacije, potrošnja tokena i kretanje podataka postaju sve teži za upravljanje.
U isto vreme, modeli otvorenog koda su se poboljšali još bržom stopom. Napredak je najočigledniji kod vrlo malih i efikasnih modela kao što su NVIDIA Nemotron 3.5 Lightning (ukupno 30B parametara), Qwen 3.6 (35B) i Qwen 3.8 (27B). Ovi mali modeli nadmašuju svoju kategoriju i sada su sposobni za složene radne tokove agenata. Hardver za lokalno zaključivanje napreduje paralelno: sistemi kao što je NVIDIA DGX Spark sada mogu lokalno da pokreću ove modele. Zajedno, ovi trendovi čine rad u potpunosti na uređaju praktičnim, istovremeno omogućavajući korisnicima da se opredele za spoljne sposobnosti kada je to potrebno, kao što su veb pretraga, konektori ili eskalacija na model u oblaku.
Ovaj pristup sa primarnim fokusom na lokalno okruženje omogućava značajnu uštedu troškova, pošto lokalno zaključivanje izbegava API naknade po tokenu. On takođe prirodno rešava probleme privatnosti i intelektualne svojine: privatni tokeni nikada ne moraju da se prenose na udaljene klastere i ostaju bezbedno unutar granica lokalnog uređaja.
U junu smo predstavili prvi hibridni orkestrator lokalnog i serverskog zaključivanja koji odlučuje koji rad treba da se izvršava na uređaju, a koji rad treba da ide agentima u oblaku. Ovde objašnjavamo kako smo izgradili takvog agenta sa primarnim fokusom na lokalno okruženje, uključujući okruženje za izvršavanje i modele koji su međusobno optimizovani.
Dajemo pregled ključnih izbora dizajna, procenjujemo Computer u odnosu na popularna okruženja opšte namene otvorenog koda (Hermes i Pi) kroz tri javna referentna testiranja i naš interni Local Knowledge Work Bench. Na našem referentnom testiranju, sa modelom Qwen 3.8 27B koji radi na NVIDIA DGX Spark-u, Computer postiže najviši rezultat, 82,6% u poređenju sa 77,6% za Pi i 74,0% za Hermes. PPLX 27B, naš model naknadno obućen povrh Qwen 3.8 27B, dodatno podiže rezultat na 85,4%.
Dizajnirajte okruženje za izvršavanje oko lokalnog modela
Iako su kompaktni modeli na uređaju već prilično sposobni, oni i dalje zaostaju za većim modelima na granici mogućnosti u performansama. Pažljivo dizajnirano okruženje za izvršavanje je neophodno da bi se ovi modeli efikasno usmeravali i da bi se rešila njihova ograničenja.
Popularna okruženja otvorenog koda kao što su Pi i Hermes pokazala su se opštim: dobro rade sa širokim izborom modela svih veličina i klasa. Ali oni nisu optimizovani za sposobnosti modela na uređaju. Dizajnirali smo lokalno okruženje posebno za ovo okruženje, oko nekoliko ključnih principa.
Efikasnost konteksta
Glavni fokus u dizajnu našeg okruženja za izvršavanje bio je da se na najbolji način iskoristi kontekst modela.
Iako modeli na uređaju kao što je Qwen 3.8 27B nude prozore konteksta od 260K tokena, empirijski smo utvrdili da počinju da se muče preko 100K tokena. Zbog toga osnovno okruženje držimo sažetim: minimalni sistemski upit i mali skup osnovnih alata.
Sve druge sposobnosti su modularizovane u veštine koje se učitavaju na zahtev i učitavaju i isključuju tokom cele putanje. Ove veštine smo dizajnirali za uobičajene zadatke radnog znanja: istraživanje, nauku o podacima, vizuelizaciju podataka, kreiranje dokumenata, softversko inženjerstvo i još mnogo toga.
Okruženje za izvršavanje takođe podržava kompaktnost konteksta, sumirajući zastareli kontekst kada putanja postane duga kako bi model ostao unutar svog efektivnog prozora.
Konektori kao alati komandne linije
Svakodnevni rad sa znanjem često zahteva konektore kao što su Gmail, GitHub, Outlook i Google Calendar. Oni su obično izloženi okruženju za izvršavanje kao MCP serveri, čije velike definicije alata troše značajan udeo konteksta. Umesto toga, konvertovali smo najčešće korišćene MCP-ove u kompaktne alate komandne linije lake za korišćenje, dopunjene prilagođenim veštinama koje mnogo bolje koriste ograničeni efektivni kontekst.
Samoverifikacija
Performanse se takođe poboljšavaju kada agent sam verifikuje svoj rad. Verifikacija dodaje dodatne korake, ali u velikoj meri poboljšava konačne rezultate i značajno sužava jaz u odnosu na modele na granici mogućnosti. Može je pokrenuti sam model ili skup hvataljki koje prate zdravlje putanje i traže samoverifikaciju kada nešto pođe po zlu.
Izvršavanje u sandboksu
Okruženje za izvršavanje pokreće alate u sandboksu na nivou operativnog sistema na uređaju korisnika. Granica ograničava procese, putanje fajlova sistema datoteka i mrežni pristup u skladu sa politikom. Ovo ograničava radijus udara pogrešne komande. Ako sandboks nije dostupan, okruženje za izvršavanje se samo isključuje pre bilo kakvih poziva alata umesto da prelazi na izvršavanje van sandboksa.
Ovo se razlikuje od okruženja otvorenog koda kao što su Pi i Hermes, koja podrazumevano pokreću komande direktno sa dozvolama korisnika. U Computer-u, izolacija je uvek uključena, ne zahteva nikakvu konfiguraciju i alati ne mogu da rade bez nje.
Dijagram ispod prikazuje kako se ovi principi uklapaju u petlju izvršavanja. Orkestrator je deterministički kod okruženja za izvršavanje, a ne LLM: on održava petlju, sastavlja kontekst i sprovodi politiku. Lokalni model predlaže sledeću radnju; orkestrator izvršava odobrene pozive alata u sandboksu i vraća njihove rezultate modelu. Veb pretraga, konektori i pozivi savetniku prelaze granicu uređaja samo kada su omogućeni i odobreni.
Lokalno okruženje izvlači više iz istog modela
Koristeći isti bazni model na uređaju, upoređujemo naše lokalno okruženje sa alternativama opšte namene na veb istraživanju i multimodalnom razumevanju dokumenata. Sva okruženja koriste model Qwen 3.8 27B sa srednjim zaključivanjem, koji radi na NVIDIA DGX Spark-u. Ovo poređenje izdvaja sposobnosti koje doprinosi samo okruženje za izvršavanje, pre bilo kakvog naknadnog obučavanja modela.
Fokusiramo se na ove dve sposobnosti zato što rad sa znanjem često kombinuje privatne dokumente na uređaju korisnika sa javnim informacijama sa veba radi proizvodnje utemeljenog artefakta. Veb pretraga zahteva povezanost, ali zaključivanje modela i obrada privatnih dokumenata ostaju lokalni. Lokalni fajlovi služe kao merodavni izvor, javni izvori dodaju kontekst, a korisnici mogu u potpunosti da onemoguće veb pretragu za rad u potpunosti van mreže.
Veb istraživanje
Gradimo naše lokalno okruženje uz pretraživač kompanije Perplexity, koji je postigao najviše rangove u nezavisnim procenama. Okruženje mu pristupa preko interfejsa Search as Code.
Procenjujemo kvalitet istraživanja na 1.266 BrowseComp zadataka. Computer koristi Perplexity-jevu infrastrukturu za pretragu zajedno sa našim lokalnim okruženjem, dok se Pi i Hermes oslanjaju na Brave, svog preporučenog provajdera pretrage. Computer dostže tačnost od 66,7%, u poređenju sa 50,2% za Pi i 43,9% za Hermes.
Computer takođe ima najniže srednje zabeleženo vreme izvršavanja i upotrebu tokena: 402,1 sekundu i 852k tokena po zadatku, u poređenju sa 1.020,9 sekundi i 1,01 milion tokena za Hermes, i 826,0 sekundi i 2,82 miliona tokena za Pi. Computer stoga koristi 61% manje vremena izvršavanja i 16% manje tokena od Hermesa, i 51% manje vremena izvršavanja i 70% manje tokena od Pi-ja.
Multimodalno razumevanje dokumenata na uređaju
Mnogi dokumenti nose informacije vizuelno i teško ih je analizirati kao običan tekst: PDF-ovi, skenirane stranice, snimci ekrana, grafikoni i prezentacije. Ovi radni tokovi zavise od OCR-a i razumevanja slika, i najviše imaju koristi od izvornog multimodalnog modela.
Okruženje za izvršavanje prosleđuje stranice dokumenata i slike direktno modelu, koji ih razume i kombinuje vizuelne dokaze sa ekstrahovanim tekstom. Obrada ovih fajlova na uređaju održava osetljive dokumente i njihov ekstrahovani sadržaj privatnim.
Procenjujemo multimodalno razumevanje dokumenata na ParseBench-100, podskupu od 100 zadataka ParseBench referentnog testiranja, sa po 20 zadataka za grafikone, raspored, tabele, sadržaj teksta i formatiranje.
Computer dostiže srednji rezultat od 65,1%, u poređenju sa 34,6% za Hermes i 13,9% za Pi. On takođe završava zadatke sa najmanje vremena i najmanje tokena: u proseku 60,6 sekundi i 20,1k tokena po zadatku, u poređenju sa 108,3 sekunde i 32,1k tokena za Hermes, i 410,5 sekundi i 829,1k tokena za Pi. Computer vodi u svih pet kategorija dokumenata, sa najvećom prednošću na grafikonima. Raspored ostaje težak za sva tri okruženja za izvršavanje.
Tabela 1. Srednji rezultat za ParseBench-100 po kategoriji dokumenata za Computer, Hermes i Pi okruženja sa modelom Qwen 3.8 27B na uređaju. Computer vodi u svih pet kategorija.
Okruženje | Grafikon | Raspored | Tabela | Sadržaj teksta | Formatiranje |
Computer | 76,5% | 16,2% | 72,7% | 87,9% | 72,4% |
Hermes | 29,3% | 2,9% | 44,1% | 61,5% | 35,2% |
Pi | 2,5% | 0,1% | 11,0% | 29,7% | 26,1% |
Sužavanje jaza u odnosu na granicu mogućnosti pomoću eskalacije savetniku
Čak i sa pažljivo dizajniranim okruženjem za izvršavanje, najteži zadaci i dalje prevazilaze sposobnosti kompaktnog modela na uređaju. Za takve zadatke, okruženje izlaže alat savetnika: lokalni model može da se posavetuje sa jačim modelom na granici mogućnosti kada mu je potrebna pomoć oko planiranja, rešavanja dvosmislenosti, oporavka od ponovljenih neuspeha ili verifikacije konačnog rezultata.
Lokalni model odlučuje kada će zatražiti savet, dok orkestrator okruženja zadržava autoritet nad alatima i kontroliše koji se kontekst šalje. Eskalacija je opciona. Korisnik odlučuje da li će je omogućiti i da li će odobriti svaki poziv savetniku ručno ili automatski.
Pre poziva savetniku, okruženje bira relevantan kontekst, primenjuje PII klasifikator za označavanje osetljivih informacija i pokazuje korisniku šta bi napustilo uređaj. Savetnik prima samo odobreni kontekst i vraća tekstualne smernice; nema direktan pristup fajlovima, alatima ili konverzacijama uređaja. Ovo poboljšava i troškove i privatnost, i planiramo da dalje istražimo ovaj pravac u budućem radu.
Testiramo ovaj pristup na izazovnim zadacima softverskog inženjerstva, koji zahtevaju jako zaključivanje i gde lokalni model najčešće podbaci. Za ovo koristimo Terminal Bench 2.1, popularno referentno testiranje sa 89 zadataka za agente za kodiranje.
Želimo da odgovorimo na dva pitanja: koliki deo jaza do modela na granici mogućnosti eskalacija savetniku može da zatvori i po kojoj ceni. Potpuno lokalni modeli ne koštaju praktično ništa za rad, pošto se zaključivanje odvija na hardveru korisnika. Međutim, kada model počne da poziva savetnika, počinje da akumulira troškove API-ja.
Kao osnovnu liniju za performanse na granici mogućnosti, koristimo Claude Opus 5 koji radi u lokalnom okruženju; lokalni model je Qwen 3.8 27B. Konačno, uparujemo to dvoje: Qwen 3.8 27B izvršava zadatak i eskalira do savetnika Claude Opus 5 kada mu je potrebna pomoć. Ne procenjujemo eskalaciju savetniku sa Pi-jem ili Hermesom zato što nijedan ne obezbeđuje ekvivalentan alat savetnika; dodavanje jednog zahtevalo bi izmenu njegove površine alata i logike orkestracije, tako da rezultat više ne bi predstavljao standardno okruženje.
Eskalacija savetniku podiže rezultat Computer-a sa 59,6% na 73,0%, što je povećanje od 13,5 procentnih poena, uz procenjenu API cenu od 0,415 USD po pokretanju. Pokretanje samo modela Claude Opus 5 dostiže 82,4% uz 0,65 USD po pokretanju. Eskalacija tako nadoknađuje otprilike tri petine jaza do granice mogućnosti po ceni od oko dve treućine troškova granice, a korisnik odlučuje kada se taj kompromis isplati.
Naknadno obučavanje za okruženje i rad sa znanjem
Do sada smo držali lokalni model nepromenjenim kako bismo izdvojili šta okruženje doprinosi. Sa uspostavljenim dizajnom okruženja, najveći preostali dobici dolaze od prilagođavanja samog modela. Podaci o korišćenju Perplexity Computer-a nam pokazuju šta ljudi zapravo rade za rad sa znanjem, što koristimo za sintezu podataka za obuku. Naknadno obučavamo lokalni model unutar Computer okruženja, vođeni stvarnom distribucijom zadataka koje korisnici obavljaju.
Konkretno, identifikujemo raznolik skup slučajeva upotrebe koji isprobavaju različite sposobnosti modela, alate i konektore. Iz ovih slučajeva upotrebe sintetišemo realistična okruženja za učenje sa potkrepljenjem i definišemo izazovne, ali proverljive zadatke: svaki zadatak se sastoji od instrukcije, okruženja i verifikatora koji boduje konačni rezultat, pri čemu je okruženje Docker kontejner u kojem okruženje radi. Važno je naglasiti da, pošto su zadaci sintetički, oni ne sadrže nikakve stvarne dokumente ili korisničke informacije.
Koristimo ova okruženja za dvostepenu obuku: fino podešavanje odbacivanjem praćeno učenjem sa potkrepljenjem. U prvoj fazi, pokrećemo model u odnosu na svaki zadatak više puta, biramo najbolje putanje prema rezultatu verifikatora i obučavamo ga pomoću nadgledanog učenja. Ova faza inicijalizuje model za specifično okruženje i distribuciju zadataka. U drugoj fazi, učenje sa potkrepljenjem dodatno fino podešava model, čineći ga robusnijim.
Podskup zadataka je izdvojen iz obuke i koristi se za konačnu procenu; ovaj izdvojeni skup nazivamo Local Knowledge Work Bench: 53 zadatka koji obuhvataju sedam kategorija svakodnevnog rada sa znanjem, od dubokog istraživanja do kreiranja dokumenata. Uskoro ćemo objaviti tehnički izveštaj koji detaljno opisuje obuku modela i planiramo da otvorimo kod ovog referentnog testiranja.
Naknadno smo obučili Qwen 3.8 27B sa ovim pristupom, proizvodeći model koji zovemo PPLX 27B, i procenili smo ga na Local Knowledge Work Bench-u. Sa osnovnim modelom Qwen 3.8 27B, Computer postiže najviši rezultat (82,6%, u poređenju sa 77,6% za Pi i 74,0% za Hermes) i koristi najmanje tokena (520k, naspram 681k za Pi i 634k za Hermes). Pi najbrže završava zadatke za 176 sekundi po zadatku, u poređenju sa 218 sekundi za Computer i 292 sekunde za Hermes. PPLX 27B podiže rezultat Computer-a na 85,4%, uz cenu više tokena (678k naspram 520k). Njegovo procenjeno vreme izvršavanja je 250 sekundi.
Tabela 2. Kategorije zadataka za Local Knowledge Work Bench.
Kategorija | Zadaci | Udeo | Opis |
Duboko istraživanje | 20 | 37,7% | Odgovorite na složena pitanja koja zahtevaju veb istraživanje u više koraka, javne skupove podataka, statistiku i verifikaciju izvora. |
Podaci, finansije i nabavka | 9 | 17,0% | Očistite skupove podataka, uskladite evidencije, revidirajte troškove, analizirajte investicije, procenite dobavljače i izračunajte finansijske metrike. |
Dokumenti, prezentacije i dizajn | 7 | 13,2% | Napravite doterane PDF-ove, fakture, materijale za uvođenje u posao, promotivni materijal za događaje i poslovne prezentacije. |
Inženjerstvo, IT i incidenti | 5 | 9,4% | Istražite incidente, analizirajte evidencije (logove), napišite planove oporavka, procenite spremnost za izdavanje i sintetišite tehničku dokumentaciju. |
Ugovori, dokazi i usklađenost | 5 | 9,4% | Pregledajte ugovore, proverite dokaze, istražite opozive, redigujte osetljive dokumente i verifikujte zahteve usklađenosti. |
Kontrolne table, softver i vizuelizacija | 4 | 7,5% | Izgradite interaktivne kontrolne table, obrazovne mikrosajtove, grafikone i vizuelizacije projekata. |
Ljudi, projekti i sastanci | 3 | 5,7% | Pregledajte radne biografije (CV), konsolidujte odluke sa sastanaka i održavajte pratioce radnji na projektu. |
Ukupno | 53 | 100% |
Zaključak
Naše istraživanje pokazuje da snažan model otvorenog koda, sa sposobnim lokalnim hardverom i okruženjem napravljenim za njih, može da se nosi sa stvarnim radom sa znanjem uz troškove zaključivanja blizu nule, bez potrebe da osetljivi podaci napuste uređaj.
Kroz različita referentna testiranja, Computer se poklopio sa Hermesom i Pi-jem ili ih je nadmašio u tačnosti dok je pokretao Qwen 3.8 27B na NVIDIA DGX Spark-u. Među tri referentna testiranja koja izveštavaju o latenciji i upotrebi tokena, Computer je bio najbrži na BrowseComp-u i ParseBench-100 i koristio je najmanje tokena na sva tri; Pi je bio najbrži na Local Knowledge Work Bench-u.
Dobici su došli iz izbora koje smo napravili. Izgradili smo sažeto lokalno okruženje sa veštinama koje se učitavaju na zahtev. Konvertovali smo konektore u kompaktne CLI alate umesto MCP servera. Izvršavanje je bilo u sandboksu radi bezbednosti.
Rezultati takođe pokazuju gde kompaktni modeli imaju prostora za poboljšanje. Na primer, na izazovnim zadacima kodiranja u Terminal Bench 2.1, lokalni model zaostaje za modelom na granici mogućnosti u sva tri okruženja. Eskalacija savetniku sužava, ali ne zatvara u potpunosti jaz; dalja poboljšanja u sposobnostima modela i lokalnom hardveru su i dalje neophodna da bi se performanse pomerile dalje.
Svrha izgradnje okruženja i modela za lokalna ograničenja jeste da se korisnicima dâ eksplicitna kontrola nad tim koje informacije napuštaju njihove mašine. Takođe postoje pogodnosti u pogledu troškova za korisnika. Smatramo da su ovo deo šire promene u kojoj sve sposobniji agenti prelaze sa udaljene infrastrukture na pojedinačne i lokalne uređaje. Očekujemo da će napredak u čipovima, modelima i uređajima kontinuirano proširiti opseg rada sa znanjem koji Portable Computer može lokalno da obradi.