Lokāli pirmais aģents privātam un izmaksu ziņā efektīvam zināšanu darbam
Karkass un modelis, kas izstrādāti lokālam zināšanu darbam, darbojas ierīcē un pēc pieprasījuma piekļūst attālinātām iespējām.
Perplexity Portable Computer ir lokāli pirmais aģents.
Visa sistēma pēc noklusējuma darbojas lokāli. Modelis, karkass, saruna un trajektorija – viss atrodas lietotāja datorā. Darbs, kam nepieciešama ārpasaole, piemēram, tīmekļa meklēšana, savienotāji vai eskalācija uz jaudīgāku padomdevēja modeli mākonī, tiek izsaukts tikai nepieciešamības gadījumā un vienmēr ar lietotāja atļauju. Tādējādi sensitīvi dati nekad neatstāj ierīci bez atļaujas, un lokālajiem modeļiem nav secināšanas maksas: sistēma pēc savas uzbūves ir privāta un izmaksu ziņā efektīva.
Efektīvam lokāli pirmajam aģentam ir nepieciešams, ka modelis un karkass tiek izstrādāti kopā. Vispārējas nozīmes karkasos tiek pieņemts, ka robežmodelis spēj uztvert garus kontekstus, pārvietoties pa plašu rīku virsmu un plānot ilgtermiņā. Lokālie modeļi šajās prasībās ir mazāk uzticami. Tā vietā, lai liktu mazam modelim pārvaldīt karkasu, kas būvēts lielam modelim, mēs veidojām abus vienu ap otru: karkasam, kas pielāgots modeļa iespēju profilam, un modeli, kas pēcapmācīts šo karkasu izmantot efektīvi.
Ievads
Aģentu iespējas pēdējos mēnešos ir strauji attīstījušās plašā zināšanu darba uzdevumu lokā. Lai gan šie sasniegumi sniedz lielu produktivitātes un efektivitātes pieaugumu, tie rada arī divus izaicinājumus.
Žetonu patēriņš strauji pieaug, un līdz ar to arī kopējās izmaksas. Kad inteliģencei piekļūst, izmantojot attālinātos klasteros darbināmu atvērtā koda modeļu API, privātā informācija un intelektuālais īpašums ar katru pieprasījumu pamet lietotāja ierīci. Ģenerātoriem mērogojoties starp atsevišķām darbplūsmām un veselām organizācijām, žetonu patēriņu un datu kustību kļūst arvien grūtāk pārvaldīt.
Tajā pašā laikā atvērtā koda modeļi ir uzlabojušies vēl straujāk. Progress vislabāk redzams ļoti mazos un efektīvos modeļos, piemēram, NVIDIA Nemotron 3.5 Lightning (30B kopējo parametru), Qwen 3.6 (35B) un Qwen 3.8 (27B). Šie mazie modeļi pārspēj savu svara kategoriju un tagad spēj veikt sarežģītas aģentu darbplūsmas. Lokālās secināšanas aparatūra attīstās paralēli: tādas sistēmas kā NVIDIA DGX Spark tagad var darbināt šos modeļus lokāli. Kopā šīs tendences padara pilnīgu darbību ierīcē praktisku, vienlaikus ļaujot lietotājiem pēc nepieciešamības izvēlēties ārējās iespējas, piemēram, tīmekļa meklēšanu, savienotājus vai mākoņa modeļa eskalāciju.
Šī lokāli pirmā pieeja nodrošina ievērojamu izmaksu ietaupījumu, jo lokālā secināšana ļauj izvairīties no API maksām par katru žetonu. Tā arī dabiski atrisina privātuma un intelektuālā īpašuma problēmas: privātie žetoni nekad nav jāpārraida uz attāliem klasteriem un droši paliek lokālās ierīces robežās.
Jūnijā mēs iepazīstinājām ar pirmo hibrīdo lokālā servera secināšanas orķestratoru, kas izlemj, kuram darbam jānotiek ierīcē un kuram darbam jānonāk mākoņa aģentos. Šeit mēs paskaidrojam, kā mēs izveidojām šādu lokāli pirmo aģentu, tostarp karkasu un modeļus, kas ir kopīgi optimizēti viens otram.
Mēs sniedzam pārskatu par galvenajām dizaina izvēlēm, novērtējam Computer salīdzinājumā ar populāriem atvērtā koda vispārējas nozīmes karkasiem (Hermes un Pi) trīs publiskos salīdzināšanas testos un mūsu iekšējā Local Knowledge Work Bench. Mūsu salīdzināšanas testā ar Qwen 3.8 27B modeli, kas darbojas uz NVIDIA DGX Spark, Computer sasniedz augstāko rezultātu – 82,6%, salīdzinot ar 77,6% Pi un 74,0% Hermes gadījumā. PPLX 27B, mūsu modelis, kas pēcapmācīts virs Qwen 3.8 27B, paceļ rezultātu vēl augstāk līdz 85,4%.
Veidot karkasu ap lokālo modeli
Lai gan kompakti ierīces modeļi jau ir diezgan spējīgi, tie veiktspējas ziņā joprojām atpaliek no lielākiem robežmodeļiem. Ir nepieciešams rūpīgi izstrādāts karkass, lai efektīvi vadītu šos modeļus un risinātu to ierobežojumus.
Populāri atvērtā koda karkasi, piemēram, Pi un Hermes, ir izrādījušies vispārīgi: tie labi darbojas ar visdažādākajiem modeļiem dažādos izmēros un klasēs. Bet tie nav optimizēti ierīces modeļu iespējām. Mēs izstrādājām lokālo karkasu īpaši šim iestatījumam, balstoties uz dažiem pamatprincipiem.
Konteksta efektivitāte
Galvenā uzmanība karkasa izstrādē tika pievērsta tam, lai vislabāk izmantotu modeļa kontekstu.
Lai gan ierīces modeļi, piemēram, Qwen 3.8 27B, piedāvā 260K žetonu konteksta logus, mēs empīriski konstatējām, ka tie sāk saskarties ar grūtībām, pārsniedzot 100K žetonus. Tāpēc mēs saglabājam pamata karkasu kodolīgu: minimālu sistēmas uzvedni un nelielu pamata rīku kopumu.
Visas pārējās iespējas ir modulētas pēcpieprasījuma prasmēs, kas ielādējas un izlādējas visā trajektorijas laikā. Mēs izstrādājām šīs prasmes izplatītiem zināšanu darba uzdevumiem: izpētei, datu zinātnei, datu vizualizācijai, dokumentu izveidei, programmatūras inženierijai un citiem.
Karkass atbalsta arī konteksta sablīvēšanu, apkopojot novecojušu kontekstu, kad trajektorija kļūst gara, lai modelis paliktu tā efektīvā loga robežās.
Savienotāji kā komandrindas rīki
Ikdienas zināšanu darbam bieži ir nepieciešami savienotāji, piemēram, Gmail, GitHub, Outlook un Google Calendar. Tie parasti tiek pakļauti karkasam kā MCP serveri, kuru lielās rīku definīcijas patērē ievērojamu konteksta daļu. Tā vietā mēs pārvērtām visvairāk izmantotos MCP kompaktos, ērti lietojamos komandrindas rīkos, ko papildina pielāgotas prasmes, kas daudz labāk izmanto ierobežoto efektīvo kontekstu.
Pašpārbaude
Veiktspēja uzlabojas arī tad, kad aģents pārbauda savu darbu. Pārbaude pievieno papildu soļus, taču tā būtiski uzlabo gala rezultātus un būtiski samazina atšķirību līdz robežmodeļiem. To var aktivizēt pats modelis vai āķu kopums, kas uzrauga trajektorijas veselību un pieprasa pašpārbaudi, ja kaut kas noiet greizi.
Izpilde smilšu kastē
Karkass izpilda rīkus operētājsistēmas līmeņa smilšu kastē lietotāja ierīcē. Robeža ierobežo procesus, failu sistēmas ceļus un tīkla piekļuvi saskaņā ar politiku. Tas ierobežo kļūdainas komandas ietekmes rādiusu. Ja smilšu kaste nav pieejama, karkass pats sevi atspējo pirms jebkādiem rīka izsaukumiem, nevis degradējas uz izpildi bez smilšu kastes.
Tas atšķiras no atvērtā koda karkasiem, piemēram, Pi un Hermes, kas pēc noklusējuma izpilda komandas tieši ar lietotāja atļaujām. Computer izolācija vienmēr ir ieslēgta, tai nav nepieciešama konfigurācija, un rīki nevar darboties bez tās.
Zemāk redzamajā diagrammā parādīts, kā šie principi sader kopā izpildes cilpā. Orķestrators ir deterministisks karkasa kods, nevis LLM: tas uztur cilpu, apkopo kontekstu un uzspiež politiku. Lokālais modelis piedāvā nākamo darbību; orķestrators izpilda apstiprinātos rīka izsaukumus smilšu kastē un atgriež to rezultātus modelim. Tīmekļa meklēšana, savienotāji un padomdevēja izsaukumi šķērso ierīces robežu tikai tad, kad tie ir iespējoti un apstiprināti.
Lokālais karkass sniedz vairāk no tā paša modeļa
Izmantojot to pašu lokālo bāzes modeli, mēs salīdzinām mūsu lokālo karkasu ar vispārējas nozīmes alternatīvām tīmekļa izpētē un multimodālā dokumentu izpratnē. Visi karkasi izmanto Qwen 3.8 27B modeli ar vidēju argumentāciju, kas darbojas uz NVIDIA DGX Spark. Šis salīdzinājums izolē iespējas, ko sniedz pats karkass pirms jebkādas modeļa pēcapmācības.
Mēs koncentrējamies uz šīm divām iespējām, jo zināšanu darbā privāti dokumenti lietotāja ierīcē bieži tiek apvienoti ar publisku informāciju no tīmekļa, lai radītu pamatotu artefaktu. Tīmekļa meklēšanai ir nepieciešams savienojums, taču modeļa secināšana un privāto dokumentu apstrāde paliek lokāla. Lokālie faili kalpo kā autoritatīvs avots, publiskie avoti pievieno kontekstu, un lietotāji var pilnībā atspējot tīmekļa meklēšanu pilnīgi bezsaistes darbam.
Tīmekļa izpēte
Mēs veidojam savu lokālo karkasu kopā ar Perplexity meklētājprogrammu, kas ir ieguvusi augstākās vietas neatkarīgos novērtējumos. Karkass tai piekļūst, izmantojot Search as Code saskarni.
Mēs novērtējam izpētes kvalitāti 1266 BrowseComp uzdevumos. Computer izmanto Perplexity meklēšanas infrastruktūru kopā ar mūsu lokālo karkasu, savukārt Pi un Hermes paļaujas uz Brave – to ieteikto meklēšanas nodrošinātāju. Computer sasniedz 66,7% precizitāti, salīdzinot ar 50,2% Pi un 43.9% Hermes gadījumā.
Computer ir arī zemākais vidējais reģistrētais laiks un žetonu izmantošana: 402,1 sekunde un 852k žetonu uz vienu uzdevumu, salīdzinot ar 1020,9 sekundēm un 1,01 miljonu žetonu Hermes gadījumā, un 826,0 sekundēm un 2,82 miljoniem žetonu Pi gadījumā. Tāpēc Computer izmanto par 61% mazāk laika un par 16% mazāk žetonu nekā Hermes, un par 51% mazāk laika un par 70% mazāk žetonu nekā Pi.
Multimodālā dokumentu izpratne ierīcē
Daudzi dokumenti satur informāciju vizuāli, un tos ir grūti parsēt kā vienkāršu tekstu: PDF faili, skenētas lapas, ekrānuzņēmumi, diagrammas un prezentācijas. Šīs darbplūsmas ir atkarīgas no OCR un attēlu izpratnes, un tās visvairāk gūst labumu no sākotnēji multimodāla modeļa.
Karkass nodod dokumentu lapas un attēlus tieši modelim, kas tos saprot un apvieno vizuālos pierādījumus ar iegūto tekstu. Šo failu apstrāde ierīcē saglabā sensitīvus dokumentus un to iegūto saturu privātu.
Mēs novērtējam multimodālo dokumentu izpratni ParseBench-100 – 100 uzdevumu apakškopā no ParseBench salīdzināšanas testa, ar 20 uzdevumiem katrai no šādām kategorijām: diagrammas, izkārtojums, tabulas, teksta saturs un formatējums.
Computer sasniedz vidējo rezultātu 65,1%, salīdzinot ar 34,6% Hermes un 13,9% Pi gadījumā. Tas arī izpilda uzdevumus ar mazāko laiku un mazāko žetonu skaitu: vidēji 60,6 sekundes un 20,1k žetonu uz uzdevumu, salīdzinot ar 108,3 sekundēm un 32,1k žetonu Hermes gadījumā, un 410,5 sekundēm un 829,1k žetonu Pi gadījumā. Computer ir līderis visās piecās dokumentu kategorijās, ar lielāko pārsvaru diagrammās. Izkārtojums joprojām ir sarežģīts visiem trim karkasiem.
1. tabula. ParseBench-100 vidējais rezultāts pēc dokumentu kategorijas Computer, Hermes un Pi karkasam ar ierīces Qwen 3.8 27B modeli. Computer ir līderis visās piecās kategorijās.
Karkass | Diagramma | Izkārtojums | Tabula | Teksta saturs | Formatējums |
Computer | 76,5% | 16,2% | 72,7% | 87,9% | 72,4% |
Hermes | 29,3% | 2,9% | 44,1% | 61,5% | 35,2% |
Pi | 2,5% | 0,1% | 11,0% | 29,7% | 26,1% |
Robežas atšķirības samazināšana ar padomdevēja eskalāciju
Pat ar rūpīgi izstrādātu karkasu visgrūtākie uzdevumi joprojām pārsniedz kompakta ierīces modeļa iespējas. Šādiem uzdevumiem karkass piedāvā padomdevēja rīku: lokālais modelis var konsultēties ar jaudīgāku robežmodeli, kad tam nepieciešama palīdzība plānošanā, neskaidrību risināšanā, atkopšanā no atkārtotām kļūmēm vai gala rezultāta pārbaudē.
Lokālais modelis izlemj, kad pieprasīt padomu, savukārt karkasa orķestrators saglabā rīku autoritāti un kontrolē, kāds konteksts tiek nosūtīts. Eskalācija nav obligāta. Lietotājs izlemj, vai to iespējot un vai katru padomdevēja izsaukumu apstiprināt manuāli vai automātiski.
Pirms padomdevēja izsaukuma karkass atlasa attiecīgo kontekstu, lieto PII klasifikatoru, lai atzīmētu sensitīvu informāciju, un parāda lietotājam, kas atstātu ierīci. Padomdevējs saņem tikai apstiprināto kontekstu un atgriež teksta norādījumus; tam nav tiešas piekļuves ierīces failiem, rīkiem vai sarunām. Tas uzlabo gan izmaksas, gan privātumu, un mēs plānojam turpināt izpētīt šo virzienu turpmākajā darbā.
Mēs testējam šo pieeju sarežģītos programmatūras inženierijas uzdevumos, kam nepieciešama spēcīga argumentācija un kur lokālais modelis visbiežāk izrādās nepietiekams. Šim nolūkam mēs izmantojam Terminal Bench 2.1 – populāru 89 uzdevumu salīdzināšanas testu kodēšanas aģentiem.
Mēs vēlamies atbildēt uz diviem jautājumiem: cik lielu daļu no atšķirības līdz robežmodelim var novērst ar padomdevēja eskalāciju un par kādu cenu. Pilnībā lokālu modeļu darbināšana nemaksā gandrīz neko, jo secināšana notiek lietotāja aparatūrā. Tomēr, tiklīdz modelis sāk izsaukt padomdevēju, tas sāk radīt API izmaksas.
Kā bāzes līniju robežas veiktspējai mēs izmantojam Claude Opus 5, kas darbojas lokālajā karkasā; lokālais modelis ir Qwen 3.8 27B. Visbeidzot, mēs savienojam abus: Qwen 3.8 27B izpilda uzdevumu un eskalē uz Claude Opus 5 padomdevēju, kad tam nepieciešama palīdzība. Mēs nevērtējam padomdevēja eskalāciju ar Pi vai Hermes, jo neviens no tiem nenodrošina līdzvērtīgu padomdevēja rīku; tā pievienošana prasītu modificēt tā rīku virsmu un orķestrēšanas loģiku, tāpēc rezultāts vairs neatspoguļotu gatavu karkasu.
Padomdevēja eskalācija paceļ Computer rezultātu no 59,6% līdz 73,0%, kas ir 13,5 procentpunktu pieaugums, ar aptuvenām API izmaksām 0,415 USD apmērā par palaidi. Claude Opus 5 darbināšana atsevišķi sasniedz 82,4% par 0,65 USD par palaidi. Tādējādi eskalācija atgūst aptuveni trīs piektdaļas no atšķirības līdz robežai par aptuveni divām trešdaļām no robežas izmaksām, un lietotājs izlemj, vai šī maiņa ir tā vērta.
Pēcapmācība karkasam un zināšanu darbam
Līdz šim mēs esam saglabājuši lokālo modeli nemainīgu, lai izolētu to, ko sniedz karkass. Kad karkasa dizains ir ieviests, lielākie atlikušie ieguvumi rodas, pielāgojot pašu modeli. Perplexity Computer lietojuma dati parāda, ko cilvēki faktiski dara zināšanu darbā, ko mēs izmantojam apmācības datu sintetizēšanai. Mēs pēcapmācām lokālo modeli Computer karkasā, ko vada reālais lietotāju veikto uzdevumu sadalījums.
Konkrēti, mēs identificējam dažādu lietošanas gadījumu kopumu, kas izmanto dažādas modeļa iespējas, rīkus un savienotājus. No šiem lietošanas gadījumiem mēs sintetizējam reālistiskas pastiprinātas mācīšanās vides un definējam izaicinošus, bet pārbaudāmus uzdevumus: katrs uzdevums sastāv no norādījuma, vides un pārbaudītāja, kas novērtē gala rezultātu, kur vide ir Docker konteiners, kurā darbojas karkass. Svarīgi ir tas, ka, tā kā uzdevumi ir sintētiski, tie nesatur reālus dokumentus vai lietotāja informāciju.
Mēs izmantojam šīs vides divu posmu apmācībai: noraidīšanas smalkajai regulēšanai, kam seko pastiprināta mācīšanās. Pirmajā posmā mēs vairākkārt palaižam modeli pret katru uzdevumu, atlasām labākās trajektorijas pēc pārbaudītāja rezultāta un apmācām tās ar uzraudzītu mācīšanos. Šis posms inicializē modeli konkrētajam karkasam un uzdevumu sadalījumam. Otrajā posmā pastiprinātā mācīšanās vēl vairāk pielāgo modeli, padarot to izturīgāku.
Uzdevumu apakškopa tiek paturēta no apmācības un izmantota gala novērtējumam; mēs saucam šo paturēto kopu par Local Knowledge Work Bench: 53 uzdevumi, kas aptver septiņas ikdienas zināšanu darba kategorijas – no padziļinātas izpēte līdz dokumentu izveidei. Drīzumā mēs publicēsim tehnisko ziņojumu, kurā detalizēti aprakstīta modeļu apmācība, un plānojam atvērt šo novērtēšanas salīdzināšanas testu koda formātā.
Mēs pēcapmācījām Qwen 3.8 27B ar šo pieeju, izveidojot modeli, ko saucam par PPLX 27B, un novērtējām to Local Knowledge Work Bench. Ar bāzes Qwen 3.8 27B modeli Computer sasniedz augstāko rezultātu (82,6%, salīdzinot ar 77,6% Pi un 74,0% Hermes) un izmanto vismazāk žetonu (520k pret 681k Pi un 634k Hermes). Pi pabeidz uzdevumus visātrāk – 176 sekundēs uz uzdevumu, salīdzinot ar 218 sekundēm Computer un 292 sekundēm Hermes. PPLX 27B paceļ Computer rezultātu līdz 85,4% par lielāku žetonu skaitu (678k pret 520k). Tā aptuvenais laiks ir 250 sekundes.
2. tabula. Local Knowledge Work Bench uzdevumu kategorijas.
Kategorija | Uzdevumi | Daļa | Apraksts |
Padziļināta izpēte | 20 | 37,7% | Atbildēt uz sarežģītiem jautājumiem, kam nepieciešama daudzpakāpju tīmekļa izpēte, publiskas datu kopas, statistika un avotu pārbaude. |
Dati, finanses un iepirkumi | 9 | 17,0% | Tīrīt datu kopas, saskaņot ierakstus, auditēt izdevumus, analizēt investīcijas, novērtēt piegādātājus un aprēķināt finanšu rādītājus. |
Dokumenti, prezentācijas un dizains | 7 | 13,2% | Sagatavot noslīpētus PDF failus, rēķinus, ievadapmācības materiālus, pasākumu materiālus un biznesa prezentācijas. |
Inženierija, IT un starpgadījumi | 5 | 9,4% | Izmeklēt starpgadījumus, analizēt žurnālus, rakstīt atkopšanas plānus, novērtēt relīzes gatavību un sintetizēt tehnisko dokumentāciju. |
Līgumi, pierādījumi un atbilstība | 5 | 9,4% | Pārskatīt līgumus, izskatīt pierādījumus, izmeklēt atsaukumus, rediģēt sensitīvus dokumentus un pārbaudīt atbilstības prasības. |
Informācijas paneļi, programmatūra un vizualizācija | 4 | 7,5% | Veidot interaktīvus informācijas paneļus, izglītojošas mikrovietnes, diagrammas un projektu vizualizācijas. |
Cilvēki, projekti un sanāksmes | 3 | 5,7% | Pārbaudīt CV, apkopot sanāksmju lēmumus un uzturēt projektu darbības izsekotājus. |
Kopā | 53 | 100% |
Secinājums
Mūsu pētījums parāda, ka spēcīgs atvērtā koda modelis ar spējīgu lokālo aparatūru un tiem izstrādātu karkasu var paveikt reālu zināšanu darbu par gandrīz nulles secināšanas izmaksām, neprasot sensitīvu datu atstāšanu ierīcē.
Dažādos salīdzināšanas testos Computer atbilda vai pārsniedza Hermes un Pi precizitātē, darbinot Qwen 3.8 27B uz NVIDIA DGX Spark. Starp trim salīdzināšanas testiem, kuros ziņots par latentumu un žetonu izmantošanu, Computer bija ātrākais BrowseComp un ParseBench-100 un izmantoja vismazāk žetonu visos trijos; Pi bija ātrākais Local Knowledge Work Bench.
Ieguvumi radās no mūsu izdarītajām izvēlēm. Mēs uzbūvējām kodolīgu lokālo karkasu ar prasmēm, kas ielādējas pēc pieprasījuma. Mēs pārvērtām savienotājus kompaktos CLI rīkos, nevis MCP serveros. Drošības nolūkos izpilde notika smilšu kastē.
Rezultāti arī parāda jomas, kurās kompaktiem modeļiem ir iespējas uzlabojumiem. Piemēram, sarežģītajos Terminal Bench 2.1 kodēšanas uzdevumos lokālais modelis atpaliek no robežmodeļa visos trijos karkasos. Padomdevēja eskalācija sašaurina, bet pilnībā nenovērš atšķirību; modeļa iespēju un lokālās aparatūras nepārtraukti uzlabojumi joprojām ir nepieciešami, lai virzītu veiktspēju tālāk.
Karkasa un modeļa izveides mērķis lokāliem ierobežojumiem ir sniegt lietotājiem skaidru kontroli pār to, kāda informācija pamet viņu datorus. Lietotājam ir arī izmaksu ieguvumi. Mēs uzskatām, ka tas ir daļa no plašākas maiņas, kurā arvien spējīgāki aģenti pārvietojas no attālinātās infrastruktūras uz individuālām un lokālām ierīcēm. Mēs sagaidām, ka mikroshēmu, modeļu un ierīču sasniegumi nepārtraukti paplašinās to zināšanu darba klāstu un kvalitāti, ko Portable Computer apstrādā lokāli.