Kohapealne agent privaatseks ja kulutõhusaks teadmussiirde tööks

Kohaliku teadmussiirde töö jaoks loodud raamistik ja mudel, mis töötavad seadmes ja pääsevad nõudmisel ligi kaugfunktsioonidele.

AutoridPerplexity Research

Perplexity Portable Computer on kohapealsel tööl põhinev agent.

Kogu pinu töötab vaikimisi kohapeal. Mudel, rakendusraamistik, vestlus ja trajektoor asuvad kõik kasutaja masinas. Töö, mis vajab välismaailma, nagu veebiotsing, konnektorid või eskaleerimine pilves asuvale tugevamale nõuandemudelile, käivitatakse ainult vajadusel ja alati kasutaja loal. Seetõttu ei lahku tundlikud andmed seadmest kunagi ilma loata ja kohalikel mudelitel puudub järeldustasu: süsteem on olemuselt privaatne ja kulutõhus.

Efektiivne kohapealsel tööl põhinev agent eeldab mudeli ja rakendusraamistiku ühist disaini. Üldotstarbelised rakendusraamistikud eeldavad piirimudelit, mis suudab omandada pikki kontekste, hallata laia tööriistade valikut ja planeerida pika aja jooksul. Kohalikud mudelid on selliste nõuete juures vähem usaldusväärsed. Selle asemel, et paluda väikesel mudelil hallata suure jaoks ehitatud raamistikku, kujundasime need kaks üksteise järgi: mudeli võimekuse profiilile kohandatud raamistik ja selle raamistiku tõhusaks kasutamiseks järeltreeningu läbinud mudel.

Sissejuhatus

Agentide võimekus on viimastel kuudel kiiresti edenenud paljudes teadmussiirde tööülesannetes. Kuigi need edusammud toovad kaasa suure tootlikkuse ja tõhususe kasvu, kaasnevad nendega ka kaks väljakutset.

Tokenite tarbimine kasvab kiiresti ja koos sellega ka üldkulud. Kui intelligentsile pääsetakse juurde kaugtöörühmades töötavate suletud lähtekoodiga mudelite API-de kaudu, lahkuvad konfidentsiaalne teave ja intellektuaalomand kasutaja seadmest iga päringuga. Kuna agendid laienevad üksikute töövoogude ja tervete organisatsioonide ülesteks, muutub tokenite tarbimine ja andmete liikumine üha raskemini kontrollitavaks.

Samal ajal on avatud lähtekoodiga mudelid paranenud veelgi kiiremas tempos. Edusammud on kõige nähtavamad väga väikestes ja tõhusates mudelites, nagu NVIDIA Nemotron 3.5 Lightning (kokku 30B parameetrit), Qwen 3.6 (35B) ja Qwen 3.8 (27B). Need väikesed mudelid ületavad oma kaalukategooriat ja on nüüd võimelised toime tulema keeruliste agentide töövoogudega. Kohapealse järelduse riistvara areneb paralleelselt: sellised süsteemid nagu NVIDIA DGX Spark suudavad neid mudeleid nüüd kohapeal käitada. Need suundumused muudavad täieliku seadmesisese töö praktiliseks, võimaldades samal ajal kasutajatel vajaduse korral valida välised võimalused, nagu veebiotsing, konnektorid või pilvemudelile eskaleerimine.

See kohapealsel tööl põhinev lähenemine võimaldab märkimisväärset kulude kokkuhoidu, kuna kohalik järeldus hoiab ära tokenipõhised API tasud. See lahendab loomulikult ka privaatsuse ja intellektuaalomandiga seotud mured: konfidentsiaalseid tokeneid ei ole vaja kaugserveritesse edastada ja need jäävad turvaliselt kohaliku seadme piiridesse.

Juunis tutvustasime esimest hübriidset kohaliku serveri järelduste orkestraatorit, mis otsustab, milline töö peaks toimuma seadmes ja milline minema pilves olevatele agentidele. Siin selgitame, kuidas me sellise kohapealsel tööl põhineva agendi ehitasime, sealhulgas rakendusraamistiku ja teineteise jaoks optimeeritud mudelid.

Anname ülevaate peamistest disainivalikutest, hinnates Computerit populaarsete avatud lähtekoodiga üldotstarbeliste rakendusraamistikega (Hermes ja Pi) kolmel avalikul võrdlusalusel ja meie sisemisel kohalike teadmiste töö võrdlusalusel (Local Knowledge Work Bench). Meie võrdlusalusel saavutab Qwen 3.8 27B mudeliga, mis töötab NVIDIA DGX Sparkil, Computer kõrgeima skoori: 82.6% versus P-i 77.6% ja Hermese 74.0%. PPLX 27B, meie mudel, mis on läbinud järeltreeningu Qwen 3.8 27B peal, tõstab skoori veelgi 85.4%ni.

Kohalike teadmiste töö võrdlusaluse tulemuste tulpdiagramm: Qwen 3.8 27B-ga Computer, Pi ja Hermese raamistikud ning PPLX 27B-ga Computer, mis saavutab kõrgeima skoori 85.4%.
Skoorid kohalike teadmiste töö võrdlusalusel, mis on meie 53 tüüpilisest igapäevasest teadmussiirde töö ülesandest koosnev võrdlusalus. Iga tulp on NVIDIA DGX Sparkil töötav raamistiku ja mudeli kombinatsioon; PPLX 27B on meie järeltreeningu läbinud mudel. Kolm katset ülesande kohta; vead on 95% usaldusvahemikud.

Kujundage rakendusraamistik kohaliku mudeli ümber

Kuigi kompaktsed seadmesisesed mudelid on juba üsna võimekad, jäävad nad jõudluses siiski suurematele piirimudelitele alla. Nende mudelite tõhusaks juhtimiseks ja nende piirangute ületamiseks on vaja hoolikalt kavandatud raamistikku.

Populaarsed avatud lähtekoodiga raamistikud, nagu Pi ja Hermes, on osutunud üldisteks: need töötavad hästi paljude erinevate mudelite ja klassidega. Kuid need ei ole optimeeritud seadmesiseste mudelite võimekusele. Kujundasime kohaliku raamistiku spetsiaalselt selle keskkonna jaoks, tuginedes mõnele põhiprintsiibile.

Konteksti tõhusus

Meie raamistiku kujundamise peamine fookus oli mudeli konteksti parimal võimalikul viisil kasutamine.

Kuigi seadmesisesed mudelid, nagu Qwen 3.8 27B, pakuvad 260K tokeni suuruseid kontekstiaknaid, leidsime empiiriliselt, et need hakkavad üle 100K tokeni raskustesse sattuma. Seetõttu hoiame põhilise raamistiku lühikesena: minimaalne süsteemiviip ja väike põhitööriistade komplekt.

Kõik muud võimalused on jagatud nõudmisel laaditavateks ja tühjendatavateks oskusteks, mida laaditakse ja eemaldatakse kogu trajektoori vältel. Kujundasime need oskused levinud teadmussiirde tööülesannete jaoks: uurimistöö, andmeteadus, andmete visualiseerimine, dokumentide loomine, tarkvaraarendus ja muu.

Raamistik toetab ka konteksti tihendamist, tehes kokkuvõtte aegunud kontekstist, kui trajektoor pikaks venib, et mudel püsiks oma efektiivses aknas.

Konnektorid käsureatööriistadena

Igapäevane teadmussiirdetöö nõuab sageli konnektoreid, nagu Gmail, GitHub, Outlook ja Google Calendar. Neid esitletakse raamistikule tavaliselt MCP-serveritena, mille suured tööriistade määratlused tarbivad märkimisväärse osa kontekstist. Selle asemel konverteerisime enimkasutatud MCP-d kompaktseteks, hõlpsasti kasutatavateks käsureatööriistadeks, mida täiendavad kohandatud oskused, mis kasutavad piiratud efektiivset konteksti palju paremini ära.

Isekontroll

Jõudlus paraneb ka siis, kui agent kontrollib oma tööd ise. Kontrollimine lisab lisasamme, kuid parandab oluliselt lõpptulemusi ja vähendab oluliselt vahet piirimudelitega. Selle saab käivitada mudel ise või rida konksusid (hooks), mis jälgivad trajektoori tervist ja taotlevad isekontrolli, kui midagi läheb valesti.

Liivakastis täitmine

Raamistik käivitab tööriistu OS-i tasemel liivakastis kasutaja seadmes. Piirang piirab protsesse, failisüsteemi teid ja võrgujuurdepääsu vastavalt poliitikale. See piirab eksliku käsu mõjuala. Kui liivakast pole saadaval, keelab raamistik end enne mis tahes tööriistakutseid, selle asemel et langeda liivakastita täitmisele.

See erineb avatud lähtekoodiga raamistikest, nagu Pi ja Hermes, mis käivitavad käske vaikimisi otse kasutaja õigustega. Computeris on isoleeritus alati sisse lülitatud, ei vaja konfigureerimist ja tööriistad ei saa ilma selleta töötada.

Allolev diagramm näitab, kuidas need põhimõtted täitmistsüklis kokku sobivad. Orkestraator on deterministlik raamistiku kood, mitte LLM: see säilitab tsükli, paneb kokku konteksti ja rakendab poliitikat. Kohalik mudel pakub välja järgmise tegevuse; orkestraator käivitab liivakastis heakskiidetud tööriistakutsed ja tagastab nende tulemused mudelile. Veebiotsing, konnektorid ja nõuandja kutsed ületavad seadme piiri ainult siis, kui need on lubatud ja heaks kiidetud.

Kohaliku raamistiku täitmistsükli diagramm: deterministlik orkestraatori kood paneb kokku konteksti ja käivitab liivakastis olevaid tööriistu, kohalik mudel pakub tegevusi ning seadmevälised teenused on valikulised ja kasutaja poolt lubatud.
Kuidas kohalik raamistik ülesannet täidab. Deterministlik raamistiku kood juhib tsüklit ja liivakastis olevaid tööriistu; kohalik mudel pakub tegevusi. Seadmevälised teenused on valikulised ja kasutaja poolt lubatud.

Kohalik raamistik võtab samast mudelist rohkem välja

Kasutades sama seadmesisest baasmudelit, võrdleme oma kohalikku raamistikku üldotstarbeliste alternatiividega veebiuuringute ja multimodaalse dokumentide mõistmise osas. Kõik raamistikud kasutavad keskmise arutluskäiguga Qwen 3.8 27B mudelit, mis töötab NVIDIA DGX Sparkil. See võrdlus eraldab raamistiku enda panustatud võimed enne mudeli järeltreeningut.

Keskendume nendele kahele võimekusele, kuna teadmussiirde töö ühendab sageli kasutaja seadmes olevad konfidentsiaalsed dokumendid avaliku teabega veebist, et luua põhjendatud artefakt. Veebiotsing nõuab ühenduvust, kuid mudeli järeldus ja konfidentsiaalsete dokumentide töötlemine jäävad kohalikuks. Kohalikud failid on autoriteetne allikas, avalikud allikad lisavad konteksti ja kasutajad saavad täiesti võrguühenduseta töö jaoks veebiotsingu täielikult keelata.

Veebiuuringud

Ehitasime oma kohaliku raamistiku koos Perplexity otsingumootoriga, mis on saavutanud sõltumatutes hindamistes tipptasemel kohad. Raamistik pääseb sellele juurde Search as Code liidese kaudu.

Hindame uurimistöö kvaliteeti 1,266 BrowseCompi ülesandel. Computer kasutab Perplexity otsinguinfrastruktuuri koos meie kohaliku raamistikuga, samas kui Pi ja Hermes tuginetakse nende soovitatud otsinguteenuse pakkuja Brave'ile. Computer saavutab 66.7% täpsuse, võrreldes Pi 50.2% ja Hermese 43.9% ga.

Computeril on ka lühim keskmine salvestatud tegelik aeg ja tokenite kasutus: 402.1 sekundit ja 852k tokenit ülesande kohta, võrreldes Hermese 1,020.9 sekundi ja 1.01 miljoni tokeniga ning Pi 826.0 sekundi ja 2.82 miljoni tokeniga. Seetõttu kasutab Computer 61% vähem tegelikku aega ja 16% vähem tokeneid kui Hermes ning 51% vähem tegelikku aega ja 70% vähem tokeneid kui Pi.

BrowseCompi skoori ja ülesande keskmise tegeliku aja hajutusdiagramm Qwen 3.8 27B-ga Computerile, Hermesele ja Pi-le; Computer saavutab kõrgeima skoori vähima aja ja vähimate tokenitega.
BrowseCompi tulemused seadmesisese Qwen 3.8 27B mudeliga: skoor versus keskmine tegelik aeg ülesande kohta Computeri, Hermese ja Pi raamistike jaoks; punktisildid näitavad keskmisi tokeneid ülesande kohta. Mittetäielikud tulemused saavad nullpunktid ning aja ja tokenite keskmised jätavad välja salvestatud mõõtmisteta väljakutsed. Vead on skoori 95% Wilsoni usaldusvahemikud.

Seadmesisene multimodaalne dokumentide mõistmine

Paljud dokumendid kannavad teavet visuaalselt ja neid on raske lihttekstina parsida: PDF-id, skannitud lehed, ekraanipildid, diagrammid ja esitlused. Need töövood sõltuvad OCR-ist ja piltide mõistmisest ning saavad kõige rohkem kasu olemuslikult multimodaalsest mudelil.

Raamistik edastab dokumendilehed ja pildid otse mudelile, mis mõistab neid ja ühendab visuaalsed tõendid ekstraheeritud tekstiga. Nende failide töötlemine seadmes hoiab konfidentsiaalsed dokumendid ja nende ekstraheeritud sisu privaatsena.

Hindame multimodaalsete dokumentide mõistmist ParseBench-100-l, mis on ParseBenchi võrdlusaluse 100 ülesandest koosnev alamhulka, kus on 20 ülesannet diagrammide, paigutuse, tabelite, tekstisisu ja vormingu kohta.

Computer saavutab keskmiseks skooriks 65.1%, võrreldes Hermese 34.6% ja Pi 13.9% ga. Samuti täidab see ülesandeid vähima aja ja vähimate tokenitega: keskmiselt 60.6 sekundit ja 20.1k tokenit ülesande kohta, võrreldes Hermese 108.3 sekundi ja 32.1k tokeniga ning Pi 410.5 sekundi ja 829.1k tokeniga. Computer juhib kõigis viies dokumendikategoorias, suurima eelisega diagrammide osas. Paigutus jääb kõigi kolme raamistiku jaoks keeruliseks.

ParseBench-100 OCR-i skoori ja ülesande keskmise tegeliku aja hajutusdiagramm Qwen 3.8 27B-ga Computerile, Hermesele ja Pi-le; Computer saavutab kõrgeima skoori vähima aja ja vähimate tokenitega.
ParseBench-100 OCR-i tulemused seadmesisese Qwen 3.8 27B mudeliga: skoor versus keskmine tegelik aeg ülesande kohta Computeri, Hermese ja Pi raamistike jaoks; punktisildid näitavad keskmisi tokeneid ülesande kohta. Tokenite keskmistes kasutatakse salvestatud mõõtmistega käivitamisi. Vead on 95% usaldusvahemikud.

Tabel 1. ParseBench-100 keskmine skoor dokumendikategooria järgi Computeri, Hermese ja Pi raamistike jaoks seadmesisese Qwen 3.8 27B mudeliga. Computer juhib kõigis viies kategoorias.

Raamistik

Diagramm

Paigutus

Tabel

Tekstisisu

Vorming

Computer

76.5%

16.2%

72.7%

87.9%

72.4%

Hermes

29.3%

2.9%

44.1%

61.5%

35.2%

Pi

2.5%

0.1%

11.0%

29.7%

26.1%

Piirimudeli vahe vähendamine nõuandja eskaleerimisega

Isegi hoolikalt kavandatud raamistiku puhul ületavad kõige raskemad ülesanded endiselt kompaktse seadmesisese mudeli võimalusi. Selliste ülesannete jaoks pakub raamistik nõuandja tööriista: kohalik mudel saab konsulteerida tugevama piirimudeliga, kui ta vajab abi planeerimisel, mitmetähenduslikkuse lahendamisel, korduvatest tõrgetest taastumisel või lõpptulemuse kontrollimisel.

Kohalik mudel otsustab, millal nõu küsida, samas kui raamistiku orkestraator säilitab tööriista volitused ja kontrollib, millist konteksti saadetakse. Eskaleerimine on valikuline. Kasutaja otsustab, kas see lubada ja kas kiita iga nõuandja kutse heaks käsitsi või automaatselt.

Enne nõuandja kutsumist valib raamistik välja asjakohase konteksti, rakendab tundliku teabe märgistamiseks PII klassifikaatorit ja näitab kasutajale, mis seadmest lahkuks. Nõuandja saab ainult heakskiidetud konteksti ja tagastab tekstijuhised; sellel puudub otsene juurdepääs seadme failidele, tööriistadele ega vestlustele. See parandab nii kulusid kui ka privaatsust ning plaanime seda suunda tulevastes töödes edasi uurida.

Nõuandja eskaleerimise diagramm: raamistiku orkestraator säilitab tööriista volitused ja saadab nõuandja mudelile ainult kinnitatud konteksti, mis tagastab tekstijuhised ilma otsese juurdepääsuta tööriistadele või failidele.
Kaugjuhised, kohalik juhtimine. Raamistiku orkestraator säilitab tööriista volitused ja saadab ainult eskaleerimiseks kinnitatud konteksti. Nõuandjal puudub otsene juurdepääs tööriistadele, failidele või vastusekanalile; see tagastab tekstijuhised, mida kohalik mudel võib kasutada.

Testime seda lähenemist keerulistes tarkvaraarenduse ülesannetes, mis nõuavad tugevat arutluskäiku ja kus kohalik mudel jääb kõige sagedamini alla. Selleks kasutame kodeerimisagentide jaoks populaarset 89 ülesandega võrdlusalust Terminal Bench 2.1.

Tahame vastata kahele küsimusele: kui suure osa vahest piirimudeliga saab nõuandja eskaleerimisega sulgeda ja millise hinnaga. Täiesti kohalike mudelite käitamine ei maksa peaaegu midagi, kuna järeldus toimub kasutaja riistvaral. Kui aga mudel hakkab nõuandjat kutsuma, hakkavad sellega kaasnema API kulud.

Piirimudeli toimivuse baasjooneks kasutame kohalikus raamistikus töötavat Claude Opus 5-t; kohalik mudel on Qwen 3.8 27B. Lõpuks seome need kaks: Qwen 3.8 27B täidab ülesande ja eskaleerib selle abi vajamisel Claude Opus 5 nõuandjale. Me ei hinda nõuandja eskaleerimist Pi ega Hermesega, kuna kumbki ei paku samaväärset nõuandja tööriista; selle lisamine nõuaks selle tööriistapinna ja orkestreerimisloogika muutmist, nii et tulemus ei esindaks enam standardset raamistikku.

Nõuandja eskaleerimine tõstab Computeri skoori 59.6%-lt 73.0%-le, mis on 13.5 protsendipunktine kasv, hinnangulise API kuluga $0.415 käivitamise kohta. Claude Opus 5 eraldi käitamine saavutab 82.4% kuluga $0.65 käivitamise kohta. Eskaleerimine taastab seega umbes kolmeviiendiku vahest piirini umbes kahe kolmandikuga piiri kulust ja kasutaja otsustab, millal see tehing on tegemist väärt.

Terminal Bench 2.1 skoori ja käivitamise API kulu hajutusdiagramm: Qwen 3.8 27B täiesti kohalik, Qwen 3.8 27B Claude Opus 5 nõuandjaga ja Claude Opus 5 eraldi, kõik Computeri raamistikus.
Terminal Bench 2.1 kulude ja jõudluse suhe 89 ülesandel: skoor versus API kulu käivitamise kohta. Kõik punktid kasutavad Computeri raamistikku: Qwen 3.8 27B täiesti kohalik, Qwen 3.8 27B eskaleerumas Claude Opus 5 nõuandjale ja Claude Opus 5 eraldi. Katkendlikud jooned näitavad Pi-d ja Hermest, kes käitavad sama kohalikku mudelit null-API kuluga. Vead on ülesannete alglaadimise (bootstrap) 95% usaldusvahemikud; mittetäielikud käivitamised saavad nullpunktid.

Järeltreening raamistiku ja teadmussiirde töö jaoks

Siiani oleme hoidnud kohaliku mudeli muutumatuna, et eraldada raamistiku panus. Kui raamistiku disain on paigas, tulevad suurimad ülejäänud võidud mudeli enda kohandamisest. Perplexity Computer kasutusandmed näitavad meile, mida inimesed teadmussiirde tööks tegelikult teevad, mida kasutame treeningandmete sünteesimiseks. Teeme kohalikule mudelile järeltreeningu Computeri raamistiku sees, juhindudes kasutajate tehtavate ülesannete tegelikust jaotusest.

Konkreetselt tuvastame mitmekesise kasutusjuhiste komplekti, mis kasutavad erinevaid mudeli võimalusi, tööriistu ja konnektoreid. Nendest kasutusjuhistest sünteesime realistlikud tugevdatud õppe keskkonnad ja määratleme keerulised, kuid kontrollitavad ülesanded: iga ülesanne koosneb juhisest, keskkonnast ja kontrollijast, mis hindab lõpptulemust, kusjuures keskkond on Dockeri konteiner, milles raamistik töötab. Oluline on märkida, et kuna ülesanded on sünteetilised, ei sisalda need tegelikke dokumente ega kasutajateavet.

Kasutame neid keskkondi kaheastmeliseks treeninguks: tagasilükkamise peenhäälestus, millele järgneb tugevdatud õpe. Esimeses etapis käivitame mudeli iga ülesande vastu mitu korda, valime kontrollija skoori järgi parimad trajektoorid ja treenime nendega juhendatud õppe abil. See etapp lähtestab mudeli konkreetse raamistiku ja ülesannete jaotuse jaoks. Teises etapis häälestab tugevdatud õpe mudelit veelgi, muutes selle vastupidavamaks.

Osa ülesannetest jäetakse treeningust kõrvale ja neid kasutatakse lõplikuks hindamiseks; nimetame seda eraldatud hulka kohalike teadmiste töö võrdlusaluseks (Local Knowledge Work Bench): 53 ülesannet, mis hõlmavad seitset igapäevase teadmussiirde töö kategooriat, alates põhjalikust uuringust kuni dokumentide loomiseni. Avaldame peagi tehnilise aruande, mis kirjeldab mudeli treenimist üksikasjalikult, ja plaanime selle hindamise võrdlusaluse avatud lähtekoodiga avaldada.

Tegime selle lähenemisviisiga Qwen 3.8 27B-le järeltreeningu, luues mudeli, mida nimetame PPLX 27B-ks, ja hindasime seda kohalike teadmiste töö võrdlusalusel. Baasmudeliga Qwen 3.8 27B saavutab Computer kõrgeima skoori (82.6%, võrreldes Pi 77.6% ja Hermese 74.0%) ning kasutab kõige vähem tokeneid (520k, võrreldes Pi 681k ja Hermese 634k-ga). Pi täidab ülesandeid kõige kiiremini, 178 sekundit ülesande kohta, võrreldes Computeri 218 sekundi ja Hermese 292 sekundiga. PPLX 27B tõstab Computeri skoori 85.4%-ni, rohkemate tokenite arvelt (678k võrreldes 520k-ga). Selle hinnanguline tegelik aeg on 250 sekundit.

Kohalike teadmiste töö võrdlusaluse skoori ja ülesande keskmise tegeliku aja hajutusdiagramm; Computeris töötav PPLX 27B saavutab kõrgeima skoori 85.4%.
Järeltreeningu tulemused kohalike teadmiste töö võrdlusalusel: skoor versus keskmine tegelik aeg ülesande kohta; punktisildid näitavad raamistikku, mudelit ja keskmisi tokeneid ülesande kohta. PPLX 27B on meie järeltreeningu läbinud mudel, mis töötab Computeris. Vead on 95% usaldusvahemikud 53 ülesande põhjal, millest igaühel on kolm katset.

Tabel 2. Kohalike teadmiste töö võrdlusaluse ülesannete kategooriad.

Kategooria

Ülesanded

Osa

Kirjeldus

Põhjalik uuring

20

37.7%

Vasta keerulistele küsimustele, mis nõuavad mitme hüppega veebiuuringuid, avalikke andmestikke, statistikat ja allikate kontrollimist.

Andmed, finance ja hanked

9

17.0%

Puhastage andmestikke, kooskõlastage kirjeid, auditeerige kulusid, analüüsige investeeringuid, hinnake tarnijaid ja arvutage finantsnäitajaid.

Dokumendid, esitlused ja disain

7

13.2%

Looge professionaalseid PDF-e, arveid, pardalevõtu materjale, ürituse lisamaterjale ja äriesitlusi.

Tehnika, IT ja intsidentide haldus

5

9.4%

Uurige intsidente, analüüsige logisid, kirjutage taasteplaane, hinnake väljalaskevalmidust ja sünteesige tehnilist dokumentatsiooni.

Lepingud, tõendid ja vastavus

5

9.4%

Vaadake läbi lepinguid, sõeluge tõendeid, uurige tagasikutsumisi, redigeerige tundlikke dokumente ja kontrollige vastavusnõudeid.

Juhtpaneelid, tarkvara ja visualiseerimine

4

7.5%

Ehitage interaktiivseid juhtpaneele, hariduslikke mikrosaite, diagramme ja projekti visualiseeringuid.

Inimesed, projektid ja koosolekud

3

5.7%

Sõeluge CV-sid, koondage koosolekuotsuseid ja hallake projekti tegevuste jälgijaid.

Kokku

53

100%

Kokkuvõte

Meie uuringud näitavad, et tugev avatud lähtekoodiga mudel koos võimeka kohaliku riistvara ja nende jaoks ehitatud raamistikuga suudab toime tulla tõelise teadmussiirde tööga peaaegu nullilähedase järelduskuluga, ilma et konfidentsiaalsed andmed peaksid seadmest lahkuma.

Erinevatel võrdlusalustel vastas Computer täpsuse osas Hermesele ja Pi-le või ületas neid, käitades NVIDIA DGX Sparkil Qwen 3.8 27B-d. Kolmest võrdlusalusest, mis kajastavad latentsust ja tokenite kasutust, oli Computer kõige kiirem BrowseCompil ja ParseBench-100-l ning kasutas kõigil kolmel vähim tokeneid; Pi oli kohalike teadmiste töö võrdlusalusel kõige kiirem.

Saavutused tulenesid meie tehtud valikutest. Ehitasime lühikese kohaliku raamistiku koos oskustega, mis laadivad nõudmisel. Konverteerisime konnektorid MCP serverite asemel kompaktseteks CLI tööriistadeks. Turvalisuse tagamiseks viidi täitmine liivakasti.

Tulemused näitavad ka seda, kus kompaktsetel mudelitel on ruumi paranemiseks. Näiteks Terminal Bench 2.1 keerulistes kodeerimisülesannetes jääb kohalik mudel piirimudelist maha kõigi kolme raamistiku puhul. Nõuandja eskaleerimine kitsendab vahet, kuid ei sulge seda täielikult; mudeli võimekuse ja kohaliku riistvara jätkuv paranemine on endiselt vajalik jõudluse edasiseks tõstmiseks.

Raamistiku ja mudeli ehitamise eesmärk kohalike piirangute jaoks on anda kasutajatele selge kontroll selle üle, milline teave nende masinatest lahkub. Kasutajale on ka kulueeliseid. Näeme neid osana laiemast nihkest, kus üha võimekamad agendid liiguvad kaugtaristult üksikutele ja kohalikele seadmetele. Eeldame, et kiipide, mudelite ja seadmete edusammud laiendavad pidevalt selle teadmussiirde töö ulatust ja kvaliteeti, millega Portable Computer kohapeal hakkama saab.