Un agent orientat spre local pentru muncă intelectuală privată și eficientă

Un cadru de execuție și un model co-proiectate pentru munca intelectuală locală, care rulează pe dispozitiv și accesează capabilități la distanță la cerere.

AutoriPerplexity Research

Perplexity Portable Computer este un agent centrat pe utilizator, care rulează local.

Întregul pachet rulează local în mod implicit. Modelul, cadrul de execuție, conversația și traiectoria se află toate pe mașina utilizatorului. Munca care necesită lumea exterioară, cum ar fi căutarea pe web, conectori sau escaladarea către un model de consiliere mai puternic din cloud, este invocată numai atunci când este necesar și întotdeauna controlată de utilizator. Prin urmare, datele sensibile nu părăsesc niciodată dispozitivul fără permisiune, iar modelele locale nu implică nici o taxă de inferență: sistemul este privat și eficient din punct de vedere al costurilor prin însăși construcția sa.

Un agent local eficient necesită ca modelul și cadrul de execuție să fie concepute împreună. Cadrele de execuție cu scop general presupun un model de frontieră care poate absorbi contexte lungi, poate naviga printr-o suprafață largă de instrumente și poate planifica pe termen lung. Modelele locale sunt mai puțin fiabile în fața acelor cerințe. În loc să cerem unui model mic să gestioneze un cadru de execuție construit pentru unul mare, le-am modelat pe ambele în funcție unul de celălalt: un cadru de execuție adaptat la profilul de capabilități al modelului și un model antrenat suplimentar pentru a utiliza acest cadru în mod eficient.

Introducere

Capabilitățile de tip agent au avansat rapid în ultimele luni într-o gamă largă de sarcini de muncă intelectuală. Deși aceste progrese aduc câștiguri majore în productivitate și eficiență, ele ridică și două provocări.

Consumul de tokenuri crește rapid, iar odată cu acesta și costurile generale. Atunci când inteligența este accesată prin intermediul API-urilor unor modele cu sursă închisă care rulează pe clustere la distanță, informațiile private și proprietatea intelectuală părăsesc dispozitivul utilizatorului la fiecare cerere. Pe măsură ce agenții se extind în cadrul fluxurilor de lucru individuale și al organizațiilor întregi, consumul de tokenuri și transferul de date devin din ce în ce mai greu de guvernat.

În același timp, modelele open-source s-au îmbunătățit într-un ritm și mai accelerat. Progresul este cel mai vizibil la modelele foarte mici și eficiente, cum ar fi NVIDIA Nemotron 3.5 Lightning (30 de miliarde de parametri totali), Qwen 3.6 (35B) și Qwen 3.8 (27B). Aceste modele mici depășesc așteptările și sunt acum capabile de fluxuri de lucru complexe bazate pe agenți. Hardware-ul pentru inferență locală avansează în paralel: sisteme precum NVIDIA DGX Spark pot rula acum aceste modele local. Împreună, aceste tendințe fac ca operarea exclusiv pe dispozitiv să fie practică, permițând în același timp utilizatorilor să opteze pentru capabilități externe atunci când este necesar, cum ar fi căutarea pe web, conectori sau escaladarea la modele în cloud.

Această abordare bazată pe dispozitiv permite economii semnificative de costuri, deoarece inferența locală evită taxele API per token. De asemenea, soluționează în mod natural problemele legate de confidențialitate și proprietate intelectuală: tokenurile private nu trebuie niciodată transmise către clustere la distanță și rămân în siguranță în limitele dispozitivului local.

În iunie, am introdus primul orchestrator hibrid de inferență local-server care decide ce muncă ar trebui să ruleze pe dispozitiv și ce muncă ar trebui să ajungă la agenții din cloud. Aici explicăm modul în care am construit un astfel de agent orientat spre local, incluzând cadrul de execuție și modelele optimizate reciproc.

Oferim o privire de ansamblu asupra alegerilor cheie de design, evaluând Computer în comparație cu cadre de execuție populare open-source cu scop general (Hermes și Pi) pe baza a trei benchmark-uri publice și a propriului nostru Local Knowledge Work Bench. Pe benchmark-ul nostru, cu modelul Qwen 3.8 27B rulând pe un NVIDIA DGX Spark, Computer obține cel mai mare scor, 82,6% față de 77,6% pentru Pi și 74,0% pentru Hermes. PPLX 27B, modelul nostru post-antrenat deasupra Qwen 3.8 27B, ridică scorul și mai sus, la 85.4%.

Diagramă cu bare a scorurilor Local Knowledge Work Bench: cadrele de execuție Computer, Pi și Hermes cu Qwen 3.8 27B, și Computer cu PPLX 27B, care obține cel mai mare scor la 85,4%.
Scoruri pe Local Knowledge Work Bench, benchmark-ul nostru cu 53 de sarcini reprezentative de muncă intelectuală de zi cu zi. Fiecare bară reprezintă o combinație de cadru de execuție și model care rulează pe un NVIDIA DGX Spark; PPLX 27B este modelul nostru post-antrenat. Trei rulări per sarcină; marcajele reprezintă intervale de încredere de 95%.

Proiectarea cadrului de execuție în jurul modelului local

Deși modelele compacte de pe dispozitiv sunt deja destul de capabile, ele rămân totuși în urmă față de modelele de frontieră mai mari în ceea ce privește performanța. Este nevoie de un cadru de execuție conceput cu atenție pentru a ghida aceste modele în mod eficient și pentru a le adresa limitările.

Cadrele de execuție populare open-source precum Pi și Hermes s-au dovedit a fi generale: funcționează bine cu o mare varietate de modele de diferite dimensiuni și clase. Dar ele nu sunt optimizate pentru capabilitățile modelelor de pe dispozitiv. Am conceput cadrul de execuție local în mod special pentru acest scenariu, pornind de la câteva principii cheie.

Eficiența contextului

Accentul principal în proiectarea cadrului nostru de execuție a fost acela de a profita la maximum de contextul modelului.

Deși modelele de pe dispozitiv, cum ar fi Qwen 3.8 27B, oferă ferestre de context de 260 de mii de tokenuri, am constatat empiric că acestea încep să întâmpine dificultăți dincolo de 100 de mii de tokenuri. Prin urmare, menținem cadrul de execuție de bază concis: un prompt de sistem minimal și un set mic de instrumente de bază.

Toate celelalte capabilități sunt modularizate în abilități la cerere care se încarcă și se descarcă pe parcursul traiectoriei. Am conceput aceste abilități pentru sarcini comune de muncă intelectuală: cercetare, știința datelor, vizualizarea datelor, creare de documente, inginerie software și multe altele.

Cadrul de execuție acceptă, de asemenea, compactarea contextului, rezumând contextul învechit atunci când o traiectorie devine lungă, astfel încât modelul să rămână în fereastra sa efectivă.

Conectori ca instrumente delinie de comandă

Munca intelectuală de zi cu zi necesită adesea conectori precum Gmail, GitHub, Outlook și Google Calendar. Aceștia sunt expuși de obicei unui cadru de execuție sub formă de servere MCP, ale căror definiții mari de instrumente consumă o parte substanțială din context. În schimb, am convertit cele mai utilizate MCP-uri în instrumente de linie de comandă compacte și ușor de utilizat, suplimentate cu abilități personalizate care utilizează mult mai bine contextul efectiv limitat.

Autoverificare

Performanța se îmbunătățește și atunci când agentul își verifică propria muncă. Verificarea adaugă pași suplimentari, dar îmbunătățește considerabil rezultatele finale și reduce substanțial decalajul față de modelele de frontieră. Aceasta poate fi declanșată de modelul însuși sau de un set de cârlige (hooks) care monitorizează starea traiectoriei și solicită autoverificarea atunci când ceva nu merge bine.

Execuție în sandbox

Cadrul de execuție rulează instrumentele într-un sandbox la nivel de sistem de operare pe dispozitivul utilizatorului. Această barieră restricționează procesele, căile din sistemul de fișiere și accesul la rețea în conformitate cu politica. Acest lucru limitează raza de impact a unei comenzi eronate. Dacă sandbox-ul nu este disponibil, cadrul de execuție se dezactivează înainte de orice apel de instrument, în loc să treacă la o execuție nesandboxată.

Acest lucru diferă de cadrele de execuție open-source precum Pi și Hermes, care rulează în mod implicit comenzi direct cu permisiunile utilizatorului. În Computer, izolarea este întotdeauna activată, nu necesită configurare, iar instrumentele nu pot rula fără ea.

Diagrama de mai jos arată cum se îmbină aceste principii în bucla de execuție. Orchestratorul este un cod de cadru determinist, nu un LLM: el menține bucla, asamblează contextul și aplică politica. Modelul local propune următoarea acțiune; orchestratorul execută apelurile de instrumente aprobate în sandbox și returnează rezultatele acestora către model. Căutarea pe web, conectorii și apelurile către consilier trec granița dispozitivului numai atunci când sunt activate și aprobate.

Diagrama buclei de execuție a cadrului de execuție local: codul determinist al orchestratorului asamblează contextul și rulează instrumente în sandbox, modelul local propune acțiuni, iar serviciile din afara dispozitivului sunt opționale și controlate de utilizator.
Modul în care cadrul de execuție local rulează o sarcină. Codul determinist al cadrului controlează bucla și instrumentele din sandbox; modelul local propune acțiuni. Serviciile din afara dispozitivului sunt opționale și controlate de utilizator.

Un cadru de execuție local oferă mai mult de la același model

Folosind același model de bază de pe dispozitiv, comparăm cadrul nostru de execuție local cu alternative cu scop general privind cercetarea pe web și înțelegerea documentelor multimodale. Toate cadrele de execuție utilizează modelul Qwen 3.8 27B cu raționament mediu, rulând pe un NVIDIA DGX Spark. Această comparație izolează capabilitățile aduse de însuși cadrul de execuție, înainte de orice post-antrenare a modelului.

Ne concentrăm pe aceste două capabilități deoarece munca intelectuală combină adesea documente private de pe dispozitivul utilizatorului cu informații publice de pe web pentru a produce un artefact fundamentat. Căutarea pe web necesită conectivitate, dar inferența modelului și procesarea documentelor private rămân locale. Fișierele locale servesc drept sursă autoritară, sursele publice adaugă context, iar utilizatorii pot dezactiva complet căutarea pe web pentru munca efectuată în mod1 offline.

Cercetare pe web

Construim cadrul nostru de execuție local alături de motorul de căutare Perplexity, care a obținut clasări de top în evaluări independente. Cadrul de execuție îl accesează prin interfața Search as Code.

Evaluăm calitatea cercetării pe 1.266 de sarcini BrowseComp. Computer utilizează infrastructura de căutare a Perplexity împreună cu cadrul nostru de execuție local, în timp ce Pi și Hermes se bazează pe Brave, furnizorul lor de căutare recomandat. Computer atinge o acuratețe de 66,7%, comparativ cu 50,2% pentru Pi și 43,9% pentru Hermes.

Computer are, de asemenea, cel mai mic timp mediu de execuție înregistrat și cel mai redus consum de tokenuri: 402,1 secunde și 852 de mii de tokenuri per sarcină, comparativ cu 1.020,9 secunde și 1,01 milioane de tokenuri pentru Hermes și 826,0 secunde și 2,82 milioane de tokenuri pentru Pi. Prin urmare, Computer utilizează cu 61% mai puțin timp de execuție și cu 16% mai puține tokenuri decât Hermes, și cu 51% mai puțin timp de execuție și cu 70% mai puține tokenuri decât Pi.

Grafic de dispersie (scatter plot) al scorului BrowseComp în funcție de timpul mediu de execuție per sarcină pentru Computer, Hermes și Pi cu Qwen 3.8 27B; Computer atinge cel mai mare scor cu cel mai scurt timp și cele mai puține tokenuri.
Rezultate BrowseComp cu modelul Qwen 3.8 27B pe dispozitiv: scor în funcție de timpul mediu de execuție per sarcină pentru cadrele de execuție Computer, Hermes și Pi; etichetele punctelor indică media tokenurilor per sarcină. Rezultatele incomplete primesc scorul zero, iar mediile pentru timp și tokenuri exclud rulările fără măsurători înregistrate. Marcajele sunt intervale de încredere Wilson de 95% pentru scor.

Înțelegerea documentelor multimodale pe dispozitiv

Multe documente conțin informații în format vizual și sunt greu de analizat ca text simplu: PDF-uri, pagini scanate, capturi de ecran, diagrame și prezentări. Aceste fluxuri de lucru depind de OCR și de înțelegerea imaginilor și beneficiază cel mai mult de pe urma unui model nativ multimodal.

Cadrul de execuție transmite paginile documentelor și imaginile direct către model, care le înțelege și combină dovezile vizuale cu textul extras. Procesarea acestor fișiere pe dispozitiv menține confidențiale documentele sensibile și conținutul extras din acestea.

Evaluăm înțelegerea documentelor multimodale pe ParseBench-100, un subset de 100 de sarcini din benchmark-ul ParseBench, cu câte 20 de sarcini pentru diagrame, aspect (layout), tabele, conținut text și formatare.

Computer atinge un scor mediu de 65,1%, comparativ cu 34,6% pentru Hermes și 13,9% pentru Pi. De asemenea, finalizează sarcinile cu cel mai scurt timp și cele mai puține tokenuri: în medie 60,6 secunde și 20,1 mii de tokenuri per sarcină, comparativ cu 108,3 secunde și 32,1 mii de tokenuri pentru Hermes, și 410,5 secunde și 829,1 mii de tokenuri pentru Pi. Computer conduce în toate cele cinci categorii de documente, având cel mai mare avantaj la diagrame. Aspectul rămâne dificil pentru toate cele trei cadre de execuție.

Grafic de dispersie al scorului OCR ParseBench-100 în funcție de timpul mediu de execuție per sarcină pentru Computer, Hermes și Pi cu Qwen 3.8 27B; Computer atinge cel mai mare scor cu cel mai scurt timp și cele mai puține tokenuri.
Rezultate OCR ParseBench-100 cu modelul Qwen 3.8 27B de pe dispozitiv: scor în funcție de timpul mediu de execuție per sarcină pentru cadrele de execuție Computer, Hermes și Pi; etichetele punctelor indică media tokenurilor per sarcină. Mediile tokenurilor utilizează rulări cu măsurători înregistrate. Marcajele reprezintă intervale de încredere de 95%.

Tabelul 1. Scor mediu ParseBench-100 pe categoria de documente pentru cadrele de execuție Computer, Hermes și Pi cu modelul Qwen 3.8 27B pe dispozitiv. Computer este lider în toate cele cinci categorii.

Cadru de execuție

Diagramă

Aspect

Tabel

Conținut text

Formatare

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Reducerea decalajului față de frontieră prin escaladarea către un consilier

Chiar și cu un cadru de execuție conceput cu atenție, cele mai dificile sarcini depășesc în continuare capabilitățile unui model compact de pe dispozitiv. Pentru astfel de sarcini, cadrul de execuție expune un instrument de consiliere: modelul local poate consulta un model de frontieră mai puternic atunci când are nevoie de ajutor în planificare, rezolvarea ambiguităților, recuperarea după eșecuri repetate sau verificarea rezultatului final.

Modelul local decide când să solicite sfaturi, în timp ce orchestratorul cadrului de execuție își păstrează autoritatea asupra instrumentelor și controlează ce context este trimis. Escaladarea este opțională. Utilizatorul decide dacă o activează și dacă aprobă fiecare apel către consilier manual sau automat.

Înainte de un apel către consilier, cadrul de execuție selectează contextul relevant, aplică un clasificator PII pentru a semnala informațiile sensibile și îi arată utilizatorului ce ar urma să părăsească dispozitivul. Consilierul primește doar contextul aprobat și returnează ghidare sub formă de text; nu are acces direct la fișierele, instrumentele sau conversațiile dispozitivului. Acest lucru îmbunătățit atât costul, cât și confidențialitatea, și intenționăm să explorăm mai departe această direcție în lucrări viitoare.

Diagrama escaladării către consilier: orchestratorul cadrului de execuție își păstrează autoritatea asupra instrumentelor și trimite doar contextul aprobat către modelul consilier, care returnează ghidare sub formă de text fără acces direct la instrumente sau fișiere.
Ghidare la distanță, control local. Orchestratorul cadrului de execuție își păstrează autoritatea asupra instrumentelor și trimite doar contextul aprobat pentru escaladare. Consilierul nu are acces direct la instrumente, fișiere sau canalul de răspuns; el returnează ghidare sub formă de text pe care modelul local o poate utiliza.

Testăm această abordare pe sarcini dificile de inginerie software, care necesită un raționament puternic și reprezintă domeniul în care un model local dă cel mai des greș. Pentru aceasta, utilizăm Terminal Bench 2.1, un benchmark popular cu 89 de sarcini pentru agenții de codare.

Dorim să răspundem la două întrebări: cât din decalajul față de un model de frontieră poate fi acoperit prin escaladarea la un consilier și cu ce cost. Modelele complet locale nu costă practic nimic de rulat, deoarece inferența are loc pe hardware-ul utilizatorului. Odată ce modelul începe să apeleze consilierul, însă, el începe să genereze costuri API.

Ca punct de referință pentru performanța de frontieră, utilizăm Claude Opus 5 care rulează în cadrul de execuție local; modelul local este Qwen 3.8 27B. În cele din urmă, le asociem pe cele două: Qwen 3.8 27B execută sarcina și escalează către un consilier Claude Opus 5 atunci când are nevoie de ajutor. Nu evaluăm escaladarea la consilier cu Pi sau Hermes deoarece niciunul nu oferă un instrument de consiliere echivalent; adăugarea unuia ar necesita modificarea suprafeței sale de instrumente și a logicii de orchestrare, astfel încât rezultatul nu ar mai reprezenta cadrul de execuție standard.

Escaladarea către consilier crește scorul Computer de la 59,6% la 73,0%, un câștig de 13,5 puncte procentuale, la un cost estimat al API-ului de 0,415 dolari pe rulare. Rularea de sine stătătoare a Claude Opus 5 atinge 82,4% la 0,65 dolari pe rulare. Astfel, escaladarea recuperează aproximativ trei cincimi din decalajul față de frontieră la aproximativ două treimi din costul acesteia, iar utilizatorul decide când merită făcut acest compromis.

Grafic de dispersie al scorului Terminal Bench 2.1 în funcție de costul API per rulare: Qwen 3.8 27B complet local, Qwen 3.8 27B cu un consilier Claude Opus 5 și Claude Opus 5 de sine stătător, toate în cadrul de execuție Computer.
Raport cost-performanță Terminal Bench 2.1 pe 89 de sarcini: scor în funcție de costul API per rulare. Toate punctele utilizează cadrul de execuție Computer: Qwen 3.8 27B complet local, Qwen 3.8 27B care escalează către un consilier Claude Opus 5 și Claude Opus 5 de sine stătător. Liniile întrerupte arată Pi și Hermes rulând același model local la cost API zero. Marcajele sunt intervale de încredere de 95% obținute prin eșantionare bootstrap pe sarcini; rulările incomplete primesc scorul zero.

Post-antrenarea pentru cadrul de execuție și munca intelectuală

Până acum, am menținut modelul local neschimbat pentru a izola contribuția adusă de cadrul de execuție. Odată ce designul cadrului de execuție este implementat, cele mai mari câștiguri rămase provin din adaptarea modelului însuși. Datele de utilizare Perplexity Computer ne arată ce fac efectiv oamenii în munca intelectuală, pe care le folosim pentru a sintetiza date de antrenament. Post-antrenăm modelul local în cadrul cadrului Computer, ghidați de distribuția reală a sarcinilor pe care le efectuează utilizatorii.

În mod concret, identificăm un set divers de cazuri de utilizare care pun la încercare diferite capabilități ale modelului, instrumente și conectori. Din aceste cazuri de utilizare sintetizăm medii de învățare prin consolidare (reinforcement learning) realiste și definim sarcini dificile, dar verificabile: fiecare sarcină constă dintr-o instrucțiune, un mediu și un verificator care punctează rezultatul final, unde mediul este un container Docker în care operează cadrul de execuție. Important este că, deoarece sarcinile sunt sintetice, ele nu conțin documente reale sau informații despre utilizator.

Folosim aceste medii pentru antrenament în două etape: reglaj fin prin respingere (rejection fine-tuning) urmat de învățare prin consolidare. În prima etapă, rulăm modelul împotriva fiecărei sarcini de mai multe ori, selectăm cele mai bune traiectorii după scorul verificatorului și îl antrenăm pe acestea prin învățare supervizată. Această etapă inițializează modelul pentru cadrul specific și distribuția de sarcini. În a doua etapă, învățarea prin consolidare reglează fin modelul în continuare, făcându-l mai robust.

Un subset de sarcini este rezervat din antrenament și utilizat pentru evaluarea finală; numim acest set rezervat Local Knowledge Work Bench: 53 de sarcini care acoperi șapte categorii de muncă intelectuală de zi cu zi, de la cercetare aprofundată până la crearea de documente. Vom publica în curând un raport tehnic care descrie în detaliu antrenamentul modelului și intenționăm să deschidem sursa (open-source) acestui benchmark de evaluare.

Am post-antrenat Qwen 3.8 27B cu această abordare, producând un model pe care îl numim PPLX 27B, și l-am evaluat pe Local Knowledge Work Bench. Cu modelul de bază Qwen 3.8 27B, Computer obține cel mai mare scor (82,6%, comparativ cu 77,6% pentru Pi și 74,0% pentru Hermes) și utilizează cele mai puține tokenuri (520k, față de 681k pentru Pi și 634k pentru Hermes). Pi finalizează sarcinile cel mai rapid, la 176 de secunde per sarcină, comparativ cu 218 secunde pentru Computer și 292 de secunde pentru Hermes. PPLX 27B ridică scorul Computer la 85,4%, cu costul unor tokenuri suplimentare (678k față de 520k). Timpul său mediu de execuție estimat este de 250 de secunde.

Grafic de dispersie al scorului Local Knowledge Work Bench în funcție de timpul mediu de execuție per sarcină; PPLX 27B rulând în Computer atinge cel mai mare scor, de 85,4%.
Rezultate post-antrenament pe Local Knowledge Work Bench: scor în funcție de timpul mediu de execuție per sarcină; etichetele punctelor indică cadrul de execuție, modelul și media tokenurilor per sarcină. PPLX 27B este modelul nostru post-antrenat, care rulează în Computer. Marcajele reprezintă intervale de încredere de 95% pe 53 de sarcini cu câte trei rulări fiecare.

Tabelul 2. Categoriile de sarcini din Local Knowledge Work Bench.

Categorie

Sarcini

Pondere

Descriere

Cercetare aprofundată

20

37,7%

Răspundeți la întrebări complexe care necesită cercetare web pe mai multe niveluri (multi-hop), seturi de date publice, statistici și verificarea surselor.

Date, finanțe și achiziții

9

17,0%

Curățați seturi de date, reconciliați înregistrări, auditați cheltuieli, analizați investiții, evaluați furnizori și calculați indicatori financiari.

Documente, prezentări și design

7

13,2%

Produceți PDF-uri finisate, facturi, materiale de integrare (onboarding), colaterale pentru evenimente și prezentări de afaceri.

Inginerie, IT și incidente

5

9,4%

Investigați incidente, analizați jurnale (loguri), scrieți planuri de recuperare, evaluați disponibilitatea pentru lansare și sintetizați documentație tehnică.

Contracte, dovezi și conformitate

5

9,4%

Examinați contracte, analizați probe, investigați rechemări, redactați documente sensibile și verificați cerințele de conformitate.

Tablouri de bord, software și vizualizare

4

7,5%

Construiți tablouri de bord interactive, microsite-uri educaționale, diagrame și vizualizări de proiecte.

Oameni, proiecte și întâlniri

3

5,7%

Selectați CV-uri, consolidați deciziile din întâlniri și mențineți instrumente de urmărire a acțiunilor din proiecte.

Total

53

100%

Concluzie

Cercetarea noastră arată că un model open-source puternic, cu hardware local capabil și un cadru de execuție construit pentru acestea, poate gestiona munca intelectuală reală la un cost de inferență aproape de zero, fără a necesita ca datele sensibile să părăsească dispozitivul.

În cadrul diferitelor benchmark-uri, Computer a egalat sau a depășit Hermes și Pi în ceea ce privește acuratețea în timp ce rula Qwen 3.8 27B pe un NVIDIA DGX Spark. Dintre cele trei benchmark-uri care raportează latența și utilizarea tokenurilor, Computer a fost cel mai rapid pe BrowseComp și ParseBench-100 și a utilizat cele mai puține tokenuri pe toate cele trei; Pi a fost cel mai rapid pe Local Knowledge Work Bench.

Câștigurile au provenit din alegerile pe care le-am făcut. Am construit un cadru de execuție local concis cu abilități care se încarcă la cerere. Am convertit conectorii în instrumente CLI compacte în locul serverelor MCP. Execuția a fost plasată într-un sandbox pentru securitate.

Rezultatele arată, de asemenea, unde modelele compacte au loc de îmbunătățire. De exemplu, în cazul sarcinilor dificile de codare din Terminal Bench 2.1, modelul local se situează în spatele modelului de frontieră în toate cele trei cadre de execuție. Escaladarea către consilier îngustează, dar nu închide complet decalajul; îmbunătățirile continue ale capabilităților modelului și ale hardware-ului local sunt încă necesare pentru a împinge performanța mai departe.

Scopul construirii cadrului de execuție și a modelului pentru constrângeri locale este de a oferi utilizatorilor control explicit asupra informațiilor care părăsesc mașinile lor. Există, de asemenea, beneficii de cost pentru utilizator. Vdem acestea ca parte a unei schimbări mai ample în cadrul căreia agenții din ce în ce mai capabili trec de la infrastructura de la distanță la dispozitive individuale și locale. Ne așteptăm ca progresele în materie de cipuri, modele și dispozitive să extindă în mod continuu gama și calitatea muncii intelectuale pe care Portable Computer o gestionează local.