Un agent centrat en el dispositiu local per a un treball de coneixement privat i rendible

Un harness i un model codissenyats per al treball de coneixement local, que s'executen al dispositiu i accedeixen a capacitats remotes sota demanda.

AutorsPerplexity Research

Perplexity Portable Computer és un agent centrat en el dispositiu local.

Tot l'entorn s'executa localment per defecte. El model, el harness, la conversa i la trajectòria viuen a la màquina de l'usuari. El treball que necessita el món exterior, com ara la cerca web, els connectors o l'escalat a un model d'assessor més potent al núvol, s'invoca només quan és necessari i sempre gestionat per l'usuari. Per tant, les dades sensibles no abandonen mai el dispositiu sense permís, i els models locals no tenen cap cost d'inferència: el sistema és privat i rendible per construcció.

Un agent efectiu centrat en el dispositiu local requereix que el model i el harness es dissenyin conjuntament. Els harnesses d'ús general assumeixen un model de frontera capaç d'absorbir contextos llargs, navegar per una àmplia superfície d'eines i planificar a llarg termini. Els models locals són menys fiables davant d'aquestes demandes. En lloc de demanar a un model petit que gestioni un harness creat per a un de gran, hem modelat tots dos l'un al voltant de l'altre: un harness adaptat al perfil de capacitats del model i un model postentrenat per utilitzar aquest harness eficaçment.

Introducció

Les capacitats d'agència en els darrers mesos han avançat ràpidament en una àmplia gamma de tasques de treball de coneixement. Tot i que aquests avenços aporten grans guanys en productivitat i eficiència, també plantegen dos reptes.

El consum de tokens està augmentant ràpidament, i amb ell la despesa global. Quan s'accedeix a la intel·ligència a través de les API de models de codi tancat que s'executen en clústers remots, la informació privada i la propietat intel·lectual abandonen el dispositiu de l'usuari amb cada sol·licitud. A mesura que els agents s'escalen a través de fluxos de treball individuals i organitzacions senceres, la despesa de tokens i el moviment de dades es tornen cada vegada més difícil de governar.

Al mateix temps, els models de codi obert han millorat a un ritme encara més ràpid. El progrés és més visible en models molt petits i eficients com NVIDIA Nemotron 3.5 Lightning (30B paràmetres totals), Qwen 3.6 (35B) i Qwen 3.8 (27B). Aquests models petits superen les seves expectatives i ara són capaços de realitzar fluxos de treball complexos basats en agents. El maquinari d'inferència local avança en paral·lel: sistemes com ara NVIDIA DGX Spark ara poden executar aquests models localment. Juntes, aquestes tendències fan que l'operació totalment al dispositiu sigui pràctica alhora que permeten als usuaris optar per capacitats externes quan sigui necessari, com ara la cerca web, els connectors o l'escalat a models al núvol.

Aquest enfocament centrat en el dispositiu local permet un estalvi de costos significatiu, ja que la inferència local evita les tarifes d'API per token. També resol de manera natural les preocupacions de privadesa i propietat intel·lectual: els tokens privats no s'han de transmetre mai a clústers remots i romanen de manera segura dins del límit del dispositiu local.

Al juny, vam presentar el primer orquestrador d'inferència híbrid local-servidor que decideix quin treball s'ha d'executar al dispositiu i quin ha d'anar als agents al núvol. Aquí expliquem com hem construït aquest agent centrat en el dispositiu local, incloent-hi el harness i els models cooptimitzats els uns per als altres.

Donem una visió general de les eleccions clau de disseny, avaluem Computer davant de harnesses d'ús general de codi obert populars (Hermes i Pi) a través de tres benchmarks públics i el nostre banc intern de treball de coneixement local (Local Knowledge Work Bench). Al nostre banc de proves, amb el model Qwen 3.8 27B executant-se en un NVIDIA DGX Spark, Computer aconsegueix la puntuació més alta, un 82,6% enfront del 77,6% de Pi i el 74,0% d'Hermes. PPLX 27B, el nostre model postentrenat sobre Qwen 3.8 27B, eleva encara més la puntuació fins al 85,4%.

Gràfic de barres de les puntuacions del Local Knowledge Work Bench: harnesses Computer, Pi i Hermes amb Qwen 3.8 27B, i Computer amb PPLX 27B, que obté la puntuació més alta amb un 85,4%.
Puntuacions al Local Knowledge Work Bench, el nostre benchmark de 53 tasques representatives de treball de coneixement del dia a dia. Cada barra és una combinació de harness i model que s'executa en un NVIDIA DGX Spark; PPLX 27B és el nostre model postentrenat. Tres proves per tasca; els bigotis són intervals de confiança del 95%.

Dissenyar el harness al voltant del model local

Tot i que els models compactes al dispositiu ja són força capaços, encara queden per darrere dels models de frontera més grans en rendiment. Es necessita un harness dissenyat amb cura per orientar aquests models de manera eficaç i abordar les seves limitacions.

Els harnesses de codi obert populars com ara Pi i Hermes han demostrat ser generals: funcionen bé amb una gran varietat de models de diferents mides i classes. Però no estan optimitzats per a les capacitats dels models al dispositiu. Hem dissenyat el harness local específicament per a aquest entorn, al voltant d'uns quants principis clau.

Eficiència del context

L'enfocament principal en el disseny del nostre harness ha estat treure el màxim profit del context del model.

Tot i que els models al dispositiu com ara Qwen 3.8 27B ofereixen finestres de context de 260.000 tokens, hem trobat de manera empírica que comencen a tenir dificultats més enllà dels 100.000 tokens. Per tant, mantenim el harness central concís: un missatge de sistema mínim i un petit conjunt d'eines bàsiques.

Totes les altres capacitats estan modularitzades en Habilitats sota demanda que es carreguen i descarreguen al llarg de la trajectòria. Hem dissenyat aquestes habilitats per a tasques comunes de treball de coneixement: recerca, ciència de dades, visualització de dades, creació de documents, enginyeria de programari i molt més.

El harness també admet la compactació de context, resumint el context obsolet quan una trajectòria es fa llarga perquè el model romangui dins de la seva finestra eficaç.

Connectors com a eines de linia d'ordres

El treball de coneixement del dia a dia sovint requereix connectors com Gmail, GitHub, Outlook i Google Calendar. Normalment, aquests s'exposeen a un harness com a servidors MCP, les grans definicions d'eines dels quals consumeixen una part substancial del context. En canvi, hem convertit els MCP més utilitzats en eines de línia d'ordres compactes i fàcils d'utilitzar, complementades amb habilitats personalitzades que fan un ús molt millor del context efectiu limitat.

Autoverificació

El rendiment també millora quan l'agent verifica el seu propi treball. La verificació afegeix passos addicionals, però millora molt els resultats finals i redueix substancialment la bretxa respecte als models de frontera. Pot ser activada pel mateix model o per un conjunt de ginys que supervisen la salut de la trajectòria i sol·liciten l'autoverificació quan alguna cosa va malament.

Execució en entorn de proves

El harness executa eines en un entorn de proves a nivell de sistema operatiu al dispositiu de l'usuari. El límit restringeix els processos, els camins del sistema de fitxers i l'accés a la xarxa segons la política. Això limita el radi d'acció d'una ordre errònia. Si l'entorn de proves no està disponible, el harness es desactiva abans de qualsevol crida d'eina en lloc de degradar-se a una execució sense entorn de proves.

Això difereix dels harnesses de codi obert com Pi i Hermes, que executen ordres directament amb els permisos de l'usuari per defecte. A Computer, l'aïllament està sempre activat, no requereix cap configuració i les eines no poden funcionar sense ell.

El diagrama següent mostra com s'integren aquests principis en el bucle d'execució. L'orquestrador és un codi de harness determinista, no un LLM: manté el bucle, assembla el context i aplica la política. El model local proposa la següent acció; l'orquestrador executa les crides d'eines aprovades a l'entorn de proves i retorna els seus resultats al model. La cerca web, els connectors i les trucades d'assessor creuen el límit del dispositiu només quan estan habilitades i aprovades.

Diagrama del bucle d'execució del harness local: el codi de l'orquestrador determinista assembla el context i executa eines en un entorn de proves, el model local proposa accions i els serveis externs al dispositiu són opcionals i gestionats per l'usuari.
Com executa una tasca el harness local. El codi del harness determinista controla el bucle i les eines en un entorn de proves; el model local proposa accions. Els serveis externs al dispositiu són opcionals i gestionats per l'usuari.

Un harness local treu més profit del mateix model

Utilitzant el mateix model base al dispositiu, comparem el nostre harness local amb alternatives d'ús general en recerca web i comprensió de documents multimodals. Tots els harnesses utilitzen el model Qwen 3.8 27B amb raonament mitjà, executant-se en un NVIDIA DGX Spark. Aquesta comparació aïlla les capacitats aportades pel mateix harness, abans de qualsevol postentrenament del model.

Ens centrem en aquestes dues capacitats perquè el treball de coneixement sovint combina documents privats al dispositiu de l'usuari amb informació pública del web per produir un artefacte fundamentat. La cerca web requereix connectivitat, però la inferència del model i el processament de documents privats segueixen sent locals. Els fitxers locals serveixen com a font autoritària, les fonts públiques afegeixen context i els usuaris poden desactivar completament la cerca web per a treballs totalment fora de línia.

Recerca web

Construïm el nostre harness local conjuntament amb el motor de cerca de Perplexity, que ha aconseguit les màximes posicions en avaluacions independents. El harness hi accedeix a través de la interfície Search as Code.

Avaluem la qualitat de la recerca en 1.266 tasques de BrowseComp. Computer utilitza la infraestructura de cerca de Perplexity juntament amb el nostre harness local, mentre que Pi i Hermes depenen de Brave, el seu proveïdor de cerca recomanat. Computer arriba a una precisió del 66,7%, en comparació amb el 50,2% de Pi i el 43,9% d'Hermes.

Computer també té el temps de resposta mitjà registrat i el consum de tokens més baixos: 402,1 segons i 852.000 tokens per tasca, en comparació amb els 1.020,9 segons i 1,01 milions de tokens d'Hermes, i els 826,0 segons i 2,82 milions de tokens de Pi. Per tant, Computer utilitza un 61% menys de temps de resposta i un 16% menys de tokens que Hermes, i un 51% menys de temps de resposta i un 70% menys de tokens que Pi.

Gràfic de dispersió de la puntuació de BrowseComp enfront del temps de resposta mitjà per tasca per a Computer, Hermes i Pi amb Qwen 3.8 27B; Computer arriba a la puntuació més alta amb menys temps i menys tokens.
Resultats de BrowseComp amb el model Qwen 3.8 27B al dispositiu: puntuació enfront del temps de resposta mitjà per tasca per als harnesses Computer, Hermes i Pi; les etiquetes dels punts mostren els tokens mitjans per tasca. Els resultats incomplets puntuen zero, i les mitjanes de temps i tokens exclouen els desplegaments sense mesures registrades. Els bigotis són intervals de confiança de Wilson del 95% per a la puntuació.

Comprensió de documents multimodals al dispositiu

Molts documents porten informació visualment i són difícils d'analitzar com a text pla: PDF, pàgines escanejades, captures de pantalla, gràfics i presentacions. Aquests fluxos de treball depenen de l'OCR i de la comprensió d'imatges, i es beneficien més d'un model nativament multimodal.

El harness passa les pàgines de documents i les imatges directament al model, que les comprèn i combina l'evidència visual amb el text extret. Processar aquests fitxers al dispositiu manté privats els documents sensibles i el seu contingut extret.

Avaluem la comprensió de documents multimodals a ParseBench-100, un subconjunt de 100 tasques del benchmark ParseBench, amb 20 tasques cadascuna per a gràfics, disseny, taules, contingut de text i format.

Computer arriba a una puntuació mitjana del 65,1%, en comparació amb el 34,6% d'Hermes i el 13,9% de Pi. També completa les tasques amb menys temps i el menor nombre de tokens: de mitjana 60,6 segons i 20.100 tokens per tasca, en comparació amb els 108,3 segons i 32.100 tokens d'Hermes, i els 410,5 segons i 829.100 tokens de Pi. Computer lidera en les cinc categories de documents, amb el seu avantatge més gran en els gràfics. El disseny continua sent difícil per als tres harnesses.

Gràfic de dispersió de la puntuació OCR de ParseBench-100 enfront del temps de resposta mitjà per tasca per a Computer, Hermes i Pi amb Qwen 3.8 27B; Computer arriba a la puntuació més alta amb menys temps i menys tokens.
Resultats OCR de ParseBench-100 amb el model Qwen 3.8 27B al dispositiu: puntuació enfront del temps de resposta mitjà per tasca per als harnesses Computer, Hermes i Pi; les etiquetes dels punts mostren els tokens mitjans per tasca. Les mitjanes de tokens utilitzen desplegaments amb mesures registrades. Els bigotis són intervals de confiança del 95%.

Taula 1. Puntuació mitjana de ParseBench-100 per categoria de document per als harnesses Computer, Hermes i Pi amb el model Qwen 3.8 27B al dispositiu. Computer lidera en les cinc categories.

Harness

Gràfic

Disseny

Taula

Contingut de text

Format

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Reducció de la bretxa de la frontera amb l'escalat a l'assessor

Fins i tot amb un harness dissenyat amb cura, les tasques més difícils encara superen les capacitats d'un model compacte al dispositiu. Per a aquestes tasques, el harness exposa una eina d'assessor: el model local pot consultar un model de frontera més potent quan necessita ajuda amb la planificació, la resolució d'ambigüitats, la recuperació de fallades repetides o la verificació del resultat final.

El model local decideix quan demanar consell, mentre que l'orquestrador del harness conserva l'autoritat sobre les eines i controla quin context s'envia. L'escalat és opcional. L'usuari decideix si vol habilitar-lo i si vol aprovar cada trucada d'assessor de manera manual o automàtica.

Abans d'una trucada a l'assessor, el harness selecciona el context rellevant, aplica un classificador PII per marcar la informació sensible i mostra a l'usuari què sortiria del dispositiu. L'assessor rep només el context aprovat i retorna orientació en text; no té accés directe als fitxers, eines o converses del dispositiu. Això millora tant el cost com la privadesa, i tenim previst explorar més aquesta direcció en un treball futur.

Diagrama de l'escalat a l'assessor: l'orquestrador del harness conserva l'autoritat sobre les eines i envia només el context aprovat al model assessor, el qual retorna orientació en text sense accés directe a eines o fitxers.
Orientació remota, control local. L'orquestrador del harness conserva l'autoritat sobre les eines i envia només el context aprovat per a l'escalat. L'assessor no té accés directe a eines, fitxers ni al canal de resposta; retorna orientació en text que el model local pot utilitzar.

Provem aquest enfocament en tasques d'enginyeria de programari desafiants, que exigeixen un fort raonament i on un model local sovint es queda curt. Per a això utilitzem Terminal Bench 2.1, un benchmark popular de 89 tasques per a agents de codificació.

Volem respondre a dues preguntes: quanta part de la bretxa respecte a un model de frontera pot tancar l'escalat a l'assessor i a quin cost. Els models totalment locals no costen pràcticament res d'executar, ja que la inferència es produeix al maquinari de l'usuari. Tanmateix, un cop el model comença a trucar a l'assessor, comença a incórrer en costos d'API.

Com a línia de base per al rendiment de la frontera, utilitzem Claude Opus 5 operant al harness local; el model local és Qwen 3.8 27B. Finalment, unim tots dos: Qwen 3.8 27B executa la tasca i escala a un assessor Claude Opus 5 quan necessita ajuda. No avaluem l'escalat a l'assessor amb Pi o Hermes perquè cap dels dos proporciona una eina d'assessor equivalent; afegir-ne una requeriria modificar la seva superfície d'eines i la lògica d'orquestració, de manera que el resultat ja no representaria el harness estàndard.

L'escalat a l'assessor eleva la puntuació de Computer del 59,6% al 73,0%, un guany de 13,5 punts percentuals, amb un cost d'API estimat de 0,415 $ per desplegament. Executar Claude Opus 5 sol arriba al 82,4% a 0,65 $ per desplegament. Així doncs, l'escalat recupera aproximadament tres cinquenes parts de la bretxa fins a la frontera a aproximadament dos terços del cost de la frontera, i l'usuari decideix quan val la pena fer aquest intercanvi.

Gràfic de dispersió de la puntuació de Terminal Bench 2.1 enfront del cost d'API per desplegament: Qwen 3.8 27B totalment local, Qwen 3.8 27B amb un assessor Claude Opus 5 i Claude Opus 5 sol, tot al harness Computer.
Rendiment i cost de Terminal Bench 2.1 en 89 tasques: puntuació enfront del cost d'API per desplegament. Tots els punts utilitzen el harness Computer: Qwen 3.8 27B totalment local, Qwen 3.8 27B escalant a un assessor Claude Opus 5, i Claude Opus 5 sol. Les línies de guions mostren Pi i Hermes executant el mateix model local a cost d'API zero. Els bigotis són intervals de confiança del 95% obtinguts mitjançant mostratge bootstrap de tasques; els desplegaments incomplets puntuen zero.

Postentrenament per al harness i el treball de coneixement

Fins ara, hem mantingut el model local sense canvis per aïlar què aporta el harness. Un cop establert el disseny del harness, els guanys més grans que queden proven d'adaptar el mateix model. Les dades d'ús de Perplexity Computer ens mostren què fa realitat la gent pel que fa al treball de coneixement, les quals utilitzem per sintetitzar dades d'entrenament. Postentrenem el model local dins del harness de Computer, guiat per la distribució real de les tasques que realitzen els usuaris.

Concretament, identifiquem un conjunt divers de casos d'ús que posen a prova diferents capacitats del model, eines i connectors. A partir d'aquests casos d'ús, sintetitzem entorns d'aprenentatge per reforç realistes i definim tasques desafiants però verificables: cada tasca consisteix en una instrucció, un entorn i un verificador que puntua el resultat final, on l'entorn és un contenidor Docker en el qual opera el harness. Importantment, com que les tasques són sintètiques, no contenen cap document real ni informació d'usuari.

Utilitzem aquests entorns per a l'entrenament en dues etapes: ajust fi per rebuig seguit d'aprenentatge per reforç. En la primera etapa, despleguem el model contra cada tasca múltiples vegades, seleccionem les millors trajectòries per puntuació del verificador i hi entrenem amb aprenentatge supervisat. Aquesta etapa inicialitza el model per al harness específic i la distribució de tasques. En la segona etapa, l'aprenentatge per reforç afina encara més el model, fent-lo més robust.

Un subconjunt de tasques es reserva de l'entrenament i s'utilitza per a l'avaluació final; anomenem aquest conjunt reservat Local Knowledge Work Bench: 53 tasques que abasten set categories de treball de coneixement del dia a dia, des de la investigació profunda fins a la creació de documents. Aviat publicarem un informe tècnic que descriu l'entrenament del model amb detall, i tenim previst fer de codi obert aquest benchmark d'avaluació.

Hem postentrenat Qwen 3.8 27B amb aquest enfocament, produint un model que anomenem PPLX 27B, i l'hem avaluat al Local Knowledge Work Bench. Amb el model base Qwen 3.8 27B, Computer aconsegueix la puntuació més alta (82,6%, en comparació amb el 77,6% de Pi i el 74,0% d'Hermes) i utilitza menys tokens (520.000, enfront dels 681.000 de Pi i els 634.000 d'Hermes). Pi completa les tasques més ràpidament amb 176 segons per tasca, en comparació amb els 218 segons de Computer i els 292 segons d'Hermes. PPLX 27B eleva la puntuació de Computer fins al 85,4%, a costa de més tokens (678.000 enfront de 520.000). El seu temps de resposta estimat és de 250 segons.

Gràfic de dispersió de la puntuació del Local Knowledge Work Bench enfront del temps de resposta mitjà per tasca; PPLX 27B executant-se a Computer arriba a la puntuació més alta amb un 85,4%.
Resultats del postentrenament al Local Knowledge Work Bench: puntuació enfront del temps de resposta mitjà per tasca; les etiquetes dels punts mostren el harness, el model i els tokens mitjans per tasca. PPLX 27B és el nostre model postentrenat, executant-se a Computer. Els bigotis són intervals de confiança del 95% sobre 53 tasques amb tres proves cadascuna.

Taula 2. Categories de tasques del Local Knowledge Work Bench.

Categoria

Tasques

Quota

Descripció

Investigació profunda

20

37,7%

Responent preguntes complexes que requereixen recerca web de múltiples salts, conjunts de dades públics, estadístiques i verificació de fonts.

Dades, finances i compres

9

17,0%

Netejar conjunts de dades, conciliar registres, auditar despeses, analitzar inversions, avaluar proveïdors i calcular mètriques financeres.

Documents, presentacions i disseny

7

13,2%

Produir PDF polits, factures, materials d'incorporació, material col·lateral per a esdeveniments i presentacions de negocis.

Enginyeria, TI i incidents

5

9,4%

Investigar incidents, analitzar registres, escriure plans de recuperació, avaluar la preparació per al llançament i sintetitzar documentació tècnica.

Contractes, proves i compliment

5

9,4%

Revisar contractes, examinar proves, investigar retirades de productes, redactar documents sensibles i verificar requisits de compliment normatiu.

Taulers de control, programari i visualització

4

7,5%

Construir taulers de control interactius, llocs web educatius a petita escala, gràfics i visualitzacions de projectes.

Persones, projectes i reunions

3

5,7%

Examinar currículums, consolidar decisions de reunions i mantenir seguidors d'accions de projectes.

Total

53

100%

Conclusió

La nostra recerca mostra que un model de codi obert potent, amb maquinari local capaç i un harness construït per a ells, pot gestionar el treball de coneixement real amb un cost d'inferència gairebé nul sense requerir que les dades sensibles abandonin el dispositiu.

A través dels diversos benchmarks, Computer va igualar o superar Hermes i Pi en precisió mentre executava Qwen 3.8 27B en un NVIDIA DGX Spark. Entre els tres benchmarks que reporten latència i ús de tokens, Computer va ser el més ràpid a BrowseComp i ParseBench-100 i va utilitzar el menor nombre de tokens en els tres; Pi va ser el més ràpid al Local Knowledge Work Bench.

Els guanys van venir de les eleccions que vam fer. Vam construir un harness local concís amb habilitats que es carreguen sota demanda. Vam convertir els connectors en eines CLI compactes en lloc de servidors MCP. L'execució es va confinar en un entorn de proves per a més seguretat.

Els resultats també mostren on els models compactes tenen marge de millora. Per exemple, en les tasques de codificació desafiants de Terminal Bench 2.1, el model local queda per darrere del model de frontera en els tres harnesses. L'escalat a l'assessor redueix però no tanca completament la bretxa; encara calen millores contínues en les capacitats dels models i en el maquinari local per impulsar encara més el rendiment.

El propòsit de construir el harness i el model per a limitacions locals és donar als usuaris un control explícit sobre quina informació abandona les seves màquines. També hi ha beneficis de costos per a l'usuari. Vist com a part d'un canvi més ampli en el qual agents cada cop més capaços es desplacen des de la infraestructura remota cap a dispositius individuals i locals. Esperem que els avenços en xips, models i dispositius ampliïn contínuament el rang i la qualitat del treball de coneixement que Portable Computer gestiona localment.