Un axente local para traballos de coñecemento privados e económicos
Unha estrutura e un modelo deseñados para traballos de coñecemento locais, executados no dispositivo e accedendo a capacidades remotas baixo demanda.
Perplexity Portable Computer é un axente local.
Todo o sistema execútase localmente por defecto. O modelo, a estrutura, a conversa e a traxectoria viven na máquina do usuario. O traballo que require o mundo exterior, como a busca web, os conectores ou a escalada a un modelo asesor máis potente na nube, invócase só cando é necesario e sempre controlado polo usuario. Por conseguinte, os datos sensibles nunca abandonan o dispositivo sen permiso, e os modelos locais non levan ningunha taxa de inferencia: o sistema é privado e económico por deseño.
Un axente local eficaz require que o modelo e a estrutura estean deseñados xunto con el. As estruturas de propósito xeral asumen un modelo de vangarda que pode absorber contextos longos, navegar dunha ampla superficie de ferramentas e planificar a longo prazo. Os modelos locais son menos fiables baixo esas demandas. En vez de pedirlle a un modelo pequeno que xestione unha estrutura construída para un grande, moldeamos ambos arredor do outro: unha estrutura adaptada ao perfil de capacidades do modelo e un modelo posadestrado para usar esa estrutura eficazmente.
Introdución
As capacidades de axente nos últimos meses avanzaron rapidamente nunha ampla gama de tarefas de traballo de coñecemento. Aínda que estes avances traen grandes ganancias en produtividade e eficiencia, tamén expoñen dous desafíos.
O consumo de tokens está a aumentar rapidamente, e con el o gasto xeral. Cando se accede á intelixencia a través das API de modelos de código pechado que se executan en clústeres remotos, a información privada e a propiedade intelectual abandonan o dispositivo do usuario con cada solicitude. A medida que os axentes se expanden por fluxos de traballo individuais e organizacións enteiras, o gasto en tokens e o movemento de datos fanse cada vez máis difíciles de rexer.
Ao mesmo tempo, os modelos de código aberto melloraron a un ritmo aínda máis rápido. O progreso é máis visíbel en modelos moi pequenos e eficientes como NVIDIA Nemotron 3.5 Lightning (30 mil millóns de parámetros en total), Qwen 3.6 (35 mil millóns) e Qwen 3.8 (27 mil millóns). Estes modelos pequenos superan as súas expectativas e agora son quen de realizar fluxos de traballo de axentes complexos. O hardware de inferencia local avanza en paralelo: sistemas como o NVIDIA DGX Spark agora poden executar estes modelos localmente. Xuntos, estas tendencias fan que a operación totalmente no dispositivo sexa práctica mentres permiten aos usuarios optar por capacidades externas cando sexa necesario, como busca web, conectores ou escalada de modelos na nube.
Este enfoque local permite un aforro de custos significativo, xa que a inferencia local evita as taxas de API por token. Tamén resolve de maneira natural as preocupacións de privacidade e propiedade intelectual: os tokens privados nunca precisan ser transmitidos a clústeres remotos e permanecen seguros dentro dos límites do dispositivo local.
En xuño, introducimos o primeiro orquestrador de inferencia híbrida local-servidor que decide que traballo debe executarse no dispositivo e que traballo debe ir aos axentes na nube. Aquí explicamos como construímos este axente local, incluíndo a estrutura e os modelos optimizados mutuamente.
Ofrecemos unha visión xeral das opcións de deseño clave, avaliamos Computer en comparación con estruturas de código aberto de propósito xeral populares (Hermes e Pi) en tres puntos de referencia públicos e o noso Local Knowledge Work Bench interno. No noso punto de referencia, co modelo Qwen 3.8 27B executándose nun NVIDIA DGX Spark, Computer atinxe a puntuación máis alta, 82,6% fronte ao 77,6% de Pi e ao 74,0% de Hermes. PPLX 27B, o noso modelo posadestrado sobre Qwen 3.8 27B, eleva aínda máis a puntuación ata o 85,4%.
Deseñar a estrutura arredor do modelo local
Aínda que os modelos compactos no dispositivo xa son bastante capaces, aínda están por detrás dos modelos de vangarda máis grandes en rendemento. Precísase dunha estrutura coidadamente deseñada para orientar estes modelos eficazmente e abordar as súas limitacións.
As estruturas de código aberto populares como Pi e Hermes demostraron ser xerais: funcionan ben cunha gran variedade de modelos de todos os tamaños e clases. Mais non están optimizadas para as capacidades dos modelos no dispositivo. Deseñamos a estrutura local especificamente para este escenario, arredor duns poucos principios clave.
Eficiencia do contexto
O enfoque principal no deseño da nosa estrutura foi facer o mellor uso do contexto do modelo.
Aínda que os modelos no dispositivo como Qwen 3.8 27B ofrecen xanelas de contexto de 260.000 tokens, atopamos empiricamente que comezan a ter dificultades máis aló dos 100.000 tokens. Por tanto, mantemos a estrutura central concisa: unha instrución de sistema mínima e un pequeno conxunto de ferramentas principais.
Todas as demais capacidades modularízanse en habilidades baixo demanda que se cargan e descargan ao longo da traxectoria. Deseñamos estas habilidades para tarefas comúns de traballo de coñecemento: investigación, ciencia de datos, visualización de datos, creación de documentos, enxeñaría de software e moito máis.
A estrutura tamén admite a compactación de contexto, resumindo o contexto obsoleto cando unha traxectoria medra para que o modelo permaneza dentro da súa xanela efectiva.
Conectores como ferramentas de liña de comandos
O traballo de coñecemento diario adoita requirir conectores como Gmail, GitHub, Outlook e Google Calendar. Estes adoitan expoñerse a unha estrutura como servidores MCP, cuxas grandes definicións de ferramentas consumen unha parte substancial do contexto. No seu lugar, convertemos os MCP máis utilizados en ferramentas de liña de comandos compactas e fáciles de usar, complementadas con habilidades personalizadas que fan un uso moito mellor do contexto efectivo limitado.
Autoverificación
O rendemento tamén mellora cando o axente verifica o seu propio traballo. A verificación engade pasos adicionais, pero mellora moito os resultados finais e reduce substancialmente a brecha cos modelos de vangarda. Pode ser activada polo propio modelo ou por un conxunto de ganchos que supervisan a saúde da traxectoria e solicitan a autoverificación cando algo vai mal.
Execución en contorno illado
A estrutura executa ferramentas nun contorno illado a nivel de sistema operativo no dispositivo do usuario. O límite restrinxe os procesos, as rutas do sistema de ficheiros e o acceso á rede segundo a política. Isto limita o raio de impacto dun comando erróneo. Se o contorno illado non está dispoñible, a estrutura desbállase antes de calquera chamada de ferramenta en vez de degradarse a unha execución sen illamento.
Isto difire das estruturas de código aberto como Pi e Hermes, que executan comandos directamente cos permisos do usuario por defecto. En Computer, o illamento está sempre activado, non require configuración e as ferramentas non poden executarse sen el.
O diagrama seguinte mostra como encaixan estes principios no bucle de execución. O orquestrador é un código de estrutura determinista, non un LLM: mantén o bucle, ensambla o contexto e impón a política. O modelo local propón a seguinte acción; o orquestrador executa as chamadas de ferramentas aprobadas no contorno illado e devolve os seus resultados ao modelo. A busca web, os conectores e as chamadas de asesores cruzan os límites do dispositivo só cando están habilitadas e aprobadas.
Unha estrutura local aproveita máis o mesmo modelo
Usando o mesmo modelo base no dispositivo, comparamos a nosa estrutura local con alternativas de propósito xeral en investigación web e comprensión de documentos multimodal. Todas as estruturas usan o modelo Qwen 3.8 27B con razoamento medio, executándose nun NVIDIA DGX Spark. Esta comparación illaba as capacidades achegadas pola estrutura en si, antes de calquera posadestramento do modelo.
Centrarnos nestas dúas capacidades débese a que o traballo de coñecemento adoita combinar documentos privados no dispositivo do usuario con información pública da web para producir un artefacto fundamentado. A busca web require conectividade, pero a inferencia do modelo e o procesamento de documentos privados permanecen locais. Os ficheiros locais serven como fonte autorizada, as fontes públicas engaden contexto e os usuarios poden desactivar a busca web por completo para traballar totalmente fóra de liña.
Investigación web
Construímos a nosa estrutura local xunto co motor de busca de Perplexity, que acadou os primeiros postos en avaliacións independentes. A estrutura accede a el a través da interface Search as Code.
Avaliamos a calidade da investigación en 1.266 tarefas de BrowseComp. Computer utiliza a infraestrutura de busca de Perplexity xunto coa nosa estrutura local, mentres que Pi e Hermes confían en Brave, o seu provedor de busca recomendado. Computer alcanza o 66,7% de precisión, en comparación co 50,2% de Pi e o 43,9% de Hermes.
Computer tamén ten o tempo de parede medio rexistrado e o uso de tokens máis baixos: 402,1 segundos e 852 mil tokens por tarefa, en comparación con 1.020,9 segundos e 1,01 millóns de tokens para Hermes, e 826,0 segundos e 2,82 millóns de tokens para Pi. Polo tanto, Computer usa un 61% menos de tempo de parede e un 16% menos de tokens que Hermes, e un 51% menos de tempo de parede e un 70% menos de tokens que Pi.
Comprensión de documentos multimodal no dispositivo
Moitos documentos conteñen información visualmente e son difíciles de analizar como texto plano: PDFs, páxinas escaneadas, capturas de pantalla, gráficos e presentacións. Estes fluxos de traballo dependen do OCR e da comprensión de imaxes, e benefícianse máis dun modelo nativamente multimodal.
A estrutura pasa páxinas de documentos e imaxes directamente ao modelo, que as comprende e combina a evidencia visual co texto extraído. O procesamento destes ficheiros no dispositivo mantén os documentos sensibles e o seu contido extraído en privado.
Avaliamos a comprensión de documentos multimodal en ParseBench-100, un subconxunto de 100 tarefas da referencia ParseBench, con 20 tarefas cada unha para gráficos, deseño, tabas, contido de texto e formato.
Computer alcanza unha puntuación media do 65,1%, en comparación co 34,6% de Hermes e o 13,9% de Pi. Tamén completa as tarefas co menor tempo e o menor número de tokens: de media 60,6 segundos e 20,1 mil tokens por tarefa, en comparación con 108,3 segundos e 32,1 mil tokens para Hermes, e 410,5 segundos e 829,1 mil tokens para Pi. Computer lidera en todas as cinco categorías de documentos, coa súa maior vantaxe nos gráficos. O deseño segue a ser difícil para as tres estruturas.
Táboa 1. Puntuación media de ParseBench-100 por categoría de documento para as estruturas Computer, Hermes e Pi co modelo Qwen 3.8 27B no dispositivo. Computer lidera nas cinco categorías.
Estrutura | Gráfico | Deseño | Táboa | Contido de texto | Formato |
Computer | 76,5% | 16,2% | 72,7% | 87,9% | 72,4% |
Hermes | 29,3% | 2,9% | 44,1% | 61,5% | 35,2% |
Pi | 2,5% | 0,1% | 11,0% | 29,7% | 26,1% |
Reducir a brecha da vangarda coa escalada de asesoramento
Aínda cunha estrutura coidadamente deseñada, as tarefas máis difíciles aínda superan as capacidades dun modelo compacto no dispositivo. Para tales tarefas, a estrutura expón unha ferramenta de asesoramento: o modelo local pode consultar un modelo de vangarda máis forte cando precisa axuda coa planificación, a resolución de ambigüidades, a recuperación de fallos repetidos ou a verificación do resultado final.
O modelo local decide cando solicitar asesoramento, mentres que o orquestrador de estrutura conserva a autoridade de ferramentas e controla que contexto se envía. A escalada é opcional. O usuario decide se a habilita e se aproba cada chamada de asesor de forma manual ou automática.
Antes dunha chamada de asesoramento, a estrutura selecciona o contexto relevante, aplica un clasificador PII para sinalar información sensíbel e mostra ao usuario o que abandonaría o dispositivo. O asesor recibe só o contexto aprobado e devolve orientacións en texto; non ten acceso directo aos ficheiros, ferramentas ou conversas do dispositivo. Isto mellora tanto o custo como a privacidade, e planeamos explorar máis esta dirección en traballos futuros.
Probamos este enfoque en tarefas desafiantes de enxeñaría de software, que esixen un forte razoamento e onde un modelo local adoita quedar curto. Para iso usamos Terminal Bench 2.1, unha popular referencia de 89 tarefas para axentes de codificación.
Queremos responder a dúas preguntas: cantra da brecha cun modelo de vangarda pode pechar a escalada de asesoramento e a que custo. Os modelos totalmente locais practicamente non custan nada de executar, xa que a inferencia ocorre no hardware do usuario. Non obstante, unha vez que o modelo comeza a chamar ao asesor, comeza a incorrer en custos de API.
Como liña de base para o rendemento de vangarda, usamos Claude Opus 5 operando na estrutura local; o modelo local é Qwen 3.8 27B. Finalmente, emparellamos ambos: Qwen 3.8 27B executa a tarefa e escala a un asesor Claude Opus 5 cando precisa axuda. Non avaliamos a escalada de asesoramento con Pi ou Hermes porque ningún ofrece unha ferramenta de asesoramento equivalente; engadir unha requiriría modificar a súa superficie de ferramentas e a súa lóxica de orquestración, polo que o resultado xa non representaría a estrutura estándar.
A escalada de asesoramento eleva a puntuación de Computer do 59,6% ao 73,0%, unha ganancia de 13,5 puntos porcentuais, cun custo de API estimado de 0,415 $ por despregamento. Executar Claude Opus 5 só alcanza o 82,4% a 0,65 $ por despregamento. Así, a escalada recupera aproximadamente tres quintas partes da brecha cara á vangarda a aproximadamente dous terzos do custo da vangarda, e o usuario decide cando vale a pena facer ese intercambio.
Posadestramento para a estrutura e o traballo de coñecemento
Ata agora, mantivemos o modelo local sen cambios para illar o que achega a estrutura. Co deseño da estrutura establecido, as maiores ganancias restantes provén de adaptar o modelo en si. Os datos de uso de Perplexity Computer móstrannos o que a xente fai realmente para o traballo de coñecemento, que usamos para sintetizar datos de adestramento. Posadestramos o modelo local dentro da estrutura de Computer, guiados pola distribución real de tarefas que realizan os usuarios.
En concreto, identificamos un conxunto diverso de casos de uso que exercitan diferentes capacidades de modelos, ferramentas e conectores. A partir destes casos de uso, sintetizamos contornas de aprendizaxe por reforzo realistas e definimos tarefas desafiantes pero verificables: cada tarefa consiste nunha instrución, unha contorna e un verificador que puntúa o resultado final, onde a contorna é un contedor Docker no que opera a estrutura. É importante destacar que, como as tarefas son sintéticas, non conteñen documentos reais nin información de usuarios.
Usamos estas contornas para o adestramento en dúas etapas: axuste fino de rexeitamento seguido de aprendizaxe por reforzo. Na primeira etapa, despregamos o modelo contra cada tarefa varias veces, seleccionamos as mellores traxectorias pola puntuación do verificador e adestramos nelas con aprendizaxe supervisada. Esta etapa inicializa o modelo para a estrutura específica e a distribución de tarefas. Na segunda etapa, a aprendizaxe por reforzo axusta aínda máis o modelo, facéndoo máis robusto.
Un subconxunto de tarefas resérvase fóra do adestramento e utilízase para a avaliación final; chamamos a este conxunto reservado Local Knowledge Work Bench: 53 tarefas que abarcan sete categorías de traballo de coñecemento diario, desde a investigación profunda ata a creación de documentos. Pronto publicaremos un informe técnico que describe detalladamente o adestramento do modelo e planeamos publicar en código aberto esta referencia de avaliación.
Posadestramos Qwen 3.8 27B con este enfoque, producindo un modelo que chamamos PPLX 27B, e avaliamos no Local Knowledge Work Bench. Co modelo base Qwen 3.8 27B, Computer atinxe a puntuación máis alta (82,6%, en comparación co 77,6% de Pi e o 74,0% de Hermes) e usa o menor número de tokens (520 mil, fronte a 681 mil para Pi e 634 mil para Hermes). Pi completa as tarefas máis rápido a 176 segundos por tarefa, en comparación con 218 segundos para Computer e 292 segundos para Hermes. PPLX 27B eleva a puntuación de Computer ao 85,4%, a custa de máis tokens (678 mil fronte a 520 mil). O seu tempo de parede estimado é de 250 segundos.
Táboa 2. Categorías de tarefas do Local Knowledge Work Bench.
Categoría | Tarefas | Cota | Descrición |
Investigación profunda | 20 | 37,7% | Responder a preguntas complexas que requiren investigación web de múltiples saltos, conxuntos de datos públicos, estatísticas e verificación de fontes. |
Datos, finanzas e contratación | 9 | 17,0% | Limpar conxuntos de datos, conciliar rexistros, auditar gastos, analizar investimentos, avaliar provedores e calcular métricas financeiras. |
Documentos, presentacións e deseño | 7 | 13,2% | Producir PDFs pulidos, facturas, materiais de incorporación, material de eventos e presentacións de negocios. |
Enxeñaría, TIC e incidentes | 5 | 9,4% | Investigar incidentes, analizar rexistros, escribir plans de recuperación, avaliar a preparación para o lanzamento e sintetizar documentación técnica. |
Contratos, probas e cumprimento | 5 | 9,4% | Revisar contratos, filtrar probas, investigar retiradas, redactar documentos sensibles e verificar os requisitos de cumprimento. |
Paneis, software e visualización | 4 | 7,5% | Construír paneis interactivos, micrositios educativos, gráficos e visualizacións de proxectos. |
Persoas, proxectos e reunións | 3 | 5,7% | Filtrar currículos, consolidar decisións de reunións e manter rastreadores de accións de proxectos. |
Total | 53 | 100% |
Conclusión
A nosa investigación mostra que un forte modelo de código aberto, cun hardware local capaz e unha estrutura construída para eles, pode xestionar traballos de coñecemento reais a un custo de inferencia case cero sen requirir que os datos sensibles abandonen o dispositivo.
A través dos distintos puntos de referencia, Computer igualou ou superou a Hermes e Pi en precisión mentres executaba Qwen 3.8 27B nun NVIDIA DGX Spark. Entre os tres puntos de referencia que informan sobre a latencia e o uso de tokens, Computer foi o máis rápido en BrowseComp e ParseBench-100 e utilizou o menor número de tokens nos tres; Pi foi o máis rápido no Local Knowledge Work Bench.
As ganancias provén das opcións que fixemos. Construímos unha estrutura local concisa con habilidades que se cargan baixo demanda. Convertemos os conectores en ferramentas CLI compactas en lugar de servidores MCP. A execución estivo illada por seguridade.
Os resultados tamén mostran onde os modelos compactos teñen marxe de mellora. Por exemplo, nas desafiantes tarefas de codificación de Terminal Bench 2.1, o modelo local queda por detrás do modelo de vangarda en todas as tres estruturas. A escalada de asesoramento reduce pero non pecha completamente a brecha; aínda se necesitan melloras continuas nas capacidades dos modelos e no hardware local para impulsar aínda máis o rendemento.
O propósito de construír a estrutura e o modelo para restricións locais é ofrecer aos usuarios un control explícito sobre que información abandona as súas máquinas. Tamén hai beneficios de custos para o usuario. Vemos isto como parte dun cambio máis amplo no que axentes cada vez máis capaces pasan da infraestrutura remota a dispositivos individuais e locais. Agardamos que os avances en chips, modelos e dispositivos amplíen continuamente o rango e a calidade do traballo de coñecemento que Portable Computer manexa localmente.