En lokalfokuseret agent til privat og omkostningseffektivt vidensarbejde
En ramme og model co-designet til lokalt vidensarbejde, der kører på enheden og tilgår fjerntliggende funktioner efter behov.
Perplexity Portable Computer er en lokalfokuseret agent.
Hele stakken kører lokalt som standard. Modellen, rammen, samtalen og banen befinder sig alle på brugerens maskine. Arbejde, der kræver den ydre verden, såsom websøgning, connectors eller eskalering til en stærkere advisormodel i skyen, aktiveres kun når det er nødvendigt og er altid styret af brugeren. Følsomme data forlader derfor aldrig enheden uden tilladelse, og lokale modeller har intet inferensgebyr: systemet er privat og omkostningseffektivt i kraft af sin opbygning.
En effektiv lokalfokuseret agent kræver, at modellen og rammen er designet sammen. Generelle rammer forudsætter en frontier-model, der kan håndtere lange kontekster, navigere i en bred værktøjsflade og planlægge over lange horisonter. Lokale modeller er mindre pålidelige under disse krav. I stedet for at bede en lille model om at administrere en ramme bygget til en stor, formede vi de to omkring hinanden: en ramme skræddersyet til modellens kapacitetsprofil og en model, der er eftertrænet til at bruge den ramme effektivt.
Introduktion
Agentkapaciteter er i de seneste måneder avanceret hurtigt på tværs af en lang række vidensarbejdsopgaver. Selvom disse fremskridt medfører store gevinster i produktivitet og effektivitet, udgør de også to udfordringer.
Tokenforbruget stiger hurtigt, og det samme gør de samlede udgifter. Når intelligens tilgås gennem API'er fra lukkede modeller, der kører på fjerntliggende klynger, forlader private oplysninger og intellektuel ejendom brugerens enhed ved hver forespørgsel. Efterhånden som agenter skaleres på tværs af individuelle arbejdsprocesser og hele organisationer, bliver token-forbrug og dataflytning stadig sværere at styre.
Samtidig er open source-modeller blevet forbedret i et endnu hurtigere tempo. Fremgangen er mest synlig i meget små og effektive modeller såsom NVIDIA Nemotron 3.5 Lightning (30B samlede parametre), Qwen 3.6 (35B) og Qwen 3.8 (27B). Disse små modeller præsterer over deres vægtklasse og er nu i stand til at udføre komplekse arbejdsprocesser. Hardware til lokal inferens udvikler sig parallelt: systemer som NVIDIA DGX Spark kan nu køre disse modeller lokalt. Sammen gør disse tendenser fuldstændig on-device-drift praktisk, samtidig med at brugerne kan vælge eksterne funktioner til, når det er nødvendigt, såsom websøgning, connectors eller eskalering til sky-modeller.
Denne lokalfokuserede tilgang muliggør betydelige omkostningsbesparelser, da lokal inferens undgår per-token API-gebyrer. Den løser også naturligt privatlivs- og intellektuel ejendom-bekymringer: private tokens behøver aldrig at blive transmitteret til fjerntliggende klynger og forbliver sikkert inden for grænsen af den lokale enhed.
I juni introducerede vi den første hybride lokale server-inferensorkestrator, der beslutter, hvilket arbejde der skal køre on-device, og hvilket arbejde der skal gå til agenter i skyen. Her forklarer vi, hvordan vi byggede en sådan lokalfokuseret agent, herunder rammen og de modeller, der er co-optimeret til hinanden.
Vi giver et overblik over de vigtigste designvalg og evaluerer Computer op imod populære open source-generelle rammer (Hermes og Pi) på tværs af tre offentlige benchmarks og vores interne Local Knowledge Work Bench. På vores benchmark, med Qwen 3.8 27B-modellen kørende på en NVIDIA DGX Spark, opnår Computer den højeste score, 82,6% mod 77,6% for Pi og 74,0% for Hermes. PPLX 27B, vores model eftertrænet oven på Qwen 3.8 27B, hæver scoren yderligere til 85,4%.
Design rammen omkring den lokale model
Selvom kompakte on-device-modeller allerede er ret dygtige, halter de stadig efter større frontier-modeller i ydeevne. Der er brug for en omhyggeligt designet ramme til at styre disse modeller effektivt og imødegå deres begrænsninger.
Populære open source-rammer som Pi og Hermes har vist sig at være generelle: de fungerer godt med et bredt udvalg af modeller på tværs af størrelser og klasser. Men de er ikke optimeret til kapaciteterne hos on-device-modeller. Vi designede den lokale ramme specifikt til denne indstilling omkring et par nøgleprincipper.
Konteksteffektivitet
Hovedfokus i designet af vores ramme var at få mest muligt ud af modellens kontekst.
Selvom on-device-modeller som Qwen 3.8 27B tilbyder kontekstvinduer på 260K tokens, fandt vi empirisk, at de begynder at kæmpe ud over 100K tokens. Vi holder derfor kernerammen kort og præcis: en minimal systemprompt og et lille sæt kerneværktøjer.
Alle andre funktioner er modulariseret i on-demand-færdigheder, der indlæses og afstilles gennem hele banen. Vi designede disse færdigheder til almindelige vidensarbejdsopgaver: research, datalogi, datavisualisering, dokumentoprettelse, softwareudvikling med mere.
Rammen understøtter også kontekstkomprimering, hvor forældet kontekst opsummeres, når en bane bliver lang, så modellen forbliver inden for sit effektive vindue.
Connectors som kommandolinjeværktøjer
Dagligt vidensarbejde kræver ofte connectors som Gmail, GitHub, Outlook og Google Calendar. Disse eksponeres normalt for en ramme som MCP-servere, hvis store værktøjsdefinitioner forbruger en væsentlig del af konteksten. I stedet konverterede vi de mest brugte MCP'er til kompakte, letanvendelige kommandolinjeværktøjer, suppleret med tilpassede færdigheder, der udnytter den begrænsede effektive kontekst langt bedre.
Selvverificering
Ydeevnen forbedres også, når agenten verificerer sit eget arbejde. Verificering tilføjer ekstra trin, men det forbedrer de endelige resultater betydeligt og indsnævrer i væsentlig grad kløften til frontier-modeller. Det kan udløses af selve modellen eller af et sæt hooks, der overvåger banens tilstand og anmoder om selvverificering, når noget går galt.
Sandkassekørsel
Rammen udfører værktøjer i en sandkasse på OS-niveau på brugerens enhed. Grænsen begrænser processer, filstier og netværksadgang i henhold til politikken. Dette begrænser skadesomfanget af en fejlagtig kommando. Hvis sandkassen ikke er tilgængelig, deaktiverer rammen sig selv før eventuelle værktøjsopkald i stedet for at forringe til kørsel uden sandkasse.
Dette adskiller sig fra open source-rammer som Pi og Hermes, som som standard kører kommandoer direkte med brugerens tilladelser. I Computer er isolering altid slået til, kræver ingen konfiguration, og værktøjer kan ikke køre uden den.
Diagrammet nedenfor viser, hvordan disse principper passer sammen i udførelsesløkken. Orkestratoren er deterministisk rammekode, ikke en LLM: den vedligeholder løkken, samler kontekst og håndhæver politik. Den lokale model foreslår den næste handling; orkestratoren udfører godkendte værktøjsopkald i sandkassen og returnerer deres resultater til modellen. Websøgning, connectors og advisor-opkald krydser enhedsgrænsen kun når det er aktiveret og godkendt.
En lokal ramme får mere ud af den samme model
Ved hjælp af den samme on-device-basismodel sammenligner vi vores lokale ramme med generelle alternativer på webresearch og multimodal dokumentforståelse. Alle rammer bruger Qwen 3.8 27B-modellen med medium ræsonnering, kørende på en NVIDIA DGX Spark. Denne sammenligning isolerer de kapaciteter, der bidrages med af selve rammen, før eventuel modeleftertræning.
Vi fokuserer på disse to funktioner, fordi vidensarbejde ofte kombinerer private dokumenter på brugerens enhed med offentlig information fra the web for at producere et funderet artefakt. Websøgning kræver konnektivitet, men modelinferens og behandling af private dokumenter forbliver lokale. Lokale filer fungerer som den autoritative kilde, offentlige kilder tilføjer kontekst, og brugere kan deaktivere websøgning helt for fuldstændig offline arbejde.
Webresearch
Vi bygger vores lokale ramme sammen med Perplexitys søgemaskine, som har opnået topPLACERINGer i uafhængige evalueringer. Rammen tilgår den gennem Search as Code-grænsefladen.
Vi evaluerer research-kvalitet på 1.266 BrowseComp-opgaver. Computer bruger Perplexitys søgeinfrastruktur sammen med vores lokale ramme, mens Pi og Hermes er afhængige af Brave, deres anbefalede søgeudbyder. Computer når 66,7% nøjagtighed sammenlignet med 50,2% for Pi og 43,9% for Hermes.
Computer har også den laveste gennemsnitlige registrerede svartid og token-forbrug: 402,1 sekunder og 852k tokens pr. opgave sammenlignet med 1.020,9 sekunder og 1,01 millioner tokens for Hermes og 826,0 sekunder og 2,82 millioner tokens for Pi. Computer bruger derfor 61% mindre svartid og 16% færre tokens end Hermes og 51% mindre svartid og 70% færre tokens end Pi.
On-device multimodal dokumentforståelse
Mange dokumenter bærer information visuelt og er svære at analysere som almindelig tekst: PDF'er, skannede sider, skærmbilleder, diagrammer og præsentationer. Disse arbejdsprocesser afhænger af OCR og billedforståelse og drager mest fordel af en nativt multimodal model.
Rammen sender dokumentvisninger og billeder direkte til modellen, som forstår dem og kombinerer visuel evidens med den ekstraherede tekst. Behandling af disse filer på enheden holder følsomme dokumenter og deres ekstraherede indhold private.
Vi evaluerer multimodal dokumentforståelse på ParseBench-100, en delmængde på 100 opgaver af ParseBench-benchmarken, med 20 opgaver hver for diagrammer, layout, tabeller, tekstindhold og formatering.
Computer når en gennemsnitlig score på 65,1% sammenlignet med 34,6% for Hermes og 13,9% for Pi. Den fuldfører også opgaver med mindst tid og færrest tokens: i gennemsnit 60,6 sekunder og 20,1k tokens pr. opgave sammenlignet med 108,3 sekunder og 32,1k tokens for Hermes og 410,5 sekunder og 829,1k tokens for Pi. Computer fører i alle fem dokumentkategorier med sin største fordel på diagrammer. Layout forbliver svært for alle tre rammer.
Tabel 1. ParseBench-100 gennemsnitlig score efter dokumentkategori for Computer-, Hermes- og Pi-rammerne med on-device Qwen 3.8 27B-modellen. Computer fører i alle fem kategorier.
Ramme | Diagram | Layout | Tabel | Tekstindhold | Formatering |
Computer | 76,5% | 16,2% | 72,7% | 87,9% | 72,4% |
Hermes | 29,3% | 2,9% | 44,1% | 61,5% | 35,2% |
Pi | 2,5% | 0,1% | 11,0% | 29,7% | 26,1% |
Indsnævring af frontier-kløften med advisor-eskalering
Selv med en omhyggeligt designet ramme overstiger de sværeste opgaver stadig kapaciteten hos en kompakt on-device-model. For sådanne opgaver eksponerer rammen et advisor-værktøj: den lokale model kan konsultere en stærkere frontier-model, når den har brug for hjælp til planlægning, løsning af tvetydighed, gendannelse fra gentagne fejl eller verificering af det endelige resultat.
Den lokale model beslutter, hvornår der skal anmodes om rådgivning, mens rammecorkestratoren beholder værktøjsmyndighed og kontrollerer, hvilken kontekst der sendes. Eskalering er valgfri. Brugeren beslutter, om den skal aktiveres, og om hvert advisor-opkald skal godkendes manuelt eller automatisk.
Før et advisor-opkald vælger rammen den relevante kontekst, anvender en PII-klassificering til at markere følsomme oplysninger og viser brugeren, hvad der ville forlade enheden. Advisoren modtager kun den godkendte kontekst og returnerer tekstrejledning; den har ikke direkte adgang til enhedens filer, værktøjer eller samtaler. Dette forbedrer både omkostninger og privatliv, og vi planlægger at udforske denne retning yderligere i fremtidigt arbejde.
Vi tester denne tilgang på udfordrende softwareudviklingsopgaver, som kræver stærk ræsonnering, og hvor en lokal model oftest kommer til kort. Til dette bruger vi Terminal Bench 2.1, en populær benchmark med 89 opgaver for koderagenter.
Vi ønsker at besvare to spørgsmål: hvor meget af kløften til en frontier-model kan advisor-eskalering lukke, og til hvilken pris. Fuldt lokale modeller koster praktisk talt ingenting at køre, da inferens sker på brugerens hardware. Når modellen først begynder at kalde advisoren, begynder den dog at pådrage sig API-omkostninger.
Som baseline for frontier-ydeevne bruger vi Claude Opus 5, der fungerer i den lokale ramme; den lokale model er Qwen 3.8 27B. Endelig parrer vi de to: Qwen 3.8 27B udfører opgaven og eskalerer til en Claude Opus 5-advisor, når den har brug for hjælp. Vi evaluerer ikke advisor-eskalering med Pi eller Hermes, fordi ingen af dem leverer et tilsvarende advisor-værktøj; tilføjelse af et ville kræve modifikation af dens værktøjsflade og orkestreringslogik, så resultatet ikke længere ville repræsentere standardrammen.
Advisor-eskalering hæver Computers score fra 59,6% til 73,0%, en stigning på 13,5 procentpoint, til en anslået API-omkostning på $0,415 pr. udrulning. Kørsel af Claude Opus 5 alene når 82.4% til $0,65 pr. udrulning. Eskalering indhenter således ca. tre femtedele af kløften til frontier'en til ca. to tredjedele af frontier'ens omkostninger, og brugeren beslutter, hvornår den handel er værd at foretage.
Eftertræning af rammen og vidensarbejde
Indtil videre har vi holdt den lokale model uændret for at isolere, hvad rammen bidrager med. Med rammendesignet på plads kommer de største resterende gevinster fra at tilpasse selve modellen. Perplexity Computer-brugsdata viser os, hvad folk faktisk gør til vidensarbejde, hvilket vi bruger til at syntetisere træningsdata. Vi eftertræner den lokale model inde i Computer-rammen, guidet af den reelle fordeling af opgaver, som brugere udfører.
Konkret identificerer vi et mangfoldigt sæt brugsscenarier, der afprøver forskellige modelkapaciteter, værktøjer og connectors. Fra disse brugsscenarier syntetiserer vi realistiske forstærkende læringsmiljøer og definerer udfordrende, men verificerbare opgaver: hver opgave består af en instruktion, et miljø og en verifikator, der scorer det endelige resultat, hvor miljøet er en Docker-container, som rammen opererer i. Vigtigt er det, at fordi opgaverne er syntetiske, indeholder de ingen reelle dokumenter eller brugeroplysninger.
Vi bruger disse miljøer til totrætstræning: rejection fine-tuning efterfulgt af forstærkende læring. I den første fase udruller vi modellen mod hver opgave flere gange, vælger de bedste baner efter verifikatorscore og træner på dem med overvåget læring. Denne fase initialiserer modellen til den specifikke ramme og opgavefordeling. I den anden fase finjusterer forstærkende læring modellen yderligere, hvilket gør den mere robust.
En delmængde af opgaver holdes tilbage fra træning og bruges til endelig evaluering; vi kalder dette tilbageholdte sæt for Local Knowledge Work Bench: 53 opgaver fordelt på syv kategorier af dagligt vidensarbejde, fra dybtgående forskning til dokumentoprettelse. Vi vil snart udgive en teknisk rapport, der beskriver modeltræningen i detaljer, og vi planlægger at open-source denne evalueringsbenchmark.
Vi eftertrænede Qwen 3.8 27B med denne tilgang, hvilket producerede en model, vi kalder PPLX 27B, og evaluerede den på Local Knowledge Work Bench. Med basismodellen Qwen 3.8 27B opnår Computer den højeste score (82,6% sammenlignet med 77,6% for Pi og 74,0% for Hermes) og bruger færrest tokens (520k mod 681k for Pi og 634k for Hermes). Pi fuldfører opgaver hurtigst på 176 sekunder pr. opgave sammenlignet med 218 sekunder for Computer og 292 sekunder for Hermes. PPLX 27B løfter Computers score til 85,4% til prisen af flere tokens (678k mod 520k). Dens anslåede svartid er 250 sekunder.
Tabel 2. Opgavekategorier for Local Knowledge Work Bench.
Kategori | Opgaver | Andel | Beskrivelse |
Dybtgående forskning | 20 | 37,7% | Besvar komplekse spørgsmål, der kræver webresearch i flere led, offentlige datasæt, statistik og kildeverificering. |
Data, finans og indkøb | 9 | 17,0% | Rens datasæt, afstem regnskaber, revider udgifter, analysér investeringer, evaluer leverandører og beregn finansielle målingstal. |
Dokumenter, præsentationer og design | 7 | 13,2% | Producer polerede PDF'er, fakturaer, onboarding-materialer, event-materiale og forretningspræsentationer. |
Ingeniørarbejde, IT og hændelser | 5 | 9,4% | Undersøg hændelser, analysér logfiler, skriv gendannelsesplaner, vurder udgivelsesparathed og syntetisér teknisk dokumentation. |
Kontrakter, evidens og compliance | 5 | 9,4% | Gennemgå kontrakter, gennemgå evidens, undersøg tilbagekaldelser, slør følsomme dokumenter og verificer compliance-krav. |
Dashboards, software og visualisering | 4 | 7,5% | Byg interaktive dashboards, uddannelsesmæssige mikrosites, diagrammer og projektvisualiseringer. |
Personer, projekter og møder | 3 | 5,7% | Gennemse CV'er, konsolider mødebeslutninger og vedligehold projekthandlingssporere. |
I alt | 53 | 100% |
Konklusion
Vores research viser, at en stærk open source-model med dygtig lokal hardware og en ramme bygget til dem kan håndtere reelt vidensarbejde til næsten nul inferensomkostninger uden at kræve, at følsomme data forlader enheden.
På tværs af de forskellige benchmarks matchede eller oversteg Computer Hermes og Pi i nøjagtighed, mens den kørte Qwen 3.8 27B på en NVIDIA DGX Spark. Blandt de tre benchmarks, der rapporterer latency og token-forbrug, var Computer hurtigst på BrowseComp og ParseBench-100 og brugte færrest tokens på alle tre; Pi var hurtigst på Local Knowledge Work Bench.
Gevinsterne kom fra valg, vi traf. Vi byggede en kortfattet lokal ramme med færdigheder, der indlæses efter behov. Vi konverterede connectors til kompakte CLI-værktøjer i stedet for MCP-servere. Kørsel blev sandkassebeskyttet af hensyn til sikkerheden.
Resultaterne viser også, hvor kompakte modeller har plads til forbedring. For eksempel halter den lokale model efter frontier-modellen på tværs af alle tre rammer på de udfordrende koderopgaver i Terminal Bench 2.1. Advisor-eskalering indsnævrer, men lukker ikke fuldstændigt kløften; fortsatte forbedringer af modelkapaciteter og lokal hardware er stadig nødvendige for at skubbe ydeevnen yderligere frem.
Formålet med at bygge rammen og modellen til lokale begrænsninger er at give brugerne eksplicit kontrol over, hvilken information der forliver på deres maskiner. Der er også omkostningsmæssige fordele for brugeren. Vi ser disse som en del af et bredere skift, hvor stadig mere kapable agenter bevæger sig fra fjerntliggende infrastruktur til individuelle og lokale enheder. Vi forventer, at fremskridt inden for chips, modeller og enheder løbende vil udvide rækkevidden og kvaliteten af det vidensarbejde, som Portable Computer håndterer lokalt.