Lokální agent pro soukromou a cenově dostupné znalostní práci

Obálka a model navržené pro lokální znalostní práci, běžící v zařízení a přistupující ke vzdáleným funkcím na vyžádání.

AutořiPerplexity Research

Perplexity Portable Computer je lokální agent.

Celý zásobník běží ve výchozím nastavení lokálně. Model, obálka, konverzace i trajektorie žijí na zařízení uživatele. Práce, která vyžaduje okolní svět, jako je vyhledávání na webu, konektory nebo eskalace na silnější poradenský model v cloudu, je vyvolána pouze v případě potřeby a je vždy řízena uživatelem. Citlivá data proto nikdy neopustí zařízení bez povolení a lokální modely nenesou žádný poplatek za inferenci: systém je soukromý a nákladově efektivní už ze své podstaty.

Efektivní lokální agent vyžaduje, aby model a obálka byly navrženy společně. Účelové obálky předpokládají špičkový model, který dokáže absorbovat dlouhé kontexty, procházet širokou plochu nástrojů a plánovat v dlouhých horizontech. Lokální modely jsou za těchto požadavků méně spolehlivé. Místo abychom po malém modelu chtěli, aby spravoval obálku postavenou pro velký model, vytvořili jsme obě tak, aby se vzájemně doplňovaly: obálku přizpůsobenou profilu schopností modelu a model dodatečně trénovaný k efektivnímu využívání této obálky.

Úvod

Schopnosti agentů v posledních měsících rychle pokročily v široké škále úkolů znalostní práce. I když tyto pokroky přinášejí velké přínosy v produktivitě a efektivitě, přinášejí také dvě výzvy.

Spotřeba tokenů rychle roste a s ní i celkové výdaje. Když je k inteligenci přistupováno prostřednictvím rozhraní API uzavřených modelů běžících na vzdálených clusterech, soukromé informace a duševní vlastnictví opouštějí zařízení uživatele s každým požadavkem. S tím, jak agenti škálují napříč individuálními pracovními postupy a celými organizacemi, je spotřeba tokenů a pohyb dat stále obtížnější řídit.

Open-source modely se mezitím zlepšují ještě rychlejším tempem. Pokrok je nejviditelnější u velmi malých a efektivních modelů, jako jsou NVIDIA Nemotron 3.5 Lightning (celkem 30B parametrů), Qwen 3.6 (35B) a Qwen 3.8 (27B). Tyto malé modely předčí očekávání a jsou nyní schopny složitých pracovních postupů agentů. Hardware pro lokální inferenci postupuje paralelně: systémy jako NVIDIA DGX Spark nyní dokážou tyto modely spouštět lokálně. Tyto trendy dohromady činí plně lokální provoz praktickým a zároveň umožňují uživatelům v případě potřeby využívat externí schopnosti, jako je webové vyhledávání, konektory nebo eskalace na cloudový model.

Tento lokální přístup umožňuje významnou úsporu nákladů, protože lokální inference se vyhýbá poplatkům za rozhraní API za token. Přirozeně také řeší obavy o soukromí a duševní vlastnictví: soukromé tokeny nikdy nemusí být přenášeny do vzdálených clusterů a zůstávají v bezpečí v rámci hranic lokálního zařízení.

V červnu jsme představili první hybridní orchestrátor inference lokálního serveru, který rozhoduje, jaká práce má běžet na zařízení a jaká má jít agentům v cloudu. Zde vysvětlujeme, jak jsme takového lokálního agenta sestavili, včetně obálky a modelů vzájemně optimalizovaných pro sebe.

Přehled klíčových voleb návrhu hodnotíme Computer oproti oblíbeným open-source obecným obálkám (Hermes a Pi) napříč třemi veřejnými srovnávacími testy a naším interním Local Knowledge Work Bench. V našem srovnávacím testu s modelem Qwen 3.8 27B běžícím na zařízení NVIDIA DGX Spark dosahuje Computer nejvyššího skóre 82,6 % oproti 77,6 % u Pi a 74,0 % u Hermes. PPLX 27B, náš model dodatečně trénovaný nad Qwen 3.8 27B, zvyšuje skóre dále na 85,4 %.

Sloupcový graf skóre Local Knowledge Work Bench: obálky Computer, Pi a Hermes s Qwen 3.8 27B a Computer s PPLX 27B, který dosahuje nejvyššího skóre 85,4 %.
Skóre v Local Knowledge Work Bench, našem benchmarku 53 reprezentativních úkolů každodenní znalostní práce. Každý sloupec představuje kombinaci obálky a modelu běžící na NVIDIA DGX Spark; PPLX 27B je náš dodatečně trénovaný model. Tři pokusy na úkol; vousy představují 95% intervaly spolehlivosti.

Navrhněte obálku kolem lokálního modelu

Ačkoli jsou kompaktní modely v zařízení již poměrně schopné, ve výkonu stále zaostávají za většími špičkovými modely. K efektivnímu řízení těchto modelů a řešení jejich omezení je zapotřebí pečlivě navržená obálka.

Oblíbené open-source obálky jako Pi a Hermes se ukázaly jako obecné: fungují dobře s širokou škálou modelů napříč velikostmi a třídami. Nejsou však optimalizovány pro schopnosti lokálních modelů. Lokální obálku jsme navrhli speciálně pro toto prostředí, kolem několika klíčových principů.

Efektivita kontextu

Hlavním zaměřením při navrhování naší obálky bylo co nejlépe využít kontext modelu.

Ačkoli modely v zařízení, jako je Qwen 3.8 27B, nabízejí kontextová okna o velikosti 260 tisíc tokenů, empiricky jsme zjistili, že nad 100 tisíc tokenů začínají mít potíže. Základní obálku proto udržujeme stručnou: minimální systémovou výzvu a malou sadu základních nástrojů.

Všechny ostatní schopnosti jsou modularizovány do dovedností na vyžádání, které se načítají a vykládají v průběhu trajektorie. Tyto dovednosti jsme navrhli pro běžné úkoly znalostní práce: výzkum, datovou vědu, vizualizaci dat, tvorbu dokumentů, softwarové inženýrství a další.

Obálka také podporuje kompresi kontextu, přičemž shrnuje zastaralý kontext, když se trajektorie prodlouží, aby model zůstal v rámci svého efektivního okna.

Konektory jako nástroje příkazové řádky

Každodenní znalostní práce často vyžaduje konektory jako Gmail, GitHub, Outlook a Google Calendar. Ty jsou obvykle vystaveny obálce jako servery MCP, jejichž velké definice nástrojů spotřebovávají podstatnou část kontextu. Místo toho jsme nejčastěji používané protokoly MCP převedli na kompaktní, snadno použitelné nástroje příkazové řádky, doplněné o vlastní dovednosti, které mnohem lépe využívají omezený efektivní kontext.

Vlastní ověření

Výkon se také zlepšuje, když agent ověřuje svou vlastní práci. Ověření přidává další kroky, ale výrazně zlepšuje konečné výsledky a podstatně zmenšuje propast ke špičkovým modelům. Může být spuštěno samotným modelem nebo sadou háčků, které sledují stav trajektorie a požadují vlastní ověření, když se něco pokazí.

Spuštění v sandboxu

Obálka provádí nástroje v sandboxu na úrovni operačního systému v zařízení uživatele. Hranice omezuje procesy, cesty k souborům a přístup k síti podle zásad. To omezuje rozsah dopadu chybného příkazu. Pokud je sandbox nedostupný, obálka se před jakýmkoli voláním nástroje deaktivuje, namísto aby degradovala na spuštění bez sandboxu.

To se liší od open-source obálek, jako jsou Pi a Hermes, které standardně spouštějí příkazy přímo s oprávněními uživatele. V Computer je izolace vždy zapnutá, nevyžaduje žádnou konfiguraci a nástroje bez ní nemohou běžet.

Následující diagram ukazuje, jak tyto principy do sebe zapadají v prováděcí smyčce. Orchestrátor je deterministický kód obálky, nikoli LLM: udržuje smyčku, sestavuje kontext a vynucuje pravidla. Lokální model navrhuje další akci; orchestrátor provádí schválená volání nástrojů v sandboxu a vrací jejich výsledky modelu. Vyhledávání na webu, konektory a volání poradců překračují hranici zařízení pouze tehdy, když jsou povoleny a schváleny.

Diagram prováděcí smyčky lokální obálky: deterministický kód orchestrátoru sestavuje kontext a spouští nástroje v sandboxu, lokální model navrhuje akce a služby mimo zařízení jsou volitelné a řízené uživatelem.
Jak lokální obálka spouští úkol. Deterministický kód obálky řídí smyčku a nástroje v sandboxu; lokální model navrhuje akce. Služby mimo zařízení jsou volitelné a řízené uživatelem.

Lokální obálka vytěží z téhož modelu více

Pomocí stejného základního modelu v zařízení porovnáváme naši lokální obálku s alternativami pro všeobecné použití při webovém výzkumu a multimodálním porozumění dokumentům. Všechny obálky používají model Qwen 3.8 27B se středním uvažováním, běžící na NVIDIA DGX Spark. Toto srovnání izoluje schopnosti, které přispívá samotná obálka, před jakýmkoliv dodatečným trénováním modelu.

Na tyto dvě schopnosti se zaměřujeme proto, že znalostní práce často kombinuje soukromé dokumenty v zařízení uživatele s veřejnými informacemi z webu za účelem vytvoření podloženého artefaktu. Vyhledávání na webu vyžaduje připojení, ale inference modelu a zpracování soukromých dokumentů zůstávají lokální. Lokální soubory slouží jako autoritativní zdroj, veřejné zdroje přidávají kontext a uživatelé mohou vyhledávání na webu zcela zakázat pro práci plně offline.

Webový výzkum

Naši lokální obálku stavíme vedle vyhledávače Perplexity, který dosáhl předních umístění v nezávislých hodnoceních. Obálka k němu přistupuje prostřednictvím rozhraní Search as Code.

Kvalitu výzkumu hodnotíme na 1 266 úkolech BrowseComp. Computer používá vyhledávací infrastrukturu Perplexity spolu s naší lokální obálkou, zatímco Pi a Hermes spoléhají na Brave, jejich doporučeného poskytovatele vyhledávání. Computer dosahuje přesnosti 66,7 % ve srovnání s 50,2 % u Pi a 43,9 % u Hermes.

Computer má také nejnižší zaznamenanou průměrnou dobu běhu a spotřebu tokenů: 402,1 sekundy a 852 tisíc tokenů na úkol, ve srovnání s 1 020,9 sekundami a 1,01 milionu tokenů pro Hermes a 826,0 sekundami a 2,82 milionu tokenů pro Pi. Computer tak využívá o 61 % kratší dobu běhu a o 16 % méně tokenů než Hermes a o 51 % kratší dobu běhu a o 70 % méně tokenů než Pi.

Bodový graf skóre BrowseComp oproti průměrné době běhu na úkol pro Computer, Hermes a Pi s Qwen 3.8 27B; Computer dosahuje nejvyššího skóre s nejkratším časem a nejméně tokeny.
Výsledky BrowseComp s modelem Qwen 3.8 27B v zařízení: skóre versus průměrná doba běhu na úkol pro obálky Computer, Hermes a Pi; popisky bodů ukazují průměrné tokeny na úkol. Neúplné výsledky mají nulové skóre a průměry času a tokenů nezahrnují spuštění bez zaznamenaných měření. Vousy jsou 95% Wilsonovy intervaly spolehlivosti pro skóre.

Multimodální porozumění dokumentům v zařízení

Mnoho dokumentů nese informace vizuálně a je obtížné je analyzovat jako prostý text: soubory PDF, naskenované stránky, snímky obrazovky, grafy a prezentace. Tyto pracovní postupy závisí na OCR a porozumění obrazu a nejvíce těží z přirozeně multimodálního modelu.

Obálka předává stránky dokumentů a obrázky přímo modelu, který jim rozumí a kombinuje vizuální důkazy s extrahovaným textem. Zpracování těchto souborů v zařízení udržuje citlivé dokumenty a jejich extrahovaný obsah v soukromí.

Multimodální porozumění dokumentům hodnotíme na ParseBench-100, což je podmnožina 100 úkolů z benchmarku ParseBench, s 20 úkoly pro grafy, rozvržení, tabulky, textový obsah a formátování.

Computer dosahuje průměrného skóre 65,1 % ve srovnání s 34,6 % u Hermes a 13,9 % u Pi. Úkoly také dokončuje v nejkratším čase a s nejmenším počtem tokenů: v průměru 60,6 sekundy a 20,1 tisíce tokenů na úkol, ve srovnání se 108,3 sekundami a 32,1 tisíce tokenů u Hermes a 410,5 sekundami a 829,1 tisíce tokenů u Pi. Computer vede ve všech pěti kategoriích dokumentů, přičemž největší náskok má u grafů. Rozvržení zůstává obtížné pro všechny tři obálky.

Bodový graf skóre OCR ParseBench-100 oproti průměrné době běhu na úkol pro Computer, Hermes a Pi s Qwen 3.8 27B; Computer dosahuje nejvyššího skóre s nejkratším časem a nejméně tokeny.
Výsledky OCR ParseBench-100 s modelem Qwen 3.8 27B v zařízení: skóre versus průměrná doba běhu na úkol pro obálky Computer, Hermes a Pi; popisky bodů ukazují průměrné tokeny na úkol. Průměry tokenů využívají spuštění se zaznamenanými měřeními. Vousy jsou 95% intervaly spolehlivosti.

Tabulka 1. Průměrné skóre ParseBench-100 podle kategorie dokumentů pro obálky Computer, Hermes a Pi s modelem Qwen 3.8 27B v zařízení. Computer vedoucí ve všech pěti kategoriích.

Obálka

Graf

Rozvržení

Tabulka

Textový obsah

Formátování

Computer

76,5 %

16,2 %

72,7 %

87,9 %

72,4 %

Hermes

29,3 %

2,9 %

44,1 %

61,5 %

35,2 %

Pi

2,5 %

0,1 %

11,0 %

29,7 %

26,1 %

Zmenšování propasti ke špičce pomocí eskalace na poradce

I s pečlivě navrženou obálkou ty nejtěžší úkoly stále přesahují schopnosti kompaktního modelu v zařízení. Pro takové úkoly obálka vystavuje poradenský nástroj: lokální model se může poradit se silnějším špičkovým modelem, když potřebuje pomoc s plánováním, řešením nejednoznačnosti, zotavením z opakovaných selhání nebo ověřením konečného výsledku.

Lokální model rozhoduje, kdy požádat o radu, zatímco orchestrátor obálky si zachovává pravomoc nad nástroji a řídí, jaký kontext je odeslán. Eskalace je volitelná. Uživatel rozhoduje, zda ji povolí a zda každé volání poradce schválí ručně, nebo automaticky.

Před voláním poradce obálka vybere relevantní kontext, použije klasifikátor PII k označení citlivých informací a ukáže uživateli, co by zařízení opustilo. Poradce obdrží pouze schválený kontext a vrátí textové pokyny; nemá přímý přístup k souborům, nástrojům ani konverzacím v zařízení. To zlepšuje jak náklady, tak soukromí a plánujeme tento směr dále prozkoumat v budoucí práci.

Diagram eskalace na poradce: orchestrátor obálky si zachovává pravomoc nad nástroji a odesílá pouze schválený kontext poradenskému modelu, který vrací textové pokyny bez přímého přístupu k nástrojům nebo souborům.
Vzdálené navádění, lokální ovládání. Orchestrátor obálky si zachovává pravomoc nad nástroji a odesílá pouze kontext schválený pro eskalaci. Poradce nemá přímý přístup k nástrojům, souborům ani kanálu odezvy; vrací textové pokyny, které může lokální model využít.

Tento přístup testujeme na náročných úkolech softwarového inženýrství, které vyžadují silné uvažování a kde lokální model nejčastěji selhává. K tomu používáme Terminal Bench 2.1, oblíbený benchmark s 89 úkoly pro kódovací agenty.

Chceme zodpovědět dvě otázky: kolik z propasti ke špičkovému modelu dokáže eskalace na poradce uzavřít a za jakou cenu. Spuštění plně lokálních modelů nestojí prakticky nic, protože inference probíhá na hardwaru uživatele. Jakmile však model začne volat poradce, začnou mu vznikat náklady na API.

Jako základ pro výkon špičkových modelů používáme Claude Opus 5 pracující v lokální obálce; lokálním modelem je Qwen 3.8 27B. Nakonec oba spojíme: Qwen 3.8 27B provede úkol a v případě potřeby pomoci eskaluje na poradce Claude Opus 5. Eskalaci na poradce s Pi ani Hermes nehodnotíme, protože ani jedno neposkytuje ekvivalentní poradenský nástroj; přidání by vyžadovalo úpravu jeho plochy nástrojů a logiky orchestrace, takže výsledek by již nepředstavoval hotovou obálku.

Eskalace na poradce zvyšuje skóre Computeru z 59,6 % na 73,0 %, což představuje nárůst o 13,5 procentního bodu, při odhadovaných nákladech na API ve výši 0,415 USD na jedno spuštění. Samotné spuštění Claude Opus 5 dosahuje 82,4 % při 0,65 USD na spuštění. Eskalace tak obnovuje zhruba tři pětiny propasti ke špičce přibližně za dvě třetiny nákladů špičky a uživatel rozhoduje, kdy se tato kompromisní volba vyplatí.

Bodový graf skóre Terminal Bench 2.1 oproti nákladům na API na spuštění: Qwen 3.8 27B plně lokálně, Qwen 3.8 27B s poradcem Claude Opus 5 a samotný Claude Opus 5, vše v obálce Computer.
Nákladová efektivita Terminal Bench 2.1 na 89 úkolech: skóre versus náklady na API na spuštění. Všechny body používají obálku Computer: Qwen 3.8 27B plně lokálně, Qwen 3.8 27B eskalující na poradce Claude Opus 5 a samotný Claude Opus 5. Čárkované čáry ukazují Pi a Hermes spouštějící stejný lokální model s nulovými náklady na API. Vousy jsou 95% intervaly spolehlivosti bootstrapu úkolu; neúplná spuštění mají nulové skóre.

Dodatečné trénování pro obálku a znalostní práci

Zatím jsme ponechali lokální model nezměněný, abychom izolovali to, čím přispívá obálka. S hotovým návrhem obálky pocházejí největší zbývající zisky z přizpůsobení samotného modelu. Údaje o používání Perplexity Computer nám ukazují, co lidé skutečně dělají při znalostní práci, což používáme k syntéze tréninkových dat. Lokální model dodatečně trénujeme uvnitř obálky Computer, vedení skutečným rozdělením úkolů, které uživatelé provádějí.

Konkrétně identifikujeme různorodou sadu případů použití, které procvičují různé schopnosti modelů, nástroje a konektory. Z těchto případů použití syntetizujeme realistická prostředí pro posilované učení a definujeme náročné, ale ověřitelné úkoly: každý úkol se skládá z pokynu, prostředí a ověřovatele, který boduje konečný výsledek, přičemž prostředí je kontejner Docker, ve kterém obálka funguje. Důležité je, že protože jsou úkoly syntetické, neobsahují žádné skutečné dokumenty ani uživatelské informace.

Tato prostředí používáme pro dvoustupňové trénování: jemné ladění odmítnutím následované posilovaným učením. V prvním stupni nasadíme model proti každému úkolu několikrát, vybereme nejlepší trajektorie podle skóre ověřovatele a trénujeme na nich pomocí supervisovaného učení. Tento stupeň inicializuje model pro specifickou obálku a rozdělení úkolů. Ve druhém stupni posilované učení dále jemně doladí model a činí jej robustnějším.

Podmnožina úkolů je vyčleněna z trénování a používá se pro závěrečné hodnocení; tuto vyčleněnou sadu nazýváme Local Knowledge Work Bench: 53 úkolů pokrývajících sedm kategorií každodenní znalostní práce, od hloubkový výzkum po tvorbu dokumentů. Brzy vydáme technickou zprávu popisující trénování modelu podrobně a plánujeme tento hodnotící benchmark poskytnout jako open-source.

Tímto přístupem jsme dodatečně trénovali Qwen 3.8 27B, čímž jsme vytvořili model nazvaný PPLX 27B, a vyhodnotili jej na Local Knowledge Work Bench. S 3.8 27B základním modelem Qwen dosahuje Computer nejvyššího skóre (82,6 % oproti 77,6 % u Pi a 74,0 % u Hermes) a používá nejméně tokenů (520 tisíc oproti 681 tisícům u Pi a 634 tisícům u Hermes). Pi dokončuje úkoly nejrychleji za 176 sekund na úkol ve srovnání s 218 sekundami u Computer a 292 sekundami u Hermes. PPLX 27B zvyšuje skóre Computeru na 85,4 % za cenu více tokenů (678 tisíc oproti 520 tisícům). Jeho odhadovaná doba běhu je 250 sekund.

Bodový graf skóre Local Knowledge Work Bench oproti průměrné době běhu na úkol; PPLX 27B běžící v Computer dosahuje nejvyššího skóre 85,4 %.
Výsledky dodatečného trénování na Local Knowledge Work Bench: skóre versus průměrná doba běhu na úkol; popisky bodů ukazují obálku, model a průměrné tokeny na úkol. PPLX 27B je náš dodatečně trénovaný model, běžící v Computer. Vousy jsou 95% intervaly spolehlivosti nad 53 úkoly s třemi pokusy každý.

Tabulka 2. Kategorie úkolů Local Knowledge Work Bench.

Kategorie

Úkoly

Podíl

Popis

Hloubkový výzkum

20

37,7 %

Odpovězte na složité otázky vyžadující vícestupňový webový výzkum, veřejné datové sady, statistiky a ověření zdrojů.

Data, finance a zadávání zakázek

9

17,0 %

Čistěte datové sady, slaďte záznamy, auditujte výdaje, analyzujte investice, vyhodnocujte dodavatele a vypočítejte finanční metriky.

Dokumenty, prezentace a design

7

13,2 %

Vytvářejte vypiplané soubory PDF, faktury, onboardingové materiály, podklady pro akce a obchodní prezentace.

Inženýrství, IT a incidenty

5

9,4 %

Vyšetřujte incidenty, analyzujte protokoly, pište plány obnovy, posuzujte připravenost k vydání a syntetizujte technickou dokumentaci.

Smlouvy, důkazy a dodržování předpisů

5

9,4 %

Kontrolujte smlouvy, prověřujte důkazy, vyšetřujte stažení z oběhu, redigujte citlivé dokumenty a ověřujte požadavky na dodržování předpisů.

Řídicí panely, software a vizualizace

4

7,5 %

Sestavujte interaktivní řídicí panely, výukové microsites, grafy a vizualizace projektů.

Lidé, projekty a schůzky

3

5,7 %

Prověřujte životopisy, konsolidujte rozhodnutí ze schůzek a spravujte sledovače akcí projektů.

Celkem

53

100 %

Závěr

Náš výzkum ukazuje, že silný open-source model s schopným lokálním hardwerem a obálkou pro něj postavenou zvládne skutečnou znalostní práci s téměř nulovými náklady na inferenci, aniž by vyžadoval, aby citlivá data opustila zařízení.

Napříč různými srovnávacími testy Computer vyrovnal nebo překonal Hermes a Pi v přesnosti při spuštění Qwen 3.8 27B na NVIDIA DGX Spark. Mezi třemi srovnávacími testy, které uvádějí latenci a použití tokenů, byl Computer nejrychlejší na BrowseComp a ParseBench-100 a použil nejméně tokenů na všech třech; Pi byl nejrychlejší na Local Knowledge Work Bench.

Zisky vzešly z rozhodnutí, která jsme učinili. Vytvořili jsme stručnou lokální obálku s dovednostmi, které se načítají na vyžádání. Převedli jsme konektory na kompaktní nástroje CLI namísto serverů MCP. Provádění bylo z bezpečnostních důvodů uzavřeno v sandboxu.

Výsledky také ukazují, kde mají kompaktní modely prostor pro zlepšení. Například u náročných kódovacích úkolů Terminal Bench 2.1 zaostává lokální model za špičkovým modelem ve všech třech obálkách. Eskalace na poradce zmenšuje, ale zcela neuzavírá mezeru; k dalšímu posunu výkonu vpřed jsou stále potřeba nepřetržitá vylepšení schopností modelů a lokálního hardwaru.

Účelem sestavení obálky a modelu pro lokální omezení je dát uživatelům výslovnou kontrolu nad tím, jaké informace opouštějí jejich stroje. Pro uživatele to má také přínosy v podobě úspory nákladů. Vnímáme to jako součást širšího posunu, ve kterém stále schopnější agenti přecházejí ze vzdálené infrastruktury na individuální a lokální zařízení. Očekáváme, že pokroky v čipech, modelech a zařízeních budou neustále rozšiřovat rozsah a kvalitu znalostní práce, kterou Portable Computer zpracovává lokálně.