適用於私密且具成本效益知識工作的本機優先代理程式

為本機知識工作共同設計的執行環境與模型,可在裝置上執行並視需求存取遠端功能。

作者Perplexity Research

Perplexity Portable Computer 是一個以本機優先的代理程式。

整個堆疊預設都在本機執行。模型、執行環境、對話與軌跡全都存放在使用者的機器上。需要外部世界的作業(例如網路搜尋、連接器,或升級至雲端上更強大的顧問模型)僅在必要時才會叫用,且一律由使用者進行閘道控管。因此,在未經許可的情況下,敏感資料絕不會離開裝置,且本機模型不需支付推論費用:就系統架構而言,它是隱密且具成本效益的。

一個有效的本機優先代理程式要求模型與執行環境必須共同設計。通用型執行環境假設有一個能夠吸收長上下文、瀏覽廣泛工具介面並跨越長遠視界的前沿模型。本機模型在這些需求下可靠性較低。我們沒有要求小模型去管理為大模型建構的執行環境,而是讓兩者互相配合塑造:打造出配合模型能力設定檔量身打造的執行環境,以及經過後訓練以有效使用該執行環境的模型。

簡介

最近幾個月,代理式能力在各種知識工作任務中迅速進展。雖然這些進展帶來了 生產力與效率的大幅提升,但它們也帶來了兩個挑戰。

權杖消耗量正快速上升,整體支出也隨之增加。當透過在遠端叢集上執行的閉源模型 API 來存取智慧時,私人資訊與智慧財產權會在每個要求發出時離開使用者的裝置。隨著代理程式擴展到個別工作流程與整個組織,權杖支出與資料流動變得越來越難以治理。

與此同時,開源模型的進步速度甚至更快。在極小且高效的模型中,這種進展最為明顯,例如 NVIDIA Nemotron 3.5 Lightning(總計 300 億個參數)、Qwen 3.6(350 億)以及 Qwen 3.8(270 億)。這些小模型表現超群,現在已具備執行複雜代理式工作流程的能力。本機推論硬體也同步在進步:諸如 NVIDIA DGX Spark 等系統現在可以在本機執行這些模型。這些趨勢結合在一起,使完全在裝置上運作變得切實可行,同時允許使用者在需要時選擇外部功能(例如網路搜尋、連接器或雲端模型升級)。

這種本機優先的方法能夠顯著節省成本,因為本機推論可避免每個權杖的 API 費用。它還自然地解決了隱私與智慧財產權的疑慮:私人權杖永遠不需要傳輸到遠端叢集,而是安全地留在本機裝置的邊界之內。

在 6 月,我們推出了第一個混合式本機與伺服器推論協調器,它能決定哪些工作應該在本機執行,以及哪些工作應該傳送至雲端中的代理程式。在此,我們將說明我們是如何建構這樣一個本機優先的代理程式,包括執行環境以及互為對方最佳化所共同設計的模型。

我們概述了主要的設計選擇,在三個公開基準測試以及我們的內部「本機知識工作基準 (Local Knowledge Work Bench)」上,評估了 Computer 與熱門的開源通用型執行環境(HermesPi)。在我們的基準測試中,當 Qwen 3.8 27B 模型在 NVIDIA DGX Spark 上執行時,Computer 獲得了最高分,達 82.6%,相較之下 Pi 為 77.6%,Hermes 為 74.0%。PPLX 27B 是我們在 Qwen 3.8 27B 基礎上進行後訓練的模型,將分數進一步提升至 85.4%。

本機知識工作基準 (Local Knowledge Work Bench) 分數的長條圖:搭配 Qwen 3.8 27B 的 Computer、Pi 和 Hermes 執行環境,以及搭配 PPLX 27B 的 Computer,其獲得最高分 85.4%。
在我們由 53 個具代表性的日常知識工作任務組成的基準測試「本機知識工作基準 (Local Knowledge Work Bench)」上的分數。每個長條是在 NVIDIA DGX Spark 上執行的執行環境與模型組合;PPLX 27B 是我們的後訓練模型。每個任務三次試驗;誤差線為 95% 信賴區間。

圍繞本機模型設計執行環境

雖然精巧的裝置端模型已經相當有能力,但在效能上它們仍然落後於較大的前沿模型。我們需要精心設計的執行環境來有效地引導這些模型並解決其侷限性。

熱門的開源執行環境(例如 Pi 與 Hermes)已被證明是通用的:它們能與各種不同大小與類別的模型搭配良好。但它們並未針對本機模型的功能進行最佳化。我們特別針對此設定設計了本機執行環境,並遵循幾個核心原則。

上下文效率

設計我們執行環境的主要焦點,在於充份利用模型的上下文。

儘管諸如 Qwen 3.8 27B 等裝置端模型提供 260K 權杖的上下文視窗,但我們經由實驗發現,當超過 100K 權杖時,它們便開始感到吃力。因此,我們保持核心執行環境簡潔:最小化的系統提示與一小組核心工具。

所有其他功能都被模組化為隨需載入的技能,這些技能會在整個軌跡中載入與卸載。我們為常見的知識工作任務設計了這些技能:研究、資料科學、資料視覺化、文件建立、軟體工程等。

執行環境也支援上下文壓縮,當軌跡變長時摘要陳舊的上下文,以便讓模型保持在其有效的視窗內。

作為命令列工具的連接器

日常知識工作通常需要連接器,例如 Gmail、GitHub、Outlook 與 Google Calendar。這些通常會作為 MCP 伺服器暴露給執行環境,其龐大的工具定義消耗了相當大比例的上下文。相反地,我們將最常使用的 MCP 轉換成精簡且易於使用的命令列工具,並輔以自訂技能,能更有效地利用有限的有效上下文。

自我驗證

當代理程式驗證自己的工作時,效能也會提升。驗證會增加額外的步驟,但它能大幅改善最終結果,並顯著縮短與前沿模型的差距。它可以由模型本身觸發,或由一組監控軌跡健康狀況並在出問題時請求自我驗證的掛鉤 (hooks) 來觸發。

沙箱化執行

執行環境在使用者的裝置上於作業系統層級的沙箱中執行工具。此邊界根據政策來限制程序、檔案系統路徑與網路存取。這限制了錯誤指令的影響範圍。如果沙箱無法使用,執行環境會在進行任何工具呼叫之前自行停用,而不會降級為未沙箱化的執行。

這與 Pi 和 Hermes 等開源執行環境不同,後者預設會直接以使用者的權限執行命令。在 Computer 中,隔離功能永遠開啟,不需要任何設定,而且工具沒有它就無法執行。

下圖展示了這些原則如何在執行迴圈中結合在一起。協調器是具決定性的執行環境程式碼,而不是 LLM:它維護迴圈、組合上下文並強制執行政策。本機模型提出下一個動作;協調器在沙箱中執行核准的工具呼叫,並將其結果傳回給模型。網路搜尋、連接器和顧問呼叫只有在啟用並核准時才會跨越裝置邊界。

本機執行環境執行迴圈的圖表:具決定性的協調器程式碼組合上下文並執行沙箱化工具,本機模型提出動作,且裝置外服務為選用且由使用者進行閘道控管。
本機執行環境如何執行任務。具決定性的執行環境程式碼控制迴圈與沙箱化工具;本機模型提出動作。裝置外服務為選用且由使用者進行閘道控管。

本機執行環境讓相同的模型發揮更多效能

使用相同的裝置端基礎模型,我們將我們的本機執行環境與通用型替代方案在網路研究和多模態文件理解方面進行比較。所有執行環境都使用具有中等推理能力的 Qwen 3.8 27B 模型,並在 NVIDIA DGX Spark 上執行。這種比較隔絕了由執行環境本身所貢獻的能力,在任何模型後訓練之前。

我們專注於這兩項能力,因為知識工作通常會結合使用者裝置上的私人文件與來自網路的公開資訊,以產生有依據的成品。網路搜尋需要連線能力,但模型推論與私人文件處理仍保持在本機。本機檔案作為權威來源,公開來源增加上下文,且使用者可以完全停用網路搜尋以進行完全離線的工作。

網路研究

我們將我們的本機執行環境與 Perplexity 的搜尋引擎一起建構,該搜尋引擎已在獨立評估中獲得頂尖排名。執行環境透過 Search as Code 介面來存取它。

我們在 1,266 個 BrowseComp 任務上評估研究品質。Computer 使用 Perplexity 的搜尋基礎設施以及我們的本機執行環境,而 Pi 和 Hermes 則依賴其推薦的搜尋提供者 Brave。Computer 達到 66.7% 的準確率,相較之下 Pi 為 50.2%,Hermes 為 43.9%。

Computer 還具有最低的平均記錄實際執行時間與權杖使用量:每個任務 402.1 秒和 852k 權杖,相較之下 Hermes 為 1,020.9 秒和 101 萬個權杖,Pi 則是 826.0 秒和 282 萬個權杖。因此,與 Hermes 相比,Computer 減少了 61% 的實際執行時間和 16% 的權杖使用量;與 Pi 相比,則減少了 51% 的實際執行時間和 70% 的權杖使用量。

搭配 Qwen 3.8 27B 的 Computer、Hermes 和 Pi 的 BrowseComp 分數對每個任務平均實際執行時間的散佈圖;Computer 以最少的時間和最少的權杖達到最高分。
搭配裝置端 Qwen 3.8 27B 模型的 BrowseComp 結果:Computer、Hermes 和 Pi 執行環境的分數對每個任務平均實際執行時間;點標籤顯示每個任務的平均權杖。未完成的結果分數為零,且時間與權杖平均值不包含沒有記錄測量值的 rollout。誤差線為分數的 95% Wilson 信賴區間。

裝置端多模態文件理解

許多文件以視覺化方式攜帶資訊,且很難作為純文字來解析:PDF、掃描頁面、螢幕截圖、圖表與簡報。這些工作流程依賴 OCR 與影像理解,並最受惠於原生多模態模型。

執行環境將文件頁面與影像直接傳遞給模型,模型會理解它們,並將視覺證據與擷取的文字結合。在裝置上處理這些檔案可確保敏感文件及其擷取內容的隱私。

我們在 ParseBench-100 上評估多模態文件理解,這是 ParseBench 基準測試的 100 個任務子集,其中圖表、版面配置、表格、文字內容和格式各有 20 個任務。

Computer 的平均分數達到 65.1%,相較之下 Hermes 為 34.6%,Pi 為 13.9%。它也以最少的時間和最少的權杖完成任務:平均每個任務 60.6 秒和 20.1k 權杖,相較之下 Hermes 為 108.3 秒和 32.1k 權杖,Pi 為 410.5 秒和 829.1k 權杖. Computer 在所有五個文件類別中領先,其中在圖表上的優勢最大。版面配置對所有三個執行環境而言依然困難。

搭配 Qwen 3.8 27B 的 Computer、Hermes 和 Pi 的 ParseBench-100 OCR 分數對每個任務平均實際執行時間的散佈圖;Computer 以最少的時間和最少的權杖達到最高分。
搭配裝置端 Qwen 3.8 27B 模型的 ParseBench-100 OCR 結果:Computer、Hermes 和 Pi 執行環境的分數對每個任務平均實際執行時間;點標籤顯示每個任務的平均權杖。權杖平均值使用具有記錄測量值的 rollout。誤差線為 95% 信賴區間。

表 1. 搭配裝置端 Qwen 3.8 27B 模型的 Computer、Hermes 和 Pi 執行環境在各文件類別的 ParseBench-100 平均分數。Computer 在所有五個類別中領先。

執行環境

圖表

版面配置

表格

文字內容

格式

Computer

76.5%

16.2%

72.7%

87.9%

72.4%

Hermes

29.3%

2.9%

44.1%

61.5%

35.2%

Pi

2.5%

0.1%

11.0%

29.7%

26.1%

透過顧問升級縮小與前沿模型的差距

即使有精心設計的執行環境,最困難的任務仍然超出精巧裝置端模型的能力。對於此類任務,執行環境公開了一個顧問工具:當本機模型在規劃、解決模糊性、從重複失敗中恢復或驗證最終結果需要協助時,可以諮詢更強大的前沿模型。

本機模型決定何時請求建議,而執行環境協調器則保留工具權限並控制傳送哪些上下文。升級是選用的。使用者可以決定是否啟用它,以及是否要手動或自動核准每次的顧問呼叫。

在進行顧問呼叫之前,執行環境會選取相關的上下文,套用 PII 分類器來標記敏感資訊,並向使用者顯示將會離開裝置的內容。顧問只會收到經核准的上下文並傳回文字指引;它無法直接存取裝置的檔案、工具或對話。這改善了成本與隱私,我們計劃在未來的工作中進一步探索這個方向。

顧問升級的圖表:執行環境協調器保留工具權限,且僅將核准的上下文傳送給顧問模型,顧問模型傳回文字指引,無法直接存取工具或檔案。
遠端指引,本機控制。執行環境協調器保留工具權限,且僅傳送已核准用於升級的上下文。顧問無法直接存取工具、檔案或回應通道;它傳回本機模型可能會使用的文字指引。

我們在具有挑戰性的軟體工程任務上測試這項方法,這些任務需要強大的推理能力,也是本機模型最常力有未逮的地方。為此,我們使用 Terminal Bench 2.1,這是一個熱門的 89 個任務的編碼代理程式基準測試。

我們想要回答兩個問題:顧問升級可以縮小與前沿模型多少差距,以及代價是什麼。完全本機模型執行的成本幾乎為零,因為推論是在使用者的硬體上進行。然而,一旦模型開始呼叫顧問,它就會開始產生 API 費用。

作為前沿效能的基準,我們使用在本地執行環境中運作的 Claude Opus 5;本機模型則是 Qwen 3.8 27B。最後,我們將兩者配對:Qwen 3.8 27B 執行任務,並在需要協助時升級至 Claude Opus 5 顧問。我們不會評估搭配 Pi 或 Hermes 的顧問升級,因為兩者都沒有提供相對應的顧問工具;新增一個工具將需要修改其工具介面與協調邏輯,因此結果將不再代表現成的執行環境。

顧問升級將 Computer 的分數從 59.6% 提升至 73.0%,增加了 13.5 個百分點,每個 rollout 的估計 API 成本為 $0.415 美元。單獨執行 Claude Opus 5 的分數可達 82.4%,每個 rollout 成本為 $0.65 美元。因此,升級以大約三分之二的前沿成本,恢復了約五分之三與前沿的差距,而使用者可以決定何時該交換是值得的。

Terminal Bench 2.1 分數對每個 rollout API 成本的散佈圖:完全本機的 Qwen 3.8 27B、搭配 Claude Opus 5 顧問的 Qwen 3.8 27B,以及單獨的 Claude Opus 5,全都在 Computer 執行環境中。
在 89 個任務上的 Terminal Bench 2.1 成本效能:分數對每個 rollout 的 API 成本。所有點都使用 Computer 執行環境:完全本機的 Qwen 3.8 27B、升級至 Claude Opus 5 顧問的 Qwen 3.8 27B,以及單獨的 Claude Opus 5。虛線顯示以零 API 成本執行相同本機模型的 Pi 和 Hermes。誤差線為任務自助法 (task-bootstrap) 95% 信賴區間;未完成的 rollout 分數為零。

針對執行環境與知識工作的後訓練

到目前為止,我們保持本機模型不變,以便隔離執行環境所貢獻的部分。在執行環境設計就緒後,剩下的最大增益來自於調適模型本身。Perplexity Computer 使用資料向我們展示了人們在知識工作中實際執行的操作,我們利用這些資料來合成訓練資料。我們在 Computer 執行環境內對本機模型進行後訓練,並由使用者執行的任務的實際分佈來引導。

具體來說,我們識別出一組不同的使用情境,這些情境運用了不同的模型能力、工具與連接器。從這些使用情境中,我們合成出實際的強化學習環境,並定義出具挑戰性但可驗證的任務:每個任務由一個指令、一個環境,以及一個對最終結果評分的驗證器組成,其中環境是執行環境在其上運作的 Docker 容器。重要的是,由於這些任務是合成的,它們不包含任何真實文件或使用者資訊。

我們將這些環境用於兩階段訓練:拒絕微調接著進行強化學習。在第一階段中,我們針對每個任務對模型進行多次 rollout,透過驗證器分數選取最佳軌跡,並透過監督式學習對其進行訓練。此階段為特定的執行環境與任務分佈初始化模型。在第二階段中,強化學習進一步微調模型,使其更具強固性。

一部分的任務從訓練中保留下來並用於最終評估;我們將這個保留集稱為「本機知識工作基準 (Local Knowledge Work Bench)」:53 個任務涵蓋了七個類別的日常知識工作,從深入研究到文件建立。我們很快就會發布一份技術報告,詳細描述模型訓練,我們也計劃將此評估基準開源。

我們以此方法對 Qwen 3.8 27B 進行後訓練,產生了一個我們稱為 PPLX 27B 的模型,並在「本機知識工作基準 (Local Knowledge Work Bench)」上對其進行評估。使用基礎的 Qwen 3.8 27B 模型,Computer 獲得了最高分(82.6%,相較之下 Pi 為 77.6%,Hermes 為 74.0%)並使用最少的權杖(520k,相較之下 Pi 為 681k,Hermes 為 634k)。Pi 完成任務的速度最快,每個任務 176 秒,相較之下 Computer 為 218 秒,Hermes 為 292 秒。PPLX 27B 將 Computer 的分數提升至 85.4%,代價是更多的權杖(678k 對比 520k)。其估計的實際執行時間為 250 秒。

本機知識工作基準 (Local Knowledge Work Bench) 分數對每個任務平均實際執行時間的散佈圖;在 Computer 中執行的 PPLX 27B 達到 85.4% 的最高分。
在「本機知識工作基準 (Local Knowledge Work Bench)」上的後訓練結果:分數對每個任務平均實際執行時間;點標籤顯示執行環境、模型以及每個任務的平均權杖。PPLX 27B 是我們的後訓練模型,在 Computer 中執行。誤差線是跨 53 個任務(每次三次試驗)的 95% 信賴區間。

表 2. 本機知識工作基準 (Local Knowledge Work Bench) 任務類別。

類別

任務

佔比

描述

深入研究

20

37.7%

回答需要多跳網路研究、公共資料集、統計資料與來源驗證的複雜問題。

資料、財務與採購

9

17.0%

清理資料集、對帳、審計費用、分析投資、評估供應商並計算財務指標。

文件、簡報與設計

7

13.2%

製作精美的 PDF、發票、到職導引資料、活動宣傳品與商業簡報。

工程、IT 與事件處理

5

9.4%

調查事件、分析記錄檔、撰寫復原計畫、評估發布就緒狀態,並綜合技術文件。

合約、證據與合規性

5

9.4%

審查合約、審查證據、調查召回事件、修訂敏感文件,以及驗證合規要求。

儀表板、軟體與視覺化

4

7.5%

建構互動式儀表板、教育微型網站、圖表與專案視覺化。

人員、專案與會議

3

5.7%

篩選履歷、整合會議決議,並維護專案行動追蹤器。

總計

53

100%

結論

我們的研究顯示,強大的開源模型搭配有能力的本機硬體以及為其建構的執行環境,能夠以趨近於零的推論成本處理真正的知識工作,而不需要敏感資料離開裝置。

在各個基準測試中,當在 NVIDIA DGX Spark 上執行 Qwen 3.8 27B 時,Computer 在準確率上平局或超越了 Hermes 和 Pi。在回報延遲與權杖用量的三個基準測試中,Computer 在 BrowseComp 和 ParseBench-100 上的速度最快,且在全部三個測試中使用的權杖最少;Pi 在「本機知識工作基準 (Local Knowledge Work Bench)」上的速度最快。

這些增益來自於我們的選擇。我們建構了一個簡潔的本機執行環境,並具備隨需載入的技能。我們將連接器轉換成精簡的 CLI 工具,而不是 MCP 伺服器。為了安全性,執行已進行沙箱化。

結果也顯示了精巧模型仍有改進空間的地方。例如,在 Terminal Bench 2.1 具挑戰性的編碼任務中,本機模型在所有三個執行環境中皆落後於前沿模型。顧問升級縮小了差距,但並未完全彌合;要進一步推動效能,仍需要持續改進模型能力與本機硬體。

建構適用於本機限制的執行環境與模型的目的,是為了讓使用者能夠明確控制哪些資訊會離開他們的機器。對使用者而言也有成本上的好處。我們認為這是更廣泛轉變的一部分,在其中能力日益強大的代理程式從遠端基礎設施轉移到個人與本機裝置。我們預期晶片、模型與裝置的進步將會持續擴大 Portable Computer 可以在本機處理的知識工作範圍。