AI 代理人如何重塑知識工作

Computer 提高了任務自主性、降低了成本,並擴大了使用者所承擔的工作範圍。

作者Perplexity Research

前沿 AI 系統正在縮小模型智慧與現實世界應用之間的差距。新的模型、運算架構和協調模式使這些系統能夠完成僅在幾個月前被認為是不可能的任務。

這種快速創新透過放大使用者的槓桿作用和自主權,證明對 AI 使用者是一大助力。然而,它也在技術前沿與我們對知識工作如何應對演變的精確理解之間造成了滯後。前沿 AI 如何改變各行各業知識工作的本質?我們預期在這項工作中會出現哪些結構性和經濟性變革?

我們尋求透過對 Perplexity 使用情況進行嚴謹的實證分析來縮小這一差距。今天,我們與哈佛商學院的研究人員合作,分享我們關於 Perplexity Computer 在現實世界部署中的首份綜合研究。我們的研究結果顯示,Computer 不僅擴大了使用者能完成工作的廣度與深度,且成本更低。Computer 的使用者能完成更多工作,在更高抽象層級上運作,並跨越學科界限以發揮自身專業以外的價值。

本文介紹了我們研究的重點。詳細的方法論和研究結果請參閱我們的 技術報告

緒論

第一代主流生成式 AI 系統是與使用者進行對話的對話式助理。這些助理位於意圖與行動之間。它們負責回答問題、解釋權衡,並建議後續步驟。隨後,使用者必須將答案轉化為實際工作:開啟正確的工具、收集檔案、編輯文件、檢查中間產出,並決定下一步該做什麼。

代理人(Agents)改變了這種勞動分工。使用者指定一個目標,系統便會跨工具進行規劃、執行中間步驟、在需要時詢問缺失的輸入,並回傳完成的交付成果。代理人將 AI 的使用方式從單純的查詢與整合,轉變為自主規劃並執行任務。

這一發展軌跡體現了 Perplexity 自身的產品演進。2022 年,我們推出了 Search,透過賦能使用者進行提問並接收由數十億份檔案中可驗證引文支持的答案,定義了答案引擎類別。2025 年,我們推出了 Comet 瀏覽器,其中嵌入了網頁代理人,可在開放網路上與使用者共同推理並採取行動。2026 年,我們推出了 Computer,這是一款通用型代理人協調器,能在複雜環境和漫長的時間跨度中,針對使用者指定的目標進行自主工作。

這種轉變如何改變我們的工作方式?我們利用 Search 和 Computer 產品的資料探討這個問題,重點關注三個維度:

自主性: 在同一任務上,Computer 相較於 Search 執行了多少自主工作?

效率: 在同一任務上,Computer 相較於 Search 節省了多少時間與勞動成本?

範圍: Computer 如何改變使用者嘗試的工作類型?

我們發現,像 Computer 這樣的代理人雖然需要使用者投入更多前期精力(因為使用者必須指定要委派的目標並檢視結果),但每單位工作所需的人力卻大幅減少(由於執行過程更加自主)。這使得它們在冗長、多步驟的工作流程中特別有效。其回報是工作變得既深入又低成本。Computer 將使用者的精力從手動執行轉移至監督,擴展了使用者在其專業領域內外所能完成的工作範圍。

Computer 的採用與使用案例

Computer 於 2026 年 2 月 25 日推出,並在前三個月內迅速增長。

截至 5 月 27 日,累計 Computer 查詢量達到了首週總量的 84 倍。作為基準,Computer 使用者中 Search 的累計使用量達到了其首週總量的 14 倍,高於非 Computer 使用者的 12 倍增長。

即使在訂閱等級、主要搜尋主題和先前搜尋強度上對 Computer 和非 Computer 使用者進行配對後,倍差法(difference-in-differences)比較顯示,採用 Computer 增加了 Search 的使用:與類似的非 Computer 使用者相比,Computer 使用者每天多進行 1.05 次 Search 查詢。

以各系列首週為基準的累計增長。在 2 月 27 日至 5 月 27 日期間,Computer 查詢量達到了其首週累計總量的 84 倍。
以各系列首週為基準的累計增長。在 2 月 27 日至 5 月 27 日期間,Computer 查詢量達到了其首週累計總量的 84 倍。

在 100,000 次 Computer 查詢的隨機抽樣中,研究與分析是最大的任務類別,佔 25.8%,其次是文件與資產創作,佔 18.6%。所觀察到的任務組合偏向生成式工作:文件、試算表、程式庫、網站以及需要跨多個工具進行的工作流程。

談到領域,使用分佈廣泛,涵蓋軟體與 IT、金融與投資、行銷與銷售、商業營運、醫療保健、教育、法律及媒體。

跨任務類別與主題領域的 Computer 使用案例。
跨任務類別與主題領域的 Computer 使用案例。研究、分析、文件創作、軟體、金融、商業營運和個人工作流程都顯著出現。

更高的自主性與品質

自主性最直接的訊號在於使用者提交請求後,系統在無需人工干預的情況下運行了多長時間。Search 通常在幾秒鐘內回傳回應。Computer 往往持續工作幾分鐘甚至幾小時:搜尋、瀏覽、寫作、編輯、執行程式碼並檢查中間結果。

我們使用初始查詢幾乎相同的 Search 和 Computer 工作階段,作為同一任務透過兩種產品嘗試的代表。在 10,000 個配對樣本中,Computer 每個工作階段平均執行 26 分鐘的機器執行時間,而 Search 為 33 秒。這意味著在實際上相同的任務上,機器工作量增加了 48 倍。在中位數方面,差距為 9 分鐘對 14 秒,即 40 倍。領域拆分顯示了相同的模式:Computer 在所有 18 個領域中執行的機器工作量大約增加了 26-75 倍。

配對的 Computer 和 Search 工作階段的每個工作階段機器執行時間。
配對的 Computer 和 Search 工作階段的每個工作階段機器執行時間。Search 集中在短回應時間附近;Computer 的分佈更廣,以長時間運行的自主執行為中心。Computer 的平均執行時間(26 分鐘)遠高於中位數(9 分鐘),顯示出複雜、長期請求的長尾效應。
按領域劃分的平均機器執行時間。
按領域劃分的平均機器執行時間。Computer 每個工作階段執行的工作量要多得多,因為使用者的每一次轉向都會觸發下游執行,而不僅僅是產生對話式回應。

長時間運行的自主性並未導致更多放棄。使用者停止事件在各產品間相似:3.7% 的 Computer 工作階段和 3.4% 的 Search 工作階段包含至少一個使用者停止事件。Computer 確實更頻繁地暫停以等待使用者輸入:13% 的 Computer 查詢調用了至少一個「暫停以等待使用者」工具,而 Search 為 0.3%,通常是為了請求批准或提出澄清問題。這是代理人的預期模式:它大部分時間可以自主運作,但需要檢查點來獲得許可並確認使用者的需求。

Computer 還會在單一工作階段中連結更多外部工具呼叫——透過模型上下文協定 (MCP) 或應用程式介面 (API) 端點——執行 Search 使用者原本需要手動跨不同應用程式完成的工作。7.9% 的 Computer 工作階段至少進行了一次連接器呼叫,而 Search 工作階段為 1.8%(差距為 4 倍),且 Computer 平均每個工作階段進行 1.19 次連接器呼叫,而 Search 為 0.10 次(比例為 12 倍)。換句話說,Computer 不僅運行時間更長;它還能跨越更多使用者的連結服務來提取資料並採取行動。

後續行為的組成也發生了變化。在 1,000 對多輪樣本中,各產品間任務推進的總體傾向幾乎相同(52.7% 的 Computer 後續追問對比 52.9% 的 Search),但使用者要求的內容發生了轉移:由於 Computer 預先回傳了更完整的交付成果,其使用者將延伸請求替換為釐清細節的深入追問(延伸請求為 14.2% 對比 12.5%;深入追問為 22.0% 對比 23.4%)。Computer 使用者也花費稍多一點的後續時間來檢視和修訂輸出(24.6% 對比 23.6%),而 Search 則更多偏向於確認、重試和格式請求等短指令(11.6% 對比 9.9%),這些請求在 Computer 中已被整合至其初始執行中。換句話說,Search 建立了較短的「摘要與執行」迴圈;Computer 則建立了較長的「檢視與擴展」迴圈。

最重要的是,品質並未隨著自主性的提高而下降。在配對的多輪工作階段中,有意義的下一輪不滿意度在 Computer 為 1.3%,而 Search 為 2.9%,降低了 55%。包括輕微訊號在內的任何不滿意度,Computer 為 10.8%,而 Search 為 16.6%。

配對多輪樣本中的下一輪不滿意度訊號。由於四捨五入,各欄總和可能不完全等於 100%。

自主性帶來的效率提升

更高的自主性將手動人工工作交換為機器運算,這提高了效率。為了量化這種影響,我們比較了相同配對任務上的兩種設置。

Search + 人工: Search 處理檢索與整合;人類手動執行。

Computer + 人工: Computer 執行工作流程;人類負責定義任務範圍並檢視輸出。

我們無法直接觀察一項任務對人類需要花費多長時間,因此我們使用三個獨立的估計值進行三角驗證:

基於工具的估計: 我們將 Computer 的工具呼叫分為兩類:「搜尋」與「執行」。搜尋工具對應於已由 Search 產品處理的資訊檢索與整合步驟。執行工具代表人類在使用 Search 時需要手動進行的執行步驟。然後,我們估算經驗豐富的人類執行這些「執行」動作所需的時間。

基於 LLM 的估計: 我們將 Computer 工作階段中的查詢輸入至 LLM,以估算熟練專業人員在接收 Search 答案後,必須手動執行所有步驟所需的時間。

使用者回報的估計: 我們對各領域的活躍 Computer 使用者進行了 25 次半結構化訪談,並引導出使用 Computer 前的工作流程以及這些工作流程所需的時間。

基於工具估計中使用的工具分類。「搜尋」工具反映了 Search 已經提供的功能,因此不計入人工時間。「執行」工具需要人類根據 Search 的研究輸出採取行動;每次呼叫的分鐘數估計近似於熟練專業人員手動執行對等動作所需的時間。

根據基於工具的估計,平均 Search + 人工任務需要 269 分鐘,而相應的 Computer + 人工工作流程需要 36 分鐘。這意味著任務時間減少了 87%。

為了將任務時間轉化為成本,我們使用美國勞工統計局職業就業與工資統計 (BLS OEWS) 2025 年 5 月的資料(美國勞工統計局 2026)中特定領域的平均時薪。將模型成本與特定領域的人力成本相結合,Computer 平均降低了 94% 的預估任務成本。

Search + 人工對比 Computer + 人工的預估任務時間與成本。
Search + 人工對比 Computer + 人工的預估任務時間與成本。人力成本主導了 Search + 人工的基準,而 Computer 將大部分工作轉移至模型與工具執行。
Computer + 人工相對於 Search + 人工節省的時間與成本百分比,括號內為倍數(例如:94% (16 倍) 表示 Computer + 人工的成本降低了 94% 或便宜 16 倍)。人力成本使用 BLS OEWS 2025 年 5 月的平均時薪。

效率優勢出現在所有 18 個領域中,時間節省為 79-92%,成本節省為 87-96%。程式設計是最極端的案例:Search + 人工需要 596 分鐘,而 Computer + 人工為 48 分鐘——時間減少 92%,產生成本降低 96% 的結果。商業、技術、教育和寫作也顯示出顯著提升。時間節省往往在高薪領域轉化為更大的成本節省。

這一結果的穩健性如何?考慮損益平衡點:對於 Search + 人工而言,要達到與 Computer + 人工相同的成本,專業人員需要在 14-24 分鐘內(中位數 18 分鐘)完成每個手動步驟。即使在更保守的假設下,Computer 在每個領域都保持其優勢:例如,工具使用時間高估 8 倍,或 Computer 的監督時間低估 12 倍。

基於 LLM 的估計得出了類似的總體結果:時間總體減少了 84%,成本總體減少了 93%。使用者訪談顯示了更廣泛的結果範圍——從 5 倍到超過 300 倍的速度提升——這很可能反映了使用者在使用 Computer 前基準的巨大差異。參與者的中位數速度提升為 25 倍,對應於時間減少了 96%。

任務範圍水平與垂直擴張

配對任務上的速度與成本僅捕捉到故事的一部分。工作的型態也可能發生變化。隨著 Computer 以機器運算取代手動執行,使用者可能會承擔不同類型的工作——跨越職業邊界以及需要更高專業水準的任務。

首先,我們詢問與 Search 相比,使用者是否更頻繁地在推斷的主要職業群體之外工作。其次,我們使用五種任務層級分類來比較相同使用者的 Computer 和 Search 查詢:布魯姆修正分類法 (Bloom's Revised Taxonomy) (Anderson and Krathwohl 2001)、任務內容傳統中的抽象工作對比常規工作 (Autor, Levy, and Murnane 2003)、O*NET 知識廣度 (National Center for O*NET Development 2026)、O*NET 工作活動廣度,以及未曾嘗試使用 Search 完成的新任務。

這種水平轉移在資料中顯而易見。在一項涵蓋八個職業群體、共 8,000 名使用者的抽樣調查中,使用他們的所有查詢資料,Computer 使用者有 59% 的時間在他們主要職業之外工作,而 Search 使用者為 50%。最大的增長出現在管理與創業、數位技術、藝術與設計,以及醫療保健與人類服務領域。跨職業的 Search 查詢集中在數位技術領域,而 Computer 查詢則將工作委派至更多元的領域,這些領域的使用者原本需要專家的協助。

八個職業群體中的跨職業任務流。
八個職業群體中的跨職業任務流。曲線圓弧顯示了每個群體頂部的輸出目的地,線寬與目的地份額成比例,線型表示排名。Search 將跨職業流集中在數位技術領域,而 Computer 將流動分散至行銷、管理、金融服務和其他執行性目的地。

垂直轉移甚至更大。在 5,000 個 Computer 查詢和 5,000 個 Search 查詢的相同雙產品使用者樣本中,Computer 查詢比 Search 查詢在認知上更複雜。在布魯姆修正分類法中,76% 的 Computer 查詢需要更高階認知,相比之下 Search 為 55%。這種差異集中在頂部:50% 的 Computer 查詢屬於創作層級的任務,而 Search 為 26%。Search 在記憶層級的事實查詢中有更多份額。在抽象對比常規任務類型維度上,71% 的 Computer 查詢涉及抽象、非常規認知,而 Search 為 53%。

Computer 和 Search 查詢的認知複雜度。
Computer 和 Search 查詢的認知複雜度。Computer 強烈轉向創作層級和抽象非常規工作。

Computer 任務也利用了更多知識領域。平均 Computer 任務需要 2.40 個 O*NET 知識領域的實質專業知識,相比之下 Search 為 1.74 個,增加了 38%。Computer 需要三個或更多知識領域的可能性幾乎是 Search 的三倍:51% 對比 17%。

每個查詢所需的知識領域。
每個查詢所需的知識領域。Computer 工作階段集中在兩個到三個領域,並且更有可能需要廣博的專業知識。

在工作活動層級,相同的模式成立。典型的 Computer 查詢涉及 2.95 個 O*NET 廣義工作活動和 4.01 個中間工作活動,而 Search 為 2.24 個和 2.87 個,分別增加了 32% 和 40%。在更精細的層級上,Computer 涉及的詳細工作活動增加了 59%,職業特定任務陳述增加了 60%。

跨 O*NET 嵌套層級的每個查詢任務活動廣度。
跨 O*NET 嵌套層級的每個查詢任務活動廣度。Computer 將分佈在中間、詳細和任務陳述層級向右移動。

最具啟示性的指標是同一使用者中出現在 Computer 但未出現在 Search 中的任務集。在最嚴格的定義下,即一個任務陳述出現在 Computer 中但從未出現在配對的 Search 樣本中,23% 的 Computer 查詢至少涉及一個僅限 Computer 的任務陳述。放寬門檻以允許最多五次 Search 出現,份額提高至 38%,並在接近 41% 時趨於平穩。這些僅限 Computer 的活動集中在軟體與網頁開發、文件生產,以及資料視覺化或圖形處理。這正是自主執行最重要的地方:Search 進行解釋;Computer 進行產出。

在不同出現門檻下,涉及至少一個僅限 Computer 的 O*NET 活動的 Computer 查詢份額。
在不同出現門檻下,涉及至少一個僅限 Computer 的 O*NET 活動的 Computer 查詢份額。最強烈的區分出現在精細的任務陳述層級。

討論

關於 AI 工作的大多數證據都集中在助理設置上。該文獻顯示,在增強寫作、客戶支援、程式設計和諮詢方面有巨大的生產力提升(例如:Noy and Zhang 2023; Brynjolfsson, Li, and Raymond 2025; Cui et al. 2026; Dell'Acqua et al. 2026)。

代理人改變了使用者行為和下游經濟成果。生產部署開始揭示代理人在現實世界中的使用及其影響,但主要集中在專業程式設計代理人和早期瀏覽器代理人上(例如:Sarkar 2026; McCain et al. 2026; Demirer, Musolff, and Yang 2026; Yang et al. 2025)。我們透過比較使用者與通用代理人協調器和對話式助理的互動,並將下游影響分析擴展至更廣泛的知識工作,補充了這項研究並連結了助理與代理人相關的文獻。

我們也從暴露度轉向實現的任務重組。先前的研究利用任務描述和職業結構來估算哪些職業暴露於 AI(例如:Eloundou et al. 2024; Felten, Raj, and Seamans 2023),而基於使用的衡量指標則顯示了暴露度與部署之間的差距(Massenkoff and McCrory 2026)。我們記錄了任務構成隨代理人存取權限而發生的變化。

我們注意到幾個注意事項。首先,觀察視窗尚早,且早期採用者偏向 AI 原生使用者。使用者也在快速發展的產品景觀中積極實驗並調整其工作流程,因此這些模式可能會隨著時間推移而改變。其次,基於工作階段的配對查詢設計遺漏了許多沒有接近 Search 等價物的 Computer 任務。雖然工作階段提供了一種區分任務的自然方式,但使用者在實踐中並不總是遵循這種結構,這使得工作階段成為任務單位的雜訊代用指標。第三,效率估計關鍵取決於對人類對等工具時間和人工監督時間的假設。儘管基於 LLM 的估計和使用者訪談指向相同的方向,且損益平衡與敏感性分析顯示了穩健性,但精確的量值應視為近似值。相關地,LLM 分類錯誤引入了額外的測量雜訊。最後,我們僅在 Perplexity 生態系統內觀察使用者行為,並未捕捉其外部活動,這可能會限制我們對使用者完整工作活動和工具使用的視角。

展望未來

代理人使現有的任務更快、更便宜——更重要的是,使得跨越職業邊界和專業水準的任務變得可行。

當一個系統可以搜尋、瀏覽、程式設計、編輯檔案、連接服務並生產交付成果時,使用者的瓶頸就會發生轉移。他們花在操作工作流程上的時間減少,而花在指定目標、提供背景資訊、檢查輸出並請求延伸的時間增加。使用者從操作者轉變為監督者。

在個人層面上,這種轉變擴展了任務前沿,使使用者能夠承擔更廣泛且更深入的工作。在組織和勞動力市場層面上,這些微觀層級的變化如何聚合仍然是一個懸而未決的問題。如果一個配備代理人的單一個人可以完成以往需要多個角色才能完成的工作流程,那麼代理人的長期影響將不僅僅由速度和成本指標來衡量。相反,它將體現在工作如何捆綁、角色如何定義以及團隊如何建構等方面。

欲了解更多關於我們的方法論和研究結果,請閱讀完整的 技術報告

參考文獻

Anderson, Lorin W., and David R. Krathwohl. 2001. 學習、教學與評鑑的分類學:布魯姆教育目標分類學之修正。紐約:Longman。

Autor, David H., Frank Levy, and Richard J. Murnane. 2003. 「近期技術變革的技能內容:實證探索」。季刊經濟學雜誌 118 (4): 1279-1333。

Brynjolfsson, Erik, Danielle Li, and Lindsey R. Raymond. 2025. 「工作中的生成式 AI」。季刊經濟學雜誌 140 (2): 889-942。

Cui, Zheyuan Kevin, Mert Demirer, Sonia Jaffe, Leon Musolff, Sida Peng, and Tobias Salz. 2026. 「生成式 AI 對高技能工作的影響:來自軟體開發人員三次現場實驗的證據」。管理科學,提前出版。

Dell'Acqua, Fabrizio, Edward McFowland III, Ethan R. Mollick, Hila Lifshitz-Assaf, Katherine Kellogg, Saran Rajendran, Lisa Krayer, François Candelon, and Karim R. Lakhani. 2026. 「導航鋸齒狀技術前沿:人工智慧對知識工作者生產力與品質影響的現場實驗證據」。組織科學,提前出版。

Demirer, Mert, Leon Musolff, and Liyuan Yang. 2026. 「編寫程式碼與交付程式碼:幾代 AI 程式設計工具的生產力影響」。NBER 工作論文 35275。

Eloundou, Tyna, Sam Manning, Pamela Mishkin, and Daniel Rock. 2024. 「GPT 是 GPT:大型語言模型的勞動力市場影響潛力」。科學 384 (6702): 1306-1308。

Felten, Edward W., Manav Raj, and Robert Seamans. 2023. 「生成式 AI 暴露度的職業異質性」。SSRN 4414065。

Massenkoff, Maxim, and Peter McCrory. 2026. 「AI 的勞動力市場影響:新的衡量指標與早期證據」。Anthropic。

McCain, Miles, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, and Deep Ganguli. 2026. 「實踐中衡量 AI 代理人自主性」。Anthropic。

National Center for O*NET Development. 2026. O*NET 30.2 資料庫。美國勞工部,就業與培訓管理局。

Noy, Shakked, and Whitney Zhang. 2023. 「生成式人工智慧生產力影響的實驗證據」。科學 381 (6654): 187-192。

Sarkar, Suproteem K. 2026. 「AI 代理人與高階工作」。芝加哥大學布斯商學院。

U.S. Bureau of Labor Statistics. 2026. 「職業就業與工資統計:2025 年 5 月預估」。美國勞工部。

Yang, Jeremy, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, and Jerry Ma. 2025. 「AI 代理人的採用與使用:來自 Perplexity 的早期證據」。arXiv 預印本 arXiv:2512.07828。