AI 代理如何重塑知識工作

Computer 提升了任務自主性、降低了成本,並擴大了使用者承擔的工作範圍。

作者Perplexity Research

頂尖 AI 系統正在縮小模型智慧與現實世界實用性之間的差距。全新的模型、運算架構與編排模式讓這些系統能夠完成幾個月前被認為不可能實現的任務。

這項迅速的創新為 AI 使用者帶來了莫大助益,大幅提升了他們的主導權與自主性。然而,它也在技術尖端與我們對知識工作如何隨之演變的精確理解之間造成了落差。頂尖 AI 如何改變各行各業中知識工作的本質?我們又能預期這項工作會出現哪些結構與經濟轉型?

我們希望能透過對 Perplexity 使用情況的謹慎實證分析來填補這個落差。今天,我們與哈佛商學院的研究人員合作,分享我們針對實際部署 Perplexity Computer 所進行的第一項全面性研究。我們的研究結果顯示,Computer 以更低的成本,擴大了使用者能完成之任務的廣度與深度。Computer 使用者能完成更多工作、在更高抽象層次上運作,並跨越學科界線,在自身專業領域之外釋放價值。

這篇文章呈現了我們研究中的重點。詳細的方法與研究結果可在我們的技術報告中查閱。

緒論

第一代主流的生成式 AI 系統是會與使用者進行對話的對話式助理。這些助理處於意圖與行動之間。它們回答問題、解釋取捨,並建議下一步。隨後,使用者必須將答案轉化為實際工作:開啟正確的工具、收集檔案、編輯文件、檢查中間產出,並決定接下來要做什麼。

代理程式改變咗呢種分工。使用者指定一個結果,系統就會跨工具進行規劃、執行中間步驟、喺需要時索取缺失嘅輸入,然後傳回完成嘅交付項目。代理程式將人工智能嘅使用方式,從單純搜尋同整合資料,轉變為自主規劃同執行任務。

這條發展軌跡體現了 Perplexity 自身的產品演進。在 2022 年,我們推出了 Search,透過賦能使用者提出問題並獲得支援可驗證引文(涵蓋數十億份文件)的答案,定義了答案引擎的類別。在 2025 年,我們推出了 Comet 瀏覽器,內嵌網路代理,能在開放網路上與使用者共同推理並採取行動。而在 2026 年,我們推出了 Computer,這是一個通用代理編排器,能在複雜環境與漫長的時間範圍內,自主朝著使用者指定的目標工作。

這種轉變正在如何改變我們的工作方式?我們利用 Search 與 Computer 產品的資料來探討這個問題,重點關注三個面向:

自主性:在相同的任務中,Computer 與 Search 相比執行了多少自主工作?

效率:相較於 Search 在相同任務上的表現,Computer 節省了多少時間與人工成本?

範疇:Computer 如何改變使用者嘗試的工作類型?

我們發現,像 Computer 這樣的代理需要更多的前期使用者心力(因為使用者必須指定要委託的目標並檢閱結果),但每單位工作的所需人工則大幅減少(由於更具自主性的執行)。這使得它們在漫長的多步驟工作流程中特別有效。其回報是更深入且更具成本效益的工作。Computer 將使用者的心力從手動執行轉移到監督,擴大了使用者在其自身專業領域內外所能完成的範圍。

Computer 的採用與使用情境

Computer 於 2026 年 2 月 25 日推出,並在頭三個月內快速成長。

截至 5 月 27 日,累積的 Computer 查詢次數達到其第一週總量的 84 倍。作為基準,Computer 使用者的累積 Search 使用量達到其第一週總量的 14 倍,高於非 Computer 使用者的 12 倍成長率。

即使在按訂閱層級、主要 Search 主題和先前的 Search 強度對 Computer 與非 Computer 使用者進行配對之後,雙重差分比較仍顯示,採用 Computer 會增加 Search 的使用量:Computer 使用者每天發出的 Search 查詢次數比類似的非 Computer 使用者多 1.05 次。

相對於各序列第一週的累積成長指數。在 2 月 27 日至 5 月 27 日期間,Computer 查詢量達到其第一週累積總量的 84 倍。
相對於各序列第一週的累積成長指數。在 2 月 27 日至 5 月 27 日期間,Computer 查詢量達到其第一週累積總量的 84 倍。

在 100,000 個 Computer 查詢的隨機樣本中,「研究與分析」是最大的任務類別,佔 25.8%,其次是「文件與資產建立」,佔 18.6%。所觀察到的任務組合偏向生成式工作:需要跨多個工具運作的文件、試算表、程式碼庫、網站和工作流程。

至於應用領域方面,使用情況分佈廣泛,涵蓋軟件與資訊科技、金融與投資、市場營銷與銷售、業務營運、醫療保健、教育、法律以及傳媒。

Computer 的使用情境橫跨各種任務類別與主題領域。
Computer 的使用情境橫跨各種任務類別與主題領域。研究、分析、文件建立、軟體、金融、業務營運和個人工作流程都佔有顯著比例。

更高的自主性與品質

自主性的最直接訊號是系統在使用者提交請求後,無需人工介入即可持續運作的時間。Search 通常會在幾秒鐘內傳回回應。Computer 則經常持續運作數分鐘甚至數小時:搜尋、瀏覽、寫作、編輯、執行程式碼以及檢查中間結果。

我們使用具有幾乎相同初始查詢的 Search 與 Computer 工作階段,作為嘗試透過這兩種產品執行相同任務的代理指標。在 10,000 個配對中,Computer 平均每個工作階段執行 26 分鐘的機器執行時間,而 Search 則是 33 秒。這相當於在實際上相同的任務上,機器工作量增加了 48 倍。在中位數方面,差距為 9 分鐘對比 14 秒,即 40 倍。領域分佈顯示出相同的模式:Computer 在所有 18 個領域中執行的機器工作量大約多出 26 至 75 倍。

配對的 Computer 與 Search 工作階段之每個工作階段的機器執行時間。
配對的 Computer 與 Search 工作階段之每個工作階段的機器執行時間。Search 集中在較短的回應時間;Computer 則具有以長時間自主執行為中心的較廣泛分佈。Computer 的平均執行時間(26 分鐘)遠高於中位數(9 分鐘),顯示出複雜且長期請求的長尾現象。
各領域的平均機器執行時間。
各領域的平均機器執行時間。Computer 每個工作階段執行的工作要多得多,因為使用者的每一次操作都會觸發後續執行,而不僅僅是對話式回應。

執行時間較長的自主性並未導致更多的工作階段放棄。使用者停止事件在各產品中相似:3.7% 的 Computer 工作階段和 3.4% 的 Search 工作階段包含至少一個使用者停止事件。Computer 確實更常暫停以等待使用者輸入:13% 的 Computer 查詢調用了至少一個暫停等待使用者工具,而 Search 則為 0.3%,通常是為了請求批准或詢問釐清問題。這對於代理來說是預期的模式:它大部分時間都可以自主進行,但需要檢查點來獲得許可並確認使用者的需求。

Computer 還會在單一工作階段中串連更多外部工具呼叫(透過模型上下文協定 (MCP) 或應用程式介面 (API) 端點),執行 Search 使用者原本必須在不同應用程式中手動執行的工作。7.9% 的 Computer 工作階段進行了至少一次連接器呼叫,而 Search 工作階段則為 1.8%(有 4 倍的差距),且 Computer 平均每個工作階段有 1.19 次連接器呼叫,而 Search 則為 0.10 次(12 倍的比率)。換句話說,Computer 不僅執行時間更長;它還能觸及使用者更多已連接的服務來提取資料並採取行動。

後續行為的組成也有所改變。在 1,000 對多輪互動樣本中,推動任務前進的整體傾向在各產品中幾乎完全相同(52.7% 的 Computer 後續互動對比 52.9% 的 Search),但使用者的要求有所轉變:由於 Computer 提前傳回了更完整的交付成果,其使用者會以擴充套件來取代釐清細節(擴充套件佔 14.2% 對比 12.5%;細節釐清佔 22.0% 對比 23.4%)。Computer 使用者也花費略多的後續互動時間來檢閱與修改輸出(24.6% 對比 23.6%),而 Search 則較多短促的指令,例如確認、重試和格式請求(11.6% 對比 9.9%),這些指令已被 Computer 納入其初始執行中。換句話說,Search 建立了較短的「摘要與執行」迴圈;Computer 則建立了較長的「檢閱與擴充」迴圈。

最重要的是,品質並未隨著自主性的提高而下降。在配對的多輪工作階段中,有意義的下一輪不滿意度在 Computer 中為 1.3%,而在 Search 中為 2.9%,減少了 55%。任何不滿意度(包括輕微的訊號),Computer 為 10.8%,而 Search 為 16.6%。

配對多輪樣本中的下一輪不滿意度訊號。由於四捨五入,各欄的總和可能不完全等於 100%。

自主性帶來的效率提升

更高的自主性以機器運算取代了手動人工,從而提高了效率。為了量化這種效果,我們在相同的配對任務上比較了兩種設定。

Search + 人工:Search 負責檢索與綜合;由人類手動執行。

Computer + 人工:Computer 執行工作流程;人類界定任務範圍並檢閱輸出。

我們無法直接觀察一項任務需要人類花費多長時間,因此我們透過三個獨立的估算來進行三角驗證:

以工具為基礎的估算:我們將 Computer 工具呼叫分為兩類:「搜尋 (Search)」與「執行 (Do)」。搜尋工具對應到 Search 產品已處理的資訊檢索與綜合步驟。執行工具則代表使用者單獨使用 Search 時,需要手動執行的執行步驟。接著,我們估算經驗豐富的人類執行這些執行動作所需的時間。

以 LLM 為基礎的估算:我們將來自 Computer 工作階段的查詢輸入到 LLM 中,以估算熟練專業人員所需的時間,該專業人員從 Search 接收答案,但必須手動執行所有執行步驟。

使用者回報的估算:我們對跨領域的活躍 Computer 使用者進行了 25 次半結構化訪談,並引導出使用 Computer 前的工作流程以及這些工作流程原本需要花費的時間。

工具型估算中所使用的工具分類。「搜尋」工具反映了 Search 已提供的功能,因此不計入手動時間。「執行」工具需要人類根據 Search 的研究輸出採取行動;每次呼叫的分鐘數估算是指熟練專業人員手動執行同等動作所需的近似時間。

根據以工具為基礎的估算,平均 Search + 人工任務需要 269 分鐘,而相對應的 Computer + 人工工作流程則需要 36 分鐘。這代表任務時間減少了 87%。

為了將任務時間轉化為成本,我們使用了美國勞工統計局職業就業與薪資統計 (BLS OEWS) 2025 年 5 月資料(美國勞工統計局 2026 年)中各領域的平均時薪。結合模型成本與特定領域的人工成本,Computer 平均將估計的任務成本降低了 94%。

Search + 人工與 Computer + 人工的估計任務時間與成本。
Search + 人工與 Computer + 人工的估計任務時間與成本。人工成本在 Search + 人工基準中佔主導地位,而 Computer 則將大部分工作轉移至模型與工具執行。
相較於 Search + 人工,Computer + 人工所節省的時間與成本百分比,括號內為倍數(例如:94% (16x) 意指 Computer + 人工便宜 94% 或 16 倍)。人工成本採用 BLS OEWS 2025 年 5 月的平均時薪。

效率優勢出現在所有 18 個領域中,時間節省達 79–92%,成本節省達 87–96%。程式設計是最極端的例子:Search + 人工需時 596 分鐘,而 Computer + 人工僅需 48 分鐘——時間減少 92%,並帶來 96% 的成本降低。商業、科技、教育和寫作也展現了巨大的收益。在薪資較高的領域中,時間的節省往往會轉化為更大的成本節省。

這個結果有多強健?考慮損益兩平點:若要讓 Search + 人工的成本與 Computer + 人工相匹配,專業人員必須在 14–24 分鐘(中位數 18 分鐘)內完成每個手動步驟。即使在更保守的假設下,Computer 在每個領域中依然保持優勢:例如,每個工具的時間高估 8 倍,或是 Computer 的監督時間低估 12 倍。

以 LLM 為基礎的估算產生了類似的整體結果:總體時間減少 84%,成本減少 93%。使用者訪談顯示了更廣泛的結果範圍——從 5 倍到超過 300 倍的速度提升——這可能反映了使用者在使用 Computer 前的基準有顯著差異。參與者之間的速度提升中位數為 25 倍,相當於時間減少 96%。

任務範疇橫向與縱向擴展

配對任務上的速度與成本僅捕捉了部分事實。工作的形態也可能改變。隨著 Computer 以機器運算取代手動執行,使用者可能會承擔不同型態的工作——跨越職業界線以及需要更高專業水準的任務。

首先,我們探討使用者使用 Computer 時,是否比使用 Search 更常在推斷的主要職業群集之外工作。其次,我們使用五種任務層級分類來比較同一位使用者的 Computer 與 Search 查詢:布魯姆修訂版教育目標分類法 (Bloom's Revised Taxonomy)(Anderson 與 Krathwohl 2001 年)、工作內容傳統中的抽象與常規工作(Autor、Levy 與 Murnane 2003 年)、O*NET 知識廣度(O*NET 發展國家中心 2026 年)、O*NET 工作活動廣度,以及未曾以 Search 嘗試過的新任務。

資料顯示了明顯的橫向轉變。在來自八個職業群集的 8,000 名使用者樣本中,綜合他們的所有查詢,Computer 使用者有 59% 的時間在其主要職業之外工作,相較之下 Search 則為 50%。最大的增幅出現在管理與創業、數位科技、藝術與設計,以及醫療保健與人類服務。跨職業的 Search 查詢集中在數位科技領域中,而 Computer 查詢則委託了跨越更多元領域的工作,使用者在這些領域中原本需要依賴專家。

跨越八個職業群集的跨職業任務流程。
跨越八個職業群集的跨職業任務流程。曲線弧線顯示每個群集的主要流向目的地,線寬與目的地佔有率成正比,線型則表示排名。Search 將跨職業流程集中在數位科技領域,而 Computer 則將流程分散至行銷、管理、金融服務和其他執行型目的地。

縱向轉變甚至更大。在來自同一組雙產品使用者的 5,000 個 Computer 查詢和 5,000 個 Search 查詢樣本中,Computer 查詢在認知上比 Search 查詢更為複雜。在布魯姆修訂版教育目標分類法上,76% 的 Computer 查詢需要更高階的認知,相較之下 Search 為 55%。這項差異集中在頂端:50% 的 Computer 查詢是「創造 (Create)」層級的任務,相較之下 Search 為 26%。Search 在「記憶 (Remember)」層級的事實查詢上佔了絕大多數。在抽象與常規任務類型的維度上,71% 的 Computer 查詢涉及抽象、非常規的認知,相較之下 Search 為 53%。

Computer 與 Search 查詢的認知複雜度。
Computer 與 Search 查詢的認知複雜度。Computer 強烈轉向「創造」層級與抽象非常規工作。

Computer 任務也汲取了更多知識領域。平均每個 Computer 任務需要在 2.40 個 O*NET 知識領域中具備實質專業知識,相較之下 Search 為 1.74 個,增加了 38%。Computer 需要三個或更多知識領域的可能性幾乎是 Search 的三倍:51% 對比 17%。

每個查詢所需的知識領域。
每個查詢所需的知識領域。Computer 工作階段集中在兩到三個領域,且更有可能需要廣泛的專業知識。

在工作活動層級上,也呈現相同的模式。一個典型的 Computer 查詢會涉及 2.95 個 O*NET 通用工作活動和 4.01 個中階工作活動,相較之下 Search 則為 2.24 個與 2.87 個,分別增加了 32% 和 40%。在更細緻的層級上,Computer 涉及的工作細節活動增加 59%,職業特定任務陳述增加 60%。

跨 O*NET 巢狀層級的每個查詢任務活動廣度。
跨 O*NET 巢狀層級的每個查詢任務活動廣度。Computer 將分佈在中間、細節和任務陳述層級上向右推移。

最具啟發性的指標是出現在 Computer 中但未出現在同一使用者 Search 中的任務集。在最嚴格的定義下(即任務陳述式出現在 Computer 中但從未出現在配對的 Search 樣本中),23% 的 Computer 查詢涉及至少一個僅限 Computer 的任務陳述式。將閾值放寬至允許最多 5 次 Search 出現,會將比例提高至 38%,並在接近 41% 時趨於平穩。這些僅限 Computer 的活動集中在軟體與網頁開發、文件產出,以及資料視覺化或圖形。這正是自主執行最為關鍵的地方:Search 負責解釋;Computer 負責產出。

在不同的出現閾值下,涉及至少一個僅限 Computer 的 O*NET 活動之 Computer 查詢比例。
在不同的出現閾值下,涉及至少一個僅限 Computer 的 O*NET 活動之 Computer 查詢比例。最強烈的區隔出現在微觀的任務陳述層級。

討論

關於 AI 工作的大部分證據都集中在助理設定上。該文獻已顯示在擴增寫作、客戶支援、程式編碼和諮詢方面帶來了巨大的生產力提升(例如:Noy 與 Zhang 2023 年;Brynjolfsson、Li 與 Raymond 2025 年;Cui 等人 2026 年;Dell'Acqua 等人 2026 年)。

代理改變了使用者的行為與後續的經濟成果。生產部署開始揭示代理在現實世界設定中的使用情形與影響,但大多集中在專門的程式編碼代理和早期瀏覽器代理(例如:Sarkar 2026 年;McCain 等人 2026 年;Demirer、Musolff 與 Yang 2026 年;Yang 等人 2025 年)。我們透過比較使用者與通用代理編排器相較於對話式助理的互動,並將後續影響分析延伸至更廣泛的知識工作,來互補這項研究並搭起助理與代理文獻之間的橋樑。

我們也從暴露度轉向實現的任務重組。先前的研究使用任務描述與職業結構來估算哪些職業暴露於 AI(例如:Eloundou 等人 2024 年;Felten、Raj 與 Seamans 2023 年),而基於使用量的指標則顯示了暴露度與部署之間的差距(Massenkoff 與 McCrory 2026 年)。我們記錄了任務組成如何隨著代理存取權限而轉變。

我們注意到幾個注意事項。首先,觀察窗口尚處於早期,且早期採用者偏向 AI 原住民。使用者也正在快速演進的產品格局中積極實驗並調整其工作流程,因此這些模式可能會隨著時間而改變。其次,基於工作階段的配對查詢設計遺漏了許多沒有相近 Search 等效項目的 Computer 任務。雖然工作階段提供了區段化任務的自然方式,但使用者在實務上並不總是遵循此結構,使得工作階段成為任務單位的雜訊代理。第三,效率估算關鍵取決於關於人類等效工具時間與人類監督時間的假設。儘管基於 LLM 的估算和使用者訪談指向相同的方向,且損益兩平與敏感度分析顯示其強健性,但確切的量級應被視為近似值。相對地,LLM 分類錯誤引入了額外的測量雜訊。最後,我們僅在 Perplexity 生態系統內觀察使用者行為,並未捕捉其外部的活動,這可能會限制我們對使用者完整工作活動和工具使用的視野。

展望未來

代理使現有的任務變得更快、更便宜——更重要的是,讓跨越職業界線和專業水準的任務變得可行。

當系統能夠搜尋、瀏覽、編碼、編輯檔案、連接服務並產出交付成果時,使用者的瓶頸便會轉移。他們花費較少的時間操作工作流程,而花費更多時間指定目標、提供內容、檢查輸出並請求擴充套件。使用者從操作員轉變為監督者。

在個人層面上,這種轉變擴大了任務前端,使使用者能夠承擔更廣泛且更深入的工作。在組織與勞動市場層面上,這些微觀層面的變化將如何聚合仍然是一個開放的問題。如果配備了代理的單一成員能夠完成先前需要多個角色才能完成的工作流程,那麼代理的長期影響將無法僅靠速度與成本指標來捕捉。相反地,它將顯現在工作的組合方式、角色的定義方式以及團隊的結構方式上。

若要深入了解我們的方法與研究結果,請閱讀完整的技術報告

參考資料

Anderson, Lorin W., and David R. Krathwohl. 2001. A Taxonomy for Learning, Teaching, and Assessing: A Revision of Bloom's Taxonomy of Educational Objectives. New York: Longman.

Autor, David H., Frank Levy, and Richard J. Murnane. 2003. "The Skill Content of Recent Technological Change: An Empirical Exploration." The Quarterly Journal of Economics 118 (4): 1279–1333.

Brynjolfsson, Erik, Danielle Li, and Lindsey R. Raymond. 2025. "Generative AI at Work." The Quarterly Journal of Economics 140 (2): 889–942.

Cui, Zheyuan Kevin, Mert Demirer, Sonia Jaffe, Leon Musolff, Sida Peng, and Tobias Salz. 2026. "The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers." Management Science, Articles in Advance.

Dell'Acqua, Fabrizio, Edward McFowland III, Ethan R. Mollick, Hila Lifshitz-Assaf, Katherine Kellogg, Saran Rajendran, Lisa Krayer, François Candelon, and Karim R. Lakhani. 2026. "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality." Organization Science, Articles in Advance.

Demirer, Mert, Leon Musolff, and Liyuan Yang. 2026. "Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools." NBER Working Paper 35275.

Eloundou, Tyna, Sam Manning, Pamela Mishkin, and Daniel Rock. 2024. "GPTs are GPTs: Labor Market Impact Potential of LLMs." Science 384 (6702): 1306–1308.

Felten, Edward W., Manav Raj, and Robert Seamans. 2023. "Occupational Heterogeneity in Exposure to Generative AI." SSRN 4414065.

Massenkoff, Maxim, and Peter McCrory. 2026. "Labor Market Impacts of AI: A New Measure and Early Evidence." Anthropic.

McCain, Miles, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, and Deep Ganguli. 2026. "Measuring AI Agent Autonomy in Practice." Anthropic.

National Center for O*NET Development. 2026. O*NET 30.2 Database. U.S. Department of Labor, Employment and Training Administration.

Noy, Shakked, and Whitney Zhang. 2023. "Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence." Science 381 (6654): 187–192.

Sarkar, Suproteem K. 2026. "AI Agents and Higher-Order Work." University of Chicago Booth School of Business.

U.S. Bureau of Labor Statistics. 2026. "Occupational Employment and Wage Statistics: May 2025 Estimates." U.S. Department of Labor.

Yang, Jeremy, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, and Jerry Ma. 2025. "The Adoption and Usage of AI Agents: Early Evidence from Perplexity." arXiv preprint arXiv:2512.07828.