AI智能体如何重塑知识工作
Computer提高了任务自主性、降低了成本,并拓宽了用户承担的工作范围。
前沿AI系统正在缩小模型智能与现实世界效用之间的差距。新的模型、计算架构和编排模式正在使这些系统能够完成几个月前被认为不可能的任务。
这种快速创新通过增强AI用户的杠杆作用和主体性,为他们带来了福音。然而,它也在技术前沿与我们对知识工作如何随之演变的确切理解之间造成了滞后。前沿AI如何改变各行业知识工作的本质?我们预计这种工作中会出现哪些结构性和经济性变革?
我们寻求通过对Perplexity使用情况的严谨实证分析来缩小这一差距。今天,我们与哈佛商学院的研究人员合作,分享我们关于Perplexity Computer在现实世界部署中的首份全面研究报告。我们的研究结果表明,Computer在降低成本的同时,扩展了用户所能完成任务的广度和深度。Computer用户完成的工作更多,工作抽象程度更高,并且能够跨越学科界限,在自身专业领域之外创造价值。
本文展示了我们研究的重点。详细的方法论和研究结果可在我们的技术报告中查阅。
引言
首批主流生成式AI系统是与用户进行对话的对话式助手。这些助手位于意图和行动之间。它们回答问题、解释权衡并建议后续步骤。用户随后必须将答案转化为工作:打开合适的工具、收集文件、编辑文档、检查中间输出并决定下一步做什么。
智能体改变了这种劳动分工。用户指定一个结果,系统则在各个工具之间进行规划、执行中间步骤、在需要时请求缺失的输入,并返回最终交付成果。智能体将AI的使用从查找和综合信息转向自主规划和执行任务。
这一发展轨迹激发了Perplexity自身的产品演进。2022年,我们推出了Search,它通过赋能用户提出问题并接收由数十亿份文档中可验证引文支持的答案,定义了答案引擎这一类别。2025年,我们推出了Comet浏览器,其中嵌入了在开放网络上与用户一起推理和行动的网络智能体。2026年,我们推出了Computer,这是一款通用智能体编排器,可在复杂环境和长远时间跨度内朝着用户指定的目标自主工作。
这种转变如何改变我们的工作方式?我们利用Search和Computer产品的数据来探讨这个问题,重点关注三个维度:
自主性:在同一任务上,Computer相对于Search执行了多少自主工作?
效率:在同一任务上,Computer相对于Search节省了多少时间和人工成本?
范围:Computer如何改变用户尝试的工作类型?
我们发现,像Computer这样的智能体需要更多的前期用户投入(因为用户必须指定要委派的目标并审查结果),但单位工作量所需的人力投入却大大减少(由于更自主的执行)。这使得它们在冗长的多步工作流中特别有效。其回报是更加深入且成本更低的工作。Computer将用户的投入从手动执行转向监督,扩展了用户在自身专业领域内外所能完成的工作范围。

Computer的采用与用例
Computer于2026年2月25日推出,并在最初三个月内快速增长。
截至5月27日,累计Computer查询量达到其首周总量的84倍。作为基准,Computer用户中的累计Search使用量达到其首周总量的14倍,高于非Computer用户的12倍增长。
即使在按订阅层级、主要搜索主题和过往搜索强度对Computer用户和非Computer用户进行匹配后,双重差分比较显示,采用Computer增加了Search的使用量:Computer用户每天进行的Search查询比相似的非Computer用户多1.05次。

在100,000个Computer查询的随机样本中,研究与分析是最大的任务类别,占比25.8%,其次是文档和资产创建,占比18.6%。所观察到的任务组合偏向于生成式工作:文档、电子表格、代码库、网站和需要跨多个工具协作的工作流。
就领域而言,使用范围广泛分布于软件与IT、金融与投资、市场营销与销售、商业运营、医疗保健、教育、法律和媒体领域。

更高的自主性和质量
自主性最直接的信号是用户提交请求后,系统在没有人工干预的情况下运行了多长时间。Search通常在几秒钟内返回响应。Computer则经常持续工作数分钟甚至数小时:搜索、浏览、撰写、编辑、运行代码并检查中间结果。
我们使用具有几乎相同初始查询的Search和Computer会话作为用同一产品完成相同任务的代理。在10,000对匹配的会话中,Computer平均每个会话执行26分钟的机器执行,而Search为33秒。这相当于在本质上相同的任务上机器工作量增加了48倍。在中位数上,差距为9分钟对14秒,即40倍。领域划分显示了相同的模式:在所有18个领域中,Computer的机器工作量大约多出26-75倍。


更长时间的自主运行并未转化为更多的中止。各产品的用户停止事件相似:3.7%的Computer会话和3.4%的Search会话包含至少一个用户停止事件。Computer确实更频繁地暂停以获取用户输入:13%的Computer查询调用了至少一个暂停以获取用户工具,而Search为0.3%,通常是为了请求批准或提出澄清问题。这是智能体的预期模式:它大部分时间可以自主进行,但需要检查点来获得许可并确认用户的意图。
Computer还通过模型上下文协议(MCP)或应用程序编程接口(API)端点将更多的外部工具调用链接到单个会话中,完成Search用户原本需要在不同应用程序中手动完成的工作。7.9%的Computer会话至少进行了一次连接器调用,而Search会话为1.8%(差距为4倍),并且Computer平均每个会话进行1.19次连接器调用,而Search为0.10次(比率为12倍)。换句话说,Computer不仅运行时间更长;它还触及了用户更多已连接的服务,以提取数据并采取行动。
后续行为的构成也发生了变化。在1,000对多轮样本中,各产品任务推进的总体倾向几乎相同(Computer后续行动中52.7%为推进,Search为52.9%),但用户要求的内容发生了变化:由于Computer预先返回了更完整的交付成果,其用户用扩展替代了澄清性的深入挖掘(扩展14.2%对12.5%;深入挖掘22.0%对23.4%)。Computer用户也花费略多的后续行动来审查和修订输出(24.6%对23.6%),而Search在简短指令(如确认、重试和格式请求)方面更多(11.6%对9.9%),而Computer则将这些整合到其初始运行中。换句话说,Search创建了更短的“消化与执行”循环;Computer创建了更长的“审查与扩展”循环。
最重要的是,质量并没有随着自主性的提高而下降。在匹配的多轮会话中,下一次轮次有意义的不满率为Computer 1.3%,Search 2.9%,降低了55%。任何不满,包括轻微信号,Computer为10.8%,Search为16.6%。

自主性带来的效率提升
更高的自主性将手动人工工作与机器计算进行了交换,从而提高了效率。为了量化这种影响,我们在相同的匹配任务上比较了两种设置。
Search + 人工:Search处理检索和综合;人工手动执行。
Computer + 人工:Computer执行工作流;人工对任务进行范围界定并审查输出。
我们无法直接观察一项任务需要多长时间,因此我们通过三个独立的估计来三角验证:
基于工具的估计:我们将Computer工具调用分为两类:“搜索”和“执行”。搜索工具对应于已由Search产品处理的信息检索和综合步骤。执行工具代表了用户仅使用Search时需要手动执行的步骤。然后,我们估计有经验的人工执行这些执行操作所需的时间。
基于LLM的估计:我们将来自Computer会话的查询输入LLM,以估计熟练专业人员从Search接收答案但必须手动执行所有执行步骤所需的时间。
用户报告的估计:我们对各领域的活跃Computer用户进行了25次半结构化访谈,并引出使用Computer前的工作流以及这些工作流原本所需的时间。

根据基于工具的估计,平均Search + 人工任务需要269分钟,而相应的Computer + 人工工作流需要36分钟。这减少了87%的任务时间。
为了将任务时间转化为成本,我们使用了美国劳工统计局职业就业和工资统计(BLS OEWS)2025年5月数据的领域特定平均小时工资(美国劳工统计局 2026)。结合模型成本与领域特定的人力劳动成本,Computer平均将预计任务成本降低了94%。


效率优势出现在所有18个领域中,节省了79-92%的时间,成本节省了87-96%。编程是最极端的例子:Search + 人工需要596分钟,而Computer + 人工需要48分钟——节省了92%的时间,从而降低了96%的成本。商业、技术、教育和写作也显示出巨大的收益。时间节省往往在更高工资的领域转化为更大的成本节省。
这一结果有多稳健?考虑盈亏平衡:对于Search + 人工来说,要匹配Computer + 人工的成本,专业人员需要在14-24分钟(中位数为18)内完成每一个手动步骤。即使在更保守的假设下,Computer在每个领域也保持了优势:例如,每工具时间高估8倍,或者Computer监督时间低估12倍。
基于LLM的估计产生了相似的总计结果:总体时间减少84%,成本减少93%。用户访谈显示结果范围广得多——从5倍到超过300倍的加速——这很可能反映了用户在使用Computer前基准的巨大差异。参与者的中位数加速为25倍,对应于时间减少96%。
任务范围在横向和纵向上扩展
匹配任务上的速度和成本仅捕捉到了一部分情况。工作的形式也可能改变。随着Computer用机器计算取代手动执行,用户可能会承担不同类型的工作——跨越职业界限的任务以及需要更高专业水平的任务。
首先,我们询问用户是否比使用Search更频繁地在推断的主要职业集群之外工作。其次,我们使用五个任务级分类来比较相同用户的Computer和Search查询:布鲁姆修订分类法(Anderson and Krathwohl 2001)、任务内容传统中的抽象与常规工作(Autor, Levy, and Murnane 2003)、O*NET知识广度(国家O*NET开发中心 2026)、O*NET工作活动广度,以及使用Search未尝试过的新任务。
横向转移在数据中很明显。在来自八个职业集群的8,000名用户样本中,使用他们所有的查询,Computer用户59%的时间在主要职业之外工作,而Search用户为50%。最大的增加出现在管理和创业、数字技术、艺术与设计以及医疗保健与人类服务领域。跨职业Search查询集中在数字技术中,而Computer查询委派了跨越到更多元化领域的工作,否则用户将需要专家介入。

纵向转移更大。在来自同一组双产品用户的5,000个Computer查询和5,000个Search查询样本中,Computer查询比Search查询在认知上更复杂。根据布鲁姆修订分类法,76%的Computer查询需要高阶认知,而Search为55%。差异集中在顶部:50%的Computer查询是“创造”级任务,而Search为26%。Search在“记忆”级事实查找方面具有更大比重。在抽象与常规任务类型维度上,71%的Computer查询涉及抽象、非常规认知,而Search为53%。

Computer任务还利用了更多的知识领域。平均Computer任务需要在2.40个O*NET知识领域中具备实质性专业知识,而Search为1.74个,增加了38%。Computer需要三个或更多知识领域的可能性几乎是Search的三倍:51%对17%。

在工作活动层面,相同的模式成立。典型的Computer查询涉及2.95个O*NET通用工作活动和4.01个中间工作活动,而Search分别为2.24和2.87,分别增加了32%和40%。在更细的层面,Computer涉及多出59%的详细工作活动和多出60%的职业特定任务陈述。

最能说明问题的指标是同一用户中出现在Computer但未出现在Search中的任务集。在最严格的定义下(任务陈述出现在Computer中且从未出现在配对的Search样本中),23%的Computer查询涉及至少一个仅限Computer的任务陈述。将阈值放宽以允许最多五个Search出现将份额提高到38%,并稳定在41%附近。这些仅限Computer的活动集中在软件和网络开发、文档生产以及数据可视化或图形方面。这正是自主执行最重要的地方:Search解释;Computer生产。

讨论
大多数关于人工智能工作的证据集中在助手设置上。该文献表明,在增强写作、客户支持、编码和咨询方面有巨大的生产力收益(例如,Noy and Zhang 2023; Brynjolfsson, Li, and Raymond 2025; Cui et al. 2026; Dell'Acqua et al. 2026)。
智能体改变了用户行为和下游经济成果。生产部署已开始揭示智能体在现实世界中的使用和影响,但主要集中在专门的编码智能体和早期浏览器智能体上(例如,Sarkar 2026; McCain et al. 2026; Demirer, Musolff, and Yang 2026; Yang et al. 2025)。我们通过比较用户与通用智能体编排器和对话式助手的交互,并将下游影响分析扩展到更广泛的知识工作中,补充了这项工作并弥合了助手和智能体文献。
我们还将研究从暴露转向实现的任务重组。先前的研究使用任务描述和职业结构估计哪些职业暴露于AI(例如,Eloundou et al. 2024; Felten, Raj, and Seamans 2023),而基于使用的衡量指标显示了暴露与部署之间的差距(Massenkoff and McCrory 2026)。我们记录了任务组合如何随着智能体访问权限的增加而发生转移。
我们注意到几个注意事项。首先,观察窗口还很早,早期采用者偏向于AI原生用户。用户也在快速演进的产品环境中积极试验和调整他们的工作流,因此这些模式可能会随时间推移而变化。其次,基于会话的匹配查询设计遗漏了许多没有紧密Search等效项的Computer任务。虽然会话提供了一种细分任务的自然方式,但用户在实践中并不总是遵循这种结构,使得会话成为任务单元的嘈杂代理。第三,效率估计关键取决于关于人类等效工具时间和人类监督时间的假设。尽管基于LLM的估计和用户访谈指向同一方向,并且盈亏平衡和敏感性分析表明了稳健性,但确切量级应被视为近似值。相关地,LLM分类错误引入了额外的测量噪声。最后,我们仅观察Perplexity生态系统内的用户行为,没有捕捉到外部活动,这可能会限制我们对用户全部工作活动和工具使用的视角。
展望未来
智能体使现有任务更快、更便宜——更重要的是,使跨越职业界限和专业水平的任务变得可行。
当系统能够搜索、浏览、编码、编辑文件、连接服务并生产交付成果时,用户的瓶颈就会转移。他们花在操作工作流上的时间减少,而花在指定目标、提供上下文、检查输出和请求扩展上的时间增加。用户从操作员转变为监督者。
在个人层面,这种转变扩展了任务前沿,使个人能够承担更广泛和更深入的工作。在组织和劳动力市场层面,这些微观层面的变化如何汇总仍然是一个悬而未决的问题。如果一个装备了智能体的个体能够完成以前需要多个角色才能完成的工作流,那么智能体的长期影响将不会仅仅通过速度和成本指标来捕捉。相反,它将体现在工作如何捆绑、角色如何定义以及团队如何结构化上。
要了解更多关于我们的方法论和研究结果,请阅读完整的技术报告。
参考文献
Anderson, Lorin W., and David R. Krathwohl. 2001. A Taxonomy for Learning, Teaching, and Assessing: A Revision of Bloom's Taxonomy of Educational Objectives. New York: Longman.
Autor, David H., Frank Levy, and Richard J. Murnane. 2003. "The Skill Content of Recent Technological Change: An Empirical Exploration." The Quarterly Journal of Economics 118 (4): 1279–1333.
Brynjolfsson, Erik, Danielle Li, and Lindsey R. Raymond. 2025. "Generative AI at Work." The Quarterly Journal of Economics 140 (2): 889–942.
Cui, Zheyuan Kevin, Mert Demirer, Sonia Jaffe, Leon Musolff, Sida Peng, and Tobias Salz. 2026. "The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers." Management Science, Articles in Advance.
Dell'Acqua, Fabrizio, Edward McFowland III, Ethan R. Mollick, Hila Lifshitz-Assaf, Katherine Kellogg, Saran Rajendran, Lisa Krayer, François Candelon, and Karim R. Lakhani. 2026. "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality." Organization Science, Articles in Advance.
Demirer, Mert, Leon Musolff, and Liyuan Yang. 2026. "Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools." NBER Working Paper 35275.
Eloundou, Tyna, Sam Manning, Pamela Mishkin, and Daniel Rock. 2024. "GPTs are GPTs: Labor Market Impact Potential of LLMs." Science 384 (6702): 1306–1308.
Felten, Edward W., Manav Raj, and Robert Seamans. 2023. "Occupational Heterogeneity in Exposure to Generative AI." SSRN 4414065.
Massenkoff, Maxim, and Peter McCrory. 2026. "Labor Market Impacts of AI: A New Measure and Early Evidence." Anthropic.
McCain, Miles, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, and Deep Ganguli. 2026. "Measuring AI Agent Autonomy in Practice." Anthropic.
National Center for O*NET Development. 2026. O*NET 30.2 Database. U.S. Department of Labor, Employment and Training Administration.
Noy, Shakked, and Whitney Zhang. 2023. "Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence." Science 381 (6654): 187–192.
Sarkar, Suproteem K. 2026. "AI Agents and Higher-Order Work." University of Chicago Booth School of Business.
U.S. Bureau of Labor Statistics. 2026. "Occupational Employment and Wage Statistics: May 2025 Estimates." U.S. Department of Labor.
Yang, Jeremy, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, and Jerry Ma. 2025. "The Adoption and Usage of AI Agents: Early Evidence from Perplexity." arXiv preprint arXiv:2512.07828.