AIエージェントはナレッジワークをいかに再形成するか

Computerはタスクの自律性を高め、コストを削減し、ユーザーが取り組む仕事の範囲を広げます。

著者Perplexity Research

Frontier AIシステムは、モデルの知能と実世界での有用性の間のギャップを埋めつつあります。新しいモデル、計算アーキテクチャ、およびオーケストレーションパターンにより、これらのシステムは、ほんの数ヶ月前には不可能と考えられていたタスクを達成できるようになっています。

この急速なイノベーションは、AIユーザーのレバレッジと主体性を高めることで、大きな恩恵をもたらしました。しかし同時に、技術の最前線と、それに対応してナレッジワークがどのように進化しているかという正確な理解との間にギャップを生じさせています。Frontier AIは、専門職全般にわたるナレッジワークの性質をどのように変えるのでしょうか?私たちは、この業務においてどのような構造的および経済的変革を期待すべきでしょうか?

私たちは、Perplexityの利用状況に関する綿密な実証分析を通じて、このギャップを埋めようとしています。本日、ハーバード・ビジネス・スクールの研究者らと共同で、実環境におけるPerplexity Computerの導入に関する初の包括的な調査結果を共有します。調査結果は、Computerがユーザーの達成能力の幅と深さの両方を低コストで拡大することを示唆しています。Computerのユーザーは、より多くの業務をこなし、より高い抽象度で作業し、専門分野の境界を越えて自らの専門外でも価値を生み出しています。

本記事では、調査の要点を提示します。詳細な方法論と調査結果は、私たちの技術レポートで入手可能です。

はじめに

初期の主流な生成AIシステムは、ユーザーと対話を行う会話型アシスタントでした。これらのアシスタントは、意図と行動の間に位置し、質問への回答、トレードオフの説明、次にとるべきステップの提案を行いました。ユーザーはその後、回答を実際の作業に変換しなければなりませんでした。つまり、適切なツールを開き、ファイルを収集し、ドキュメントを編集し、中間生成物を確認し、次にとるべき行動を決定する必要がありました。

エージェントはこの労働の分担を変えます。ユーザーが成果を指定すると、システムはツール全体を横断して計画を立て、中間ステップを実行し、必要に応じて不足している入力を求め、完成した成果物を作成します。エージェントは、AIの利用方法を「情報を検索して統合すること」から「自律的にタスクを計画し遂行すること」へとシフトさせます。

この軌跡は、Perplexity自身の製品進化を体現しています。2022年に、私たちは何十億ものドキュメントを横断して検証可能な引用に裏打ちされた回答をユーザーに提供することで、回答エンジンのカテゴリーを定義した「Search」を立ち上げました。2025年には、オープンウェブ上でユーザーの傍らで推論し行動するウェブエージェントを内蔵したブラウザ「Comet」を導入しました。そして2026年には、複雑な環境と長期的な時間軸にわたり、ユーザーが指定した目的に向けて自律的に作業を行う汎用エージェントオーケストレーター「Computer」を立ち上げました。

この移行は、私たちの働き方をどのように変えているのでしょうか?私たちは、「Search」および「Computer」製品のデータを用いてこの問いを探求し、以下の3つの側面に焦点を当てます。

自律性:同じタスクにおいて、ComputerはSearchと比較してどれだけ自律的な作業を実行するか?

効率性:同じタスクにおいて、ComputerはSearchと比較してどれだけの時間と労働コストを削減するか?

スコープ:Computerはユーザーが試みる作業の種類をどのように変えるか?

私たちは、Computerのようなエージェントは、より多くの初期設定の労力(委任すべき目的をユーザーが指定し、結果を確認する必要があるため)を必要としますが、単位作業あたりの人間による労力ははるかに少ない(より自律的な実行のため)ことを発見しました。これは、長く複数のステップを要するワークフローにおいて特に効果的です。その見返りは、より深く、かつ安価な成果です。Computerはユーザーの労力を手作業による実行から監督へとシフトさせ、ユーザーが自身の専門領域内外で達成できる範囲を拡大します。

Computerの導入とユースケース

Computerは2026年2月25日に立ち上げられ、最初の3ヶ月間で急速に成長しました。

Computerの累積クエリ数は、5月27日までに初週の合計の84倍に達しました。ベースラインとして、ComputerユーザーのSearchの累積使用量は初週の合計の14倍に達しており、Computerを使用していないユーザーの12倍の成長を上回っています。

サブスクリプション層、主要な検索トピック、事前の検索頻度でComputerユーザーと非Computerユーザーをマッチングした後でも、差の差(difference-in-differences)比較により、Computerの採用が検索使用を増加させることが示されました。Computerユーザーは、同様の非Computerユーザーと比較して、1日あたり1.05回多く検索クエリを実行しています。

各シリーズの初週を基準とした累積成長率。Computerのクエリ数は、2月27日から5月27日の期間中に、累積初週合計の84倍に達しました。
各シリーズの初週を基準とした累積成長率。Computerのクエリ数は、2月27日から5月27日の期間中に、累積初週合計の84倍に達しました。

10万件のComputerクエリの無作為標本において、「リサーチおよび分析」が25.8%で最大のタスクカテゴリであり、「ドキュメントおよび資産作成」が18.6%でこれに続きました。観察されたタスクの構成は生成的な作業に偏っており、ドキュメント、スプレッドシート、コードベース、ウェブサイト、および複数のツールを横断する作業を必要とするワークフローが目立ちます。

ドメインに注目すると、使用状況はソフトウェア・IT、金融・投資、マーケティング・販売、ビジネス運用、ヘルスケア、教育、法務、およびメディア全体に広く分散していました。

タスクカテゴリおよび主題ドメイン全体におけるComputerのユースケース。
タスクカテゴリおよび主題ドメイン全体におけるComputerのユースケース。リサーチ、分析、ドキュメント作成、ソフトウェア、金融、ビジネス運用、および個人のワークフローが顕著に現れています。

高い自律性と品質

自律性の最も直接的なシグナルは、ユーザーがリクエストを送信した後、人間が介在せずにシステムがどれだけ長く実行を続けるかです。Searchは通常、数秒で応答を返します。Computerは、検索、ブラウジング、執筆、編集、コードの実行、中間結果の確認など、数分から数時間も作業を続けることがよくあります。

私たちは、SearchとComputerのセッションのうち、最初のクエリがほぼ同一のものを、両方の製品で試行された同一タスクの代替指標として使用しています。1万組のマッチング済みペア全体で、Computerはセッションあたり平均26分のマシン実行を実行し、Searchは33秒でした。これは実質的に同一のタスクにおいて、マシン作業が48倍増加したことを意味します。中央値で見ると、その差は9分対14秒で、40倍です。ドメインごとの分割でも同じパターンが見られ、すべての18のドメインにおいて、Computerは概ね26〜75倍のマシン作業を実行しています。

マッチングされたComputerセッションとSearchセッションのセッションあたりのマシン実行時間。
マッチングされたComputerセッションとSearchセッションのセッションあたりのマシン実行時間。Searchは短い応答時間に集中していますが、Computerは長時間の自律的実行を中心に、より幅広い分布を示しています。Computerの平均実行時間(26分)は中央値(9分)よりもはるかに高く、複雑で長期的なリクエストの長いテールが存在することを示しています。
ドメインごとの平均マシン実行時間。
ドメインごとの平均マシン実行時間。各ユーザーのターンが会話型の応答だけでなくダウンストリームの実行をトリガーするため、Computerはセッションごとにより多くの作業を実行します。

長時間の自律性が、より多くの放棄につながることはありませんでした。ユーザーによる停止イベントは、製品間で類似しており、Computerセッションの3.7%、Searchセッションの3.4%に少なくとも1回のユーザー停止イベントが含まれていました。Computerは、ユーザー入力のための一時停止をより頻繁に行いました。Computerクエリの13%が少なくとも1回のユーザー一時停止ツールを呼び出したのに対し、Searchでは0.3%でした。これは通常、承認の要求や明確化のための質問を行うためです。これはエージェントとして期待されるパターンであり、ほとんどの時間は自律的に進行できますが、許可を得たり、ユーザーの意図を確認したりするためのチェックポイントを必要とします。

Computerはまた、モデルコンテキストプロトコル(MCP)またはAPIエンドポイントを通じて、より多くの外部ツール呼び出しを単一のセッションに連鎖させ、Searchユーザーがそうでなければ別々のアプリ間で手作業で行うような作業を実行します。Computerセッションの7.9%が少なくとも1つのコネクタ呼び出しを行っているのに対し、Searchセッションでは1.8%(4倍の差)であり、Computerはセッションあたり平均1.19回のコネクタ呼び出しを行っています(Searchは0.10回、12倍の比率)。言い換えれば、Computerは単に長時間実行されるだけでなく、ユーザーの接続されたサービスを横断してデータを取得し、アクションを実行します。

フォローアップの挙動の構成も変化します。1,000組の複数ターンサンプルにおいて、タスクを前進させようとする傾向は製品間でほぼ同一ですが(Computerのフォローアップの52.7%対Searchの52.9%)、ユーザーが求める内容は変化します。Computerはより完全な成果物をあらかじめ返すため、ユーザーは明確化のための深掘りの代わりに拡張を要求するようになります(拡張14.2%対12.5%、深掘り22.0%対23.4%)。Computerユーザーはまた、フォローアップにおいて成果物の確認や修正により多くの時間を費やしますが(24.6%対23.6%)、Searchは確認、再試行、フォーマット要求(11.6%対9.9%)のような短い指示が多く、これらはComputerでは最初の実行に含まれます。言い換えれば、Searchは短期間の「理解して実行する」ループを形成し、Computerは長期間の「レビューして拡張する」ループを形成します。

最も重要なことに、自律性の向上によって品質が低下することはありませんでした。マッチングされた複数ターンセッションにおいて、次ターンにおける有意義な不満は、Computerでは1.3%であったのに対し、Searchでは2.9%であり、55%の削減となりました。軽微なシグナルを含む不満の総数は、Computerでは10.8%であったのに対し、Searchでは16.6%でした。

マッチングされた複数ターンサンプルにおける次ターン不満シグナル。端数のため、列の合計が100%にならない場合があります。

自律性による効率性の向上

高い自律性は、人間の手作業を機械計算に置き換えるため、効率が向上します。この効果を定量化するために、同一のマッチングタスクで2つの設定を比較します。

Search + 人間:Searchが検索と統合を行い、人間が手動で実行する。

Computer + 人間:Computerがワークフローを実行し、人間がタスクのスコープを定義して成果物をレビューする。

タスクに人間がどれだけ時間を要するかを直接観察することはできないため、3つの独立した推定を用いて三角測量を行います。

ツールベースの推定:私たちはComputerのツール呼び出しを「検索」と「実行」の2つのカテゴリに分類します。検索ツールは、Search製品によってすでに処理されている情報検索および統合ステップに対応します。「実行」ツールは、Search単体を使用する際に人間が手動で行う必要のある実行ステップを表します。次に、経験豊富な人間がこれらの「実行」アクションを行うために必要な時間を推定します。

LLMベースの推定:私たちはComputerセッションからのクエリをLLMに入力し、Searchから回答を受け取るものの、すべての実行ステップを手動で行わなければならない熟練専門家が必要とする時間を推定します。

ユーザーによる自己報告の推定:私たちは、ドメインをまたぐアクティブなComputerユーザー25名を対象に半構造化インタビューを実施し、Computer導入前のワークフローと、そのワークフローにかかっていた時間を明らかにしました。

ツールベースの推定で使用されるツール分類。「検索」ツールはSearchがすでに提供している機能を反映しているため、手動作業時間は請求されません。「実行」ツールは、人間がSearchのリサーチ出力に基づいて行動することを必要とします。呼び出しあたりの分単位の推定値は、熟練の専門家が同等のアクションを手動で行う際に費やす時間をおおよそ算出しています。

ツールベースの推定では、平均的なSearch + 人間のタスクは269分かかるのに対し、対応するComputer + 人間のワークフローは36分かかります。これはタスク時間の87%削減です。

タスク時間をコストに変換するため、私たちは米国労働統計局の職業雇用賃金統計(BLS OEWS)の2025年5月データ(2026年)におけるドメイン別の平均時給を使用します。モデルのコストとドメイン別の人間による労働コストを組み合わせると、Computerは推定タスクコストを平均94%削減します。

Search + 人間対Computer + 人間の推定タスク時間およびコスト。
Search + 人間対Computer + 人間の推定タスク時間およびコスト。Search + 人間のベースラインでは人間の労働力が大部分を占めますが、Computerは作業の多くをモデルとツールの実行にシフトさせます。
Search + 人間と比較したComputer + 人間による時間およびコストの節約率(括弧内は乗数。例えば、94% (16倍)は、Computer + 人間が94%または16倍安価であることを意味します)。人間の労働コストには、BLS OEWSの2025年5月の平均時給を使用しています。

効率性の優位性は全18ドメインで現れており、79〜92%の時間節約と87〜96%のコスト節約が見られます。プログラミングは最も極端な例であり、Search + 人間では596分かかるところ、Computer + 人間では48分であり、92%の時間短縮が96%のコスト削減をもたらしています。ビジネス、テクノロジー、教育、執筆も大きな利益を示しています。時間節約は、賃金水準の高いドメインにおいて、より大きなコスト節約につながる傾向があります。

この結果はどれほど堅牢でしょうか?損益分岐点を考慮してください。Search + 人間がComputer + 人間のコストと一致するためには、専門家はすべての手動ステップを14〜24分(中央値18分)で完了させる必要があります。Computerは、ツールごとの時間における8倍の過大評価や、Computerの監督時間における12倍の過小評価といった、より保守的な仮定の下でも、あらゆるドメインで優位性を保ちます。

LLMベースの推定では、全体として時間で84%、コストで93%の削減という同様の総計結果が得られます。ユーザーインタビューは、5倍から300倍を超えるスピードアップという、はるかに幅広い結果を示しており、これはユーザーのComputer導入前のベースラインに大きなばらつきがあることを反映している可能性が高いです。参加者全体の中央値のスピードアップは25倍であり、これは時間の96%削減に相当します。

タスクのスコープは水平方向および垂直方向に拡大する

マッチングタスクにおける速度とコストは、物語の一部に過ぎません。仕事の形も変化する可能性があります。Computerが手作業を機械計算に置き換えるにつれて、ユーザーは、職業的な境界を越えるタスクや、より高いレベルの専門知識を必要とするタスクなど、これまでとは異なる種類の作業に取り組む可能性があります。

第一に、ユーザーがSearchを使用する場合よりもComputerを使用する場合の方が、より頻繁に自身の推測される主要な職業クラスタ外で作業を行っているかどうかを問います。第二に、ブルームの改訂版分類法(2001年)、タスクの内容に関する伝統における抽象的作業対ルーチン的作業(2003年)、O*NETの知識の幅(2026年)、O*NETの仕事活動の幅、およびSearchでは試みられなかった新しいタスクという5つのタスクレベルの分類を用いて、同じユーザーからのComputerクエリとSearchクエリを比較します。

水平方向のシフトはデータに明らかです。8つの職業クラスタに属する8,000人のユーザーのサンプル全体で、すべてのクエリを使用して分析すると、Computerユーザーは時間の59%を自身の主要な職業外の作業に費やしており、Searchの50%と比較して高くなっています。最大の増加は、経営・起業、デジタルテクノロジー、芸術・デザイン、ヘルスケア・ヒューマンサービスで見られます。職業を横断するSearchクエリはデジタルテクノロジーに集中していますが、Computerクエリは、ユーザーがそうでなければ専門家を必要とするような、より多様なドメインにまたがる作業を委任しています。

8つの職業クラスタ全体における職業をまたぐタスクフロー。
8つの職業クラスタ全体における職業をまたぐタスクフロー。曲線は各クラスタの上位の流出先を示し、線の幅は流出先のシェアに比例し、線の種類は順位を示しています。Searchは職業をまたぐフローをデジタルテクノロジーに集中させていますが、Computerはマーケティング、経営、金融サービス、およびその他の実行目的の先にフローを分散させています。

垂直方向のシフトはさらに大きいです。同一のデュアル製品ユーザーセットからの5,000件のComputerクエリと5,000件のSearchクエリのサンプルにおいて、ComputerクエリはSearchクエリよりも認知的に複雑です。ブルームの改訂版分類法に基づくと、Computerクエリの76%が高次認知を必要とするのに対し、Searchでは55%です。その差は上位に集中しており、Computerクエリの50%が「創造」レベルのタスクであるのに対し、Searchでは26%です。Searchは「記憶」レベルの事実調査に大きく偏っています。抽象的作業対ルーチン的作業の次元では、Computerクエリの71%が抽象的かつ非ルーチン的な認知に関与しており、Searchの53%に対して高くなっています。

ComputerクエリとSearchクエリの認知的複雑性。
ComputerクエリとSearchクエリの認知的複雑性。Computerは「創造」レベルおよび抽象的な非ルーチンワークへ強くシフトしています。

Computerタスクはより多くの知識ドメインを活用します。平均的なComputerタスクは、O*NET知識分野で2.40の分野の実質的な専門知識を必要としますが、Searchは1.74であり、38%の増加です。ComputerはSearchに比べて3つ以上の知識ドメインを必要とする可能性がほぼ3倍高く、51%対17%です。

クエリごとの必要な知識ドメイン。
クエリごとの必要な知識ドメイン。Computerセッションは2〜3のドメインに集中しており、幅広い専門知識を必要とする可能性がはるかに高いです。

仕事活動レベルでも同様のパターンが見られます。典型的なComputerクエリは、O*NETの一般的な仕事活動のうち2.95、中間的な仕事活動のうち4.01に従事しますが、Searchではそれぞれ2.24、2.87であり、32%および40%の増加です。より詳細なレベルでは、Computerは59%多くの詳細な仕事活動と60%多くの職業固有のタスクステートメントに従事します。

O*NETのネストレベル全体におけるクエリごとのタスク活動の幅。
O*NETのネストレベル全体におけるクエリごとのタスク活動の幅。Computerは中間、詳細、タスクステートメントのレベルで分布を右にシフトさせます。

最も示唆に富む測定尺度は、同一ユーザーにおいてSearchには現れずComputerにのみ現れるタスクのセットです。タスクステートメントがComputerには現れ、ペアとなるSearchサンプルには一度も現れないという最も厳格な定義では、Computerクエリの23%が少なくとも1つのComputer専用タスクステートメントに従事しています。Searchでの出現回数を5回まで許容するように閾値を緩和すると、そのシェアは38%に上昇し、41%近くでプラトーに達します。これらのComputer専用アクティビティは、ソフトウェア・ウェブ開発、ドキュメント作成、およびデータ可視化またはグラフィックスに集中しています。これこそが、自律的な実行が最も重要となる領域です。つまり、Searchは説明し、Computerは生成するのです。

異なる出現閾値の下で、少なくとも1つのComputer専用O*NETアクティビティに従事するComputerクエリのシェア。
異なる出現閾値の下で、少なくとも1つのComputer専用O*NETアクティビティに従事するComputerクエリのシェア。最も強い分離は、詳細なタスクステートメントレベルで現れています。

議論

仕事におけるAIに関する証拠のほとんどは、アシスタントの設定に焦点を当てています。その文献は、執筆、カスタマーサポート、コーディング、コンサルティングなどの補強において、大きな生産性の向上を示しています(例えば、Noy and Zhang 2023; Brynjolfsson, Li, and Raymond 2025; Cui et al. 2026; Dell'Acqua et al. 2026)。

エージェントはユーザーの行動とダウンストリームの経済的結果を変えます。製品としての導入は、実環境におけるエージェントの使用と影響を明らかにしていますが、主に特殊なコーディングエージェントや初期のブラウザエージェントに焦点を当てています(例えば、Sarkar 2026; McCain et al. 2026; Demirer, Musolff, and Yang 2026; Yang et al. 2025)。私たちはこの研究を補完し、汎用エージェントオーケストレーター対会話型アシスタントのユーザーインタラクションを比較し、ダウンストリームの影響分析をより幅広いナレッジワークに拡張することで、アシスタントとエージェントの文献をつなぎます。

私たちはまた、露出(exposure)から実現されたタスクの再構成(task recomposition)へと移行します。先行研究は、タスクの説明と職業構造を使用して、どの職業がAIにさらされているかを推定していますが(例えば、Eloundou et al. 2024; Felten, Raj, and Seamans 2023)、使用ベースの指標は、露出と展開の間のギャップを示しています(Massenkoff and McCrory 2026)。私たちは、エージェントへのアクセスによってタスクの構成がどのように変化するかを文書化します。

いくつかの注意事項を述べます。第一に、観察期間が初期段階であり、アーリーアダプターはAIネイティブに偏っています。ユーザーはまた、急速に進化する製品環境の中で自らのワークフローを積極的に実験し、適応させているため、これらのパターンは時間の経過とともに変化する可能性があります。第二に、セッションベースのマッチングクエリ設計は、Searchに類似したものがない多くのComputerタスクを除外しています。セッションはタスクをセグメント化する自然な方法を提供しますが、ユーザーは実際には必ずしもこの構造に従わず、セッションはタスク単位のノイズの多い代理指標となります。第三に、効率性の推定値は、人間と同等のツール時間と人間の監督時間に関する仮定に決定的に依存しています。LLMベースの推定とユーザーインタビューは同じ方向を向いており、損益分岐点と感度分析は堅牢性を示していますが、正確な規模はおおよそのものとして読まれるべきです。関連して、LLMの分類誤差が測定ノイズをさらに生じさせています。最後に、私たちはPerplexityエコシステム内のユーザー行動のみを観察しており、その外部の活動を捉えていないため、ユーザーの完全な仕事活動やツール使用の全容についての視点が制限されている可能性があります。

今後の展望

エージェントは既存のタスクをより速く、より安価にするだけでなく、さらに重要なこととして、職業の境界や専門知識のレベルを越えるタスクを実現可能にします。

システムが検索、ブラウジング、コーディング、ファイル編集、サービスへの接続、および成果物の作成を可能にする場合、ユーザーのボトルネックはシフトします。ユーザーはワークフローを操作することに費やす時間を減らし、目標の指定、コンテキストの提供、出力の確認、拡張の依頼に時間を費やすようになります。ユーザーはオペレーターからスーパーバイザーへと移行します。

個人レベルでは、このシフトはタスクのフロンティアを拡大し、ユーザーがより広く、より深い仕事に取り組むことを可能にします。組織および労働市場レベルでは、これらのミクロレベルの変化がどのように集計されるかは未解決の問題です。エージェントを装備した一人の個人が、以前は複数の役割を必要としていたワークフローを完了できるのであれば、エージェントの長期的影響は速度とコストの指標だけでは捉えられません。その代わり、仕事がどのようにバンドルされ、役割がどのように定義され、チームがどのように構造化されるかに現れます。

方法論と調査結果の詳細については、完全な技術レポートをお読みください。

参考文献

Anderson, Lorin W., and David R. Krathwohl. 2001. A Taxonomy for Learning, Teaching, and Assessing: A Revision of Bloom's Taxonomy of Educational Objectives. New York: Longman.

Autor, David H., Frank Levy, and Richard J. Murnane. 2003. "The Skill Content of Recent Technological Change: An Empirical Exploration." The Quarterly Journal of Economics 118 (4): 1279–1333.

Brynjolfsson, Erik, Danielle Li, and Lindsey R. Raymond. 2025. "Generative AI at Work." The Quarterly Journal of Economics 140 (2): 889–942.

Cui, Zheyuan Kevin, Mert Demirer, Sonia Jaffe, Leon Musolff, Sida Peng, and Tobias Salz. 2026. "The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers." Management Science, Articles in Advance.

Dell'Acqua, Fabrizio, Edward McFowland III, Ethan R. Mollick, Hila Lifshitz-Assaf, Katherine Kellogg, Saran Rajendran, Lisa Krayer, François Candelon, and Karim R. Lakhani. 2026. "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality." Organization Science, Articles in Advance.

Demirer, Mert, Leon Musolff, and Liyuan Yang. 2026. "Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools." NBER Working Paper 35275.

Eloundou, Tyna, Sam Manning, Pamela Mishkin, and Daniel Rock. 2024. "GPTs are GPTs: Labor Market Impact Potential of LLMs." Science 384 (6702): 1306–1308.

Felten, Edward W., Manav Raj, and Robert Seamans. 2023. "Occupational Heterogeneity in Exposure to Generative AI." SSRN 4414065.

Massenkoff, Maxim, and Peter McCrory. 2026. "Labor Market Impacts of AI: A New Measure and Early Evidence." Anthropic.

McCain, Miles, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, and Deep Ganguli. 2026. "Measuring AI Agent Autonomy in Practice." Anthropic.

National Center for O*NET Development. 2026. O*NET 30.2 Database. U.S. Department of Labor, Employment and Training Administration.

Noy, Shakked, and Whitney Zhang. 2023. "Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence." Science 381 (6654): 187–192.

Sarkar, Suproteem K. 2026. "AI Agents and Higher-Order Work." University of Chicago Booth School of Business.

U.S. Bureau of Labor Statistics. 2026. "Occupational Employment and Wage Statistics: May 2025 Estimates." U.S. Department of Labor.

Yang, Jeremy, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, and Jerry Ma. 2025. "The Adoption and Usage of AI Agents: Early Evidence from Perplexity." arXiv preprint arXiv:2512.07828.