エージェントかボットか?オープンウェブにおけるAIの理解
現代のAIアシスタントは、従来のウェブクローリングとは根本的に異なる仕組みで動作します。

インターネットが進化するにつれ、私たちが情報にアクセスし、対話する方法もまた進化しています。ウェブの黎明期において、自動化されたボットは、検索用のサイトのインデックス作成、リンクの確認、あるいはウェブサイトの所有者が設定した明確なルールに従ったデータ収集といった、シンプルで分かりやすい役割を担っていました。
しかし、AIを活用したアシスタントやユーザー主導型エージェントの台頭により、「単なるボット」と、人々の差し迫ったニーズを満たすものとの境界線はますます曖昧になっています。
デジタルアシスタントの台頭
現代のAIアシスタントは、従来のウェブクローリングとは根本的に異なる仕組みで動作します。「あの新しいレストランの最新のレビューは?」といったように、最新情報を必要とする質問をPerplexityに投げかけた場合、AIはその情報をどこかのデータベースに既に保持しているわけではありません。そうではなく、関連するウェブサイトにアクセスし、その内容を読み取り、ユーザーの特定の質問に合わせて要約を作成して提示します。
これは、誰かがその特定の情報を求めているかどうかにかかわらず、クローラーが体系的に数百万のページを巡回して巨大なデータベースを構築する従来のウェブクローリングとは根本的に異なります。対照的に、ユーザー主導型エージェントは、人間が具体的なリクエストを行った場合にのみコンテンツを取得し、そのコンテンツを即座に使用してユーザーの質問に回答します。Perplexityのユーザー主導型エージェントは、情報を保存したり、その情報を使って学習したりすることはありません。
この区別が重要な理由
自動クローリングとユーザー主導型取得の違いは、単なる技術的な問題ではありません。オープンウェブ上の情報に誰がアクセスできるかという問題なのです。Googleの検索エンジンがインデックスを構築するために行うクロールと、ユーザーがプレビューを求めたことでウェブページを取得する場合とでは、その意味合いが異なります。Googleの「ユーザーによってトリガーされるフェッチャー(取得ツール)」は、こうしたリクエストがユーザーに代わって行われるものであるため、robots.txtの制限よりもユーザーのエクスペリエンスを優先します。
同じことがAIアシスタントにも当てはまります。Perplexityがウェブページを取得するのは、ユーザーが最新情報を必要とする具体的な質問をした場合です。そのコンテンツは学習のために保存されることはなく、質問への回答のために即座に使用されます。
Cloudflareのような企業が、ユーザー主導型のAIアシスタントを悪意のあるボットとして不当に扱う際、彼らは「ユーザーにサービスを提供する自動ツールはすべて疑わしいものとみなされるべきだ」と主張していることになります。これは、電子メールクライアントやウェブブラウザ、あるいはゲートキーパーを自任する者が好まないと判断したあらゆるサービスを犯罪視することになりかねない姿勢です。
この論争は、Cloudflareのシステムが、正当なAIアシスタントと実際の脅威を区別する上で根本的に不十分であることを露呈しています。役に立つデジタルアシスタントと悪意のあるスクレーパーを見分けられないのであれば、どのようなトラフィックが正当なウェブトラフィックであるかを決定すべきではありません。
このような過度なブロックは、すべての人に不利益をもたらします。AIを利用して医学的状態を調べたり、製品レビューを比較したり、複数の情報源からニュースにアクセスしたりしているユーザーを想像してみてください。もしそのアシスタントが「悪意のあるボット」としてブロックされてしまえば、ユーザーは貴重な情報へのアクセスを失うことになります。
その結果生じるのは、ユーザーのニーズではなく、使用するツールがインフラ管理者に承認されているかどうかによってアクセス権が決まる、二層化されたインターネットです。インフラ管理者はユーザーの手段に関心を持っているに過ぎません。これはユーザーの選択を損ない、確立された大企業と競争する革新的なサービスにとって、オープンウェブのアクセシビリティを脅かすものです。
明快さを求めて:ユーザーエージェントはどのように機能するのか
AIアシスタントは、人間のアシスタントと同じように機能します。最新の情報を必要とする質問をAIアシスタントにした際、彼らは答えをあらかじめ知っているわけではありません。ユーザーが依頼したタスクを完了するために、彼らが代わりに情報を調査するのです。
Perplexityおよびその他すべてのエージェント型AIプラットフォームにおいて、これはユーザーのリクエストに応じてリアルタイムで実行され、取得した情報は質問への回答に即座に使用されます。この情報は将来の使用のために巨大なデータベースに蓄積されることも、AIモデルの学習に使用されることもありません。
ユーザー主導型エージェントは、ユーザーが具体的なリクエストを行った場合にのみ動作し、そのリクエストを満たすために必要なコンテンツのみを取得します。これこそが、ユーザーエージェントとボットの根本的な違いです。
Cloudflareへの直接的な言及:その能力に対する疑問
Cloudflareの最近のブログ投稿は、現代のAIアシスタントの実際の仕組みについて、ほぼすべてを誤って伝えています。
2,000万〜2,500万件のユーザーエージェントリクエストがスクレーパーではないという事実の誤解に加え、Cloudflareは、Perplexityがウェブサイトの制限を回避するために隠れたボットやなりすまし手法を用いた「ステルス・クローリング」を行っていると主張しました。しかし、技術的な事実は全く異なる様相を示しています。
Cloudflareは、Perplexityが高度に専門的なタスクのために稀に使用するサードパーティのクラウドブラウザサービス「BrowserBase」による関連のないトラフィック(1日あたり300万〜600万件)と、Perplexityを混同したようです(BrowserBaseの利用は1日あたり45,000リクエスト未満です)。
Cloudflareは意図的にその手法を曖昧にし、我々のチームが状況を理解するための質問への回答を拒否しているため、この件については2つの可能性しか考えられません。
Cloudflareには巧みな広報活動の瞬間が必要であり、我々(Cloudflareの顧客でもある)が、そのための格好の材料にされたということです。
Cloudflareは、BrowserBaseの自動ブラウザサービスからの1日あたり300万〜600万件のリクエストを、Perplexityによるものだと根本的に誤認しました。これは、ウェブトラフィックの理解と分類を中核事業とする企業としては、特に恥ずべき基本的なトラフィック分析の失敗です。
いずれの説明が真実であれ、Cloudflareの分析における技術的エラーは恥ずべきことであるだけでなく、専門性を欠いています。数百万件のリクエストを誤って属性付けし、完全に不正確な技術図を公開し、現代のAIアシスタントがどのように機能するかについて根本的な誤解を示しているようでは、このスペースにおける専門性を主張する資格を喪失したと言わざるを得ません。
この論争は、Cloudflareのシステムが、正当なAIアシスタントと実際の脅威を区別する上で根本的に不十分であることを露呈しています。役に立つデジタルアシスタントと悪意のあるスクレーパーを見分けられないのであれば、どのようなトラフィックが正当なウェブトラフィックであるかを決定すべきではありません。
この問題に関する騒動は、CloudflareのリーダーシップがAIの基本について危険なほど無知であるか、単に実態よりも見栄えを優先していることを露呈しています。これは、Cloudflareの顧客にはあらゆるタイプの企業が含まれており、彼らはインフラの信頼性を、詐欺師のような広報戦略に委ねる余裕などないため、重要な問題なのです。
さらに恥ずべきことに、Cloudflareは「Perplexityのクロールワークフロー」を示すとされる技術図を公開しましたが、それはPerplexityの実際の仕組みとは似ても似つかないものでした。Cloudflareがもし真に自分たちが目にしているデータ、我々のシステムの仕組み、あるいは上述の基本的な概念を理解することに関心があるのであれば、我々がすべてのPerplexityユーザーに推奨していることをすればよかったのです。ただ、尋ねればよいのです。