代理還是機器人?解讀開放網路中的 AI
現代AI助理的工作原理與傳統的網頁爬蟲有著根本的不同。

隨著互聯網的不斷發展,我們存取和互動資訊的方式也在發生變化。在互聯網的早期,自動化機器人扮演著簡單且明確的角色:根據網站擁有者設定的清晰規則,為搜尋引擎索引網站、檢查連結或抓取資料。
然而,隨著AI驅動的助理和使用者驅動的代理的興起,「僅僅是機器人」與滿足真人即時需求之間的界線變得越來越模糊。
數碼助理的興起
現代AI助理的工作原理與傳統的網頁爬蟲有著根本的不同。當你向 Perplexity 提出一個需要即時資訊的問題時——例如「那家新餐廳的最新評論是什麼?」——AI 並不會把這些資訊預先儲存在某個資料庫中。相反,它會造訪相關網站、讀取內容,並針對你的具體問題提供量身定制的摘要。
這與傳統的網頁爬蟲有著本質上的區別。傳統爬蟲會系統性地造訪數百萬個網頁來建立龐大的資料庫,而不管是否有人要求取得這些特定資訊。相比之下,使用者驅動的代理只有在真人請求特定內容時才會進行擷取,並且會立即利用這些內容來回答使用者的問題。Perplexity 的使用者驅動代理不會儲存這些資訊,也不會用其進行訓練。
為什麼這種區別很重要
自動爬蟲與使用者驅動擷取之間的區別不僅僅在於技術層面,更關係到誰能在開放網路中存取資訊。當 Google 的搜尋引擎為了建立索引而進行爬取時,這與它因你要求預覽而擷取網頁的情況不同。Google 的「使用者觸發擷取器」會優先考慮你的體驗,而不是 robots.txt 的限制,因為這些請求是代表你發起的。
AI 助理也是如此。當 Perplexity 擷取網頁時,是因為你提出了需要即時資訊的具體問題。這些內容不會被儲存用於訓練,而是立即用於回答你的問題。
當像 Cloudflare 這樣的公司將使用者驅動的 AI 助理歪曲為惡意機器人時,他們實際上是在主張任何服務使用者的自動化工具都應該受到懷疑——這種立場將會把電子郵件客戶端、網頁瀏覽器,或是任何其他被潛在守門人認為不喜歡的服務都視為違法。
這一爭議表明,Cloudflare 的系統根本無法區分合法的 AI 助理與實際的威脅。如果你無法分辨有用的數碼助理和惡意抓取工具,那麼你大概就不應該對什麼構成合法的網路流量做出決策。
這種过度封鎖會損害每個人。試想一下,有人利用 AI 來研究醫療狀況、比較產品評論,或是從多個來源存取新聞。如果他們的助理被當作「惡意機器人」封鎖,他們就會失去存取寶貴資訊的機會。
其結果就是形成了一個兩極化的互聯網,在其中你的存取權限不取決於你的需求,而是取決於你所選擇的工具是否得到了基礎設施控制者的批准,而他們更關心的是你的手段。這削弱了使用者的選擇權,並威脅到開放網路對於與老牌巨頭競爭的創新服務的可及性。
呼籲釐清:使用者代理實際上是如何工作的
AI 助理的工作方式就像人類助理一樣。當你向 AI 助理提出一個需要即時資訊的問題時,它們並不是已經知道了答案。為了完成你要求的任何任務,它們會為你進行查詢。
在 Perplexity 和所有其他代理式 AI 平台上,這個過程是即時發生的,是為了回應你的請求而進行的,並且這些資訊會被立即用於回答你的問題。它不會被儲存在龐大的資料庫中供未來使用,也不會被用於訓練 AI 模型。
使用者驅動的代理僅在使用者提出特定請求時採取行動,並且只擷取滿足這些請求所需的內容。這是使用者代理與機器人之間的根本區別。
直面 Cloudflare:一場關於能力的問題
Cloudflare 最近的一篇網誌文章幾乎把現代 AI 助理的實際運作方式全面搞錯了。
除了誤解 2000 萬至 2500 萬次使用者代理請求並非爬蟲之外,Cloudflare 還聲稱 Perplexity 參與了「隱蔽爬取」,使用了隱藏的機器人和冒充策略來繞過網站限制。但技術事實說明了完全不同的情況。
顯然,Cloudflare 將 Perplexity 混淆成了來自 BrowserBase 的 300 萬至 600 萬次日常無關流量。BrowserBase 是一個第三方雲端瀏覽器服務,Perplexity 僅在執行高度專業化的任務時才會偶爾使用它(每天的請求次數少於 45,000 次)。
由於 Cloudflare 刻意混淆了他們的方法論,並且拒絕回答有助於我們團隊理解的問題,我們只能將範圍縮小到以下兩種可能的解釋。
Cloudflare 需要一個聰明的公關時刻,而我們——他們的客戶——恰好是一個能為他們帶來這種效果的好名字。
Cloudflare 根本性地將來自 BrowserBase 自動化瀏覽器服務的每日 300 萬至 600 萬次請求錯誤地歸咎於 Perplexity。這是一次基礎的流量分析失誤,對於一家以理解和分類網路流量為核心業務的公司來說,這尤其令人尷尬。
無論哪種解釋才是真相,Cloudflare 分析中的技術錯誤不僅僅是令人尷尬,更是失去了資格。當你錯誤歸因數百萬次請求、發布完全不準確的技術圖表,並表現出對現代AI助理工作原理的根本性誤解時,你就已經喪失了在該空間中宣稱專業知識的任何資格。
這一爭議表明,Cloudflare 的系統根本無法區分合法的 AI 助理與實際的威脅。如果你無法分辨有用的數碼助理和惡意抓取工具,那麼你大概就不應該對什麼構成合法的網路流量做出決策。
围绕这一问题的叫嚣也表明,Cloudflare 的高层要么对 AI 的基础知识存在危险的误解,要么就是虚有其表。这一点之所以重要,是因为 Cloudflare 的客户包括各种类型的企业,这些公司根本承担不起将基础设施托付给江湖骗子式公关特技的风险。
更令人尷尬的是,Cloudflare 發布了一張聲稱展示「Perplexity 爬取工作流程」的技術圖表,該圖表與 Perplexity 的實際運作方式毫無共同之處。如果 Cloudflare 真的有興趣理解他們看到的數據、我們系統的工作原理,或是上述這些基本概念,他們本可以做我們鼓勵所有 Perplexity 使用者去做的事情。直接開口問就行了。