代理程式還是機器人?解讀開放網路上的 AI

現代 AI 助理的運作方式與傳統網路爬蟲有本質上的區別。

隨著網際網路的不斷發展,我們存取與互動資訊的方式亦隨之演進。在網路發展初期,自動化機器人扮演著單純且明確的角色:根據網站擁有者設定的明確規則,為搜尋引擎編制索引、檢查連結或抓取資料。

然而,隨著人工智慧助理與使用者導向代理程式的興起,「單純機器人」與滿足真實使用者即時需求之工具之間的界線已日益模糊。

數位助理的崛起

現代 AI 助理的運作方式與傳統網路爬蟲有本質上的區別。當您向 Perplexity 詢問需要即時資訊的問題時(例如:「這家新餐廳的最新評價如何?」),AI 並非事先在某個資料庫中儲存這些資訊。相反地,它會存取相關網站、讀取內容,並針對您的具體問題提供量身打造的摘要。

這與傳統網路爬蟲有本質上的不同。傳統爬蟲會系統性地造訪數百萬個網頁以建立龐大的資料庫,而不論是否有人請求該特定資訊。相比之下,使用者導向的代理程式僅會在真實使用者發出具體請求時才擷取內容,並立即利用該內容來回答使用者的問題。Perplexity 的使用者導向代理程式不會儲存該資訊,也不會利用該資訊進行訓練。

為何此項區別至關重要

自動化爬取與使用者導向擷取之間的差異不僅僅是技術層面,更涉及誰有權存取開放網路上的資訊。Google 的搜尋引擎為了建立索引而進行爬取,這與因為您要求預覽而擷取網頁的行為不同。Google 的「使用者觸發擷取器」會優先考慮您的體驗,而非遵守 robots.txt 的限制,因為這些請求是代表您發出的。

這同樣適用於 AI 助理。當 Perplexity 擷取網頁時,是因為您提出了需要即時資訊的特定問題。內容不會被儲存用於訓練,而是立即用來回答您的問題。

當 Cloudflare 等公司將使用者導向的 AI 助理錯誤地描述為惡意機器人時,他們主張任何服務使用者的自動化工具都應受到懷疑。這種立場等同於將電子郵件用戶端、網路瀏覽器或任何其他被守門人視為不合意的服務定罪。

此爭議顯示 Cloudflare 的系統在區分合法 AI 助理與實際威脅方面存在根本上的不足。如果您無法區分有用的數位助理與惡意的爬蟲程式,那麼您或許就不應負責判定何謂合法的網路流量。

這種過度封鎖行為損害了所有人的權益。試想某人正在利用 AI 研究醫療狀況、比較產品評論或從多個來源存取新聞。如果他們的助理被封鎖為「惡意機器人」,他們將失去獲取寶貴資訊的機會。

其結果是形成一個雙軌制的網際網路,您存取網路的權利取決於您的工具是否獲得基礎設施管理者的核准,而非取決於您的需求,而這些管理者更在意的是您的手段。這破壞了使用者選擇權,並威脅到開放網路對於與既有巨頭競爭的創新服務之可存取性。

呼籲釐清事實:使用者代理程式的實際運作機制

AI 助理的運作方式與人類助理如出一轍。當您詢問 AI 助理一個需要即時資訊的問題時,他們並非預先知道答案。為了完成您所指派的任務,他們會為您進行搜尋。

在 Perplexity 及所有其他代理型 AI 平台上,此過程是在即時狀態下響應您的請求,且資訊會立即用於回答您的問題。這些資訊不會被儲存至大型資料庫以供未來使用,也不會用於訓練 AI 模型。

使用者導向的代理程式僅在使用者提出特定請求時才會採取行動,且僅會擷取履行該請求所需的內容。這是使用者代理程式與機器人之間最根本的差異。

直接回應 Cloudflare:關於適任性的問題

Cloudflare 最近的部落格文章對於現代 AI 助理的實際運作機制,幾乎全盤錯誤。

除了誤解了 2000 萬至 2500 萬次使用者代理請求並非爬蟲程式之外,Cloudflare 還聲稱 Perplexity 進行了「隱形爬取」,使用隱藏的機器人與冒充策略來規避網站限制。然而,技術事實呈現了截然不同的情況。

看來 Cloudflare 將 Perplexity 與來自 BrowserBase(一家 Perplexity 僅偶爾用於極其特殊任務的第三方雲端瀏覽器服務,每日請求少於 45,000 次)的 300 萬至 600 萬次每日無關流量請求混淆了。

由於 Cloudflare 刻意模糊其方法論並拒絕回答有助於我們團隊釐清事實的問題,我們只能將其歸結為兩種可能的原因。

Cloudflare 需要一個精明的宣傳時刻,而我們(他們自己的客戶)恰好成為了達成此目的的棋子。

Cloudflare 將來自 BrowserBase 自動化瀏覽器服務的 300 萬至 600 萬次每日請求,從根本上誤歸咎於 Perplexity。對於一家以理解與分類網路流量為核心業務的公司而言,這種基本的流量分析失敗顯得格外尷尬。

無論何種解釋為真,Cloudflare 分析中的技術錯誤不僅僅是尷尬,更是喪失資格的表現。當您誤報了數百萬次請求,發布完全不準確的技術圖表,並展現出對現代 AI 助理運作方式的根本性誤解時,您已喪失了在該空間領域中聲稱具備專業知識的資格。

此爭議顯示 Cloudflare 的系統在區分合法 AI 助理與實際威脅方面存在根本上的不足。如果您無法區分有用的數位助理與惡意的爬蟲程式,那麼您或許就不應負責判定何謂合法的網路流量。

圍繞此議題的喧囂亦顯示,Cloudflare 的領導階層對於 AI 的基礎知識要麼嚴重誤解,要麼就是徒有虛名。這一點至關重要,因為 Cloudflare 的客戶群包含各種類型的企業,這些公司無法承受將其基礎設施信任於譁眾取寵的宣傳噱頭。

更令人尷尬的是,Cloudflare 發布了一張技術圖表,宣稱顯示了「Perplexity 的爬取工作流程」,但該圖表與 Perplexity 的實際運作方式毫無關聯。如果 Cloudflare 真的有興趣了解他們所看到的資料、我們的系統如何運作,或是上述的基本概念,他們本可以做我們鼓勵所有 Perplexity 使用者所做的事。直接詢問即可。