代理还是机器人?理清开放网络中的人工智能
现代人工智能助理的工作方式与传统的网络爬虫有着本质的区别。

随着互联网的演进,我们访问和交互信息的方式也在发生变化。在互联网发展的早期阶段,自动化机器人(bot)扮演着一种简单且易于理解的角色:根据网站所有者设定的明确规则,对网站进行索引以供搜索、检查链接或抓取数据。
然而,随着人工智能驱动的助理和用户驱动的代理(agent)兴起,“仅仅是机器人”与“满足真实用户直接需求”之间的界限已变得日益模糊。
数字助理的兴起
现代人工智能助理的工作方式与传统的网络爬虫有着本质的区别。当您向Perplexity提出一个需要实时信息的问题时——例如,“那家新餐厅的最新评论是什么?”——人工智能并非已经在某个数据库中预存了这些信息。相反,它会访问相关的网站,阅读内容,并针对您具体的问题生成摘要。
这与传统的网络爬虫有着本质的不同,传统爬虫会系统性地访问数百万个页面以构建庞大的数据库,无论是否有人请求过该特定信息。相比之下,用户驱动的代理仅在真实用户提出特定请求时才会抓取内容,并立即利用这些内容来回答用户的问题。Perplexity的用户驱动代理不会存储这些信息,也不会利用这些信息进行训练。
为何这一区别至关重要
自动化抓取与用户驱动获取之间的差异不仅在于技术层面,更在于谁有权访问开放网络上的信息。当Google的搜索引擎为了构建索引而进行抓取时,这与当您因需要预览而请求其抓取网页时的情形截然不同。Google的“用户触发式获取程序”会优先考虑您的体验,而非遵循robots.txt协议的限制,因为这些请求是代表您发出的。
这一点同样适用于人工智能助理。当Perplexity抓取网页时,是因为您提出了需要即时信息的特定问题。相关内容不会被存储用于训练,而是立即用于回答您的问题。
当Cloudflare等公司将用户驱动的人工智能助理错误地定性为恶意机器人时,他们实际上是在主张任何服务于用户的自动化工具都应受到怀疑——这一立场若成立,将导致电子邮件客户端、网页浏览器或任何被潜在守门人所厌恶的服务都被定性为非法。
此次争议揭示出,Cloudflare的系统在区分合法人工智能助理与实际威胁方面存在根本性的不足。如果无法分辨有用的数字助理与恶意的抓取程序,那么其可能并不具备判定何为合法网络流量的决策能力。
这种过度屏蔽伤害了所有人。试想有人使用人工智能来研究医疗状况、比较产品评论或从多个来源获取新闻。如果其助理被屏蔽为“恶意机器人”,他们将失去获取宝贵信息的渠道。
其结果是一个双层互联网结构,用户的访问权限不再取决于自身需求,而是取决于所选工具是否得到了基础设施控制方的许可,而这些控制方更关心的是用户的手段。这削弱了用户选择权,并威胁到开放网络对于那些与现有巨头竞争的创新服务的可访问性。
澄清呼吁:用户代理的实际工作原理
人工智能助理的工作方式与人类助理如出一辙。当您向人工智能助理提出一个需要当前信息的问题时,它们并非预先知道答案。它们会为您查询并完成您所要求的任务。
在Perplexity及所有其他代理型人工智能平台上,这一过程均实时发生,以响应您的请求,并且这些信息被立即用于回答您的问题。它们不会被存储在庞大的数据库中供将来使用,也不会被用于人工智能模型的训练。
用户驱动的代理仅在用户做出具体请求时才采取行动,且仅抓取为满足这些请求所需的内容。这就是用户代理与机器人之间的根本区别。
直接回应Cloudflare:能力质疑
Cloudflare最近发布的博客文章几乎完全误解了现代人工智能助理的实际工作方式。
除了误认为2000万至2500万次用户代理请求并非抓取程序外,Cloudflare还声称Perplexity正在进行“隐蔽抓取”,使用隐藏的机器人和冒充手段来规避网站限制。但事实并非如此。
看来Cloudflare将Perplexity与来自BrowserBase的每日300万至600万次不相关流量混淆了,BrowserBase是一家第三方云浏览器服务商,Perplexity仅在极少数高度专业化的任务中偶尔使用(每日请求量少于45,000次)。
由于Cloudflare方便地掩盖了其方法论并拒绝回答帮助我们的团队理解的问题,我们只能将其原因归结为两种可能性。
Cloudflare需要一个聪明的公关时刻,而我们——他们的客户——正好是一个可以利用的名字。
Cloudflare从根本上将来自BrowserBase自动化浏览器服务的每日300万至600万次请求错误地归因于Perplexity,这是一种基础性的流量分析失败,对于一家以理解和分类网络流量为核心业务的公司而言,这尤其令人尴尬。
无论哪种解释才是事实,Cloudflare分析中的技术错误不仅令人尴尬,更是缺乏资质的表现。当您错误归因了数百万次请求,发布了完全不准确的技术图表,并表现出对现代人工智能助理工作原理的根本性误解时,您便已丧失了在该空间内声称具备专业知识的权利。
此次争议揭示出,Cloudflare的系统在区分合法人工智能助理与实际威胁方面存在根本性的不足。如果无法分辨有用的数字助理与恶意的抓取程序,那么其可能并不具备判定何为合法网络流量的决策能力。
围绕此议题的喧嚣也表明,Cloudflare的领导层要么在人工智能基础知识上存在危险的无知,要么仅仅是虚张声势。这很重要,因为Cloudflare的客户包括各种类型的企业,这些公司无法承担将自身基础设施交付给进行虚假公关噱头的公司的风险。
更令人尴尬的是,Cloudflare发布了一张技术图表,声称展示了“Perplexity的抓取工作流”,但这与Perplexity的实际工作方式毫无相似之处。如果Cloudflare真有兴趣了解其所见的数据、我们的系统如何工作,或上述基本概念,他们本可以效仿我们鼓励所有Perplexity用户所做的事情。直接询问即可。