利用 BrowseSafe 构建更安全的 AI 浏览器

BrowseSafe 是我们开发的开放检测模型和基准,用于捕获隐藏在网页中的恶意指令。

今天,我们发布了 BrowseSafe,这是一个开放的研究基准和内容检测模型,旨在确保用户在浏览代理式网络(agentic web)时的安全。

随着 AI 助手从搜索框走向浏览器本身,我们预计下一代网络将从以页面为中心转向以代理为中心:信息的存储地不再那么重要,而由谁来检索和操作信息则更为关键。Comet 将浏览器变成了一个不仅能回答问题,还能执行任务的场所,因此有一项原则是不容商榷的:它必须始终站在用户这一边。

BrowseSafe:通过实时内容扫描保护代理和用户

BrowseSafe 是一个经过微调的检测模型,旨在回答一个明确的问题:给定一个页面的 HTML,它是否包含针对代理的恶意指令?大型通用模型虽然能够很好地推理这些情况,但它们往往运行缓慢且成本高昂,无法在每个页面上运行。BrowseSafe 能够在不拖慢浏览器的情况下实时扫描整个网页。我们还发布了 BrowseSafe-Bench 评估套件,作为评估和提高防御有效性的资源。

信任边界与分层防御

然而,新一代 AI 浏览技术也意味着新一代网络安全威胁的出现,这需要采用创新的方法来确保用户安全。在之前的一篇文章中,我们介绍了 Comet 如何利用多层防御措施来确保助手执行用户的请求,即使网站试图通过 提示词注入(prompt injection) 来劫持它。今天,我们将重点探讨我们如何应对这一问题:如何定义这些威胁,如何针对现实世界的攻击进行测试,以及如何利用这些威胁训练专门的模型,从而快速识别并阻止恶意指令,确保其在浏览器中安全运行。

浏览器提示词注入的工作原理

提示词注入是指嵌入在 AI 阅读文本中的恶意语言,旨在覆盖其原始意图。在浏览器中,代理会读取整个页面,因此攻击可以隐藏在注释、模板或长页脚等位置。

攻击者利用这些位置插入指令,从而悄悄地重定向代理。由于它读取所有内容,包括大多数人从未注意到的内容,这些消息可以在没有强力保障措施的情况下劫持行为。

这些攻击通常会避开明显的词组,并且可以使用精练的或多语言文本编写,或者放置在屏幕上从不显示的 HTML 元素中,例如浏览器不会显示但代理仍会解析的数据属性或表单字段。

BrowseSafe-Bench:在现实环境中提升代理安全性

为了在模拟真实网络的设置中研究这些攻击,我们构建了 BrowseSafe(我们训练并开源的一个检测模型)以及 BrowseSafe-Bench(一个包含 14,719 个模拟生产页面样本的公共基准)。它包含复杂的 HTML、干扰内容,以及在三个维度上有所差异的恶意和良性样本组合:攻击者试图做什么、指令在页面中的位置,以及语言编写方式。

该基准测试包含 11 种攻击类型、9 种涵盖从隐藏字段到可见段落及页脚的注入策略,以及三种从显式命令到间接隐蔽文本的语言风格。

纵深防御方法

在我们的威胁模型中,助手本身处于一个受信任的环境中,但来自网络的任何内容都是不可信的。攻击者可能控制整个网站,或者仅仅将产品描述、评论和帖子等内容注入到助手访问的原本良性的页面中。为了管理这种风险,能够返回不可信内容(如网页、电子邮件或文件)的工具会被标记,并且其原始输出在代理读取或操作之前始终由 BrowseSafe 进行扫描。

BrowseSafe 是更广泛防御方法中的一层。原始内容在使用前会经过扫描,工具权限默认受到限制,且敏感操作可能需要明确的用户确认,所有这些都建立在现有的浏览器安全功能之上。纵深防御使用户能够使用强大的浏览器助手,而无需以安全性为代价换取功能。

什么因素会影响攻击效果?

BrowseSafe-Bench 的评估结果显示了明显的规律。直接攻击(例如要求代理泄露其系统提示词或通过 URL 片段窃取信息)是模型最容易捕捉的攻击类型。相比之下,多语言攻击以及以间接或假设性指令编写的攻击则要困难得多,因为它们避开了许多检测器隐式依赖的明显关键词。

放置位置也很关键。隐藏在注释中的攻击被检测到的几率相对较高,而改写到可见页脚、表格单元格或行内段落中的版本则要困难得多,这揭示了结构上对“隐藏”注入的偏向。通过精心设计的示例进行严谨的训练,可以显著提高模型检测这些模式的能力。

利用 BrowseSafe 构建更安全的代理

BrowseSafe 和 BrowseSafe-Bench 已完全开源。任何构建自主代理的开发人员都可以立即加固其系统,防御提示词注入——无需从零开始构建安全防线。该开源权重检测模型在本地运行,并在恶意指令到达代理的核心逻辑之前对其进行标记,其速度足以扫描每个页面而不会拖慢用户速度。

使用 BrowseSafe-Bench 的 14,000 多个真实攻击场景来对您自己的模型进行压力测试,对抗那些会破坏标准 LLM 的混乱 HTML 陷阱。我们的分块和并行扫描技术使代理能够高效处理庞大的不可信页面,在不让用户面临危险的情况下实现强大的浏览功能。欲了解更多关于我们如何构建 BrowseSafe 和 BrowseSafe-Bench 的信息,请查看 Perplexity 研究 博客