使用 BrowseSafe 構建更安全的 AI 瀏覽器
BrowseSafe 是我們的開源檢測模型和基準測試,用於捕捉隱藏在網頁中的惡意指令。

今天,我們發佈了 BrowseSafe,這是一個開源研究基準和內容檢測模型,旨在確保使用者在瀏覽代理網路時的安全。
隨著 AI 助理從搜尋框轉移到瀏覽器本身,我們預期下一代網路將從頁面轉向代理:重點不再是資訊位於何處,而是誰在檢索並處理資訊。Comet 將瀏覽器變成助理可以完成任務而非僅僅回答問題的地方,因此一個原則是不容協商的:它必須始終站在使用者的一方。
BrowseSafe:透過即時內容掃描保護代理和使用者
BrowseSafe 是一個檢測模型,經過微調以回答一個單一的重點問題:給定一個網頁的 HTML,它是否包含針對代理的惡意指令?大型通用模型可以很好地推理這些情況,但它們通常太慢且在每個頁面上執行成本太高。BrowseSafe 可以即時掃描整個網頁,而不會拖慢瀏覽器速度。我們同時也發佈了 BrowseSafe-Bench 評估套件,作為評估和改進防禦有效性的資源。
信任邊界與分層防禦
然而,新一代的 AI 瀏覽也意味著新一代的網路安全威脅,這需要創新的方法來保障使用者的安全。在之前的文章中,我們介紹了 Comet 如何使用多層防禦來確保助理執行使用者要求的操作,即使網站試圖透過 提示詞注入 來劫持它。今天,我們將重點說明我們如何解決該問題:這些威脅是如何被定義的,如何針對真實世界的攻擊進行測試,以及如何用於訓練專用模型,以識別並阻止惡意指令,確保其執行速度足以在瀏覽器中安全運行。
瀏覽器提示詞注入的工作原理
提示詞注入是嵌入在 AI 讀取的文字中的惡意語言,旨在覆蓋其原始意圖。在瀏覽器中,代理會讀取整個頁面,因此攻擊可以隱藏在註解、模板或長頁尾等地方。
攻擊者利用這些位置植入指令,悄悄地重新導向代理。由於它讀取所有內容,包括大多數人未曾注意到的內容,若缺乏強有力的防護措施,這些訊息可能會劫持其行為。
這些攻擊通常避開明顯的語句,並可能以洗練或多語言文本書寫,或者放置在螢幕上不會顯示的 HTML 元素中,例如瀏覽器不會可見呈現但代理仍會解析的資料屬性或表單欄位。
BrowseSafe-Bench:推進真實環境中的代理安全性
為了在看起來像真實網路的環境中研究這些攻擊,我們構建了 BrowseSafe(一個我們訓練並開源的檢測模型)和 BrowseSafe-Bench(一個包含 14,719 個模擬生產環境頁面範例的公開基準)。它包含複雜的 HTML、雜訊內容,以及混合了惡意與無害的樣本,這些樣本在三個軸向上有所不同:攻擊者試圖做什麼、指令在頁面中的位置,以及語言撰寫方式。
該基準測試包含 11 種攻擊類型、9 種注入策略(涵蓋隱藏欄位到可見段落與頁尾),以及 3 種語言風格,從明確指令到間接、偽裝的文字。
縱深防禦方法
在我們的威脅模型中,助理本身處於受信任的環境中,但任何來自網路的內容都是不可信的。攻擊者可能控制整個網站或僅注入內容(例如產品描述、註解和貼文)到助理訪問的良性頁面中。為了管理該風險,可以回傳不可信內容(如網頁、電子郵件或檔案)的工具會被標記,其原始輸出在代理讀取或執行之前,始終會由 BrowseSafe 進行掃描。
BrowseSafe 是更廣泛防禦方法中的一層。原始內容在使用前會被掃描,工具權限預設受到限制,敏感操作可能需要明確的使用者確認,這一切都在現有的瀏覽器安全功能之上。縱深防禦使使用者能夠採用強大的瀏覽器助理,而無需犧牲安全性來換取效能。
什麼影響了攻擊的有效性?
BrowseSafe-Bench 的評估結果顯示了明顯的模式。直接攻擊(例如要求代理揭露其系統提示詞或透過 URL 分段竊取資訊)是模型最容易捕捉的攻擊之一。相比之下,多語言攻擊以及以間接或假設性指令書寫的攻擊則困難得多,因為它們避開了許多檢測器隱式依賴的明顯關鍵字。
位置也很重要。隱藏在註解中的攻擊檢測效果相對較好,而改寫為可見頁尾、表格儲存格或內嵌段落的版本則被證明困難得多,揭示了對「隱藏」注入的結構性偏差。對設計精良的範例進行仔細訓練,可以顯著提高模型檢測這些模式的能力。
使用 BrowseSafe 構建更安全的代理
BrowseSafe 和 BrowseSafe-Bench 是完全開源的。任何構建自主代理的開發者都可以立即加強其系統以對抗提示詞注入,無需從零開始構建安全防護欄。該開源權重檢測模型在本地運行,並在惡意指令到達代理核心邏輯之前對其進行標記,速度足以在不拖慢使用者速度的情況下掃描每個頁面。
使用 BrowseSafe-Bench 的 14,000 多個真實世界攻擊場景來對您的模型進行壓力測試,對抗那些破壞標準 LLM 的複雜 HTML 陷阱。我們的分塊和並行掃描技術讓代理能夠有效地處理大量的、不可信的頁面——實現強大的瀏覽功能而不將使用者暴露於危險之中。如需了解更多關於我們如何構建 BrowseSafe 和 BrowseSafe-Bench 的資訊,請查閱 Perplexity Research 部落格。