使用 BrowseSafe 建構更安全的 AI 瀏覽器
BrowseSafe 是我們的開源偵測模型與基準,用於攔截隱藏在網頁中的惡意指令。

今天,我們發布了 BrowseSafe,這是一個開源的研究基準與內容偵測模型,旨在確保使用者在瀏覽網頁代理程式網絡時的安全。
隨著 AI 助理從搜尋框走入瀏覽器本身,我們預期新一代的網路將從網頁轉向代理程式:重點不再是資訊存放的位置,而是誰來擷取並採取行動。Comet 將瀏覽器變成一個讓助理可以完成任務而不僅僅是回答問題的地方,因此有一項原則是不容妥協的:它必須永遠站在使用者這邊。
BrowseSafe:透過即時內容掃描保護代理程式與使用者
BrowseSafe 是一個經過微調的偵測模型,旨在回答一個核心問題:給定一個網頁的 HTML,它是否包含針對代理程式的惡意指令?大型通用模型雖然能很好地推導這些情況,但它們通常運行速度太慢且成本過高,無法在每個網頁上執行。BrowseSafe 能夠即時掃描完整網頁,且不會拖慢瀏覽器速度。我們同時也發布了 BrowseSafe‑Bench 評估套件,作為評估與提升防禦效能的資源。
信任邊界與多層防禦
然而,新一代的 AI 瀏覽也意味著新一代的網路安全威脅,需要創新方法來確保使用者安全。在先前的文章中,我們探討了 Comet 如何使用多層防禦來確保助理持續執行使用者的指令,即使網站試圖透過 提示詞注入(prompt injection)來劫持它。今天,我們將深入探討如何解決這個問題:如何定義這些威脅、針對真實世界的攻擊進行測試,以及如何用來訓練專門的模型,以便在瀏覽器中以足夠快的速度發現並阻止不良指令,從而安全運行。
瀏覽器提示詞注入的運作原理
提示詞注入是指嵌入在 AI 閱讀文字中的惡意語言,旨在覆寫其原始意圖。在瀏覽器中,代理程式會閱讀整個網頁,因此攻擊可能會隱藏在評論、範本或長頁尾等地方。
攻擊者利用這些地方悄悄塞入會重新導向代理程式的指令。由於它會閱讀所有內容(包括大多數人從未注意到的內容),這些訊息如果在沒有強大防護的情況下,可能會劫持其行為。
這些攻擊通常會避開明顯的詞彙,並且可以寫在流暢或多語言的文字中,或者放置在永不會在畫面上顯示的 HTML 元素中,例如瀏覽器不會可視化呈現但代理程式仍會解析的資料屬性或表單欄位。
BrowseSafe-Bench:在真實世界環境中推進代理程式安全性
為了在類似真實網路的環境中研究這些攻擊,我們建構了 BrowseSafe(一個我們訓練並開源的偵測模型)以及 BrowseSafe‑Bench(一個包含 14,719 個模仿生產環境網頁範例的公開基準)。它包含複雜的 HTML、雜訊內容,以及一系列惡意與無害樣本,這些樣本在三個軸向上有所不同:攻擊者試圖做什麼、指令在網頁中的位置,以及語言的編寫方式。
該基準包含 11 種攻擊類型、涵蓋從隱藏欄位到可見段落和頁尾的 9 種注入策略,以及從明確指令到間接、偽裝文字的 3 種語言風格。
縱深防禦的方法
在我們的威脅模型中,助理本身處於受信任的環境中,但任何來自網路的內容都是不受信任的。攻擊者可能會控制整個網站,或者只是將產品描述、評論和貼文等內容注入到助理造訪的原本良性的網頁中。為了管理該風險,會對可能傳回不受信任內容的工具(例如網頁、電子郵件或檔案)進行標記,且其原始輸出在代理程式讀取或根據其採取行動之前,一律會透過 BrowseSafe 進行掃描。
BrowseSafe 是更廣泛防禦方法中的其中一層。原始內容在使用前會先經過掃描、工具權限預設會受到限制,且敏感動作可能需要使用者明確確認,這一切都是建立在現有瀏覽器安全功能之上。縱深防禦讓使用者能夠採用強大的瀏覽器助理,而不需犧牲安全性來換取功能。
是什麼影響了攻擊的有效性?
BrowseSafe‑Bench 上的評估結果顯示出清晰的模式。直接攻擊(例如要求助理透露其系統提示詞或透過 URL 區段洩漏資訊)是模型最容易捕捉到的攻擊之一。相比之下,多語言攻擊以及寫成間接或假設性指令的攻擊則困難得多,因為它們避開了許多偵測器隱含依賴的明顯關鍵字。
放置位置也很重要。隱藏在評論中的攻擊能被相對較好地偵測出來,而改寫到可見頁尾、表格儲存格或內嵌段落中的版本則要困難得多,這顯示出模型對「隱藏」注入存在結構性偏見。針對設計良好的範例進行仔細訓練,可以顯著提升模型偵測這些模式的能力。
利用 BrowseSafe 建構更安全的代理程式
BrowseSafe 與 BrowseSafe-Bench 是完全開源的。任何建構自主代理程式的開發人員都可以立即強化其系統以防範提示詞注入,無需從頭建構安全欄柵。開源權重的偵測模型會在本地運行,並在惡意指令到達代理程式的核心邏輯之前将其標記,其速度足以掃描每個網頁而不會拖慢使用者速度。
利用 BrowseSafe-Bench 超過 14,000 個真實世界的攻擊情境,對你自己的模型進行壓力測試,以對抗破壞標準 LLM 的凌亂 HTML 陷阱。我們的分塊與平行掃描技術讓代理程式能夠有效率地處理大量、不受信任的網頁,提供強大的瀏覽功能而不會讓使用者暴露於危險之中。
若要深入了解我們如何建構 BrowseSafe 與 BrowseSafe-Bench,請查看 Perplexity Research 網誌。