Budování bezpečnějších prohlížečů s umělou inteligencí pomocí BrowseSafe

BrowseSafe je náš otevřený detekční model a benchmark pro zachycení škodlivých instrukcí skrytých na webových stránkách.

Dnes vydáváme BrowseSafe, otevřený výzkumný benchmark a model pro detekci obsahu, který má zajistit bezpečí uživatelů při procházení agentického webu.

S tím, jak se AI asistenti přesouvají z vyhledávacích políček přímo do prohlížeče, očekáváme, že se příští generace webu posune od stránek k agentům: méně o tom, kde jsou informace uloženy, a více o tom, kdo je vyhledává a jedná na jejich základě. Comet mění prohlížeč v místo, kde může asistent plnit úkoly, a nejen odpovídat na otázky, takže jeden princip je naprosto nezbytný: musí zůstat na straně uživatele.

BrowseSafe: ochrana agentů a uživatelů prostřednictvím skenování obsahu v reálném čase

BrowseSafe je detekční model vyladěný tak, aby odpovídal na jedinou cílenou otázku: obsahuje HTML stránky škodlivé instrukce cílící na agenta? Velké modely pro všeobecné účely dokážou o těchto případech dobře uvažovat, ale jsou často příliš pomalé a drahé na to, aby běžely na každé stránce. BrowseSafe skenuje celé webové stránky v reálném čase, aniž by zpomaloval prohlížeč. Jako zdroj pro vyhodnocování a zlepšování účinnosti obrany rovněž vydáváme vyhodnocovací sadu BrowseSafe‑Bench.

Hranice důvěry a vrstvená obrana

Nová generace AI prohlížení však znamená také novou generaci kybernetických hrozeb, které vyžadují nové přístupy k zajištění bezpečnosti uživatelů. V dřívějším příspěvku jsme si ukázali, jak Comet využívá několik vrstev ochrany, aby asistent dělal to, o co uživatel požádal, a to i v případě, že se ho webová stránka snaží zneužít pomocí prompt injection. Dnes se blíže podíváme na to, jak tento problém řešíme: jak jsou tyto hrozby definovány, testovány proti útokům z reálného světa a využívány k trénování specializovaných modelů, které dokážou odhalit a zastavit špatné instrukce dostatečně rychle na to, aby mohly bezpečně běžet v prohlížeči.

Jak funguje prompt injection v prohlížeči

Prompt injection je škodlivý jazyk vnořený do textu, který AI čte a který je navržen tak, aby přepsal její původní záměr. V prohlížeči čtou agenti celé stránky, takže útoky se mohou skrývat na místech, jako jsou komentáře, šablony nebo dlouhé patičky.

Útočníci tato místa využívají k nenápadnému vkládání instrukcí, které agenta potichu přesměrují. Protože čte všechno, včetně obsahu, kterého si většina lidí nikdy nevšimne, mohou tyto zprávy narušit chování bez silných záruk.

Tyto útoky se často vyhýbají zjevným frázím a mohou být napsány ve vytříbeném nebo vícejazyčném textu, případně umístěny v HTML prvcích, které se na obrazovce nikdy nezobrazí, jako jsou datové atributy nebo pole formulářů, které prohlížeče viditelně vykreslují, ale agenti je přesto parsují.

BrowseSafe-Bench: pokrok v oblasti zabezpečení agentů v reálném prostředí

Abychom tyto útoky prostudovali v prostředí, které vypadá jako skutečný web, vytvořili jsme BrowseSafe, detekční model, který jsme vytrénovali a zveřejnili jako open-source, a BrowseSafe‑Bench, veřejný benchmark obsahující 14 719 příkladů napodobujících produkční stránky. Obsahuje složité HTML, zašuměný obsah a kombinaci škodlivých a neškodných vzorků, které se liší ve třech osách: co se útočník snaží udělat, kde je instrukce na stránce umístěna a jakým způsobem je jazyk napsán.

Benchmark obsahuje 11 typů útoků, devět strategií injektáže od skrytých polí po viditelné odstavce a patičky a tři lingvistické styly, od explicitních příkazů až po nepřímý, maskovaný text.

Hloubkový přístup k obraně

V našem modelu hrozeb žije samotný asistent v důvěryhodném prostředí, ale cokoliv, co pochází z webu, je nedůvěryhodné. Útočníci mohou ovládat celé weby nebo pouze vkládat obsah, jako jsou popisy produktů, komentáře a příspěvky, do jinak nezávadných stránek, které asistent navštěvuje. Aby bylo možné toto riziko řídit, jsou nástroje, které mohou vracet nedůvěryhodný obsah (např. webové stránky, e-maily nebo soubory), označeny příznakem a jejich surové výstupy jsou vždy před přečtením nebo zpracováním agentem skenovány pomocí nástroje BrowseSafe.

BrowseSafe je jednou z vrstev širšího obranného přístupu. Surový obsah je před použitím skenován, oprávnění nástrojů jsou ve výchozím nastavení omezena a citlivé akce mohou vyžadovat výslovné potvrzení uživatele, a to vše nad rámec stávajících funkcí zabezpečení prohlížeče. Hloubková obrana umožňuje uživatelům používat výkonné asistenty v prohlížeči, aniž by museli vyměnit bezpečnost za schopnosti.

Co ovlivňuje účinnost útoků?

Výsledky hodnocení na nástroji BrowseSafe‑Bench ukazují jasné vzorce. Přímé útoky, jako je požadavek na agenta, aby odhalil svůj systémový prompt nebo exfiltroval informace prostřednictvím segmentů URL, patří mezi ty, které modely zachytí nejlépe. Naproti tomu vícejazyčné útoky a útoky napsané jako nepřímé nebo hypotetické instrukce jsou výrazně obtížnější, protože se vyhýbají zjevným klíčovým slovům, na která se mnoho detektorů implicitně spoléhá.

Záleží také na umístění. Útoky skryté v komentářích jsou detekovány poměrně dobře, zatímco verze přepsané do viditelných patiček, buněk tabulek nebo vkládaných odstavců se ukazují jako mnohem obtížnější, což odhaluje strukturální zaujatost vůči „skrytým“ injektážím. Pečlivý trénink na dobře navržených příkladech může výrazně zlepšit schopnost modelů tyto vzorce detekovat.

Vytvářejte bezpečnější agenty pomocí BrowseSafe

BrowseSafe a BrowseSafe-Bench jsou plně open-source. Každý vývojář budující autonomní agenty může okamžitě zabezpečit své systémy proti prompt injection – bez nutnosti budovat bezpečnostní prvky od základu. Detekční model s otevřenými vahami běží lokálně a označuje škodlivé instrukce dříve, než se dostanou do jádra logiky vašeho agenta, a to dostatečně rychle na to, aby proskenoval každou stránku, aniž by uživatele zpomaloval.

Využijte více než 14 000 scénářů útoků z reálného světa ze sady BrowseSafe-Bench k zátěžovému testování vlastních modelů proti složitým HTML pastím, které ničí standardní LLM. Naše techniky rozdělování na bloky (chunking) a paralelního skenování umožňují agentům efektivně zpracovávat masivní, nedůvěryhodné stránky – výkonné funkce prohlížení bez vystavování uživatelů nebezpečí. Chcete-li se dozvědět více o tom, jak jsme BrowseSafe a BrowseSafe-Bench vytvořili, podívejte se na blog Perplexity Research.