Vytváranie bezpečnejších AI prehliadačov pomocou BrowseSafe

BrowseSafe je náš otvorený detekčný model a benchmark na zachytávanie škodlivých inštrukcií skrytých vo webových stránkach.

Dnes vydávame BrowseSafe, otvorený výskumný benchmark a model na detekciu obsahu, ktorého cieľom je chrániť používateľov pri surfovaní po webe orientovanom na agentov.

Keďže sa AI asistenti presúvajú z vyhľadávacích polí priamo do prehliadača, očakávame, že ďalšia generácia webu prejde od stránok k agentom: pôjde menej o to, kde sú informácie uložené, a viac o to, kto ich získava a koná na základe nich. Comet mení prehliadač na miesto, kde môže asistent plniť úlohy, nielen odpovedať na otázky, takže jedna zásada je nevyjednateľná: musí stáť na strane používateľa.

BrowseSafe: ochrana agentov a používateľov prostredníctvom skenovania obsahu v reálnom čase

BrowseSafe je detekčný model vyladený tak, aby odpovedal na jedinú konkrétnu otázku: obsahuje HTML stránky škodlivé inštrukcie určené pre agenta? Veľké modely na všeobecné použitie dokážu v týchto prípadoch dobre uvažovať, ale často sú príliš pomalé a drahé na to, aby sa spúšťali na každej stránke. BrowseSafe skenuje celé webové stránky v reálnom čase bez toho, aby spomaľoval prehliadač. Vydávame tiež hodnotiacu súpravu BrowseSafe‑Bench ako zdroj na hodnotenie a zlepšovanie efektívnosti obrany.

Hranice dôvery a vrstvená obrana

Nová generácia prehliadania s AI však znamená aj novú generáciu kybernetických hrozieb, ktoré si vyžadujú nové prístupy k udržaniu bezpečnosti používateľov. V predchádzajúcom príspevku sme si ukázali, ako Comet využíva viaceré vrstvy ochrany, aby asistent robil presne to, o čo používateľ požiadal, a to aj vtedy, keď sa webová stránka pokúša o jeho únos pomocou injekcie promptov. Dnes sa bližšie pozrieme na to, ako tento problém riešime: ako sú tieto hrozby definované, testované na reálnych útokoch a využívané na trénovanie špecializovaných modelov, ktoré dokážu odhaliť a zastaviť zlé inštrukcie dostatočne rýchlo na to, aby mohli bezpečne fungovať v prehliadači.

Ako funguje injekcia promptov v prehliadači

Injekcia promptov je škodlivý jazyk zakomponovaný v texte, ktorý číta AI, a je navrhnutý tak, aby prebil jej pôvodný zámer. V prehliadači čítajú agenti celé stránky, takže útoky sa môžu skrývať na miestach, ako sú komentáre, šablóny alebo dlhé päty.

Útočníci využívajú tieto miesta na nenápadné vloženie inštrukcií, ktoré potichu presmerujú agenta. Keďže prečíta všetko, vrátane obsahu, ktorý väčšina ľudí ani nevníma, tieto správy môžu prevziať kontrolu nad správaním bez silných záruk.

Tieto útoky často vyhýbajú zjavným frázam a môžu byť napísané v uhladenom alebo viacjazyčnom texte, prípadne umiestnené v HTML prvkoch, ktoré sa nikdy nezobrazia na obrazovke, ako sú dátové atribúty alebo polia formulárov, ktoré prehliadače viditeľne nevykresľujú, ale agenti ich stále analyzujú.

BrowseSafe-Bench: napredovanie v bezpečnosti agentov v prostredí reálneho sveta

Aby sme mohli tieto útoky študovať v prostredí, ktoré pripomína skutočný web, vytvorili sme BrowseSafe, detekčný model, ktorý sme natrénovali a zverejnili ako open-source, a BrowseSafe‑Bench, verejný benchmark so 14 719 príkladmi, ktoré napodobňujú produkčné stránky. Obsahuje komplexné HTML, zašumený obsah a kombináciu škodlivých a neškodných vzoriek, ktoré sa líšia v troch osiach: čo sa útočník snaží urobiť, kde sa inštrukcia na stránke nachádza a akým spôsobom je jazyk napísaný.

Benchmark zahŕňa 11 typov útokov, deväť stratégizácií injekcií siahajúcich od skrytých polí až po viditeľné odstavce a päty a tri lingvistické štýly, od explicitných príkazov až po nepriamy, maskovaný text.

Prístup viacvrstvovej obrany

V našom modele hrozieb sa samotný asistent nachádza v dôveryhodnom prostredí, ale všetko, čo prichádza z webu, je nedôveryhodné. Útočníci môžu kontrolovať celé stránky alebo len vkladať obsah, ako sú popisy produktov, komentáre a príspevky do inak nezávadných stránok, ktoré asistent navštevuje. Na riadenie tohto rizika sú nástroje, ktoré môžu vracať nedôveryhodný obsah (napríklad webové stránky, e-maily alebo súbory), označené a ich surové výstupy vždy pred prečítaním alebo vykonaním agentom skenuje BrowseSafe.

BrowseSafe je jednou z vrstiev širšieho obranného prístupu. Surový obsah sa pred použitím skenuje, oprávnenia nástrojov sú v predvolenom nastavení obmedzené a citlivé akcie si môžu vyžadovať výslovné potvrdenie používateľa, a to všetko navyše k existujúcim funkciám zabezpečenia prehliadača. Viacvrstvová obrana umožňuje používateľom prijať výkonných asistentov v prehliadači bez toho, aby obetovali bezpečnosť výmenou za funkcie.

Čo ovplyvňuje efektivitu útokov?

Výsledky hodnotenia na BrowseSafe‑Bench ukazujú jasné vzorce. Priame útoky, ako napríklad žiadosť, aby asistent odhalil svoj systémový prompt alebo exfiltriral informácie cez časti URL adresy, patria medzi tie, ktoré modely zachytia najľahšie. Naopak, viacjazyčné útoky a tie, ktoré sú napísané ako nepriame alebo hypotetické inštrukcie, sú výrazne náročnejšie, pretože sa vyhýbajú zjavným kľúčovým slovám, na ktoré sa mnohé detektory implicitne spoliehajú.

Umiestnenie má tiež význam. Útoky skryté v komentároch sú detekované pomerne dobre, zatiaľ čo verzie prepísané do viditeľných pätiek, buniek tabuliek alebo vložených odstavcov sa ukazujú ako oveľa náročnejšie, čo odhaľuje štrukturálnu zaujatosť voči „skrytým“ injekciám. Starostlivé trénovanie na dobre navrhnutých príkladoch môže výrazne zlepšiť schopnosť modelov detekovať tieto vzorce.

Vytvárajte bezpečnejších agentov pomocou BrowseSafe

BrowseSafe a BrowseSafe-Bench sú plne open-source. Každý vývojár, ktorý vytvára autonómnych agentov, môže okamžite zabezpečiť svoje systémy proti injekciám promptov – netreba vytvárať bezpečnostné zábrany od nuly. Detekčný model s otvorenými váhami funguje lokálne a označuje škodlivé inštrukcie skôr, než sa dostanú k core logike vášho agenta, a to dostatočne rýchlo na to, aby naskenoval každú stránku bez toho, aby spomaľoval používateľov.

Využite viac ako 14 000 scenárov reálnych útokov z BrowseSafe-Bench na záťažové testovanie vlastných modelov proti chaotickým HTML pasciam, ktoré lámu štandardné LLM. Naše techniky delenia na bloky a paralelného skenovania umožňujú agentom spracovávať masívne, nedôveryhodné stránky efektívne – výkonné možnosti prehliadania bez vystavovania používateľov nebezpečenstvu. Ak sa chcete dozvedieť viac o tom, ako sme vytvorili BrowseSafe a BrowseSafe-Bench, pozrite si blog Perplexity Research.