Biztonságosabb MI-böngészők építése a BrowseSafe segítségével
A BrowseSafe a nyílt detektáló modellünk és benchmarkunk a weboldalakon rejlő rosszindulatú utasítások kiszűrésére.

Ma adtuk ki a BrowseSafe modellt, amely egy nyílt forráskódú kutatási benchmark és tartalomérzékelő modell, amelynek célja, hogy biztonságban tartsa a felhasználókat az ügynökök által vezérelt webes navigáció során.
Ahogy a mesterséges intelligencia asszisztensek a keresőmezőkből átkerülnek magába a böngészőbe, számítunk rá, hogy a web következő generációja az oldalakról az ügynökökre helyeződik át: kevésbé arról szól majd, hogy hol található az információ, és inkább arról, hogy ki kéri le és cselekszik vele kapcsolatban. A Comet a böngészőt olyan hellyé alakítja, ahol egy asszisztens képes feladatokat végrehajtani, nem csak kérdésekre válaszolni, így egy elv nem alku tárgya: a felhasználó oldalán kell maradnia.
BrowseSafe: ügynökök és felhasználók védelme valós idejű tartalomvizsgálattal
A BrowseSafe egy olyan detektáló modell, amelyet arra hangoltak finomhangolással, hogy egyetlen, fókuszált kérdésre válaszoljon: egy oldal HTML-kódját figyelembe véve tartalmaz-e az ügynökre irányuló rosszindulatú utasításokat? A nagyméretű, általános célú modellek jól tudnak következtetni ezekben az esetekben, de gyakran túl lassúak és drágák ahhoz, hogy minden egyes oldalon lefuttassák őket. A BrowseSafe valós időben vizsgálja a teljes weboldalakat anélkül, hogy lelassítaná a böngészőt. Ezenkívül kiadjuk a BrowseSafe-Bench értékelési csomagot is, amely forrásként szolgál a védelmi hatékonyság értékeléséhez és javításához.
Megbízhatósági határok és rétegzett védelem
Az MI-böngészés új generációja azonban a kiberbiztonsági fenyegetések új generációját is jelenti, amelyek új megközelítéseket igényelnek a felhasználók biztonságának megőrzéséhez. Egy korábbi bejegyzésünkben bemutattuk, hogyan használja a Comet a védelem több rétegét annak érdekében, hogy az asszisztens azt tegye, amit a felhasználó kért, még akkor is, amikor egy webhely prompt-injekcióval próbálja eltéríteni. Ma arra fókuszálunk, hogyan kezeljük ezt a problémát: hogyan határozzák meg ezeket a fenyegetéseket, hogyan tesztelik őket valós támadásokkal szemben, és hogyan használják őket olyan speciális modellek betanítására, amelyek elég gyorsan felismerik és leállítják a rosszindulatú utasításokat ahhoz, hogy biztonságosan futhassanak a böngészőben.
Hogyan működik a böngészőbeli prompt-injekció?
A prompt-injekció a mesterséges intelligencia által olvasott szövegbe ágyazott rosszindulatú nyelv, amelyet úgy terveztek, hogy felülírja az eredeti szándékot. A böngészőben az ügynökök teljes oldalakat olvasnak, így a támadások olyan helyeken bújhatnak meg, mint a hozzászólások, sablonok vagy hosszú láblécek.
A támadók ezeket a helyeket használják fel olyan utasítások becsempészésére, amelyek észrevétlenül átirányítják az ügynököt. Mivel mindent elolvas, beleértve azt a tartalmat is, amit a legtöbb ember észre sem vesz, ezek az üzenetek erős védelem nélkül eltéríthetik a viselkedést.
Ezek a támadások gyakran kerülik a nyilvánvaló kifejezéseket, és írhatók választékos vagy többnyelvű szöveggel, illetve elhelyezhetők olyan HTML-elemekben, amelyek soha nem jelennek meg a képernyőn, például adatelemekben vagy űrlapmezőkben, amelyeket a böngészők nem jelenítenek meg láthatóan, de az ügynökök mégis elemzik őket.
BrowseSafe-Bench: az ügynökök biztonságának előmozdítása valós környezetben
Annak érdekében, hogy a valódi webhez hasonló környezetben tanulmányozzuk ezeket a támadásokat, megépítettük a BrowseSafe modellt, amelyet betanítottunk és nyílt forráskódúvá tettünk, valamint a BrowseSafe-Bench-et, amely a gyártási oldalakat imitáló 14 719 példát tartalmazó nyilvános benchmark. Ez magában foglalja a komplex HTML-t, a zajos tartalmat, valamint a rosszindulatú és ártalmatlan minták keverékét, amelyek három tengely mentén változnak: mit próbál tenni a támadó, hol helyezkedik el az utasítás az oldalon, és hogyan van megírva a nyelv.
A benchmark 11 támatípust, a rejtett mezőktől a látható bekezdésekig és láblécekig terjedő kilenc injekciós stratégiát, valamint három nyelvi stílust tartalmaz, az explicit parancsoktól a közvetett, álcázott szövegekig.
Mélységi védelem megközelítés
Fenyegetési modellünkben maga az asszisztens egy megbízható környezetben él, de minden, ami a webről érkezik, nem megbízható. A támadók ellenőrizhetnek teljes webhelyeket, vagy egyszerűen csak tartalmakat – például termékleírásokat, megjegyzéseket és bejegyzéseket – injektálhatnak egyébként jóindulatú oldalakra, amelyeket az asszisztens meglátogat. E kockázat kezelése érdekében a nem megbízható tartalmakat – például weboldalakat, e-maileket vagy fájlokat – visszaadni képes eszközök meg vannak jelölve, és nyers kimeneteiket a BrowseSafe mindig átvizsgálja, mielőtt az ügynök elolvashatná vagy cselekedhetne velük kapcsolatban.
A BrowseSafe egy réteg egy szélesebb védelmi megközelítésben. A nyers tartalmat használat előtt átvizsgálják, az eszközök engedélyei alapértelmezés szerint korlátozva vannak, és az érzékeny műveletek kifejezett felhasználói jóváhagyást igényelhetnek, mindezt a meglévő böngészőbiztonsági funkciókon felül. A mélységi védelem lehetővé teszi a felhasználók számára, hogy erős böngészőasszisztenseket fogadjanak el anélkül, hogy a biztonságot a képességekre cserélnék.
Mi befolyásolja a támadás hatékonyságát?
A BrowseSafe-Bench értékelési eredményei egyértelmű mintákat mutatnak. A közvetlen támadások, mint például annakkérése az ügynöktől, hogy fedje fel a rendszerpromptját vagy exfiltráljon információkat URL-szegmenseken keresztül, a modellek számára a legkönnyebben elkaphatóak közé tartoznak. Ezzel szemben a többnyelvű támadások és a közvetett vagy hipotetikus utasításokként megírtak lényegesen nehezebbek, mivel elkerülik azokat a nyilvánvaló kulcsszavakat, amelyekre sok detektor implicit módon támaszkodik.
Az elhelyezkedés is számít. A megjegyzésekbe rejtett támadásokat viszonylag jól észleli, míg a látható láblécekbe, táblázatcellákba vagy bekezdésekbe átírt változatok sokkal nehezebbnek bizonyulnak, ami a „rejtett” injekciók felüli strukturális elfogultságot mutat. A jól megtervezett példákon végzett alapos betanítás jelentősen javíthatja a modellek képességét e minták észlelésére.
Építsen biztonságosabb ügynököket a BrowseSafe segítségével
A BrowseSafe és a BrowseSafe-Bench teljesen nyílt forráskódúak. Bármely autonóm ügynököket építő fejlesztő azonnal megerősítheti rendszereit a prompt-injekcióval szemben – nem kell a semmiből biztonsági korlátokat építeni. A nyílt súlyú detektáló modell helyben fut, és még azelőtt jelzi a rosszindulatú utasításokat, hogy azok elérnék az ügynök maglogikáját, elég gyorsan ahhoz, hogy minden oldalt átvizsgáljon anélkül, hogy lelassítaná a felhasználókat.
Használja a BrowseSafe-Bench több mint 14 000 valós támadási forgatókönyvét saját modelljeinek stressz-tesztelésére a szabványos LLM-eket megtörő, rendezetlen HTML-csapdákkal szemben. Darabolási és párhuzamos szkennelési technikáink lehetővé teszik az ügynökök számára, hogy hatalmas, nem megbízható oldalakat dolgozzanak fel hatékonyan – nagyteljesítményű böngészési képességek anélkül, hogy a felhasználókat veszélynek tennék ki. Ha többet szeretne megtudni arról, hogyan építettük fel a BrowseSafe-et és a BrowseSafe-Bench-et, tekintse meg a Perplexity Kutatási blogját.