Turvalisemate AI-brauserite loomine BrowseSafe'i abil
BrowseSafe on meie avatud tuvastusmudel ja võrdlusalus veebilehtedele peidetud pahatahtlike juhiste tabamiseks.

Täna anname välja BrowseSafe'i, avatud teadusuuringute võrdlusaluse ja sisutuvastusmudeli, mille eesmärk on hoida kasutajaid veebis navigeerimisel turvaliselt.
Kuna tehisintellekti assistendid liiguvad otsingukastidest otse brauserisse, ootame, et järgmise põlvkonna veeb nihkub lehekülgedelt agentidele: vähem sellest, kus teave asub, ja rohkem sellest, kes selle leiab ja selle alusel tegutseb. Comet muudab brauseri paigaks, kus assistent saab ülesandeid täita, mitte ainult küsimustele vastata, mistõttu on üks põhimõte tingimusteta: see peab jääma kasutaja poolele.
BrowseSafe: agentide ja kasutajate kaitsemine reaalajas sisuskaneerimise abil
BrowseSafe on tuvastusmudel, mida on häälestatud vastama ühele konkreetsele küsimusele: kas lehe HTML-kood sisaldab agentidele suunatud pahatahtlikke juhiseid? Suured üldotstarbelised mudelid suudavad neid olukordi hästi analüüsida, kuid need on sageli liiga aeglased ja kulukad, et iga lehekülje puhul käivituda. BrowseSafe skannib täismahus veebilehti reaalajas ilma brauserit aeglustamata. Anname välja ka hindamiskomplekti BrowseSafe‑Bench, mis toimib ressursina kaitse tõhususe hindamiseks ja parandamiseks.
Usalduspiirid ja mitmekihiline kaitse
Tehisintellektiga veebisirvimise uus põlvkond tähendab siiski ka uue põlvkonna küberturvalisuse ohte, mis nõuavad uudseid lähenemisi kasutajate turvalisuse tagamiseks. Varasemas postituses vaatlesime, kuidas Comet kasutab mitut kaitsekihti, et hoida assistenti kasutaja antud ülesande täitmisel isegi siis, când veebisait üritab seda kiirpäringu süstimise abil kaaperdada. Täna keskendume sellele, kuidas me selle probleemiga tegeleme: kuidas neid ohte määratletakse, testitakse reaalsete rünnakute vastu ning kasutatakse spetsiaalsete mudelite treenimiseks, mis suudavad pahatahtlikud juhised piisavalt kiiresti tuvastada ja peatada, et brauseris turvaliselt töötada.
Kuidas brauseri kiirpäringu süstimine toimib
Kiirpäringu süstimine on AI loetavasse teksti põimitud pahatahtlik keel, mis on loodud selle algse kavatsuse tühistamiseks. Brauseris loevad agendid terveid lehti, mistõttu rünnakud võivad peituda sellistes kohtades nagu kommentaarid, mallid või pikad jalused.
Ründajad kasutavad neid kohti selleks, et libistada sisse juhiseid, mis agendi märkamatult ümber suunavad. Kuna see loeb kõike, sealhulgas sisu, mida enamik inimesi kunagi ei märka, võivad need sõnumid käitumist kaaperdada ilma tugevate kaitsemeetmeteta.
Need rünnakud väldivad sageli ilmseid väljendeid ning võivad olla kirjutatud lihvitud või mitmekeelses tekstis või paigutatud HTML-elementidesse, mis ei ilmu kunagi ekraanile, näiteks andmeatribuutidesse või vormiväljadesse, mida brauserid nähtavalt ei renderda, kuid agendid siiski analüüsivad.
BrowseSafe-Bench: agenditurvalisuse edendamine reaalsetes keskkondades
Selleks, et uurida neid rünnakuid reaalsele veebile sarnanevas keskkonnas, lõime BrowseSafe'i, tuvastusmudeli, mille treenisime ja tegime avatud lähtekoodiga, ning BrowseSafe‑Bench'i, mis on 14 719 tootmislehti jäljendava näite avalik võrdlusalus. See sisaldab keerulist HTML-i, müra sisaldavat sisu ning segu pahatahtlikest ja ohututest näidistest, mis varieeruvad kolmel teljel: mida ründaja püüab teha, kus juhis lehel asub ja kuidas keel on kirjutatud.
Võrdlusalus sisaldab 11 rünnakutüüpi, üheksat süstimisstrateegiat alates peidetud väljadest kuni nähtavate lõikude ja jalusteni ning kolme keelelist stiili selgetest käskudest kaudse ja maskeeritud tekstini.
Mitmekihilise kaitse lähenemisviis
Meie ohumudelis asub assistent ise usaldusväärses keskkonnas, kuid kõik veebist tulev on ebaturvaline. Ründajad võivad kontrollida terveid saite või lihtsalt süstida sisu, näiteks tootekirjeldusi, kommentaare ja postitusi muidu ohututele lehtedele, mida assistent külastab. Selle riski haldamiseks märgistatakse tööriistad, mis saavad tagastada ebausaldusväärset sisu, nagu veebilehed, e-kirjad või failid, ja BrowseSafe skannib alati nende töötlemata väljundeid enne, kui agent saab neid lugeda või nende alusel tegutseda.
BrowseSafe on üks kiht laiemas kaitselähenemises. Toores sisu skannitakse enne kasutamist, tööriistade õigused on vaikimisi piiratud ja tundlikud toimingud võivad nõuda kasutaja selget kinnitust – seda kõike lisaks olemasolevatele brauseri turvafunktsioonidele. Mitmekihiline kaitse võimaldab kasutajatel võtta kasutusele võimsad brauseriassistendid ilma turvalisust funktsionaalsuse vastu vahetamata.
Mis mõjutab rünnaku tõhusust?
BrowseSafe‑Benchi hindamistulemused näitavad selgeid mustreid. Otsesed rünnakud, näiteks assistendilt süsteemipäringu avaldamise või URL-i segmentide kaudu teabe väljatoomise palumine, on mudelite jaoks ühed lihtsamad tabada. Seevastu mitmekeelsed rünnakud ja kaudsete või hüpoteetiliste juhistena kirjutatud rünnakud on oluliselt keerulisemad, kuna need väldivad ilmseid märksõnu, millele paljud detektorid kaudselt tuginevad.
Paigutus on samuti oluline. Kommentaaridesse peidetud rünnakud tuvastatakse suhteliselt hästi, samas kui nähtavatesse jalustesse, tabeli lahtritesse või tekstisisestesse lõikudesse ümber kirjutatud versioonid osutuvad palju keerulisemateks, mis paljastab struktuurse eelarvamuse „peidetud“ süstimiste suhtes. Hoolikas treenimine hästi kujundatud näidetel võib mudelite võimet neid mustreid tuvastada märkimisväärselt parandada.
Looge BrowseSafe'i abil turvalisemaid agente
BrowseSafe ja BrowseSafe-Bench on täielikult avatud lähtekoodiga. Iga autonoomseid agente loov arendaja saab oma süsteemid kiirpäringu süstimise vastu koheselt vastupidavaks muuta – ohutuspiirdeid pole vaja nullist üles ehitada. Avatud kaaludega tuvastusmudel töötab kohapeal ja märgistab pahatahtlikud juhised enne, kui need jõuavad teie agendi põhiloogikani, olles piisavalt kiire, et skannida iga lehekülge kasutajaid aeglustamata.
Kasutage BrowseSafe-Benchi enam kui 14 000 reaalse maailma rünnakustsenaariumi, et testida oma mudeleid sassis HTML-lõksude vastu, mis standardseid LLM-e murravad. Meie tükeldus- ja paralleelskannimise tehnikad võimaldavad agentidel suuri, ebausaldusväärseid lehti tõhusalt töödelda – võimsad sirvimisvõimalused ilma kasutajaid ohtu seadmata. Lisateavet selle kohta, kuidas me BrowseSafe'i ja BrowseSafe-Benchi lõime, leiate Perplexity Researchi blogist.