Izgradnja sigurnijih AI preglednika s BrowseSafe-om

BrowseSafe je naš otvoreni model detekcije i referentni okvir za hvatanje zlonamjernih uputa skrivenih na web stranicama.

Danas predstavljamo BrowseSafe, otvoreni istraživački referentni okvir i model za otkrivanje sadržaja osmišljen kako bi korisnici bili sigurni dok pregledavaju agentni web.

Kako AI asistenti prelaze iz okvira za pretraživanje u sam preglednik, očekujemo da će se sljedeća generacija weba pomaknuti s stranica na agente: manje o tome gdje informacije borave, a više o tome tko ih dohvaća i djeluje na njih. Comet pretvara preglednik u mjesto na kojem asistent može obavljati zadatke, a ne samo odgovarati na pitanja, stoga je jedno načelo nepregovaračko: mora ostati na strani korisnika.

BrowseSafe: zaštita agenata i korisnika kroz skeniranje sadržaja u stvarnom vremenu

BrowseSafe je model za otkrivanje prilagođen za odgovaranje na jedno usmjereno pitanje: s obzirom na HTML stranice, sadrži li zlonamjerne upute usmjerene na agenta? Veliki općeniti modeli mogu dobro razmišljati o ovim slučajevima, ali su često prespori i skupi za pokretanje na svakoj stranici. BrowseSafe skenira cijele web stranice u stvarnom vremenu bez usporavanja preglednika. Također objavljujemo evaluacijski paket BrowseSafe‑Bench kao resurs za procjenu i poboljšanje učinkovitosti obrane.

Granice povjerenja i slojevite obrane

Međutim, nova generacija AI pregledavanja također znači novu generaciju prijetnji kibernetičkoj sigurnosti koje zahtijevaju nove pristupe održavanju sigurnosti korisnika. U ranijoj objavi prošli smo kroz način na koji Comet koristi višestruke slojeve zaštite kako bi asistent radio ono što je korisnik tražio, čak i kada ga web stranica pokuša zloupotrijebiti s injekcijom prompta. Danas se fokusiramo na to kako rješavamo taj problem: kako se te prijetnje definiraju, testiraju na napadima iz stvarnog svijeta i koriste za obuku specijaliziranih modela koji mogu brzo primijetiti i zaustaviti loše upute kako bi se sigurno pokrenuli u pregledniku.

Kako funkcionira injekcija prompta u pregledniku

Injekcija prompta je zlonamjerni jezik ugrađen u tekst koji AI čita, a koji je dizajniran da nadjača njegovu izvornu namjeru. U pregledniku agenti čitaju cijele stranice, tako da se napadi mogu sakriti na mjestima kao što su komentari, predlošci ili duga podnožja.

Napadači koriste ta mjesta kako bi ubacili upute koje tiho preusmjeravaju agenta. Budući da čita sve, uključujući sadržaj koji većina ljudi nikada ne primjećuje, te poruke mogu preoteti ponašanje bez snažnih zaštitnih mjera.

Ovi napadi često izbjegavaju očite fraze i mogu biti napisani uglađenim ili višejezičnim tekstom, ili smješteni u HTML elemente koji se nikada ne pojavljuju na ekranu, kao što su podatkovni atributi ili polja obrasca koje preglednici vizualno ne prikazuju, ali ih agenti ipak analiziraju.

BrowseSafe-Bench: unapređenje sigurnosti agenata u okruženjima stvarnog svijeta

Kako bismo proučili ove napade u okruženju koje nalikuje stvarnom webu, izgradili smo BrowseSafe, model za otkrivanje koji smo trenirali i otvorili izvorni kod, te BrowseSafe‑Bench, javni referentni okvir s 14.719 primjera koji oponašaju produkcijske stranice. Uključuje složeni HTML, šumni sadržaj i mješavinu zlonamjernih i bezopasnih uzoraka koji variraju duž tri osi: što napadač pokušava učiniti, gdje se uputa nalazi na stranici i kako je jezik napisan.

Referentni okvir uključuje 11 vrsta napada, devet strategija injektiranja koje se protežu od skrivenih polja do vidljivih odlomaka i podnožja, te tri jezična stila, od izričitih naredbi do neizravnog, kamufliranog teksta.

Pristup obrane u dubini

U našem modelu prijetnji, sam asistent živi u pouzdanom okruženju, ali sve što dolazi s weba je nepouzdano. Napadači mogu kontrolirati cijele stranice ili samo ubaciti sadržaj, kao što su opisi proizvoda, komentari i objave u inače benigne stranice koje asistent posjećuje. Kako bi se upravljalo tim rizikom, alati koji mogu vratiti nepouzdani sadržaj, kao što su web stranice, e-pošta ili datoteke, označeni su, a njihove sirove izlaze uvijek skenira BrowseSafe prije nego što ih agent može pročitati ili djelovati na njih.

BrowseSafe je jedan sloj u široj strategiji obrane. Sirovi sadržaj se skenira prije upotrebe, dopuštenja alata su prema zadanim postavkama ograničena, a osjetljive radnje mogu zahtijevati izričitu potvrdu korisnika, sve povrh postojećih sigurnosnih značajki preglednika. Obrana u dubini omogućuje korisnicima usvajanje moćnih pomoćnika za preglednik bez žrtvovanja sigurnosti radi mogućnosti.

Što utječe na učinkovitost napada?

Rezultati evaluacije na BrowseSafe‑Bench pokazuju jasne uzorke. Izravni napadi, poput traženja od agenta da otkrije svoj sistemski prompt ili iznese informacije putem dijelova URL-a, među najlakšima su za hvatanje modelima. Suprotno tome, višejezični napadi i oni napisani kao neizravne ili hipotetske upute znatno su teži jer izbjegavaju ocite ključne riječi na koje se mnogi detektori implicitno oslanjaju.

Smještaj je također važan. Napadi skriveni u komentarima otkrivaju se relativno dobro, dok se verzije prepisane u vidljiva podnožja, ćelije tablica ili unutrašnje odlomke pokazuju mnogo težima, otkrivajući strukturnu pristranost prema „skrivenim“ injekcijama. Pažljivo treniranje na dobro osmišljenim primjerima može značajno poboljšati sposobnost modela da prepoznaju ove uzorke.

Izgradite sigurnije agente s BrowseSafe-om

BrowseSafe i BrowseSafe-Bench u potpunosti su otvorenog koda. Svaki programer koji gradi autonomne agente može odmah ojačati svoje sustave protiv injekcija promptova—bez potrebe za gradnjom sigurnosnih ograda od nule. Model za otkrivanje s otvorenim težinama radi lokalno i označava zlonamjerne upute prije nego što dosegnu jezgru logike vašeg agenta, dovoljno brzo da skenira svaku stranicu bez usporavanja korisnika.

Upotrijebite više od 14.000 scenarija napada iz stvarnog svijeta BrowseSafe-Bench-a kako biste testirali otpornost vlastitih modela protiv neurednih HTML zamki koje ruše standardne LLM-ove. Naše tehnike dijeljenja i paralelne obrade omogućuju agentima učinkovitu obradu masivnih, nepouzdanih stranica—moćne mogućnosti pregledavanja bez izlaganja korisnika opasnosti.

Da biste saznali više o tome kako smo izgradili BrowseSafe i BrowseSafe-Bench, pogledajte blog Perplexity Researcha.