Izgradnja sigurnijih veb pregledača uz BrowseSafe

BrowseSafe je naš otvoreni model detekcije i benchmark za hvatanje zlonamernih instrukcija sakrivenih u veb stranicama.

Danas objavljujemo BrowseSafe, otvoreni istraž B-bench-marking model i model za detekciju sadržaja čiji je cilj da zaštiti korisnike dok pretražuju veb sa agentima.

Kako se AI asistenti sele iz polja za pretragu u sam pregledač, očekujemo da će sledeća generacija veba preći sa stranica na agente: manje je važno gde se informacije nalaze, a više ko ih preuzima i deluje u skladu sa njima. Comet pretvara pregledač u mesto gde asistent može da obavlja zadatke, a ne samo da odgovara na pitanja, tako da je jedno načelo beskompromisno: mora ostati na strani korisnika.

BrowseSafe: zaštita agenata i korisnika kroz skeniranje sadržaja u realnom vremenu

BrowseSafe je model detekcije fino podešen da odgovori na jedno fokusirano pitanje: s obzirom na HTML stranice, da li sadrži zlonamerne instrukcije usmerene ka agentu? Veliki modeli opšte namene mogu dobro da obrazlože ove slučajeve, ali su često previše spori i skupi za pokretanje na svakoj stranici. BrowseSafe skenira cele veb stranice u realnom vremenu bez usporavanja pregledača. Takođe objavljujemo paket za evaluaciju BrowseSafe‑Bench kao resurs za procenu i poboljšanje efikasnosti odbrane.

Granice poverenja i slojevite odbrane

Međutim, nova generacija AI pretraživanja takođe znači i novu generaciju pretnji sajber bezbednosti koje zahtevaju nove pristupe održavanju bezbednosti korisnika. U ranijem postu smo prošli kroz način na koji Comet koristi više slojeva zaštite kako bi asistent radio ono što je korisnik tražio, čak i kada sajt pokuša da ga preotme sa prompt injection. Danas se fokusiramo na to kako se hvatamo u koštac sa tim problemom: kako se te pretnje definišu, testiraju na napadima iz stvarnog sveta i koriste za obuku specijalizovanih modela koji mogu brzo da prepoznaju i zaustave loše instrukcije kako bi se bezbedno pokretali u pregledaču.

Kako funkcioniše prompt injection u pregledaču

Prompt injection je zlonamerni jezik ugrađen u tekst koji AI čita a koji je dizajniran da poništi njegov prvobitni nameru. U pregledaču, agenti čitaju cele stranice, tako da napadi mogu da se sakriju na mestima kao što su komentari, šabloni ili duga podnožja.

Napadači koriste ta mesta da ubace instrukcije koje neprimetno preusmeravaju agenta. Pošto čita sve, uključujući sadržaj koji većina ljudi nikada ne primećuje, te poruke mogu da preotmu ponašanje bez jakih zaštitnih mera.

Ovi napadi često izbegavaju očigledne fraze i mogu biti napisani u uglađenom ili višejezičnom tekstu, ili postavljeni u HTML elemente koji se nikada ne pojavljuju na ekranu, kao što su atributi podataka ili polja forme koje pregledači ne prikazuju vidljivo, ali ih agenti i dalje analiziraju.

BrowseSafe-Bench: unapređenje bezbednosti agenata u okruženjima stvarnog sveta

Da bismo proučili ove napade u okruženju koje liči na pravi vev, izgradili smo BrowseSafe, model detekcije koji smo obučili i učinili open-source, i BrowseSafe‑Bench, javni benchmark od 14.719 primjera koji imitiraju stranice u proizvodnji. On uključuje kompleksan HTML, bučan sadržaj i mešavinu zlonamernih i bezopasnih uzoraka koji variraju duž tri ose: šta napadač pokušava da uradi, gde se instrukcija nalazi na stranici i kako je jezik napisan.

Benchmark uključuje 11 vrsta napada, devet strategija injektovanja u rasponu od skrivenih polja do vidljivih pasusa i podnožja, i tri lingvistička stila, od eksplicitnih komandi do indirektnog, maskiranog teksta.

Pristup odbrane u slojevima

U našem modelu pretnji, sam asistent živi u pouzdanom okruženju, ali sve što dolazi sa veba je nepouzdano. Napadači mogu da kontrolišu cele sajtove ili samo da ubace sadržaj, kao što su opisi proizvoda, komentari i objave u inače benignim stranicama koje asistent posećuje. Da bi se upravljalo tim rizikom, alatke koje mogu da vrate nepouzdani sadržaj, kao što su veb stranice, imejlovi ili datoteke, bivaju označene, a njihovi sirovi izlazi se uvek skeniraju od strane BrowseSafe-a pre nego što agent može da ih pročita ili da deluje u skladu sa njima.

BrowseSafe je jedan sloj u širem pristupu odbrani. Sirovi sadržaj se skenira pre upotrebe, dozvole alata su podrazumevano ograničene, a osetljive radnje mogu zahtevati eksplicitnu potvrdu korisnika, sve to povrh postojećih bezbednosnih funkcija pregledača. Odbrana u slojevima omogućava korisnicima da usvoje moćne asistente u pregledaču bez žrtvovanja bezbednosti zarad funkcionalnosti.

Šta utiče na efikasnost napada?

Rezultati evaluacije na BrowseSafe‑Bench pokazuju jasne obrasce. Direktan napad, poput traženja od agenta da otkrije svoj sistemski prompt ili da iznese informacije putem URL segmenata, spada u one koje modeli najlakše hvataju. Suprotno tome, višejezični napadi i oni napisani kao indirektne ili hipotetičke instrukcije znatno su teži, jer izbegavaju očigledne ključne reči na koje se mnogi detektori implicitno oslanjaju.

Položaj je takođe važan. Napadi skriveni u komentarima detektuju se relativno dobro, dok se verzije prepisane u vidljiva podnožja, ćelije tabela ili pasuse u tekstu pokazuju mnogo težim, otkrivajući strukturnu pristrasnost ka „skrivenim“ injektovanjima. Pažljiva obuka na dobro dizajniranim primerima može značajno poboljšati sposobnost modela da otkriju ove obrasce.

Izgradite sigurnije agente sa BrowseSafe

BrowseSafe i BrowseSafe-Bench su u potpunosti open-source. Svaki programer koji gradi autonomne agente može odmah da ojača svoje sisteme protiv prompt injection - nema potrebe da se bezbednosne ograde grade od nule. Model detekcije sa otvorenim tegovima radi lokalno i označava zlonamerne instrukcije pre nego što stignu do jezgra logike vašeg agenta, dovoljno brzo da skenira svaku stranicu bez usporavanja korisnika.

Koristite BrowseSafe-Bench-ovih 14.000+ scenarija napada iz stvarnog sveta da biste testirali sopstvene modele na neurednim HTML zamkama koje ruše standardne LLM-ove. Naše tehnike deljenja na delove i paralelno skeniranje omogućavaju agentima da efikasno obrađuju masivne, nepouzdane stranice - moćne mogućnosti pretraživanja bez izlaganja korisnika opasnosti. Da biste saznali više o tome kako smo izgradili BrowseSafe i BrowseSafe-Bench, pogledajte Perplexity Research blog.