Construirea de browsere AI mai sigure cu BrowseSafe
BrowseSafe este modelul și benchmark-ul nostru de detecție deschis pentru capturarea instrucțiunilor malițioase ascunse în paginile web.

Astăzi lansăm BrowseSafe, un benchmark de cercetare deschis și un model de detectare a conținutului care au drept scop menținerea siguranței utilizatorilor în timp ce navighează pe webul bazat pe agenți.
Pe măsură ce asistenții AI trec de la casetele de căutare chiar în browser, ne așteptăm ca următoarea generație a webului să treacă de la pagini la agenți: mai puțin despre locul unde se află informațiile și mai mult despre cine le preia și acționează pe baza lor. Comet transformă browserul într-un loc în care un asistent poate duce la bun sfârșit sarcini, nu doar să răspundă la întrebări, așa că un principiu este nenegociabil: trebuie să rămână de partea utilizatorului.
BrowseSafe: protejarea agenților și a utilizatorilor prin scanarea conținutului în timp real
BrowseSafe este un model de detecție finisat pentru a răspunde la o singură întrebare precisă: având în vedere codul HTML al unei pagini, conține acesta instrucțiuni malitioase îndreptate spre agent? Modelele mari de uz general pot rationa bine în aceste cazuri, dar sunt adesea prea lente și scumpe pentru a rula pe fiecare pagină. BrowseSafe scanează pagini web complete în timp real fără a încetini browserul. De asemenea, lansăm suita de evaluare BrowseSafe‑Bench ca resursă pentru evaluarea și îmbunătățirea eficacității apărării.
Limite de încredere și apărări stratificate
Cu toate acestea, o nouă generație de navigare cu AI înseamnă, de asemenea, o nouă generație de amenințări la adresa securității cibernetice care necesită abordări inovatoare pentru menținerea siguranței utilizatorilor. Într-o postare anterioară, am trecut în revistă modul în care Comet utilizează mai multe niveluri de protecție pentru a menține asistentul să facă ceea ce a cerut utilizatorul, chiar și atunci când un site web încearcă să îl deturneze cu prompt injection. Astăzi ne concentrăm asupra modului în care abordăm această problemă: cum sunt definite aceste amenințări, testate împotriva atacurilor din lumea reală și folosite pentru antrenarea modelelor specializate care pot depista și opri instrucțiunile dăunătoare suficient de rapid pentru a rula în siguranță în browser.
Cum funcționează injectarea de prompturi în browser
Injectarea de prompturi reprezintă limbaj malițios încorporat în textul citit de AI, conceput pentru a anula intenția sa originală. În browser, agenții citesc pagini întregi, astfel încât atacurile se pot ascunde în locuri precum comentarii, șabloane sau subsoluri lungi.
Atacatorii folosesc acele locuri pentru a strecura instrucțiuni care redirecționează discret agentul. Deoarece citește totul, inclusiv conținutul pe care majoritatea oamenilor nu îl observă niciodată, acele mesaje pot deturna comportamentul fără garanții puternice.
Aceste atacuri evită adesea frazele evidente și pot fi scrise într-un text finisat sau multilingv, ori plasate în elemente HTML care nu apar niciodată pe ecran, cum ar fi atribute de date sau câmpuri de formular pe care browserele nu le afișează vizibil, dar pe care agenții le analizează totuși.
BrowseSafe-Bench: avansarea securității agenților în medii din lumea reală
Pentru a studia aceste atacuri într-un cadru care seamănă cu webul real, am construit BrowseSafe, un model de detecție pe care l-am antrenat și l-am făcut open-source, și BrowseSafe‑Bench, un benchmark public cu 14.719 exemple care imită paginile de producție. Acesta include HTML complex, conținut cu zgomot și o combinație de eșantioane malițioase și inofensive care variază de-a lungul a trei axe: ce încearcă să facă atacatorul, unde se află instrucțiunea în pagină și cum este scris limbajul.
Benchmark-ul include 11 tipuri de atac, nouă strategii de injectare care variază de la câmpuri ascunse la paragrafe și subsoluri vizibile și trei stiluri lingvistice, de la comenzi explicite la text indirect, camuflat.
O abordare de apărare în profunzime
În modelul nostru de amenințări, asistentul însuși trăiește într-un mediu de încredere, dar tot ceea ce provine de pe web nu este de încredere. Atacatorii pot controla site-uri întregi sau pot doar injecta conținut, cum ar fi descrieri de produse, comentarii și postări în pagini altfel benigne pe care le vizitează asistentul. Pentru a gestiona acest risc, instrumentele care pot returna conținut care nu este de încredere, cum ar fi pagini web, e-mailuri sau fișiere, sunt marcate, iar rezultatele lor brute sunt întotdeauna scanate de BrowseSafe înainte ca agentul să le poată citi sau să acționeze pe baza lor.
BrowseSafe este un strat într-o abordare de apărare mai amplă. Conținutul brut este scanat înainte de utilizare, permisiunile instrumentelor sunt limitate în mod implicit, iar acțiunile sensibile pot necesita confirmarea explicită a utilizatorului, totul pe lângă funcțiile de securitate existente ale browserului. Apărarea în profunzime le permite utilizatorilor să adopte asistenți de browser puternici fără a sacrifica siguranța pentru capabilitate.
Ce influențează eficacitatea atacului?
Rezultatele evaluării pe BrowseSafe‑Bench arată modele clare. Atacurile directe, cum ar fi solicitarea ca agentul să își dezvăluie promptul de sistem sau să exfiltreze informații prin segmente URL, se numără printre cele mai ușor de capturat de către modele. În schimb, atacurile multilingve și cele scrise ca instrucțiuni indirecte sau ipotetice sunt semnificativ mai dificile, deoarece evită cuvintele cheie evidente pe care mulți detectori se bazează implicit.
Amplasarea contează de asemenea. Atacurile ascunse în comentarii sunt detectate relativ bine, în timp ce versiunile rescrise în subsoluri vizibile, celule de tabele sau paragrafe inline se dovedesc a fi mult mai dificile, dezvăluind o prejudecată structurală față de injectările „ascunse”. Antrenamentul atent pe exemple bine concepute poate îmbunătăți semnificativ capacitatea modelelor de a detecta aceste modele.
Construiește agenți mai siguri cu BrowseSafe
BrowseSafe și BrowseSafe-Bench sunt complet open-source. Orice dezoltator care construiește agenți autonomi își poate întări imediat sistemele împotriva injectării de prompturi — fără a fi nevoie să construiască bări de siguranță de la zero. Modelul de detecție cu greutăți deschise rulează local și marchează instrucțiunile malițioase înainte ca acestea să ajungă la logica de bază a agentului, suficient de rapid pentru a scana fiecare pagină fără a încetini utilizatorii.
Folosește cele peste 14.000 de scenarii de atac din lumea reală ale BrowseSafe-Bench pentru a testa sub stres propriile modele împotriva capcanelor HTML dezordonate care sparg modelele LLM standard. Tehnicile noastre de chunking și scanare paralelă le permit agenților să proceseze pagini masive, care nu sunt de încredere, în mod eficient — capabilități de navigare puternice fără a expune utilizatorii la pericol. Pentru a afla mai multe despre cum am construit BrowseSafe și BrowseSafe-Bench, consultă blogul Perplexity Research.