Creació de navegadors d'IA més segurs amb BrowseSafe

BrowseSafe és el nostre model de detecció obert i punt de referència per detectar instruccions malicioses amagades a les pàgines web.

Avui llancem BrowseSafe, un punt de referència de recerca obert i un model de detecció de contingut dissenyat per protegir els usuaris mentre naveguen pel web d'agents.

A mesura que els assistents d'IA passen de les caixes de cerca al propi navegador, esperem que la propera generació del web passi de les pàgines als agents: menys on viu la informació i més sobre qui la recupera i actua. Comet converteix el navegador en un lloc on un assistent pot dur a terme tasques, no només respondre preguntes, de manera que un principi és innegociable: s'ha de mantenir del costat de l'usuari.

BrowseSafe: protegir agents i usuaris mitjançant l'escaneig de contingut en temps real

BrowseSafe és un model de detecció optimitzat per respondre una única pregunta centrada: donat l'HTML d'una pàgina, conté instruccions malicioses adreçades a l'agent? Els grans models de propòsit general poden raonar bé sobre aquests casos, però sovint són massa lent i cars per executar-se a cada pàgina. BrowseSafe analitza pàgines web senceres en temps real sense alentir el navegador. També estem llançant el paquet d'avaluació BrowseSafe‑Bench com a recurs per avaluar i millorar l'eficàcia de la defensa.

Límits de confiança i defenses per capes

Tanmateix, una nova generació de navegació per IA també significa una nova generació d'amenaces de ciberseguretat que requereixen enfocaments nous per mantenir els usuaris segurs. En una publicació anterior, vam analitzar com Comet utilitza múltiples capes de protecció per mantenir l'assistent fent el que l'usuari va demanar, fins i tot quan un lloc web intenta segrestar-lo amb injecció d'indicacions. Avui ens centrem en com abordem aquest problema: com es defineixen aquestes amenaces, es proven contra atacs del món real i s'utilitzen per entrenar models especialitzats que poden detectar i aturar instruccions dolentes amb prou rapidesa per funcionar amb seguretat al navegador.

Com funciona la injecció d'indicacions del navegador

La injecció d'indicacions és un llenguatge maliciós incrustat al text que llegeix la IA i que està dissenyat per anul·lar la seva intenció original. Al navegador, els agents llegeixen pàgines senceres, de manera que els atacs es poden amagar en llocs com comentaris, plantilles o peus de pàgina llargs.

Els atacants utilitzen aquests llocs per colar instruccions que redirigeixen silenciosament l'agent. Com que ho llegeix tot, inclòs el contingut que la majoria de la gent no nota mai, aquests missatges poden segrestar el comportament sense mesures de seguretat sòlides.

Aquests atacs sovint eviten frases òbvies i es poden escriure en text polit o multilingüe, o col·locar-se en elements HTML que mai apareixen a la pantalla, com ara atributs de dades o camps de formulari que els navegadors no representen de manera visible però que els agents encara analitzen.

BrowseSafe-Bench: avançant en la seguretat dels agents en entorns del món real

Per estudiar aquests atacs en un entorn que s'assembli al web real, vam construir BrowseSafe, un model de detecció que vam entrenar i de codi obert, i BrowseSafe‑Bench, un punt de referència públic de 14.719 exemples que imiten pàgines de producció. Inclou HTML complex, contingut amb soroll i una barreja de mostres malicioses i innòcues que varien al llarg de tres eixos: què intenta fer l'atacant, on es troba la instrucció a la pàgina i com s'escriu el llenguatge.

El punt de referència inclou 11 tipus d'atacs, nou estratègies d'injecció que abasten des de camps ocults fins a paràgrafs i peus de pàgina visibles, i tres estils lingüístics, des de ordres explícites fins a text indirecte i camuflat.

Un enfocament de defensa en profunditat

En el nostre model d'amenaces, l'assistent en si viu en un entorn de confiança, però tot el que prové del web no és de confiança. Els atacants poden controlar llocs sencers o simplement injectar contingut, com ara descripcions de productes, comentaris i publicacions en pàgines si no benignes que visita l'assistent. Per gestionar aquest risc, les eines que poden retornar contingut no de confiança, com ara pàgines web, correus electrònics o fitxers, estan marcades i les seves sortides sense processar sempre són analitzades per BrowseSafe abans que l'agent pugui llegir-les o actuar-hi.

BrowseSafe és una capa d'un enfocament de defensa més ampli. El contingut sense processar s'escaneja abans del seu ús, els permisos d'eines estan limitats per defecte i les accions sensibles poden requerir una confirmació explícita de l'usuari, tot a més de les funcions de seguretat del navegador existents. La defensa en profunditat permet als usuaris adoptar potents assistents de navegador sense canviar la seguretat per la capacitat.

Què influeix en l'eficàcia de l'atac?

Els resultats de l'avaluació a BrowseSafe‑Bench mostren patrons clars. Els atacs directes, com ara demanar a l'assistent que reveli el seu missatge del sistema o exfiltri informació mitjançant segments d'URL, es troben entre els més fàcils de detectar per als models. En canvi, els atacs multilingües i els escrits com a instruccions indirectes o hipotètiques són significativament més difícils, perquè eviten les paraules clau òbvies de les quals molts detectors depenen implícitament.

La ubicació també importa. Els atacs amagats als comentaris es detecten relativament bé, mentre que les versions reescrites en peus de pàgina visibles, cel·les de taules o paràgrafs en línia resulten molt més difícils, revelant un biaix estructural cap a les injeccions "ocultes". Un entrenament acurat en exemples ben dissenyats pot millorar significativament la capacitat dels models per detectar aquests patrons.

Crea agents més segurs amb BrowseSafe

BrowseSafe i BrowseSafe-Bench són completament de codi obert. Qualsevol desenvolupador que creï agents autònoms pot reforçar immediatament els seus sistemes contra la injecció d'indicacions, sense necessitat de construir baranes de seguretat des de zero. El model de detecció de pes obert s'executa localment i marca les instruccions malicioses abans que arribin a la lògica central del vostre agent, prou ràpid com per escanejar cada pàgina sense alentir els usuaris.

Utilitzeu els més de 14.000 escenaris d'atac del món real de BrowseSafe-Bench per provar d'estrès els vostres propis models contra les trampes HTML desordenades que trenquen els LLM estàndard. Les nostres tècniques de segmentació i escaneig paral·lel permeten als agents processar pàgines massives i no de confiança de manera eficient, capacitats de navegació potents sense exposar els usuaris al perill.

Per obtenir més informació sobre com hem creat BrowseSafe i BrowseSafe-Bench, consulteu el blog de Perplexity Research.