Construyendo navegadores de IA más seguros con BrowseSafe

BrowseSafe es nuestro modelo de detección abierto y benchmark para detectar instrucciones maliciosas ocultas en páginas web.

Hoy presentamos BrowseSafe, un modelo de detección de contenido y benchmark de investigación abierto cuyo objetivo es mantener la seguridad de los usuarios mientras navegan por la web agentica.

A medida que los asistentes de IA se desplazan de los cuadros de búsqueda al propio navegador, esperamos que la próxima generación de la web pase de páginas a agentes: menos centrado en dónde reside la información y más en quién la recupera y actúa sobre ella. Comet convierte el navegador en un lugar donde un asistente puede realizar tareas, no solo responder preguntas, por lo que un principio no es negociable: debe permanecer del lado del usuario.

BrowseSafe: protección de agentes y usuarios mediante el escaneo de contenido en tiempo real

BrowseSafe es un modelo de detección ajustado para responder a una única pregunta central: dado el HTML de una página, ¿contiene instrucciones maliciosas dirigidas al agente? Los grandes modelos de propósito general pueden razonar bien sobre estos casos, pero a menudo son demasiado lentos y costosos para ejecutarlos en cada página. BrowseSafe escanea páginas web completas en tiempo real sin ralentizar el navegador. También lanzamos la suite de evaluación BrowseSafe-Bench como recurso para evaluar y mejorar la eficacia de la defensa.

Límites de confianza y defensas por capas

Sin embargo, una nueva generación de navegación con IA también significa una nueva generación de amenazas de ciberseguridad que requieren enfoques novedosos para mantener la seguridad de los usuarios. En una publicación anterior, explicamos cómo Comet utiliza múltiples capas de protección para mantener al asistente haciendo lo que el usuario solicitó, incluso cuando un sitio web intenta secuestrarlo con inyección de prompts. Hoy nos centramos en cómo abordamos ese problema: cómo se definen esas amenazas, se prueban frente a ataques del mundo real y se utilizan para entrenar modelos especializados que puedan detectar y detener instrucciones maliciosas con la suficiente rapidez para ejecutarse de forma segura en el navegador.

Cómo funciona la inyección de prompts en el navegador

La inyección de prompts es un lenguaje malicioso incrustado en el texto que lee la IA, diseñado para anular su intención original. En el navegador, los agentes leen páginas completas, por lo que los ataques pueden esconderse en lugares como comentarios, plantillas o pies de página largos.

Los atacantes utilizan esos puntos para introducir instrucciones que redirigen silenciosamente al agente. Debido a que lee todo, incluido el contenido que la mayoría de las personas nunca nota, esos mensajes pueden secuestrar el comportamiento sin salvaguardas sólidas.

Estos ataques a menudo evitan frases obvias y pueden escribirse en texto pulido o multilingüe, o colocarse en elementos HTML que nunca aparecen en pantalla, como atributos de datos o campos de formulario que los navegadores no representan visiblemente pero que los agentes aún analizan.

BrowseSafe-Bench: avanzando en la seguridad de los agentes en entornos del mundo real

Para estudiar estos ataques en un entorno que se parece a la web real, creamos BrowseSafe, un modelo de detección que entrenamos y abrimos al público, y BrowseSafe‑Bench, un benchmark público de 14,719 ejemplos que imitan páginas de producción. Incluye HTML complejo, contenido ruidoso y una combinación de muestras maliciosas y benignas que varían a lo largo de tres ejes: qué intenta hacer el atacante, dónde se encuentra la instrucción en la página y cómo está escrito el lenguaje.

El benchmark incluye 11 tipos de ataques, nueve estrategias de inyección que abarcan desde campos ocultos hasta párrafos y pies de página visibles, y tres estilos lingüísticos, desde comandos explícitos hasta texto indirecto y camuflado.

Un enfoque de defensa en profundidad

En nuestro modelo de amenazas, el asistente mismo vive en un entorno confiable, pero todo lo que proviene de la web no es confiable. Los atacantes pueden controlar sitios completos o simplemente inyectar contenido, como descripciones de productos, comentarios y publicaciones en páginas que, de otro modo, serían benignas y que el asistente visita. Para gestionar ese riesgo, las herramientas que pueden devolver contenido no confiable, como páginas web, correos electrónicos o archivos, se marcan, y sus resultados sin procesar siempre son escaneados por BrowseSafe antes de que el agente pueda leerlos o actuar sobre ellos.

BrowseSafe es una capa en un enfoque de defensa más amplio. El contenido sin procesar se escanea antes de su uso, los permisos de las herramientas están limitados de forma predeterminada y las acciones confidenciales pueden requerir una confirmación explícita del usuario, todo ello además de las funciones de seguridad del navegador existentes. La defensa en profundidad permite a los usuarios adoptar potentes asistentes de navegador sin cambiar la seguridad por capacidad.

¿Qué influye en la eficacia del ataque?

Los resultados de la evaluación en BrowseSafe-Bench muestran patrones claros. Los ataques directos, como pedirle al agente que revele su prompt del sistema o que exfiltre información a través de segmentos de URL, se encuentran entre los más fáciles de detectar para los modelos. Por el contrario, los ataques multilingües y aquellos escritos como instrucciones indirectas o hipotéticas son significativamente más difíciles, porque evitan las palabras clave obvias en las que muchos detectores dependen implícitamente.

La ubicación también importa. Los ataques ocultos en los comentarios se detectan relativamente bien, mientras que las versiones reescritas en pies de página visibles, celdas de tabla o párrafos en línea resultan mucho más difíciles, lo que revela un sesgo estructural hacia las inyecciones “ocultas”. Un entrenamiento cuidadoso con ejemplos bien diseñados puede mejorar significativamente la capacidad de los modelos para detectar estos patrones.

Cree agentes más seguros con BrowseSafe

BrowseSafe y BrowseSafe-Bench son completamente de código abierto. Cualquier desarrollador que cree agentes autónomos puede proteger inmediatamente sus sistemas contra la inyección de prompts: no es necesario crear barreras de seguridad desde cero. El modelo de detección de pesos abiertos se ejecuta localmente y marca las instrucciones maliciosas antes de que lleguen a la lógica central de su agente, lo suficientemente rápido como para escanear cada página sin ralentizar a los usuarios.

Utilice los más de 14,000 escenarios de ataque del mundo real de BrowseSafe-Bench para someter a prueba sus propios modelos contra las complicadas trampas HTML que rompen los LLM estándar. Nuestras técnicas de fragmentación y escaneo paralelo permiten a los agentes procesar páginas masivas y no confiables de manera eficiente: capacidades de navegación potentes sin exponer a los usuarios al peligro. Para obtener más información sobre cómo construimos BrowseSafe y BrowseSafe-Bench, consulte el blog de investigación de Perplexity.