Создание более безопасных ИИ-браузеров с помощью BrowseSafe
BrowseSafe — это наша открытая модель обнаружения и бенчмарк для выявления вредоносных инструкций, скрытых на веб-страницах.

Сегодня мы выпускаем BrowseSafe — открытый исследовательский бенчмарк и модель обнаружения контента, предназначенные для обеспечения безопасности пользователей при работе в «агентной» сети.
По мере того как ИИ-ассистенты перемещаются из поисковых окон непосредственно в браузер, мы ожидаем, что следующее поколение интернета перейдет от страниц к агентам: суть будет не в том, где находится информация, а в том, кто ее извлекает и действует на ее основе. Comet превращает браузер в пространство, где ассистент может выполнять задачи, а не просто отвечать на вопросы, поэтому один принцип не подлежит обсуждению: он должен всегда оставаться на стороне пользователя.
BrowseSafe: защита агентов и пользователей посредством сканирования контента в режиме реального времени
BrowseSafe — это модель обнаружения, дообученная для ответа на один конкретный вопрос: содержит ли HTML-код страницы вредоносные инструкции, направленные против агента? Крупные модели общего назначения хорошо справляются с анализом таких случаев, но они часто работают слишком медленно и требуют больших ресурсов для сканирования каждой страницы. BrowseSafe сканирует целые веб-страницы в режиме реального времени, не замедляя работу браузера. Мы также выпускаем набор для оценки BrowseSafe-Bench в качестве ресурса для проверки и повышения эффективности защиты.
Границы доверия и эшелонированная защита
Однако новое поколение ИИ-браузеров означает и новое поколение киберугроз, требующих инновационных подходов к обеспечению безопасности пользователей. В предыдущей публикации мы рассказывали, как Comet использует многоуровневую защиту, чтобы ассистент продолжал выполнять запросы пользователя, даже когда веб-сайт пытается перехватить его с помощью prompt injection. Сегодня мы подробно рассмотрим, как мы решаем эту проблему: как определяются подобные угрозы, как они тестируются на реальных атаках и как используются для обучения специализированных моделей, способных быстро выявлять и блокировать опасные инструкции, чтобы обеспечить безопасность работы в браузере.
Как работает prompt injection в браузере
Prompt injection — это вредоносный язык, внедренный в текст, который считывает ИИ, предназначенный для переопределения его исходного намерения. В браузере агенты считывают страницы целиком, поэтому атаки могут скрываться в таких местах, как комментарии, шаблоны или длинные нижние колонтитулы.
Злоумышленники используют эти места для вставки инструкций, которые незаметно перенаправляют агента. Поскольку он считывает всё, включая контент, который большинство людей даже не замечают, такие сообщения могут подменять поведение без наличия строгих мер защиты.
Эти атаки часто избегают очевидных фраз, могут быть написаны на литературном или многоязычном языке, либо размещены в HTML-элементах, которые никогда не отображаются на экране, например, в атрибутах данных или полях форм, которые браузеры не отрисовывают визуально, но агенты всё равно обрабатывают.
BrowseSafe-Bench: повышение безопасности агентов в реальных условиях
Чтобы изучить эти атаки в условиях, приближенных к реальному интернету, мы создали BrowseSafe, модель обнаружения, которую мы обучили и открыли для общего доступа, и BrowseSafe-Bench — публичный бенчмарк из 14 719 примеров, имитирующих рабочие страницы. Он включает сложный HTML-код, зашумленный контент и смесь вредоносных и безопасных образцов, которые варьируются по трем осям: что пытается сделать злоумышленник, где инструкция расположена на странице и как написан текст.
Бенчмарк включает 11 типов атак, девять стратегий внедрения — от скрытых полей до видимых абзацев и нижних колонтитулов — и три лингвистических стиля: от явных команд до косвенного, замаскированного текста.
Эшелонированный подход к защите
В нашей модели угроз сам ассистент находится в доверенной среде, но всё, что поступает из интернета, является недоверенным. Злоумышленники могут контролировать целые сайты или просто внедрять контент, например описания товаров, комментарии и сообщения, на иначе доброкачественные страницы, которые посещает ассистент. Чтобы управлять этим риском, инструменты, которые могут возвращать недоверенный контент (такие как веб-страницы, электронные письма или файлы), помечаются, а их необработанные выходные данные всегда сканируются с помощью BrowseSafe, прежде чем агент сможет прочитать их или выполнить действия на их основе.
BrowseSafe является одним из уровней в более широком подходе к защите. Необработанный контент сканируется перед использованием, разрешения инструментов ограничены по умолчанию, а критические действия могут требовать явного подтверждения пользователя — всё это дополняет существующие функции безопасности браузера. Эшелонированная защита позволяет пользователям использовать мощные браузерные ассистенты, не жертвуя безопасностью ради функциональности.
Что влияет на эффективность атаки?
Результаты оценки на BrowseSafe-Bench показывают четкие закономерности. Прямые атаки, такие как просьба к агенту раскрыть свой системный промпт или извлечь информацию через сегменты URL, легче всего распознаются моделями. Напротив, многоязычные атаки и атаки, написанные как косвенные или гипотетические инструкции, значительно сложнее, так как они избегают очевидных ключевых слов, на которые часто неявно полагаются детекторы.
Размещение также имеет значение. Атаки, скрытые в комментариях, определяются относительно хорошо, тогда как версии, переписанные в видимые нижние колонтитулы, ячейки таблиц или встроенные абзацы, оказываются гораздо более сложными, что выявляет структурную предвзятость в сторону «скрытых» внедрений. Тщательное обучение на хорошо продуманных примерах может значительно улучшить способность моделей распознавать такие закономерности.
Создавайте более безопасных агентов с помощью BrowseSafe
BrowseSafe и BrowseSafe-Bench полностью открыты (open-source). Любой разработчик, создающий автономных агентов, может немедленно укрепить свои системы против prompt injection — нет необходимости создавать средства защиты с нуля. Модель обнаружения с открытыми весами работает локально и помечает вредоносные инструкции до того, как они достигнут основной логики вашего агента, достаточно быстро для сканирования каждой страницы без замедления работы для пользователей.
Используйте более 14 000 сценариев реальных атак из BrowseSafe-Bench для стресс-тестирования ваших собственных моделей против запутанных HTML-ловушек, которые выводят из строя стандартные LLM. Наши методы сегментирования и параллельного сканирования позволяют агентам эффективно обрабатывать массивные, недоверенные страницы — мощные возможности браузера без подвергания пользователей опасности. Чтобы узнать больше о том, как мы создали BrowseSafe и BrowseSafe-Bench, ознакомьтесь с блогом Perplexity Research.