Створення безпечніших браузерів зі штучним інтелектом завдяки BrowseSafe
BrowseSafe — це наша відкрита модель виявлення та бенчмарк для пошуку шкідливих інструкцій у вебсторінках.

Сьогодні ми випускаємо BrowseSafe — відкритий дослідницький бенчмарк і модель виявлення контенту, створені для захисту користувачів під час серфінгу в агентичному вебі.
Коли штучний інтелект переходить із пошукових рядків безпосередньо у браузер, ми очікуємо, що наступне покоління вебу перетвориться зі сторінок на агентів: менше значення матиме те, де зберігається інформація, і більше — хто її отримує та виконує дії з нею. Comet перетворює браузер на простір, де ассистент здатний виконувати завдання, а не лише відповідати на запитання, тому один із принципів є непорушним: він завжди залишається на боці користувача.
BrowseSafe: захист агентів і користувачів за допомогою сканування контенту в реальному часі
BrowseSafe — це модель виявлення, налаштована на одне конкретне питання: чи містить HTML-код сторінки шкідливі інструкції, спрямовані на агента? Великі універсальні моделі здатні добре аналізувати подібні випадки, проте вони занадто повільні та дорогі для запуску на кожній сторінці. BrowseSafe сканує цілі вебсторінки в реальному часі, не сповільнюючи роботу браузера. Ми також випускаємо набір оцінювання BrowseSafe‑Bench як ресурс для оцінки та підвищення ефективності захисту.
Межі довіри та багаторівневий захист
Проте нове покоління браузерів зі штучним інтелектом також означає появу нових загроз кібербезпеці, які потребують інноваційних підходів до захисту користувачів. У попередній публікації ми розповідали про те, як Comet використовує кілька рівнів захисту, щоб помічник продовжував виконувати запити користувача навіть тоді, коли вебсайт намагається перехопити його за допомогою впровадження підказок (prompt injection). Сьогодні ми детальніше розглянемо, як ми розв'язуємо цю проблему: як ці загрози визначаються, тестуються на реальних атаках і використовуються для навчання спеціалізованих моделей, здатних виявляти й зупиняти шкідливі інструкції достатньо швидко для безпечної роботи в браузері.
Як працює впровадження підказок у браузері
Впровадження підказок (prompt injection) — це шкідливий текст, вбудований у вміст, який читає штучний інтелект і який створено задля перевизначення його початкового призначення. У браузері агенти читають цілі сторінки, тому атаки можуть ховатися в таких місцях, як коментарі, шаблони або довгі нижні колонтитули.
Зловмисники використовують ці місця, щоб непомітно впровадити інструкції, які перенаправляють агента. Оскільки він читає все, зокрема й контент, який більшість людей ніколи не помічає, ці повідомлення можуть перехоплювати керування за відсутності потужних засобів захисту.
Такі атаки часто уникають очевидних фраз і можуть бути написані витонченим або багатомовним текстом чи розміщені в HTML-елементах, які ніколи не відображаються на екрані, наприклад у атрибутах даних або полях форм, які браузери візуально не рендерять, але агенти все одно парсять.
BrowseSafe-Bench: розвиток безпеки агентів у реальних умовах
Щоб вивчати ці атаки в середовищі, подібному до реального вебу, ми створили BrowseSafe — модель виявлення, яку ми навчили та відкрили для спільноти, а також BrowseSafe‑Bench — публічний бенчмарк із 14 719 прикладів, що імітують робочі сторінки. Він містить складний HTML, зашумлений контент, а також суміш шкідливих і нешкідливих зразків, які відрізняються за трьома осями: що намагається зробити зловмисник, де інструкція розташована на сторінці та як написаний текст.
Бенчмарк містить 11 типів атак, дев'ять стратегій ін'єкцій — від прихованих полів до видимих абзаців і нижніх колонтитулів, а також три лінгвістичні стилі, від прямих команд до непрямого замаскованого тексту.
Підхід глибокого ешелонованого захисту
У нашій моделі загроз сам асистент перебуває в довіреному середовищі, тоді як усе, що надходить із вебу, є недовіреним. Зловмисники можуть контролювати цілі сайти або лише впроваджувати контент, наприклад описи товарів, коментарі й дописи у звичайні сторінки, які відвідує асистент. Для керування цим ризиком інструменти, здатні повертати недовірений контент (як-от вебсторінки, електронні листи чи файли), позначаються мітками, а їхні необроблені результати завжди скануються за допомогою BrowseSafe перед тим, як агент зможе їх прочитати чи виконати дії з ними.
BrowseSafe є одним із рівнів ширшого підходу до захисту. Необроблений контент сканується перед використанням, дозволи інструментів за замовчуванням обмежені, а конфіденційні дії можуть вимагати явного підтвердження від користувача — і все це на додачу до наявних функцій безпеки браузера. Ешелонований захист дає змогу користувачам використовувати потужні браузерні асистенти без шкоди для безпеки заради функціональності.
Що впливає на ефективність атак?
Результати оцінювання на BrowseSafe‑Bench демонструють чіткі закономірності. Прямі атаки, як-от прохання до агента розкрити його системний промпт або вилучити інформацію через сегменти URL, є найпростішими для виявлення моделями. Натомість багатомовні атаки, а також атаки, написані як непрямі чи гіпотетичні інструкції, є значно складнішими, оскільки вони уникають очевидних ключових слів, на які неявно спираються багато детекторів.
Розташування також має значення. Атаки, сховані в коментарях, виявляються відносно добре, тоді як варіанти, переписані у видимі нижні колонтитули, клітинки таблиць або вбудовані абзаци, виявляються набагато складнішими, що свідчить про структурну упередженість щодо «прихованих» ін'єкцій. Ретельне навчання на якісно розроблених прикладах може суттєво покращити здатність моделей виявляти такі патерни.
Створюйте безпечніших агентів за допомогою BrowseSafe
BrowseSafe та BrowseSafe-Bench мають повністю відкритий код. Будь-який розробник, який створює автономних агентів, може негайно зміцнити свої системи проти впровадження підказок — без потреби створювати засоби захисту з нуля. Модель виявлення з відкритими вагами працює локально та позначає шкідливі інструкції ще до того, як вони досягнуть основної логіки вашого агента, достатньо швидко, щоб сканувати кожну сторінку без уповільнення роботи користувачів.
Використовуйте понад 14 000 сценаріїв реальних атак із BrowseSafe-Bench для стрес-тестування власних моделей проти складних HTML-пасток, які виводять з ладу стандартні LLM. Наші методи розбиття на фрагменти (chunking) і паралельного сканування дають агентам змогу ефективно обробляти масивні недовірені сторінки — потужні можливості серфінгу без піддавання користувачів небезпеці.
Щоб дізнатися більше про те, як ми створили BrowseSafe та BrowseSafe-Bench, перегляньте блог Perplexity Research.