BrowseSafe көмегімен қауіпсіз ЖИ браузерлерін жасау

BrowseSafe – бұл веб-беттерде жасырылған зиянды нұсқауларды анықтауға арналған біздің ашық анықтау моделіміз және стандартымыз.

Бүгін біз агенттік вебті шолу кезінде пайдаланушылардың қауіпсіздігін қамтамасыз етуге бағытталған ашық зерттеу стандарты мен контентті анықтау моделі BrowseSafe жүйесін шығарамыз.

Жасанды интеллект көмекшілері іздеу жолақтарынан браузердің өзіне ауысқан сайын, біз вебтің келесі буыны беттерден агенттерге ауысады деп күтеміз: бұл ақпараттың қай жерде орналасқанына емес, оны кім алатынына және соған сәйкес әрекет ететініне көбірек қатысты. Comet браузерді көмекші тек сұрақтарға жауап беріп қана қоймай, тапсырмаларды орындай алатын орынға айналдырады, сондықтан бір қағидат өзгеріссіз қалады: ол әрқашан пайдаланушының жағында болуы тиіс.

BrowseSafe: контентті нақты уақыт режимінде сканерлеу арқылы агенттер мен пайдаланушыларды қорғау

BrowseSafe – бұл бір ғана маңызды сұраққа жауап беру үшін арнайы бапталған анықтау моделі: веб-беттің HTML кодында агентке бағытталған қасақана нұсқаулар бар ма? Үлкен жалпы мақсаттағы модельдер бұл жағдайларды жақсы түсіне алады, бірақ олар әр бетте жұмыс істеу үшін тым баяу және қымбат. BrowseSafe браузердің жұмысын бәсеңдетпей, толық веб-беттерді нақты уақыт режимінде сканерлейді. Сондай-ақ қорғаныс тиімділігін бағалау және жақсарту ресурсы ретінде BrowseSafe‑Bench бағалау жинағын шығарып жатырмыз.

Сенім шекаралары және көп деңгейлі қорғаныс

Дегенмен, Жасанды интеллект браузерлерінің жаңа буыны пайдаланушылардың қауіпсіздігін сақтау үшін жаңа тәсілдерді талап ететін киберқауіпсіздік қауіптерінің жаңа буынын білдіреді. Бұрынғы жазбамызда біз Comet веб-сайт промпт инъекциясымен көмекшіні басқа бағытқа бұруға тырысса да, оның пайдаланушының сұрағанын орындауын қамтамасыз ету үшін бірнеше қорғаныс қабаттарын қалай пайдаланатынын қарастырдық. Бүгін біз бұл мәселені қалай шешетінімізге тоқталамыз: бұл қауіптер қалай анықталады, шынайы шабуылдарға қарсы қалай сынақтан өтеді және браузерде қауіпсіз жұмыс істеу үшін нашар нұсқауларды жылдам анықтап, тоқтата алатын арнайы модельдерді үйрету үшін қалай қолданылады.

Браузердегі промпт инъекциясы қалай жұмыс істейді

Промпт инъекциясы – бұл Жасанды интеллект оқитын мәтінге енгізілген, оның түпкілікті мақсатын өзгертуге арналған зиянды тіл. Браузерде агенттер бүкіл беттерді оқиды, сондықтан шабуылдар пікірлер, үлгілер немесе ұзақ колонтитулдар сияқты жерлерде жасырынуы мүмкін.

Шабуылдаушылар агентті байқатпай бағытты өзгертуге мәжбүрлейтін нұсқауларды енгізу үшін осындай орындарды пайдаланады. Ол барлығын, соның ішінде көптеген адамдар байқамайтын мазмұнды да оқитындықтан, бұл хабарлар мықты қорғаныс болмаса, мінез-құлықты бұрмалауы мүмкін.

Бұл шабуылдар көбінесе айқын сөз тіркестерінен аулақ болады және жылтыр немесе көптілді мәтінмен жазылуы мүмкін немесе браузерлер визуалды түрде көрсетпейтін, бірақ агенттер талдай беретін деректер атрибуттары немесе пішін өрістері сияқты экранда ешқашан көрінбейтін HTML элементтеріне орналастырылуы мүмкін.

BrowseSafe-Bench: шынайы ортада агент қауіпсіздігін жетілдіру

Бұл шабуылдарды нақты вебке ұқсайтын ортада зерттеу үшін біз өзіміз оқытқан және ашық кодты етіп шығарған BrowseSafe анықтау моделін және өндірістік беттерге еліктейтін 14 719 мысалдан тұратын жалпыға қолжетімді BrowseSafe‑Bench стандарын жасадық. Оған күрделі HTML, шулы мазмұн және үш ось бойынша өзгеретін зиянды және зиянсыз үлгілердің қоспасы кіреді: шабуылдаушының не істегісі келетіні, нұсқаудың беттің қай жерінде орналасқаны және тілдің қалай жазылғаны.

Бұл стандартқа шабуылдың 11 түрі, жасырын өрістерден көрінетін абзацтар мен колонтитулдарға дейінгі тоғыз инъекция стратегиясы және нақты пәрмендерден бастап жанама, маскировкаланған мәтінге дейінгі үш лингвистикалық стиль кіреді.

Тереңдетілген қорғаныс тәсілі

Біздің қауіптер моделімізде көмекçінің өзі сенімді ортада жұмыс істейді, бірақ вебтен келетін кез келген нәрсе сенімсіз болып табылады. Шабуылдаушылар бүкіл сайттарды басқаруы мүмкін немесе агент кіретін басқа жағдайда қауіпсіз беттерге өнім сипаттамаларын, пікірлер және жазбалар сияқты контентті енгізе алады. Бұл тәуекелді басқару үшін веб-беттер, электрондық хаттар немесе файлдар сияқты сенімсіз контентті қайтара алатын құралдар белгіленеді, ал олардың шикі нәтижелерін агент оқымас немесе олар бойынша әрекет етпес бұрын BrowseSafe әрқашан сканерлейді.

BrowseSafe – бұл кеңірек қорғаныс тәсілінің бір қабаты. Шикі мазмұн пайдаланылар алдында сканерленеді, құрал рұқсаттары әдепкі бойынша шектеледі, ал сезімтал әрекеттер қолданыстағы браузер қауіпсіздік мүмкіндіктеріне қосымша түрде пайдаланушының нақты растауын талап етуі мүмкін. Тереңдетілген қорғаныс пайдаланушыларға қауіпсіздікті мүмкіндіктер үшін құрбан етпей, қуатты браузер көмекшілерін пайдалануға мүмкіндік береді.

Шабуылдың тиімділігіне не әсер етеді?

BrowseSafe‑Bench бойынша бағалау нәтижелері анық үлгілерді көрсетеді. Агенттен жүйелік промптін ашуды немесе URL сегменттері арқылы ақпаратты шығарып алуды сұрау сияқты тікелей шабуылдар модельдер үшін анықтау ең оңай шабуылдар қатарына жатады. Керісінше, көптілді шабуылдар және жанама немесе гипотетикалық нұсқаулар ретінде жазылған шабуылдар әлдеқайда күрделі, өйткені олар көптеген детекторлар жасырын түрде сүйенетін анық түйінді сөздерден аулақ болады.

Орналасуы да маңызды. Пікірлерде жасырылған шабуылдар салыстырмалы түрде жақсы анықталады, ал көрінетін колонтитулдарға, кесте ұяшықтарына немесе мәтін ішіндегі абзацтарға қайта жазылған нұсқалар әлдеқайда қиын екенін көрсетеді, бұл «жасырын» инъекцияларға қатысты құрылымдық бейімділікті көрсетіді. Жақсы жобаланған үлгілер бойынша мұқият оқыту модельдердің осы үлгілерді анықтау мүмкіндігін айтарлықтай жақсарта алады.

BrowseSafe көмегімен қауіпсіз агенттер жасаңыз

BrowseSafe және BrowseSafe-Bench толығымен ашық кодты. Автономды агенттерді құратын кез келген әзірлеуші қорғаныс жүйелерін промпт инъекциясынан дереу қорғай алады – қауіпсіздік рельстерін нөлден жасаудың қажеті жоқ. Ашық салмақты анықтау моделі жергілікті түрде жұмыс істейді және пайдаланушыларды баяулатпастан әрбір бетті сканерлеуге жеткілікті жылдамдықпен, зиянды нұсқаулар агентіңіздің негізгі логикасына жетпей тұрып белгілейді.

Стандартты LLM модельдерін бұзатын қате HTML ловушкаларына қарсы өзіңіздің модельдеріңізді сынау үшін BrowseSafe-Bench жүйесінің 14 000-нан астам шынайы шабуыл сценарийлерін пайдаланыңыз. Біздің чанктерге бөлу және параллель сканерлеу әдістеріміз агенттерге пайдаланушыларды қауіпке ұшыратпастан, қуатты шолу мүмкіндіктерін пайдалана отырып, үлкен, сенімсіз беттерді тиімді өңдеуге мүмкіндік береді.

BrowseSafe және BrowseSafe-Bench қалай жасалғаны туралы көбірек білу үшін Perplexity Research блогын қараңыз.