Изградња сигурнијих АИ прегледача уз BrowseSafe
BrowseSafe је наш отворени модел детекције и референтни тест за hvatanje злонамерних упутстава скривених у веб страницама.

Данас објављујемо BrowseSafe, отворени референтни тест и модел за детекцију садржаја који има за циљ да заштити кориснике док серфују агентичким вебом.
Како се АИ асистенти померају из поља за претрагу у сам прегледач, очекујемо да ће се следећа генерација веба пребацити са страница на агенте: мање је важно где информације живе, а више ко их довлачи и поступа по њима. Comet претвара прегледачник у место где асистент може да извршава задатке, а не само да одговара на питања, тако да је један принцип не преговарачки: мора да остане на страни корисника.
BrowseSafe: заштита агената и корисника путем скенирања садржаја у реалном времену
BrowseSafe је модел детекције фино подешен да одговори на једно фокусирано питање: с обзиром на ХТМЛ странице, да ли она садржи злонамерна упутства усмерена на агента? Велики модели опште намене могу добро да размишљају о овим случајевима, али су често преспори и скупи за покретање на свакој страници. BrowseSafe скенира целе веб странице у реалном времену без успоравања прегледача. Такође објављујемо и BrowseSafe‑Bench пакет за евалуацију као ресурс за процену и побољшање ефикасности одбране.
Границе поверења и слојевите одбране
Међутим, нова генерација АИ прегледања такође значи и нову генерацију сајбер-безбедносних претњи које захтевају нове приступе одржавању сигурности корисника. У претходном тексту смо прошли кроз то како Comet користи више слојева заштите како би асистент радио оно што је корисник тражио, чак и када веб-сајт покушава да га хијерархијски преузме помоћу инјектовања упутстава. Данас се фокусирамо на то како решавамо тај проблем: како се те претње дефинишу, тестирају на нападима из стварног света и користе за обуку специјализованих модела који могу да уоче и зауставе лоша упутства довољно брзо да се безбедно извршавају у прегледачу.
Како функционише инјектовање упутстава у прегледачу
Инјектовање упутстава је злонамерни језик уграђен у текст који вештачка интелигенција чита, а који је дизајниран да поништи њен оригинални намерни циљ. У прегледачу, агенти читају целе странице, тако да се напади могу сакрити на местима као што су коментари, шаблони или дуга подножја.
Нападачи користе та места да увуку упутства која тихо преусмеравају агента. Пошто чита све, укључујући и садржај који већина људи никада не примећује, те поруке могу да преузму понашање без јаких заштитних мера.
Ови напади често избегавају очигледне фразе и могу бити написани у углађеном или вишејезичном тексту, или смештени у ХТМЛ елементе који се никада не појављују на екрану, као што су атрибути података или поља образаца које прегледачи не приказују видљиво, али их агенти и даље парсирају.
BrowseSafe-Bench: унапређење безбедности агената у окружењима стварног света
Да бисмо проучили ове нападе у окружењу које личи на стварни веб, направили смо BrowseSafe, модел детекције који смо обучили и отворили његов код, и BrowseSafe‑Bench, јавни референтни тест са 14.719 примера који опонашају продукционе странице. Он укључује сложен ХТМЛ, бучни садржај и мешавину злонамерних и безопасних узорака који варирају дуж три осе: шта нападач покушава да уради, где се упутство налази на страници и како је језик написан.
Референтни тест укључује 11 врста напада, девет стратегија инјектовања које обухватају од скривених поља до видљивих пасуса и подножја, и три лингвистичка стила, од експлицитних команди до индиректног, камуфлираног текста.
Приступ вишеслојне одбране
У нашем моделу претњи, сам асистент живи у заштићеном окружењу, али све што долази са веба је непоуздано. Нападачи могу контролисати читаве сајтове или само инјектовати садржај, као што су описи производа, коментари и објаве у иначе доброћудне странице које асистент посећује. Да би се тај ризик управљао, алати који могу да врате непоуздан садржај, као што су веб странице, имејлови или датотеке, се означавају, а њихови сирови излази се увек скенирају од стране BrowseSafe пре него што асистент може да их прочита или поступа по њима.
BrowseSafe је један слој у ширем приступу одбрани. Сирови садржај се скенира пре употребе, дозволе за алате су стандардно ограничене, а осетљиве радње могу захтевати експлицитну потврду корисника, све то на врху постојећих безбедносних функција прегледача. Вишеслојна одбрана омогућава корисницима да усвоје моћне асистенте прегледача без жртвовања безбедности зарад функционалности.
Шта утиче на ефикасност напада?
Резултати евалуације на BrowseSafe‑Bench показују јасне обрасце. Директни напади, попут тражења од агента да открије свој системски промпт или ексфилтрира информације преко УРЛ сегмената, међу најлакшим су за уочавање од стране модела. Насупрот томе, вишејезични напади и они написани као индиректна или хипотетичка упутства су знатно тежи, јер избегавају очигледне кључне речи на које се многи детектери имплицитно ослањају.
Позиционирање је такође важно. Напади скривени у коментарима се релативно добро детектују, док се верзије преписане у видљива подножја, ћелије табела или уметнуте пасусе показују као много теже, откривајући структурну пристрасност према „скривеним” инјектовањима. Пажљива обука на добро дизајнираним примерима може значајно побољшати способност модела да детектују ове обрасце.
Изградите сигурније агенте уз BrowseSafe
BrowseSafe и BrowseSafe-Bench су потпуно отвореног кода. Сваки програмер који гради аутономне агенте може одмах да ојача своје системе против инјектовања упутстава — нема потребе да се безбедносне ограде граде од нуле. Модел детекције са отвореним тежинама ради локално и означава злонамерна упутства пре него што стигну до основне логике вашег агента, довољно брзо да скенира сваку страницу без успоравања корисника.
Користите преко 14.000 сценарија напада из стварног света из BrowseSafe-Bench-а да тестирате сопствене моделе против неуредних ХТМЛ замки које руше стандардне ЛЛМ-ове. Наше технике дељења на делове и паралелног скенирања омогућавају агентима да ефикасно обрађују масивне, непоуздане странице — моћне могућности прегледања без излагања корисника опасности. Да бисте сазнали више о томе како смо изградили BrowseSafe и BrowseSafe-Bench, погледајте блог компаније Perplexity Research.