Drošāku MI pārlūkprogrammu veidošana ar BrowseSafe
BrowseSafe ir mūsu atvērtais noteikšanas modelis un standartnovērtējums tīmekļa lapās paslēptu ļaunprātīgu instrukciju uztveršanai.

Šodien mēs izlaižam BrowseSafe — atvērtu pētījumu standartnovērtējumu un satura noteikšanas modeli, kura mērķis ir gādāt par lietotāju drošību, tiem pārvietojoties pa aģentu tīmekli.
Mākslīgā intelekta asistēšanās rīkiem pārvietojoties no meklēšanas lodziņiem uz pašu pārlūkprogrammu, mēs sagaidām, ka nākamās paaudzes tīmeklis mainīsies no lapām uz aģentiem: mazāk uzmanības tiks pievērsts tam, kur atrodas informācija, un vairāk tam, kurš to izgūst un rīkojas ar to. Comet pārvērš pārlūkprogrammu par vietu, kur asistents var paveikt uzdevumus, nevis tikai atbildēt uz jautājumiem, tāpēc viens princips ir neapspriežams: tam ir jāpaliek lietotāja pusē.
BrowseSafe: aģentu un lietotāju aizsardzība, izmantojot reāllaika satura skenēšanu
BrowseSafe ir noteikšanas modelis, kas pielāgots, lai atbildētu uz vienu konkrētu jautājumu: vai lapas HTML kodā ir ļaunprātīgas instrukcijas, kas vērstas pret aģentu? Lieli vispārējas nozīmes modeļi spēj labi analizēt šādus gadījumus, taču tie bieži vien ir pārāk lēni un dārgi, lai tos darbinātu katrā lapā. BrowseSafe skenē pilnas tīmekļa lapas reāllaikā, nepalēninot pārlūkprogrammu. Mēs publicējam arī BrowseSafe‑Bench novērtēšanas komplektu kā resursu aizsardzības efektivitātes novērtēšanai un uzlabošanai.
Uzticēšanās robežas un slāņveida aizsardzība
Tomēr jaunā MI pārlūkošanas paaudze nozīmē arī jaunu kiberdrošības apdraudējumu paaudzi, kurai nepieciešamas jaunas läjas lietotāju drošības uzturēšanai. Iepriekšējā ierakstā mēs apskatījām, kā Comet izmanto vairākus aizsardzības slāņus, lai nodrošinātu, ka asistents turpina darīt to, ko lietotājs prasīja, pat ja tīmekļa vietne mēģina to pārņemt, izmantojot uzvednes injekciju (prompt injection). Šodien mēs pievēršamies tam, kā mēs risinām šo problēmu: kā šie draudi tiek definēti, pārbaudīti pret reālās pasaules uzbrukumiem un izmantoti specializētu modeļu apmācīšanai, kas spēj ātri pamanīt un apturēt sliktas instrukcijas, lai tās varētu droši darbināt pārlūkprogrammā.
Kā darbojas pārlūkprogrammas uzvednes injekcija
Uzvednes injekcija ir ļaunprātīga valoda, kas iegulta tekstā un ko lasa MI, un tā ir paredzēta, lai ignorētu tā sākotnējo nolūku. Pārlūkprogrammā aģenti nolasa veselas lapas, tāpēc uzbrukumi var paslēpties tādās vietās kā komentāri, sagataves vai gari kājenes.
Uzbrucēji izmanto šīs vietas, lai nemanāmi iekļautu instrukcijas, kas klusi novirza aģentu. Tā kā tas nolasa visu, tostarp saturu, ko vairums cilvēku nekad nepamana, šie ziņojumi var pārņemt uzvedību bez stingrām drošības garantijām.
Šie uzbrukumi bieži vien izvairās no acīmredzamām frāzēm, un tie var būt uzrakstīti slīpētā vai daudzvalodu tekstā vai ievietoti HTML elementos, kas nekad neparādās ekrānā, piemēram, datu atribūtos vai veidlapu laukos, kurus pārlūkprogrammas vizuāli neattēlo, bet aģenti joprojām parsē.
BrowseSafe-Bench: aģentu drošības uzlabošana reālās pasaules vidēs
Lai izpētītu šos uzbrukumus vidē, kas līdzinās reālam tīmeklim, mēs izveidojām BrowseSafe — noteikšanas modeli, ko mēs apmācījām un padarījām par atvērtā koda risinājumu, un BrowseSafe‑Bench — publisku standartnovērtējumu, kurā ir 14 719 piemēri, kas atdarina produkcijas lapas. Tas ietver sarežģītu HTML, trokšņainu saturu un ļaunprātīgu un nekaitīgu paraugu sajaukumu, kas mainās trīs asīs: ko uzbrucējs mēģina izdarīt, kur lapā atrodas instrukcija un kā ir uzrakstīta valoda.
Standartnovērtējums ietver 11 uzbrukumu veidus, deviņas injekcijas stratēģijas, sākot no slēptiem laukiem līdz redzamām rindkopām un kājenēm, un trīs lingvistiskos stilus — no skaidrām komandām līdz netiešam, maskētam tekstam.
Daudzlīmeņu aizsardzības pieeja
Mūsu draudu modelī pats asistents atrodas uzticamā vidē, bet viss, kas nāk no tīmekļa, nav uzticams. Uzbrucēji var kontrolēt veselas vietnes vai vienkārši injicēt saturu, piemēram, produktu aprakstus, komentārus un ierakstus citādi labdabīgās lapās, ko asistents apmeklē. Lai pārvaldītu šo risku, rīki, kas var atgriezt neuzticamu saturu, piemēram, tīmekļa lapas, e-pastus vai failus, tiek atzīmēti, un to neapstrādātos izvades datus pirms aģenta nolasīšanas vai rīcības ar tiem vienmēr skenē BrowseSafe.
BrowseSafe ir viens slānis plašākā aizsardzības pieejā. Neapstrādāts saturs tiek skenēts pirms lietošanas, rīku atļaujas pēc noklusējuma ir ierobežotas, un sensitīvām darbībām var būt nepieciešama nepārprotama lietotāja apstiprināšana — tas viss papildus esošajām pārlūkprogrammas drošības funkcijām. Daudzlīmeņu aizsardzība ļauj lietotājiem izmantot jaudīgus pārlūkprogrammas asistentus, neupurējot drošību kapacitātes dēļ.
Kas ietekmē uzbrukuma efektivitāti?
Novērtējuma rezultāti vietnē BrowseSafe‑Bench uzrāda skaidras likumsakarības. Tieši uzbrukumi, piemēram, lūgums aģentam atklāt tā sistēmas uzvedni vai izgūt informāciju, izmantojot URL segmentus, ir vieni no modeļiem visvieglāk uztveramajiem. Turpretī daudzvalodu uzbrukumi un tie, kas uzrakstīti kā netiešas vai hipotētiskas instrukcijas, ir ievērojami grūtāki, jo tie izvairās no acīmredzamajiem atslēgvārdiem, uz kuriem netieši paļaujas daudzi detektori.
Nozīme ir arī izvietojumam. Komentāros paslēptie uzbrukumi tiek atklāti salīdzinoši labi, savukārt versijas, kas pārrakstītas redzamās kājenēs, tabulas šūnās vai iekļautajās rindkopās, izrādās daudz sarežģītākas, atklājot strukturālu neobjektivitāti pret “slēptajām” injekcijām. Rūpīga apmācība, izmantojot labi izstrādātus piemērus, var būtiski uzlabot modeļu spēju noteikt šos modeļus.
Izveidojiet drošākus aģentus ar BrowseSafe
BrowseSafe un BrowseSafe-Bench ir pilnībā atvērtā koda risinājumi. Ikviens izstrādātājs, kas veido autonomus aģentus, var nekavējoties nostiprināt savas sistēmas pret uzvednes injekciju — nav nepieciešams no jauna veidot drošības margas. Atvērto svaru noteikšanas modelis darbojas lokāli un atzīmē ļaunprātīgās instrukcijas, pirms tās sasniedz jūsu aģenta pamata loģiku, pietiekami ātri, lai skenētu katru lapu, nepalēninot lietotājus.
Izmantojiet BrowseSafe-Bench vairāk nekā 14 000 reālās pasaules uzbrukumu scenāriju, lai veiktu stresa testēšanu saviem modeļiem pret netīrajiem HTML slazdiem, kas salauž standarta LLM. Mūsu datu kopu sadalīšanas un paralēlās skenēšanas metodes ļauj aģentiem efektīvi apstrādāt masīvas, neuzticamas lapas — jaudīgas pārlūkošanas iespējas, nepakļaujot lietotājus briesmām. Lai uzzinātu vairāk par to, kā mēs izveidojām BrowseSafe un BrowseSafe-Bench, ieskatieties Perplexity Research emuārā.