Veiligere AI-browsers bouwen met BrowseSafe
BrowseSafe is ons open detectiemodel en benchmark voor het vangen van kwaadaardige instructies die verborgen zijn in webpagina's.

Vandaag introduceren wij BrowseSafe, een open onderzoeksbenchmark en model voor inhoudsdetectie dat erop gericht is gebruikers te beschermen terwijl zij zich door het agent-gestuurde web navigeren.
Nu AI-assistenten zich verplaatsen van zoekvensters naar de browser zelf, verwachten wij dat de volgende generatie van het web zal verschuiven van pagina's naar agents: minder gericht op waar informatie staat en meer op wie deze ophaalt en er actie op onderneemt. Comet verandert de browser in een plek waar een assistent taken kan voltooien in plaats van alleen vragen te beantwoorden, dus één principe is niet onderhandelbaar: het moet aan de kant van de gebruiker blijven.
BrowseSafe: agents en gebruikers beschermen door realtime scannen van inhoud
BrowseSafe is een detectiemodel dat is fijn afgesteld om één gerichte vraag te beantwoorden: bevat de HTML van een pagina kwaadaardige instructies gericht aan de agent? Grote modellen voor algemeen gebruik kunnen goed redeneren over deze gevallen, maar ze zijn vaak te traag en duur om op elke pagina uit te voeren. BrowseSafe scant volledige webpagina's in realtime zonder de browser te vertragen. We brengen ook de BrowseSafe-Bench evaluatiesuite uit als een hulpmiddel voor het evalueren en verbeteren van de effectiviteit van de verdediging.
Vertrouwensgrenzen en gelaagde verdediging
Een nieuwe generatie AI-browsing betekent echter ook een nieuwe generatie cyberbeveiligingsdreigingen die nieuwe benaderingen vereisen om gebruikers veilig te houden. In een eerdere publicatie hebben we uitgelegd hoe Comet meerdere beschermingslagen gebruikt om de assistent te laten doen wat de gebruiker vroeg, zelfs wanneer een website probeert deze te kapen met prompt-injectie. Vandaag zoomen we in op hoe we dat probleem aanpakken: hoe die dreigingen worden gedefinieerd, getest tegen aanvallen uit de echte wereld, en gebruikt om gespecialiseerde modellen te trainen die kwaadaardige instructies snel genoeg kunnen herkennen en stoppen om veilig in de browser te draaien.
Hoe browser-prompt-injectie werkt
Prompt-injectie is kwaadaardige taal ingebed in de tekst die AI leest, ontworpen om de oorspronkelijke intentie te overschrijven. In de browser lezen agents hele pagina's, dus kunnen aanvallen zich verstoppen op plekken zoals opmerkingen, sjablonen of lange voetteksten.
Aanvallers gebruiken die plekken om instructies toe te voegen die de agent stilletjes omleiden. Omdat deze alles leest, inclusief inhoud die de meeste mensen nooit opmerken, kunnen die berichten gedrag kapen zonder sterke waarborgen.
Deze aanvallen vermijden vaak voor de hand liggende zinsneden en kunnen geschreven zijn in gepolijste of meertalige tekst, of geplaatst zijn in HTML-elementen die nooit op het scherm verschijnen, zoals gegevenskenmerken of formuliervelden die browsers niet zichtbaar weergeven maar die agents wel parseren.
BrowseSafe-Bench: agentbeveiliging in echte omgevingen bevorderen
Om deze aanvallen te bestuderen in een omgeving die lijkt op het echte web, hebben we BrowseSafe gebouwd, een detectiemodel dat we hebben getraind en als open-source hebben vrijgegeven, en BrowseSafe-Bench, een publieke benchmark van 14.719 voorbeelden die productiepagina's nabootsen. Het omvat complexe HTML, ruisinhoud en een mix van kwaadaardige en onschadelijke voorbeelden die variëren langs drie assen: wat de aanvaller probeert te doen, waar de instructie op de pagina staat en hoe de taal is geschreven.
De benchmark omvat 11 aanvalstypen, negen injectiestrategieën variërend van verborgen velden tot zichtbare paragrafen en voetteksten, en drie taalkundige stijlen, van expliciete commando's tot indirecte, gecamoufleerde tekst.
Een gelaagde verdedigingsaanpak
In ons dreigingsmodel bevindt de assistent zelf zich in een vertrouwde omgeving, maar alles wat van het web komt is niet vertrouwd. Aanvallers kunnen hele sites controleren of gewoon inhoud injecteren, zoals productbeschrijvingen, opmerkingen en berichten in anders goedaardige pagina's die de assistent bezoekt. Om dat risico te beheren, worden hulpmiddelen die niet-vertrouwde inhoud kunnen retourneren, zoals webpagina's, e-mails of bestanden, gemarkeerd en worden hun onbewerkte uitvoer altijd gescand door BrowseSafe voordat de agent deze kan lezen of er actie op kan ondernemen.
BrowseSafe is één laag in een bredere verdedigingsaanpak. Onbewerkte inhoud wordt vóór gebruik gescand, rechten van hulpmiddelen zijn standaard beperkt en gevoelige acties kunnen expliciete bevestiging van de gebruiker vereisen, allemaal bovenop bestaande beveiligingsfuncties van de browser. Gelaagde verdediging stelt gebruikers in staat om krachtige browser-assistenten te gebruiken zonder veiligheid op te offeren voor functionaliteit.
Wat beïnvloedt de effectiviteit van een aanval?
Evaluatieresultaten op BrowseSafe-Bench tonen duidelijke patronen. Directe aanvallen, zoals de assistent vragen zijn systeem-prompt te onthullen of informatie via URL-segmenten te exfiltreren, behoren tot de makkelijkste voor modellen om te detecteren. Daarentegen zijn meertalige aanvallen en aanvallen geschreven als indirecte of hypothetische instructies aanzienlijk moeilijker, omdat ze de voor de hand liggende trefwoorden vermijden waar veel detectoren impliciet op vertrouwen.
De plaatsing is ook van belang. Aanvallen die in opmerkingen verborgen zijn, worden relatief goed gedetecteerd, terwijl versies die herschreven zijn in zichtbare voetteksten, tabelcellen of inline paragrafen veel moeilijker blijken, wat wijst op een structurele bias naar "verborgen" injecties. Zorgvuldige training op goed ontworpen voorbeelden kan het vermogen van modellen om deze patronen te detecteren aanzienlijk verbeteren.
Bouw veiligere agents met BrowseSafe
BrowseSafe en BrowseSafe-Bench zijn volledig open-source. Elke ontwikkelaar die autonome agents bouwt, kan zijn systemen onmiddellijk wapenen tegen prompt-injectie—het is niet nodig om beveiligingsmechanismen vanaf nul op te bouwen. Het detectiemodel met open gewichten draait lokaal en markeert kwaadaardige instructies voordat ze de kernlogica van je agent bereiken, snel genoeg om elke pagina te scannen zonder gebruikers te vertragen.
Gebruik de 14.000+ real-world aanvalsscenario's van BrowseSafe-Bench om je eigen modellen te stresstesten tegen de rommelige HTML-vallen die standaard LLM's breken. Onze technieken voor chunking en parallel scannen laten agents massale, niet-vertrouwde pagina's efficiënt verwerken—krachtige browse-mogelijkheden zonder gebruikers bloot te stellen aan gevaar. Voor meer informatie over hoe we BrowseSafe en BrowseSafe-Bench hebben gebouwd, bekijk de Perplexity Research blog.