BrowseSafe ile Daha Güvenli Yapay Zeka Tarayıcıları Oluşturma

BrowseSafe, web sayfalarında gizlenen kötü amaçlı talimatları yakalamaya yönelik açık algılama modelimiz ve kıyaslamamızdır.

Bugün, kullanıcılara ajan destekli web'de gezinirken güven sağlamayı amaçlayan açık bir araştırma kıyaslaması ve içerik algılama modeli olan BrowseSafe'i piyasaya sürüyoruz.

Yapay zeka asistanları arama kutularından tarayıcının kendisine taşındıkça, web'in yeni neslinin sayfalardan ajanlara geçiş yapmasını bekliyoruz: bilginin nerede yaşadığından ziyade, onu kimin getirdiği ve üzerinde kimin işlem yaptığı önem kazanıyor. Comet, tarayıcısını bir asistanın yalnızca soruları yanıtlamakla kalmayıp görevleri de tamamlayabileceği bir yere dönüştürüyor; bu nedenle bir ilke tartışılamaz: her zaman kullanıcının tarafında kalmalıdır.

BrowseSafe: Gerçek zamanlı içerik taramasıyla ajanları ve kullanıcıları koruma

BrowseSafe, odaklanmış tek bir soruyu yanıtlamak için ince ayar yapılmış bir algılama modelidir: Bir sayfanın HTML'si göz önüne alındığında, ajanı hedefleyen kötü amaçlı yönergeler içeriyor mu? Büyük genel amaçlı modeller bu durumlarda iyi akıl yürütebilir, ancak her sayfada çalıştırılmak için genellikle çok yavaş ve pahalıdırlar. BrowseSafe, tarayıcıyı yavaşlatmadan tam web sayfalarını gerçek zamanlı olarak tarar. Ayrıca savunma etkinliğini değerlendirmek ve geliştirmek için bir kaynak olarak BrowseSafe‑Bench değerlendirme paketini de yayınlıyoruz.

Güven sınırları ve katmanlı savunmalar

Ancak yapay zeka taramasının yeni nesli, kullanıcıları güvende tutmak için yeni yaklaşımlar gerektiren yeni nesil siber güvenlik tehditleri anlamına da gelir. Daha önceki bir yazımızda, bir web sitesi onu istem enjeksiyonu ile ele geçirmeye çalışsa bile Comet'in asistanın kullanıcının istediğini yapmasını sağlamak için birden fazla koruma katmanını nasıl kullandığını ele almıştık. Bugün bu sorunu nasıl ele aldığımıza odaklanıyoruz: bu tehditlerin nasıl tanımlandığı, gerçek dünyadaki saldırılara karşı nasıl test edildiği ve tarayıcıda güvenli bir şekilde çalışacak kadar hızlı bir şekilde kötü talimatları tespit edip durdurabilen özel modelleri eğitmek için nasıl kullanıldığı.

Tarayıcı istem enjeksiyonu nasıl çalışır?

İstem enjeksiyonu, yapay zekanın okuduğu metne gömülü, orijinal amacını geçersiz kılmak için tasarlanmış kötü amaçlı bir dildir. Tarayıcıda ajanlar tüm sayfaları okur, bu nedenle saldırılar yorumlar, şablonlar veya uzun altbilgiler gibi yerlerde gizlenebilir.

Saldırganlar, ajanı sessizce başka bir yöne yönlendiren talimatlar sızdırmak için bu noktaları kullanır. Çoğu insanın asla fark etmediği içerikler dahil her şeyi okuduğu için, bu mesajlar güçlü korumalar olmadan davranışı ele geçirebilir.

Bu saldırılar genellikle bariz ifadelerden kaçınır ve cilalı veya çok dilli metinlerle yazılabilir ya da tarayıcıların görünür şekilde işlemediği ancak ajanların yine de ayrıştırdığı veri özellikleri veya form alanları gibi ekranda asla görünmeyen HTML öğelerine yerleştirilebilir.

BrowseSafe-Bench: Gerçek dünya ortamlarında ajan güvenliğini ilerletme

Bu saldırıları gerçek web'e benzeyen bir ortamda incelemek için, eğittiğimiz ve açık kaynaklı hale getirdiğimiz bir algılama modeli olan BrowseSafe ve üretim sayfalarını taklit eden 14.719 örnekten oluşan genel bir kıyaslama olan BrowseSafe‑Bench'i oluşturduk. Karmaşık HTML, gürültülü içerik ve saldırganın ne yapmaya çalıştığı, talimatın sayfada nerede yer aldığı ve dilin nasıl yazıldığı olmak üzere üç eksen boyunca değişen kötü amaçlı ve zararsız örneklerin bir karışımını içerir.

Kıyaslama; gizli alanlardan görünür paragraflara ve altbilgilere kadar uzanan 11 saldırı türü, dokuz enjeksiyon stratejisi ve açık komutlardan dolaylı, kamufle edilmiş metne kadar üç dilsel stil içermektedir.

Derinlemesine savunma yaklaşımı

Tehdit modelimizde asistanın kendisi güvenli bir ortamda yaşar, ancak web'den gelen her şey güvenilir değildir. Saldırganlar sitelerin tamamını kontrol edebilir veya ürün açıklamaları, yorumlar ve gönderiler gibi içeriği asistanın ziyaret ettiği aksi takdirde güvenli olan sayfalara enjekte edebilir. Bu riski yönetmek için web sayfaları, e-postalar veya dosyalar gibi güvenilmeyen içeriği döndürebilen araçlar işaretlenir ve hammaddeleri, ajan bunları okumadan veya üzerinde işlem yapmadan önce her zaman BrowseSafe tarafından taranır.

BrowseSafe, daha geniş bir savunma yaklaşımındaki katmanlardan biridir. Ham içerik kullanılmadan önce taranır, araç izinleri varsayılan olarak sınırlıdır ve hassas eylemler, mevcut tarayıcı güvenlik özelliklerinin üstüne ek olarak açık kullanıcı onayı gerektirebilir. Derinlemesine savunma, kullanıcıların güçten ödün vermeden güçlü tarayıcı asistanlarını benimsemesini sağlar.

Saldırı etkinliğini ne etkiler?

BrowseSafe‑Bench üzerindeki değerlendirme sonuçları net kalıplar göstermektedir. Ajianttan sistem istemini ortaya çıkarmasını istemek veya URL segmentleri aracılığıyla bilgi sızdırmak gibi doğrudan saldırılar, modellerin yakalaması en kolay olanlar arasındadır. Buna karşılık, çok dilli saldırılar ve dolaylı veya varsayımsal talimatlar olarak yazılanlar çok daha zordur, çünkü birçok detektörün örtük olarak güvendiği bariz anahtar kelimelerden kaçınırlar.

Yerleşim de önemlidir. Yorumlarda gizlenen saldırılar nispeten iyi tespit edilirken, görünür altbilgilere, tablo hücrelerine veya satır içi paragraflara yeniden yazılan sürümler çok daha zor olduğunu kanıtlıyor ve "gizli" enjeksiyonlara yönelik yapısal bir önyargıyı ortaya çıkarıyor. İyi tasarlanmış örnekler üzerinde dikkatli bir eğitim, modellerin bu kalıpları tespit etme yeteneğini önemli ölçüde artırabilir.

BrowseSafe ile daha güvenli ajanlar oluşturun

BrowseSafe ve BrowseSafe-Bench tamamen açık kaynaklıdır. Otonom ajanlar oluşturan herhangi bir geliştirici, güvenlik raylarını sıfırdan oluşturmaya gerek kalmadan sistemlerini istem enjeksiyonuna karşı hemen güçlendirebilir. Açık ağırlıklı algılama modeli yerel olarak çalışır ve kullanıcıları yavaşlatmadan her sayfayı tarayacak kadar hızlı bir şekilde, ajanınızın çekirdek mantığına ulaşmadan önce kötü amaçlı talimatları işaretler.

Standart LLM'leri bozan karmaşık HTML tuzaklarına karşı kendi modellerinizi stres testine tabi tutmak için BrowseSafe-Bench'in 14.000'den fazla gerçek dünya saldırı senaryosunu kullanın. Parçalama ve paralel tarama tekniklerimiz, ajanların büyük, güvenilmeyen sayfaları verimli bir şekilde işlemesine olanak tanır; kullanıcıları tehlikeye atmadan güçlü tarama özellikleri sunar. BrowseSafe ve BrowseSafe-Bench'i nasıl oluşturduğumuz hakkında daha fazla bilgi edinmek için Perplexity Araştırma bloguna göz atın.

ipt>