BrowseSafe सह सुरक्षित AI ब्राउझर तयार करणे
BrowseSafe हे वेब पेजेसमध्ये लपलेल्या दुर्भावनापूर्ण सूचना पकडण्यासाठी आमचे ओपन डिटेक्शन मॉडेल आणि बेंचमार्क आहे.

आज, आम्ही BrowseSafe लाँच करत आहोत, जो एक ओपन रिसर्च बेंचमार्क आणि कंटेंट डिटेक्शन मॉडेल आहे, ज्याचा उद्देश वापरकर्ते एजंट वेबवर नेव्हिगेट करत असताना त्यांना सुरक्षित ठेवणे हा आहे.
जसे जसे एआय असिस्टंट्स सर्च बॉक्समधून ब्राउझरमध्ये प्रवेश करत आहेत, तसे आम्हाला अपेक्षा आहे की वेबची पुढील पिढी पानांपासून (pages) एजंट्सकडे जाईल: माहिती कुठे असते यावर कमी आणि ती कोण मिळवतो आणि त्यावर कोण कार्यवाही करतो यावर जास्त भर असेल. Comet ब्राउझरला अशा जागेत बदलते जिथे असिस्टंट फक्त प्रश्नांची उत्तरेच नाही तर कार्ये पूर्ण करू शकतो, त्यामुळे एक तत्त्व तडजोडी पलीकडचे आहे: ते नेहमी वापरकर्त्याच्या बाजूने राहिले पाहिजे.
BrowseSafe: रिअल-टाइम कंटेंट स्कॅनिंगद्वारे एजंट्स आणि वापरकर्त्यांचे संरक्षण करणे
BrowseSafe हे एक डिटेक्शन मॉडेल आहे जे एका विशिष्ट प्रश्नाचे उत्तर देण्यासाठी बारीक-सारिक पद्धतीने (fine-tuned) तयार केले गेले आहे: दिलेल्या पेजच्या HTML मध्ये, एजंटच्या उद्देशाने तयार केलेल्या काही दुर्भावनापूर्ण सूचना आहेत का? मोठे जनरल-परपज मॉडेल या प्रकरणांचा चांगला अंदाज घेऊ शकतात, परंतु प्रत्येक पानावर चालवण्यासाठी ते अनेकदा खूप स्लो आणि महाग असतात. BrowseSafe ब्राउझरचा वेग कमी न करता रिअल टाइममध्ये संपूर्ण वेब पेज स्कॅन करते. संरक्षणाची प्रभावीता मोजण्यासाठी आणि सुधारण्यासाठी आम्ही BrowseSafe‑Bench मूल्यांकन सूट देखील एक संसाधन म्हणून रिलीज करत आहोत.
विश्वास सीमा आणि स्तरित संरक्षण (Trust boundaries and layered defenses)
तथापि, एआय ब्राउझिंगच्या नवीन पिढीचा अर्थ सायबर सुरक्षेच्या नवीन धोके असाही होतो, ज्यासाठी वापरकर्त्यांना सुरक्षित ठेवण्याच्या नाविन्यपूर्ण पद्धतींची आवश्यकता असते. एका मागील पोस्टमध्ये, आम्ही यावर चर्चा केली की Comet संरक्षणाचे अनेक स्तर वापरून असिस्टंटला वापरकर्त्याने विचारलेले काम करत ठेवते, अगदी तेव्हाही जेव्हा एखादी वेबसाइट प्रॉम्प्ट इंजेक्शन द्वारे त्यावर ताबा मिळवण्याचा प्रयत्न करते. आज आपण या समस्येचा कसा सामना करतो यावर लक्ष केंद्रित करत आहोत: त्या धोक्यांची कशी व्याख्या केली जाते, वास्तविक जगातील हल्ल्यांविरुद्ध त्यांची कशी चाचणी घेतली जाते आणि ब्राउझरमध्ये सुरक्षितपणे चालण्यासाठी वाईट सूचनांना जलद ओळखू शकणारी आणि थांबवू शकणारी विशेष मॉडेल प्रशिक्षित करण्यासाठी त्यांचा कसा वापर केला जातो.
ब्राउझर प्रॉम्प्ट इंजेक्शन कसे काम करते
प्रॉम्प्ट इंजेक्शन हा एआय वाचत असलेल्या मजकुरातील दुर्भावनापूर्ण भाषा आहे, जी त्याचा मूळ हेतू ओव्हरराईड करण्यासाठी डिझाइन केलेली असते. ब्राउझरमध्ये, एजंट्स संपूर्ण पाने वाचतात, त्यामुळे हल्ले टिप्पण्या (comments), टेम्पलेट्स किंवा लांब फूटर्स सारख्या ठिकाणी लपून राहू शकतात.
हल्लेखोर एजंटला गुप्तपणे दिशाभूल करण्यासाठी त्या जागांचा वापर करतात. ते सर्वकाही वाचत असल्यामुळे, बहुतेक लोकांना कधीही लक्षात न येणाऱ्या सामग्रीसह, त्या संदेश मजबूत सुरक्षिततेशिवाय वर्तनावर ताबा मिळवू शकतात.
या हल्ल्यांमध्ये 11 हल्ल्याचे प्रकार, लपलेल्या फील्डपासून ते दृश्यमान परिच्छेद आणि फूटर्सपर्यंत नऊ इंजेक्शन धोरणे आणि स्पष्ट कमांड्सपासून ते अप्रत्यक्ष, कॅमोफ्लाज्ड मजकुरापर्यंत तीन भाषिक शैली समाविष्ट आहेत.
BrowseSafe-Bench: रिअल-वर्ल्ड वातावरणात एजंट सुरक्षा वाढवणे
वास्तविक वेब सारख्या सेटिंगमध्ये या हल्ल्यांचा अभ्यास करण्यासाठी, आम्ही BrowseSafe तयार केले, जे आम्ही प्रशिक्षित केलेले आणि ओपन-सोर्स केलेले डिटेक्शन मॉडेल आहे, आणि BrowseSafe‑Bench, जे प्रॉडक्शन पेजेसची नक्कल करणाऱ्या 14,719 उदाहरणांचा एक सार्वजनिक बेंचमार्क आहे. यात जटिल HTML, गोंधळात टाकणारी सामग्री आणि दुर्भावनापूर्ण आणि निरुपद्रवी नमुन्यांचे मिश्रण समाविष्ट आहे जे तीन अक्षांवर भिन्न आहेत: हल्लेखोर काय करण्याचा प्रयत्न करतो, पानामध्ये सूचना कुठे बसते आणि भाषा कशी लिहिली जाते.
या बेंचमार्कमध्ये ११ हल्ल्याचे प्रकार, लपवलेल्या फील्ड्सपासून ते दृश्यमान परिच्छेद आणि फुटरपर्यंत पसरलेल्या नऊ इन्जेक्शन धोरणा आणि स्पष्ट आदेशांपासून ते अप्रत्यक्ष, कॅमफ्लाज केलेल्या मजकुरापर्यंतच्या तीन भाषिक शैली समाविष्ट आहेत.
खोलवर संरक्षणाचा दृष्टिकोन (A defense in depth approach)
आमच्या थ्रेट मॉडेलमध्ये, असिस्टंट स्वतः एका विश्वासू वातावरणात राहतो, परंतु वेबवरून येणारी कोणतीही गोष्ट अविश्वसनीय असते. हल्लेखोर संपूर्ण साइट्स नियंत्रित करू शकतात किंवा प्रॉडक्ट वर्णन, टिप्पण्या आणि पोस्ट्स यांसारख्या सामग्रीला असिस्टंट भेट देत असलेल्या अन्यथा बिनविषारी पानांमध्ये फक्त समाविष्ट करू शकतात. त्या जोखमीचे व्यवस्थापन करण्यासाठी, वेब पेजेस, ईमेल्स किंवा फायली यांसारखी अविश्वसनीय सामग्री परत करू शकणारी टूल्स फ्लॅग केली जातात आणि एजंट त्या वाचण्यापूर्वी किंवा त्यावर कार्य करण्यापूर्वी त्यांच्या रॉ आउटपुट नेहमी BrowseSafe द्वारे स्कॅन केले जातात.
BrowseSafe हा व्यापक संरक्षण दृष्टिकोनातील एक स्तर आहे. वापरण्यापूर्वी रॉ कंटेंट स्कॅन केली जाते, टूलच्या परवानग्या डीफॉल्टनुसार मर्यादित असतात आणि संवेदनशील कृतींसाठी स्पष्ट वापरकर्ता पुष्टीकरणाची आवश्यकता असू शकते, हे सर्व विद्यमान ब्राउझर सुरक्षा वैशिष्ट्यांच्या वर असते. संरक्षण खोलीमुळे वापरकर्त्यांना सुरक्षिततेचा त्याग न करता शक्तिशाली ब्राउझर असिस्टंट्सचा अवलंब करता येतो.
हल्ल्याच्या प्रभावीतेवर कशाचा प्रभाव पडतो?
BrowseSafe‑Bench वरून मूल्यमापन परिणाम स्पष्ट नमुने दर्शवतात. प्रत्यक्ष हल्ले, जसे की एजंटला त्याचे सिस्टम प्रॉम्प्ट उघड करण्यास सांगणे किंवा URL विभागांमार्फत माहिती बाहेर काढणे, हे मॉडेल्सना पकडण्यासाठी सर्वात सोप्या पैकी आहेत. याउคะ, बहुभाषिक हल्ले आणि अप्रत्यक्ष किंवा काल्पनिक सूचना म्हणून लिहिलेले हल्ले लक्षणीयरीत्या कठीण आहेत, कारण ते अनेक डिटेक्टर अंतर्निहितपणे अवलंबून असलेले स्पष्ट कीवर्ड टाळतात.
जागा महत्त्वाची आहे. टिप्पण्यांमध्ये लपलेले हल्ले तुलनेने चांगले ओळखले जातात, तर दृश्यमान फूटर्स, टेबल सेल्स किंवा इनलाइन परिच्छेदांमध्ये पुनर्संचयित आवृत्त्या अधिक कठीण असल्याचे सिद्ध होतात, जे "लपलेल्या" इनपुटच्या दिशेने संरचनात्मक पूर्वग्रह दर्शवतात. चांगल्या प्रकारे डिझाइन केलेल्या उदाहरणांवर काळजीपूर्वक प्रशिक्षण दिल्यास मॉडेल्सची ही नमुने ओळखण्याची क्षमता लक्षणीयरीत्या सुधारू शकते.
BrowseSafe सह सुरक्षित एजंट तयार करा
BrowseSafe आणि BrowseSafe-Bench पूर्णपणे ओपन-सोर्स आहेत. स्वायत्त एजंट तयार करणारा कोणताही डेव्हलपर प्रॉम्प्ट इंजेक्शनविरुद्ध त्यांची सिस्टम त्वरित मजबूत करू शकतो—सुरक्षा रेल्वे सुरुवातीից तयार करण्याची गरज नाही. ओपन-वेट डिटेक्शन मॉडेल स्थानिक पातळीवर चालते आणि तुमच्या एजंटच्या मुख्य लॉजिकपर्यंत पोहोचण्यापूर्वी दुर्भावनापूर्ण सूचना फ्लॅग करते, वापरकर्त्यांचा वेग मंद न करता प्रत्येक पान स्कॅन करण्यासाठी ते पुरेसे जलद आहे.
मानक LLM ला ब्रेक करणाऱ्या गोंधळात टाकणाऱ्या HTML ट्रॅप्सविरुद्ध तुमच्या स्वतःच्या मॉडेल्सची स्ट्रेस-टेस्ट करण्यासाठी BrowseSafe-Bench च्या 14,000+ वास्तविक जगातील हल्ल्याच्या परिस्थितींचा वापर करा. आमचे चंकिंग आणि समांतर स्कॅनिंग तंत्र एजंट्सना प्रचंड, अविश्वसनीय पृष्ठांवर कार्यक्षमतेने प्रक्रिया करण्यास अनुमती देते—वापरकर्त्यांना धोक्यात न घालता शक्तिशाली ब्राउझिंग क्षमता. BrowseSafe आणि BrowseSafe-Bench कसे तयार केले याबद्दल अधिक जाननेसाठी, Perplexity रिसर्च ब्लॉग पहा.