بناء متصفحات ذكاء اصطناعي أكثر أماناً باستخدام BrowseSafe
BrowseSafe هو نموذج الكشف المفتوح والمعيار الخاص بنا لاكتشاف التعليمات الخبيثة المخفية في صفحات الويب.

اليوم، نُطلق نموذج BrowseSafe، وهو معيار بحثي مفتوح ونموذج لاكتشاف المحتوى يهدف إلى الحفاظ على أمان المستخدمين أثناء تصفحهم للويب القائم على الوكلاء.
مع انتقال مساعدي الذكاء الاصطناعي من مربعات البحث إلى المتصفح نفسه، نتوقع أن تتحول الجيل القادم من شبكة الويب من الصفحات إلى الوكلاء: بحيث يقل الاهتمام بمكان وجود المعلومات، ويزداد الاهتمام بمن يسترجعها ويتصرف بناءً عليها. يحول Comet المتصفح إلى بيئة يمكن للمساعد من خلالها إنجاز المهام وليس مجرد الإجابة عن الأسئلة، لذا فإن هناك مبدأً واحداً غير قابل للتفاوض: وهو وجوب بقائه في جانب المستخدم.
BrowseSafe: حماية الوكلاء والمستخدمين من خلال فحص المحتوى في الوقت الفعلي
BrowseSafe هو نموذج اكتشاف تم ضبطه دقيقاً للإجابة عن سؤال واحد ومحدد: بناءً على شيفرة HTML للصفحة، هل تحتوي على تعليمات خبيثة موجهة إلى الوكلاء؟ يمكن للنماذج الكبيرة ذات الأغراض العامة الاستدلال بشكل جيد في هذه الحالات، لكنها غالباً ما تكون بطيئة ومكلفة للغاية بحيث لا يمكن تشغيلها على كل صفحة. يقوم BrowseSafe بفحص صفحات الويب الكاملة في الوقت الفعلي دون إبطاء المتصفح. كما نُطلق أيضاً مجموعة التقييم BrowseSafe‑Benchكمورد لتقييم وتحسين فعالية الدفاع.
حدود الثقة والدفاعات متعددة الطبقات
ومع ذلك، فإن جيلاً جديداً من التصفح المدعوم بالذكاء الاصطناعي يعني أيضاً جيلاً جديداً من تهديدات الأمن السيبراني التي تتطلب مقاربات مبتكرة للحفاظ على أمان المستخدمين. في مقال سابق، استعرضنا كيف يستخدم Comet طبقات متعددة من الحماية للحفاظ على أداء المساعد للمهام التي طلبها المستخدم، حتى عندما تحاول أي موقع ويب اختطافه باستخدام حقن الأوامر. واليوم نركز بشكل عميق على كيفية معالجة هذه المشكلة: كيف يتم تحديد تلك التهديدات، واختبارها ضد الهجمات الواقعية، واستخدامها لتدريب نماذج متخصصة قادرة على رصد الأوامر الضارة وإيقافها بسرعة كافية للتشغيل بأمان داخل المتصفح.
كيف يعمل حقن الأوامر في المتصفح
حقن الأوامر هو لغة خبيثة مدمجة في النص الذي يقرأه الذكاء الاصطناعي بهدف تجاوز قصده الأصلي. في المتصفح، يقرأ الوكلاء صفحات كاملة، لذا يمكن أن تختبئ الهجمات في أماكن مثل التعليقات، أو القوالب، أو التذييلات الطويلة.
يستخدم المهاجمون هذه الأماكن لتسريب تعليمات تقوم بهدوء بتوجيه الوكيل نحو مسار آخر. ونظراً لأنه يقرأ كل شيء، بما في ذلك المحتوى الذي لا يلاحظه معظم الناس أبداً، يمكن لتلك الرسائل اختطاف السلوك دون وجود ضمانات أمان قوية.
غالباً ما تتجنب هذه الهجمات العبارات الواضحة ويمكن كتابتها بنصوص مصقولة أو متعددة اللغات، أو وضعها في عناصر HTML لا تظهر أبداً على الشاشة، مثل سمات البيانات أو حقول النماذج التي لا يعرضها المتصفح مرئياً ولكن الوكلاء يحللونها مع ذلك.
BrowseSafe-Bench: تعزيز أمان الوكلاء في البيئات الواقعية
لدراسة هذه الهجمات في بيئة تشبه الويب الحقيقي، قمنا بناء BrowseSafe، وهو نموذج اكتشاف قمنا بتدريبه وإتاحته كمصدر مفتوح، وBrowseSafe‑Bench، وهو معيار عام يضم 14,719 مثالاً تحاكي صفحات الإنتاج. وهو يتضمن HTML معقداً، ومحتوى مشوشاً، ومزيجاً من العينات الخبيثة وغير الضارة التي تتباين على طول ثلاثة محاور: ما يحاول المهاجم فعله، ومكان وجود التعليمات في الصفحة، وكيفية كتابة اللغة.
يشتمل المعيار على 11 نوعاً من الهجمات، وتسع استراتيجيات حقن تمتد من الحقول المخفية إلى الفقرات والتذييلات المرئية، وثلاثة أساليب لغوية، تتراوح من الأوامر الصريحة إلى النصوص غير المباشرة والمموهة.
نهج الدفاع المتعدد الطبقات
في نموذج التهديدات الخاص بنا، يعيش المساعد نفسه في بيئة موثوقة، ولكن أي شيء يأتي من الويب يعتبر غير موثوق. قد يتحكم المهاجمون في مواقع كاملة أو يقومون فقط بحقن محتوى، مثل وصف المنتجات، والتعليقات، والمقالات في صفحات حميدة بخلاف ذلك يزورها المساعد. لإدارة هذه المخاطر، يتم وضع علامة على الأدوات التي يمكنها إرجاع محتوى غير موثوق، مثل صفحات الويب، أو رسائل البريد الإلكتروني، أو الملفات، ويتم فحص مخرجاتها الخام دائماً بواسطة BrowseSafe قبل أن يتمكن الوكيل من قراءتها أو التصرف بناءً عليها.
يُعد BrowseSafe إحدى الطبقات ضمن نهج دفاعي أوسع. يتم فحص المحتوى الخام قبل الاستخدام، وتحديد أpermissions الأدوات افتراضياً، ويمكن أن تتطلب الإجراءات الحساسة تأكيداً صريحاً من المستخدم، وكل ذلك يضاف إلى ميزات أمان المتصفح الحالية. يُمكّن الدفاع المتعدد الطبقات المستخدمين من تبني مساعدي تصفح أقوياء دون التضحية بالأمان مقابل الكفاءة.
ما الذي يؤثر على فعالية الهجوم؟
تظهر نتائج التقييم على BrowseSafe‑Bench أنماطاً واضحة. الهجمات المباشرة، مثل طلب المساعد الكشف عن موجه النظام الخاص به أو تسريب المعلومات عبر أجزاء عنوان URL، هي من بين الأسهل على النماذج اكتشافها. في المقابل، تُعد الهجمات متعددة اللغات وتلك المكتوبة كتعليمات غير مباشرة أو افتراضية أكثر صعوبة بكثير، لأنها تتجنب الكلمات الأساسية الواضحة التي تعتمد عليها العديد من أدوات الكشف ضمناً.
الموضع مهم أيضاً. يتم اكتشاف الهجمات المخفية في التعليقات بشكل جيد نسبياً، بينما تثبت النسخ المعاد كتابتها في التذييلات المرئية، أو خلايا الجداول، أو الفقرات المضمنة أنها أكثر صعوبة بكثير، مما يكشف عن انحياز هيكلي نحو عمليات الحقن "المخفية". يمكن أن يؤدي التدريب الدقيق على أمثلة مصممة جيداً إلى تحسين قدرة النماذج بشكل كبير على اكتشاف هذه الأنماط.
بناء وكلاء أكثر أماناً باستخدام BrowseSafe
BrowseSafe و BrowseSafe-Bench هما مفتوحا المصدر بالكامل. يمكن لأي مطور يبني وكلاء مستقلين تعزيز أنظمتهم فوراً ضد حقن الأوامر—دون الحاجة إلى بناء حواجز أمان من الصفر. يعمل نموذج الكشف ذو الأوزان المفتوحة محلياً ويقوم بتحديد التعليمات الخبيثة قبل وصولها إلى المنطق الأساسي لوكيلك، بسرعة كافية لفحص كل صفحة دون إبطاء المستخدمين.
استخدم سيناريوهات الهجوم الواقعية التي يزيد عددها عن 14,000 سيناريو في BrowseSafe-Bench لاختبار نماذجك الخاصة تحت الضغط ضد فخاخ HTML المعقدة التي تكسر نماذج اللغات الكبيرة القياسية. تتيح لك تقنيات التقطيع والفحص المتوازي للوكلاء معالجة صفحات ضخمة وغير موثوقة بكفاءة—قدرات تصفح قوية دون تعريض المستخدمين للخطر.
لمعرفة المزيد حول كيفية بناء BrowseSafe و BrowseSafe-Bench، تحقق من مدونة Perplexity للأبحاث.