BrowseSafe দিয়ে আরও নিরাপদ এআই ব্রাউজার তৈরি করা
ওয়েব পেজে লুকিয়ে থাকা ক্ষতিকর নির্দেশনা শনাক্ত করার জন্য BrowseSafe হলো আমাদের ওপেন ডিটেকশন মডেল এবং বেঞ্চমার্ক।

আজ আমরা BrowseSafe প্রকাশ করছি, যা একটি ওপেন রিসার্চ বেঞ্চমার্ক এবং কনটেন্ট ডিটেকশন মডেল, যা এজেন্টিক ওয়েব ব্রাউজ করার সময় ব্যবহারকারীদের নিরাপদ রাখতে তৈরি করা হয়েছে।
যেহেতু এআই অ্যাসিস্ট্যান্টগুলো সার্চ বক্স থেকে সরাসরি ব্রাউজারে স্থানান্তরিত হচ্ছে, আমরা আশা করি ওয়েবের পরবর্তী প্রজন্ম পেজ থেকে এজেন্টে রূপান্তরিত হবে: তথ্য কোথায় আছে তার চেয়ে কে এটি সংগ্রহ করছে এবং এর উপর ভিত্তি করে কাজ করছে সেটি এখানে বেশি গুরুত্বপূর্ণ। Comet ব্রাউজারকে এমন একটি জায়গায় পরিণত করে যেখানে একজন অ্যাসিস্ট্যান্ট কেবল প্রশ্নের উত্তরই দেয় না, বরং কাজও সম্পন্ন করতে পারে, তাই একটি নীতি নিয়ে কোনো আপস করা যাবে না: এটি অবশ্যই ব্যবহারকারীর পক্ষে থাকতে হবে।
BrowseSafe: রিয়েল-টাইম কনটেন্ট স্ক্যানিংয়ের মাধ্যমে এজেন্ট এবং ব্যবহারকারীদের সুরক্ষা
BrowseSafe হলো একটি ডিটেকশন মডেল যা একটি নির্দিষ্ট প্রশ্নের উত্তর দেওয়ার জন্য ফাইন-টিউন করা হয়েছে: একটি পেজের এইচটিএমএল দেওয়া হলে, সেটিতে কি এজেন্টের উদ্দেশ্যে কোনো ক্ষতিকর নির্দেশনা রয়েছে? বড় জেনেরাল-পারপাস মডেলগুলো এসব বিষয় ভালোভাবে বুঝতে পারে, তবে প্রতিটি পেজে এটি চালানো প্রায়শই অত্যন্ত ধীরগতির এবং ব্যয়বহুল। BrowseSafe ব্রাউজারকে ধীরগতির না করেই রিয়েল-টাইমে সম্পূর্ণ ওয়েব পেজ স্ক্যান করে। সুরক্ষার কার্যকারিতা মূল্যায়ন এবং উন্নতির জন্য আমরা BrowseSafe‑Bench ইভালুয়েশন স্যুটও প্রকাশ করছি।
ট্রাস্ট বাউন্ডারি এবং স্তরীভূত প্রতিরক্ষা ব্যবস্থা
যﺎই হোক, এআই ব্রাউজিংয়ের নতুন প্রজন্মের অর্থ হলো সাইবার নিরাপত্তার একটি নতুন প্রজন্ম, যার জন্য ব্যবহারকারীদের নিরাপদ রাখতে নতুন পদ্ধতির প্রয়োজন। একটি পূর্ববর্তী পোস্টে, আমরা আলোচনা করেছি কীভাবে Comet সুরক্ষার একাধিক স্তর ব্যবহার করে অ্যাসিস্ট্যান্টকে ব্যবহারকারীর অনুরোধ অনুযায়ী কাজ করাতে সাহায্য করে, এমনকি কোনো ওয়েবসাইট যখন প্রম্পট ইনজেকশন-এর মাধ্যমে এর নিয়ন্ত্রণ নেওয়ার চেষ্টা করে তখনও। আজ আমরা এই সমস্যাটি কীভাবে সমাধান করি তার বিশদ বিবরণে যাচ্ছি: কীভাবে সেই হুমকিগুলোকে সংজ্ঞায়িত করা হয়, বাস্তব বিশ্বের আক্রমণগুলোর বিরুদ্ধে পরীক্ষা করা হয় এবং বিশেষায়িত মডেলগুলোকে প্রশিক্ষণ দিতে ব্যবহার করা হয় যা ব্রাউজারে নিরাপদে চালানোর মতো যথেষ্ট দ্রুত খারাপ নির্দেশনাগুলোকে চিহ্নিত ও থামাতে পারে।
ব্রাউজার প্রম্পট ইনজেকশন যেভাবে কাজ করে
প্রম্পট ইনজেকশন হলো এআই-এর পঠিত টেক্সটের মধ্যে এমবেড করা ক্ষতিকর ভাষা যা এর মূল উদ্দেশ্যকে ওভাররাইড করার জন্য ডিজাইন করা হয়েছে। ব্রাউজারে, এজেন্টরা পুরো পেজ পড়ে, তাই আক্রমণগুলো কমেন্ট, টেমপ্লেট বা দীর্ঘ ফুটারের মতো জায়গায় লুকিয়ে থাকতে পারে।
আক্রমণকারীরা এজেন্টকে নীরবভাবে অন্যদিকে পরিচালিত করার জন্য নির্দেশনা ঢুকিয়ে দিতে এই জায়গাগুলো ব্যবহার করে। যেহেতু এটি বেশিরভাগ মানুষ লক্ষ্য করে না এমন কনটেন্টসহ সবকিছুই পড়ে, তাই শক্তিশালী সুরক্ষা ছাড়া সেই বার্তাগুলো আচরণ নিয়ন্ত্রণ করতে পারে।
এই আক্রমণগুলো প্রায়শই স্পষ্ট বাক্যাংশ এড়িয়ে চলে এবং পরিশীলিত বা বহুভাষিক টেক্সটে লেখা হতে পারে, অথবা এমন এইচটিএমএল উপাদানে রাখা হতে পারে যা স্ক্রিনে কখনো প্রদর্শিত হয় না, যেমন ডেটা অ্যাট্রিবিউট বা ফর্ম ফিল্ড যা ব্রাউজার দৃশ্যমানভাবে রেন্ডার করে না কিন্তু এজেন্টরা তবুও পার্স করে।
BrowseSafe-Bench: বাস্তব বিশ্বের পরিবেশে এজেন্টের নিরাপত্তা এগিয়ে নেওয়া
বাস্তব ওয়েবের মতো একটি সেটিংয়ে এই আক্রমণগুলো অধ্যয়ন করার জন্য, আমরা তৈরি করেছি BrowseSafe, একটি ডিটেকশন মডেল যা আমরা প্রশিক্ষণ দিয়ে ওপেন-সোর্স করেছি, এবং BrowseSafe‑Bench, যা প্রোডাকশন পেজের অনুকরণ করে এমন ১৪,৭১৯টি উদাহরণের একটি পাবলিক বেঞ্চমার্ক। এতে রয়েছে জটিল এইচটিএমএল, নয়েজি কনটেন্ট এবং ক্ষতিকর ও ক্ষতিকর নয় এমন নমুনার একটি মিশ্রণ যা তিনটি অক্ষ বরাবর পরিবর্তিত হয়: আক্রমণকারী কী করার চেষ্টা করে, পেজের মধ্যে নির্দেশনাটি কোথায় অবস্থান করে এবং ভাষাটি কীভাবে লেখা হয়।
বেঞ্চমার্কে ১১টি আক্রমণের ধরন, লুকানো ক্ষেত্র থেকে দৃশ্যমান প্যারাগ্রাফ এবং ফুটার পর্যন্ত বিস্তৃত নয়টি ইনজেকশন কৌশল এবং স্পষ্ট কমান্ড থেকে শুরু করে পরোক্ষ, ছদ্মবেশী টেক্সট পর্যন্ত তিনটি ভাষাগত শৈলী অন্তর্ভুক্ত রয়েছে।
বহুস্তরীয় প্রতিরক্ষার একটি দৃষ্টিভঙ্গি
আমাদের থ্রেট মডেলে, অ্যাসিস্ট্যান্ট নিজেই একটি বিশ্বস্ত পরিবেশে থাকে, কিন্তু ওয়েব থেকে আসা যেকোনো কিছু বিশ্বস্ত নয়। আক্রমণকারীরা পুরো সাইট নিয়ন্ত্রণ করতে পারে অথবা অন্যথায় সৌম্য পেজে প্রোডাক্টের বিবরণ, কমেন্ট এবং পোস্টের মতো কনটেন্ট ইনজেক্ট করতে পারে যা অ্যাসিস্ট্যান্ট পরিদর্শন করে। সেই ঝুঁকি পরিচালনা করার জন্য, ওয়েব পেজ, ইমেল বা ফাইলের মতো অবিশ্বস্ত কনটেন্ট রিটার্ন করতে পারে এমন টুলগুলোকে ফ্ল্যাগ করা হয় এবং এজেন্ট সেগুলো পড়ার বা সে অনুযায়ী কাজ করার আগে তাদের কাঁচা আউটপুটগুলো সবসময় BrowseSafe দ্বারা স্ক্যান করা হয়।
BrowseSafe হলো একটি বিস্তৃত প্রতিরক্ষা পদ্ধতির একটি স্তর। ব্যবহারের আগে কাঁচা কনটেন্ট স্ক্যান করা হয়, ডিফল্টভাবে টুলের অনুমতি সীমিত করা হয় এবং সংবেদনশীল কাজের জন্য স্পষ্ট ব্যবহারকারী নিশ্চিতকরণের প্রয়োজন হতে পারে, যা বিদ্যমান ব্রাউজার নিরাপত্তা বৈশিষ্ট্যের ওপর ভিত্তি করে তৈরি। বহুস্তরীয় প্রতিরক্ষা ব্যবহারকারীদের ক্ষমতার সাথে নিরাপত্তার আপস না করে শক্তিশালী ব্রাউজার অ্যাসিস্ট্যান্ট গ্রহণ করতে সক্ষম করে।
আক্রমণের কার্যকারিতাকে কোন বিষয়গুলো প্রভাবিত করে?
BrowseSafe‑Bench-এর মূল্যায়নের ফলাফলগুলো স্পষ্ট প্যাটার্ন দেখায়। সরাসরি আক্রমণ, যেমন এজেন্টকে তার সিস্টেম প্রম্পট প্রকাশ করতে বলা বা ইউআরএল সেগমেন্টের মাধ্যমে তথ্য পাচার করা, মডেলগুলোর পক্ষে ধরতে সবচেয়ে সহজগুলোর মধ্যে একটি। এর বিপরীতে, বহুভাষিক আক্রমণ এবং পরোক্ষ বা কাল্পনিক নির্দেশনা হিসেবে লেখা আক্রমণগুলো উল্লেখযোগ্যভাবে কঠিন, কারণ সেগুলো অনেক ডিটেক্টর অন্তর্নিহিতভাবে নির্ভর করে এমন স্পষ্ট কিওয়ার্ডগুলো এড়িয়ে চলে।
অবস্থানও গুরুত্বপূর্ণ। কমেন্টে লুকিয়ে থাকা আক্রমণগুলো তুলনামূলকভাবে ভালোভাবে শনাক্ত করা হয়, অন্যদিকে দৃশ্যমান ফুটার, টেবিল সেল বা ইনলাইন প্যারাগ্রাফে পুনরায় লেখা সংস্করণগুলো অনেক বেশি কঠিন প্রমাণিত হয়, যা "লুকানো" ইনজেকশনের প্রতি একটি কাঠামোগত পক্ষপাত প্রকাশ করে। ভালোভাবে ডিজাইন করা উদাহরণের ওপর সতর্ক প্রশিক্ষণ এই প্যাটার্নগুলো শনাক্ত করার মডেলগুলোর ক্ষমতা উল্লেখযোগ্যভাবে উন্নত করতে পারে।
BrowseSafe দিয়ে নিরাপদ এজেন্ট তৈরি করুন
BrowseSafe এবং BrowseSafe-Bench সম্পূর্ণ ওপেন-সোর্স। স্বায়ত্তশাসিত এজেন্ট তৈরি করে এমন যেকোনো ডেভেলপার অবিলম্বে প্রম্পট ইনজেকশনের বিরুদ্ধে তাদের সিস্টেমকে শক্তিশালী করতে পারেন—শুরু থেকে নিরাপত্তা রেল তৈরি করার কোনো প্রয়োজন নেই। ওপেন-ওয়েট ডিটেকশন মডেলটি স্থানীয়ভাবে চলে এবং আপনার এজেন্টের মূল লজিক পর্যন্ত পৌঁছানোর আগেই ক্ষতিকর নির্দেশনাগুলোকে ফ্ল্যাগ করে, যা ব্যবহারকারীদের ধীরগতির না করেই প্রতিটি পেজ স্ক্যান করার জন্য যথেষ্ট দ্রুত।
স্ট্যান্ডার্ড এলএলএমগুলোকে ভেঙে দেয় এমন অগোছালো এইচটিএমএল ট্র্যাপগুলোর বিরুদ্ধে আপনার নিজস্ব মডেলগুলোকে স্ট্রেস-টেস্ট করতে BrowseSafe-Bench-এর ১৪,০০০+ বাস্তব বিশ্বের আক্রমণ পরিস্থিতি ব্যবহার করুন। আমাদের চাংকিং এবং প্যারালাল স্ক্যানিং কৌশলগুলো এজেন্টদের বিশাল, অবিশ্বস্ত পেজগুলো দক্ষতার সাথে প্রক্রিয়া করতে দেয়—ব্যবহারকারীদের বিপদের মুখে না ফেলেই শক্তিশালী ব্রাউজিং ক্ষমতা প্রদান করে। BrowseSafe এবং BrowseSafe-Bench কীভাবে তৈরি করেছি সে সম্পর্কে আরও জানতে, Perplexity Research ব্লগ দেখুন।