BrowseSafe ഉപയോഗിച്ച് സുരക്ഷിതമായ AI ബ്രൗസറുകൾ നിർമ്മിക്കുന്നു
വെബ് പേജുകളിൽ ഒളിഞ്ഞിരിക്കുന്ന ദോഷകരമായ നിർദ്ദേശങ്ങൾ കണ്ടെത്തുന്നതിനുള്ള ഞങ്ങളുടെ ഓപ്പൺ ഡിറ്റക്ഷൻ മോഡലും ബെഞ്ച്മാർക്കുമാണ് BrowseSafe.

ഇന്ന്, ഏജന്റ് വെബിൽ നാവിഗേറ്റ് ചെയ്യുമ്പോൾ ഉപയോക്താക്കളെ സുരക്ഷിതമായി നിലനിർത്താൻ ലക്ഷ്യമിട്ടുള്ള ഒരു ഓപ്പൺ റിസർച്ച് ബെഞ്ച്മാർക്കും ഉള്ളടക്ക കണ്ടെത്തൽ മോഡലുമായ BrowseSafe ഞങ്ങൾ പുറത്തിറക്കുന്നു.
AI അസിസ്റ്റന്റുകൾ തിരയൽ പെട്ടിയിൽ നിന്ന് ബ്രൗസറിലേക്ക് തന്നെ നീങ്ങുമ്പോൾ, വെബിന്റെ അടുത്ത തലമുറ പേജുകളിൽ നിന്ന് ഏജന്റുകളിലേക്ക് മാറും എന്ന് ഞങ്ങൾ പ്രതീക്ഷിക്കുന്നു: വിവരങ്ങൾ എവിടെ സ്ഥിതിചെയ്യുന്നു എന്നതിനേക്കാൾ, ആരാണ് അത് വീണ്ടെടുക്കുന്നതും അതിൽ പ്രവർത്തിക്കുന്നതും എന്നതിനെക്കുറിച്ചാണ്. Comet ഒരു അസിസ്റ്റന്റിന് വെറും ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുക മാത്രമല്ല, ടാസ്കുകൾ നിർവഹിക്കാൻ കഴിയുന്ന ഒരു ഇടമാക്കി ബ്രൗസറിനെ മാറ്റുന്നു, അതിനാൽ ഒരു തത്വം വിട്ടുവീഴ്ച ചെയ്യാനാവാത്തതാണ്: ഇത് എപ്പോഴും ഉപയോക്താവിന്റെ പക്ഷത്ത് തന്നെ നിൽക്കണം.
BrowseSafe: തത്സമയ ഉള്ളടക്ക സ്കാനിംഗിലൂടെ ഏജന്റുകളെയും ഉപയോക്താക്കളെയും സംരക്ഷിക്കുന്നു
BrowseSafe എന്നത് ഒരൊറ്റ കേന്ദ്രീകൃത ചോദ്യത്തിന് ഉത്തരം നൽകാൻ ഫൈൻ-ട്യൂൺ ചെയ്ത ഒരു ഡിറ്റക്ഷൻ മോഡലാണ്: ഒരു പേജിന്റെ HTML നൽകിയാൽ, അതിൽ ഏജന്റിനെ ലക്ഷ്യമിട്ടുള്ള ദോഷകരമായ നിർദ്ദേശങ്ങൾ അടങ്ങിയിട്ടുണ്ടോ? വലിയ ജനറൽ പർപ്പസ് മോഡലുകൾക്ക് ഈ കേസുകളെക്കുറിച്ച് നന്നായി ചിന്തിക്കാൻ കഴിയും, എന്നാൽ എല്ലാ പേജിലും പ്രവർത്തിപ്പിക്കാൻ അവ വളരെ മന്ദഗതിയിലുള്ളതും ചെലവേറിയതുമാണ്. ബ്രൗസറിന്റെ വേഗത കുറയ്ക്കാതെ BrowseSafe മുഴുവൻ വെബ് പേജുകളും തത്സമയം സ്കാൻ ചെയ്യുന്നു. പ്രതിരോധ ഫലപ്രാപ്തി വിലയിരുത്തുന്നതിനും മെച്ചപ്പെടുത്തുന്നതിനുമുള്ള ഒരു വിഭവമായി ഞങ്ങൾ BrowseSafe‑Bench മൂല്യനിർണ്ണയ സ്യൂട്ടും പുറത്തിറക്കുന്നു.
ട്രസ്റ്റ് ബൗണ്ടറികളും ലേയേർഡ് പ്രതിരോധങ്ങളും
എന്നിരുന്നാലും, AI ബ്രൗസിംഗിന്റെ ഒരു പുതിയ തലമുറ എന്നാൽ ഉപയോക്താക്കളെ സുരക്ഷിതമായി നിലനിർത്തുന്നതിന് പുതിയ സമീപനങ്ങൾ ആവശ്യമുള്ള സൈബർ സുരക്ഷാ ഭീഷണികളുടെ ഒരു പുതിയ തലമുറ കൂടിയാണ്. ഒരു മുൻ പോസ്റ്റിൽ, ഒരു വെബ്സൈറ്റ് പ്രോംപ്റ്റ് ഇൻജെക്ഷൻ ഉപയോഗിച്ച് ഹൈജാക്ക് ചെയ്യാൻ ശ്രമിക്കുമ്പോഴും, ഉപയോക്താവ് ആവശ്യപ്പെട്ടത് തന്നെ അസിസ്റ്റന്റ് ചെയ്യുന്നത് തുടരാൻ Comet ഒന്നിലധികം സംരക്ഷണ പാളികൾ എങ്ങനെ ഉപയോഗിക്കുന്നു എന്ന് ഞങ്ങൾ വിശദീകരിച്ചിരുന്നു. ഇന്ന് ഞങ്ങൾ ആ പ്രശ്നം എങ്ങനെ പരിഹരിക്കുന്നു എന്ന് സൂക്ഷ്മമായി പരിശോധിക്കുന്നു: ആ ഭീഷണികൾ എങ്ങനെ നിർവചിക്കപ്പെടുന്നു, യഥാർത്ഥ ലോക ആക്രമണങ്ങൾക്കെതിരെ എങ്ങനെ പരീക്ഷിക്കപ്പെടുന്നു, കൂടാതെ ബ്രൗസറിൽ സുരക്ഷിതമായി പ്രവർത്തിക്കാൻ വേഗത്തിൽ മോശമായ നിർദ്ദേശങ്ങൾ കണ്ടെത്താനും തടയാനും കഴിയുന്ന പ്രത്യേക മോഡലുകളെ പരിശീലിപ്പിക്കാൻ എങ്ങനെ ഉപയോഗിക്കുന്നു.
ബ്രൗസർ പ്രോംപ്റ്റ് ഇൻജെക്ഷൻ എങ്ങനെ പ്രവർത്തിക്കുന്നു
AI വായിക്കുന്ന വാചകത്തിൽ ഉൾച്ചേർത്ത ദോഷകരമായ ഭാഷയാണ് പ്രോംപ്റ്റ് ഇൻജെക്ഷൻ, അത് അതിന്റെ യഥാർത്ഥ ഉദ്ദേശ്യത്തെ അസാധുവാക്കാൻ രൂപകൽപ്പന ചെയ്തിരിക്കുന്നു. ബ്രൗസറിൽ, ഏജന്റുകൾ മുഴുവൻ പേജുകളും വായിക്കുന്നു, അതിനാൽ അഭിപ്രായങ്ങൾ, ടെംപ്ലേറ്റുകൾ അല്ലെങ്കിൽ നീളമുള്ള അടിക്കുറിപ്പുകൾ എന്നിവപോലെയുള്ള സ്ഥലങ്ങളിൽ ആക്രമണങ്ങൾക്ക് ഒളിച്ചിരിക്കാൻ കഴിയും.
ഏജന്റിനെ നിശബ്ദമായി വഴിതിരിച്ചുവിടുന്ന നിർദ്ദേശങ്ങൾ ഒളിപ്പിച്ചു കടത്താൻ ആക്രമണകാരികൾ ആ ഇടങ്ങൾ ഉപയോഗിക്കുന്നു. മിക്ക ആളുകളും ഒരിക്കലും ശ്രദ്ധിക്കാത്ത ഉള്ളടക്കം ഉൾപ്പെടെ എല്ലാ കാര്യങ്ങളും അത് വായിക്കുന്നതിനാൽ, ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങളില്ലാതെ ആ സന്ദേശങ്ങൾക്ക് പെരുമാറ്റത്തെ ഹൈജാക്ക് ചെയ്യാൻ കഴിയും.
ഈ ആക്രമണങ്ങൾ പലപ്പോഴും പ്രകടമായ ശൈലികൾ ഒഴിവാക്കുകയും മിനുക്കിയതോ ബഹുഭാഷാ ഉള്ളതോ ആയ വാചകങ്ങളിൽ എഴുതപ്പെടുകയും ചെയ്യാം, അല്ലെങ്കിൽ ബ്രൗസറുകൾ ദൃശ്യപരമായി റെൻഡർ ചെയ്യാത്തതും എന്നാൽ ഏജന്റുകൾ ഇപ്പോഴും പാഴ്സ് ചെയ്യുന്നതുമായ ഡാറ്റ ആട്രിബ്യൂട്ടുകൾ അല്ലെങ്കിൽ ഫോം ഫീൽഡുകൾ പോലുള്ള സ്ക്രീനിൽ ഒരിക്കലും ദൃശ്യമാകാത്ത HTML ഘടകങ്ങളിൽ സ്ഥാപിക്കുകയും ചെയ്യാം.
BrowseSafe-Bench: യഥാർത്ഥ ലോക പരിതസ്ഥിതികളിൽ ഏജന്റ് സുരക്ഷ മുന്നോട്ട് കൊണ്ടുപോകുന്നു
യഥാർത്ഥ വെബ് പോലെ തോന്നിക്കുന്ന ഒരു ക്രമീകരണത്തിൽ ഈ ആക്രമണങ്ങൾ പഠിക്കാൻ, ഞങ്ങൾ BrowseSafe നിർമ്മിച്ചു, അത് ഞങ്ങൾ പരിശീലിപ്പിക്കുകയും ഓപ്പൺ സോഴ്സ് ചെയ്യുകയും ചെയ്ത ഒരു ഡിറ്റക്ഷൻ മോഡലാണ്, കൂടാതെ ഉൽപ്പാദന പേജുകളെ അനുകരിക്കുന്ന 14,719 ഉദാഹരണങ്ങളുടെ പൊതു ബെഞ്ച്മാർക്കായ BrowseSafe‑Bench ഉം നിർമ്മിച്ചു. ഇതിൽ സങ്കീർണ്ണമായ HTML, ശബ്ദമുണ്ടാക്കുന്ന ഉള്ളടക്കം, മൂന്ന് അക്ഷങ്ങളിൽ വ്യത്യാസപ്പെടുന്ന ദോഷകരവും നിരുപദ്രവകരവുമായ സാമ്പിളുകളുടെ മിശ്രിതം എന്നിവ ഉൾപ്പെടുന്നു: ആക്രമണകാരി എന്ത് ചെയ്യാൻ ശ്രമിക്കുന്നു, പേജിൽ നിർദ്ദേശം എവിടെയാണ് ഇരിക്കുന്നത്, ഭാഷ എങ്ങനെയാണ് എഴുതിയിരിക്കുന്നത്.
ബെഞ്ച്മാർക്കിൽ 11 ആക്രമണ തരങ്ങൾ, മറഞ്ഞിരിക്കുന്ന ഫീൽഡുകൾ മുതൽ ദൃശ്യമായ段落കൾ, അടിക്കുറിപ്പുകൾ വരെയുള്ള ഒമ്പത് ഇൻജെക്ഷൻ തന്ത്രങ്ങൾ, വ്യക്തമായ കമാൻഡുകൾ മുതൽ പരോക്ഷവും കാമൗഫ്ലേജ് ചെയ്തതുമായ വാചകം വരെയുള്ള മൂന്ന് ഭാഷാ ശൈലികൾ എന്നിവ ഉൾപ്പെടുന്നു.
ആഴത്തിലുള്ള പ്രതിരോധ സമീപനം
ഞങ്ങളുടെ ഭീഷണി മാതൃകയിൽ, അസിസ്റ്റന്റ് തന്നെ വിശ്വസനീയമായ ഒരു പരിസ്ഥിതിയിലാണ് വരുന്നത്, എന്നാൽ വെബിൽ നിന്ന് വരുന്ന ഏതും വിശ്വസനീയമല്ല. ആക്രമണകാരികൾ മുഴുവൻ സൈറ്റുകളും നിയന്ത്രിക്കാം അല്ലെങ്കിൽ അസിസ്റ്റന്റ് സന്ദർശിക്കുന്ന ഉപദ്രവകരമല്ലാത്ത പേജുകളിലേക്ക് ഉൽപ്പന്ന വിവരണങ്ങൾ, അഭിപ്രായങ്ങൾ, പോസ്റ്റുകൾ തുടങ്ങിയ ഉള്ളടക്കം ഇൻജക്റ്റ് ചെയ്യാം. ആ അപകടസാധ്യത കൈകാര്യം ചെയ്യുന്നതിനായി, വെബ് പേജുകൾ, ഇമെയിലുകൾ അല്ലെങ്കിൽ ഫയലുകൾ പോലുള്ള വിശ്വസനീയമല്ലാത്ത ഉള്ളടക്കം തിരികെ നൽകാൻ കഴിയുന്ന ഉപകരണങ്ങൾ ഫ്ലാഗ് ചെയ്യപ്പെടുന്നു, കൂടാതെ ഏജന്റിന് അവ വായിക്കുന്നതിനോ പ്രവർത്തിക്കുന്നതിനോ മുമ്പ് അവയുടെ റോ ഔട്ട്പുട്ടുകൾ എപ്പോഴും BrowseSafe സ്കാൻ ചെയ്യുന്നു.
വിപുലമായ പ്രതിരോധ സമീപനത്തിലെ ഒരു പാളിയാണ് BrowseSafe. ഉപയോഗിക്കുന്നതിന് മുമ്പ് റോ ഉള്ളടക്കം സ്കാൻ ചെയ്യപ്പെടുന്നു, ടൂൾ അനുമതികൾ സ്ഥിരമായി പരിമിതപ്പെടുത്തിയിരിക്കുന്നു, കൂടാതെ സെൻസിറ്റീവ് പ്രവർത്തനങ്ങൾക്ക് വ്യക്തമായ ഉപയോക്തൃ സ്ഥിരീകരണം ആവശ്യമായി വരാം, എല്ലാം നിലവിലുള്ള ബ്രൗസർ സുരക്ഷാ സവിശേഷതകൾക്ക് മുകളിലാണ്. ആഴത്തിലുള്ള പ്രതിരോധം സുരക്ഷയ്ക്കായി കഴിവുകൾ കൈമാറാതെ തന്നെ ശക്തമായ ബ്രൗസർ അസിസ്റ്റന്റുകൾ സ്വീകരിക്കാൻ ഉപയോക്താക്കളെ പ്രാപ്തരാക്കുന്നു.
ആക്രമണ ഫലപ്രാപ്തിയെ സ്വാധീനിക്കുന്നത് എന്താണ്?
BrowseSafe‑Bench ലെ മൂല്യനിർണ്ണയ ഫലങ്ങൾ വ്യക്തമായ പാറ്റേണുകൾ കാണിക്കുന്നു. സിസ്റ്റം പ്രോംപ്റ്റ് വെളിപ്പെടുത്താനോ URL സെഗ്മെന്റുകൾ വഴി വിവരങ്ങൾ ചോർത്താനോ ഏജന്റിനോട് ആവശ്യപ്പെടുന്നത് പോലെയുള്ള നേരിട്ടുള്ള ആക്രമണങ്ങൾ, മോഡലുകൾക്ക് പിടിക്കാൻ ഏറ്റവും എളുപ്പമുള്ളവയിൽ പെടുന്നു. ഇതിനു വിപരീതമായി, ബഹുഭാഷാ ആക്രമണങ്ങളും പരോക്ഷമോ അനുമാനപരമോ ആയ നിർദ്ദേശങ്ങളായി എഴുതിയവയും ഗണ്യമായി ബുദ്ധിമുട്ടാണ്, കാരണം പല ഡിറ്റക്ടറുകളും പരോക്ഷമായി ആശ്രയിക്കുന്ന പ്രകടമായ കിവർഡുകൾ അവ ഒഴിവാക്കുന്നു.
സ്ഥാപനവും പ്രധാനമാണ്. കമന്റുകളിൽ ഒളിപ്പിച്ചിരിക്കുന്ന ആക്രമണങ്ങൾ താരതമ്യേന നന്നായി കണ്ടെത്തപ്പെടുന്നു, അതേസമയം ദൃശ്യമായ അടിക്കുറിപ്പുകൾ, ടേബിൾ സെല്ലുകൾ അല്ലെങ്കിൽ ഇൻലൈൻ പാരഗ്രാഫുകൾ എന്നിവയിലേക്ക് പുനർഎഴുതിയ പതിപ്പുകൾ വളരെ ബുദ്ധിമുട്ടാണെന്ന് തെളിയിക്കുന്നു, ഇത് "മറഞ്ഞിരിക്കുന്ന" ഇൻജെക്ഷനുകളിലേക്ക് ഒരു ഘടനാപരമായ പക്ഷപാതം വെളിപ്പെടുത്തുന്നു. നന്നായി രൂപകൽപ്പന ചെയ്ത ഉദാഹരണങ്ങളിലെ ശ്രദ്ധാപൂർവ്വമായ പരിശീലനത്തിന് ഈ പാറ്റേണുകൾ കണ്ടെത്താനുള്ള മോഡലുകളുടെ കഴിവ് ഗണ്യമായി മെച്ചപ്പെടുത്താൻ കഴിയും.
BrowseSafe ഉപയോഗിച്ച് സുരക്ഷിതമായ ഏജന്റുകൾ നിർമ്മിക്കുക
BrowseSafe ഉം BrowseSafe-Bench ഉം പൂർണ്ണമായും ഓപ്പൺ സോഴ്സ് ആണ്. ഓട്ടോണമസ് ഏജന്റുകൾ നിർമ്മിക്കുന്ന ഏത് ഡെവലപ്പർക്കും പ്രോംപ്റ്റ് ഇൻജെക്ഷനെതിരെ അവരുടെ സിസ്റ്റങ്ങൾ ഉടൻ തന്നെ ശക്തമാക്കാം—സുരക്ഷാ റെയിലുകൾ ആദ്യം മുതൽ നിർമ്മിക്കേണ്ട ആവശ്യമില്ല. ഓപ്പൺ-വെയ്റ്റ് ഡിറ്റക്ഷൻ മോഡൽ ലോക്കലായി പ്രവർത്തിക്കുകയും നിങ്ങളുടെ ഏജന്റിന്റെ കോർ ലോജിക്കിൽ എത്തുന്നതിന് മുമ്പ് ദോഷകരമായ നിർദ്ദേശങ്ങൾ ഫ്ലാഗ് ചെയ്യുകയും ചെയ്യുന്നു, ഉപയോക്താക്കളുടെ വേഗത കുറയ്ക്കാതെ ഓരോ പേജും സ്കാൻ ചെയ്യാൻ പര്യാപ്തമാണ്.
സാധാരണ LLM-കളെ തകർക്കുന്ന കുഴപ്പമുള്ള HTML കെണികൾക്കെതിരെ നിങ്ങളുടെ സ്വന്തം മോഡലുകളെ സ്ട്രെസ്-ടെസ്റ്റ് ചെയ്യാൻ BrowseSafe-Bench-ന്റെ 14,000+ യഥാർത്ഥ ലോക ആക്രമണ സാഹചര്യങ്ങൾ ഉപയോഗിക്കുക. ഞങ്ങളുടെ ചങ്കിങ്ങും പാരലൽ സ്കാനിംഗ് സാങ്കേതികവിദ്യകളും ഏജന്റുകളെ വലിയ, വിശ്വസനീയമല്ലാത്ത പേജുകൾ കാര്യക്ഷമമായി പ്രോസസ്സ് ചെയ്യാൻ അനുവദിക്കുന്നു—ഉപയോക്താക്കളെ അപകടത്തിന് വിധേയമാക്കാതെ ശക്തമായ ബ്രൗസിംഗ് കഴിവുകൾ.
Browse ഞങ്ങൾ നിർമ്മിച്ചതിനെക്കുറിച്ചും BrowseSafe-Bench-നെക്കുറിച്ചും കൂടുതൽ അറിയാൻ, Perplexity റിസർച്ച് ബ്ലോഗ് പരിശോധിക്കുക.