Κατασκευή ασφαλέστερων προγραμμάτων περιήγησης AI με το BrowseSafe
Το BrowseSafe είναι το ανοιχτό μας μοντέλο ανίχνευσης και benchmark για τον εντοπισμό κακόβουλων οδηγιών που είναι κρυμμένες σε ιστοσελίδες.

Σήμερα κυκλοφορούμε το BrowseSafe, ένα ανοιχτό ερευνητικό πρότυπο μέτρησης (benchmark) και ένα μοντέλο ανίχνευσης περιεχομένου με στόχο τη διατήρηση της ασφάλειας των χρηστών καθώς πλοηγούνται στον ιστό των αυτόνομων πρακτόρων (agentic web).
Καθώς οι βοηθοί τεχνητής νοημοσύνης μετακινούνται από τα πλαίσια αναζήτησης απευθείας στον περιηγητή (browser), αναμένουμε ότι η επόμενη γενιά του διαδικτύου θα μετατοπιστεί από τις σελίδες στους πράκτορες: λιγότερο σχετικά με το πού βρίσκεται η πληροφορία και περισσότερο σχετικά με το ποιος την ανακτά και ενεργεί βάσει αυτής. Το Comet μετατρέπει τον περιηγητή σε έναν χώρο όπου ένας βοηθός μπορεί να διεκπεραιώνει εργασίες, όχι απλώς να απαντά σε ερωτήσεις, επομένως η μία αρχή είναι αδιαπραγμάτευτη: πρέπει να παραμένει στην πλευρά του χρήστη.
BrowseSafe: προστασία πρακτόρων και χρηστών μέσω σάρωσης περιεχομένου σε πραγματικό χρόνο
Το BrowseSafe είναι ένα μοντέλο ανίχνευσης βελτιστοποιημένο (fine-tuned) ώστε να απαντά σε μια συγκεκριμένη, εστιασμένη ερώτηση: δεδομένης της HTML μιας σελίδας, περιέχει κακόβουλες οδηγίες που απευθύνονται στον πράκτορα; Τα μεγάλα μοντέλα γενικής χρήσης μπορούν να αξιολογήσουν καλά αυτές τις περιπτώσεις, αλλά είναι συχνά πολύ αργά και δαπανηρά για να εκτελούνται σε κάθε σελίδα. Το BrowseSafe σαρώνει ολόκληρες ιστοσελίδες σε πραγματικό χρόνο χωρίς να επιβραδύνει τον περιηγητή. Επίσης, κυκλοφορούμε τη σουίτα αξιολόγησης BrowseSafe‑Bench ως πόρο για την αξιολόγηση και τη βελτίωση της αποτελεσματικότητας της άμυνας.
Όρια εμπιστοσύνης και πολυεπίπεδη άμυνα
Ωστόσο, μια νέα γενιά περιήγησης με τεχνητή νοημοσύνη σημαίνει επίσης μια νέα γενιά απειλών κυβερνοασφάλειας που απαιτούν νέες προσεγγίσεις για τη διατήρηση της ασφάλειας των χρηστών. Σε μια προηγούμενη δημοσίευση, εξετάσαμε πώς το Comet χρησιμοποιεί πολλαπλά επίπεδα προστασίας για να διατηρεί τον βοηθό επικεντρωμένο σε αυτό που ζήτησε ο χρήστης, ακόμη και όταν ένας ιστότοπος προσπαθεί να τον θέσει υπό έλεγχο με injection προτροπών (prompt injection). Σήμερα εστιάζουμε στον τρόπο με τον οποίο αντιμετωπίζουμε αυτό το πρόβλημα: πώς ορίζονται αυτές οι απειλές, πώς δοκιμάζονται έναντι επιθέσεων του πραγματικού κόσμου και πώς χρησιμοποιούνται για την εκπαίδευση εξειδικευμένων μοντέλων που μπορούν να εντοπίζουν και να σταματούν κακόβουλες οδηγίες αρκετά γρήγορα ώστε να εκτελούνται με ασφάλεια στον περιηγητή.
Πώς λειτουργεί το prompt injection στον περιηγητή
Το prompt injection είναι κακόβουλη γλώσσα ενσωματωμένη στο κείμενο που διαβάζει η τεχνητή νοημοσύνη, σχεδιασμένη να παρακάμπτει την αρχική της πρόθεση. Στον περιηγητή, οι πράκτορες διαβάζουν ολόκληρες σελίδες, επομένως οι επιθέσεις μπορούν να κρυφτούν σε σημεία όπως σχόλια, πρότυπα (templates) ή μακροσκελή υποσέλιδα.
Οι επιτιθέμενοι χρησιμοποιούν αυτά τα σημεία για να εισάγουν διακριτικά οδηγίες που ανακατευθύνουν τον πράκτορα. Επειδή διαβάζει τα πάντα, συμπεριλαμβανομένου περιεχομένου που οι περισσότεροι άνθρωποι δεν προσέχουν ποτέ, αυτά τα μηνύματα μπορούν να αλλοιώσουν τη συμπεριφορά χωρίς ισχυρές δικλίδες ασφαλείας.
Αυτές οι επιθέσεις συχνά αποφεύγουν προφανείς φράσεις και μπορούν να γραφτούν σε εξεζητημένο ή πολυγλωσσικό κείμενο, ή να τοποθετηθούν σε στοιχεία HTML που δεν εμφανίζονται ποτέ στην οθόνη, όπως γνωρίσματα δεδομένων (data attributes) ή πεδία φόρμων τα οποία οι περιηγητές δεν αποδίδουν ορατά, αλλά οι πράκτορες εξακολουθούν να αναλύουν.
BrowseSafe-Bench: προώθηση της ασφάλειας πρακτόρων σε περιβάλλοντα του πραγματικού κόσμου
Για να μελετήσουμε αυτές τις επιθέσεις σε ένα περιβάλλον που μοιάζει με τον πραγματικό ιστό, δημιουργήσαμε το BrowseSafe, ένα μοντέλο ανίχνευσης που εκπαιδεύσαμε και διαθέσαμε ως ανοιχτού κώδικα, και το BrowseSafe‑Bench, ένα δημόσιο πρότυπο μέτρησης (benchmark) 14.719 παραδειγμάτων που μιμούνται σελίδες παραγωγής. Περιλαμβάνει πολύ σύνθετη HTML, θορυβώδες περιεχομένο και έναν συνδυασμό κακόβουλων και ακίνδυνων δειγμάτων που ποικίλλουν κατά μήκος τριών αξόνων: τι προσπαθεί να κάνει ο επιτιθέμενος, πού βρίσκεται η οδηγία στη σελίδα και πώς είναι γραμμένη η γλώσσα.
Το πρότυπο μέτρησης περιλαμβάνει 11 τύπους επιθέσεων, εννέα στρατηγικές injection που εκτείνονται από κρυφά πεδία έως ορατές παραγράφους και υποσέλιδα, και τρία γλωσσικά στυλ, από ρητές εντολές έως έμμεσο, καμουφλαρισμένο κείμενο.
Μια προσέγγιση άμυνας σε βάθος
Στο μοντέλο απειλών μας, ο ίδιος ο βοηθός βρίσκεται σε ένα έμπιστο περιβάλλον, αλλά οτιδήποτε προέρχεται από τον ιστό δεν είναι έμπιστο. Οι επιτιθέμενοι ενδέχεται να ελέγχουν ολόκληρους ιστότοπους ή απλώς να εισάγουν περιεχόμενο, όπως περιγραφές προϊόντων, σχόλια και δημοσιεύσεις σε κατά τα άλλα αβλαβείς σελίδες που επισκέπτεται ο βοηθός. Για τη διαχείριση αυτού του κινδύνου, τα εργαλεία που μπορούν να επιστρέψουν μη έμπιστο περιεχόμενο, όπως ιστοσελίδες, μηνύματα ηλεκτρονικού ταχυδρομείου ή αρχεία, επισημαίνονται και τα ακατέργαστα αποτελέσματά τους σαρώνονται πάντα από το BrowseSafe προτού ο πράκτορας μπορέσει να τα διαβάσει ή να ενεργήσει βάσει αυτών.
Το BrowseSafe αποτελεί ένα επίπεδο σε μια ευρύτερη προσέγγιση άμυνας. Το ακατέργαστο περιεχόμενο σαρώνεται πριν από τη χρήση, τα δικαιώματα των εργαλείων περιορίζονται από προεπιλογή και οι ευαίσθητες ενέργειες ενδέχεται να απαιτούν ρητή επιβεβαίωση από τον χρήστη, όλα αυτά επιπλέον των υπαρχόντων χαρακτηριστικών ασφαλείας του περιηγητή. Η άμυνα σε βάθος επιτρέπει στους χρήστες να υιοθετούν ισχυρούς βοηθούς περιηγητή χωρίς να θυσιάζουν την ασφάλεια χάριν της λειτουργικότητας.
Τι επηρεάζει την αποτελεσματικότητα των επιθέσεων;
Τα αποτελέσματα της αξιολόγησης στο BrowseSafe‑Bench δείχνουν σαφή μοτίβα. Οι άμεσες επιθέσεις, όπως το να ζητείται από τον πράκτορα να αποκαλύψει την προτροπή συστήματος (system prompt) του ή να εξαγάγει πληροφορίες μέσω τμημάτων URL, συγκαταλέγονται μεταξύ των ευκολότερων για τα μοντέλα να εντοπίσουν. Αντίθετα, οι πολυγλωσσικές επιθέσεις και εκείνες που είναι γραμμένες ως έμμεσες ή υποθετικές οδηγίες είναι σημαντικά πιο δύσκολες, επειδή αποφεύγουν τις προφανείς λέξεις-κλειδιά στις οποίες βασίζονται σιωπηρά πολλοί ανιχνευτές.
Η τοποθέτηση έχει επίσης σημασία. Οι επιθέσεις που είναι κρυμμένες σε σχόλια ανιχνεύονται σχετικά καλά, ενώ οι εκδοχές που επανεγγραφούν σε ορατά υποσέλιδα, κελιά πινάκων ή ενσωματωμένες παραγράφους αποδεικνύονται πολύ πιο δύσκολες, αποκαλύπτοντας μια δομική προκατάληψη προς τα «κρυφά» injections. Η προσεκτική εκπαίδευση σε καλά σχεδιασμένα παραδείγματα μπορεί να βελτιώσει σημαντικά την ικανότητα των μοντέλων να εντοπίζουν αυτά τα μοτίβα.
Δημιουργήστε ασφαλέστερους πράκτορες με το BrowseSafe
Το BrowseSafe και το BrowseSafe-Bench διατίθενται πλήρως ως ανοιχτός κώδικας. Οποιοσδήποτε προγραμματιστής κατασκευάζει αυτόνομους πράκτορες μπορεί να θωρακίσει άμεσα τα συστήματά του έναντι του prompt injection — δεν χρειάζεται να κατασκευάσει δικλίδες ασφαλείας από την αρχή. Το μοντέλο ανίχνευσης ανοιχτών βαρών (open-weight) εκτελείται τοπικά και επισημαίνει κακόβουλες οδηγίες προτού φτάσουν στη βασική λογική του πράκτορά σας, αρκετά γρήγορα ώστε να σαρώνει κάθε σελίδα χωρίς να επιβραδύνει τους χρήστες.
Χρησιμοποιήστε τα 14.000+ σενάρια επιθέσεων πραγματικού κόσμου του BrowseSafe-Bench για να κάνετε stress-test στα δικά σας μοντέλα έναντι των ακατάστατων παγίδων HTML που χαλάνε τα τυπικά LLM. Οι τεχνικές τεμαχισμού (chunking) και παράλληλης σάρωσης που διαθέτουμε επιτρέπουν στους πράκτορες να επεξεργάζονται τεράστιες, μη έμπιστες σελίδες αποτελεσματικά — ισχυρές δυνατότητες περιήγησης χωρίς να εκτίθενται οι χρήστες σε κίνδυνο.
Για να μάθετε περισσότερα σχετικά με το πώς κατασκευάσαμε το BrowseSafe και το BrowseSafe-Bench, δείτε το ισλόλογο (blog) του Perplexity Research.