Xây dựng trình duyệt AI an toàn hơn với BrowseSafe
BrowseSafe là mô hình phát hiện và chuẩn mực mở của chúng tôi để bắt các hướng dẫn độc hại ẩn trong các trang web.

Hôm nay, chúng tôi ra mắt BrowseSafe, một mô hình phát hiện nội dung và chuẩn mực nghiên cứu mở nhằm giữ an toàn cho người dùng khi họ duyệt web theo tác nhân (agentic web).
Khi các trợ lý AI chuyển từ hộp tìm kiếm vào thẳng trình duyệt, chúng tôi kỳ vọng thế hệ web tiếp theo sẽ chuyển dịch từ các trang web sang các tác nhân: ít tập trung hơn vào nơi lưu trữ thông tin, và tập trung nhiều hơn vào đối tượng truy xuất và thực hiện hành động trên thông tin đó. Comet biến trình duyệt thành nơi mà trợ lý có thể hoàn thành các tác vụ thay vì chỉ trả lời câu hỏi, vì vậy có một nguyên tắc không thể thương lượng: trợ lý phải luôn đứng về phía người dùng.
BrowseSafe: bảo vệ các tác nhân và người dùng thông qua việc quét nội dung thời gian thực
BrowseSafe là một mô hình phát hiện được tinh chỉnh để trả lời một câu hỏi tập trung duy nhất: dựa trên mã HTML của một trang web, trang đó có chứa các hướng dẫn độc hại nhằm vào tác nhân hay không? Các mô hình đa năng cỡ lớn có thể lý luận tốt về các trường hợp này, nhưng chúng thường quá chậm và tốn kém để chạy trên mọi trang web. BrowseSafe quét toàn bộ trang web trong thời gian thực mà không làm chậm trình duyệt. Chúng tôi cũng phát hành bộ đánh giá BrowseSafe‑Bench như một nguồn tài nguyên để đánh giá và nâng cao hiệu quả phòng thủ.
Ranh giới tin cậy và các lớp phòng thủ
Tuy nhiên, một thế hệ duyệt web hỗ trợ AI mới cũng đồng nghĩa với một thế hệ mối đe dọa an ninh mạng mới đòi hỏi các phương pháp tiếp cận mới để giữ an toàn cho người dùng. Trong một bài viết trước, chúng tôi đã điểm qua cách Comet sử dụng nhiều lớp bảo vệ để giữ cho trợ lý thực hiện đúng những gì người dùng yêu cầu, ngay cả khi một trang web cố gắng chiếm quyền điều khiển bằng tiêm câu lệnh nhắc (prompt injection). Hôm nay, chúng tôi sẽ đi sâu vào cách chúng tôi giải quyết vấn đề đó: cách các mối đe dọa đó được định nghĩa, thử nghiệm chống lại các cuộc tấn công thực tế, và được sử dụng để đào tạo các mô hình chuyên biệt có thể phát hiện và ngăn chặn các hướng dẫn độc hại đủ nhanh để chạy an toàn trong trình duyệt.
Cách hoạt động của tiêm câu lệnh nhắc trên trình duyệt
Tiêm câu lệnh nhắc là ngôn ngữ độc hại được nhúng trong văn bản mà AI đọc, được thiết kế để ghi đè lên ý định ban đầu của nó. Trên trình duyệt, các tác nhân đọc toàn bộ trang, do đó các cuộc tấn công có thể ẩn ở những nơi như bình luận, mẫu (template), hoặc phần chân trang dài.
Kẻ tấn công sử dụng các vị trí đó để lén lút đưa vào các hướng dẫn nhằm chuyển hướng tác nhân một cách âm thầm. Do nó đọc mọi thứ, kể cả nội dung mà hầu hết mọi người không bao giờ để ý, những thông điệp đó có thể chiếm quyền điều khiển hành vi mà không cần các biện pháp bảo vệ mạnh mẽ.
Các cuộc tấn công này thường tránh các cụm từ rõ ràng và có thể được viết bằng văn bản trau chuốt hoặc đa ngôn ngữ, hoặc được đặt trong các phần tử HTML không bao giờ xuất hiện trên màn hình, chẳng hạn như các thuộc tính dữ liệu hoặc trường biểu mẫu mà trình duyệt không hiển thị trực quan nhưng các tác nhân vẫn phân tích cú pháp.
BrowseSafe-Bench: thúc đẩy bảo mật tác nhân trong môi trường thực tế
Để nghiên cứu các cuộc tấn công này trong một thiết lập giống như web thực tế, chúng tôi đã xây dựng BrowseSafe, một mô hình phát hiện mà chúng tôi đã huấn luyện và cấp mã nguồn mở, và BrowseSafe‑Bench, một chuẩn mực công khai gồm 14.719 ví dụ mô phỏng các trang web sản xuất. Nó bao gồm HTML phức tạp, nội dung nhiễu, và sự kết hợp của các mẫu độc hại và vô hại thay đổi theo ba trục: những gì kẻ tấn công cố gắng thực hiện, vị trí của hướng dẫn trong trang, và cách ngôn ngữ được viết.
Chuẩn mực này bao gồm 11 loại tấn công, chín chiến lược tiêm câu lệnh từ các trường ẩn đến các đoạn văn bản hiển thị và chân trang, và ba phong cách ngôn ngữ, từ các lệnh rõ ràng đến văn bản gián tiếp, ngụy trang.
Cách tiếp cận phòng thủ theo chiều sâu
Trong mô hình mối đe dọa của chúng tôi, bản thân trợ lý nằm trong một môi trường đáng tin cậy, nhưng bất cứ thứ gì đến từ web đều không đáng tin cậy. Kẻ tấn công có thể kiểm soát toàn bộ các trang web hoặc chỉ tiêm nội dung, chẳng hạn như mô tả sản phẩm, bình luận và bài đăng vào các trang web vốn dĩ lành tính mà trợ lý truy cập. Để quản lý rủi ro đó, các công cụ có thể trả về nội dung không đáng tin cậy, chẳng hạn như trang web, email hoặc tệp, sẽ được gắn cờ và đầu ra thô của chúng luôn được quét bởi BrowseSafe trước khi tác nhân có thể đọc hoặc thực hiện hành động dựa trên chúng.
BrowseSafe là một lớp trong cách tiếp cận phòng thủ rộng lớn hơn. Nội dung thô được quét trước khi sử dụng, quyền của công cụ bị giới hạn theo mặc định và các hành động nhạy cảm có thể yêu cầu người dùng xác nhận rõ ràng, tất cả đều nằm trên các tính năng bảo mật trình duyệt hiện có. Phòng thủ theo chiều sâu cho phép người dùng áp dụng các trợ lý trình duyệt mạnh mẽ mà không phải đánh đổi tính bảo mật để lấy tính năng.
Điều gì ảnh hưởng đến hiệu quả tấn công?
Kết quả đánh giá trên BrowseSafe‑Bench cho thấy các mẫu rõ ràng. Các cuộc tấn công trực tiếp, như yêu cầu trợ lý tiết lộ câu lệnh hệ thống của nó hoặc lấy cắp thông tin qua các phân đoạn URL, là một trong những trường hợp dễ nhất để các mô hình bắt gặp. Ngược lại, các cuộc tấn công đa ngôn ngữ và những cuộc tấn công được viết dưới dạng hướng dẫn gián tiếp hoặc giả định khó hơn đáng kể, vì chúng tránh các từ khóa rõ ràng mà nhiều trình phát hiện ngầm dựa vào.
Vị trí cũng quan trọng. Các cuộc tấn công ẩn trong bình luận được phát hiện tương đối tốt, trong khi các phiên bản được viết lại thành chân trang hiển thị, ô bảng hoặc đoạn văn bản nội dòng tỏ ra khó khăn hơn nhiều, cho thấy sự thiên lệch cấu trúc đối với các lệnh tiêm "ẩn". Quấn luyện cẩn thận trên các ví dụ được thiết kế tốt có thể cải thiện đáng kể khả năng của mô hình trong việc phát hiện các mẫu này.
Xây dựng các tác nhân an toàn hơn với BrowseSafe
BrowseSafe và BrowseSafe-Bench là mã nguồn mở hoàn toàn. Bất kỳ nhà phát triển nào xây dựng các tác nhân tự động đều có thể ngay lập tức củng cố hệ thống của họ chống lại việc tiêm câu lệnh nhắc—không cần phải xây dựng các rào cản an toàn từ đầu. Mô hình phát hiện trọng số mở chạy cục bộ và gắn cờ các hướng dẫn độc hại trước khi chúng đến logic cốt lõi của tác nhân, đủ nhanh để quét mọi trang mà không làm người dùng chậm lại.
Sử dụng hơn 14.000 kịch bản tấn công thực tế của BrowseSafe-Bench để kiểm tra sức chịu tải của các mô hình của bạn trước các bẫy HTML lộn xộn làm hỏng các LLM tiêu chuẩn. Các kỹ thuật phân đoạn và quét song song của chúng tôi cho phép các tác nhân xử lý các trang lớn, không đáng tin cậy một cách hiệu quả—khả năng duyệt web mạnh mẽ mà không đặt người dùng vào tình thế nguy hiểm. Để tìm hiểu thêm về cách chúng tôi xây dựng BrowseSafe và BrowseSafe-Bench, hãy xem blog Nghiên cứu của Perplexity.