Tác nhân hay bot? Hiểu về AI trên web mở

Các trợ lý AI hiện đại hoạt động hoàn toàn khác biệt so với việc cào dữ liệu web truyền thống.

Khi internet phát triển, các phương thức chúng ta truy cập và tương tác với thông tin cũng thay đổi theo. Trong những ngày đầu của web, các bot tự động đóng một vai trò đơn giản, dễ hiểu: lập chỉ mục các trang để tìm kiếm, kiểm tra liên kết hoặc thu thập dữ liệu theo các quy tắc rõ ràng do chủ sở hữu trang web đặt ra.

Nhưng với sự trỗi dậy của các trợ lý hỗ trợ AI và các tác nhân do người dùng điều khiển, ranh giới giữa cái gọi là "chỉ là một bot" và cái phục vụ nhu cầu tức thời của con người thực sự ngày càng trở nên mờ nhạt.

Sự trỗi dậy của các trợ lý kỹ thuật số

Các trợ lý AI hiện đại hoạt động hoàn toàn khác biệt so với việc cào dữ liệu web truyền thống. Khi bạn hỏi Perplexity một câu hỏi cần thông tin hiện tại—ví dụ: "Các đánh giá mới nhất cho nhà hàng mới đó là gì?"—AI chưa có sẵn thông tin đó trong một cơ sở dữ liệu nào đó. Thay vào đó, nó truy cập các trang web có liên quan, đọc nội dung và mang lại một bản tóm tắt phù hợp với câu hỏi cụ thể của bạn.

Điều này hoàn toàn khác với việc cào dữ liệu web truyền thống, trong đó các trình thu thập dữ liệu truy cập có hệ thống vào hàng triệu trang để xây dựng cơ sở dữ liệu khổng lồ, bất kể có ai yêu cầu thông tin cụ thể đó hay không. Ngược lại, các tác nhân do người dùng điều khiển chỉ lấy nội dung khi một người thực sự yêu cầu điều gì đó cụ thể và họ sử dụng nội dung đó ngay lập tức để trả lời câu hỏi của người dùng. Các tác nhân do người dùng điều khiển của Perplexity không lưu trữ thông tin hoặc đào tạo với thông tin đó.

Tại sao sự khác biệt này lại quan trọng

Sự khác biệt giữa việc cào dữ liệu tự động và lấy dữ liệu do người dùng điều khiển không chỉ mang tính kỹ thuật—mà là về việc ai được quyền truy cập thông tin trên web mở. Khi công cụ tìm kiếm của Google cào dữ liệu để xây dựng chỉ mục của mình, điều đó khác với khi nó lấy một trang web vì bạn yêu cầu bản xem trước. Các "trình lấy dữ liệu do người dùng kích hoạt" của Google ưu tiên trải nghiệm của bạn hơn các giới hạn của robots.txt vì các yêu cầu này diễn ra thay mặt bạn.

Điều tương tự cũng áp dụng cho các trợ lý AI. Khi Perplexity lấy một trang web, đó là vì bạn đã đặt một câu hỏi cụ thể yêu cầu thông tin hiện tại. Nội dung không được lưu trữ để đào tạo—nó được sử dụng ngay lập tức để trả lời câu hỏi của bạn.

Khi các công ty như Cloudflare mô tả sai các trợ lý AI do người dùng điều khiển là các bot độc hại, họ đang lập luận rằng bất kỳ công cụ tự động nào phục vụ người dùng đều đáng ngờ—một quan điểm sẽ biến các ứng dụng email và trình duyệt web, hoặc bất kỳ dịch vụ nào khác mà một người giữ cổng muốn có, thành tội phạm.

Cuộc tranh cãi này cho thấy hệ thống của Cloudflare hoàn toàn không đủ khả năng để phân biệt giữa các trợ lý AI hợp pháp và các mối đe dọa thực tế. Nếu bạn không thể phân biệt được một trợ lý kỹ thuật số hữu ích với một kẻ cào dữ liệu độc hại, thì có lẽ bạn không nên đưa ra quyết định về những gì cấu thành lưu lượng truy cập web hợp pháp.

Việc chặn quá mức này làm tổn hại đến tất cả mọi người. Hãy tưởng tượng ai đó sử dụng AI để nghiên cứu các tình trạng y tế, so sánh đánh giá sản phẩm hoặc truy cập tin tức từ nhiều nguồn khác nhau. Nếu trợ lý của họ bị chặn như một "bot độc hại", họ sẽ mất quyền truy cập vào thông tin có giá trị.

Kết quả là một internet hai cấp độ, nơi quyền truy cập của bạn không phụ thuộc vào nhu cầu của bạn, mà phụ thuộc vào việc các công cụ bạn chọn có được phê duyệt bởi những người kiểm soát cơ sở hạ tầng hay không, những người quan tâm nhiều hơn đến phương tiện của bạn. Điều này làm suy yếu sự lựa chọn của người dùng và đe dọa khả năng tiếp cận của web mở đối với các dịch vụ sáng tạo cạnh tranh với các gã khổng lồ đã thành danh.

Lời kêu gọi sự rõ ràng: Các tác nhân người dùng thực sự hoạt động như thế nào

Một trợ lý AI hoạt động giống như một trợ lý con người. Khi bạn hỏi một trợ lý AI một câu hỏi đòi hỏi thông tin hiện tại, họ không biết sẵn câu trả lời. Họ tra cứu nó cho bạn để hoàn thành bất kỳ nhiệm vụ nào bạn đã yêu cầu.

Trên Perplexity và tất cả các nền tảng AI có tác nhân khác, điều này diễn ra trong thời gian thực, để đáp lại yêu cầu của bạn và thông tin được sử dụng ngay lập tức để trả lời câu hỏi của bạn. Nó không được lưu trữ trong các cơ sở dữ liệu khổng lồ để sử dụng trong tương lai và không được sử dụng để đào tạo các mô hình AI.

Các tác nhân do người dùng điều khiển chỉ hành động khi người dùng đưa ra các yêu cầu cụ thể và chúng chỉ lấy nội dung cần thiết để thực hiện các yêu cầu đó. Đây là sự khác biệt cơ bản giữa tác nhân người dùng và bot.

Giải quyết trực tiếp Cloudflare: Vấn đề năng lực

Bài đăng trên blog gần đây của Cloudflare đã hiểu sai hầu hết mọi thứ về cách các trợ lý AI hiện đại thực sự hoạt động.

Ngoài việc hiểu lầm rằng 20-25 triệu yêu cầu tác nhân người dùng không phải là công cụ cào dữ liệu, Cloudflare tuyên bố rằng Perplexity đang tham gia vào "việc cào dữ liệu tàng hình", sử dụng các bot ẩn và chiến thuật giả mạo để vượt qua các hạn chế của trang web. Nhưng các sự thật kỹ thuật lại kể một câu chuyện khác.

Có vẻ như Cloudflare đã nhầm lẫn Perplexity với 3-6 triệu yêu cầu hàng ngày của lưu lượng truy cập không liên quan từ BrowserBase, một dịch vụ trình duyệt đám mây của bên thứ ba mà Perplexity chỉ thỉnh thoảng sử dụng cho các tác vụ mang tính chuyên môn cao (ít hơn 45.000 yêu cầu hàng ngày).

Bởi vì Cloudflare đã vô tình che giấu phương pháp của họ và từ chối trả lời các câu hỏi giúp các teams của chúng tôi hiểu rõ, chúng tôi chỉ có thể thu hẹp điều này thành hai lời giải thích khả dĩ.

Cloudflare cần một khoảnh khắc công khai thông minh và chúng tôi—khách hàng của chính họ—tình cờ là một cái tên hữu ích để mang lại điều đó cho họ.

Cloudflare đã quy kết sai cơ bản 3-6 triệu yêu cầu hàng ngày từ dịch vụ trình duyệt tự động của BrowserBase cho Perplexity, một lỗi phân tích lưu lượng truy cập cơ bản đặc biệt đáng xấu hổ đối với một công ty có hoạt động kinh doanh cốt lõi là hiểu và phân loại lưu lượng truy cập web.

Dù lời giải thích nào là sự thật, các lỗi kỹ thuật trong phân tích của Cloudflare không chỉ đáng xấu hổ—chúng còn bị loại bỏ tư cách. Khi bạn quy kết sai hàng triệu yêu cầu, xuất bản các sơ đồ kỹ thuật hoàn toàn không chính xác và thể hiện sự hiểu lầm cơ bản về cách các trợ lý AI hiện đại hoạt động, bạn đã từ bỏ mọi tuyên bố về chuyên môn trong Space này.

Cuộc tranh cãi này cho thấy hệ thống của Cloudflare hoàn toàn không đủ khả năng để phân biệt giữa các trợ lý AI hợp pháp và các mối đe dọa thực tế. Nếu bạn không thể phân biệt được một trợ lý kỹ thuật số hữu ích với một kẻ cào dữ liệu độc hại, thì có lẽ bạn không nên đưa ra quyết định về những gì cấu thành lưu lượng truy cập web hợp pháp.

Sự ồn ào xung quanh vấn đề này cũng cho thấy rằng bộ máy lãnh đạo của Cloudflare hoặc là bị thông tin sai lệch một cách nguy hiểm về những điều cơ bản của AI, hoặc đơn giản là mang tính phô trương nhiều hơn là thực chất. Điều này rất quan trọng vì khách hàng của Cloudflare bao gồm các doanh nghiệp đủ mọi thể loại, những công ty không thể mạo hiểm tin tưởng cơ sở hạ tầng của mình vào các chiêu trò PR lang băm.

Đáng xấu hổ hơn nữa, Cloudflare đã xuất bản một sơ đồ kỹ thuật được cho là hiển thị "quy trình làm việc của Perplexity" mà không có điểm gì giống với cách Perplexity thực sự hoạt động. Nếu Cloudflare thực sự quan tâm đến việc hiểu dữ liệu họ đang nhìn thấy, cách hệ thống của chúng tôi hoạt động hoặc các khái niệm cơ bản được nêu ở trên, họ có thể đã làm những gì chúng tôi khuyến khích tất cả người dùng Perplexity làm. Chỉ cần hỏi.