¿Agentes o bots? Entendiendo la IA en la web abierta

Los asistentes modernos basados en IA funcionan de forma fundamentalmente distinta al rastreo web tradicional.

A medida que internet evoluciona, también lo hacen las formas en que accedemos a la información e interactuamos con ella. En los inicios de la web, los bots automatizados desempeñaban un papel sencillo y bien definido: indexar sitios para la búsqueda, comprobar enlaces o extraer datos siguiendo reglas claras establecidas por los propietarios de los sitios web.

Sin embargo, con el auge de los asistentes basados en IA y los agentes dirigidos por el usuario, la frontera entre lo que se considera "simplemente un bot" y lo que satisface las necesidades inmediatas de las personas reales se ha vuelto cada vez más difusa.

El auge de los asistentes digitales

Los asistentes modernos basados en IA funcionan de forma fundamentalmente distinta al rastreo web tradicional. Cuando usted hace una pregunta a Perplexity que requiere información actual (por ejemplo: "¿Cuáles son las últimas reseñas de ese nuevo restaurante?"), la IA no tiene esa información almacenada previamente en ninguna base de datos. En su lugar, acude a los sitios web pertinentes, lee el contenido y ofrece un resumen adaptado a su pregunta específica.

Esto es fundamentalmente diferente del rastreo web tradicional, en el que los rastreadores visitan sistemáticamente millones de páginas para construir bases de datos masivas, independientemente de si alguien solicitó o no esa información específica. Por el contrario, los agentes dirigidos por el usuario solo recuperan contenido cuando una persona real solicita algo específico, y utilizan ese contenido inmediatamente para responder a la pregunta del usuario. Los agentes dirigidos por el usuario de Perplexity no almacenan la información ni la utilizan para entrenamiento.

Por qué es importante esta distinción

La diferencia entre el rastreo automatizado y la recuperación dirigida por el usuario no es solo técnica; tiene que ver con quién puede acceder a la información en la web abierta. Cuando el motor de búsqueda de Google rastrea para construir su índice, es distinto a cuando recupera una página web porque usted ha solicitado una vista previa. Los "recuperadores activados por el usuario" de Google priorizan su experiencia sobre las restricciones de robots.txt porque estas solicitudes se realizan en su nombre.

Lo mismo se aplica a los asistentes de IA. Cuando Perplexity recupera una página web, lo hace porque usted realizó una pregunta específica que requiere información actual. El contenido no se almacena para entrenamiento, sino que se utiliza inmediatamente para responder a su pregunta.

Cuando empresas como Cloudflare caracterizan erróneamente a los asistentes de IA dirigidos por el usuario como bots maliciosos, argumentan que cualquier herramienta automatizada al servicio de los usuarios debería ser sospechosa; una postura que criminalizaría a los clientes de correo electrónico y navegadores web, o a cualquier otro servicio que un posible guardián decidiera que no le gusta.

Esta controversia revela que los sistemas de Cloudflare son fundamentalmente inadecuados para distinguir entre asistentes de IA legítimos y amenazas reales. Si no puede distinguir un asistente digital útil de un extractor malicioso, probablemente no debería tomar decisiones sobre lo que constituye tráfico web legítimo.

Este bloqueo excesivo perjudica a todos. Piense en alguien que utiliza IA para investigar afecciones médicas, comparar reseñas de productos o acceder a noticias de múltiples fuentes. Si su asistente es bloqueado como un "bot malicioso", pierde el acceso a información valiosa.

El resultado es una internet de dos niveles donde su acceso no depende de sus necesidades, sino de si sus herramientas elegidas han sido aprobadas por los controladores de infraestructura, quienes se preocuparán más por sus medios. Esto socava la elección del usuario y amenaza la accesibilidad de la web abierta para servicios innovadores que compiten con gigantes establecidos.

Un llamado a la claridad: cómo funcionan realmente los agentes de usuario

Un asistente de IA funciona exactamente igual que un asistente humano. Cuando le hace una pregunta a un asistente de IA que requiere información actual, este no conoce la respuesta de antemano. La busca por usted para completar cualquier tarea que le haya encomendado.

En Perplexity y en todas las demás plataformas de IA con agentes, esto ocurre en tiempo real, en respuesta a su solicitud, y la información se utiliza inmediatamente para responder a su pregunta. No se almacena en bases de datos masivas para su uso futuro, ni se utiliza para entrenar modelos de IA.

Los agentes dirigidos por el usuario solo actúan cuando los usuarios realizan solicitudes específicas, y solo recuperan el contenido necesario para cumplir con esas solicitudes. Esta es la diferencia fundamental entre un agente de usuario y un bot.

Dirigiéndose directamente a Cloudflare: una cuestión de competencia

La reciente entrada de blog de Cloudflare logró equivocarse en casi todo sobre cómo funcionan realmente los asistentes de IA modernos.

Además de malinterpretar que 20-25 millones de solicitudes de agentes de usuario no son extractores, Cloudflare afirmó que Perplexity realizaba un "rastreo sigiloso", utilizando bots ocultos y tácticas de suplantación para eludir las restricciones de los sitios web. Pero los hechos técnicos cuentan una historia diferente.

Parece que Cloudflare confundió a Perplexity con 3-6 millones de solicitudes diarias de tráfico no relacionado provenientes de BrowserBase, un servicio de navegación en la nube de terceros que Perplexity solo utiliza ocasionalmente para tareas altamente especializadas (menos de 45.000 solicitudes diarias).

Dado que Cloudflare ha ocultado convenientemente su metodología y se ha negado a responder a las preguntas que ayudan a nuestros equipos a comprender, solo podemos reducir esto a dos posibles explicaciones.

Cloudflare necesitaba un momento publicitario inteligente y nosotros, su propio cliente, resultamos ser un nombre útil para conseguirlo.

Cloudflare atribuyó erróneamente de forma fundamental 3-6 millones de solicitudes diarias del servicio de navegador automatizado de BrowserBase a Perplexity, un fallo básico de análisis de tráfico que resulta particularmente embarazoso para una empresa cuyo negocio principal es comprender y categorizar el tráfico web.

Sea cual sea la explicación verdadera, los errores técnicos en el análisis de Cloudflare no solo son embarazosos, sino que son descalificadores. Cuando se atribuyen erróneamente millones de solicitudes, se publican diagramas técnicos completamente inexactos y se demuestra una incomprensión fundamental de cómo funcionan los asistentes de IA modernos, se pierde toda pretensión de experiencia en este espacio.

Esta controversia revela que los sistemas de Cloudflare son fundamentalmente inadecuados para distinguir entre asistentes de IA legítimos y amenazas reales. Si no puede distinguir un asistente digital útil de un extractor malicioso, probablemente no debería tomar decisiones sobre lo que constituye tráfico web legítimo.

El alboroto en torno a este problema también revela que el liderazgo de Cloudflare está peligrosamente mal informado sobre los fundamentos de la IA, o simplemente es más apariencia que infraestructura. Esto es importante porque los clientes de Cloudflare incluyen empresas de todo tipo, compañías que no pueden permitirse confiar su infraestructura a trucos publicitarios de charlatanes.

Aún más embarazoso es que Cloudflare publicó un diagrama técnico que supuestamente mostraba el "flujo de trabajo de rastreo de Perplexity" y que no tiene ninguna semejanza con cómo funciona realmente Perplexity. Si Cloudflare estuviera realmente interesada en comprender los datos que observaba, cómo funcionan nuestros sistemas o estos conceptos fundamentales descritos anteriormente, podría haber hecho lo que animamos a todos los usuarios de Perplexity a hacer. Simplemente preguntar.