Agenți sau roboți? Să înțelegem AI pe webul deschis

Asistenții AI moderni funcționează într-un mod fundamental diferit față de crawlerele web tradiționale.

Pe măsură ce internetul evoluează, la fel se schimbă și modurile în care accesăm informațiile și interacționăm cu acestea. În primele zile ale webului, roboții automatizați aveau un rol simplu și bine înțeles: indexarea site-urilor pentru căutare, verificarea linkurilor sau extragerea de date în conformitate cu regulile clare stabilite de proprietarii site-urilor.

Însă, odată cu ascensiunea asistenților bazați pe inteligență artificială și a agenților conduși de utilizatori, granița dintre ceea ce contează drept „simplu robot” și ceea ce servește nevoilor imediate ale unor oameni reali a devenit tot mai estompată.

Ascensiunea asistenților digitali

Asistenții AI moderni funcționează într-un mod fundamental diferit față de crawlerele web tradiționale. Când îi adresezi lui Perplexity o întrebare care necesită informații de actualitate – de exemplu, „Care sunt cele mai recente recenzii pentru acel restaurant nou?” –, AI-ul nu are deja acele informații stocate undeva într-o bază de date. În schimb, accesează site-urile relevante, citește conținutul și aduce un rezumat adaptat la întrebarea ta specifică.

Acest lucru este fundamental diferit de crawlingul web tradițional, în cadrul căruia crawlerele vizitează în mod sistematic milioane de pagini pentru a construi baze de date masive, indiferent dacă cineva a solicitat sau nu acele informații specifice. Agenții conduși de utilizatori, prin contrast, preiau conținutul doar atunci când o persoană reală solicită ceva anume și folosesc acel conținut imediat pentru a răspunde la întrebarea utilizatorului. Agenții conduși de utilizatori ai lui Perplexity nu stochează informațiile și nu se antrenează pe baza acestora.

De ce contează această distincție

Diferența dintre crawlingul automatizat și preluarea condusă de utilizator nu este doar una tehnică – este vorba despre cine are acces la informații pe webul deschis. Când motorul de căutare Google efectuează o scanare pentru a-și construi indexul, acest lucru este diferit de momentul în care preia o pagină web deoarece ai cerut o previzualizare. „Sistemele de preluare declanșate de utilizator” ale Google acordă prioritate experienței tale în detrimentul restricțiilor din robots.txt, deoarece aceste cereri au loc în numele tău.

Același lucru este valabil și pentru asistenții AI. Când Perplexity preia o pagină web, o face pentru că ai pus o întrebare specifică ce necesită informații actuale. Conținutul nu este stocat pentru antrenament – este folosit imediat pentru a răspunde la întrebarea ta.

Atunci când companii precum Cloudflare caracterizează în mod greșit asistenții AI conduși de utilizatori drept roboți rău intenționați, ele susțin că orice unealtă automatizată care servește utilizatorii ar trebui să fie suspectă – o poziție care ar incrimina clienții de e-mail și browserele web sau orice alt serviciu pe care un potențial portar l-ar considera indezirabil.

Această controversă relevă faptul că sistemele Cloudflare sunt fundamental inadecvate pentru a face o distincție între asistenții AI legitimi și amenințările reale. Dacă nu poți deosebi un asistent digital util de un scraper rău intenționat, atunci probabil că nu ar trebui să iei decizii cu privire la ceea ce constituie trafic web legitim.

Această blocare excesivă afectează pe toată lumea. Să ne gândim la cineva care folosește inteligența artificială pentru a cerceta afecțiuni medicale, a compara recenzii de produse sau a accesa știri din mai multe surse. Dacă asistentul lor este blocat ca „robot rău intenționat”, ei pierd accesul la informații valoroase.

Rezultatul este un internet pe două niveluri, unde accesul tău nu depinde de nevoile tale, ci de faptul dacă instrumentele alese de tine au fost sau nu aprobate de administratorii de infrastructură, cărora le pasă mai mult de mijloacele tale. Acest lucru subminează opțiunea utilizatorului și amenință accesibilitatea webului deschis pentru serviciile inovatoare care concurează cu giganții stabiliți.

Un apel la claritate: Cum funcționează de fapt agenții utilizator

Un asistent AI funcționează exact ca un asistent uman. Când îi adresezi unui asistent AI o întrebare care necesită informații actuale, acesta nu știe deja răspunsul. Îl caută pentru tine pentru a finaliza orice sarcină pe care ai solicitat-o.

Pe Perplexity și pe toate celelalte platforme AI bazate pe agenți, acest lucru se întâmplă în timp real, ca răspuns la cererea ta, iar informațiile sunt folosite imediat pentru a răspunde la întrebarea ta. Nu sunt stocate în baze de date masive pentru utilizare ulterioară și nu sunt folosite pentru a antrena modele AI.

Agenții conduși de utilizatori acționează doar atunci când utilizatorii fac solicitări specifice și preiau doar conținutul necesar pentru a îndeplini acele solicitări. Aceasta este diferența fundamentală dintre un agent utilizator și un robot.

Abordarea directă a Cloudflare: O chestiune de competență

Recentul articol de blog al Cloudflare a reușit să înțeleagă greșit aproape totul despre modul în care funcționează de fapt asistenții AI moderni.

Pe lângă neînțelegerea faptului că 20-25 de milioane de cereri de la agenți utilizatori nu reprezintă scrapere, Cloudflare a susținut că Perplexity se angajează în „crawling pe furiș”, utilizând roboți ascunși și tactici de uzurpare a identității pentru a ocoli restricțiile site-urilor web. Dar faptele tehnice spun o altă poveste.

Se pare că Cloudflare a confundat Perplexity cu 3-6 milioane de cereri zilnice de trafic fără legătură provenite de la BrowserBase, un serviciu de browser în cloud terț pe care Perplexity îl folosește doar ocazional pentru sarcini extrem de specializate (mai puțin de 45.000 de cereri zilnice).

Deoarece Cloudflare și-a obfuscate în mod convenabil metodologia și a refuzat să răspundă la întrebări care ne-ar ajuta echipele să înțeleagă, putem restrânge această situație la doar două explicații posibile.

Cloudflare avea nevoie de un moment inteligent de publicitate, iar noi – propriul lor client – s-a nimerit să fim un nume util pentru a obține unul.

Cloudflare a atribuit în mod fundamental greșit 3-6 milioane de cereri zilnice din serviciul de browser automatizat al BrowserBase către Perplexity, un eșec de bază în analiza traficului, care este deosebit de jenant pentru o companie a cărei afacere de bază este înțelegerea și clasificarea traficului web.

Oricare ar fi adevărul, erorile tehnice din analiza Cloudflare nu sunt doar jenante – sunt descalificante. Când atribui greșit milioane de cereri, publici diagrame tehnice complet inexacte și demonstrezi o neînțelegere fundamentală a modului în care funcționează asistenții AI moderni, ți-ai pierdut orice pretenție de expertiză în acest spațiu.

Această controversă relevă faptul că sistemele Cloudflare sunt fundamental inadecvate pentru a face o distincție între asistenții AI legitimi și amenințările reale. Dacă nu poți deosebi un asistent digital util de un scraper rău intenționat, atunci probabil că nu ar trebui să iei decizii cu privire la ceea ce constituie trafic web legitim.

Zgomotul din jurul acestei probleme dezvăluie, de asemenea, că conducerea Cloudflare este fie periculoasă de dezinformată cu privire la bazele inteligenței artificiale, fie pur și simplu mai mult de fațadă decât un cloud real. Acest lucru contează deoarece clienții Cloudflare includ companii de toate tipurile, companii care nu își pot permite să își încredințeze infrastructura unor cascadorii publicitare de șarlatani.

Chiar mai jenant, Cloudflare a publicat o diagramă tehnică care pretindea că prezintă „fluxul de lucru de crawling al lui Perplexity”, care nu seamănă deloc cu modul în care funcționează de fapt Perplexity. Dacă Cloudflare ar fi fost cu adevărat interesat să înțeleagă datele pe care le vedea, modul în care funcționează sistemele noastre sau aceste concepte fundamentale prezentate mai sus, ar fi putut face ceea ce încurajăm toți utilizatorii Perplexity să facă. Doar să întrebe.