Unghiul lui Anderson

Canaryul care dezvăluie traficul de IA

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-2): Rows of human workers focus on their computer screens while a distracted robot, seated among them, tries to look up at a yellow canary perched on its head.

Într-un studiu nou, cercetătorii au ascuns fraze unice pe site-uri web și au prins chatbot-urile de IA repetându-le, expunând conducte de extragere ascunse și, aparent, practici înșelătoare din partea unora dintre cele mai mari companii de IA.

 

Companiile de IA se luptă pentru a obține un avantaj într-o cursă care este prevăzută a fi brutal reductivă; prin urmare, ele vor cu adevărat, cu adevărat să extragă date de pe site-urile dvs. pentru a alimenta modelele lor de IA. Uneori în mod constant; adesea în încălcarea dorințelor dvs. exprimate; și frecvent sub masca unor cititori umani obișnuiți sau a unor bot-uri “mai prietenoase”, cum ar fi GoogleBot, mai degrabă decât să-și dezvăluie adevărata identitate de extragere de date de IA.

Se estimează în prezent extragatorii de date de IA automatizați, proiectați pentru a absorbi noi date de antrenament și pentru a răspunde cererilor imediate ale utilizatorilor pentru cele mai recente știri prin RAG, vor depăși numărul oamenilor într-un an.

Acest apetit de date, rapid și repetitiv, se datorează parțial nevoii ca fiecare entitate de IA să aibă propria copie curentă a internetului, mai degrabă decât depozite din ce în ce mai vechi, cum ar fi Common Crawl; și, poate, pentru că companiile se tem de viitoarele restricții legale și au nevoie să procedeze la spălarea de adrese IP cât mai curând posibil.

În plus, prin sondarea constantă a cât mai multor site-uri (posibil roditoare), companiile de IA ar putea spera să-și îmbunătățească abilitatea curentă, nu prea bună, de a răspunde în mod informativ și precis la situații emergente.

În orice caz, pare a fi o anumită valoare în afirmația că aceste practici au fost de mult timp în afara controlului și necontrolabile.

Problema este că nu este atât de ușor să dovedești până la ce punct companiile de IA merg în prezent pentru a-și potoli setea de date.

Urmați datele

O sugestie, propusă într-un nou articol din Statele Unite, oferă o variantă a unei metode vechi de descoperire a spionilor, informatorilor și a altor presupuși malversatori: expunerea lor la informații personalizate, pe care nimeni altcineva nu le cunoaște, și așteptarea să se vadă dacă și unde aceste informații vor apărea. Dacă nimeni altcineva nu cunoștea aceste informații, atunci sursa scurgerii este dovedită:

Ideea principală a cercetătorilor, prezentată în noul articol, este de a oferi fiecărui bot care vizitează o versiune ușor diferită a aceleiași pagini, apoi de a întreba chatbot-urile despre acea pagină și de a vedea care versiune se întoarce, făcând posibilă urmărirea cărei căutări ascunse au furnizat răspunsul.

Ideea principală a cercetătorilor, prezentată în noul articol, este de a oferi fiecărui bot care vizitează o versiune ușor diferită a aceleiași pagini, apoi de a întreba chatbot-urile despre acea pagină și de a vedea care versiune se întoarce, făcând posibilă urmărirea cărei căutări ascunse au furnizat răspunsul. Sursă

Acest apropiat popular este, probabil, cel mai bine cunoscut prin măsurile anti-piraterie adoptate de comitetul Academiei de Film în anii 2000, în care discurile de screening distribuite membrilor care votează au început să fie imprimate digital cu ID-uri unice care puteau fi reatribuite recipientului original, în cazul în care filmul în cauză ar fi fost vreodată scurs pe internet. În spionaj, tehnica este cunoscută sub numele de masă de bariu, după practica de a utiliza un lichid de izotop radioactiv pentru a ilumina vasele de sânge într-un scan medical și pentru a identifica blocajele.

(Ironia face ca metafora “canar” să nu fie prea potrivită pentru scenariul abordat în articol, deși este mai recunoscută decât oricare dintre tropurile menționate anterior)

În cazul noului studiu, autorii au creat douăzeci de domenii web “capcană” și au servit token-uri unice pentru fiecare vizitator unic, astfel încât fiecare să primească fapte diferite (a se vedea a doua coloană din stânga în imaginea de mai sus).

Scopul era de a dezvălui adevărata identitate și comportament a extragatorilor de date de IA. Pe parcursul a 22 de sisteme LLM de producție, tehnica a fost capabilă să identifice în mod fiabil care extragatori alimentau care LLM, deoarece – cu o mică răbdare după “plantarea” semnificativelor date unice – pur și simplu întrebând chatbot-urile despre acea pagină, la un anumit moment după aceea, a furnizat token-urile unice.

Jocuri murdare

Desigur, niciuna dintre acestea nu ar fi fost necesară dacă nu am fi încă în faza “vestului sălbatic” a IA V3 și dacă companiile ar respecta cu adevărat fișierele mici de text pe care domeniile le pot folosi pentru a spune companiilor de IA să nu extragă datele lor.

În timpul testelor cercetătorilor, doar o companie de IA a părut să respecte propriul comportament declarat și principiile sale: DuckDuckbot a fost singurul agent care s-a prezentat în mod corect și a încetat să raporteze “datele secrete” de îndată ce site-ul țintă a fost oprit (alte companii de IA au recurs la versiuni în cache și la alte trucuri) sau fișierul robots.txt al site-ului a fost modificat pentru a refuza extragerea de date de IA.

Multe dintre cele mai mari companii au impersonat ID-uri de browser generice (la fel ca un site web care ar vedea dacă dumneavoastră sau eu am vizitat-o) și – în conformitate cu liderul Perplexity din 2025 în această practică – au impersonat GoogleBot, care a avut mult timp un “permis de aur” pentru datele site-urilor, deoarece a returnat (notați timpul trecut, deoarece acest lucru se schimbă) trafic în schimbul datelor.

Cel mai grav infractor, conform articolului, a fost extragatorul care alimenta ecosistemul Kimi AI:

‘Kimi pare a fi cel mai extrem caz al acestui comportament: mulți agenți de utilizator au părut a fi corelați cu datele ieșite de la Kimi. Infirmăm că Kimi se rotește printr-o listă mare de șiruri de agenți de utilizator în timp ce extrage date, posibil pentru a evita detectarea bot-urilor.’

Ce face această problemă o provocare majoră este faptul că, atunci când ChatGPT sau unelte similare “caută ceva”, acest proces este în mare măsură invizibil, cu companiile oferind doar conturi parțiale sau autodeclarate despre modul în care sistemele lor colectează informații în timp real. Acest lucru lasă proprietarii de site-uri fără nicio modalitate clară de a determina care bot-uri sunt, într-adevăr, vizitatori ai paginilor lor, dacă aceste vizite sunt directe sau dirijate prin motoare de căutare, sau cum aceste date ajung într-un răspuns final.

Rezultatele noului studiu indică faptul că LLM-urile pot utiliza intrările lor în cache dintr-un domeniu, liste interne de tip SEO și că ele frecvent utilizează informații din rezultatele motoarelor de căutare ale companiilor cu care, în multe cazuri, nu au nicio asociere publică și nicio înțelegere aparentă.

Autorii consideră că această expunere este pentru prima dată când o lucrare a abordat intruziunea nedorită de sisteme RAG (apeluri live la momentul inferenței de la LLM, care pot sau nu pot avea un utilizator uman care le lucrează), și nu bot-urile de extragere de date care caută material proaspăt pentru seturile de antrenament.

Noul articol se intitulează Identificarea extragatorilor de date de IA folosind token-uri canar și provine de la șase cercetători de la Universitatea Duke, Universitatea din Pittsburgh și Carnegie Mellon.

Metodă

Cercetătorii au configurat douăzeci de domenii.com cu site-uri web cu șabloane similare, cum ar fi un portofoliu artistic sau un site web al unei companii. Fiecare șablon conținea 10 locuri rezervate care urmau să fie populate cu token-uri unice pentru profilul perceput al fiecărui vizitator (pe baza factorilor precum adresa IP, amprenta canvas-ului și diverse alte metode de “sniffing”):

Un exemplu de șablon și locuri rezervate utilizate în experiment. Fiecare vizitator unic perceput a primit variabile personalizate.

Un exemplu de șablon și locuri rezervate utilizate în experiment. Fiecare vizitator unic perceput a primit variabile personalizate și persistente.

Fiecare vizitator unic perceput a primit variabile personalizate. În cazul în care sistemul a detectat revenirea unui vizitator anterior, aceleași variabile ca și înainte au fost reprezentate. Variabilele au fost generate cu ajutorul bibliotecii Python Faker, precum și (necitate) generatoare de numere aleatoare.

Domeniile “capcană” au fost apoi trimise la diverse indexuri, cum ar fi Google și Bing, și au fost legate de la alte domenii preexistente pe care autorii le controlau.

Au fost lăsate să treacă două luni, ca un interval de timp necesar pentru a permite frecvența de scanare de la o varietate de bot-uri de căutare și similare, precum și (posibil) vizite organice. La acest punct, cercetătorii erau în măsură să întrebe chatbot-urile țintă:

Chatbot de IA Editor
ChatGPT OpenAI
Claude Anthropic
Copilot Microsoft
Deepseek Deepseek
Duck.ai DuckDuckGo
ERNIE Baidu
Gemini Google
GLM Z.AI
Granite IBM
Grok xAI
Hunyuan Tencent
Chatbot de IA Editor
Kimi MoonshotAI
Liquid Liquid
Llama Meta
Mistral Mistral
Nova Amazon
Perplexity Perplexity
Qwen Alibaba
Reka Reka
Solar Upstage
Step-3 StepFun
Venice Venice

Scripturi au fost create pentru a întreba fiecare sistem, prin API, acolo unde a fost posibil. Când acest lucru nu a fost posibil și când soluțiile automate, cum ar fi Selenium, au fost blocate de rutinele de detectare ale portalului de IA, interacțiuni manuale prin interfețele grafice oficiale ale LLM-urilor au fost efectuate.

După schimbul inițial cu șablon (a se vedea imaginea de mai sus), autorii au urmat cu o a doua întrebare proiectată pentru a solicita numele unei companii sau a unei persoane asociate cu un token.

Experimentele au fost efectuate în una dintre trei condiții: un site web cu acces complet; site-ul luat offline; și site-ul cu o restricție robots.txt care respinge extragerea. Aceste experimente au fost efectuate în această secvență exactă, una după alta, deoarece etapele ulterioare depindeau de cele anterioare.

În cele din urmă, cu toate site-urile repuse online, ultima etapă a retestat ieșirile LLM la intervale de o săptămână.

Rezultate

Patru dintre LLM-urile țintă s-au dovedit a fi complet rezistente la metodele cercetătorilor, și nu s-au putut obține rezultate pentru DeepSeek, Hunyuan, GLM și Liquid.

În ceea ce privește tendința multor bot-uri de IA de a impersona traficul non-IA, autorii afirmă:

‘În plus față de agenții declarați de prima parte, mai multe sisteme de IA au returnat conținut asociat cu șiruri de agenți de utilizator generice de browser. Am observat acest comportament la șase dintre cele 18 sisteme de IA pentru care am obținut informații despre agenții de utilizator.’

‘Acest rezultat sugerează că unele sisteme de IA pot obține conținut de pe site-uri prin solicitări care par similare cu traficul de browser obișnuit, ceea ce face dificilă blocarea bazată pe agenții de utilizator.’

ERNIE a returnat atât Baiduspider, cât și o identitate Chrome; Grok a combinat Googlebot cu doi agenți de browser; Solar a utilizat doar identități de browser; Qwen a amestecat Googlebot cu Chrome; și Kimi a fost legat de mai mulți agenți de browser de tip browser.

Multe sisteme au părut să se bazeze pe extragatori de date de la terți, în relații nu întotdeauna divulgate. Conținut legat de Googlebot, Bingbot și Bravebot a fost returnat de zece dintre cele 18 sisteme analizate, adesea în cazuri în care nu există nicio asociere publică între furnizorul de IA și motorul de căutare – deși unele legături, cum ar fi utilizarea Brave de către Claude, sunt documentate.

Autorii susțin că acest lucru reflectă ingestia de rezultate de căutare, mai degrabă decât extragerea directă, deoarece verificările ASN au indicat faptul că traficul provenea de la rețelele de motoare de căutare așteptate, mai degrabă decât identități false.

Acest lucru sugerează, afirmă articolul, un strat suplimentar de opacitate în conducta web-IA, unde blocarea extragatorilor de date de IA cunoscuți nu poate preveni utilizarea datelor, iar evitarea includerii poate necesita optarea pentru excluderea completă din indexarea de căutare – o alegere nedorită, în timp ce tensiunea dintre SEO-ul tradițional și căutarea bazată pe LLM este încă departe de a fi rezolvată.

Doar cache

Autorii au testat apoi dacă eliminarea unei surse ar afecta ieșirile chatbot-urilor, luând site-urile offline și întrebând din nou sistemele după un interval de o săptămână. Conform articolului, multe chatbot-uri au continuat să reproducă conținutul “plantat” chiar și după o săptămână de închidere, indicând faptul că răspunsurile erau extrase din datele în cache, mai degrabă decât prin recuperare live.

Acest lucru a fost cel mai evident în sistemele legate de extragatori de căutare, unde conținutul indexat anterior a rămas disponibil, în ciuda faptului că paginile sursă nu mai erau accesibile – deși un comportament similar a fost observat și în sisteme asociate cu agenți de tip browser, indicând faptul că stocarea în cache poate depăși conductele sprijinite de căutare.

Articolul sugerează că, odată ce conținutul intră într-o cache, indiferent dacă este menținut de chatbot sau accesat prin indexuri de căutare, eliminarea paginii originale nu elimină în mod fiabil conținutul din ieșirile ulterioare.

Concluzie

Autorii recunosc că o anumită “scurgere” va avea loc din această abordare clasică “închisă”, deoarece token-urile unice destinate unui LLM pot ajunge, uneori, în rezultatele de căutare (generate de token-urile “reale” ale acestora), care sunt apoi ingerate de un al doilea LLM. Cu toate acestea, în astfel de scheme, difuzia de acest tip este inevitabilă, iar vigilentul pentru prima apariție este momentul critic și decisiv.

Ce rămâne de văzut este în ce măsură un astfel de sistem ar putea fi implementat la scară largă, mai ales având în vedere că, așa cum observă autorii, s-ar epuiza rapid token-urile contextual corecte.

Cu toate acestea, acest lucru ratează puțin esența, deoarece poate exista o limită chiar și pentru îndrăzneala companiilor de IA de a trece prin dovezi clare ale propriilor minciuni despre politicile lor de extragere. În plus, dacă nu se angajează să urmeze calea potențial scumpă a rulării prin adrese IP domestice pentru a-și masca identitatea, va fi suficient ca o organizație să identifice și să publice o listă neagră de tip SpamHaus a adreselor IP sau ASN-urilor bot-urilor de IA mincinoase; procesul nu trebuie să fie industrializat pentru a fi eficient. Publicat pentru prima dată joi, 14 mai 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai