Andersonův úhel

Kanár, který odhaluje AI provoz

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image (GPT-2): Rows of human workers focus on their computer screens while a distracted robot, seated among them, tries to look up at a yellow canary perched on its head.

V nové studii vědci skryli jedinečné fráze na webových stránkách a chytili AI chatboty, které je opakovaly, čímž odhalili skryté potrubí pro sběr dat a zřejmě i zavádějící postupy některých z největších AI společností.

 

Společnosti zabývající se umělou inteligencí bojují o výhodu v závodě, který je předpovídán jako brutálně reduktivní; proto opravdu, velmi chtějí procházet vaše webové stránky za účelem získání trénovacích dat pro své AI modely. Někdy trvale; často v rozporu s vašimi vyjádřenými přáními; a často pod maskou běžných lidských uživatelů nebo jako “přátelštější” boti jako GoogleBot, místo aby odhalili svou skutečnou identitu jako AI sběrači dat.

Odhaduje se, že automatizovaní AI sběrači navržení pro sběr nových trénovacích dat a reakci na okamžitou poptávku uživatelů po nejnovějších zprávách prostřednictvím RAG budou brzy převyšovat lidi.

Tento divoký a opakovaný sběr dat probíhá částečně kvůli potřebě každé AI entity mít svou vlastní aktuální kopii internetu, místo aby se spoléhaly na stále zastaralější repozitáře, jako je Common Crawl; a možná také proto, že společnosti se obávají přicházejících právních omezení a potřebují co nejdříve provést čištění IP adres.

Dále, neustálým dotazováním na co největší počet (potenciálně plodných) stránek, AI společnosti mohou doufat, že vylepší svou současnou nedokonalou schopnost reagovat informovaně a přesně na vznikající situace.

V každém případě se zdá, že existuje určitá oprávněnost tvrzení, že tyto postupy jsou již delší dobu nekontrolovatelné a neřídí se žádnými pravidly.

Problém je v tom, že není snadné prokázat, jak daleko AI společnosti jdou, aby uhasily svou žízeň po nejnovějších datech.

Sledujte data

Jedním z návrhů, který byl navržen v nové studii, je variace staré metody odhalování špionů, informátorů a jiných údajných zločinců: vystavení jim speciálně upravených informací, o kterých nikdo jiný neví, a zjištění, zda a kde se tyto informace objeví. Pokud nikdo jiný o těchto informacích neví, pak je zdroj úniku prokázán:

Jádrový nápad výzkumníků, popsáný v nové studii, spočívá v tom, že každému navštívujícímu botu je poskytnuta mírně odlišná verze stejné stránky, a poté je požádán chatbot o tuto stránku a zjišťuje se, která verze se vrátí, což umožňuje stopovat, které skryté webové vyhledávání poskytlo odpověď.. Zdroj - https://arxiv.org/pdf/2605.13706

Jádrový nápad výzkumníků, popsáný v nové studii, spočívá v tom, že každému navštívujícímu botu je poskytnuta mírně odlišná verze stejné stránky, a poté je požádán chatbot o tuto stránku a zjišťuje se, která verze se vrátí, což umožňuje stopovat, které skryté webové vyhledávání poskytlo odpověď. Zdroj

Tento populární přístup je možná nejlépe známý díky protipirátským opatřením přijatým Akademií filmových umění a věd v roce 2000, kdy screener DVD distribuované hlasujícím členům začaly být digitálně označeny jedinečnými ID, která by mohla být připsána původnímu příjemci, pokud by film byl někdy zveřejněn na internetu. Ve špionáži je tato technika známa jako barium meal, podle postupu použití radioaktivního izotopu tekutiny k označení krevních cév v medicínském snímku a identifikaci bloků.

(Ironicky, zvolená metafora “kanár” není příliš vhodná pro scénář, který studie popisuje, i když je více rozpoznatelná než výše uvedené postoje)

V případě nové studie autoři vytvořili dvacet “honeypot” webových domén a poskytli jedinečné tokeny každému jedinečnému návštěvníkovi, aby každý obdržel odlišné skutečnosti (viz druhá sloupec zleva na obrázku výše).

Cílem bylo odhalit skutečnou identitu a chování LLM (AI) sběračů. Napříč 22 produkčními LLM systémy byla technika schopna spolehlivě identifikovat, které sběrače krmily které LLM, protože – s trochou trpělivosti po “zasetí” jedinečných datových signálů – stačilo pouze položit správné otázky AI o měsíc nebo dva později, aby se získaly jedinečné tokeny.

Podvod

Samozřejmě, nic z toho by nebylo nutné, kdybychom nebyli stále ve “divokém západě” fázi AI V3, a kdyby společnosti skutečně dodržovaly malé textové soubory, které domény mohou použít k označení AI společnostem, aby nesbíraly jejich data.

Jako se ukázalo ve výzkumných testech, pouze jedna AI společnost se zdála respektovat své vlastní prohlášení a zásady: DuckDuckGo’s DuckDuckbot byl jediným agentem, který se představil přesně a přestal hlásit “tajné údaje” okamžitě, když byla cílová doména vypnuta (jiné AI společnosti se uchýlily k cached verzím a jiným trikům) nebo když byl soubor robots.txt domény změněn na zákaz AI sběru.

Mnozí z největších hráčů místo toho impersonovali obecné prohlížečové ID (stejné, jako by webová stránka viděla, kdybychom ji navštívili my nebo vy), a – v souladu s Perplexity’s 2025 lead na této praxi – impersonovali GoogleBot, který po dlouhou dobu měl “zlatou kartu” k webovým datům, protože vracel (pozor, minulý čas, protože se to mění) provoz v výměně za data.

Nejhorším provinilcem, podle studie, byl sběrač, který krmil Kimi AI ekosystém:

‘Kimi se zdá být nejextrémnějším případem tohoto chování: mnoho uživatelů-agents se zdálo být spojeno s daty výstupem Kimi. Odhadujeme, že Kimi prochází velkou seznam User-Agent řetězců při sběru, možná aby se vyhnul detekci botů.’

Co dělá tento problém velkou výzvou, je skutečnost, že když ChatGPT nebo podobné nástroje “vyhledávají něco”, tento proces je z velké části neviditelný, s společnostmi, které nabízejí pouze částečné nebo sebehlášené zprávy o tom, jak jejich systémy shromažďují živé informace. To zanechává majitele stránek bez jasného způsobu, jak určit, které boty skutečně navštěvují jejich stránky, zda tyto návštěvy jsou přímé nebo směrované prostřednictvím vyhledávačů, nebo jak tato data skončí v konečné odpovědi.

Zjištění z nové studie ukazují, že LLMs mohou používat své vlastní cached položky z domény, své vlastní interní SEO-style seznamy, a že často používají informace ze zoekávacích výsledků společností, se kterými, ve mnoha případech, nemají žádnou veřejnou asociaci, a žádnou zjevnou dohodu o použití.

Autoři se domnívají, že toto odhalení je poprvé, kdy práce řeší nežádoucí pronikání RAG systémy (živé volání z LLMs, které může nebo nemusí mít lidského uživatele, který je ovládá), spíše než datové sběrače, kteří hledají čerstvé materiály pro trénovací sady.

Nová studie se jmenuje Identifikace AI webových sběračů pomocí Canary Tokenů a pochází od šesti výzkumníků z Duke University, University of Pittsburgh a Carnegie Mellon.

Metoda

Výzkumníci nastavili dvacet.com domén s široce podobnými webovými stránkami pod společnými šablonami, jako je umělecký portfólio nebo webová stránka společnosti. Každá šablona obsahovala 10 placeholderů, které by byly později naplněny tokeny jedinečnými pro vnímaný profil každého návštěvníka (na základě faktorů, jako je IP adresa, canvas fingerprinting a různé další “sniffing metody):

Příklad šablony a proměnných použitých v experimentu. Každý vnímaný jedinečný návštěvník obdržel trvalé, individualizované proměnné.

Příklad šablony a proměnných použitých v experimentu. Každý vnímaný jedinečný návštěvník obdržel trvalé, individualizované proměnné.

Každý vnímaný jedinečný návštěvník obdržel proměnné. V případě, že systém detekoval návrat předchozího návštěvníka, byly mu znovu předloženy stejné proměnné jako předtím. Proměnné byly generovány pomocí Python Faker knihovny, jakož i (nespecifikovaných) generátorů náhodných čísel.

Honeypot domény byly poté předloženy various indexům, jako je Google a Bing, a byly také propojeny z jiných existujících domén, které autoři ovládali.

Byly povoleny dva měsíce, jakožto požadovaný interval pro umožnění skenování z široké škály vyhledávacích botů a podobných, jakož i (možná) organických návštěv. V tomto okamžiku byli výzkumníci v pozici, aby mohli dotázat cílené AI chatboty (uvedené níže):

AI chatbot Publisher
ChatGPT OpenAI
Claude Anthropic
Copilot Microsoft
Deepseek Deepseek
Duck.ai DuckDuckGo
ERNIE Baidu
Gemini Google
GLM Z.AI
Granite IBM
Grok xAI
Hunyuan Tencent
AI chatbot Publisher
Kimi MoonshotAI
Liquid Liquid
Llama Meta
Mistral Mistral
Nova Amazon
Perplexity Perplexity
Qwen Alibaba
Reka Reka
Solar Upstage
Step-3 StepFun
Venice Venice

Byly vytvořeny skripty pro dotázání každého systému, prostřednictvím API, pokud to bylo možné. Když to nebylo možné, a když automatizované řešení jako Selenium bylo zablokováno detekčními rutinami AI portálu, byly provedeny manuální interakce prostřednictvím oficiálních GUI LLM.

Po počáteční šabloně (viz obrázek výše) autoři následovali sekundární prompt navrženým k vyvolání jména společnosti nebo osoby v asociovaném tokenu.

Experimenty byly provedeny ve třech podmínkách: plně přístupná webová stránka; webová stránka vypnuta; a webová stránka s omezením robots.txt, které odpuzovalo sběr. Tyto experimenty byly provedeny v tomto přesném pořadí, jeden po druhém, protože pozdější fáze závisely na předchozích.

Nakonec, se všemi stránkami znovu online, poslední fáze by znovu otestovala výstup LLM v intervalech jednoho týdne.

Výsledky

Čtyři z cílených LLM se ukázaly být zcela odolné vůči metodám výzkumníků, a proto nebylo možné získat žádné výsledky pro DeepSeek, Hunyuan, GLM, a Liquid.

Co se týče tendence mnoha AI botů k impersonaci ne-AI provozu, autoři uvádějí:

‘Kromě prvního prohlášení agentů, několik AI systémů vrátilo obsah spojený s obecnými prohlížečovými User-Agent řetězci. Pozorovali jsme toto chování u šesti z 18 AI systémů, pro které jsme získali informace o User-Agentu.

‘Tento výsledek naznačuje, že některé AI systémy mohou získat webový obsah prostřednictvím požadavků, které se podobají běžnému prohlížečovému provozu, což činí User-Agent-based blokování obtížným.’

ERNIE vrátil Baiduspider a Chrome identitu; Grok kombinoval Googlebot s dvěma prohlížečovými agenty; Solar používal pouze prohlížečové identity; Qwen kombinoval Googlebot s Chrome; a Kimi byl spojen s několika prohlížečovými agenty.

Mnohé systémy se zdály spoléhat na třetí strany vyhledávacích sběračů, ve vztazích, které nejsou vždy zveřejněny. Obsah spojený s Googlebot, Bingbot a Bravebot byl vrácen deseti z 18 analyzovaných systémů, často v případech, kdy neexistuje žádná veřejná asociace mezi AI poskytovatelem a vyhledávačem – i když některé odkazy, jako je Claude’s použití Brave, jsou zdokumentovány.

Autoři tvrdí, že to odráží požití vyhledávacích výsledků spíše než přímý sběr, protože kontroly ASN ukázaly, že provoz pocházel z očekávaných vyhledávacích sítí, spíše než z padělaných identit.

To naznačuje, že paper tvrdí, další vrstvu neprůhlednosti ve webové AI potrubí, kde blokování známých AI crawlerů nemusí zabránit použití dat, a vyhnutí se zahrnutí může vyžadovat vyhnutí se vyhledávacímu indexování úplně – nežádoucí volbu, zatímco napětí mezi tradičním SEO a LLM-založeným vyhledáváním je stále daleko od vyřešení.

Pouze cache

Autoři poté otestovali, zda odstranění zdroje ovlivní výstup chatbotů, vypnutím testovacích stránek a opětovným dotázáním systémů po týdenním intervalu. Podle studie mnohé chatboty pokračovaly ve reprodukci “zasetých” obsahu, i po týdnu odstávky, ukazující, že odpovědi byly čerpány z cached dat, spíše než z živého sběru.

Tato persistencia byla nejvíce patrná u systémů spojených s vyhledávacími crawly, kde dříve indexovaný obsah zůstal dostupný, navzdory tomu, že původní stránky již nebyly dostupné – i když podobné chování bylo pozorováno i u systémů spojených s prohlížečovými agenty, naznačující, že caching se může rozšířit za hranice vyhledávacích potrubí.

Studie naznačuje, že jednou, co obsah vstoupí do cache, ať už je udržována chatbotem nebo přístupná prostřednictvím vyhledávacích indexů, odstranění původní stránky nemusí spolehlivě odstranit tento obsah z následujících výstupů.

Závěr

Autoři připouštějí, že určitá “únik” bude následkem tohoto klasického “siloovaného” přístupu, protože jedinečné tokeny zaměřené na jeden LLM mohou někdy skončit ve vyhledávacích výsledcích (generovaných tokeny jejich skutečného vlastníka), které jsou poté požitky druhým LLM. Nicméně, v takových schématech, je difuze tohoto typu nevyhnutelná, a bdělost pro první výskyt je kritickým a rozhodujícím okamžikem.

Co zůstává vidět, je rozsah, v jakém by takový schéma mohlo být implementováno v měřítku, zejména поскольку, jak autoři poznamenávají, jeden by brzy vyčerpal kontextově správné tokeny.

Jednoduše, tato otázka však poněkud míjí pointu, protože může existovat limit i pro drzost AI společností, aby se protlačily jasnými důkazy o svých vlastních lžích o svých sběracích politikách. Navíc, pokud tyto společnosti nespojí k maskování své identity prostřednictvím domácích IP adres, stačí, aby jedna organizace identifikovala a zveřejnila SpamHaus-style blacklist AI-bot IP adres nebo ASN; proces nemusí být industrializován, aby byl efektivní.

 

Poprvé zveřejněno ve čtvrtek, 14. května 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai