Andersonin kulma
Kulkurikello, joka paljastaa AI-liikenteen

Uudessa tutkimuksessa tutkijat piilottivat yksilöllisiä lauseita verkkosivuille ja saivat AI-keskusteluboteista toistamaan ne, paljastaen piilotetut tietojen keräysputkistot ja ilmeisesti joistakin suurimmista AI-yrityksistä tulevat petolliset käytännöt.
AI-yritykset taistelevat etulyöntiasemasta kilpailussa, joka on ennustettu olevan julmasti supistava; siksi he todella, todella haluavat kerätä tietoja verkkosivuillasi koulutusdataa varten, jotta he voivat ruokkia AI-mallejaan. Joskus jatkuvasti; usein omien toiveidensa vastaisesti; ja usein naamioiden muistuttaa tavallisia ihmisiä tai “ystävällisempiä” botteja, kuten GoogleBot, sen sijaan, että paljastaisivat oikean identiteettinsä AI-tietojen kerääjiksi.
On arvioitu, että ennustetaan, että automaattiset AI-kerääjät, jotka on suunniteltu imemään uusia koulutusdataa ja vastaamaan käyttäjien välittömiin pyynnöksiin uusimman uutisen RAG:n kautta, ylittävät ihmisten määrän vuoden kuluttua.
Tämä raivokas, pitkäaikainen ja toistuva tietojen keräys on osittain seuraus siitä, että jokaisen AI-entiteetin on oltava omalla nykyinen kopio internetistä, sen sijaan, että he käyttäisivät vanhentuneita tietokantoja, kuten Common Crawl; ja ehkä siksi, että yritykset pelkäävät tulevia oikeudellisia rajoituksia, ja heidän on ryhdyttävä IP-pesuun mahdollisimman pian.
Lisäksi, koska AI-yritykset kysyvät jatkuvasti useita (mahdollisesti hedelmällisiä) sivustoja, he saattavat parantaa nykyistä heikkoa kykyään vastata informatiivisesti ja tarkasti murtuvissa ja nousseissa tilanteissa.
Milloin tahansa, näyttää siltä, että näillä käytännöillä on ollut jonkin verran perustetta siinä, että ne ovat olleet hallitsemattomia ja hallitsemattomia jo jonkin aikaa.
Ongelma on, että se ei ole helppoa todistaa, mihin pituuteen AI-yritykset menevät tyytyäkseen janoonsa uusimpiin tietoihin.
Seuraa tietoja
Yksi ehdotus, jota esitetään uudessa tutkimuspaperissa, on vanhan menetelmän muunnelma, jota käytetään vakoilujen, ilmiantajien ja muiden epäilyttävien henkilöiden paljastamiseen: paljastaa heille räätälöity tietoa, jota kukaan muu ei tiedä, ja katsoa, miten ja missä se tieto ilmestyy. Jos kukaan muu ei tiennyt sitä tietoa, silloin vuodon lähde on todistettu:

Tutkijoiden perusidea, joka on esitetty uudessa tutkimuspaperissa, on antaa jokaiselle vierailijabotille hieman erilainen versio samasta sivusta, sitten kysyä chatbotteja siitä sivusta ja nähdä, mikä versio palautuu, mikä mahdollistaa piilotettujen verkkohakujen seuraamisen, jotka toimittivat vastauksen. Lähde
Tämä suosittu lähestymistapa on ehkä parhaiten tunnettu vastapiratointitoimista, joita Academy Awards -komitea otti käyttöön 2000-luvulla, jossa jaettavat esikatselukopiot saivat digitaalisia jäljittämismerkintöjä, jotka voitiin palauttaa alkuperäiselle vastaanottajalle, jos kyseinen elokuva vuotaisi internetiin. Vakoilussa tämä tekniikka tunnetaan barium-ateriana, jossa käytetään radioaktiivista isotooppiliuosta verisuonten valaiseksi ja tunnistamaan tukkeutumia.
(Ironisesti, valittu “kulkurikello”-metafora ei ole kovin sovelias tähän tutkimukseen, vaikka se on tunnistettavampi kuin edellä mainitut trooppiset ilmaukset)
Tutkimuksessa tutkijat loivat kaksikymmentä “honey pot” -verkkosivua ja palvelivat yksilöllisiä tunnisteita jokaiselle yksilölliselle vierailijalle, jotta jokainen sai erilaisia faktoja (katso toinen sarakkeesta vasemmasta yllä olevassa kuvassa).
Tutkimuksen tavoitteena oli paljastaa LLM (AI) -kerääjien todellinen identiteetti ja käyttäytyminen. Kaikkiaan 22 tuotannon LLM-järjestelmää kohti, menetelmä pystyi luotettavasti tunnistamaan, mitkä kerääjät ruokkivat mitäkin LLM:ää, koska – hieman kärsivällisyydellä “istuttamisen” jälkeen – vain kysymällä oikeat kysymykset AI:lle kuukauden tai kahden kuluttua, saatiin yksilölliset tunnisteet.
Petollinen peli
Totta kai, mitään tätä ei tarvitsisi, jos emme olisi vielä “villissä lännessä” -vaiheessa AI:n V3:ssa, ja jos yritykset noudattaisivat pieniä tekstinäppäimiä, joita verkkosivut voivat käyttää kertomaan AI-yrityksille, ettei heidän tietojaan saa kerätä.
Kuten tutkijoiden kokeissa ilmeni, vain yksi AI-yritys näytti kunnioittavan omaa toimintatapaansa ja periaatteitaan: DuckDuckGo:n DuckDuckbot oli ainoa agentti, joka edusti itseään oikein ja lopetti “salattujen tietojen” raportoinnin, kun kohdesivu otettiin pois käytöstä (muut AI-yritykset turvautuivat välimuistiin ja muihin temppuihin) tai kun sivun robots.txt-tiedostoa muutettiin estämään AI:n tietojen kerääminen.
Monet suurimmat toimijat naamioiden yleisiä selain-ID:itä (samaa, mitä verkkosivu näkisi, jos sinä tai minä vierailisimme niillä), ja – Perplexityn 2025 johdonmukaisuuden mukaisesti – naamioiden GoogleBotia, jolla on pitkään ollut “kultainen pääsy” verkkosivujen tietoihin, koska se palautti (huomaa menneessä aikamuodossa, koska tämä on muuttumassa) liikennettä vastineeksi tiedoista.
Pahin rikollinen, tutkimuksen mukaan, oli Kimi AI -ekosysteemi, joka ruokkii:
‘Kimi näyttää olevan äärimmäinen tapaus tästä käyttäytymisestä: useat käyttäjä-agentit näyttävät olevan korreloituneita Kimin tuottamien tietojen kanssa. Arvioimme, että Kimi pyörittää suuren luettelon käyttäjä-agentti-merkkijonoja tietojen keräämisessä, mahdollisesti välttääkseen botin havaitsemisen.’
Mikä tekee tämän ongelman suureksi haasteeksi, on se, että kun ChatGPT tai vastaavat työkalut “etsivät jotain”, se prosessi on suurelta osin näkymätön, ja yritykset tarjoavat vain osittaisia tai itse ilmoittamia tietoja siitä, miten heidän järjestelmänsä keräävät ajantasaisia tietoja. Tämä jättää sivuston omistajat ilman selvää keinoa tietää, mitkä botit ovat todella vieraillemassa heidän sivuillaan, ovatko ne suoria vai reititettyjä hakukoneiden kautta, tai miten se tieto päätyy lopulliseen vastaukseen.
Tutkimuksen tulokset osoittavat, että LLM:t saattavat käyttää omia välimuistitietojaan verkkosivuilta, omia sisäisiä hakukoneiden tyyppisiä luetteloita, ja usein tietoja hakukoneiden tuloksista yrityksistä, joilla ei välttämättä ole julkista yhteyttä, eivätkä näytä olevan käytössä.
Tutkijat uskovat, että tämä paljastus on ensimmäinen kerta, kun työ on osoittanut ei-toivottuja tunkeutumisia RAG-järjestelmistä (suorat soittopyynnöt LLM:stä, jotka saattavat tai eivät saa ihmisen käyttäjää), eikä pelkästään tietojen keräämisbotteja, jotka etsivät raakaa materiaalia koulutusdataa varten.
Uusi tutkimuspaperi on otsikoitu AI-verkkosivujen kerääjien tunnistaminen Kulkurikello-tunnisteiden avulla, ja se on peräisin kuudelta tutkijalta Duke Universitysta, Pittsburghin yliopistosta ja Carnegie Mellonista.
Menetelmä
Tutkijat loivat kaksikymmentä.com-verkkosivua, joilla oli laajalti samanlaiset verkkosivut yleisillä malleilla, kuten taiteellinen portfolio tai yrityksen verkkosivu. Kussakin mallissa oli 10 paikkaa, jotka täytettiin yksilöllisillä tunnisteilla, jotka olivat yksilöllisiä vierailijoiden profiileille (perustuen tekijöihin, kuten IP-osoitteeseen, canvas-sormenjälkeen ja muihin “haistamismenetelmiin”):

Esimerkki mallista ja muuttujista, jotka käytettiin kokeessa. Jokainen yksilöllinen vierailija sai yksilöllisiä, pysyviä mukautettuja muuttujia.
Jokainen yksilöllinen vierailija sai mukautettuja muuttujia. Jos järjestelmä havaitsi palanneen vierailijan, samaa muuttujaa käytettiin uudelleen. Muuttujat luotiin Pythonin Faker-kirjaston avulla sekä (määrittämättömien) satunnaisten numerogeneraattorien avulla.
Honey pot -verkkosivut lähetettiin erilaisiin hakukoneisiin, kuten Googleen ja Bingiin, ja ne linkitettiin myös muihin olemassa oleviin verkkosivuihin, joita tutkijat hallitsivat.
Kaksi kuukautta sallittiin kulua, jotta voidaan varmistaa, että hakukoneiden ja muiden botien skannaus taajuus olisi mahdollisimman laaja, sekä mahdollisesti myös orgaaniset vierailut. Tässä vaiheessa tutkijat pystyivät kysymään kohdennettuja AI-keskustelubotteja:
|
|
Skriptejä luotiin kysymään jokaiselta järjestelmältä, API:n kautta, missä mahdollista. Kun tämä ei ollut mahdollista, ja kun automaattisia ratkaisuja, kuten Selenium, estivät AI-portaalien havaitsemisohjelmat, manuaalisia interaktioita tehtiin LLM:ien virallisten GUI:den kautta.
Alkuperäisen mallipohjaisen vaihdon jälkeen (katso yllä oleva kuva), tutkijat seurasivat toissijaisella kysymyksellä, joka oli tarkoitettu paljastamaan yhtiön tai henkilön nimeä liittyen yksilölliseen tunnisteeseen.
Kokeet suoritettiin kolmessa eri tilanteessa: täysin saatavilla oleva verkkosivu; verkkosivu otettiin pois käytöstä; ja verkkosivu, jossa robots.txt-rajoitus esti tietojen keräämisen. Nämä kokeet suoritettiin tässä järjestyksessä, yksi toisensa jälkeen, koska myöhemmät vaiheet riippuivat aiemmista.
Lopulta, kun kaikki sivut otettiin takaisin online-tilaan, viimeinen vaihe uudelleentesti LLM-vastauksia viikon välein.
Tulokset
Neljä kohdennettua LLM:ää osoittautui täysin vastustuskykyisiksi tutkijoiden menetelmille, eikä tuloksia voitu saada DeepSeek:sta, Hunyuan:sta, GLM:stä ja Liquid:sta.
Koskien useiden AI-bottien taipumusta naamioida ei-AI-liikennettä, tutkijat toteavat:
‘Lisäksi ensimmäisen osapuolen ilmoitetuista agenteista useat AI-järjestelmät palauttivat sisältöä, joka liittyi yleisiin selain User-Agent-merkkijonoihin. Havaitsemme tämän käyttäytymisen kuudessa 18:sta AI-järjestelmästä, joista saimme User-Agent-tietoja.
‘Tämä tulos osoittaa, että jotkut AI-järjestelmät voivat hankkia verkkosivujen sisältöä pyynnöillä, jotka näyttävät samanlaisilta kuin tavallinen selainliikenne, mikä tekee User-Agent-pohjaisen eston vaikeaksi.’
ERNIE palautti sekä Baiduspiderin että Chromen identiteetin; Grok yhdisti Googlebotin kahteen selainagenttiin; Solar käytti vain selainidentiteettejä; Qwen sekoitti Googlebotin Chromen kanssa; ja Kimi liitettiin useisiin selainkaltaisiin agenteihin.
Monet järjestelmät näyttivät riippuvan kolmannen osapuolen hakukoneiden kerääjistä, joissa suhteita ei aina ilmoitettu. Sisältöä, joka liittyi Googlebotiin, Bingbotiin ja Bravebotiin, palautti kymmenen 18:sta analyysoidusta järjestelmästä, usein tapauksissa, joissa ei ollut julkista yhteyttä AI-tarjoajan ja hakukoneen välillä – vaikka jotkut yhteydet, kuten Clauden käyttö Braven kanssa, on dokumentoitu.
Tutkijat väittävät, että tämä heijastaa hakutulosten nielamista suoraan hakkeroinnin sijaan, koska ASN-tarkistukset osoittivat, että liikenne tuli odotetuilta hakukoneverkoilta, eikä naamioiduista identiteeteistä.
Tämä osoittaa, tutkimuspaperi väittää, että verkkosivuista AI-pipelineen on lisätty epäselvyyskerros, jossa estämällä tunnettuja AI-kerääjiä ei välttämättä estetä tietojen käyttöä, ja välttämättä estämiseksi on mahdollisesti tarpeen poistua hakukoneen indeksoinnista kokonaan – epätoivottava valinta, kun perinteisen SEO:n ja LLM-pohjaisen hakutoiminnan jännite on edelleen kaukana ratkaisusta.
Välimuisti vain
Tutkijat testasivat sitten, vaikuttaako lähdepoiston aiheuttama muutos chatbottien tuloksiin, ottamalla testisivut pois käytöstä ja kysymällä järjestelmiä uudelleen viikon kuluttua. Tutkimuksen mukaan monet chatbotit jatkoivat “istutettujen” tietojen toistamista jopa viikon ajan, mikä osoittaa, että vastaukset perustuivat välimuistitietoihin eikä suoriin hakuihin.
Tämä jatkuminen oli selkeintä järjestelmissä, jotka liittyivät hakukoneiden kerääjiin, joissa aikaisemmin indeksoitu sisältö säilyi edelleen saatavilla, vaikka alkuperäiset sivut eivät olleet enää saatavilla – vaikka samankaltaista käyttäytymistä havaittiin myös järjestelmissä, jotka liittyivät selainkaltaisiin agenteihin, mikä osoittaa, että välimuisti voi ulottua hakukoneiden tukiputkistojen ulkopuolelle.
Tutkimuspaperi ehdottaa, että kun sisältö pääsee välimuistiin, riippumatta siitä, onko se chatbotin ylläpitämä tai saatavilla hakukoneen kautta, alkuperäisen sivun poistaminen ei välttämättä poista sitä sisältöä myöhemmistä tuloksista.
Johtopäätös
Tutkijat myöntävät, että tällaisesta “eristetystä” lähestymistavasta voi seurata jonkin verran “vuotamista”, koska yksilölliset tunnisteet, jotka on tarkoitettu yhdelle LLM:lle, voivat joskus päätyä hakutuloksiin (joita omistaa tunnisteiden “oikea” omistaja), jotka sitten nielaisevat toinen LLM. Kuitenkin tällaisissa skeemoissa tällainen diffuusio on väistämätöntä, ja ensimmäisen ilmenemisen valvonta on kriittinen ja ratkaiseva hetki.
Mitä jää nähtäväksi, on se, missä määrin tällainen skeema voisi olla toteutettavissa laajassa mittakaavassa, erityisesti koska, kuten tutkijat huomauttavat, yksilöllisten, kontekstuaalisesti oikein olevien tunnisteiden määrä loppuisi nopeasti.
Kuitenkin tämä on sivuseikka, koska voi olla raja sille, kuinka rohkeasti AI-yritykset voivat ylittää oman selkeän valheensa tietojen keräämispolitiikasta. Lisäksi, elleivät yritykset sitoudu todella kalliiseen reittiin kotimaisten IP-osoitteiden kautta maskiroidakseen identiteettinsä, riittää, että yksi organisaatio tunnistaa ja julkaisee SpamHaus-tyylisen mustan listan petollisista AI-botti-IP-osoitteista tai ASNeista; prosessi ei välttämättä vaadi teollista mittakaavaa ollakseen tehokas.
Julkaistu torstaina, 14. toukokuuta 2026












