Andersonův úhel

Znečištění vyhledávacích výsledků umělou inteligencí ohrožuje ‘kolaps načtení’

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image (GPT-1.5) depicting sewer workers shining their torches on a huge fatberg blocking the sewer, in which is embedded multiple extruded texts saying 'AI'.

Jak umělá inteligence znečišťuje web, otevírá se nová útočná cesta v bitvě o kulturní konsenzus.

 

Výzkum vedený korejskou vyhledávací společností tvrdí, že jak stránky generované umělou inteligencí pronikají do vyhledávacích výsledků, podkopávají stabilitu vyhledávacích a řazení potrubí a oslabují systémy – jako je Generace s podporou načtení (RAG) – které se spoléhají na tyto řazení, aby rozhodly, jaká informace bude zobrazena a důvěřována, a tím zvyšují riziko, že zavádějící nebo nepřesné materiály budou považovány za autoritativní.

Pojem vynalezený pro tento syndrom výzkumníky je Kolaps načtení, jako odlišný od známé hrozby kolapsu modelu (kde umělá inteligence trénovaná na svém vlastním výstupu se stává postupně horší).

V scénáři Kolapsu načtení se obsah generovaný umělou inteligencí postupně stává dominantním ve vyhledávacích výsledcích, do té míry, že i když odpovědi zůstávají povrchově přesné, základní důkazový základ se stal odtržen od původních lidských zdrojů. Přestože tento “bezkořenový” údaj se zdá být připraven dosáhnout vysoké pozice ve vyhledávacích výsledcích*:

‘S šířením textu generovaného umělou inteligencí, výzvy v přisuzování a předtrénování kvality dat se zintenzivnily. Na rozdíl od tradičního klíčového spam, moderní syntetický obsah je sémanticky koherentní, což mu umožňuje sladit se do řazení systémů a šířit se potrubím jako autoritativní důkaz.’

Článek tvrdí, že by to vytvořilo “strukturálně křehkou” situaci, ve které signály řazení upřednostňují stránky vygenerované umělou inteligencí a optimalizované pro vyhledávače, které postupně nahrazují lidsky psané zdroje způsobem, který je záludný, tj. bez zjevného poklesu kvality odpovědí*:

‘[Růst] obsahu generovaného umělou inteligencí na webu představuje strukturální riziko pro načtení informací, protože vyhledávače a systémy Generace s podporou načtení (RAG) stále více konzumují důkazy vygenerované velkými jazykovými modely (LLM).’

‘Charakterizujeme tento ekosystémový režim selhání jako Kolaps načtení, dvoufázový proces, ve kterém (1) obsah generovaný umělou inteligencí dominuje vyhledávacím výsledkům, eroduje rozmanitost zdrojů, a (2) nízkokvalitní nebo adversní obsah infiltrovává potrubí načtení.’

Výzkumníci tvrdí, že jakmile je fáze “dominace” etablována, stejné potrubí načtení se stává náchylnějším k úmyslnému znečištění, protože adversní stránky mohou využít stejné optimalizačních mechanismů, aby získaly viditelnost*:

‘Establishováním rámce Kolapsu načtení, tato práce vytváří základ pro pochopení, jak syntetický obsah mění načtení informací. Abychom zmírnili tato rizika, navrhujeme posun k obraně řazení strategiím, které společně optimalizují relevanci, faktualitu a původ.’

Kolaps načtení by pravděpodobně zhoršil kolaps modelu, protože přidává vrstvu zlomyslné vůle na “fotokopírovací efekt” entropie, kde umělá inteligence stále více krmit umělou inteligencí generovaným výstupem. Kromě toho, že ovlivňuje zdánlivou shodu na “pravdě” v reálném čase vyhledávacích výsledků, nesprávnosti a útoky by se později mohly stát zapsanými do trénovaných LLM jako autoritativní zdroje.

Nová práce se jmenuje Kolaps načtení, když umělá inteligence znečišťuje web a pochází od tří výzkumníků z Naver Corporation.

Metoda

Aby otestovali, jak obsah generovaný umělou inteligencí se šíří prostřednictvím systémů načtení, výzkumníci náhodně vybrali 1000 párů dotaz/odpověď z MS MARCO datové sady a benchmarku, který se skládá z otevřených doménových otázek spárovaných s lidsky validovanými referenčními odpověďmi. Tyto byly použity jak pro zakotvení načtení, tak pro vyhodnocení faktické správnosti generovaných odpovědí.

Pro každý dotaz MS MARCO v testech byly načteny deset webových dokumentů z Google Search, na základě top-rankingu SEO výsledků pro každý termín, což nakonec vytvořilo pool 10 000 dokumentů.

Faktická platnost dokumentů byla hodnocena porovnáním každého z nich proti MS MARCO ground truth, pomocí GPT-5 Mini jako soudce.

Simulace farmy obsahu

Aby simulovali úroveň kvality (normálních, neadversních) článků spojených s farmami obsahu, autoři použili ekonomický GPT-5 Nano OpenAI model k skutečnému generování nových syntetických článků, protože tato je “dostupná” úroveň umělé inteligence, která bude pravděpodobně použita farmami obsahu. GPT-5 Mini, použitý pro hodnocení výstupu, je mírně schopnější model.

Naopak, aby simulovali adversní příspěvky (tj. obsah navržený k šíření dezinformací nebo který jinak obsahuje dezinformace), nebyly použity žádné reálné reference. Místo toho byly první návrhy vzorků vytvořeny pomocí konvenčního generátoru clickbait/SEO a poté předány GPT-5 Nano, kterému byla přidělena úloha nahradit určitý počet faktů nepravdivými, ale věrohodnými alternativami. GPT-5 Nano také provedl sémantické re-řazení pro účely experimentálního kontextu.

Aby simulovali nasycení umělou inteligencí v čase, byl spuštěn 20-kolový proces kontaminace, ve kterém byl přidán jeden syntetický dokument na dotaz do pevné sady deseti původních dokumentů, zvyšující se podíl umělou inteligencí z 0% na 66,7%.

Pro SEO-styl pool byl generátor vyzván, aby “jednal jako specialista na SEO”, a integroval high-IDF klíčová slova z původních dokumentů, aby zvýšil pravděpodobnost načtení.

Pro adversní pool byl prompt navržen tak, aby zachoval plynulý, přirozeně znějící prózu, zatímco jemně měnil pojmenované entity a numerické detaily, vytvářející dokumenty, které by nevyvolaly statistické filtry, zatímco tiše erodovaly faktickou přesnost.

Metriky

Byly přijaty tři metriky pro experimenty: Pool Contamination Rate (PCR), aby určily, kolik dokumentového poolu bylo generováno umělou inteligencí; Exposure Contamination Rate (ECR), aby měřily, kolik z top 10 vyhledávacích výsledků pocházelo z umělou inteligencí zdrojů (ukazující, co skutečně vstoupilo do potrubí načtení); a Citation Contamination Rate (CCR), aby zaznamenaly, kolik důkazů citovaných v konečné odpovědi bylo syntetické.

Aby se prozkoumala praktická dopad, byly testovány jak kvalita načtených zdrojů, tak integrita konečné odpovědi. Precision@10 (P@10) zachytila, kolik z top 10 výsledků bylo skutečně správných, když se porovnaly s MS MARCO ground truth; a Answer Accuracy (AA) měřila, zda generovaná odpověď odpovídala téže referenční odpovědi, s GPT-5 Mini použitým k určení, zda význam byl konzistentní.

Testy

Zpočátku autoři otestovali svou metodu proti původnímu poolu dokumentů extrahovaných z SERPS, tj. předtím, než byly použity jako materiál pro generování syntetických dat, a poznamenali, že jejich LLM ranker dosáhl “silné kvality načtení”, překonávající BM25 Ranker baseline.

První ze dvou primárních scénářových testů, nazvaný Dominance a homogenizace, byl zkoumáním toho, jak dokumenty SEO-formátů ovlivňují výsledky načtení:

Left, kontaminační křivky pro Scénář 1 pod BM25 a LLM rankery ukazují Pool Contamination Rate (PCR) rostoucí kolo po kole, s Exposure Contamination Rate (ECR) a Citation Contamination Rate (CCR) zvyšující se strměji, jak syntetické dokumenty zaplňují top výsledky, zatímco Answer Accuracy (AA) zůstává široce stabilní. Right, tabulka uvádí stejný postup numericky napříč koly 0, 5, 10 a 20, uvádějící PCR, ECR, CCR a AA pro oba rankery.

Left: kontaminační křivky pro Scénář 1 pod BM25 a LLM rankery ukazují Pool Contamination Rate (PCR) rostoucí s každým kolem, s Exposure Contamination Rate (ECR) a Citation Contamination Rate (CCR) zvyšující se strměji, jak syntetické dokumenty zaplňují top výsledky; Answer Accuracy (AA) zůstává široce stabilní. Right: tabulka uvádí stejný postup numericky napříč koly 0, 5, 10 a 20, uvádějící PCR, ECR, CCR a AA pro oba rankery.

Jakmile byly přidány více stránky vygenerované umělou inteligencí do testovacího prostředí, začaly dominovat top vyhledávacím výsledkům rychleji, než se očekávalo. Když obsah generovaný umělou inteligencí tvořil 50% všech dostupných dokumentů, více než 68% top 10 výsledků BM25 již bylo generováno umělou inteligencí; a když se podíl materiálu umělou inteligencí zvýšil na 67%, více než 80% top výsledků BM25 pocházelo z umělou inteligencí zdrojů.

LLM-založený ranker ukázal ještě silnější tendenci v tomto směru, s přibližně 76% top výsledků pocházejících z dokumentů vygenerovaných umělou inteligencí, když tyto dokumenty tvořily pouze polovinu celkového poolu – a pokračoval v tom, že se spoléhal na ně více než BM25, jak jejich přítomnost vzrostla. Autoři komentují:

‘Tento vzorec ukazuje, že SEO-optimalizovaný obsah nepřiměřeně aktivuje signály řazení, způsobující, že obě modely se rychle sbližují k synteticky dominantnímu důkazu.’

Pokud jde o napětí mezi faktickou stabilitou a kolapsem rozmanitosti, článek poznamenává, že navzdory “dramatickým” posunům ve vyhledávaných důkazech, Answer Accuracy zůstala stabilní, nebo se dokonce zlepšila:

‘Protože SEO dokumenty jsou vysoce kvalitní a topicky sladěné, načtení se zdá být zdravé, když se měří pouze přesností. Nicméně, téměř všechny načtené důkazy jsou syntetické, ukazující na vážný kolaps v rozmanitosti zdrojů.

‘Tento rozpor, charakterizovaný stabilní přesností navzdory kolapsu rozmanitosti, odhaluje strukturálně křehkou pipeline načtení: systém funguje dobře v agregovaných metrikách, zatímco tiše ztrácí své zakotvení v lidsky psaném obsahu.

‘Celkově, vysoce kvalitní syntetický obsah nejenom bezproblémově integruje do pipeline načtení, ale aktivně přehlušuje signály řazení, způsobující, že obě BM25 a LLM Rankery se téměř výhradně spoléhají na důkazy generované umělou inteligencí.’

Druhý scénář se nazýval Znečištění a korekce systému a odhalil pozoruhodný rozpor v chování rankeru ve srovnání s prvním scénářem:

Left, výsledky scénáře 2 ukazují, co se stane, když jsou do systému přidány úmyslně zavádějící stránky. Jak jsou přidávány více těchto stránek, BM25 začíná umisťovat některé z nich do svých top výsledků – ačkoli pouze až do čtvrtiny v polovině, a téměř žádné nejsou skutečně použity v konečné odpovědi. Celková kvalita odpovědi mírně klesá. Right, tabulka představuje stejný vzorec numericky pro oba BM25 a LLM-založený ranker, ukazující, že BM25 umožňuje některým zavádějícím stránkám vstoupit do svých top výsledků, zatímco LLM ranker je téměř úplně filtroval.

Left: výsledky scénáře 2 ukazují, co se stane, když jsou do systému přidány úmyslně zavádějící stránky. Jak jsou přidávány více těchto stránek, BM25 začíná umisťovat některé z nich do svých top výsledků – ačkoli pouze až do čtvrtiny v polovině, a téměř žádné nejsou skutečně použity v konečné odpovědi. Celková kvalita odpovědi mírně klesá. Right: tabulka představuje stejný vzorec numericky pro oba BM25 a LLM-založený ranker, ukazující, že BM25 umožňuje některým zavádějícím stránkám vstoupit do svých top výsledků, zatímco LLM ranker je téměř úplně filtroval.

LLM-založený ranker byl téměř schopen rozpoznat a filtrovat zavádějící stránky, udržující podíl takového obsahu v jeho top výsledcích blízko nule; ale BM25 umožnil jistému podílu adversních stránek vstoupit do svých top 10 výsledků, s přibližně 19% až 24% objevujících se tam v určitých fázích testu.

Ačkoli LLM-založený ranker prokázal větší odolnost v tomto experimentu, autoři poznamenávají, že LLM-založené systémy řazení jsou výpočetně náročnější, což může učinit jejich rozsáhlé nasazení nepraktickým. Ačkoli BM25 je jednodušší a levnější na běh, široce používané systémy načtení, které jej využívají, mohou, podle článku, být více vystaveny manipulovanému obsahu, než se zdá.

Autoři charakterizují tento jako “významné strukturální riziko”.

Co se týče kontrastu mezi zdánlivou stabilitou a podkladovým zhoršením, autoři poznamenávají, že v tomto kontextu AA zůstává relativně stabilní, díky LLM soudci, který potlačuje korupci citací, a tím působí jako druh poslední instance proti adversnímu obsahu.

Nicméně, Answer Accuracy v tomto aspektu byla konzistentně nižší než v prvním scénáři:

‘Zatímco Scénář 1 viděl AA udrženou nebo dokonce zlepšenou (dosahující až 70% s LLM Rankery) díky vysoké kvalitě SEO obsahu, Scénář 2 vykazuje pokles kvality odpovědi ve srovnání se scénářem SEO […]

‘To potvrzuje, že bez ohledu na ranker, adversní znečištění ve fázi načtení negativně ovlivňuje koncový výkon, s tím, že zhoršení je nejhorší, když se spoléhá na lehké retrievery.’

Autoři uzavírají, že re-řazení ve fázi načtení je příliš pozdě, a že “ingestní” filtry by měly být zvažovány, navrhují, že “provenanční grafy” a “perplexity filtry” by mohly být využity.

Zakončují tím, že zdůrazňují, že jádrem hrozby je obsah s vysokou plynulostí, ale nízkou hustotou přisuzování, prakticky odtržený od uklidňujících řetězců přisuzování, a poznamenávají:

‘[Jak] Agentic AI začíná autonomně publikovat obsah, obranné mechanismy musí evolucí z statické textové analýzy na behaviorální fingerprinting, identifikaci a izolaci agentů, kteří systematicky produkují vysoké-entropické, nízkofaktické proudy.’

Závěr

Zavedení nových nebo vylepšených metodologií pro informační původ může být jednou z nejkritičtějších nezbytností pro rok 2026. Komplexní systémy přihlašovacích údajů, jako je C2PA, které vyžadují infrastrukturní změny od vydavatelů a veřejného vzdělávání o tom, co znamenají a jak nebo proč je používat, zdají se být odsouzeny k neúspěchu.

Něco jednoduššího je zapotřebí, a dosud nebylo nalezeno. Je to naléhavá mise, protože tato současná éra může být nejkritičtějším bodem zlomu pro veřejný konsenzus o pravdě od vynálezu fotografie v roce 1822 a vzestupu propagandy v desetiletích před druhou světovou válkou.

 

* Moje (selektivní, pokud je to nutné) konverze autorů inline citací na hypertextové odkazy.

Poprvé publikováno ve čtvrtek, 19. února 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]