Kąt Andersona
Zanieczyszczenie wyszukiwania przez treści AI naraża na ‘kollaps pobierania’

Podczas gdy treści AI zanieczyszczają sieć, otwiera się nowy wektor ataku na polu walki o konsensus kulturowy.
Badania prowadzone przez koreańską firmę wyszukiwarkową dowodzą, że w miarę jak strony wygenerowane przez AI wkraczają do wyników wyszukiwania, podważają stabilność potoków wyszukiwania i rankingu, oraz osłabiają systemy – takie jak Retrieval-Augmented Generation (RAG) – które polegają na tych rankingach, aby zdecydować, jakie informacje są wyświetlane i uznawane za zaufane, zwiększając tym samym ryzyko, że mylące lub niedokładne materiały będą traktowane jako autorytatywne.
Określenie wymyślone przez badaczy na tę chorobę to Kollaps Pobierania, jako odrębne od znanego zagrożenia kollapsu modelu (gdzie AI szkolona na własnej produkcji staje się stopniowo gorsza).
W scenariuszu Kollapsu Pobierania, treści wygenerowane przez AI stopniowo dominują wyniki wyszukiwania, do tego stopnia, że nawet gdy odpowiedzi pozostają powierzchownie dokładne, podstawowa baza dowodowa stanie się oderwana od oryginalnych źródeł ludzkich. Niemniej jednak, ten “bezkorzeniowy” danych wydaje się gotowy osiągnąć wysoką pozycję w wynikach wyszukiwania*:
‘Z rozprzestrzenianiem się treści wygenerowanych przez AI, wyzwania w atrybucji i jakości danych przedtreningowych zostały nasilone. W przeciwieństwie do tradycyjnego spamu słów kluczowych, nowoczesne treści syntetyczne są spójne semantycznie, co pozwala im zintegrować się z systemami rankingu i rozprzestrzenić się przez potoki jako dowody autorytatywne.’
Artykuł twierdzi, że spowoduje to stworzenie “strukturalnie kruchego” środowiska, w którym sygnały rankingu faworyzują strony wytworzone przez AI, optymalizowane pod kątem SEO, które wypierają źródła ludzkie w sposób podstępny, tj. bez wywoływania oczywistych spadków jakości odpowiedzi:
‘[Wzrost] treści wygenerowanych przez AI w sieci stanowi strukturalne ryzyko dla odzyskiwania informacji, ponieważ wyszukiwarki i systemy RAG coraz częściej konsumują dowody wytworzone przez duże modele językowe (LLM).’
‘Charakteryzujemy ten tryb awarii na poziomie ekosystemu jako Kollaps Pobierania, dwuetapowy proces, w którym (1) treści wygenerowane przez AI dominują wyniki wyszukiwania, podważając różnorodność źródeł, oraz (2) treści niskiej jakości lub wrogie infiltrują potok pobierania.’
Badacze twierdzą, że gdy tylko zostanie ustanowiona faza “dominacji”, ten sam potok pobierania staje się bardziej podatny na celowe zanieczyszczenie, ponieważ strony wrogie mogą wykorzystywać te same mechanizmy optymalizacji, aby zwiększyć swoją widoczność*:
‘Ustanawiając ramy Kollapsu Pobierania, praca ta stanowi podstawę dla zrozumienia, w jaki sposób treści syntetyczne zmieniają odzyskiwanie informacji. Aby złagodzić te ryzyka, proponujemy przesunięcie w kierunku strategii rankingu obronnego, które łączą optymalizację pod kątem istotności, faktualności i pochodzenia.’
Kollaps Pobierania najprawdopodobniej nasiliłby kollaps modelu, ponieważ dodaje warstwę złośliwej intencji do “efektu kopiowania”, gdzie AI coraz częściej żywi się wyjściem wygenerowanym przez AI. Poza wpływem na pozorny konsensus na temat “prawdy” w wynikach wyszukiwania w czasie rzeczywistym, nieścisłości i ataki mogą później zostać uwzględnione w wyuczonych LLM jako autorytatywne źródła.
Nowa praca ma tytuł Kollaps Pobierania, gdy AI zanieczyszcza sieć i pochodzi od trzech badaczy z Naver Corporation.
Metoda
Aby przetestować, jak treści wygenerowane przez AI rozprzestrzeniają się przez systemy pobierania, badacze losowo wybrali 1000 par pytań i odpowiedzi z MS MARCO i zestawu danych, który składa się z pytań otwartych parzystych z ludzkimi odpowiedziami walidowanymi. Zostały one wykorzystane zarówno do ugruntowania pobierania, jak i do oceny poprawności faktualnej wygenerowanych odpowiedzi.
Dla każdego pytania MS MARCO w testach pobrano dziesięć dokumentów z Google Search, na podstawie najlepszych wyników SEO dla każdego terminu, co ostatecznie dało pulę 10 000 dokumentów.
Poprawność faktualna dokumentów została oceniona przez porównanie każdego z nich z MS MARCO, przy użyciu GPT-5 Mini jako sędziego.
<strong Symulacja Fermy Treści
Aby symulować poziom jakości (normalnych, nie-wrogich) artykułów związanych z fermami treści, autorzy użyli ekonomicznego GPT-5 Nano modelu OpenAI, aby wygenerować nowe syntetyczne artykuły, ponieważ jest to “dostępny” poziom AI, który najprawdopodobniej zostanie użyty przez młyny treści. GPT-5 Mini, użyty do oceny wyjścia, jest nieco bardziej zdolnym modelem.
Odwrotnie, aby symulować wrogie posty (tj. treści zaprojektowane do rozpowszechniania dezinformacji lub zawierające dezinformację), nie użyto żadnych odniesień do świata rzeczywistego. Zamiast tego, pierwsze szkice próbek zostały utworzone za pomocą konwencjonalnego generatora clickbait/SEO, a następnie przekazane do GPT-5 Nano, który miał za zadanie zastąpić pewną liczbę faktów prawdopodobnymi, ale nieprawdziwymi alternatywami. GPT-5 Nano również wykonał ponowne rangowanie semantyczne do celów kontekstu eksperymentalnego.
Aby symulować nasycenie AI w czasie, uruchomiono 20-okrągły proces zanieczyszczenia, w którym jeden syntetyczny dokument został dodany do ustalonego zestawu dziesięciu oryginalnych dokumentów, zwiększając udział AI z 0% do 66,7%.
Dla puli stylu SEO, generator został poproszony o “działanie jako specjalista SEO” i o zintegrowanie wyrazów o wysokiej IDF z oryginalnych dokumentów, aby zwiększyć prawdopodobieństwo pobierania.
Dla puli wrogiej, prompt został zaprojektowany tak, aby zachować płynną, naturalnie brzmiącą prozę, podczas gdy subtelnym zmianom poddano nazwy encji i szczegóły liczbowe, tworząc dokumenty, które nie wywołałyby filtrów statystycznych, a jednocześnie cicho podważałyby dokładność faktualną.
Metryki
Przyjęto trzy metryki do eksperymentów: Współczynnik Zanieczyszczenia Puli (PCR), aby określić, jaki procent puli dokumentów był wygenerowany przez AI; Współczynnik Zanieczyszczenia Ekspozycji (ECR), aby zmierzyć, jaki procent najlepszych wyników wyszukiwania pochodził z źródeł AI (wskazując, co tak naprawdę weszło do potoku pobierania); oraz Współczynnik Zanieczyszczenia Cytatów (CCR), aby odnotować, jaki procent cytowanych dowodów był syntetyczny.
Aby zbadać praktyczny wpływ, zarówno jakość odzyskanych źródeł, jak i integralność ostatecznej odpowiedzi zostały przetestowane. Precyzja@10 (P@10) ujęła, ile z najlepszych wyników było rzeczywiście poprawnych, gdy sprawdzono je względem MS MARCO; oraz Dokładność Odpowiedzi (AA) mierzyła, czy wygenerowana odpowiedź odpowiadała tej samej odpowiedzi odniesienia, z użyciem GPT-5 Mini, aby określić, czy znaczenie było spójne.
Testy
Początkowo autorzy przetestowali swoją metodę przeciwko oryginalnej puli dokumentów wyodrębnionych z SERPS, tj. przed ich użyciem jako materiału do generowania danych syntetycznych, i zauważyli, że ich LLM ranker osiągnął “silną jakość pobierania”, przewyższając BM25 Ranker bazowy.
Pierwszy z dwóch głównych testów scenariuszowych, nazwany Dominacja i Ujednolicenie, był badaniem wpływu dokumentów syntetycznych ukształtowanych przez SEO na wyniki wyszukiwania:

Left: contamination curves for Scenario 1 under BM25 and LLM rankers show Pool Contamination Rate (PCR) rising with each round, with Exposure Contamination Rate (ECR) and Citation Contamination Rate (CCR) increasing more steeply as synthetic documents crowd into the top results; Answer Accuracy (AA) remains broadly stable. Right: the corresponding table reports the same progression numerically across rounds 0, 5, 10, and 20, detailing PCR, ECR, CCR, and AA for both rankers.
Im więcej stron AI zostało stopniowo dodanych do środowiska testowego, zaczęły one dominować w najlepszych wynikach wyszukiwania szybciej, niż się spodziewano. Gdy treści AI stanowiły 50% wszystkich dostępnych dokumentów, ponad 68% najlepszych wyników BM25 było już wygenerowanych przez AI; oraz gdy udział materiału AI wzrósł do 67%, ponad 80% jego najlepszych wyników pochodziło z źródeł AI.
Ranker oparty na LLM wykazał nawet silniejszą tendencję w tym kierunku, z około 76% swoich najlepszych wyników pochodzących ze stron wygenerowanych przez AI, gdy te strony stanowiły tylko połowę puli ogólnej – i nadal polegał na nich bardziej niż BM25, w miarę wzrostu ich obecności. Autorzy komentują:
‘Ten wzorzec pokazuje, że treści zoptymalizowane pod kątem SEO aktywują nierównomiernie sygnały rankingu, powodując, że oba modele szybko konwergują w kierunku syntetycznych dowodów.’
W odniesieniu do napięcia między pozorną stabilnością a degradacją różnorodności, artykuł zauważa, że pomimo “dramatycznych” zmian w odzyskanych dowodach, Dokładność Odpowiedzi pozostaje stabilna lub nawet się poprawia:
‘Ponieważ dokumenty SEO są wysokiej jakości i dobrze dopasowane tematycznie, pobieranie wydaje się zdrowe, gdy mierzy się je tylko pod kątem dokładności. Niemniej jednak, prawie wszystkie odzyskane dowody są syntetyczne, co wskazuje na poważny kollaps w różnorodności źródeł.
‘To rozbieżność, charakteryzowana przez stabilną dokładność, mimo załamania się różnorodności, ujawnia strukturalnie kruchy potok pobierania: system wykonuje się dobrze w agregowanych miarach, podczas gdy cicho traci swoje uzasadnienie w treściach ludzkich.’
‘Ogólnie, wysokiej jakości treści syntetyczne nie tylko zintegrują się bezproblemowo z potokami pobierania, ale również aktywnie przytłoczą sygnały rankingu, powodując, że zarówno BM25, jak i LLM Ranker będą polegać niemal wyłącznie na dowodach wygenerowanych przez AI.’
Drugi scenariusz nazwano Zanieczyszczenie i Korekcja Systemu, i ujawnił zauważalną rozbieżność w zachowaniu rankera w porównaniu z pierwszym scenariuszem:

Left: the scenario 2 results show what happens when deliberately misleading pages are added to the system. As more of these pages are mixed in, BM25 begins to place some of them in its top results – though only up to about a quarter at the midpoint, and almost none are actually used in the final answer. Overall answer quality falls slightly. Right: the table presents the same pattern in numbers for both BM25 and the LLM-based ranker, making clear that BM25 lets some misleading pages into its top results, whereas the LLM ranker largely filters them out.
Ranker oparty na LLM był w stanie rozpoznać i wyfiltrować strony mylące, utrzymując udział takich treści w swoich najlepszych wynikach blisko zera; BM25 pozwolił jednak na wejście do swoich najlepszych wyników zauważalnej części stron wrogich, z około 19% do 24% pojawiających się tam w pewnych etapach testu.
Chociaż ranker LLM okazał się bardziej odporny w tym eksperymencie, autorzy zauważają, że systemy rankingu oparte na LLM są bardziej wymagające obliczeniowo, co może sprawić, że wdrożenie na dużą skalę będzie niewykonalne. Chociaż BM25 jest prostszy i tańszy w uruchomieniu, powszechnie używane systemy pobierania, które wykorzystują go, mogą, zdaniem autorów, być bardziej narażone na treści manipulowane, niż się początkowo wydaje.
Autorzy określają to jako “znaczące strukturalne ryzyko”.
W odniesieniu do kontrastu między pozorną stabilnością a degradacją podstawową, autorzy zauważają, że w tym kontekście Dokładność Odpowiedzi pozostaje względnie stabilna, ze względu na to, że sędzia LLM tłumi korupcję cytatu, i tym samym działa jako rodzaj ochrony przed treściami wrogimi.
Jednak Dokładność Odpowiedzi w tym aspekcie była stale niższa niż w pierwszym scenariuszu:
‘Podczas gdy Scenariusz 1 wykazał Dokładność Odpowiedzi utrzymaną lub nawet poprawioną (osiągając nawet 70% z rankerami LLM) dzięki wysokiej jakości treści SEO, Scenariusz 2 wykazuje spadek jakości odpowiedzi w porównaniu z ustawieniem SEO […]
‘To potwierdza, że niezależnie od rankera, zanieczyszczenie wrogie na etapie pobierania negatywnie wpływa na wydajność końcową, z degradacją najbardziej dotkliwą, gdy polega się na lekkich retrieverach.’
Autorzy twierdzą, że ponowne rangowanie na etapie pobierania jest zbyt późne, i że należy rozważyć filtry “na etapie pobierania”. Proponują, że “grafy pochodzenia” i “filtry zaskoczenia” mogą być wykorzystane.
Zamykają, podkreślając, że podstawowym zagrożeniem jest treść o wysokiej płynności, ale niskiej gęstości atrybucji, podstawowo oderwana od łańcuchów pochodzenia, i obserwują:
‘[Gdy] Agentic AI zaczyna samodzielnie publikować treści, mechanizmy obronne muszą ewoluować z analizy statycznej tekstu do śledzenia behawioralnego, identyfikując i izolując agenci, które systematycznie wytwarzają strumienie o wysokiej entropii i niskiej faktualności.’
Wnioski
Ustanowienie nowych lub udoskonalonych metodologii dla pochodzenia informacji może być jedną z najbardziej krytycznych konieczności na 2026 rok. Złożone schematy pochodzenia, takie jak C2PA, które wymagają zmian infrastrukturalnych od wydawców i edukacji publicznej na temat ich znaczenia i sposobu użycia, wydają się skazane na niepowodzenie.
Czegoś prostszego jest potrzeba, i jeszcze nie zostało znalezione. To pilna misja, ponieważ obecna era może być najbardziej krytycznym punktem zwrotnym dla konsensusu publicznego na temat prawdy od wynalezienia fotografii w 1822 roku i wzrostu propagandy w dekadach poprzedzających II wojnę światową.
* Moja (selektywna, gdzie konieczne) konwersja cytowań wewnętrznych autorów na hiperłącza.
Pierwotnie opublikowane w czwartek, 19 lutego 2026












