KÄ t Andersona
Zanieczyszczenie wyszukiwania przez treÅci AI naraÅža na âkollaps pobieraniaâ

Podczas gdy treÅci AI zanieczyszczajÄ sieÄ, otwiera siÄ nowy wektor ataku na polu walki o konsensus kulturowy.
Â
Badania prowadzone przez koreaÅskÄ firmÄ wyszukiwarkowÄ dowodzÄ , Åže w miarÄ jak strony wygenerowane przez AI wkraczajÄ do wynikÃģw wyszukiwania, podwaÅžajÄ stabilnoÅÄ potokÃģw wyszukiwania i rankingu, oraz osÅabiajÄ systemy â takie jak Retrieval-Augmented Generation (RAG) â ktÃģre polegajÄ na tych rankingach, aby zdecydowaÄ, jakie informacje sÄ wyÅwietlane i uznawane za zaufane, zwiÄkszajÄ c tym samym ryzyko, Åže mylÄ ce lub niedokÅadne materiaÅy bÄdÄ traktowane jako autorytatywne.
OkreÅlenie wymyÅlone przez badaczy na tÄ chorobÄ to Kollaps Pobierania, jako odrÄbne od znanego zagroÅženia kollapsu modelu (gdzie AI szkolona na wÅasnej produkcji staje siÄ stopniowo gorsza).
W scenariuszu Kollapsu Pobierania, treÅci wygenerowane przez AI stopniowo dominujÄ wyniki wyszukiwania, do tego stopnia, Åže nawet gdy odpowiedzi pozostajÄ powierzchownie dokÅadne, podstawowa baza dowodowa stanie siÄ oderwana od oryginalnych ÅšrÃģdeÅ ludzkich. Niemniej jednak, ten âbezkorzeniowyâ danych wydaje siÄ gotowy osiÄ gnÄ Ä wysokÄ pozycjÄ w wynikach wyszukiwania*:
âZ rozprzestrzenianiem siÄ treÅci wygenerowanych przez AI, wyzwania w atrybucji i jakoÅci danych przedtreningowych zostaÅy nasilone. W przeciwieÅstwie do tradycyjnego spamu sÅÃģw kluczowych, nowoczesne treÅci syntetyczne sÄ spÃģjne semantycznie, co pozwala im zintegrowaÄ siÄ z systemami rankingu i rozprzestrzeniÄ siÄ przez potoki jako dowody autorytatywne.â
ArtykuÅ twierdzi, Åže spowoduje to stworzenie âstrukturalnie kruchegoâ Årodowiska, w ktÃģrym sygnaÅy rankingu faworyzujÄ strony wytworzone przez AI, optymalizowane pod kÄ tem SEO, ktÃģre wypierajÄ ÅšrÃģdÅa ludzkie w sposÃģb podstÄpny, tj. bez wywoÅywania oczywistych spadkÃģw jakoÅci odpowiedzi:
â[Wzrost] treÅci wygenerowanych przez AI w sieci stanowi strukturalne ryzyko dla odzyskiwania informacji, poniewaÅž wyszukiwarki i systemy RAG coraz czÄÅciej konsumujÄ dowody wytworzone przez duÅže modele jÄzykowe (LLM).â
âCharakteryzujemy ten tryb awarii na poziomie ekosystemu jako Kollaps Pobierania, dwuetapowy proces, w ktÃģrym (1) treÅci wygenerowane przez AI dominujÄ wyniki wyszukiwania, podwaÅžajÄ c rÃģÅžnorodnoÅÄ ÅšrÃģdeÅ, oraz (2) treÅci niskiej jakoÅci lub wrogie infiltrujÄ potok pobierania.â
Badacze twierdzÄ , Åže gdy tylko zostanie ustanowiona faza âdominacjiâ, ten sam potok pobierania staje siÄ bardziej podatny na celowe zanieczyszczenie, poniewaÅž strony wrogie mogÄ wykorzystywaÄ te same mechanizmy optymalizacji, aby zwiÄkszyÄ swojÄ widocznoÅÄ*:
âUstanawiajÄ c ramy Kollapsu Pobierania, praca ta stanowi podstawÄ dla zrozumienia, w jaki sposÃģb treÅci syntetyczne zmieniajÄ odzyskiwanie informacji. Aby zÅagodziÄ te ryzyka, proponujemy przesuniÄcie w kierunku strategii rankingu obronnego, ktÃģre ÅÄ czÄ optymalizacjÄ pod kÄ tem istotnoÅci, faktualnoÅci i pochodzenia.â
Kollaps Pobierania najprawdopodobniej nasiliÅby kollaps modelu, poniewaÅž dodaje warstwÄ zÅoÅliwej intencji do âefektu kopiowaniaâ, gdzie AI coraz czÄÅciej Åžywi siÄ wyjÅciem wygenerowanym przez AI. Poza wpÅywem na pozorny konsensus na temat âprawdyâ w wynikach wyszukiwania w czasie rzeczywistym, nieÅcisÅoÅci i ataki mogÄ pÃģÅšniej zostaÄ uwzglÄdnione w wyuczonych LLM jako autorytatywne ÅšrÃģdÅa.
Nowa praca ma tytuÅ Kollaps Pobierania, gdy AI zanieczyszcza sieÄ i pochodzi od trzech badaczy z Naver Corporation.
Metoda
Aby przetestowaÄ, jak treÅci wygenerowane przez AI rozprzestrzeniajÄ siÄ przez systemy pobierania, badacze losowo wybrali 1000 par pytaÅ i odpowiedzi z MS MARCO i zestawu danych, ktÃģry skÅada siÄ z pytaÅ otwartych parzystych z ludzkimi odpowiedziami walidowanymi. ZostaÅy one wykorzystane zarÃģwno do ugruntowania pobierania, jak i do oceny poprawnoÅci faktualnej wygenerowanych odpowiedzi.
Dla kaÅždego pytania MS MARCO w testach pobrano dziesiÄÄ dokumentÃģw z Google Search, na podstawie najlepszych wynikÃģw SEO dla kaÅždego terminu, co ostatecznie daÅo pulÄ 10 000 dokumentÃģw.
PoprawnoÅÄ faktualna dokumentÃģw zostaÅa oceniona przez porÃģwnanie kaÅždego z nich z MS MARCO, przy uÅžyciu GPT-5 Mini jako sÄdziego.
<strong Symulacja Fermy TreÅci
Aby symulowaÄ poziom jakoÅci (normalnych, nie-wrogich) artykuÅÃģw zwiÄ zanych z fermami treÅci, autorzy uÅžyli ekonomicznego GPT-5 Nano modelu OpenAI, aby wygenerowaÄ nowe syntetyczne artykuÅy, poniewaÅž jest to âdostÄpnyâ poziom AI, ktÃģry najprawdopodobniej zostanie uÅžyty przez mÅyny treÅci. GPT-5 Mini, uÅžyty do oceny wyjÅcia, jest nieco bardziej zdolnym modelem.
Odwrotnie, aby symulowaÄ wrogie posty (tj. treÅci zaprojektowane do rozpowszechniania dezinformacji lub zawierajÄ ce dezinformacjÄ), nie uÅžyto Åžadnych odniesieÅ do Åwiata rzeczywistego. Zamiast tego, pierwsze szkice prÃģbek zostaÅy utworzone za pomocÄ konwencjonalnego generatora clickbait/SEO, a nastÄpnie przekazane do GPT-5 Nano, ktÃģry miaÅ za zadanie zastÄ piÄ pewnÄ liczbÄ faktÃģw prawdopodobnymi, ale nieprawdziwymi alternatywami. GPT-5 Nano rÃģwnieÅž wykonaÅ ponowne rangowanie semantyczne do celÃģw kontekstu eksperymentalnego.
Aby symulowaÄ nasycenie AI w czasie, uruchomiono 20-okrÄ gÅy proces zanieczyszczenia, w ktÃģrym jeden syntetyczny dokument zostaÅ dodany do ustalonego zestawu dziesiÄciu oryginalnych dokumentÃģw, zwiÄkszajÄ c udziaÅ AI z 0% do 66,7%.
Dla puli stylu SEO, generator zostaÅ poproszony o âdziaÅanie jako specjalista SEOâ i o zintegrowanie wyrazÃģw o wysokiej IDF z oryginalnych dokumentÃģw, aby zwiÄkszyÄ prawdopodobieÅstwo pobierania.
Dla puli wrogiej, prompt zostaÅ zaprojektowany tak, aby zachowaÄ pÅynnÄ , naturalnie brzmiÄ cÄ prozÄ, podczas gdy subtelnym zmianom poddano nazwy encji i szczegÃģÅy liczbowe, tworzÄ c dokumenty, ktÃģre nie wywoÅaÅyby filtrÃģw statystycznych, a jednoczeÅnie cicho podwaÅžaÅyby dokÅadnoÅÄ faktualnÄ .
Metryki
PrzyjÄto trzy metryki do eksperymentÃģw: WspÃģÅczynnik Zanieczyszczenia Puli (PCR), aby okreÅliÄ, jaki procent puli dokumentÃģw byÅ wygenerowany przez AI; WspÃģÅczynnik Zanieczyszczenia Ekspozycji (ECR), aby zmierzyÄ, jaki procent najlepszych wynikÃģw wyszukiwania pochodziÅ z ÅšrÃģdeÅ AI (wskazujÄ c, co tak naprawdÄ weszÅo do potoku pobierania); oraz WspÃģÅczynnik Zanieczyszczenia CytatÃģw (CCR), aby odnotowaÄ, jaki procent cytowanych dowodÃģw byÅ syntetyczny.
Aby zbadaÄ praktyczny wpÅyw, zarÃģwno jakoÅÄ odzyskanych ÅšrÃģdeÅ, jak i integralnoÅÄ ostatecznej odpowiedzi zostaÅy przetestowane. Precyzja@10 (P@10) ujÄÅa, ile z najlepszych wynikÃģw byÅo rzeczywiÅcie poprawnych, gdy sprawdzono je wzglÄdem MS MARCO; oraz DokÅadnoÅÄ Odpowiedzi (AA) mierzyÅa, czy wygenerowana odpowiedÅš odpowiadaÅa tej samej odpowiedzi odniesienia, z uÅžyciem GPT-5 Mini, aby okreÅliÄ, czy znaczenie byÅo spÃģjne.
Testy
PoczÄ tkowo autorzy przetestowali swojÄ metodÄ przeciwko oryginalnej puli dokumentÃģw wyodrÄbnionych z SERPS, tj. przed ich uÅžyciem jako materiaÅu do generowania danych syntetycznych, i zauwaÅžyli, Åže ich LLM ranker osiÄ gnÄ Å âsilnÄ jakoÅÄ pobieraniaâ, przewyÅžszajÄ c BM25 Ranker bazowy.
Pierwszy z dwÃģch gÅÃģwnych testÃģw scenariuszowych, nazwany Dominacja i Ujednolicenie, byÅ badaniem wpÅywu dokumentÃģw syntetycznych uksztaÅtowanych przez SEO na wyniki wyszukiwania:

Left: contamination curves for Scenario 1 under BM25 and LLM rankers show Pool Contamination Rate (PCR) rising with each round, with Exposure Contamination Rate (ECR) and Citation Contamination Rate (CCR) increasing more steeply as synthetic documents crowd into the top results; Answer Accuracy (AA) remains broadly stable. Right: the corresponding table reports the same progression numerically across rounds 0, 5, 10, and 20, detailing PCR, ECR, CCR, and AA for both rankers.
Im wiÄcej stron AI zostaÅo stopniowo dodanych do Årodowiska testowego, zaczÄÅy one dominowaÄ w najlepszych wynikach wyszukiwania szybciej, niÅž siÄ spodziewano. Gdy treÅci AI stanowiÅy 50% wszystkich dostÄpnych dokumentÃģw, ponad 68% najlepszych wynikÃģw BM25 byÅo juÅž wygenerowanych przez AI; oraz gdy udziaÅ materiaÅu AI wzrÃģsÅ do 67%, ponad 80% jego najlepszych wynikÃģw pochodziÅo z ÅšrÃģdeÅ AI.
Ranker oparty na LLM wykazaÅ nawet silniejszÄ tendencjÄ w tym kierunku, z okoÅo 76% swoich najlepszych wynikÃģw pochodzÄ cych ze stron wygenerowanych przez AI, gdy te strony stanowiÅy tylko poÅowÄ puli ogÃģlnej â i nadal polegaÅ na nich bardziej niÅž BM25, w miarÄ wzrostu ich obecnoÅci. Autorzy komentujÄ :
âTen wzorzec pokazuje, Åže treÅci zoptymalizowane pod kÄ tem SEO aktywujÄ nierÃģwnomiernie sygnaÅy rankingu, powodujÄ c, Åže oba modele szybko konwergujÄ w kierunku syntetycznych dowodÃģw.â
W odniesieniu do napiÄcia miÄdzy pozornÄ stabilnoÅciÄ a degradacjÄ rÃģÅžnorodnoÅci, artykuÅ zauwaÅža, Åže pomimo âdramatycznychâ zmian w odzyskanych dowodach, DokÅadnoÅÄ Odpowiedzi pozostaje stabilna lub nawet siÄ poprawia:
âPoniewaÅž dokumenty SEO sÄ wysokiej jakoÅci i dobrze dopasowane tematycznie, pobieranie wydaje siÄ zdrowe, gdy mierzy siÄ je tylko pod kÄ tem dokÅadnoÅci. Niemniej jednak, prawie wszystkie odzyskane dowody sÄ syntetyczne, co wskazuje na powaÅžny kollaps w rÃģÅžnorodnoÅci ÅšrÃģdeÅ.
âTo rozbieÅžnoÅÄ, charakteryzowana przez stabilnÄ dokÅadnoÅÄ, mimo zaÅamania siÄ rÃģÅžnorodnoÅci, ujawnia strukturalnie kruchy potok pobierania: system wykonuje siÄ dobrze w agregowanych miarach, podczas gdy cicho traci swoje uzasadnienie w treÅciach ludzkich.â
âOgÃģlnie, wysokiej jakoÅci treÅci syntetyczne nie tylko zintegrujÄ siÄ bezproblemowo z potokami pobierania, ale rÃģwnieÅž aktywnie przytÅoczÄ sygnaÅy rankingu, powodujÄ c, Åže zarÃģwno BM25, jak i LLM Ranker bÄdÄ polegaÄ niemal wyÅÄ cznie na dowodach wygenerowanych przez AI.â
Drugi scenariusz nazwano Zanieczyszczenie i Korekcja Systemu, i ujawniÅ zauwaÅžalnÄ rozbieÅžnoÅÄ w zachowaniu rankera w porÃģwnaniu z pierwszym scenariuszem:

Left: the scenario 2 results show what happens when deliberately misleading pages are added to the system. As more of these pages are mixed in, BM25 begins to place some of them in its top results â though only up to about a quarter at the midpoint, and almost none are actually used in the final answer. Overall answer quality falls slightly. Right: the table presents the same pattern in numbers for both BM25 and the LLM-based ranker, making clear that BM25 lets some misleading pages into its top results, whereas the LLM ranker largely filters them out.
Ranker oparty na LLM byÅ w stanie rozpoznaÄ i wyfiltrowaÄ strony mylÄ ce, utrzymujÄ c udziaÅ takich treÅci w swoich najlepszych wynikach blisko zera; BM25 pozwoliÅ jednak na wejÅcie do swoich najlepszych wynikÃģw zauwaÅžalnej czÄÅci stron wrogich, z okoÅo 19% do 24% pojawiajÄ cych siÄ tam w pewnych etapach testu.
ChociaÅž ranker LLM okazaÅ siÄ bardziej odporny w tym eksperymencie, autorzy zauwaÅžajÄ , Åže systemy rankingu oparte na LLM sÄ bardziej wymagajÄ ce obliczeniowo, co moÅže sprawiÄ, Åže wdroÅženie na duÅžÄ skalÄ bÄdzie niewykonalne. ChociaÅž BM25 jest prostszy i taÅszy w uruchomieniu, powszechnie uÅžywane systemy pobierania, ktÃģre wykorzystujÄ go, mogÄ , zdaniem autorÃģw, byÄ bardziej naraÅžone na treÅci manipulowane, niÅž siÄ poczÄ tkowo wydaje.
Autorzy okreÅlajÄ to jako âznaczÄ ce strukturalne ryzykoâ.
W odniesieniu do kontrastu miÄdzy pozornÄ stabilnoÅciÄ a degradacjÄ podstawowÄ , autorzy zauwaÅžajÄ , Åže w tym kontekÅcie DokÅadnoÅÄ Odpowiedzi pozostaje wzglÄdnie stabilna, ze wzglÄdu na to, Åže sÄdzia LLM tÅumi korupcjÄ cytatu, i tym samym dziaÅa jako rodzaj ochrony przed treÅciami wrogimi.
Jednak DokÅadnoÅÄ Odpowiedzi w tym aspekcie byÅa stale niÅžsza niÅž w pierwszym scenariuszu:
âPodczas gdy Scenariusz 1 wykazaÅ DokÅadnoÅÄ Odpowiedzi utrzymanÄ lub nawet poprawionÄ (osiÄ gajÄ c nawet 70% z rankerami LLM) dziÄki wysokiej jakoÅci treÅci SEO, Scenariusz 2 wykazuje spadek jakoÅci odpowiedzi w porÃģwnaniu z ustawieniem SEO [âĶ]
âTo potwierdza, Åže niezaleÅžnie od rankera, zanieczyszczenie wrogie na etapie pobierania negatywnie wpÅywa na wydajnoÅÄ koÅcowÄ , z degradacjÄ najbardziej dotkliwÄ , gdy polega siÄ na lekkich retrieverach.â
Autorzy twierdzÄ , Åže ponowne rangowanie na etapie pobierania jest zbyt pÃģÅšne, i Åže naleÅžy rozwaÅžyÄ filtry âna etapie pobieraniaâ. ProponujÄ , Åže âgrafy pochodzeniaâ i âfiltry zaskoczeniaâ mogÄ byÄ wykorzystane.
ZamykajÄ , podkreÅlajÄ c, Åže podstawowym zagroÅženiem jest treÅÄ o wysokiej pÅynnoÅci, ale niskiej gÄstoÅci atrybucji, podstawowo oderwana od ÅaÅcuchÃģw pochodzenia, i obserwujÄ :
â[Gdy] Agentic AI zaczyna samodzielnie publikowaÄ treÅci, mechanizmy obronne muszÄ ewoluowaÄ z analizy statycznej tekstu do Åledzenia behawioralnego, identyfikujÄ c i izolujÄ c agenci, ktÃģre systematycznie wytwarzajÄ strumienie o wysokiej entropii i niskiej faktualnoÅci.â
Wnioski
Ustanowienie nowych lub udoskonalonych metodologii dla pochodzenia informacji moÅže byÄ jednÄ z najbardziej krytycznych koniecznoÅci na 2026 rok. ZÅoÅžone schematy pochodzenia, takie jak C2PA, ktÃģre wymagajÄ zmian infrastrukturalnych od wydawcÃģw i edukacji publicznej na temat ich znaczenia i sposobu uÅžycia, wydajÄ siÄ skazane na niepowodzenie.
CzegoÅ prostszego jest potrzeba, i jeszcze nie zostaÅo znalezione. To pilna misja, poniewaÅž obecna era moÅže byÄ najbardziej krytycznym punktem zwrotnym dla konsensusu publicznego na temat prawdy od wynalezienia fotografii w 1822 roku i wzrostu propagandy w dekadach poprzedzajÄ cych II wojnÄ ÅwiatowÄ .
Â
* Moja (selektywna, gdzie konieczne) konwersja cytowaÅ wewnÄtrznych autorÃģw na hiperÅÄ cza.
Pierwotnie opublikowane w czwartek, 19 lutego 2026












