Kąt Andersona

Zanieczyszczenie wyszukiwania przez treści AI naraÅža na ‘kollaps pobierania’

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image (GPT-1.5) depicting sewer workers shining their torches on a huge fatberg blocking the sewer, in which is embedded multiple extruded texts saying 'AI'.

Podczas gdy treści AI zanieczyszczają sieć, otwiera się nowy wektor ataku na polu walki o konsensus kulturowy.

 

Badania prowadzone przez koreańską firmę wyszukiwarkową dowodzą, Åže w miarę jak strony wygenerowane przez AI wkraczają do wynikÃģw wyszukiwania, podwaÅžają stabilność potokÃģw wyszukiwania i rankingu, oraz osłabiają systemy – takie jak Retrieval-Augmented Generation (RAG) – ktÃģre polegają na tych rankingach, aby zdecydować, jakie informacje są wyświetlane i uznawane za zaufane, zwiększając tym samym ryzyko, Åže mylące lub niedokładne materiały będą traktowane jako autorytatywne.

Określenie wymyślone przez badaczy na tę chorobę to Kollaps Pobierania, jako odrębne od znanego zagroÅženia kollapsu modelu (gdzie AI szkolona na własnej produkcji staje się stopniowo gorsza).

W scenariuszu Kollapsu Pobierania, treści wygenerowane przez AI stopniowo dominują wyniki wyszukiwania, do tego stopnia, Åže nawet gdy odpowiedzi pozostają powierzchownie dokładne, podstawowa baza dowodowa stanie się oderwana od oryginalnych ÅšrÃģdeł ludzkich. Niemniej jednak, ten “bezkorzeniowy” danych wydaje się gotowy osiągnąć wysoką pozycję w wynikach wyszukiwania*:

‘Z rozprzestrzenianiem się treści wygenerowanych przez AI, wyzwania w atrybucji i jakości danych przedtreningowych zostały nasilone. W przeciwieństwie do tradycyjnego spamu słÃģw kluczowych, nowoczesne treści syntetyczne są spÃģjne semantycznie, co pozwala im zintegrować się z systemami rankingu i rozprzestrzenić się przez potoki jako dowody autorytatywne.’

Artykuł twierdzi, Åže spowoduje to stworzenie “strukturalnie kruchego” środowiska, w ktÃģrym sygnały rankingu faworyzują strony wytworzone przez AI, optymalizowane pod kątem SEO, ktÃģre wypierają ÅšrÃģdła ludzkie w sposÃģb podstępny, tj. bez wywoływania oczywistych spadkÃģw jakości odpowiedzi:

‘[Wzrost] treści wygenerowanych przez AI w sieci stanowi strukturalne ryzyko dla odzyskiwania informacji, poniewaÅž wyszukiwarki i systemy RAG coraz częściej konsumują dowody wytworzone przez duÅže modele językowe (LLM).’

‘Charakteryzujemy ten tryb awarii na poziomie ekosystemu jako Kollaps Pobierania, dwuetapowy proces, w ktÃģrym (1) treści wygenerowane przez AI dominują wyniki wyszukiwania, podwaÅžając rÃģÅžnorodność ÅšrÃģdeł, oraz (2) treści niskiej jakości lub wrogie infiltrują potok pobierania.’

Badacze twierdzą, Åže gdy tylko zostanie ustanowiona faza “dominacji”, ten sam potok pobierania staje się bardziej podatny na celowe zanieczyszczenie, poniewaÅž strony wrogie mogą wykorzystywać te same mechanizmy optymalizacji, aby zwiększyć swoją widoczność*:

‘Ustanawiając ramy Kollapsu Pobierania, praca ta stanowi podstawę dla zrozumienia, w jaki sposÃģb treści syntetyczne zmieniają odzyskiwanie informacji. Aby złagodzić te ryzyka, proponujemy przesunięcie w kierunku strategii rankingu obronnego, ktÃģre łączą optymalizację pod kątem istotności, faktualności i pochodzenia.’

Kollaps Pobierania najprawdopodobniej nasiliłby kollaps modelu, poniewaÅž dodaje warstwę złośliwej intencji do “efektu kopiowania”, gdzie AI coraz częściej Åžywi się wyjściem wygenerowanym przez AI. Poza wpływem na pozorny konsensus na temat “prawdy” w wynikach wyszukiwania w czasie rzeczywistym, nieścisłości i ataki mogą pÃģÅšniej zostać uwzględnione w wyuczonych LLM jako autorytatywne ÅšrÃģdła.

Nowa praca ma tytuł Kollaps Pobierania, gdy AI zanieczyszcza sieć i pochodzi od trzech badaczy z Naver Corporation.

Metoda

Aby przetestować, jak treści wygenerowane przez AI rozprzestrzeniają się przez systemy pobierania, badacze losowo wybrali 1000 par pytań i odpowiedzi z MS MARCO i zestawu danych, ktÃģry składa się z pytań otwartych parzystych z ludzkimi odpowiedziami walidowanymi. Zostały one wykorzystane zarÃģwno do ugruntowania pobierania, jak i do oceny poprawności faktualnej wygenerowanych odpowiedzi.

Dla kaÅždego pytania MS MARCO w testach pobrano dziesięć dokumentÃģw z Google Search, na podstawie najlepszych wynikÃģw SEO dla kaÅždego terminu, co ostatecznie dało pulę 10 000 dokumentÃģw.

Poprawność faktualna dokumentÃģw została oceniona przez porÃģwnanie kaÅždego z nich z MS MARCO, przy uÅžyciu GPT-5 Mini jako sędziego.

<strong Symulacja Fermy Treści

Aby symulować poziom jakości (normalnych, nie-wrogich) artykułÃģw związanych z fermami treści, autorzy uÅžyli ekonomicznego GPT-5 Nano modelu OpenAI, aby wygenerować nowe syntetyczne artykuły, poniewaÅž jest to “dostępny” poziom AI, ktÃģry najprawdopodobniej zostanie uÅžyty przez młyny treści. GPT-5 Mini, uÅžyty do oceny wyjścia, jest nieco bardziej zdolnym modelem.

Odwrotnie, aby symulować wrogie posty (tj. treści zaprojektowane do rozpowszechniania dezinformacji lub zawierające dezinformację), nie uÅžyto Åžadnych odniesień do świata rzeczywistego. Zamiast tego, pierwsze szkice prÃģbek zostały utworzone za pomocą konwencjonalnego generatora clickbait/SEO, a następnie przekazane do GPT-5 Nano, ktÃģry miał za zadanie zastąpić pewną liczbę faktÃģw prawdopodobnymi, ale nieprawdziwymi alternatywami. GPT-5 Nano rÃģwnieÅž wykonał ponowne rangowanie semantyczne do celÃģw kontekstu eksperymentalnego.

Aby symulować nasycenie AI w czasie, uruchomiono 20-okrągły proces zanieczyszczenia, w ktÃģrym jeden syntetyczny dokument został dodany do ustalonego zestawu dziesięciu oryginalnych dokumentÃģw, zwiększając udział AI z 0% do 66,7%.

Dla puli stylu SEO, generator został poproszony o “działanie jako specjalista SEO” i o zintegrowanie wyrazÃģw o wysokiej IDF z oryginalnych dokumentÃģw, aby zwiększyć prawdopodobieństwo pobierania.

Dla puli wrogiej, prompt został zaprojektowany tak, aby zachować płynną, naturalnie brzmiącą prozę, podczas gdy subtelnym zmianom poddano nazwy encji i szczegÃģły liczbowe, tworząc dokumenty, ktÃģre nie wywołałyby filtrÃģw statystycznych, a jednocześnie cicho podwaÅžałyby dokładność faktualną.

Metryki

Przyjęto trzy metryki do eksperymentÃģw: WspÃģłczynnik Zanieczyszczenia Puli (PCR), aby określić, jaki procent puli dokumentÃģw był wygenerowany przez AI; WspÃģłczynnik Zanieczyszczenia Ekspozycji (ECR), aby zmierzyć, jaki procent najlepszych wynikÃģw wyszukiwania pochodził z ÅšrÃģdeł AI (wskazując, co tak naprawdę weszło do potoku pobierania); oraz WspÃģłczynnik Zanieczyszczenia CytatÃģw (CCR), aby odnotować, jaki procent cytowanych dowodÃģw był syntetyczny.

Aby zbadać praktyczny wpływ, zarÃģwno jakość odzyskanych ÅšrÃģdeł, jak i integralność ostatecznej odpowiedzi zostały przetestowane. Precyzja@10 (P@10) ujęła, ile z najlepszych wynikÃģw było rzeczywiście poprawnych, gdy sprawdzono je względem MS MARCO; oraz Dokładność Odpowiedzi (AA) mierzyła, czy wygenerowana odpowiedÅš odpowiadała tej samej odpowiedzi odniesienia, z uÅžyciem GPT-5 Mini, aby określić, czy znaczenie było spÃģjne.

Testy

Początkowo autorzy przetestowali swoją metodę przeciwko oryginalnej puli dokumentÃģw wyodrębnionych z SERPS, tj. przed ich uÅžyciem jako materiału do generowania danych syntetycznych, i zauwaÅžyli, Åže ich LLM ranker osiągnął “silną jakość pobierania”, przewyÅžszając BM25 Ranker bazowy.

Pierwszy z dwÃģch głÃģwnych testÃģw scenariuszowych, nazwany Dominacja i Ujednolicenie, był badaniem wpływu dokumentÃģw syntetycznych ukształtowanych przez SEO na wyniki wyszukiwania:

Left, contamination curves for Scenario 1 under BM25 and LLM rankers show Pool Contamination Rate (PCR) rising round by round, with Exposure Contamination Rate (ECR) and Citation Contamination Rate (CCR) increasing more steeply as synthetic documents crowd into the top results, while Answer Accuracy (AA) remains broadly stable. Right, the corresponding table reports the same progression numerically across rounds 0, 5, 10, and 20, detailing PCR, ECR, CCR, and AA for both rankers.

Left: contamination curves for Scenario 1 under BM25 and LLM rankers show Pool Contamination Rate (PCR) rising with each round, with Exposure Contamination Rate (ECR) and Citation Contamination Rate (CCR) increasing more steeply as synthetic documents crowd into the top results; Answer Accuracy (AA) remains broadly stable. Right: the corresponding table reports the same progression numerically across rounds 0, 5, 10, and 20, detailing PCR, ECR, CCR, and AA for both rankers.

Im więcej stron AI zostało stopniowo dodanych do środowiska testowego, zaczęły one dominować w najlepszych wynikach wyszukiwania szybciej, niÅž się spodziewano. Gdy treści AI stanowiły 50% wszystkich dostępnych dokumentÃģw, ponad 68% najlepszych wynikÃģw BM25 było juÅž wygenerowanych przez AI; oraz gdy udział materiału AI wzrÃģsł do 67%, ponad 80% jego najlepszych wynikÃģw pochodziło z ÅšrÃģdeł AI.

Ranker oparty na LLM wykazał nawet silniejszą tendencję w tym kierunku, z około 76% swoich najlepszych wynikÃģw pochodzących ze stron wygenerowanych przez AI, gdy te strony stanowiły tylko połowę puli ogÃģlnej – i nadal polegał na nich bardziej niÅž BM25, w miarę wzrostu ich obecności. Autorzy komentują:

‘Ten wzorzec pokazuje, Åže treści zoptymalizowane pod kątem SEO aktywują nierÃģwnomiernie sygnały rankingu, powodując, Åže oba modele szybko konwergują w kierunku syntetycznych dowodÃģw.’

W odniesieniu do napięcia między pozorną stabilnością a degradacją rÃģÅžnorodności, artykuł zauwaÅža, Åže pomimo “dramatycznych” zmian w odzyskanych dowodach, Dokładność Odpowiedzi pozostaje stabilna lub nawet się poprawia:

‘PoniewaÅž dokumenty SEO są wysokiej jakości i dobrze dopasowane tematycznie, pobieranie wydaje się zdrowe, gdy mierzy się je tylko pod kątem dokładności. Niemniej jednak, prawie wszystkie odzyskane dowody są syntetyczne, co wskazuje na powaÅžny kollaps w rÃģÅžnorodności ÅšrÃģdeł.

‘To rozbieÅžność, charakteryzowana przez stabilną dokładność, mimo załamania się rÃģÅžnorodności, ujawnia strukturalnie kruchy potok pobierania: system wykonuje się dobrze w agregowanych miarach, podczas gdy cicho traci swoje uzasadnienie w treściach ludzkich.’

‘OgÃģlnie, wysokiej jakości treści syntetyczne nie tylko zintegrują się bezproblemowo z potokami pobierania, ale rÃģwnieÅž aktywnie przytłoczą sygnały rankingu, powodując, Åže zarÃģwno BM25, jak i LLM Ranker będą polegać niemal wyłącznie na dowodach wygenerowanych przez AI.’

Drugi scenariusz nazwano Zanieczyszczenie i Korekcja Systemu, i ujawnił zauwaÅžalną rozbieÅžność w zachowaniu rankera w porÃģwnaniu z pierwszym scenariuszem:

Left, the scenario 2 results show what happens when deliberately misleading pages are added to the system. As more of these pages are mixed in, BM25 begins to place some of them in its top results – though only up to about a quarter at the midpoint, and almost none are actually used in the final answer. Overall answer quality falls slightly. Right, the table presents the same pattern in numbers for both BM25 and the LLM-based ranker, making clear that BM25 lets some misleading pages into its top results, whereas the LLM ranker largely filters them out.

Left: the scenario 2 results show what happens when deliberately misleading pages are added to the system. As more of these pages are mixed in, BM25 begins to place some of them in its top results – though only up to about a quarter at the midpoint, and almost none are actually used in the final answer. Overall answer quality falls slightly. Right: the table presents the same pattern in numbers for both BM25 and the LLM-based ranker, making clear that BM25 lets some misleading pages into its top results, whereas the LLM ranker largely filters them out.

Ranker oparty na LLM był w stanie rozpoznać i wyfiltrować strony mylące, utrzymując udział takich treści w swoich najlepszych wynikach blisko zera; BM25 pozwolił jednak na wejście do swoich najlepszych wynikÃģw zauwaÅžalnej części stron wrogich, z około 19% do 24% pojawiających się tam w pewnych etapach testu.

ChociaÅž ranker LLM okazał się bardziej odporny w tym eksperymencie, autorzy zauwaÅžają, Åže systemy rankingu oparte na LLM są bardziej wymagające obliczeniowo, co moÅže sprawić, Åže wdroÅženie na duŞą skalę będzie niewykonalne. ChociaÅž BM25 jest prostszy i tańszy w uruchomieniu, powszechnie uÅžywane systemy pobierania, ktÃģre wykorzystują go, mogą, zdaniem autorÃģw, być bardziej naraÅžone na treści manipulowane, niÅž się początkowo wydaje.

Autorzy określają to jako “znaczące strukturalne ryzyko”.

W odniesieniu do kontrastu między pozorną stabilnością a degradacją podstawową, autorzy zauwaÅžają, Åže w tym kontekście Dokładność Odpowiedzi pozostaje względnie stabilna, ze względu na to, Åže sędzia LLM tłumi korupcję cytatu, i tym samym działa jako rodzaj ochrony przed treściami wrogimi.

Jednak Dokładność Odpowiedzi w tym aspekcie była stale niÅžsza niÅž w pierwszym scenariuszu:

‘Podczas gdy Scenariusz 1 wykazał Dokładność Odpowiedzi utrzymaną lub nawet poprawioną (osiągając nawet 70% z rankerami LLM) dzięki wysokiej jakości treści SEO, Scenariusz 2 wykazuje spadek jakości odpowiedzi w porÃģwnaniu z ustawieniem SEO [â€Ķ]

‘To potwierdza, Åže niezaleÅžnie od rankera, zanieczyszczenie wrogie na etapie pobierania negatywnie wpływa na wydajność końcową, z degradacją najbardziej dotkliwą, gdy polega się na lekkich retrieverach.’

Autorzy twierdzą, Åže ponowne rangowanie na etapie pobierania jest zbyt pÃģÅšne, i Åže naleÅžy rozwaÅžyć filtry “na etapie pobierania”. Proponują, Åže “grafy pochodzenia” i “filtry zaskoczenia” mogą być wykorzystane.

Zamykają, podkreślając, Åže podstawowym zagroÅženiem jest treść o wysokiej płynności, ale niskiej gęstości atrybucji, podstawowo oderwana od łańcuchÃģw pochodzenia, i obserwują:

‘[Gdy] Agentic AI zaczyna samodzielnie publikować treści, mechanizmy obronne muszą ewoluować z analizy statycznej tekstu do śledzenia behawioralnego, identyfikując i izolując agenci, ktÃģre systematycznie wytwarzają strumienie o wysokiej entropii i niskiej faktualności.’

Wnioski

Ustanowienie nowych lub udoskonalonych metodologii dla pochodzenia informacji moÅže być jedną z najbardziej krytycznych konieczności na 2026 rok. ZłoÅžone schematy pochodzenia, takie jak C2PA, ktÃģre wymagają zmian infrastrukturalnych od wydawcÃģw i edukacji publicznej na temat ich znaczenia i sposobu uÅžycia, wydają się skazane na niepowodzenie.

Czegoś prostszego jest potrzeba, i jeszcze nie zostało znalezione. To pilna misja, poniewaÅž obecna era moÅže być najbardziej krytycznym punktem zwrotnym dla konsensusu publicznego na temat prawdy od wynalezienia fotografii w 1822 roku i wzrostu propagandy w dekadach poprzedzających II wojnę światową.

 

* Moja (selektywna, gdzie konieczne) konwersja cytowań wewnętrznych autorÃģw na hiperłącza.

Pierwotnie opublikowane w czwartek, 19 lutego 2026

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]