Unghiul lui Anderson

Poluarea cu conținut generat de IA ÃŪn rezultatele căutării riscă “prăbușirea recuperării”

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-1.5) depicting sewer workers shining their torches on a huge fatberg blocking the sewer, in which is embedded multiple extruded texts saying 'AI'.

Pe măsură ce conținutul generat de IA poluează internetul, se deschide un nou vector de atac pe cÃĒmpul de luptă al consensului cultural.

 

Cercetarea condusă de o companie de căutare coreeană susține că, pe măsură ce paginile generate de IA pătrund ÃŪn rezultatele căutării, subminează stabilitatea căutării și a sistemelor de clasificare și slăbesc sistemele – cum ar fi Generarea Augmentată de Recuperare (RAG) – care se bazează pe aceste clasificări pentru a decide ce informații sunt afișate și considerate de ÃŪncredere, creșterea riscului ca materialele ÃŪnșelătoare sau inexacte să fie tratate ca autoritare.

Termenul inventat de către cercetători pentru acest sindrom este Prăbușirea Recuperării, distinct de amenințarea cunoscută a prăbușirii modelului (ÃŪn care IA antrenată pe propriile ieșiri devine progresiv mai slabă).

Într-un scenariu de Prăbușire a Recuperării, conținutul generat de IA domină progresiv rezultatele căutării, astfel ÃŪncÃĒt chiar și atunci cÃĒnd răspunsurile rămÃĒn superficial exacte, baza de dovezi subiacentă va fi devenit despărțită de sursele umane originale. Cu toate acestea, aceste date “fără rădăcini” par să obțină un loc ÃŪnalt ÃŪn rezultatele căutării*:

‘Cu proliferarea textului generat de IA, provocările ÃŪn atribuire și calitatea datelor de antrenament au intensificat. În contrast cu spamul tradițional de cuvinte cheie spam, conținutul sintetic modern este semantic coerent, permițÃĒndu-i să se integreze ÃŪn sistemele de clasificare și să se propage prin conducte ca dovezi autoritare.’

Articolul afirmă că acest lucru ar crea un mediu “structural fragil” ÃŪn care semnalele de clasificare favorizează paginile produse de IA și optimizate pentru SEO, ÃŪnlocuind sursele umane create pe parcursul timpului ÃŪntr-un mod insidios, adică fără a declanșa scăderi evidente ÃŪn calitatea răspunsurilor*:

‘[Creșterea] conținutului generat de IA pe internet prezintă un risc structural pentru recuperarea informațiilor, deoarece motoarele de căutare și sistemele de Generare Augmentată de Recuperare (RAG) consumă din ce ÃŪn ce mai mult dovezi produse de Modelele Limbajului Mare (LLM).

‘Caracterizăm acest mod de eșec la nivel de ecosistem ca Prăbușire a Recuperării, un proces ÃŪn două etape ÃŪn care (1) conținutul generat de IA domină rezultatele căutării, erodÃĒnd diversitatea surselor, și (2) conținutul de calitate scăzută sau adversar pătrunde ÃŪn conducta de recuperare.’

Cercetătorii susțin că, odată ce faza de “dominanță” este stabilită, aceeași conductă de recuperare devine mai susceptibilă la poluare intenționată, deoarece paginile adversare pot exploata aceleași mecanisme de optimizare pentru a obține vizibilitate*:

‘Prin stabilirea cadrului Prăbușirii Recuperării, această lucrare pune bazele pentru ÃŪnțelegerea modului ÃŪn care conținutul sintetic restructurează recuperarea informațiilor. Pentru a mitigă riscurile, propunem o schimbare către strategii de clasificare defensivă care optimizează ÃŪn mod conjunct relevanța, faptualitatea și proveniența.’

Prăbușirea Recuperării ar exacerba, probabil, prăbușirea modelului, deoarece adaugă un strat de intenție malignă pe “efectul de fotocopie” al entropiei, ÃŪn care IA se hrănește din ce ÃŪn ce mai mult cu ieșirile generate de IA. Pe lÃĒngă afectarea consensului aparent asupra “adevărului” ÃŪn rezultatele căutării ÃŪn timp real, inexactitățile și atacurile ar putea deveni ulterior ÃŪnscrise ÃŪn LLM antrenate ca surse autoritare.

Noua lucrare se intitulează Prăbușirea Recuperării atunci cÃĒnd IA poluează internetul și provine de la trei cercetători de la Naver Corporation.

Metodă

Pentru a testa modul ÃŪn care conținutul generat de IA se propagă prin sistemele de recuperare, cercetătorii au selectat aleator 1000 de perechi de ÃŪntrebări și răspunsuri din setul de date și benchmark MS MARCO, care constă ÃŪn ÃŪntrebări cu domeniu deschis pereche cu răspunsuri de referință validate de către oameni. Acestea au fost utilizate atÃĒt pentru a ancora recuperarea, cÃĒt și pentru a evalua corectitudinea factuală a răspunsurilor generate.

Pentru fiecare ÃŪntrebare MS MARCO din test, au fost extrase zece documente web din Google Search, pe baza celor mai bune rezultate SEO pentru fiecare termen, producÃĒnd ÃŪn final un set de 10.000 de documente.

Validitatea factuală a documentelor a fost evaluată prin compararea fiecăruia dintre ele cu adevărul de referință MS MARCO, utilizÃĒnd GPT-5 Mini ca judecător.

Simularea Fermei de Conținut

Pentru a simula nivelul de calitate (al articolelor normale, non-adversar) asociate cu fermele de conținut, autorii au utilizat modelul OpenAI GPT-5 Nano pentru a genera efectiv noi articole sintetice, deoarece acesta este nivelul “accesibil” de IA care va fi probabil utilizat de către fermele de conținut. GPT-5 Mini, utilizat pentru a evalua ieșirile, este un model puțin mai capabil.

În schimb, pentru a simula postări adversare (adică conținut proiectat pentru a răspÃĒndi informații false sau care altfel prezintă informații false), nu au fost utilizate referințe din lumea reală. În schimb, au fost create primele versiuni ale mostrelor cu un generator convențional de clickbait/SEO și apoi au fost transmise către GPT-5 Nano, care a fost ÃŪnsărcinat să ÃŪnlocuiască un anumit număr de fapte cu alternative plauzibile, dar false. GPT-5 Nano a efectuat, de asemenea, re-clasificarea semantică ÃŪn scopul contextului experimental.

Pentru a simula saturația IA pe parcursul timpului, a fost efectuat un proces de contaminare ÃŪn 20 de etape, ÃŪn care un document sintetic a fost adăugat pe ÃŪntrebare la un set fix de zece documente originale, crescÃĒnd cota de IA de la 0% la 66,7%.

Pentru setul de tip SEO, generatorul a fost ÃŪndrumat să “acționeze ca un specialist SEO” și să integreze cuvinte cheie cu frecvență ridicată din documentele originale pentru a crește probabilitatea de recuperare.

Pentru setul adversar, promptul a fost proiectat pentru a păstra proza fluentă și naturală, ÃŪn timp ce a modificat subtil entități numite și detalii numerice, creÃĒnd documente care nu ar fi semnalate de filtrele statistice, ÃŪn timp ce erodau ÃŪn mod discret acuratețea factuală.

Metrici

Au fost adoptate trei metrice pentru experimente: Rata de contaminare a piscinei (PCR), pentru a determina cÃĒt de mult din piscina generală de documente a fost generat de IA; Rata de contaminare a expunerii (ECR), pentru a măsura cÃĒt de mult din primele zece rezultate de căutare proveneau din surse de IA (indicÃĒnd ce a intrat ÃŪntr-adevăr ÃŪn conducta de recuperare); și Rata de contaminare a citării (CCR), pentru a ÃŪnregistra cÃĒt de mult din dovezile citate ÃŪn răspunsul final erau sintetice.

Pentru a examina impactul practic, atÃĒt calitatea surselor recuperate, cÃĒt și integritatea răspunsului final au fost testate. Precizia@10 (P@10) a capturat cÃĒte dintre primele zece rezultate au fost de fapt corecte atunci cÃĒnd au fost verificate ÃŪmpotriva adevărului de referință MS MARCO; și Acuratețea Răspunsului (AA) a măsurat dacă răspunsul generat a corespuns aceluiași răspuns de referință, cu GPT-5 Mini utilizat pentru a determina dacă sensul a fost consecvent.

Teste

Inițial, autorii au testat metoda lor ÃŪmpotriva piscinei originale de documente extrase din SERPS, adică ÃŪnainte de a fi utilizate ca material pentru a genera date sintetice, și au remarcat că sistemul lor de clasificare LLM a obținut “o calitate de recuperare puternică”, depășind BM25 Ranker de bază.

Primul din cele două scenarii principale, numit Dominanță și omogenizare, a fost o examinare a modului ÃŪn care documentele sintetice modelate de SEO afectează rezultatele recuperării:

StÃĒnga, curbele de contaminare pentru Scenariul 1 sub BM25 și LLM ranker arată că Rata de contaminare a piscinei (PCR) crește rotundă cu rotundă, cu Rata de contaminare a expunerii (ECR) și Rata de contaminare a citării (CCR) crescÃĒnd mai abrupt pe măsură ce documentele sintetice se ÃŪnghesuie ÃŪn primele rezultate, ÃŪn timp ce Acuratețea Răspunsului (AA) rămÃĒne ÃŪn general stabilă. Dreapta, tabelul corespunzător raportează aceeași progresie numerică pe parcursul rotundelor 0, 5, 10 și 20, detaliind PCR, ECR, CCR și AA pentru ambele ranker.

StÃĒnga: curbele de contaminare pentru Scenariul 1 sub BM25 și LLM ranker arată că Rata de contaminare a piscinei (PCR) crește odată cu fiecare rotundă, cu Rata de contaminare a expunerii (ECR) și Rata de contaminare a citării (CCR) crescÃĒnd mai abrupt pe măsură ce documentele sintetice se ÃŪnghesuie ÃŪn primele rezultate; Acuratețea Răspunsului (AA) rămÃĒne ÃŪn general stabilă. Dreapta: tabelul corespunzător raportează aceeași progresie numerică pe parcursul rotundelor 0, 5, 10 și 20, detaliind PCR, ECR, CCR și AA pentru ambele ranker.

Pe măsură ce au fost adăugate pagini scrise de IA ÃŪn mediu de test, acestea au ÃŪnceput să domine primele rezultate de căutare mai repede decÃĒt se așteptau. CÃĒnd conținutul de IA a reprezentat 50% din toate documentele disponibile, peste 68% din primele zece rezultate ale BM25 erau deja generate de IA; și atunci cÃĒnd cota de material de IA a crescut la 67%, peste 80% din primele rezultate ale BM25 proveneau din surse de IA.

Sistemul de clasificare LLM a arătat o tendință și mai puternică ÃŪn această direcție, cu aproximativ 76% din primele rezultate provenind din pagini scrise de IA, atunci cÃĒnd acestea reprezentau doar jumătate din piscina generală – și a continuat să se bazeze mai mult pe acestea decÃĒt BM25, pe măsură ce prezența lor a crescut. Autorii comentează:

‘Acest model arată că conținutul optimizat de SEO activează ÃŪn mod disproporționat semnalele de clasificare, determinÃĒnd ambele modele să convergeze rapid către dovezi dominate de sintetice.’

În ceea ce privește tensiunea dintre stabilitatea factuală și prăbușirea diversității, articolul notează că, ÃŪn ciuda “schimbărilor dramatice” arătate ÃŪn dovezile recuperate, Acuratețea Răspunsului a rămas stabilă, sau chiar a fost ÃŪmbunătățită:

‘Deoarece documentele SEO sunt de ÃŪnaltă calitate și aliniate tematic, recuperarea pare sănătoasă atunci cÃĒnd este măsurată doar prin acuratețe. Cu toate acestea, aproape toate dovezile recuperate sunt sintetice, indicÃĒnd o prăbușire severă a diversității surselor.

‘Acestă divergență, caracterizată prin acuratețe stabilă, ÃŪn ciuda prăbușirii diversității, dezvăluie o conductă de recuperare structurală fragilă: sistemul se desfășoară bine ÃŪn metrici agregate, ÃŪn timp ce ÃŪși pierde ÃŪn mod discret legătura cu conținutul scris de oameni.’

‘În general, conținutul sintetic de ÃŪnaltă calitate nu numai că se integrează perfect ÃŪn conductele de recuperare, dar activează și semnalele de clasificare, determinÃĒnd ambele BM25 și LLM Ranker să se bazeze aproape exclusiv pe dovezi generate de IA.’

Al doilea scenariu a fost numit Poluare și corupție a sistemului și a dezvăluit o divergență notabilă ÃŪn comportamentul clasificatorului, comparativ cu primul scenariu:

<img class=" wp-image-271855" src="https://www.unite.ai/wp-content/uploads/2026/02/fig1b-and-tab1b.jpg" alt="StÃĒnga, rezultatele scenariului 2 arată ce se ÃŪntÃĒmplă atunci cÃĒnd pagini intenționat ÃŪnșelătoare sunt adăugate ÃŪn sistem. Pe măsură ce se adaugă mai multe astfel de pagini, BM25 ÃŪncepe să le plaseze ÃŪn primele rezultate – deși doar pÃĒnă la aproximativ un sfert la punctul de mijloc, și aproape niciunul nu este de fapt utilizat ÃŪn răspunsul final. Calitatea generală a răspunsului scade ușor. Dreapta, tabelul prezintă aceeași tendință numerică pentru ambele BM25 și clasificatorul LLM, făcÃĒnd clar că BM25 permite un anumit conținut ÃŪnșelător ÃŪn primele rezultate, ÃŪn timp ce clasificatorul LLM filtrează ÃŪn mare măsură astfel de conținut.

Clasificatorul LLM a fost ÃŪn mare măsură capabil să recunoască și să filtreze paginile ÃŪnșelătoare, menținÃĒnd cota acestui conținut ÃŪn primele rezultate aproape de zero; dar BM25 a permis o parte semnificativă a paginilor adversare să intre ÃŪn primele zece rezultate, cu aproximativ 19% pÃĒnă la 24% apărÃĒnd acolo ÃŪn anumite etape ale testului.

Deși clasificatorul LLM a dovedit o rezistență mai mare ÃŪn acest experiment, autorii notează că sistemele de clasificare LLM sunt mai solicitante din punct de vedere computațional, ceea ce poate face dificilă implementarea la scară largă. Deși BM25 este mai simplu și mai ieftin de rulat, sistemele de recuperare larg utilizate care se bazează pe acesta pot, conform articolului, să fie mai expuse la conținut manipulat decÃĒt pare la prima vedere.

Autorii caracterizează acest lucru ca un “risc structural semnificativ”.

În ceea ce privește contrastul dintre stabilitatea aparentă și degradarea subiacentă, autorii notează că, ÃŪn acest context, Acuratețea Răspunsului rămÃĒne relativ stabilă, datorită judecătorului LLM care suprimă corupția citării, și, prin urmare, acționează ca o barieră de ultim moment ÃŪmpotriva conținutului advers.

Cu toate acestea, Acuratețea Răspunsului ÃŪn acest aspect a fost consistent mai scăzută decÃĒt ÃŪn primul scenariu:

‘În timp ce Scenariul 1 a văzut Acuratețea Răspunsului menținută sau chiar ÃŪmbunătățită (ajungÃĒnd pÃĒnă la 70% cu clasificatorii LLM) datorită calității ridicate a conținutului SEO, Scenariul 2 prezintă o scădere a calității răspunsului ÃŪn raport cu setarea SEO [â€Ķ]

‘Acest lucru confirmă că, indiferent de clasificator, poluarea adversă ÃŪn etapa de recuperare afectează negativ performanța de la capăt la capăt, cu degradarea cea mai severă atunci cÃĒnd se bazează pe retrieveri ușori.’

Autorii concluzionează că re-clasificarea la etapa de recuperare este o abordare prea tardivă și că ar trebui luate ÃŪn considerare filtrele de “ingestie”. Ei propun că “grafurile de proveniență” și “filtrele de perplexitate” ar putea fi utilizate.

Ei ÃŪncheie subliniind că amenințarea principală este conținutul cu fluență ridicată, dar cu densitate de atribuire scăzută, ÃŪn esență despărțit de lanțuri de ÃŪncredere, și observă:

‘[Pe măsură ce] IA agentică ÃŪncepe să publice conținut ÃŪn mod autonom, mecanismele de apărare trebuie să evolueze de la analiza statică a textului la amprentarea comportamentală, identificÃĒnd și izolÃĒnd agenții care produc ÃŪn mod sistematic fluxuri de ÃŪnaltă entropie și joasă faptualitate.’

Concluzie

Stabilirea de noi sau ÃŪmbunătățite metode pentru proveniența informațiilor poate fi una dintre cele mai critice necesități pentru 2026. Schemele complexe de credenționalizare, cum ar fi C2PA aflată ÃŪn suferință, care necesită modificări infrastructurale de la editori și educație publică cu privire la ceea ce ÃŪnseamnă și cum sau de ce să le folosească, par condamnate să eșueze.

Ceva mai simplu este necesar, și ÃŪncă nu a fost găsit. Este o misiune urgentă, deoarece această eră actuală poate fi cel mai critic punct de cotitură pentru consensul public cu privire la adevăr de la inventarea fotografiei ÃŪn 1822 și creșterea propagandei ÃŪn deceniile care au precedat al Doilea Război Mondial.

 

* Conversia mea (selectivă, acolo unde este necesar) a citărilor inline ale autorilor ÃŪn legături.

Publicat pentru prima dată joi, 19 februarie 2026

Scriitor pe machine learning, specialist ÃŪn domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, pÃĒnă la dizolvarea sa ÃŪn Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]