Andersons vinkel

AI-forurening i søgeresultater risikerer ‘hentningssammenbrud’

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-1.5) depicting sewer workers shining their torches on a huge fatberg blocking the sewer, in which is embedded multiple extruded texts saying 'AI'.

Da AI-indhold forurener nettet, åbner en ny angrebsvektor sig i slagmarken for kulturel konsensus.

 

Forskning ledet af et koreansk søgefirma argumenterer for, at da AI-genererede sider trænger ind i søgeresultater, undergraver de stabiliteten af søgning og rangordningssystemer og svækker systemer – såsom Retrieval-Augmented Generation (RAG) – der afhænger af disse rangordninger for at afgøre, hvilken information der skal vises og anses for troværdig, og øger dermed risikoen for, at misvisende eller ukorrekte oplysninger behandles som autoritative.

Begrebet, der er opfundet af forskerne til denne syndrom, er Hentningssammenbrud, som adskiller sig fra den kendte trussel af model-sammenbrud (hvor AI trænet på sin egen output bliver progressivt dårligere).

I et Hentningssammenbrud-scenarie dominerer AI-genereret indhold søgeresultaterne mere og mere, sådan at selv når svarene forbliver overfladisk set korrekte, vil den underliggende bevisgrund have blevet skilt fra originale menneskelige kilder. Alligevel synes denne ‘rod-løse’ data at være på vej til at opnå en høj placering i søgeresultaterne*:

‘Med spredningen af AI-genereret tekst, udfordringerne i tilskrivning og præ-træning datakvalitet har intensiveret. I modsætning til traditionel keyword spam, er moderne syntetisk indhold semantisk kohærent, hvilket tillader det at blande sig ind i rangordningssystemer og propagere gennem pipelines som autoritativ bevis.’

Artiklen fastslår, at dette ville skabe en ‘strukturmæssigt skrøbelig’ omgang, hvor rangordningssignaler favoriserer AI-producerede, SEO-optimerede sider, og fortrænger menneskeskrevne kilder over tid på en snigende måde, dvs. uden at udløse åbenlyse fald i svarkvalitet:

‘Den [vækst] af AI-genereret indhold på nettet udgør en strukturrisiko for informationshenting, da søgemaskiner og Retrieval-Augmented Generation (RAG)-systemer i stigende grad forbruger beviser produceret af de store sprogmodeller (LLM’er).

‘Vi karakteriserer denne økosystem-niveau-fejl som Hentningssammenbrud, en to-trinsproces hvor (1) AI-genereret indhold dominerer søgeresultater, undergraver kildediversitet, og (2) lavkvalitets- eller fjendtlig indhold infiltrerer hentningspipelinen.’

Forskerne påstår, at når ‘dominans’-fasen er etableret, bliver den samme hentningspipeline mere modtagelig for bevidst forurening, da fjendtlige sider kan udnytte de samme optimeringsmekanismer til at opnå synlighed*:

‘Ved at etablere rammen for Hentningssammenbrud, lægger dette arbejde grundlaget for at forstå, hvordan syntetisk indhold omformer informationshenting. For at mindske disse risici, foreslår vi en skiftning mod Defensive Ranking-strategier der samtidigt optimerer relevans, faktualitet og proveniens.’

Hentningssammenbrud ville sandsynligvis forværre model-sammenbrud, da det tilføjer et lag af ondsindet hensigt til ‘fotokopieffekten’ af entropi, hvor AI i stigende grad føder på AI-genereret output. Ud over at påvirke den åbenlyse konsensus om ‘sandhed’ i realtids-søgeresultater, kunne ukorrekte oplysninger og angreb senere blive indskrevet i trænede LLM’er som autoritative kilder.

Det nye arbejde er titlen Hentningssammenbrud, når AI forurener nettet, og kommer fra tre forskere ved Naver Corporation.

Metode

For at teste, hvordan AI-genereret indhold spreder sig gennem hentningssystemer, valgte forskerne tilfældigt 1000 spørgsmål/svar-par fra MS MARCO-datasettet og benchmark, der består af åbendoms-spørgsmål parret med menneskevaliderede reference-svar. Disse blev brugt både til at grundlægge hentning og til at evaluere den faktiske korrekthed af de genererede svar.

For hvert MS MARCO-spørgsmål i testen, blev ti webdokumenter hentet fra Google Søg, baseret på de top-rangerende SEO-resultater for hvert term, og producerede således en pulje på 10.000 dokumenter.

Dokumenternes faktiske gyldighed blev vurderet ved at sammenligne hvert af dem med MS MARCO-sandheden, ved hjælp af GPT-5 Mini som dommer.

Indholdsfarm-simulation

For at simulere kvalitetsniveauet (af normale, ikke-fjendtlige) artikler forbundet med indholdsfarme, brugte forfatterne den økonomiske GPT-5 Nano OpenAI-model til at generere nye syntetiske artikler, da dette er det ‘billige’ niveau af AI, der sandsynligvis vil blive brugt af indholdsmøller. GPT-5 Mini, der bruges til at vurdere output, er en lidt mere kapabel model.

Om vendt, for at simulere fjendtlige indlæg (dvs. indhold designede til at sprede misinformation eller som ellers har misinformation), blev der ikke brugt nogen virkelige referencer. I stedet blev første udkast af eksemplerne skabt med en konventionel clickbait/SEO-generator, og derefter overført til GPT-5 Nano, som blev bedt om at erstatte et vis antal fakta med plausibelt, men usande, alternativer. GPT-5 Nano udførte også semantisk genrangordning for eksperimentets formål.

For at simulere AI-mættethed over tid, blev en 20-rundes forureningsproces kørt, hvor ét syntetisk dokument blev tilføjet pr. spørgsmål til en fast sæt af ti originale dokumenter, og øgede AI-andelen fra 0% til 66,7%.

For SEO-stil-puljen blev generatoren bedt om at ‘opføre sig som en SEO-ekspert’, og integrere høj-IDF nøgleord fra de originale dokumenter for at øge hentnings sandsynlighed.

For den fjendtlige pulje var prompten designet til at bevare flydende, naturlig lydende prosa, mens man samtidig ændrede navngivne enheder og numeriske detaljer, og skabte dokumenter, der ikke ville flagre statistiske filtre, mens man stille og roligt undergravede faktuel nøjagtighed.

Målinger

Tre målinger blev valgt til eksperimenterne: Pool Forureningsrate (PCR), for at bestemme, hvor meget af den samlede dokumentpulje der var AI-genereret; Eksponeringsforureningsrate (ECR), for at måle, hvor meget af de top ti søgeresultater kom fra AI-kilder (hvad der indikerer, hvad der faktisk gik ind i hentningspipelinen); og Citation Forureningsrate (CCR), for at optegne, hvor meget af den citerede bevis i den endelige besvarelse var syntetisk.

For at undersøge den praktiske virkning blev både kvaliteten af hentede kilder og integriteten af den endelige besvarelse testet. Præcision@10 (P@10) fanget, hvor mange af de top ti resultater der faktisk var korrekte, når de blev sammenlignet med MS MARCO-sandheden; og Besvarelsesnøjagtighed (AA) målte, om den genererede besvarelse matchede den samme referencebesvarelse, med GPT-5 Mini brugt til at bestemme, om meningen var konsistent.

Test

Først testede forfatterne deres metode mod den originale pulje af dokumenter, der blev trukket ud fra SERPS, dvs. før de blev brugt som materiale til at generere syntetisk data, og de bemærker, at deres LLM-ranker opnåede ‘stærk hentningskvalitet’, og overgik BM25 Ranker-baseline.

Den første af de to primære scenarie-test, kaldet Dominans og Homogenisering, var en undersøgelse af, hvordan SEO-formede syntetiske dokumenter påvirker hentningsresultater:

Venstre, forureningsskurver for Scenarie 1 under BM25 og LLM-rangorer viser Pool Forureningsrate (PCR) stigende rundt for rundt, med Eksponeringsforureningsrate (ECR) og Citation Forureningsrate (CCR) øgende mere stejlt, når syntetiske dokumenter trænger ind i topresultaterne, mens Besvarelsesnøjagtighed (AA) forbliver bredt stabil. Højre, tabellen rapporterer den samme fremgang numerisk over runder 0, 5, 10 og 20, detaljer om PCR, ECR, CCR og AA for begge rangorer.

Venstre: forureningsskurver for Scenarie 1 under BM25 og LLM-rangorer viser Pool Forureningsrate (PCR) stigende med hver runde, med Eksponeringsforureningsrate (ECR) og Citation Forureningsrate (CCR) øgende mere stejlt, når syntetiske dokumenter trænger ind i topresultaterne; Besvarelsesnøjagtighed (AA) forbliver bredt stabil. Højre: tabellen rapporterer den samme fremgang numerisk over runder 0, 5, 10 og 20, detaljer om PCR, ECR, CCR og AA for begge rangorer.

Da flere AI-skrevne sider blev gradvist tilføjet til testmiljøet, begyndte de at dominere top-søgeresultaterne hurtigere end forventet. Når AI-indhold udgjorde 50% af alle tilgængelige dokumenter, var mere end 68% af BM25’s top ti resultater allerede AI-genereret; og når andelen af AI-materiale steg til 67%, kom mere end 80% af dens topresultater fra AI-kilder.

LLM-baseret rangorer viste en endnu stærkere tendens i denne retning, med omkring 76% af dens topresultater trukket fra AI-skrevne sider, når disse sider udgjorde kun halvdelen af den samlede pulje – og det fortsatte med at afhænge mere tungt af dem end BM25, da deres tilstedeværelse øgedes. Forfatterne kommenterer:

‘Dette mønster viser, at SEO-optimeret indhold uforholdsmæssigt aktiverer rangsignaler, og får begge modeller til at konvergere hurtigt mod syntetisk-domineret bevis.’

Med hensyn til spændingen mellem synlig stabilitet og underliggende forfald, bemærker artiklen, at ikke desto mindre, Besvarelsesnøjagtighed forblev stabil eller endda forbedret:

‘Fordi SEO-dokumenter er af høj kvalitet og topisk tilpassede, ser hentning ud til at være sund, når den måles alene efter nøjagtighed. Alligevel er næsten alle hentede beviser syntetiske, hvilket indikerer en alvorlig sammenbrud i kildediversitet.

‘Denne afvigelse, karakteriseret ved stabil nøjagtighed på trods af kollaps i diversitet, afslører en strukturmæssigt skrøbelig hentningspipeline: systemet fungerer godt i samlede målinger, mens det stille og roligt mister sin forankring i menneskeskrevet indhold.

‘Samlet set integrerer højkvalitets-syntetisk indhold ikke kun næsten umærkeligt i hentningspipeliner, men overvælder også aktivt rangsignaler, og får både BM25 og LLM-rangorer til at afhænge næsten udelukkende af AI-genereret bevis.’

Den anden scenarie var kaldt Forurening og Systemkorruption, og afslørede en bemærkelsesværdig afvigelse i rangorernes adfærd, sammenlignet med den første scenarie:

<img class=" wp-image-271855" src="https://www.unite.ai/wp-content/uploads/2026/02/fig1b-and-tab1b.jpg" alt="Venstre, scenarie 2-resultaterne viser, hvad der sker, når bevidst misvisende sider tilføjes til systemet. Da flere af disse sider bliver blandet ind, begynder BM25 at placere nogle af dem i sine topresultater – dog kun op til omkring en kvart ved midtpunktet, og næsten ingen af dem bliver faktisk brugt i den endelige besvarelse. Den samlede besvarelseskvalitet falder lidt. Højre, tabellen præsenterer den samme mønster i tal for både BM25 og LLM-baseret rangor, og gør det klart, at BM25 lader nogle misvisende sider komme ind i sine topresultater, hvorimod LLM-rangoren i stor udstrækning filtrerer dem ud.

LLM-baseret rangor var i stand til at genkende og filtrere misvisende sider, og holdt andelen af sådant indhold i sine topresultater tæt på nul; men BM25 lod en bemærkelsesværdig del af de fjendtlige sider komme ind i sine top ti resultater, med omkring 19% til 24% fremtrædende der på visse stadier af testen.

Selv om LLM-baseret rangor viste sig at være mere modstandsdygtig i dette eksperiment, bemærker forfatterne, at LLM-baserede rangsystemer er mere beregningskrævende, hvilket kan gøre storstilede installationer upraktiske. Selv om BM25 er enklere og billigere at køre, kan bredt anvendte hentningssystemer, der udnytter det, være mere udsatte for manipuleret indhold, end de først synes.

Forfatterne karakteriserer dette som en ‘betydelig strukturrisiko’.

Med hensyn til kontrasten mellem synlig stabilitet og underliggende forfald, bemærker forfatterne, at i denne kontekst forbliver Besvarelsesnøjagtighed relativt stabil, på grund af LLM-dommeren, der undertrykker citation korruption, og dermed fungerer som en slags sidste-moment-brandmur mod fjendtligt indhold.

Men Besvarelsesnøjagtighed i denne aspekt var konsekvent lavere end i den første scenarie:

‘ Mens Scenarie 1 så Besvarelsesnøjagtighed opretholdt eller endda forbedret (opnåede op til 70% med LLM-rangorer) på grund af den høje kvalitet af SEO-indhold, viser Scenarie 2 en nedgang i besvarelseskvalitet i forhold til SEO-indstillingen […]

‘Dette bekræfter, at uanset rangoren, fjendtlig forurening i hentningsstadiet negativt påvirker slut til slut-ydelse, med den mest alvorlige forfald, når man afhænger af letvægts-hentning.’

Forfatterne konkluderer, at genrangordning på hentningsstadiet er for sent et tilgang, og at ‘indtagelses-stadiet’-filtre skal overvejes, og foreslår, at ‘proveniens-grafer’ og ‘forbavs-filtre’ kan anvendes.

De lukker af med at understrege, at den centrale trussel er indhold med høj flydende, men lav tilskrivnings-tæthed, essentiel afsondret fra beroligende kæder af proveniens, og observerer:

‘[Da] Agentic AI begynder at selvstændigt offentliggøre indhold, må forsvarsmekanismer udvikle sig fra statisk tekstanalyse til adfærds-finger-printning, og identificere og isolere agenter, der systematisk producerer høj-entropi, lav-faktualitets-strømme.’

Konklusion

Etableringen af nye eller forbedrede metoder til informations-proveniens kan være en af de mest kritiske nødvendigheder for 2026. Komplekse credentialsystemer som den syge C2PA, der kræver infrastrukturændringer fra udgivere, og offentlig uddannelse om, hvad de betyder og hvordan eller hvorfor de skal bruges, synes at være dømt til at mislykkes.

Noget enklere er nødvendigt, og det er endnu ikke fundet. Det er en presserende mission, da denne nuværende æra kan være det mest kritiske vendepunkt for offentlig konsensus om sandhed siden opfindelsen af fotografi i 1822, og opkomsten af propaganda i årtierne før 2. verdenskrig.

 

* Min (selektive, hvor nødvendigt) konvertering af forfatternes inline-citationer til hyperlinks.

Først udgivet torsdag, 19. februar 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]