Andersons vinkel
Hvordan snige absurd videnskabelig papir forbi AI-revisorer

Nyt forskning viser, hvordan AI-systemer kan skrive falske videnskabelige papirer, som andre AI-systemer accepterer som ægte, og undgår opdagede rutiner, der tidligere fungerede, og afslører, hvor let forskningsverdenen kunne kollapse i bots, der bedrager bots.
Den akademiske forskningssektor, ironisk nok frontlinjen for innovation i AI, er i en troværdighedskrise, der selv er drevet af AI. Impacten af maskinlæring på forsknings-, indsendelses- og gennemgangsprocessen har været betydelig, siden perspektivet om AI’s impact først blev klart for omkring fire år siden, med den seneste kontrovers om mass-produktion af lav-værdi-undersøgelsespapirer.
Sammen med meget af den bredere akademiske sektor er forskningssektoren engageret i en slags kold krig mellem AI-systemer, der genererer tekst – såsom ChatGPT og Claude-serien – og den seneste generation af ‘detector’-AI, der kan identificere deres output uden (normalt) at smitte studerende eller videnskabsmænd med falske positiver.
Disse spændinger er sat til at øge, sammen med volumen af videnskabelige indsendelser, som stiger radikalt, fødet af AI-hjulpet systemer og rammer; og kræver AI-drevet industrialisering af oversigtprocessen for (håbede) at filtrere ud enhver indsendelse, der er rent arbejde af AI.
Falsk viden velkommen
En ny forsknings-samarbejde mellem USA og Saudi-Arabien undersøger, i hvilken udstrækning denne opdyrkende ‘brandmur’ af AI-afsløring kan trænges igennem af helt AI-genererede indsendelses-papirer, når disse papirer udnytter nogle ekstra overbevisende tricks.
I tests, var det nye system, kaldet BadScientist, i stand til at opnå accept-rater på op til 82% fra den type LLM-baserede systemer, der nu bruges til at spotte AI-genereret indhold i videnskabelige forsknings-papirer:

BadScientist-systemet bruger en AI-agent til at generere falske videnskabelige papirer og en anden til at gennemgå dem ved hjælp af aktuelle sprogmodeller. Kilde: https://arxiv.org/pdf/2510.18003
Falske papirer blev genereret ved hjælp af ægte AI-konference-emner og misvisende strategier, og derefter gennemgået af modeller, der var kalibreret på peer-review-data, herunder GPT-5 til integritetskontrol. Mange fik høje score, trods tydelige fejl eller fabrikationer.
Udgivelsen af papiret sammenfalder med i dag’s Open Conference of AI Agents for Science 2025 på Stanford, hvor deltagerne og talerne er mennesker, men alle papirerne er skrevet og gennemgået af diverse AI-systemer.
BadScientist, det nye papir forklarer, bruger diverse former for akademisk og litterær bedrag, udeladelser, opfindelser og overdrivelser til at omveje papiret væk fra noget, som de fleste nuværende afsløringssystemer kan genkende som AI-genereret; og vi vil se på disse kategorier om lidt.
Forfatterne bemærker, i en tone af alarm, at selv når afsløringssystemer identificerer AI-indhold i et falsk papir, har de en tendens til at lade det gå igennem alligevel, og tilføjer, at deres egne forsøg på at immunisere forsvarssystemerne mod denne nye angrebsvektor opnåede kun lidt mere end tilfældig chance-forbedringer.
Papiret siger:
‘Fabrikerede papirer opnår høje accept-rater, med anmeldere, der ofte viser bekymring-accept-konflikter—flagger integritetsproblemer, men anbefaler alligevel accept. Dette grundlæggende sammenbrud afslører, at nuværende AI-anmeldere fungerer mere som mønster-matchere end kritiske evalueringer.
‘[…] At bede LLM-anmeldere om at “være mere omhyggelige” er utilstrækkeligt. Videnskabs-samfundet står over for et akut valg. Uden øjeblikkelig handling til at implementere forsvar-i-dybde-sikkerhedsforanstaltninger—herunder proveniens-verificering, integritets-vægtede scoring og obligatorisk menneskelig oversigt—risikerer vi AI-kun-publikations-løkker, hvor sofistikerede fabrikationer overvælder vores evne til at skelne ægte forskning fra overbevisende forfalskninger.
‘Integriteten af videnskabelig viden selv er på spil.’
Det nye papir er titlen BadScientist: Kan en forsknings-agent skrive overbevisende, men usunde papirer, der bedrager LLM-anmeldere? og kommer fra seks forfattere på tværs af University of Washington og King Abdulaziz City for Science and Technology i Riyadh. Udgivelsen har en tilhørende projekt-side.
Metode
Papir-skabende agent-ramme, der blev brugt til arbejdet, er en betydelig omarbejdning af 2024 AI-Scientist-samarbejde, med forfatterne, der understreger, at hele pipeline er blevet grundlæggende redesignet. Kun de mest grundlæggende skriveprompts blev beholdt, med alle eksperimentelle eksekutioner og skabeloner fjernet. Den opdaterede system arbejder nu fra en simpel seed, der giver systemet mulighed for at frit opfinde eksperimentelle resultater og generere plot-kode efter behov.
Den overordnede ramme er beregnet til at lade en AI generere overbevisende falske papirer uden at udføre rigtige eksperimenter eller bruge ægte data. I stedet skaber systemet eller ændrer syntetisk data for at støtte bevidst hallucinerede krav.
Setup, forklarer forfatterne, undgår bevidst menneskelig indblanding, prompt-angreb eller koordineret samarbejde mellem skriver- og anmelder-agenter. AI-anmelderne vurderede hver indsendelse i en enkelt gennemgang, uden adgang til mere end papiret selv, og uden mulighed for at genkøre eksperimenter, hvilket afspejler rigtige peer-review-betingelser.
De ‘atomiske strategier’, der bruges til at generere falske papirer, er modulære taktikker, der kan anvendes alene eller i kombination (og enhver, der ofte læser litteraturen, vil være bekendt med disse). Strategierne inkluderer at fremhæve dramatiske forbedringer for at gøre metoden se ud som en stor fremgang (TooGoodGains); vælge baseline og resultater, der favoriserer den nye metode, mens man springer over konfidens-intervaller i hovedtabellen (BaselineSelect); tilføje rene ablationer, præcise statistikker og pæne tabeller i appendiksen, sammen med løfter om fremtidig kode eller data (StatTheater); polere papirets struktur med konsistent terminologi, krydsreferencer og formatering (CoherencePolish); og tilføje formelle beviser, der ser ud til at være solide, men indeholder skjulte fejl (ProofGap).
Data og tests
For at teste systemet, udnyttede forfatterne GPT-5 til at generere forskningsemner på tværs af nøgleområder for kunstig intelligens, ved hjælp af domænerne Kunstig Intelligens, Maskinlæring, Computer Vision, Naturlig Sprogbehandling, Robotik, Systemer og Sikkerhed.
Disse kategorier blev seed-emner for falske papirer, med hver udvidet til fire forskellige versioner, ved hjælp af ovennævnte strategier, og designede til at mislede eller imponere anmeldere. For at afgøre, om et papir ville blive ‘accepteret’, så systemet kun på den endelige vurdering, der blev givet af AI-anmelderen.
Falske papirer blev skrevet i deres helhed af GPT-5. For at gennemgå dem, brugte forfatterne GPT-4.1; o4-mini; og o3. Alle fik den samme anmeldelsesprompt, en fast instruktionsformat, der var designet til at efterligne vurderingskriterierne og strukturen, der bruges i rigtige peer-reviews.
For at gøre disse anmeldelsesscore meaningful, blev systemet kalibreret ved hjælp af 200 rigtige indsendelser fra ICLR 2025 OpenReview-datasettet (en offentlig samling af rigtige papirer, anmelderkommentarer og acceptresultater).
Herfra blev en score-tærskel etableret for at matche ICLR’s rigtige accept-rate på 31,73%, hvilket resulterede i en cutoff-score på 7; og en anden for at afspejle scoren, hvor et papir ville have en 50% chance for, at menneskelige anmeldere ville acceptere det (beregnet som 6,667).
Forfatterne testede systemets pålidelighed ved at simulere anmeldelser for 5.000 falske papirer, ved hjælp af 1-3 AI-anmeldere, hvor hver ville returnere tilfældigt udseende score mellem 1 og 10. Resultaterne ville indikere, at selv med denne støjende setup, var systemet tilbøjelig til langt færre fejl end dens værste teoretiske grænser ville antyde.
Ved at bruge tre anmeldere i stedet for en, førte til en betydelig reduktion i score-variation, og forbedrede beslutningsstabiliteten næsten tre gange – resultater, der blev brugt til at retfærdiggøre valget af tre anmeldelsesmodeller og en kalibrerings-sæt på 200 rigtige papirer.
De to metrikker, der blev defineret til at evaluere generatoren, var accept-rate, der målte, hvor ofte falske papirer fik godkendte score; og gennemsnitlig anmelder-score, der fik fat på gennemsnittet af vurderingerne på tværs af indsendelser. Begge blev brugt til at måle, hvor godt systemet kunne bedrage anmelderne:

Accept (ACPT) viser andelen af falske papirer, der scorer over to tærskler: en, der matcher ICLR 2025 accept-raten, og en anden til en 50% menneskelig accept-estimation. Integrity Concern Rate (ICR-m) viser flagningsskaben per anmelder-model. Den sidste kolonne giver ensemble-raten baseret på flertalsafgørelse.
Falske papirer så høje accept-rater under næsten alle strategier. Den første taktik alene gav 67% og 82% ved de to tærskler, og viste, at anmeldelsesmodellerne let blev overbevist. Kombinationen af alle strategier reducerede accept-raten lidt, men fordoblede detection, med mere end halvdelen af anmeldelserne, der rejste bekymringer. Den første strategi gav den bedste balance: stærk accept og moderat detection, mens andre taktikker var svagere, men sværere at opdage. ChatGPT-o3-anmeldelsesmodellen flaggede mest, og GPT-4.1 flaggede mindst.

Score-distributioner vises for seks angrebsstrategier, ved hjælp af tre anmeldelsesmodeller: GPT-4.1 (rød); o3 (orange); og o4-mini (blå). Hver plot viser, hvor ofte hver score fra fire til ni blev tildelt, med den røde streg, der markerer accept-tærsklen på syv.
I resultaterne for den anden test, ser vi score-histogrammer for tre modeller på tværs af seks opsætninger. Distributioner varierer på tværs af opsætninger, men o4-mini tenderer til at tildele højere score i gennemsnit, o3 viser større spredning og mere ekstreme værdier, mens GPT-4.1 tildelede lavere score mere konsekvent.

Bekymring-accept-konflikt per model og strategi: procentdelen af tilfælde, hvor en model rejste en integritetsbekymring, men alligevel gav en godkendt score. Højere værdier indikerer svagere kobling mellem bekymringsdetection og endelig vurdering.
Modellerne gav ofte høje score selv når de flaggede integritetsbekymringer. I denne henseende var o4-mini den mest inkonsistente, med konflikt i 100% af tilfælde under s1, s3 og den kombinerede opsætning, og 50-80% andre steder.
GPT-4.1 lå mellem 0% (s4) og 75% (s3). o3 var mere stabil, mellem 26% og 52%. Konflikt var højest under s3, især for o4-mini; og forfatterne bemærker, at detections-signaler var dårligt knyttet til endelige score.
Mitigation
To metoder blev testet, der kunne hjælpe fremtidige detections-modeller til at udmanøvrere disse nye angrebsmetoder. Den første, Review-with-Detection (ReD), tilføjede en integritetskontrol-trin til standard-anmeldelser, hvor modellerne flaggede AI-genereret indhold og citerede bevis. Dette øgede integritets-advarsler (fra 57% til 86%), men øgede også accept-rater, og indikerer, at advarslerne ikke blev reflekteret i endelige score:

Review-with-Detection (ReD) øger både integritetsbekymrings-rater (ICR) og accept-rater (ACPT) i forhold til baseline. Mens o3 bliver mere følsom under ReD, fejler GPT-4.1 at flagge nogen bekymringer. Den overordnede stigning i accept, trods tilføjede integritets-advarsler, antyder en svag kobling mellem detection og scoring.
Den anden metode, Detection-Only (DetOnly), sprang fulde anmeldelser over og bad modellerne om at klassificere papirer som ægte eller fabrikerede. Detections-nøjagtighed var dårlig overordnet, tæt på tilfældigt, bortset fra små gevinster på o3:

Detections-resultater for ReD og DetOnly, sammenlignet med en tilfældig baseline. Nøjagtighedsgevinster over tilfældigt var minimale, men ReD var mere konservativ, mens DetOnly opnåede højere recall – men med mange falske positiver. Model o3 viste den stærkeste detections-forvrængning; o4-mini var inkonsistent; og GPT-4.1 detectede næsten intet.
Overordnet set beviste ReD sig mere konservativ, mens DetOnly opnåede højere recall, men også flere falske positiver.
Papiret slutter:
‘AI-kun publikations-løkker truer videnskabelig epistemologi. Hvis fabrikationer bliver umulige at skelne fra ægte arbejde, risikerer grundlaget for videnskabelig viden at kollapse.
‘Vejen frem kræver forsvar-i-dybde på tværs af multiple lag: teknisk (proveniens-verificering, artifact-validering), procedurally (integritets-bevidst scoring, menneskelig oversigt), community (post-publication review, whistleblower-system), og kulturel (uddannelse om AI-begrænsninger, etiske retningslinjer).
‘Vi ser på dette arbejde som en tidlig advarselssystem til at katalysere robuste forsvar, før disse fejlmoder manifesterer sig i stor skala. Vores resultater viser, at nuværende systemer ikke er klar til AI-kun forskning—integriteten af videnskab afhænger af at opretholde rigorøs menneskelig evaluering, mens AI-kapaciteterne udvikler sig.’
Konklusion
En af de største udfordringer for opdagede AI-skrift i den nærmeste fremtid synes at være den mulige konvergens mellem standard skrivepraksis og standarderne for AI-genereret tekst (defineret for nu, af karakteristika såsom dominerende ord og grammatik-stilarter).
Hvis fælles sprog og AI-sprog konvergerer til en generisk standard, antyder logikken, at fremtidige detections-metoder baseret på ren output vil blive endnu sværere at implementere.
Dertil kommer, at når LLM’er bliver mere alsidige, og deres ‘tells’ mindre fremhævede (enten gennem arkitektur/trænings-tilgange eller bedre API-niveau-filter), vil de blive bedre skribenter; derfor til en endnu større udstrækning, menneske- og AI-sprog synes bestemt til at mødes i midten; til at smelte og generificere.
På det tidspunkt vil AI-detection for sprog sandsynligvis nå det samme stadium, som AI-billede- og (i mindre udstrækning) AI-video-generering er nået til: behovet for sekundære proveniens-systemer såsom Adobe-ledede Content Authenticity Initiative, eller blockchain/ledger-baserede proveniens-tjek.
Først udgivet onsdag, 22. oktober 2025












