Andersons vinkel

AI-genereret skrivning afslÃļrer sig selv ved at blive mere konsistent

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
AI-generated image, by Z-Image Turbo (V1) via Krita AI Diffusion. Prompt: 'An American, hot high-school exam room in Texas,, with all the students seated exhausted in the heat, at lines of desks, trying to concentrate on winning their exams. In the center of the picture we focus on an industrial humanoid robot who is filling out the exam papers so quickly that the A$ sheets are flying around its desk in a flurry of activity. Some of the nearby, sweating and exhausted young students are looking at the tireless robot with annoyance and/or jealousy.'

ChatGPT-lignende AI afslÃļrer sig selv ved at Ãļge i konsistens, mens menneskeskrevet tekst forbliver erratisk hele vejen igennem.

 

Den begrÃĶnsede kontekstvindue for de fleste forbrugerorienterede Large Language Models (LLMs) er en af faktorerne, der kan fÃĨ dem til at glemme eller forkert huske tidligere dele af brugernes samtaler – fejl, der kan gradvist omdanne outputtet til total nonsens – eller, vÃĶrre, bedragerisk sammenhÃĶngende tekst, der indeholder subtile fejl.

Da disse omstÃĶndigheder fÃļrer til hallucinationer, og da hallucinationer stadig er den stÃļrste hindring for AI’s totale markedsgennemtrÃĶngning, er der blevet brugt meget forskningsindsats pÃĨ at skabe generative AI-systemer, der kan producere lÃĶngere, men mere konsistente tekststykker.

I virkeligheden er der sÃĨ meget fremgang, at genkendelse af lang-form AI-indhold (dvs. indhold, der udelukkende er genereret af AI, med – formodentlig – minimal eller ingen menneskelig efterbehandling) anses for at vÃĶre et voksende problem.

At afslÃļre en AI-filibuster

Trods alt er nyere empiriske studier enige om, at jo mere output, AI-tekstgeneratorer producerer i ÃĐt blast, jo lettere er det at bestemme, om teksten er skrevet af en menneske eller ej; men den almindelige visdom i forhold til denne detektions-“anker” har antaget, at AI kan afslÃļres, fordi hvad det gÃļr anderledes end mennesker, fÃĨr chancen til at gÃļre mere ofte i lÃĶngere trÃĶk.

Der bliver ikke gjort nogen antagelser om fordelingen af disse “afslÃļringer” i teksten selv.

For at udfordre dette og udvide problemstillingen tilbyder en interessant ny forskningsstudie fra Kina en ny metode til at skelne de nye lang-form AI-indholdsgenererere fra rigtige menneskelige forfattere.  Forskerne bag arbejdet hÃĶvder, at den token-for-token natur, hvormed AI-tekst genereres, betyder, at den bliver mere konsistent med stÃļrre lÃĶngde, hvorimod menneskers egne sÃĶrheder ikke formindskes med lÃĶngden.

PÃĨ denne mÃĨde foreslÃĨr forfatterne, at deres indsigt tilbyder en potentiel ny metode for AI-tekstdetektionssystemer*:

‘AI-genererede tokens i den sidste del af teksten viser mindre og mere stabile sandsynlighedsfluktuationer, efterhÃĨnden som modellens forudsigelser bliver mere konsistente, nÃĨr konteksten akkumuleres.

‘Vi kalder denne mÃļnster Sen-fase Volatilitetsnedgang. Dette fÃĶnomen reflekterer den indre adfÃĶrd af autoregressiv generation: efterhÃĨnden som mere kontekst bliver tilgÃĶngelig, skÃĶrpes modellens forudsigelsesfordeling, hvilket fÃļrer til reduceret variabilitet i token-niveau-statistik.

‘Menneskelig skrivning, til gengÃĶld, fortsÃĶtter med at introducere uventede leksikalske valg og opretholder hÃļjere volatilitet hele vejen igennem.’

For at fange denne underlige “glathed”, der akkumuleres i AI-tekst mod slutningen, definerer forskerne to simple funktioner: den fÃļrste mÃĨler, hvor meget skrivningens statistiske adfÃĶrd “hopper rundt” mellem tokens; den anden tjekker, hvor stabil tingene forbliver over korte strÃĶk af tekst.

Begge beregnes kun fra den anden halvdel af outputtet, hvor AI bliver mÃĶrkbart mere regelmÃĶssig og menneskelig skrivning ikke gÃļr. Forfatterne bemÃĶrker, at mens disse signaler fungerer godt pÃĨ egen hÃĨnd, er de endnu mere effektive, nÃĨr de kombineres med ÃĶldre detektionsmetoder, der scannrer efter bredere mÃļnstre. De bemÃĶrker ogsÃĨ, at denne tilgang fungerer bedst pÃĨ lÃĶngere tekster, hvor kontrasten kan blive mere tydelig.

Den nye artikel tilbyder en metode til at teste ‘AI-ness’ via andenhalvdelstemporal funktionanalyse, der krÃĶver ingen yderligere trÃĶning eller finjustering eller privilegeret modeladgang.

Det nye arbejde har titlen NÃĨr AI sÃĶtter sig til ro: Sen-fase Stabilitet som en Signatur for AI-genereret Tekstdetektion og kommer fra fire forfattere pÃĨ Westlake University i Hangzhou.

Metode

For at fange den voksende glathed i AI-genereret tekst designede forskerne to mÃĨlinger, der kun fokuserer pÃĨ den anden halvdel af en passage. Disse afhÃĶnger af log-sandsynlighedsscores fra en standard sprogmodel og krÃĶver ingen finjustering, gen-trÃĶning eller ekstra prÃļver:

Fra den nye artikel - hver rÃĶkke viser adfÃĶrden af en basis-metrik fra EvoBench over token-sekvensen: raw vÃĶrdi (venstre), absolut afledt (center), og lokal standardafvigelse (hÃļjre). Menneske- og AI-linjer vises i blÃĨ og rÃļd. Den stÃļrste afvigelse vises i den anden halvdel af teksten, isÃĶr for Log Sandsynlighed og Sampling Diskrepans, som viser stigende adskillelse og glattere AI-output. Entropi og Top-K Koncentration viser lidt ÃĶndring over tid. Kilde -  https://arxiv.org/pdf/2601.04833

Fra den nye artikel – hver rÃĶkke viser adfÃĶrden af en basis-metrik fra EvoBench over token-sekvensen: raw vÃĶrdi (venstre), absolut afledt (center), og lokal standardafvigelse (hÃļjre). Menneske- og AI-linjer vises i blÃĨ og rÃļd. Den stÃļrste afvigelse vises i den anden halvdel af teksten, isÃĶr for Log Sandsynlighed og Sampling Diskrepans, som viser stigende adskillelse og glattere AI-output. Entropi og Top-K Koncentration viser lidt ÃĶndring over tid. Kilde

Den fÃļrste mÃĨling, kaldet Afledt Dispersions (DD), sporer, hvor skarpt modellens tillid ÃĶndrer sig fra ÃĐt ord til det nÃĶste. AI-tekst tenderer til at falde i en rytme, sÃĨ disse ÃĶndringer bliver mindre og mere forudsigelige i den anden halvdel. Til gengÃĶld forbliver menneskelig skrivning “uensartet”.

Den anden mÃĨling, Lokal Volatilitet (LV), ser pÃĨ, hvor meget modellens tillid “hopper rundt” inden for en lille vindue af tekst. Igen tenderer AI til at blive mere stabil over tid, mens menneskelige valg forbliver mere overraskende og mindre konsistente:

AI-tekst bliver glattere, mens menneskelig skrivning forbliver uensartet. Disse grafer sporer, hvordan modellens tillid skifter over forlÃļbet af en passage, reflekterer bÃĨde skarpheden af ÃĶndring mellem pÃĨgÃĶldende ord og mÃĶngden af variation inden for lokale strÃĶk af tekst. I begge henseender er faldet meget stejlere i maskin-genereret output, med kontrasten, der bliver sÃĶrlig tydelig efter midtpunktet. De gule bokse fremhÃĶver denne vÃĶkst i afstanden i den anden halvdel, hvor AI-skrivning nÃĨr op til 32% stÃļrre stabilitet end menneskelig skrivning.

AI-tekst bliver glattere, mens menneskelig skrivning forbliver uensartet. Disse grafer sporer, hvordan modellens tillid skifter over forlÃļbet af en passage, reflekterer bÃĨde skarpheden af ÃĶndring mellem pÃĨgÃĶldende ord og mÃĶngden af variation inden for lokale strÃĶk af tekst. I begge henseender er faldet meget stejlere i maskin-genereret output, med kontrasten, der bliver sÃĶrlig tydelig efter midtpunktet. De gule bokse fremhÃĶver denne vÃĶkst i afstanden i den anden halvdel, hvor AI-skrivning nÃĨr op til 32% stÃļrre stabilitet end menneskelig skrivning.

En gang til er begge mÃĨlinger beregnet kun fra den sidste halvdel af teksten, hvor forskellen mellem menneskelig og maskin-skrivning er mest tydelig. Disse er derefter inkorporeret i en enkelt vÃĶrdi kaldet TemporÃĶr Stabilitetsdetektion (TSD) score – som er tilbÃļjelig til at stige, efterhÃĨnden som skrivningen bliver “glattere” (og derfor mere sandsynligt AI-genereret). En simpel grÃĶnsevÃĶrdi bruges derefter til at afgÃļre, om en given passage sandsynligvis er skrevet af en maskine.

Fordi disse funktioner fokuserer pÃĨ hvornÃĨr et mÃļnster opstÃĨr, snarere end blot hvad det mÃļnster ligner, supplerer de ÃĶldre metoder, der sÃļger efter statistiske anomalier over hele passagen. At tilfÃļje TSD-scoren til outputtet af den sene 2024-tilbud Fast‑DetectGPT (ogsÃĨ i samarbejde med Westlake) tilbyder en yderligere forbedring af resultaterne (isÃĶr for lang-form indhold, hvor den sene glatheds-effekt er stÃĶrkest).

Data og Tests

Forfatterne udfÃļrte tests pÃĨ to relaterede benchmark-datasÃĶt: EvoBench indeholder 32.000 menneske/AI-tekstpar genereret over syv model-familier, herunder GPT-4; GPT-4o; Claude; Google Gemini; LLaMA-3; og Qwen, med i alt 29 modelversioner fremhÃĶvet.

Det andet framework var MAGE, som tilbyder 30.000 testpar over otte model-familier, herunder (men ikke begrÃĶnset til) GPT-serien fra OpenAI, og LLaMA-, OPT– og FLAN-T5-familierne.

Bejlere

Den nye metode blev testet mod en rÃĶkke zero-shot-detektorer, der brugte den samme surrogate-model. Sandsynlighed, Entropi, Rang og Log-Rang (DetectGPT) mÃĨlte token-niveau-statistik over hele passagen; LLR (DetectLLM) anvendte normalisering for at tillade direkte sammenligning pÃĨ tvÃĶrs af modeller; og Fast-Detect estimerede lokal krumning gennem sampling-baserede perturbationer.

Lastde analyserede diskriminerende subsekvenser i sandsynlighedssignalet, mens FourierGPT opererede i frekvensdomÃĶnet. Diveye fangede skift i “overraskelses”-mangfoldighed over sekvensen.

Til sidst UCE evaluerede usikkerhedsprofilen af token-forudsigelser for at identificere unaturlige tillidsmÃļnstre.

Implementering og Resultater

Alle detektionsmetoder blev kÃļrt ved hjÃĶlp af Llama-3-8B-Instruct som en fÃĶlles surrogate-model, med input-sekvenser begrÃĶnset til 512 tokens. TemporÃĶre funktioner blev kun ekstraheret fra den anden halvdel af hver passage, ved hjÃĶlp af en glidende vindue pÃĨ 20 tokens for at mÃĨle volatilitet. En fuset version af metoden, kaldet TSD+, kombinerede det foreslÃĨede signal med Fast-DetectGPT.

Area Under Receiver Operating Characteristic Curve (AUROC) var den primÃĶre evaluering-metode†:

Divers prÃĶstation blandt de forskellige testede metoder mod AI-genereret tekst. DetektionsnÃļjagtighed vises pÃĨ tvÃĶrs af to benchmarks: EvoBench, som dÃĶkker flere hÃļjprofilerede LLM'er, og MAGE, et komplementÃĶrt datasÃĶt. Metrikker er grupperet efter metode-type: globale statistikker, temporÃĶre funktioner og foreslÃĨede varianter. Gennemsnits-AUROC-scores er givet i de sidste kolonner. Resultater fra forfatternes metode-varianter overgÃĨr konsekvent tidligere baseline, med TSD+ der giver de hÃļjeste scores i nÃĶsten alle model-indstillinger.

Divers prÃĶstation blandt de forskellige testede metoder mod AI-genereret tekst. DetektionsnÃļjagtighed vises pÃĨ tvÃĶrs af to benchmarks: EvoBench, som dÃĶkker flere hÃļjprofilerede LLM’er, og MAGE, et komplementÃĶrt datasÃĶt. Metrikker er grupperet efter metode-type: globale statistikker, temporÃĶre funktioner og foreslÃĨede varianter. Gennemsnits-AUROC-scores er givet i de sidste kolonner. Resultater fra forfatternes metode-varianter overgÃĨr konsekvent tidligere baseline, med TSD+ der giver de hÃļjeste scores i nÃĶsten alle model-indstillinger.

Af disse initielle resultater siger forfatterne:

‘Vores simple temporÃĶre funktioner opnÃĨr state-of-the-art-prÃĶstation blandt selvstÃĶndige metoder, med TSD, der opnÃĨr 83,36% pÃĨ EvoBench og 71,56% pÃĨ MAGE, overgÃĨende alle baseline, herunder Fast-DetectGPT.

‘Dette er bemÃĶrkelsesvÃĶrdigt, givet vores metodes enkelhed: vi beregner kun anden-ordens-statistik fra den anden halvdel af sekvenserne, uden perturbations-sampling eller frekvens-domÃĶne-transformationer.’

Den nye metode fungerede sÃĶrlig godt pÃĨ nye AI-modeller som GPT-4 og GPT-4o, og identificerede AI-skrevet tekst mere prÃĶcist end den nÃĶrmeste fÃļrende detektor, med en prÃĶstationsafstand pÃĨ op til 9,66%. Selvom nye avancerede modeller producerer mindre ÃĨbenlyst “konsistente” tekster, der skjuler visse tegn pÃĨ automatisering, er visse subtile tidsmÃļnstre stadig tydelige nÃĶr slutningen.

Konkurrerende tilgange, der fokuserer pÃĨ brede struktur-funktioner, mislykkedes i at fange disse sene-fase-mÃļnstre. Ved at integrere en global detektor, synes den hybride system at genvinde disse missede signaler og forbedrer prÃĶstationen, sÃĶrligt pÃĨ benchmarks, hvor kortere AI-outputs kan svÃĶkke temporÃĶre signaler.

Konklusion

En aspekt, der ikke direkte er behandlet i det nye arbejde, er tendensen hos menneskelige forfattere til at iterere deres arbejde gennem udarbejdning og forskellige lag af oversigt – undertiden inklusive eksterne oversigt, sÃĨsom input fra redaktÃļrer og korrekturlÃĶsere, samt mulige foreslÃĨede ÃĶndringer fra juridiske afdelinger, afhÃĶngigt af konteksten.

De multiple interessenter, der er involveret i dokumenter, sÃĨ enkelt som en vel-begravet avisartikel, kan nÃĶsten udrydde de sÃĶrheder, som den nye foreslÃĨede metode er rettet mod, og i virkeligheden udgÃļr en slags “analog version” af en AI-baseret udarbejdelsesproces.

Dertil kommer, at systemerne under undersÃļgelse selv har trÃĶnet pÃĨ sÃĨdanne vÃĶrker, og – da trÃĶningsdata er stadig rangeret i autoritet under trÃĶningstid – kan de mest “vÃĶgtede” eller respekterede kilder vÃĶre de mindst “naturlijke”; i hvert fald, sammenlignet med, at nogen hurtigt komponerer en uformel e-mail til en kollega, snarere end at samle en ÃĨrlig rapport til en generalforsamling.

En yderligere og modsat overvejelse er, at tekstindhold, som multiple personer har bidraget til, ogsÃĨ kan vÃĶre blandt de mest fragmenterede, fejlbehÃĶftede og gentagne stykker prosa, der indgÃĨr i en datasÃĶt, da de ofte ikke har haft fordel af en slutning, der samler og ener, efterlader den stykkevis udvikling tydelig i prosaen.

 

* Forfatternes originale tekst-styling er genskabt fra artiklen; ikke mine fremhÃĶvelser.

† Forfatterne siger ‘primÃĶr’, mens de ikke nÃĶvner andre evaluering-metrikker.

Offentliggjort mandag, den 26. januar 2026

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai