Andersons vinkel
Selv grundlæggende AI kan nu skrive nyheder, der passer for mennesker

Nyt forskning viser, at selv små lokale AI-modeller nu kan skrive nyheder, som mennesker ikke kan skelne fra rigtig journalistik, og matcher top-systemer, og efterlader læserne ude af stand til at vide, hvem der skrev hvad.
Ifølge en ny forskningssamarbejde mellem Tyskland og Frankrig kan mennesker ikke afgøre, om en nyhedsartikel er skrevet af AI eller et menneske – selv når den er skrevet af open source-modeller, der kan downloades og køres på relativt almindelige forbruger niveau desktop-computere.
I endnu et tegn på, at lille AI er på fremmarch, fandt en undersøgelse af 2.318 domme indsamlet fra 1.054 deltagere i et dedikeret akademisk studieportal, at menneskelige læsere ikke kunne identificere oprindelsen af en artikel på et højere niveau end tilfældighed, selv når den var output fra relativt beskedne modeller med så få som syv milliarder parametre, herunder Mistral og Llama-varianter:

Gennemsnitlige kilde- og ægthedsscores for LLM’er testet. GPT-4o’s 200 milliarder parametre overstiger ikke massivt de 7 milliarder parametre i de mindre modeller. De testede modeller for studiet var Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o og GPT-3.5. Kilde
Forfatterne vender tilbage til et emne, som de først undersøgte i 2024 udgivelsen Blessing or curse? A survey on the Impact of Generative AI on Fake News. Fundene selv er nyligt udgivne resultater fra et større projekt, der først blev annonceret i januar, og bruger forfatternes eget JudgeGPT online-participatorisk ramme.
Lettevægtskraft
Titlen Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News, og kommer fra tre forskere på Frankfurt University of Applied Sciences og IRISA-forskningsenheden i Nantes, den nye studie metodik gør en vigtig forskel mellem ‘fake news’ og ‘AI-skrevet nyheder’ (da fake news kan være skrevet af mennesker eller AI, og de to aspekter er ikke nødvendigvis synonyme).
Men måske det mest interessante aspekt er papirets konklusion, at små modeller, herunder Mistral 7B og Gemma 7B, kan, med kun syv milliarder parametre, stå på niveau med aplomb mod de store modeller som en ChatGPT-model (4o) med 200 milliarder parametre:
‘Open-weight modeller med så få som 7 milliarder parametre producerer tekst, der vurderes ikke anderledes end GPT-4o output, hvilket indikerer, at evnen til at generere menneskeligt uadskillelig tekst ikke længere er begrænset til frontier-modellerne.’
Men ‘AI-genereret nyheder’ kan repræsentere mange forskellige former for menneske/AI-samarbejde, fra stavekontrol til fuld, karriere-ændrende overdragelse af indsats, og studiet gør det ikke klart, hvilken slags AI-indhold der blev produceret til testene (selvom det beskriver metoden for at producere det – se nedenfor).
Metode
For deltagerne, der var engageret i JudgeGPT-platformen, blev hver nyhedsfragment vurderet ved hjælp af en dual-axis-ramme, hvor de gav tre uafhængige vurderinger på kontinuerlige 0-100 skalaer;

JudgeGPT-portalen GUI, hvor vurdererne vurderer materiale på kilde-tillæg; ægthed; og emne-kendskab. Se venligst kildekilden for bedre opløsning.
Kilde-vurdering fanget, om en passage syntes maskin-skrevet eller menneske-skrevet; ægthed-vurdering, om det blev opfattet som falsk eller legitimt; og emne-kendskab, hvordan godt læseren kendte emnet.
Kontinuerlige skalaer blev brugt i stedet for en Likert-skala, for at fange grader af sikkerhed mere præcist, og for at understøtte statistisk analyse, herunder Pearson-korrelation og klustering.
Maskin-genereret tekst-fragmenter blev produceret af forfatternes eget RogueGPT-ramme, den førende arkitektur for JudgeGPT. RogueGPT orkestrerer bidrag fra seks Large Language Models (LLM’er): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; og Mistral 7B.
Persona-baseret prompting blev brugt til at generere tekstene, og AI-genereringerne var grundet i rigtige nyheds-emner og blev faktatjekket af mennesker.
Omvendt blev menneske-skrevne fragmenter samplet fra ‘etablerede nyheds-kilder’ og uspecificerede ‘information-databaser’.
Forfatterne observerer:
‘Stimulus-sættet er bevidst skævt mod maskin-oprindelse-fragmenter (∼98%), med menneske-oprindelse-elementer, der fungerer som kalibrerings-ankre.
‘Dette design-valg reflekterer studiets fokus på indenfor-AI-variation (over modeller) snarere end menneske-vs.-AI-sammenligning; deltagere er ikke informeret om grund-sættet, og nær-chance-detektion [resultater] holder, når de analyseres på menneske-oprindelse-undermængden alene.’
Deltagere gav først informeret samtykke og fuldførte en demografisk spørgeskema, der dækkede alder, uddannelse, politisk orientering og bekendtskab med AI, efterfulgt af, at de vurderede sekvensen af nyheds-fragmenter.
Hver person gennemgik mellem 5-87 elementer, med en median på 12, mens præsentations-rækkefølgen var tilfældig, og model-tildeling var balanceret over deltagere, for at reducere bias. Platformen optog de tre skala-vurderinger sammen med respons-tid og en anonym identifier, der tillod, at individuelle domme kunne kobles med baggrunds-faktorer.
Forfatterne påpeger, at prøven skævede mod uddannede europæiske deltagere, med 68% universitetsuddannede, og 74% baseret i Europa – en bias, som papiret noterer som en begrænsning for bredere generalisering.
Tests
Testene er inddelt i fem fund-typer: at skelne mellem maskin-genereret og menneske-skrevet tekst; sammenligning af detektion over forskellige LLM’er; undersøgelse af effekten af domæne-ekspertise versus politisk orientering på nøjagtighed; identificering af distinkte respons-strategier blandt deltagere; og sporing af, hvordan nøjagtighed ændrer sig over gentagne vurderinger, på grund af træthed:

Oversigt over de fem kerne-fund fra 2.318 domme over 1.054 deltagere, der viser, at menneskelig detektion af AI-skrevet tekst forblev på tilfældighedsniveau over alle modeller, at nøjagtighed var knyttet til domæne-ekspertise snarere end politisk orientering, at deltagere klumpede sammen i distinkte tillidsprofiler, og at præstationen faldt efter omkring 30 vurderinger, på grund af kognitiv træthed.
Testen viste ingen signifikant over-tilfældigheds-forskel i kilde-scores mellem betingelser, hvilket tilsyneladende indikerer, at deltagere ikke kan skelne AI-genereret tekst fra menneske-skrevet output:

Kilde- og ægthedsscore-fordeling for maskin- og menneske-oprindelse-fragmenter viser betydelig overlap, med ingen meningsfuld adskillelse mellem de to betingelser, og statistisk test – der indikerer, at deltagere ikke pålideligt kan skelne AI-genereret tekst fra menneske-skrevet indhold.
For det andet aspekt, som vist i grafen i starten af artiklen, fejlede detektion ikke på grund af model, da output fra alle LLM’er klumpede sammen omkring tilfældighedsniveau-vurderinger, med ingen signifikante forskelle mellem dem. Selv mindre åbne-vægts-systemer som Mistral 7B og Gemma 7B blev vurderet ikke anderledes end GPT-4o, hvilket indikerer, at menneske-uadskillelig tekst måske ikke længere er begrænset til de største modeller.
For det tredje aspekt var nøjagtighed mere stærkt knyttet til domæne-ekspertise end til politisk orientering, da bekendtskab med fake news korrelerede med bedre vurderinger, mens politiske synspunkter viste ingen meningsfuld effekt, hvilket antyder, at lært analytisk færdighed kan være mere vigtig end ideologi:

Resultater for den tredje linje for undersøgelse viste, at politisk orientering havde ingen meningsfuld effekt på kilde-tillæg eller ægthed-vurdering, med kun svage, ikke-signifikante tendenser, mens selv-rapporteret bekendtskab med fake news var associeret med højere nøjagtighed på begge akser. Dette antyder, at erfaring-baseret analytisk færdighed var en stærkere prædiktor for præstation end ideologisk position. Se venligst kildekilden for bedre opløsning.
Den fjerde fund viste, at deltagere klumpede sammen i to distinkte respons-stilarter, der blev identificeret som ‘Skeptikere’ – der tildelte lav tillid over indhold uanset oprindelse – og ‘Troende’ – der opretholdt en højere baseline af tillid.
Endelig, med hensyn til det femte mål, viste en rullende analyse af sekventielle vurderinger, at deltagere først blev bedre til opgaven, med nøjagtighed, der forbedredes over omkring de første 15-20 vurderinger, da de tilpassede sig formatet:

Rullende gennemsnit af kilde-tillæg og ægthedsscores over sekvensen af deltagernes vurderinger viser en kort initial forbedrings-fase, da brugerne synes at tilpasse sig opgaven under de første 15-20 elementer, efterfulgt af en stadig nedgang i begge mål efter omkring 30 vurderinger. Se venligst kildekilden for bedre opløsning.
Men denne effekt var kortvarig, da præstationen begyndte at falde efter omkring 30 elementer, med deltagere, der stadig mere defaultede til at mærke indhold som falsk – en skift, der blev fortolket som kognitiv træthed, og antyder klare begrænsninger for, hvor længe detektions-baserede tilgange kan forblive effektive i praksis.
Dette kan repræsentere nogen empirisk bevis for, at, udmattet af udsigten til at skelne mellem falsk nyheder og rigtige, AI-nyheder fra menneske, vi kan tende til at default til at antage, at nyhederne er AI og/eller falske (ikke nødvendigvis det samme), for at være ‘på den sikre side’. De, der betragter dette som ‘dovent’, og mener, at mennesker burde gøre deres egen research for at verificere en potentiel falsk nyheds-historie, kan være interesseret i at lære, at en studie fra 2024 indikerer, at dette kun gør problemerne værre.
Forfatterne foreslår, at det fejl, der er påvist i resultaterne, indikerer, at vi måske skal overdrage disse spørgsmål til kryptografisk proveniens-teknologier, såsom Adobe-ledede C2PA-initiativet. Andre mulige løsninger, der nævnes, er forfatternes eget OriginLens-ramme, og et andet forfatter-relateret projekt kaldet CRED-1.
Forfatterne konkluderer:
‘Kan mennesker skelne? Vores dual-axis-studie af 2.318 vurderinger over seks LLM-familier giver et klart empirisk svar: de kan ikke.
‘Maskin-genereret tekst er uadskillelig fra menneske-skrevet uanset model-størrelse eller familie, domæne-ekspertise forudser detektions-nøjagtighed mere stærkt end politisk orientering, deltagere antager distinkte tillids-strategier, og kognitiv træthed begrænser vedvarende detektion.
‘Disse fund støtter en skift fra bruger-niveau-detektion til system-niveau-kontratilbud, herunder indhold-proveniens, adaptive tillids-indikatorer og begrænsede inokulations-interventioner.’
Konklusion
Det bekymrende aspekt af denne artikel er det omgivende støtte-netværk af projekter og artikler, som forfatterne – eller nogle af forfatterne, afhængigt af arbejdet – har oprindeligt eller har en hånd i; og det ville have været oplysende, hvis man kunne have studeret eksempler på AI- og menneske-genereret tekst, der producerede disse resultater, for bedre at forstå, hvilken slags output den beskrevne generations-metode producerer.
Nonetheless, det er interessant at høre, at åbne-vægts-, åbne-kilde-modeller kan sammenlignes med API-drevne kæmper som ChatGPT-serien – kan det være, at opgaven i sig selv ikke er så svær, og at en 200-milliarder-parametre-model er overkill for sådanne opgaver? Vi ville nødt til at vide lidt mere om de indsendte AI- og menneske-skrevne kilde-eksempler for at besvare dette spørgsmål.
I mellemtiden, ifølge canirun.ai-sitet, kører Mistral 7B (der var mere eller mindre på niveau med ChatGPT-4o i testene) ‘great’ på en NVIDIA RTX 3080 med 16GB af VRAM, og kører ‘decent’ på en 3060 med 6GB af VRAM – ikke nødvendigvis de nyeste eller bedste grafikkort i spillet*. Så hvis nogen ønsker at udvikle deres egen metode for eksempel-indsendelse, kan de åbenbart deltage i disse eksperimenter også.
* Gemma 7B er ikke listet på siden.
Først udgivet torsdag, 9. april 2026












