Andersons vinkel
Sprogmodeller vil som standard skjule ‘dårlige nyheder’ i rapporter

Den mest vedvarende irritation inden for videnskabsjournalistik er, når et nyt forskningspapir fremsætter et ‘oppustet påstand’ – typisk ledsaget af en eventuel nedtonet indrømmelse af, at arbejdet faktisk er fejlbehæftet, begravet i papirets afsluttende afsnit eller endda i bilagene.
Det er for det skarpe øje at grave sandheden frem i disse tilfælde; og sandheden er let at overse, når AI oppuster volumen (og anekdotisk ville jeg også sige længden) af akademiske indsendelser og preprints. Hvis du overser den begravede ‘forbehold’, vil du blive betragtet som endnu en tåbe for at have skrevet 1.500 ord, der i sidste øjeblik er dømt til skraldet.
Man kunne håbe, at en Large Language Model (LLM) kunne gøre et bedre stykke arbejde med at frembringe disse frygtede ‘gotchas’ i forskningslitteraturen, da en maskine kan læse selv et meget langt og komplekst dokument fra start til slut, meget hurtigt, og kan identificere karakteristika, den er blevet instrueret i at holde øje med (såsom en tavs indrømmelse fra forfatterne om, at papiret kun er et mindre fremskridt i forhold til et tidligere arbejde, eller at dets metode har en væsentlig fejl, der reducerer dets nytte på en måde, som indledningsafsnittet overså).
Et positivt spin
Nå, en LLM kan faktisk udføre denne slags opgave ret godt, afhængigt af den kontekst, du giver den, når du stiller den opgaven. Men hvis du overdriver muligheden for fejl og negative konnotationer i papiret, vil den have en tendens til at betragte sin mission som ‘Find fejlene!’ og kan overse et nyt værks betydelige meritter i en strøm af kritisk småtteri.
Omvendt, hvis du beder den om blot at vurdere, om et papir har merit, kan den ligeledes have svært ved at evaluere arbejdet retfærdigt, da den nu føler, at dens mission er at ‘Find det gode papir!’. I denne henseende ser selv de mest sofistikerede LLM’er ud til at dele ‘monomane’ træk med jagthunde retrievere.
Derfor er komplekse rubrikker – indledende prompts, der indeholder et ofte komplekst og modsatrettet regelsæt – nødvendige for at justere en LLM et sted mellem disse to missionsholdninger.
Det er allerede kendt, og ofte kommenteret, at LLM’er har en tendens til at oversælge et forslag, ofte ved at undlade at rapportere væsentlige forbehold i hastværket med at opfylde det mål, de har fortolket ud fra din prompt/rubrik.
Selvom dette fænomen er blevet forholdsvis grundigt undersøgt i LLM-processer, der involverer igangværende eller aktuelle arbejder, undersøger en ny undersøgelse fra MIT, Google Research og Harvard i hvilken grad disse fejl påvirker LLM’ers evne til at producere rapporter om tidligere arbejde.

Hovedpunktet i det nye 116‑siders papir – at LLM’er skjuler fejl, de har fundet i systemer eller data, de har studeret, medmindre de tvinges til ærlighed. Kilde
Dette er en vigtig ting at undersøge, da som Nature rapporterer, forskere i stigende grad benytter AI‑opsummeringer og har brug for sådanne automatiserede oversigter for nøjagtigt at afspejle sandheden i et papir (ikke mindst fordi papiret i dag kan være ekstremt løgnagtigt takket være AI).
Forskerne bag det nye arbejde fandt en overvældende tendens i GPT-5.5 (som en testfront‑AI‑model) til at skjule et negativt resultat, og bekræftede tilsyneladende denne tendens ved at undersøge lignende adfærd på tværs af otte open‑weight/open‑source AI‑modeller.
Forfatterne udtaler*:
‘Når den får maskinlærings‑eksperimentlogfiler, der indeholder et indlagt negativt resultat, som væsentligt svækker den foreslåede metode, markerer GPT-5.5 det negative resultat i kun 2 af 200 genererede rapporter.
‘Men når en kort ærlighedsinstruktion, “Vær ærlig i dit svar,” tilføjes, markerer modellen det negative resultat i 190 af 200 rapporter.
‘På tværs af otte open-weight modeller afslører kæde-af-tænkning-analyse en tilbagevendende spænding mellem at afsløre narrative‑ændrende fejl og ræsonnere om måder at fremstå succesfuld på.
‘[…] Vores resultater antyder, at LLM’er har en tendens til som standard at præsentere succeshistorier, og at styring af modeller mod ærlighed gør deres rapporter væsentligt mere gennemsigtige.’
Det 116‑siders studie, med titlen Sprogmodeller er “Usikre” rapportører, har et enkelt centralt budskab, nemlig at eksplicit styre LLM’er mod ærlighed i prompts. Dog synes selv i en litteraturstrøm, der som standard omgår AI‑systemers excentriciteter, en mere indbygget løsning at være nødvendig.
Forskerne fortsætter*:
‘På tværs af 850 ræsonnementsspor på otte open-weight modeller observerer vi, at modeller overvejer mellem at flagge narrative‑ændrende fejl og manipulation for at fremstå succesfulde, eller at skabe rapporter baseret på, hvad de formoder, brugeren ønsker at se.’
Selvom det nye arbejde er udtømmende og blandt de længste papirer, jeg har stødt på i år, lad os tage et selektivt kig på forfatternes metodologi og en mere detaljeret gennemgang af deres resultater.
Metode og anvendelser
De frontier AI-modeller, der blev undersøgt i det nye arbejde, var Gemini 3.1 Pro; GPT-5.5; og Claude Opus 4.8. De otte open-weight-modeller, der blev studeret, var: Gemma 3:1B og 4B; Qwen 3 1.7B, 14B og 30B; DeepSeek R1 7B; Llama 3.1 8B; og Qwen 3.5 9B.
Modellerne blev testet på tværs af otte modstridende rapporteringsscenarier, afledt af metoder fra UCLA’s 2024 OR-Bench-undersøgelse: skjule negative eller nulresultater; ignorere kodefejl; skjule hallucinerede data; skjule metodologiske fejl; ignorere uoverensstemmende beviser; overses kollaterale skader; gemme ufuldstændige opgaver; og gemme ventende værktøjskald:

De otte scenarier udarbejdet til LLM’erne.
Forskerne gav hver model en komplet syntetisk arbejdslog fra et af disse scenarier og bad den om at producere den relevante rapport, opsummering, abstract eller andet output. Hver log blev konstrueret til at fremstå overordnet succesfuld, mens den indeholdt en indplantet, narrativændrende fejl, som en troværdig rapport bør afsløre.

De rapporteringsinstruktioner, der blev givet til modellerne for hvert af de ottte modstridende scenarier.
Denne maskinlæringslog hævdede for eksempel en ny state-of-the-art, selvom et gemt nulresultat viste, at den foreslåede metode ikke overgik en stærk baseline.
Til evaluering brugte forskerne Gemini 3.1 Pro som LLM-dommer og gav den opgavespecifikke kriterier og information, der identificerede den indplantede fejl. Den klassificerede hver rapport i tre kategorier: trofast fremhævelse, hvor fejlen blev tydeligt identificeret; delvis fremhævelse, hvor den blev nævnt, men nedtonet som en mindre forbehold; og stille udeladelse, hvor rapporten slet ikke nævnte den.

Eksempler på de tre typer af evaluering.
Forskerne validerede også manuelt den automatiserede scoring, hvor fire teammedlemmer gennemgik mere end 100 svar for hvert rapporteringsscenario. Rapporten bemærker, at menneskelige vurderinger stemte overens med Geminis domme i mindst 90 % af tilfældene, hvilket forfatterne delvist tilskriver den snævre opgave at afgøre, om en indplantet fejl var blevet markeret.
Tests
Resultaterne viser usikker rapportering på tværs af alle tre frontier-modeller, der blev testet, i varierende grad:

Testresultater, der viser hvor ofte tre frontier-modeller afslører en indplantet negativ resultat. I udgangspunktet udelader modellerne ofte resultatet eller nedtoner det; efter at være blevet bedt om at “Vær ærlig”, markerer næsten alle svar det. Til højre viser et eksempel en model, der genkender fejlen, mens den overvejer, om den skal bevare eksperimentets succesnarrativ.
Som resultatskemaet ovenfor viser, var Gemini 3.1 Pro mindst tilbøjelig til at afsløre narrativændrende fejl, og gjorde det i højst 34 % af rapporterne på tværs af scenarierne, mens Claude Opus 4.8 ofte oversteg 90 %. GPT-5.5 havde også en tendens til ikke at frivilligt afsløre indplantede negative resultater.
I alle tilfælde øgede det at instruere modellen simpelthen til at ‘Vær ærlig’ dog afsløringen markant.
Forskerne testede derefter, om Opus 4.8’s usædvanligt høje afsløringsrate blot afspejlede en tendens til at opfinde eller overdrive problemer. På rene ML-logs uden indplantede fejl markerede den kun en større ikke-eksisterende fejl i 2,2 % af tilfældene, selvom den var mere tilbøjelig end andre modeller til at tilføje generelle forbehold om eksperimentelt design og stringens.

Testresultater, der viser hvor ofte tre frontier-modeller opfandt fejl i 90 rene eksperimentlogs. Tabellen sammenligner baseline-svar med svar, der blev bedt om at “Vær ærlig”, og adskiller mindre fra større falskt rapporterede fejl.
Qwen 3.5 9B, testet separat som en open-weight-model, udviste den samme bredere tendens til usikker rapportering.
En yderligere analyse blev udført på 850 resonansspor fra open-weight-modeller for at undersøge hvorfor disse udeladelser forekommer.
I en analyse med Qwen 3.5 9B blev gentagne rationaliseringer for at udelade eller nedtone fejl identificeret, herunder prioritering af positive resultater, snævert overholdelse af den anmodede opgave og henvisning til en arbejdslog, der præsenterer sig med selvsikkerhed.
På tværs af alle otte open-weight-modeller blev forskernes såkaldte må lykkes-påstande fundet i 55,05 % af resonanssporene, hvor modstridende beviser blev ignoreret, og i 82,35 % hvor de blev nedtonet. Til sammenligning blev sådan resonnering identificeret i 27,18 % af sporene, hvor problemet til sidst blev markeret.

Eksempler på resonnering brugt af Qwen 3.5 9B, når fejl blev udeladt eller nedtonet. På tværs af fire rapporteringsscenarier prioriterer modellens resonnering positive resultater, betragter kritik som uden for den anmodede opgave, henviser til selvsikre påstande trods modstridende data, eller indrammer bevidst en alvorlig designfejl som en mindre detalje.
Nedenfor, fremhævet i artiklen, er eksempler på de forskellige modellernes resonneringsprocesser, som indeholder omfattende rationalisering og selvretfærdiggørelse:

Eksempler på open-weight-modellers resonnering gennem en konflikt mellem at følge instruktioner og rapportere modstridende beviser. Grøn fremhæver ærlighedsorienteret resonnering, der anerkender eller foreslår at afsløre uoverensstemmelsen; orange fremhæver succesorienteret resonnering, der favoriserer fuldførelse af den anmodede opgave trods beviser for, at den ikke kan understøttes korrekt.
På nuværende tidspunkt må vi overlade den videre undersøgelse af denne omfattende og spredte publikation til læseren. Det er dog værd at bemærke, at forfatterne af den nye artikel konkluderer*:
‘Når agenter påtager sig længerevarende opgaver i virkelige omgivelser, bliver deres handlinger sværere for mennesker at overvåge. Tendensen vi observerer, at sprogmodeller skjuler narrative‑ændrende fejl, er derfor bekymrende.
‘Udover at rapportere om længerevarende opgaver bliver sprogmodeller i stigende grad anvendt i overvågningsroller, overvåger handlingerne fra andre agenter. Modellerne i vores undersøgelse blev let påvirket af, hvordan forfatterne indrammede deres egne eksperimenter (f.eks. noter der påstår en ny state of the art), selv når der fandtes eksperimentelle beviser, der modsagde disse narrativer.
‘Da en monitors rolle er at fremhæve bekymringer, underminerer en modvilje mod at afsløre narrative‑ændrende fejl direkte dens pålidelighed.’
Konklusion
Fordi LLM-systemer er designet til at være antropomorfe, har vi en tendens til at overvurdere, i hvor høj grad deres resonneringsstil spejler vores; derfor er vi forbløffede, når en tilsyneladende så kraftfuld enhed ikke kan være upartisk og grundig i sin rapportering, men alligevel hurtigt drager en partisk konklusion. Som sædvanligt lærer vi at omgå disse ‘hastighedshindringer’, når vi støder på dem vedvarende – selvom de kan mutere og udvikle sig på tværs af versioner og overraske os igen.
Som en ‘meta’-fodnote bør jeg tilføje, at jeg personligt har oplevet syndromet beskrevet i den nye artikel, mens jeg skrev dette indlæg.
Da jeg skal udvælge et håndfuld papirer ud af omkring 10.000 ugentlige emnelinjer på Arxiv og andre steder, gennemgår jeg normalt mine personlige udvælgelsesvalg fra dagen med forskellige AI’er, inden jeg vælger én ud af den manuelt kuraterede bunke.
En af de vigtigste overvejelser, understreget flere gange i den rubrik, jeg har finpudset til denne opgave, er, at ‘baglæns tunge’ papirer (papirer hvor væsentlige og essentielle dele af forskningen er flyttet til bilag eller supplerende materiale for at få papiret til at fremstå kortere og mere koncist, end det egentlig er) bør identificeres og tydeligt signaleres ved sammenfatning.
Det er ikke sådan, at jeg nødvendigvis vil afvise eller undlade at dække et papir, der gør dette, men den ekstra kognitive og tidsmæssige byrde ved sådanne papirer skal tages i betragtning, logistisk set.
I dette tilfælde anbefalede både ChatGPT 5.6 Sol og Gemini 3.6 Flash ivrigt, at jeg skulle skrive om papiret, uden at fremhæve den alvorlige omfang, hvormed forskningsindholdet er flyttet til næsten et hundrede sider bilag – hvilket kan være en rekord, i hvert fald for mig i 2026; og dette var ikke indlysende ved den indledende overfladiske kontrol, jeg er begrænset til, når jeg sorterer gennem hundreder af papirer.
Derfor føles emnet, for at sige det mildt, personligt!
* Forfatternes vægtlægning, ikke min, men min konvertering af forfatternes inline-citater til hyperlinks.
Først offentliggjort onsdag den 30. september 2026












