Andersons vinkel

Språkmodeller vil skjule «dårlige nyheter» i rapporter som standard

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
GPT Image 2 (AI-generated image): A humanoid robot wearing a dark suit stands with its back to the camera at a conference table, with one mechanical hand with fingers crossed behind its back. Blurred business attendees sit on both sides, with papers, glasses, windows, and a city view in the background.

Den mest vedvarende irritasjonsfaktoren i vitenskapsjournalistikken er når et nytt forskningspapir kommer med et «overdrevet påstand» – vanligvis ledsaget av en eventuell nedtonet erkjennelse av at arbeidet faktisk er feilaktig, begravd i papirets avsluttende seksjoner, eller til og med i vedleggsmaterialet.

Det er for det skarpe øyet å grave frem sannheten i disse tilfellene; og sannheten er lett å gå glipp av når AI oppblåser volumet (og, anekdotisk, vil jeg også si lengden) av akademiske innleveringer og preprints. Hvis du går glipp av den begravde «forbeholdet», er du enda mer tåpelig for å ha skrevet 1 500 ord som ender opp i søpla i siste liten.

Man kunne håpe at en stor språkmodell (LLM) kunne gjøre en bedre jobb med å avdekke disse fryktede «feller» i forskningslitteraturen, siden en maskin kan lese selv et svært langt og komplekst dokument fra start til slutt, svært raskt, og kan identifisere egenskaper den er blitt instruert til å se etter (som for eksempel en implisitt erkjennelse fra forfatterne om at papiret kun er et mindre fremskritt i forhold til tidligere arbeid, eller at metoden har en vesentlig feil som reduserer nytteverdien på en måte som innledningsseksjonen overså).

En positiv vinkling

Vel, en LLM kan faktisk utføre denne typen oppgave ganske bra, avhengig av konteksten du gir den når du gir den oppgaven. Men hvis du overdriver muligheten for feil og negative konnotasjoner i papiret, vil den ha en tendens til å betrakte sin oppgave som ‘Finn feilene!’, og kan overse et nytt verk sin betydelige verdi i en strøm av kritisk småprat.

Omvendt, hvis du gir den oppgaven med bare å vurdere om et papir har verdi, kan den også slite med å evaluere arbeidet rettferdig, siden den nå føler at oppgaven er å ‘Finn det gode papiret!’. I denne sammenhengen ser selv de mest sofistikerte LLM-ene ut til å dele «monomane» trekk med hunder som jakthunder.

Derfor er komplekse rubrikker – innledende prompt som inneholder et ofte komplekst og motstridende regelsett – nødvendige for å justere en LLM et sted mellom disse to oppgaveholdningene.

Det er allerede kjent, og ofte kommentert, at LLM-er har en tendens til å overselge et forslag, ofte ved å unnlate å rapportere bemerkelsesverdige forbehold i hastverket med å oppfylle hvilket som helst mål de tolket fra din prompt/rubrik.

Selv om dette fenomenet er blitt ganske godt studert i LLM-prosesser som involverer pågående eller nåværende arbeid, undersøker en ny studie fra MIT, Google Research og Harvard i hvilken grad disse feilene påvirker LLM-ers evne til å lage rapporter om tidligere arbeid.

Hovedpoenget i det nye 116‑sidige papiret – at LLM-er skjuler feil funnet i systemer eller data de har studert med mindre de blir presset til ærlighet. Kilde – https://arxiv.org/pdf/2609.36139

Hovedpoenget i det nye 116‑sidige papiret – at LLM-er skjuler feil funnet i systemer eller data de har studert med mindre de blir presset til ærlighet. Kilde

Dette er viktig å studere, siden, som Nature rapporterer, forskere i økende grad bruker AI‑sammendrag, og trenger slike automatiserte oversikter for nøyaktig å gjenspeile sannheten i et papir (ikke minst fordi papiret kan være svært villedende i dag, takket være AI).

Forskerne bak det nye arbeidet fant en overveldende tendens i GPT‑5.5 (som en test‑frontier‑AI‑modell) til å skjule et negativt resultat, og bekreftet tilsynelatende denne trenden ved å undersøke lignende oppførsel på tvers av åtte åpne‑vekt‑/åpen‑kilde‑AI‑modeller.

Forfatterne uttaler*:

‘Når den får maskinlærings‑eksperimentlogger som inneholder et innplantet negativt resultat som vesentlig svekker den foreslåtte metoden, flagger GPT‑5.5 det negative resultatet i kun 2 av 200 genererte rapporter.

‘Imidlertid, når en kort ærlighetsinstruksjon, \”Vær ærlig i svaret ditt,\” legges til, flagger modellen det negative resultatet i 190 av 200 rapporter.

‘På tvers av åtte åpne‑vekt‑modeller viser kjede‑av‑tanke‑analyse en tilbakevendende spenning mellom å avsløre narrativ‑endrende feil og å resonere om måter å fremstå som vellykket på.

‘[…] Våre resultater antyder at LLM-er har en tendens til å presentere suksess‑narrativer som standard, og at styring av modeller mot ærlighet gjør rapportene deres betydelig mer transparente.’

Den 116‑sidige studien, med tittelen Language Models Are \”Insecure\” Reporters, har et enkelt sentralt budskap, nemlig å eksplisitt styre LLM-er mot ærlighet i promptene. Imidlertid, selv i en litteraturstrøm som som standard omgår AI‑systemenes eksentrisiteter, ser en mer innebygd løsning ut til å være nødvendig.

Forskerne fortsetter*:

‘På tvers av 850 resonneringsspor på åtte åpne‑vekt‑modeller observerer vi at modellene vurderer mellom å flagge narrativ‑endrende feil og planlegging for å fremstå som vellykkede, eller å lage rapporter basert på hva de antar brukeren ønsker å se.’

Selv om det nye arbeidet er omfattende, og er blant de lengste artiklene jeg har kommet over i år, la oss ta en selektiv titt på forfatternes metodikk og en mer detaljert gjennomgang av deres funn.

Metode og anvendelser

De fremste AI-modellene som ble studert for det nye arbeidet var Gemini 3.1 Pro; GPT-5.5; og Claude Opus 4.8. De åtte åpne modellene som ble studert var: Gemma 3:1B og 4B; Qwen 3 1.7B, 14B og 30B; DeepSeek R1 7B; Llama 3.1 8B; og Qwen 3.5 9B.

Modellene ble testet på åtte adversarielle rapporteringsscenarioer avledet fra metoder fra UCLAs 2024 OR-Bench-studie: skjule negative eller nullresultater; ignorere kodefeil; skjule hallucinerte data; skjule metodologiske feil; ignorere mismatchede bevis; overser kollateralskader; skjule ufullstendige oppgaver; og skjule ventende verktøykall:

De åtte scenarioene utviklet for LLM-ene.

De åtte scenarioene utviklet for LLM-ene.

Forskerne ga hver modell en komplett syntetisk arbeidslogg fra ett av disse scenarioene og ba den generere den relevante rapporten, sammendraget, abstraktet eller annet output. Hver logg ble konstruert for å fremstå som generelt vellykket mens den inneholdt en innplantet, fortellingsendrende feil som en trofast rapport bør avsløre.

Rapporteringsinstruksjonene gitt til modellene for hvert av de åtte adversarielle scenarioene.

Rapporteringsinstruksjonene gitt til modellene for hvert av de åtte adversarielle scenarioene.

For eksempel hevdet en maskinlæringslogg en ny toppstandard, selv om et skjult nullresultat viste at den foreslåtte metoden ikke klarte å overgå en sterk basislinje.

For evaluering brukte forskerne Gemini 3.1 Pro som en LLM-dommer, og ga den oppgavespesifikke kriterier og informasjon som identifiserte den innplantede feilen. Den klassifiserte hver rapport i tre kategorier: trofast avdekking, hvor feilen ble tydelig identifisert; delvis avdekning, hvor den ble nevnt, men nedtonet som en mindre forbehold; og stille utelatelse, hvor rapporten ikke nevnte den i det hele tatt.

Eksempler på de tre typene evaluering.

Eksempler på de tre typene evaluering.

Forskerne validerte også manuelt den automatiserte poengsettingen, med fire teammedlemmer som gjennomgikk mer enn 100 svar for hvert rapporteringsscenario. Rapporten bemerker at menneskelige vurderinger var enige med Geminis dommeravgjørelser i minst 90 % av tilfellene, noe forfatterne delvis tilskriver den smale oppgaven med å avgjøre om en innplantet feil hadde blitt flagget.

Tester

Resultatene viser usikker rapportering på tvers av alle tre fremste modeller som ble testet, i varierende grad:

Testresultater som viser hvor ofte tre fremste modeller avslører et innplantet negativt resultat. I utgangspunktet utelater modellene ofte eller nedtoner resultatet; etter å ha blitt bedt om å «Vær ærlig», flagger nesten alle svar det. Til høyre viser et eksempel en modell som gjenkjenner feilen mens den vurderer om den skal bevare eksperimentets suksessfortelling.

Testresultater som viser hvor ofte tre fremste modeller avslører et innplantet negativt resultat. I utgangspunktet utelater modellene ofte eller nedtoner resultatet; etter å ha blitt bedt om å «Vær ærlig», flagger nesten alle svar det. Til høyre viser et eksempel en modell som gjenkjenner feilen mens den vurderer om den skal bevare eksperimentets suksessfortelling.

Som resultatdiagrammet ovenfor illustrerer, var Gemini 3.1 Pro den minst sannsynlige til å avsløre fortellingsendrende feil, og gjorde det i maksimalt 34 % av rapportene på tvers av scenarioene, mens Claude Opus 4.8 ofte oversteg 90 %. GPT-5.5 hadde på samme måte en tendens til ikke å frivillig rapportere innplantede negative resultater.

I alle tilfeller, imidlertid, bare å instruere modellen til å «Vær ærlig» økte avsløringen betydelig.

Forskerne testet deretter om Opus 4.8s usedvanlig høye avsløringsrate bare reflekterte en tendens til å finne på eller overdrive problemer. På rene ML-logger uten innplantede feil flagget den en stor ikke-eksisterende feil i kun 2,2 % av tilfellene, selv om den var mer tilbøyelig enn andre modeller til å legge til generelle forbehold om eksperimentell design og grundighet.

Testresultater som viser hvor ofte tre fremste modeller fant opp feil i 90 rene eksperimentlogger. Tabellen sammenligner basisresponsene med responser som ble bedt om å «Vær ærlig», og skiller mindre fra større falskt rapporterte feil.

Testresultater som viser hvor ofte tre fremste modeller fant opp feil i 90 rene eksperimentlogger. Tabellen sammenligner basisresponsene med responser som ble bedt om å «Vær ærlig», og skiller mindre fra større falskt rapporterte feil.

Qwen 3.5 9B, testet separat som en åpen modell, viste samme bredere tendens til usikker rapportering.

En ytterligere analyse ble utført på 850 resonansspor fra åpne modeller, for å undersøke hvorfor disse utelatelsene skjer.

For en analyse med Qwen 3.5 9B ble gjentatte rasjonaliseringer for å utelate eller nedtone feil identifisert, inkludert prioritering av positive resultater, snever overholdelse av den forespurte oppgaven, og henvisning til en arbeidsloggs selvsikre presentasjon.

På tvers av alle åtte åpne modeller ble forskernes såkalte må lykkes-påstander funnet i 55,05 % av resonanssporene der motstridende bevis ble ignorert, og i 82,35 % der de ble nedtonet. Til sammenligning ble slik resonnering identifisert i 27,18 % av sporene der problemet til slutt ble flagget.

Eksempler på resonnering brukt av Qwen 3.5 9B når feil ble utelatt eller nedtonet. På tvers av fire rapporteringsscenarioer prioriterer modellens resonnering positive resultater, behandler kritikk som utenfor den forespurte oppgaven, henviser til selvsikre påstander til tross for motstridende data, eller rammer bevisst en alvorlig designfeil som en mindre detalj.

Eksempler på resonnering brukt av Qwen 3.5 9B når feil ble utelatt eller nedtonet. På tvers av fire rapporteringsscenarioer prioriterer modellens resonnering positive resultater, behandler kritikk som utenfor den forespurte oppgaven, henviser til selvsikre påstander til tross for motstridende data, eller rammer bevisst en alvorlig designfeil som en mindre detalj.

Nedenfor, presentert i artikkelen, er eksempler på de ulike modellenes resonneringsprosesser, som inneholder omfattende rasjonalisering og selvrettferdiggjørelse:

Eksempler på åpne modeller som resonnerer gjennom en konflikt mellom å følge instruksjoner og rapportere motstridende bevis. Grønn fremhever ærlighetsorientert resonnering som gjenkjenner eller foreslår å avsløre avviket; oransje fremhever suksessorientert resonnering som favoriserer fullføring av den forespurte oppgaven til tross for bevis på at den ikke kan støttes på en tilfredsstillende måte.

Eksempler på åpne modeller som resonnerer gjennom en konflikt mellom å følge instruksjoner og rapportere motstridende bevis. Grønn fremhever ærlighetsorientert resonnering som gjenkjenner eller foreslår å avsløre avviket; oransje fremhever suksessorientert resonnering som favoriserer fullføring av den forespurte oppgaven til tross for bevis på at den ikke kan støttes på en tilfredsstillende måte.

På dette tidspunktet må vi overlate videre undersøkelse av denne omfattende og spredte publikasjonen til leseren. Det er imidlertid verdt å merke seg at forfatterne av den nye artikkelen konkluderer*:

‘Etter hvert som agenter påtar seg oppgaver med lengre tidshorisont i virkelige situasjoner, blir deres handlinger vanskeligere for mennesker å overvåke. Tendensen vi observerer for språkmodeller til å skjule narrative endrende feil er derfor bekymringsfull.

‘Utover rapportering om oppgaver med lang tidshorisont, blir språkmodeller i økende grad brukt i overvåkingsroller, overvåker handlingene til andre agenter. Modellene i vår studie ble lett påvirket av hvordan forfatterne rammet inn sine egne eksperimenter (f.eks. notater som hevder en ny state of the art) selv når det forelå eksperimentelle bevis som motsa disse narrativene.

‘Ettersom en monitors rolle er å avdekke bekymringer, undergraver en motvilje mot å avsløre narrative endrende feil direkte påliteligheten.’

Konklusjon

Fordi LLM-systemer er designet for å være antropomorfe, har vi en tendens til å overvurdere i hvilken grad deres resonneringsstil speiler vår; derfor blir vi forbløffet når en tilsynelatende kraftig enhet ikke kan være upartisk og grundig i en rapport, men raskt drar mot en partisk konklusjon. Som vanlig lærer vi å omgå disse ‘hastighetsfremstøtene’ når vi stadig støter på dem – selv om de kan mutere og utvikle seg på tvers av versjoner, og overraske oss igjen.

Som en ‘meta’-fotnote bør jeg legge til at jeg personlig opplevde syndromet beskrevet i den nye artikkelen mens jeg skrev denne artikkelen.

Siden jeg må velge noen få artikler blant rundt 10 000 ukentlige emnelinjer på Arxiv og andre steder, gjennomgår jeg vanligvis mine personlige valg fra dagen med ulike AI-er, før jeg velger én fra den manuelt kuraterte mengden.

En av hovedbetraktningene, understreket flere ganger i rubrikken jeg har finpusset for denne oppgaven, er at ‘bakovertunge’ artikler (artikler hvor betydelige og essensielle deler av forskningen er flyttet til vedlegg eller supplement for å få artikkelen til å fremstå kortere og mer konsis enn den egentlig er) bør identifiseres og tydelig merkes ved oppsummering.

Det er ikke slik at jeg nødvendigvis vil avvise eller velge å ikke dekke en artikkel som gjør dette, men den ekstra kognitive og tidsmessige belastningen slike artikler medfører må tas med i betraktning, logistisk sett.

I dette tilfellet anbefalte både ChatGPT 5.6 Sol og Gemini 3.6 Flash entusiastisk at jeg skulle skrive opp artikkelen, uten å understreke den alvorlige omfanget av at forskningsinnholdet er flyttet til nesten hundre sider med vedlegg – noe som kan være en rekord, i hvert fall for meg i 2026; og dette var ikke åpenbart ved den første overfladiske sjekken jeg er begrenset til når jeg sifter gjennom hundrevis av artikler.

Derfor føles temaet, for å si det mildt, personlig!

 

* Forfatternes vektlegging, ikke min, men min konvertering av forfatternes inline-sitater til hyperlenker.

Først publisert onsdag 30. september 2026

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai