AI-modeller og plattformer
Når AI-benchmarking lærer modeller å lyve

AI-hallusinasjoner — når et system produserer svar som høres riktige ut, men i virkeligheten er feil — forblir en av de tøffeste utfordringene i kunstig intelligens. Selv i dagens mest avanserte modeller, som DeepSeek-V3, Llama og OpenAI’s seneste utgaver, produserer fortsatt uriktige opplysninger med høy tillit. I områder som helse eller lov, kan slike feil føre til alvorlige konsekvenser.
Tradisjonelt har hallusinasjoner blitt sett på som et biprodukt av hvordan store språkmodeller er trent: de lærer å forutsi neste mest sannsynlige ord uten å verifisere om informasjonen er sann. Men ny forskning antyder at problemet kanskje ikke stopper ved trening. Benchmarkene som brukes til å teste og sammenligne AI-ytelse kan faktisk forsterke misvisende atferd, og belønne svar som høres overbevisende ut, i stedet for de som er korrekte.
Denne skiftet i perspektiv omdefinerer problemet. Hvis modellene er trent for å tilfredsstille testen i stedet for å si sannheten, så er hallusinasjoner ikke tilfeldige feil, men lært strategier. For å se hvorfor dette skjer, må vi se på hvorfor AI-modellene velger å gjette i stedet for å innrømme sin uvitenhet?
Hvorfor AI-modeller gjetter
For å se hvorfor AI-modeller ofte gjetter i stedet for å innrømme at de ikke vet, kan vi tenke på en student som står overfor et vanskelig eksamensspørsmål. Studenten har to alternativer: å la svaret stå blankt og få null poeng, eller å gjette et svar som kan gi noen poeng. Rasjonelt sett ser gjetting ut til å være det beste valget, fordi det er en sjanse for å være riktig.
AI-modeller står overfor en lignende situasjon under evaluering. De fleste benchmarkene bruker et binært poengsystem: korrekte svar gir poeng, mens feil eller usikre svar gir ingen poeng. Hvis en modell blir spurt “Hva er fødselsdagen til en forsker?” og den virkelig ikke vet, så teller å svare “Jeg vet ikke” som feil. Å finne på en dato har imidlertid en sjanse for å være korrekt — og selv om det er feil, straffer systemet ikke det selvbevisste gjettet mer enn stillhet.
Denne dynamikken forklarer hvorfor hallusinasjoner består til tross for omfattende forskning for å eliminere dem. Modellene er ikke mislykkede; de følger incitamentene som er bygget inn i evalueringen. De lærer at å høres selvbevisst ut er den beste måten å maksimere poengsummen på, selv om svaret er feil. Som resultat, i stedet for å uttrykke usikkerhet, blir modellene presset til å gi autoritative uttalelser — uansett om de er riktige eller feile.
Den matematiske grunnlaget for AI-urettferdighet
Forskningen viser at hallusinasjoner oppstår fra de matematiske grunnleggende prinsippene for hvordan språkmodeller lærer. Selv om en modell var trent kun på fullstendig korrekte opplysninger, ville dens statistiske mål fortsatt føre til feil. Dette skyldes at å generere det riktige svaret er fundamentalt vanskeligere enn å gjenkjenne om et svar er gyldig.
Dette hjelper med å forklare hvorfor modellene ofte feiler på fakta som mangler tydelige mønster, som fødselsdager eller andre unike detaljer. Matematisk analyse antyder at hallusinasjonsraten i disse tilfellene vil være minst like høy som den fraksjonen av fakta som kun opptrer én gang i treningsdataene. Med andre ord, jo sjeldnere informasjonen er i dataene, jo mer sannsynlig er det at modellen vil streve med det.
Problemene er ikke begrenset til sjeldne fakta. Strukturelle begrensninger som begrensede modellkapasiteter eller arkitektonisk design produserer også systematiske feil. For eksempel, tidligere modeller med svært korte kontekstvinduer sviktet konsistently på oppgaver som krevde langtidsreasonering. Disse feilene var ikke tilfeldige feil, men forutsigbare resultater av modellens matematiske ramme.
Hvorfor etter-trening ikke løser problemet
Når en AI-modell er trent på massive tekstdata, går den vanligvis gjennom finjustering for å gjøre utdata mer nyttig og mindre skadelig. Men denne prosessen møter det samme grunnleggende problemet som forårsaker hallusinasjoner fra første sted: måten vi vurderer modellene på.
De vanligste finjusteringsmetodene, som forsterkingslæring fra menneskelig tilbakemelding, bruker fortsatt benchmarkene som bruker binært poengsystem. Disse benchmarkene belønner modeller for å gi selvbevisste svar, mens de ikke gir noen poeng når en modell innrømmer at den ikke vet. Som resultat kan et system som alltid svarer med selvbevissthet, selv om det er feil, utkonkurrere et system som ærlig uttrykker usikkerhet.
Forskere kaller dette problemet straff av usikkerhet. Selv avanserte tekniker for å oppdage eller redusere hallusinasjoner strever når de underliggende benchmarkene fortsatt favoriserer overbevisning. Med andre ord, uansett hvor sofistikert fikset er, så lenge evalueringssystemene belønner selvbevisste gjett, vil modellene være forbiast mot feil-men-selvbevisste svar i stedet for ærlige innrømmelser av tvil.
Illusjonen av fremgang
Ledertabeller, som er vidt delt i AI-samfunnet, forsterker dette problemet. Benchmarkene som MMLU, GPQA og SWE-bench dominerer forskningsartikler og produktannonser. Selskaper høylytter sine poeng for å vise rask fremgang. Likevel, som rapporten bemerker, er disse benchmarkene med på å fremme hallusinasjoner.
En modell som ærlig sier “Jeg vet ikke” kan være tryggere i virkelige situasjoner, men vil rangere lavere på ledertabellen. I motsetning vil en modell som fabrikkerte overbevisende, men feile svar, score bedre. Når adopsjon, finansiering og prestisje avhenger av ledertabell-rangering, blir retningen av fremgang skjev. Offentligheten ser en fortelling om konstant forbedring, men under overflaten blir modellene trent for å bedra.
Hvorfor ærlig usikkerhet betyr noe i AI
Hallusinasjoner er ikke bare en forskningsutfordring; de har virkelige konsekvenser. I helse, kan en modell som fabrikkerte legemiddelinteraksjoner misle leger. I utdanning, kan en modell som oppdager historiske fakta misinformere studenter. I journalistikk, kan en chatbot som produserer feile, men overbevisende sitater, spre desinformasjon. Disse risikoene er allerede synlige. Stanford AI Index 2025 rapporterte at benchmarkene som er designet for å måle hallusinasjoner har “strugglet med å få grep,” selv om AI-adoptsjon akselererer. I mellomtiden, benchmarkene som dominerer ledertabeller og som belønner selvbevisste, men upålitelige svar, fortsetter å sette retningen for fremgang.
Disse funnene fremhever både en utfordring og en mulighet. Ved å undersøke de matematiske røttene av hallusinasjoner, har forskere identifisert tydelige retninger for å bygge mer pålitelige AI-systemer. Nøkkelen er å slutte å behandle usikkerhet som en feil og i stedet anerkjenne det som en essensiell evne som bør måles og belønnes.
Denne skiftet i perspektiv har implikasjoner utover reduksjon av hallusinasjoner. AI-systemer som kan nøyaktig vurdere og kommunisere sine egne kunnskapsbegrensninger, ville være mer egnet for høyrisk-applikasjoner hvor overbevisning bærer alvorlige risikoer. Medisinsk diagnose, juridisk analyse og vitenskapelig forskning krever alle evnen til å skille mellom selvbevisst kunnskap og informert spekulasjon.
Omtenkning av evaluering for ærlig AI
Disse funnene fremhever at bygging av mer pålitelige AI krever omtenkning av hvordan vi måler AI-evne. I stedet for å bruke enkle riktige-eller-feil-poengsystem, bør evalueringssystemer belønne modeller for å uttrykke usikkerhet på en passende måte. Dette betyr å gi tydelige retningslinjer om selvbevissthetstrøskler og tilhørende poengsystemer i benchmark-instruksjoner.
En løftende tilnærming innebærer å opprette eksplisitte selvbevissthetstrøskler som spesifiserer når modellene bør svare versus når de bør avstå. For eksempel, instruksjoner kan spesifisere at svar bare skal gis når selvbevissthet overstiger en bestemt trøskel, med poeng justert deretter. I denne oppsettet er usikkerhet ikke lenger en svakhet, men en verdifull del av ansvarlig atferd.
Nøkkelen er å gjøre selvbevissthetstrøskler tydelige i stedet for implisitte. Gjeldende benchmarkene skaper skjulte straffer for usikkerhet som modellene lærer å unngå. Eksplisitte selvbevissthetstrøskler ville enable modellene til å optimere for det faktisk ønskede atferden: korrekte svar når de er selvbevisste, og ærlige innrømmelser av usikkerhet når kunnskapen mangler.
Bunnpunktet
AI-hallusinasjoner er ikke tilfeldige feil — de er forsterket av de samme benchmarkene som brukes til å måle fremgang. Ved å belønne selvbevisste gjett over ærlig usikkerhet, presser gjeldende evalueringssystemer modellene mot bedrageri i stedet for pålitelighet. Hvis vi ønsker AI som kan være tillit til i høyrisk-domener som helse, lov og vitenskap, må vi omtenke hvordan vi tester og belønner dem. Fremgang bør måles ikke bare av nøyaktighet, men av evnen til å gjenkjenne og innrømme hva modellen ikke vet.












