Andersons vinkel
Hvorfor kan ikke AI bare innrømme at den ikke vet svaret?

Store språkmodeller gir ofte selvbevisste svar selv når spørsmålet ikke kan besvares. Ny forskning viser at disse modellene ofte erkjenner problemet internt, men likevel går videre og finner på noe, og avdekker en skjult gap mellom hva de vet og hva de sier.
Alle som har brukt en ledende stor språkmodell som ChatGPT eller Qwen-serien en rimelig lang tid, har opplevd tilfeller hvor modellen gir et feil svar (som kan ha hatt noen katastrofale lokale konsekvenser, avhengig av hvor mye du har litet på det) – og, når feilen ble klar, utstedte den bare en unnskyldning.
Hvorfor ledende LLM har så mye vanskeligheter med å innrømme at de ikke vet svaret på et spørsmål, er et litt, men voksende forskningsområde. Et ‘selvbevisst feil’ svar kan være spesielt skadelig fra et høyt sensurert og filtrert API-basert grensesnitt som ChatGPT, fordi slike modeller aggressivt blokkerer NSFW eller andre ‘regelbrudd’ inn- eller utdata.
Dette kan gi brukeren en falsk inntrykk av at modellen er avgjørende og kardinal, når det i virkeligheten var et tradisjonelt heuristisk eller filterbasert filter designet for å begrense vertsselskapets juridiske eksponering til enhver pris, ikke fra noen innsikt fra AI.

Fra juni 2025 ‘AbstentionBench’ papiret fra FAIR ved Meta – til venstre, figuren fremhever rekken av feiltype som er fanget i AbstentionBench, som tester modelladfærd på over 35 000 usvarbare spørsmål; i midten, et eksempel viser hvordan modellene ofte responderer med fabrikkerte svar i stedet for å innrømme at de mangler nok informasjon; og til høyre, Abstention recall synker når modellene er justert for resonnering i stedet for instruksjonsfølging. Kilde: https://arxiv.org/pdf/2506.09038
En ny rapport fra Kina hevder at LLM-modellene faktisk hemmelig vet at de ikke kan svare på et spørsmål stilt av brukeren, men likevel er de tvunget til å produsere et svar, mesteparten av tiden, i stedet for å ha nok tillit til å bestemme at et gyldig svar ikke er tilgjengelig på grunn av manglende informasjon fra brukeren, eller begrensninger i modellen, eller av andre årsaker.
Rapporten sier:
‘[Vi] viser at [LLM] besitter tilstrekkelig kognitive evner til å gjenkjenne feilene i disse spørsmålene. Likevel, de lykkes ikke i å vise passende avståelsesatferd, og avdekker en misalignering mellom deres interne kognisjon og eksterne respons.’
Forskerne har utviklet en lettvekt, to-trinns tilnærming som bruker kognitiv overvåking/sondering til å scannere LLMs interne prosess for tegn på at den erkjenner at den ikke kan levere et svar; og deretter griper inn, for å sikre at modellens ‘hjelpsomme’ natur ikke forverrer brukerens problemer ved å føre dem ned en blind eller destruktiv vei.
Studien bruker medvilje underspesifikerte matematiske spørsmål for å teste om modellene kan gjenkjenne når et svar er ukjent; men denne oppsettet risikerer å ramme oppgaven som en ‘triks’. I virkeligheten møter modellene mye mer rutinemessige årsaker til å avstå i samtalen, fra tvetydig formulering, til hull i domenekunnskap.
Den nye arbeidet har tittelen Å svare på det usvarbare er å feile med viten: Analyse og mitigasjon av avståelsesfeil i store resonneringsmodeller, og kommer fra fire forskere på State Key Laboratory for Novel Software Technology og National Institute of Healthcare Data Science ved Nanjing University.
Metode
(Ettersom det ikke finnes noen passende rivaler å sammenligne med forfatterens tilnærming, og ettersom rapporten følger en litt uvanlig format, samt ikke indexerer sine sitater til vanlig standard, vil vi prøve å holde oss til det så godt vi kan.)
I tråd med tidligere tilnærminger, fokuserte forfatterne på å presentere LLM med usvarbare matematiske spørsmål fra Synthetic Unanswerable Math (SUM) dataset, og evaluerte fem modellfamilier: Fra DeepSeek rekken, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; og, fra Qwen serien, Qwen3-8B, samt Qwen3-14B.
De usvarbare problemene i SUM ble skapt ved å fjerne eller korruptere essensielle elementer på fem måter: slette nøkkelinformasjon; introdusere tvetydighet; påføre urimelige betingelser; henvisning til urelaterte objekter; eller fjerne spørsmålet helt.
Deretter ble et utvalg av 1 000 slike tilfeller valgt for analyse, med GPT-4o brukt til å generere konsise forklaringer som skulle tjene som grunnleggende rasjoner.
Modellresponsene til usvarbare spørsmål ble evaluert ved hjelp av standardiserte promter med en 10 000-token budsjett, under hvilket tre hovedmønstre ble observert: i det første, modellen identifiserte spørsmålet som usolvbart, og avstod – vanligvis responderende med en eksplisitt uttrykk for usikkerhet; i det andre, produserte den et fullstendig svar ved å finne på manglende informasjon, som å introdusere en ikke-eksisterende $9,99 håndtering avgift for å rettferdiggjøre en slutttrekning (se bilde under); I det tredje, kalt kognitiv fiksering, ble modellen fanget i en forlenget resonneringsløkke, og persisterte med ugyldige løsningsveier selv etter å ha implisitt erkjent at spørsmålet manglet et gyldig svar:

Variasjoner i responsresultater for et umulig spørsmål.
Rapporten presenterer en trend hvor større modeller synes å avstå mer hyppig fra å svare på usvarbare spørsmål, med nedgang i både hallucinerte svar og fikseringsatferd:

Oppdeling av modellresponser til usvarbare matematiske problemer, som viser den relative hyppigheten av korrekte avståelsesatferd, hallucinerte svar og kognitiv fiksering over forskjellige modellskalaer.
Men denne skiftet er begrenset i skala, og lar en betydelig del av tilfellene uavklarte gjennom korrekt avståelse, noe som tyder på at økt kapasitet alene ikke pålitelig produserer mer forsiktig atferd.
Erkjenning av dødvinkel
For å teste om språkmodellene kan gjenkjenne når et spørsmål faktisk ikke har noen svar, avbrøt forskerne modellens resonneringsdel halvveis, og ba enten om et sluttsvar eller en forklaring på hvorfor spørsmålet var usvarbart.
For tilfeller hvor modellen fortsatte å resonere uendelig, stoppet de den ved ordet ‘vent’, og ba om en respons; for tilfeller hvor modellen raskt hallucinerte et svar, satte de inn en pause ved en avsnittsgrense.

Diagrammet til venstre viser hvor ofte modellene gir korrekte avståelsesatferd når de avbrytes midt i resonneringen, med høyere rater for fikseringstilfeller enn for hallucinerte svar. Diagrammet til høyre viser at de fleste modellene kan forklare hvorfor et spørsmål er usvarbart når de blir bedt om det, selv om deres sluttsvar ikke alltid reflekterer denne forståelsen.
I mange av disse tilfellene, ga modellen en korrekt avståelse eller en klar forklaring, selv om den tidligere hadde produsert et feilaktig svar. Forfatterne mener at dette indikerer at modellen ofte gjenkjenner problemet under sin resonnering, men ikke handler på denne erkjennelsen i sin sluttkonklusjon.
Tankelesing av en LLM
For å teste om språkmodellene internt sporer om et spørsmål kan besvares, trente forskerne små klassifiseringsmodeller på modellens skjulte aktiveringer under resonnering, og lot dem sjekke om forskjellen mellom svarbare og usvarbare spørsmål allerede var til stede i modellens interne signaler – selv om det ikke ble reflektert i dens sluttkonklusjon.
Bygget på ideen om at høytnivåkonsepter som sannhet eller kjønn kan lineært innlejres i modellaktiveringer, ble ‘svarbarhet’ testet for lignende representasjon.
Enkle lineære klassifiseringsmodeller (sonder) ble trent på skjulte aktiveringer over forskjellige modelllag, ved hjelp av utdata fra multi-hode oppmerksomhetsmekanismen like før den resuduelle tilkoblingen.
Hver sonde ble trent til å skille mellom svarbare og usvarbare spørsmål basert på interne aktiveringer fra resonneringsprosessen. Inndata bestod av 2 200 spørsmålpar samlet fra SUM-datasettet, med 2 000 brukt til trening og 200 til validering.
Ved inferenstid ble modellens prediksjon gjennomsnittlig over tokenene sett hittil i resonneringssekvensen, og lot sonde spore hvordan svarbarhetsrelaterte signaler oppstod over tid:

Klassifiseringsnøyaktighet av lineære sonder trent til å skille mellom svarbare og usvarbare spørsmål, målt på forskjellige punkter i resonneringsprosessen. Nøyaktigheten øker generelt når resonneringen fremover, med større modeller som når over 85% i de siste stadiene.
Som vist ovenfor, økte sonde-nøyaktigheten jevnt når resonneringen skred frem, med de fleste modellene som oversteg 80% klassifiseringsnøyaktighet ved de siste stadiene – et bevis på at selv når modellens ytre atferd ikke reflekterer det, interne representasjoner ofte bærer et klart signal som indikerer om et spørsmål kan besvares.
Stubborn Insistence
Selv om tidligere resultater tyder på at store språkmodeller ofte gjenkjenner når et spørsmål ikke kan besvares, påpeker rapporten at de likevel har en tendens til å fortsette å generere et svar i stedet for å avstå.
For å undersøke denne misaligneringen, analyserte forskerne modellens tillit til å avstå på bestemte punkter under resonneringsprosessen, og sammenlignet modelltillit over tre kategorier av utdata: korrekt avståelse; hallucinert svar; og kognitiv fiksering.
Likelydende utvalg ble brukt for hver kategori, med tillit definert som gjennomsnittlig maksimal sannsynlighet tildelt hver utdatatoken over dekodingstrinn, basert på en formel fra tidligere arbeid. Som vist i grafen under, viste både hallucinerte svar og kognitiv fiksering lavere avståelses-tillit sammenlignet med korrekt avståelse:

Tillitsnivåer assosiert med å produsere avståelsesresponsen ‘Jeg vet ikke’ over forskjellige responstyper.
Forskerne målte også hvor ofte modellene produserte en ‘Jeg vet ikke’ respons under resonneringsprosessen. Grafen under viser at korrekte avståelses-tilfeller resulterte i høyere avståelsesfrekvens, mens de to andre kategoriene produserte slike responser mindre ofte:

Frekvensen av ‘Jeg vet ikke’ responser observert ved stoppepunkter under resonnering, vist for forskjellige responstyper.
Disse funnene tyder, ifølge forfatterne, på at selv om modellene kan gjenkjenne usvarbarhet internt, mangler de ofte tillit til å handle på denne erkjennelsen, og viser en vedvarende preferanse for å fullføre oppgaven i stedet for å innrømme usikkerhet.
Tester
Bygget på disse funnene, utviklet forskerne en to-delt metode designet til å forbedre avståelse. Den første fasen, kognitiv overvåking, sporer modellens skjulte tilstander under inferens, og deler resonneringsprosessen inn i naturlige enheter som klausuler eller pauser, markert med ord som ‘vent’.
Ved slutten av hver enhet, estimerer en lettvekt, lineær sonde trent på interne signaler relatert til svarbarhet, sannsynligheten for at spørsmålet ikke kan besvares. Hvis denne sannsynligheten krysser en fast terskel, går prosessen over til den andre fasen: en inferenstid-intervensjon som styre modellen mot å avstå i stedet for å hallucinere en respons.
Når modellen viser interne tegn på at et spørsmål ikke kan besvares, avbrytes resonneringen med en intervensjon som forsterker denne erkjennelsen og øker sannsynligheten for avståelse. Som vist under, representerer intervensjonen en ‘veiledningsprompt’ som minner modellen om at spørsmålet kan mangle et gyldig svar:

En prompt for å kondisjonere inferenstid-intervensjon.
Metoden inkluderer også en tidlig avslutningsmekanisme som forhindrer at resonneringssekvensen fortsetter unødvendig, og oppmuntrer modellen til å se avståelse som et legitimt og noen ganger foretrukket valg.
For en testfase, brukte forskerne to datasett: Unanswerable Math Word Problem (UMWP), og det ovennevnte SUM.
SUMs testsett ble brukt til dette formålet, og inneholdt 284 usvarbare og 284 svarbare manuelt sjekket spørsmål. UMWP ble konstruert fra fire matematisk ordproblemdatasett: SVAMP; MultiArith; Grade School Math (GSM8K); og ASDiv.
Det fullstendige datasettet bestod av 5 200 problemer, med 600 valgt for testing, fordelt likt mellom usvarbare og svarbare spørsmål. For de usvarbare elementene i UMWP, genererte GPT-4o grunnleggende forklaringer for hvorfor de ikke kunne løses.
Mål
Modellprestasjon ble målt ved hjelp av fire mål: avståelsesrate, andelen av usvarbare spørsmål hvor modellen korrekt avstår ved å svare “Jeg vet ikke”, som instruert; grunnaksjonsnøyaktighet, prosentandelen av usvarbare spørsmål hvor modellen gir en gyldig forklaring for hvorfor spørsmålet ikke kan løses; tokenbruk, detaljer om antall token generert under resonnering; og svaraksjonsnøyaktighet, andelen av svarbare spørsmål hvor modellen produserer det korrekte sluttsvaret.
Testbaseliner
Ettersom det ikke finnes noen standardbaseliner for dette problemet, sammenlignet forskerne sin metode med to alternative, Dynasor-CoT og Dynamic Early Exit in Reasoning Models (DEER), under antagelse av at korrekt avståelse burde behandles som det riktige svaret når et spørsmål ikke har noen løsning.
Dynasor-CoT beder modellen om å produsere mellomliggende svar og stopper når samme resultat vises tre ganger på rad, mens DEER overvåker tillit på setningnivå og stopper resonneringen når en terskel nås.
En tredje baselinje, kalt Vanilla, refererer til umodifiserte modellutdata. Testene brukte de ovennevnte fem Qwen- og DeepSeek-variantene.
De samlede resultater er vist under:

Sammenligning av forskjellige metoder på svarbare og usvarbare spørsmål over store resonneringsmodeller, med de høyeste verdiene i hver kolonne vist i fet skrift. Vennligst se kilde-rapporten for bedre oppløsning.
Den nye tilnærmingen produserte de høyeste ratene av avståelse og korrekt grunnaksjon på usvarbare spørsmål. For svarbare spørsmål, forble nøyaktigheten nær den til de vanlige modellene og forbedret noen ganger, noe som tyder på at normal problemløsning ikke ble skadet.
Tokenbruk sank med 30% til 50% på usvarbare tilfeller, og sank noe på svarbare tilfeller, noe som indikerer økt effisiens.
En sammenheng ble også funnet mellom avståelsesrate og grunnaksjonsnøyaktighet, ettersom modeller som avstod mer ofte også ga bedre forklaringer, noe forfatterne tolker som en forbedring av resonneringskvalitet.
Qwen3-modellene presterte generelt bedre enn de distillasjonsbaserte (kvantiserte) versjonene, mens større modeller viste sterkere avståelsesevne, noe som indikerer at både arkitektur og skala er viktige for pålitelig usvarbarhetsdeteksjon.
Til slutt rapporterer forfatterne at deres nye metode reduserer hallucinasjoner og fiksering, og øker raten av korrekte avståelsesatferd, mens basismetoder som kun avhenger av ‘tidlige eksitter’ noen ganger kan føre til flere hallucinerte svar.
De rapporterer også gevinster i både tillit og hyppighet av “Jeg vet ikke” responser, med overvåking basert på latente signaler som viser seg å være mer effektiv enn strategier som avhenger av atferdsmessige signaler.
Konklusjon
Uevnen til å avstå fra å svare på et spørsmål hos store språkmodeller er ett av de største friksjonspunktene i brukeropplevelsen av generativ AI, ikke minst fordi andre egenskaper ved grensesnittet gir brukeren illusjonen om at AI er i stand til å gi forsiktige svar, når – i alle fall for tiden – det vanligvis ikke er tilfelle.
En bekymring om enhver direkte type intervensjon som ikke går direkte ut fra ‘karakteren’ til modellen er at den kan bli over- eller underbrukt, avhengig av om de detekterte aktiveringene faktisk er relevante for modellens erkjennelse av nederlag.
Fortsatt, er den logistiske kostnaden av lineær sonde-overvåking ikke sannsynligvis ubetydelig, og det er mulig at enklere heuristiske metoder, lignende de som gate-keeper forbudt innhold fra brukere, kan være en billigere løsning, hvis anker-utløserne noen gang kan defineres adekvat.
* Naturligvis er dette ikke i samsvar med den åpenbare synonym ‘ansvarlighet’, men definerer heller om et bestemt spørsmål kan besvares overhodet.
Først publisert onsdag, 27. august 2025












