Andersons vinkel

Varför kan inte AI bara medge att de inte vet svaret?

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Flux1.D Pro, Flux Kontext Pro, Firefly V3.

Stora språkmodeller ger ofta självsäkra svar även när frågan inte kan besvaras. Ny forskning visar att dessa modeller ofta internt känner till problemet, men ändå går vidare och hittar på något, vilket avslöjar en dold klyfta mellan vad de vet och vad de säger.

 

Den som har tillbringat en rimlig tid med en ledande stor språkmodell som ChatGPT eller Qwen-serien har upplevt tillfällen då modellen ger ett felaktigt svar (som kan ha haft katastrofala lokala konsekvenser, beroende på hur mycket man litade på det) – och när felet blev tydligt, gav den bara en ursäkt.

Varför ledande LLM har så svårt att medge att de inte vet svaret på en fråga är ett litet men växande forskningsområde. Ett ‘självsäkert felaktigt’ svar kan vara särskilt skadligt från ett högt censurerat och filterbaserat API-gränssnitt som ChatGPT, eftersom sådana modeller aggressivt blockerar NSFW eller andra “regelbrytande” in- eller utdata.

Detta kan ge användaren en falsk uppfattning om att modellen är beslutsam och kardinal, när det i själva verket är ett traditionellt heuristiskt eller filterbaserat filter som är utformat för att begränsa värdbolagets juridiska exponering till varje pris, snarare än någon insikt från AI.

Från juni 2025 'AbstentionBench' -artikeln från FAIR på Meta – till vänster, figuren lyfter fram omfattningen av feltyper som fångas i AbstentionBench, som testar modellbeteende på över 35 000 osvarbara frågor; i mitten, ett exempel visar hur modellerna ofta svarar med fabricerade svar istället för att medge att de saknar tillräcklig information; och till höger, minskar avståndet när modellerna justeras för resonemang snarare än instruktionsföljande. Källa: https://arxiv.org/pdf/2506.09038

Från juni 2025 ‘AbstentionBench’ -artikeln från FAIR på Meta – till vänster, figuren lyfter fram omfattningen av feltyper som fångas i AbstentionBench, som testar modellbeteende på över 35 000 osvarbara frågor; i mitten, ett exempel visar hur modellerna ofta svarar med fabricerade svar istället för att medge att de saknar tillräcklig information; och till höger, minskar avståndet när modellerna justeras för resonemang snarare än instruktionsföljande. Källa: https://arxiv.org/pdf/2506.09038

En ny artikel från Kina hävdar att LLM-modeller faktiskt internt känner till att de inte kan besvara en fråga som ställs av användaren, men att de ändå tvingas producera någon form av svar, oftast, istället för att ha tillräckligt med förtroende för att bestämma att ett giltigt svar inte är tillgängligt på grund av brist på information från användaren eller begränsningar i modellen eller av andra skäl.

Artikeln hävdar:

‘[Vi] visar att [LLM] besitter tillräckliga kognitiva förmågor för att känna till bristerna i dessa frågor. Men de misslyckas med att visa lämpligt avståndsbeteende, vilket avslöjar en missanpassning mellan deras interna kognition och yttre respons.’

Forskarna har utvecklat en lätt tvåstegsmetod som använder kognitiv övervakning/probing för att skanna LLM-modellens interna process för tecken på att den inser att den inte kan tillhandahålla ett svar; och sedan ingriper, för att säkerställa att modellens “hjälpsamma” natur inte förvärrar användarens problem genom att föra dem ned på en blind eller till och med destruktiv väg.

Studien använder medvetet underspecificerade matematiska frågor för att testa om modellerna kan känna till när ett svar är outrett; men denna inställning riskerar att ramla in i en “fälla”. I verkligheten står modellerna inför långt vanligare skäl att avstå i samtal, från tvetydiga formuleringar till kunskapsluckor.

Den nya artikeln heter Att svara på det osvarbara är att felaktigt veta: Analys och mildring av avståndsfel i stora resonemodeller, och kommer från fyra forskare över Statens nyckellaboratorium för ny programvaruteknik och Nationella institutet för hälso- och sjukvårdsdata vid Nanjing universitet.

Metod

(Eftersom det inte finns några lämpliga rivaler att jämföra med författarnas tillvägagångssätt i tester, och eftersom artikeln därför följer en något ovanlig format, samt inte indexerar sina citat till den vanliga standarden, kommer vi att försöka följa den så mycket som möjligt.)

I linje med tidigare tillvägagångssätt, fokuserade författarna på att presentera LLM-modeller med osvarbara matematiska frågor från Synthetic Unanswerable Math (SUM) dataset, utvärderande fem modellfamiljer:  Från DeepSeek -serien, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; och, från Qwen -serien, Qwen3-8B, samt Qwen3-14B.

De osvarbara problemen i SUM skapades genom att ta bort eller korrupta viktiga element på fem sätt: radera viktig information; införa tvetydighet; påtvinga orealistiska villkor; hänvisa till orelaterade föremål; eller ta bort frågan helt.

Sedan valdes ett urval av 1 000 sådana fall för analys, med GPT-4o som användes för att generera koncisa förklaringar som skulle fungera som grundläggande rationella förklaringar.

Modellernas svar på osvarbara frågor utvärderades med hjälp av standardiserade frågor med en 10 000-teckenbudget, under vilken tre huvudsakliga beteendemönster observerades: i det första, identifierade modellen frågan som olösbar och avstod – vanligtvis genom att svara med ett uttryck för osäkerhet; i det andra, producerade den ett fullständigt svar genom att uppfinna saknad information, såsom att införa en icke-existerande $9,99 hanteringsavgift för att motivera ett slutresultat (se bild nedan); I det tredje, som kallas kognitiv fixering, fastnade modellen i en utdragen resonemangsloop, fortsatte med ogiltiga lösningar även efter att implicit erkänt att frågan saknade ett giltigt svar:

Varierande svarsresultat på en omöjlig fråga.

Varierande svarsresultat på en omöjlig fråga.

Artikeln presenterar en trend där större modeller tenderar att avstå mer frekvent från att svara på osvarbara frågor, med minskningar i både hallucinerade svar och fixeringsbeteenden:

Genomgång av modellernas svar på osvarbara matematiska problem, som visar den relativa frekvensen av korrekta avstånd, hallucinerade svar och kognitiv fixering över olika modellskalor.

Genomgång av modellernas svar på osvarbara matematiska problem, som visar den relativa frekvensen av korrekta avstånd, hallucinerade svar och kognitiv fixering över olika modellskalor.

Men denna förändring är begränsad i omfattning och lämnar en betydande andel fall olösta genom korrekt avstånd, vilket tyder på att ökad kapacitet ensam inte tillförlitligt producerar mer försiktig beteende.

Medvetenhet om dödläge

För att testa om språkmodeller kan avgöra när en fråga faktiskt inte har något svar, avbröt forskarna modellens resonemangsdel halvvägs och frågade antingen om ett slutgiltigt svar eller en förklaring till varför frågan var osvarbar.

För fall där modellen fortsatte resonera ändlöst, pausade de den vid ordet “vänta” och begärde ett svar; för fall där modellen snabbt hallucinerade ett svar, införde de en paus vid en styckegräns.

Diagrammet till vänster visar hur ofta modellerna ger korrekta avstånd när de avbryts under resonemang, med högre frekvenser för fixeringsfall än för hallucinerade svar. Diagrammet till höger visar att de flesta modeller kan förklara varför en fråga är osvarbar när de tillfrågas, även om deras slutgiltiga svar inte återspeglar den förståelsen.

Diagrammet till vänster visar hur ofta modellerna ger korrekta avstånd när de avbryts under resonemang, med högre frekvenser för fixeringsfall än för hallucinerade svar. Diagrammet till höger visar att de flesta modeller kan förklara varför en fråga är osvarbar när de tillfrågas, även om deras slutgiltiga svar inte återspeglar den förståelsen.

I många av dessa fall gav modellen ett korrekt avstånd eller en tydlig förklaring, även om den tidigare producerat ett felaktigt svar. Författarna menar att detta tyder på att modellen ofta känner till problemet under sitt resonemang, men misslyckas med att agera på den medvetenheten i sin slutliga utdata.

Att läsa en LLM

För att testa om språkmodeller internt spårar om en fråga kan besvaras, tränade forskarna små klassificerare på modellernas dolda aktiveringar under resonemang, vilket gjorde det möjligt för dem att kontrollera om skillnaden mellan svarbara och osvarbara frågor redan fanns i modellens interna signaler – även om det inte återspeglades i dess slutliga utdata.

Genom att bygga på idén att högnivåbegrepp som sanning eller kön kan linjärt bäddas in i modellaktiveringar, testades “svarbarhet” för en liknande representation.

Enkla linjära klassificerare (sonder) tränades på dolda aktiveringar över olika modelllager, med utdata från multi-huvuduppmärksamhetsmekanismen strax före den residuala anslutningen.

Varje sonder tränades för att skilja mellan svarbara och osvarbara frågor, baserat på interna aktiveringar från resonemangsprocessen. Inmatningen bestod av 2 200 frågepar som sampats från SUM-datasetet, med 2 000 använda för träning och 200 för validering.

Vid inferenstid genomsnittliggjordes modellens förutsägelse över de token som setts hittills i resonemangssekvensen, vilket gjorde det möjligt för sonder att spåra hur svarbarhetsrelaterade signaler uppstod över tid:

Klassificeringsnoggrannhet för linjära sonder som tränats för att skilja mellan svarbara och osvarbara frågor, mätt vid olika punkter i resonemangsprocessen. Noggrannheten förbättras vanligtvis allteftersom resonemangen fortskrider, med större modeller som når över 85% i de slutliga stadierna.

Klassificeringsnoggrannhet för linjära sonder som tränats för att skilja mellan svarbara och osvarbara frågor, mätt vid olika punkter i resonemangsprocessen. Noggrannheten förbättras vanligtvis allteftersom resonemangen fortskrider, med större modeller som når över 85% i de slutliga stadierna.

Som visas ovan förbättrades sonderns noggrannhet stadigt allteftersom resonemangen fortskred, med de flesta modeller som översteg 80% klassificeringsnoggrannhet i de sista stegen – ett bevis för att även när modellens yttre beteende inte återspeglar det, internt representerar signaler ofta en tydlig signal som anger om en fråga kan besvaras.

Envist Insisterande

Även om tidigare resultat tyder på att stora språkmodeller ofta känner till när en fråga inte kan besvaras, noterar artikeln att de fortfarande tenderar att fortsätta generera ett svar istället för att avstå.

För att undersöka denna missanpassning analyserade forskarna modellernas förtroende för att avstå vid specifika punkter under resonemangsprocessen, jämförande modellförtroendet över tre kategorier av utdata: korrekt avstånd; hallucinerat svar; och kognitiv fixering.

Ekvivalenta prover användes för varje kategori, med förtroende definierat som den genomsnittliga maximala sannolikheten som tilldelats varje utdatatoken över avkodningssteg, baserat på en formel från tidigare arbete. Som visas i grafen nedan, visade både hallucinerade svar och kognitiva fixeringar lägre avståndsförtroende jämfört med korrekt avstånd:

Förtroendenivåer förknippade med att producera avståndssvaret 'Jag vet inte' över olika svarstyper.

Förtroendenivåer förknippade med att producera avståndssvaret ‘Jag vet inte’ över olika svarstyper.

Forskarna mätte också hur ofta modellerna producerade ett “Jag vet inte” -svar under resonemangsprocessen. Grafen nedan visar att korrekta avståndsfall resulterade i högre avståndsfrekvens, medan de andra två kategorierna producerade sådana svar mindre ofta:

Frekvensen av 'Jag vet inte' -svar som observerades vid stopppunkter under resonemang, visade för olika svarstyper.

Frekvensen av ‘Jag vet inte’ -svar som observerades vid stopppunkter under resonemang, visade för olika svarstyper.

Dessa fynd tyder, enligt författarna, på att även om modellerna internt kan upptäcka osvarbarhet, saknar de ofta förtroendet att agera på den medvetenheten, vilket tyder på en bestående preferens för att slutföra uppgiften snarare än att medge osäkerhet.

Tester

Genom att bygga på dessa fynd, utvecklade forskarna en tvådelad metod som syftar till att förbättra avstånd. Den första fasen, kognitiv övervakning, spårar modellens dolda tillstånd under inferens, segmenterar dess resonemangsprocess i naturliga enheter som klausuler eller pauser, markerade med ord som “vänta”.

Vid slutet av varje segment, uppskattar en lätt, linjär sonder som tränats på interna signaler relaterade till svarbarhet, sannolikheten för att frågan inte kan besvaras. Om denna sannolikhet överskrider en inställd tröskel, går processen vidare till den andra fasen: en inferenstidsintervention som styr modellen mot att avstå, snarare än att hallucinera ett svar.

När modellen visar interna tecken på att en fråga inte kan besvaras, avbryts resonemangen med en intervention som förstärker denna medvetenhet och ökar sannolikheten för avstånd. Som visas nedan, representerar interventionen en “vägledningsprompt” som påminner modellen om att frågan kan sakna ett giltigt svar:

En prompt för att konditionera inferenstidsintervention.

En prompt för att konditionera inferenstidsintervention.

Metoden inkluderar också en tidig avslutningsmekanism som förhindrar att resonemangssekvensen fortsätter onödigt, vilket uppmuntrar modellen att se avstånd som ett legitimt och ibland föredraget val.

För en testfas, använde forskarna två dataset: Unanswerable Math Word Problem (UMWP), och det ovannämnda SUM.

SUM:s testuppsättning användes för detta ändamål, innehållande 284 osvarbara och 284 svarbara manuellt kontrollerade frågor.  UMWP konstruerades från fyra matematiska ordproblemkällor: SVAMP; MultiArith; Grade School Math (GSM8K); och ASDiv.

Hela datasetet bestod av 5 200 problem, med 600 sampade för testning, uppdelade lika mellan osvarbara och svarbara frågor. För de osvarbara objekten i UMWP genererade GPT-4o de grundläggande förklaringarna till varför de inte kunde lösas.

Mätetal

Modellprestationen mättes med hjälp av fyra mätetal: avståndsfrekvens,  andelen osvarbara frågor där modellen korrekt avstår genom att svara “Jag vet inte”, som instruerat; skäl noggrannhet, procentandelen osvarbara frågor där modellen ger en giltig förklaring till varför frågan inte kan lösas; tokenanvändning, detaljer om antalet token som genereras under resonemang; och svarsnoggrannhet, andelen svarbara frågor där modellen producerar det korrekta slutliga svaret.

Testbaslinjer

Eftersom det inte finns några standardbaslinjer för detta problem, jämförde forskarna sin metod mot två alternativ, Dynasor-CoT och Dynamic Early Exit in Reasoning Models (DEER), under antagandet att korrekt avstånd borde behandlas som det rätta svaret när en fråga saknar lösning.

Dynasor-CoT uppmanar modeller att producera mellanliggande svar och stoppar när samma resultat visas tre gånger i följd, medan DEER övervakar förtroende på meningsnivå och stoppar resonemangen när en tröskel nås.

En tredje baslinje, kallad Vanilla, hänvisar till omodifierade modellutdata. Testerna använde de ovannämnda fem Qwen- och DeepSeek-varianterna.

De sammanfogade resultaten visas nedan:

Jämförelse av olika metoder på svarbara och osvarbara frågor över stora resonemodeller, med de högsta värdena i varje kolumn visas i fetstil.

Jämförelse av olika metoder på svarbara och osvarbara frågor över stora resonemodeller, med de högsta värdena i varje kolumn visas i fetstil. Se källartikeln för bättre upplösning.

Den nya metoden producerade de högsta frekvenserna av avstånd och korrekt resonemang på osvarbara frågor.  För svarbara frågor förblev noggrannheten nära den som uppnåddes av vanilla-modellerna och förbättrades ibland, vilket tyder på att normal problemlösning inte skadades.

Tokenanvändningen minskade med 30% till 50% på osvarbara fall och minskade något på svarbara, vilket tyder på ökad effektivitet.

En länk observerades också mellan avståndsfrekvens och skälnoggrannhet, eftersom modeller som avstod oftare också gav bättre förklaringar, vilket författarna tolkar som en förbättring av resonemangskvalitet.

Qwen3-modellerna presterade generellt bättre än de distillerade (kvantiserade) versionerna, medan större modeller visade starkare avståndsförmåga, vilket tyder på att både arkitektur och skala spelar roll för tillförlitlig osvarbarhetsdetektering.

Slutligen rapporterar författarna att deras nya metod minskar hallucinationer och fixering samtidigt som den ökar frekvensen av korrekta avstånd, medan baslinjeapprocher som enbart förlitar sig på ‘tidiga avslut’ ibland leder till fler hallucinerade svar.

De rapporterar också vinster i både förtroende och frekvens för “Jag vet inte” -svar, med övervakning baserad på latenta signaler som visar sig vara mer effektivt än strategier som förlitar sig på beteendekännetecken.

Slutsats

Oförmågan hos stora språkmodeller att avstå från att svara på en fråga när det är nödvändigt är en av de största friktionspunkterna i den generativa AI-användarupplevelsen, inte minst för att andra egenskaper hos gränssnittet ger användaren illusionen att AI är kapabel till försiktiga svar, när – åtminstone just nu – det vanligtvis inte är fallet.

En oroande fråga om varje direkt form av intervention som inte följer direkt från “karaktären” hos modellen är att den kan vara över- eller underanvänd, beroende på om de upptäckta aktiveringarna faktiskt är relevanta för att modellen ska medge nederlag.

Ytterligare, den logistiska kostnaden för linjär sonderövervakning är inte troligen obetydlig, och det är möjligt att enklare heuristiska metoder, liknande de som skyddar användare från förbjudet innehåll, kan vara en billigare lösning, om ankartigger kan definieras tillräckligt bra.

 

* Naturligtvis överensstämmer detta inte med den uppenbara synonymen ‘ansvar’, utan definierar snarare om en specifik fråga kan besvaras eller inte.

Publicerad första gången onsdag, 27 augusti 2025

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai