AI-modeller och plattformar

När AI-benchmarks lär modeller att ljuga

mm
Lägg till Unite.AI bland dina föredragna källor på Google

AI-hallucination — när ett system producerar svar som låter korrekta men i själva verket är fel — förblir en av de tuffaste utmaningarna inom artificiell intelligens. Även dagens mest avancerade modeller, såsom DeepSeek-V3, Llama och OpenAI:s senaste versioner, producerar fortfarande felaktig information med hög säkerhet. Inom områden som hälsovård eller juridik kan sådana misstag leda till allvarliga konsekvenser.

Traditionellt har hallucinationer setts som en biprodukt av hur stora språkmodeller tränas: de lär sig att förutsäga nästa mest sannolika ord utan att verifiera om informationen är sann. Men ny forskning tyder på att problemet kanske inte slutar där träningsprocessen börjar. De benchmark-tester som används för att testa och jämföra AI-prestanda kan faktiskt förstärka vilseledande beteende, belöna svar som låter övertygande snarare än de som är korrekta.

Denna skiftning i perspektiv omformar problemet. Om modellerna tränas för att behaga testet snarare än att tala sanningen, då är hallucinationer inte olyckliga fel, de är inlärda strategier. För att se varför detta händer, måste vi undersöka varför AI-modeller väljer att gissa snarare än att medge sin okunskap?

Varför AI-modeller gissar

För att se varför AI-modeller ofta gissar snarare än att medge att de inte vet, överväg en student som står inför ett svårt examensfråga. Studenten har två alternativ: lämna svaret blankt och få noll poäng, eller göra ett utbildat gissning som kanske kan ge några poäng. Rent rationellt verkar gissning som det bättre valet eftersom det finns åtminstone en chans att vara rätt.

AI-modeller står inför en liknande situation under utvärdering. De flesta benchmark-tester använder ett binärt poängsystem: korrekta svar ger poäng, medan felaktiga eller osäkra svar ger ingenting. Om en modell får frågan “Vad är en forskares födelsedag?” och den verkligen inte vet, räknas det som ett misslyckande att svara “Jag vet inte”. Att hitta på ett datum däremot, bär med sig en viss chans att vara rätt — och även om det är fel, straffar systemet inte det säkra gissningen mer än tystnaden.

Denna dynamik förklarar varför hallucinationer består trots omfattande forskning för att eliminera dem. Modellerna beter sig inte illa; de följer incitamenten som är inbyggda i utvärderingen. De lär sig att låta säkra är det bästa sättet att maximera sin poäng, även när svaret är falskt. Som ett resultat, istället för att uttrycka osäkerhet, trycks modellerna att ge auktoritativa uttalanden — rätt eller fel.

Den matematiska grunden för AI-oärlighet

Forskningen visar att hallucinationer uppstår från de matematiska grunderna för hur språkmodeller lär sig. Även om en modell tränades enbart på fullständigt korrekt information, skulle dess statistiska mål fortfarande leda till fel. Det beror på att att generera rätt svar är fundamentalt svårare än att känna igen om ett svar är giltigt.

Detta hjälper till att förklara varför modeller ofta misslyckas med fakta som saknar tydliga mönster, som födelsedagar eller andra unika detaljer. Matematisk analys tyder på att hallucinationsfrekvensen i dessa fall kommer att vara minst lika hög som den fraktion av fakta som endast förekommer en gång i träningsdata. Med andra ord, ju sällsyntare informationen är i data, desto mer benägna är modellen att ha svårt att hantera den.

Problemet är inte begränsat till sällsynta fakta. Strukturella begränsningar som begränsad modellkapacitet eller arkitektonisk design producerar också systematiska fel. Till exempel, tidigare modeller med mycket korta kontextfönster misslyckades konsekvent med uppgifter som krävde långsiktig resonemang. Dessa misstag var inte slumpmässiga fel, utan förutsägbara resultat av modellens matematiska ramverk.

Varför post-träning inte löser problemet

När en AI-modell har tränats på stora textdatabaser, går den vanligtvis igenom finjustering för att göra utdata mer användbara och mindre skadliga. Men denna process möter samma kärnproblem som orsakar hallucinationer från första början; hur vi utvärderar modeller.

De vanligaste finträningmetoderna, såsom förstärkt inlärning från mänsklig feedback, förlitar sig fortfarande på benchmark-tester som använder binärt poängsättning. Dessa tester belönar modeller för att ge säkra svar medan de inte ger någon poäng när en modell medger att den inte vet. Som ett resultat kan ett system som alltid svarar med säkerhet, även när det är fel, prestera bättre än ett som ärligt uttrycker osäkerhet.

Forskare kallar detta problemet för att bestraffa osäkerhet. Även avancerade tekniker för att upptäcka eller minska hallucinationer kämpar när de underliggande benchmark-testerna fortsätter att föredra överdriven säkerhet. Med andra ord, oavsett hur sofistikerade lösningarna är, så länge utvärderingssystemen belönar säkra gissningar, kommer modellerna att vara benägna att ge fel men säkra svar istället för ärliga medgivanden av tvivel.

Illusionen av framsteg

Leaderboards, som är vida spridda i AI-samhället, förstärker detta problem. Benchmark-tester som MMLU, GPQA och SWE-bench dominerar forskningsartiklar och produktmeddelanden. Företag betonar sina poäng för att visa snabb framsteg. Ändå, som rapporten noterar, uppmuntrar dessa benchmark-tester hallucinationer.

En modell som ärligt säger “Jag vet inte” kan vara säkrare i verkliga situationer, men kommer att rankas lägre på leaderboarden. I kontrast, en modell som fabricerar övertygande men falska svar kommer att prestera bättre. När antagande, finansiering och prestige beror på leaderboard-rankningar, blir riktningen för framsteg snedvriden. Allmänheten ser en berättelse om konstant förbättring, men under ytan är modellerna tränade för att bedra.

Varför ärlig osäkerhet är viktig i AI

Hallucinationer är inte bara en forskningsutmaning; de har verkliga konsekvenser. Inom hälsovård, kan en modell som fabricerar läkemedelsinteraktioner vilseleda läkare. Inom utbildning, kan en modell som uppfinner historiska fakta vilseleda studenter. Inom journalistik, kan en chatbot som producerar falska men övertygande citat sprida desinformation. Dessa risker är redan synliga. Stanford AI Index 2025 rapporterade att benchmark-tester som är utformade för att mäta hallucinationer “har kämpat för att få fäste”, även när AI-användning accelererar. Samtidigt, de benchmark-tester som dominerar leaderboard och som belönar säkra men opålitliga svar, fortsätter att sätta riktningen för framsteg.

Dessa fynd betonar både en utmaning och en möjlighet. Genom att undersöka de matematiska rötterna till hallucination, har forskare identifierat tydliga riktningar för att bygga mer tillförlitliga AI-system. Nyckeln är att sluta se osäkerhet som en brist och istället erkänna den som en väsentlig förmåga som bör mätas och belönas.

Denna skiftning i perspektiv har implikationer bortom att minska hallucinationer. AI-system som kan korrekt bedöma och kommunicera sina egna kunskapsbegränsningar skulle vara mer lämpliga för högriskapplikationer där överdriven säkerhet medför allvarliga risker. Medicinsk diagnos, juridisk analys och vetenskaplig forskning kräver alla förmågan att skilja mellan säker kunskap och informerad spekulation.

Omprövning av utvärdering för ärlig AI

Dessa fynd betonar att byggandet av mer tillförlitlig AI kräver en omprövning av hur vi mäter AI-förmåga. Istället för att förlita sig på enkel rätt eller fel-poängsättning, bör utvärderingsramar belöna modeller för att uttrycka osäkerhet på lämpligt sätt. Detta innebär att ge tydliga riktlinjer om förtroendetrösklar och motsvarande poängsystem inom benchmark-instruktioner.

En lovande approach innebär att skapa explicita förtroendemål som specificerar när modeller bör svara och när de bör avstå. Till exempel, instruktioner kan ange att svar endast bör ges när förtroendet överstiger en viss tröskel, med poängsättning justerad därefter. I detta upplägg, är osäkerhet inte längre en svaghet, utan en värdefull del av ansvarsfullt beteende.

Nyckeln är att göra förtroendekrav transparenta snarare än implicita. Nuvarande benchmark-tester skapar dolda straff för osäkerhet som modeller lär sig att undvika. Explicita förtroendemål skulle möjliggöra för modeller att optimera för det faktiskt önskade beteendet: korrekta svar när de är säkra, och ärliga medgivanden av osäkerhet när kunskap saknas.

Slutsatsen

AI-hallucinationer är inte slumpmässiga fel — de förstärks av de benchmark-tester som används för att mäta framsteg. Genom att belöna säkra gissningar snarare än ärlig osäkerhet, trycker nuvarande utvärderingssystem modellerna mot bedrägeri snarare än tillförlitlighet. Om vi vill ha AI som kan lita på i högriskdomäner som hälsovård, juridik och vetenskap, måste vi ompröva hur vi testar och belönar dem. Framsteg bör mätas inte bara av korrekthet, utan av förmågan att känna igen och medge vad modellen inte vet.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.