Andersons vinkel

En ‘Zen’-metode til at forhindre sprogmodeller i at hallucinere

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
AI-generated image: A robot sits in front of a laptop and a 'Eureka!' light-bulb lights up over its head. Z-Image, Qwen Edit (509), and Firefly V3

At bede ChatGPT om at faktatjekke et tilfÃĶldigt svar, fÃļr det lÃļser et virkeligt problem, fÃĨr det til at tÃĶnke hÃĨrdere og fÃĨ svaret rigtigt mere ofte – selv hvis det tidligere ’tilfÃĶldige’ svar ikke har noget at gÃļre med din virkelige forespÃļrgsel.

 

En interessant ny artikel fra Kina har udviklet en meget lavkostmetode til at forhindre sprogmodeller som ChatGPT i at hallucinere, og til at forbedre kvaliteten af svarene: FÃĨ modellen til at faktatjekke svaret pÃĨ et fuldstÃĶndig urelateret spÃļrgsmÃĨl fÃļrst:

Et eksempel pÃĨ et urelateret spÃļrgsmÃĨl, der kan 'frigÃļre' en LLMs sind og hjÃĶlpe den til at fokusere pÃĨ et (virkeligt) efterfÃļlgende spÃļrgsmÃĨl. Kilde: https://arxiv.org/pdf/2511.21734

Et eksempel pÃĨ et urelateret spÃļrgsmÃĨl, der kan ‘frigÃļre’ en LLMs sind og hjÃĶlpe den til at fokusere pÃĨ et (virkeligt) efterfÃļlgende spÃļrgsmÃĨl. Kilde

Dette Zen-slap er en utrolig billig mÃĨde at forbedre performance pÃĨ, sammenlignet med andre mere involverede metoder, sÃĨsom fine-tuning, prompt-crafting og parallel sampling, og det virker pÃĨ bÃĨde ÃĨbne og lukkede kilde-modeller, hvilket indikerer, at der er opdaget en fundamental karakteregenskab, der er fÃĶlles for multiple LLM-arkitekturer (i stedet for en skrÃļbelig ejendommelighed, der er specifik for bestemte trÃĶningsmaterialer eller metoder).

Forfatterne beskriver de Ãļkonomiske skalafordele, der er mulige ved at forbedre output pÃĨ denne spartanske mÃĨde*:

‘For at implementere med minimal ekstra forudgÃĨende viden, behÃļver VF kun at give et tilfÃĶldigt eller trivialt svar i prompten. Verifikationsprocessen viser sig at have langt fÃĶrre output-tokens end en almindelig CoT-prompt, [nogle gange] endda ingen eksplisit verifikationsproces, og derfor [krÃĶver] meget [lille] ekstra test-tid-komputation.’

I tests var denne metode – kaldet Verification-First (VF) – i stand til at forbedre svarene i en diversitet af opgaver, herunder matematisk resonnering, pÃĨ bÃĨde ÃĨbne og kommercielle platforme.

En del af ÃĨrsagen til, at denne teknik virker, kan vÃĶre grundet i den mÃĨde, hvorpÃĨ sprogmodeller suger op og tilegner sig tendenser i menneskers psykologi, sÃĨ en direkte spÃļrgsmÃĨl kan fÃĨ modellen til at vÃĶre ‘forsvarlig’ og ‘nervÃļs’, hvorimod en anmodning om at verificere et andet svar ikke engager disse ‘overlevelsesinstinkter’.

Kerneargumentet er, at verifikation af et svar krÃĶver mindre indsats end at generere et fra scratch, og kan udlÃļse en anden resonansvej, der supplerer standard chain-of-thought.

At bede modellen om at kritiserer et givet svar (dvs. et svar, som modellen ikke har vÃĶret involveret i at skabe) kan ogsÃĨ aktivere en form for kritisk tÃĶnkning, der hjÃĶlper med at undgÃĨ overtiltro til modellens egne fÃļrste indtryk.

Arbejdet karakteriserer processen i forhold til en reverse-reasoning path:

Startende fra et foreslÃĨet svar og resonnerende baglÃĶns mod spÃļrgsmÃĨlet kan afslÃļre genveje eller indsigt, der er svÃĶrere at finde, nÃĨr man resonnerer fremad fra problemet alene. Denne 'omvendte vej' kan fÃļlge en enklere bane og tilbyde supplerende information til standard chain-of-thought-resonnering.

Startende fra et foreslÃĨet svar og resonnerende baglÃĶns mod spÃļrgsmÃĨlet kan afslÃļre genveje eller indsigt, der er svÃĶrere at finde, nÃĨr man resonnerer fremad fra problemet alene. Denne ‘omvendte vej’ kan fÃļlge en enklere bane og tilbyde supplerende information til standard chain-of-thought-resonnering.

Forskerne har ogsÃĨ konkreteret den centrale idÃĐ til Iter-VF, en sekventiel tid-test-skaleringsmetode, der iterativt forbedrer svarene og undgÃĨr fejlakkumulationsproblemet, der er almindeligt i selvkorrektionsstrategier i LLM-arkitekturer.

Den nye artikel har titlen At bede LLM’er om at verificere fÃļrst er nÃĶsten en gratis lunch og kommer fra to forskere ved Elektronisk IngeniÃļr-afdelingen pÃĨ Tsinghua Universitet i Beijing.

Metode

Den centrale idÃĐ bag den nye artikel er at omdrejne den sÃĶdvanlige resonansflow i sprogmodeller. I stedet for at bede modellen om at lÃļse et problem fra scratch, gives den fÃļrst et kandidat-svar (ofte forkert eller arbitrÃĶrt) og bedes om at kontrollere, om dette svar giver mening.

Dette fÃĨr modellen til at resonere i omvendt, arbejdende baglÃĶns fra det foreslÃĨede svar mod spÃļrgsmÃĨlet. NÃĨr verifikationen er fuldfÃļrt, gÃĨr modellen derefter videre med at lÃļse det oprindelige problem som sÃĶdvanligt.

Dette omdrejningspunkt, som artiklen fastslÃĨr, reducerer uforsvarlige fejl og opmuntrer til en mere reflekterende mÃĨde at resonere pÃĨ, hvilket hjÃĶlper LLM’en med at afslÃļre skjulte strukturer og undgÃĨ misvisende antagelser.

Som vist i eksemplerne nedenfor kan selv at bede modellen om at verificere et ÃĨbenbart forkert gÃĶt som ’10’ hjÃĶlpe den med at genoprette fejl og overgÃĨ standard chain-of-thought-prompting:

At bede modellen om at verificere et gÃĶt fÃļrst hjÃĶlper den med at spotte inkonsistenser og engagere sig mere omhyggeligt med problemet. I dette eksempel fÃļrer den standardmÃĶssige tilgang til en flydende, men forkert lÃļsning, mens Verification-First-prompten udlÃļser en klarere logisk struktur og det korrekte resultat.

At bede modellen om at verificere et gÃĶt fÃļrst hjÃĶlper den med at spotte inkonsistenser og engagere sig mere omhyggeligt med problemet. I dette eksempel fÃļrer den standardmÃĶssige tilgang til en flydende, men forkert lÃļsning, mens Verification-First-prompten udlÃļser en klarere logisk struktur og det korrekte resultat.

I forhold til mange virkelige problemer er det ikke let at give et gÃĶt, som modellen kan kontrollere, isÃĶr nÃĨr opgaven er ÃĨben, sÃĨsom skrivning af kode eller kald til en API. Derfor tilpasser metoden sig bedre, ved fÃļrst at give sit bedste svar som sÃĶdvanligt og derefter at fÃļde dette svar tilbage i Verification-First-formatet. PÃĨ denne mÃĨde kontrollerer modellen og forbedrer sit eget output:

NÃĨr modellen bedes om at verificere sit eget tidligere output, fanger den fejlen i sin logik og skriver lÃļsningen korrekt. Verification-First-prompten hjÃĶlper den med at fokusere pÃĨ den specifikke fejl og ikke gentage den samme fejl.

NÃĨr modellen bedes om at verificere sit eget tidligere output, fanger den fejlen i sin logik og skriver lÃļsningen korrekt. Verification-First-prompten hjÃĶlper den med at fokusere pÃĨ den specifikke fejl og ikke gentage den samme fejl.

Denne tilgang udgÃļr den ovennÃĶvnte Iter-VF. Modellen gentager denne cyklus, forbedrer sit svar hver gang, uden behov for genoptrÃĶning eller specialudstyr. I modsÃĶtning til andre selvkorrektionsstrategier, der kan akkumulere kontekst over iterationer, betragter Iter-VF kun det seneste svar pÃĨ hver gang, hvilket hjÃĶlper med at holde dens resonans klar.

Data og tests

Forfatterne evaluerer metoden i fire domÃĶner: generelle resonansopgaver, hvor VF seedes med et trivialt gÃĶt; tidskritiske opgaver, hvor Iter-VF sammenlignes med rivaliserende skaleringsmetoder; ÃĨbne problemer sÃĨsom kodning og API-kald, hvor VF bruger modellens eget tidligere svar; og lukkede kommercielle LLM’er, hvor interne resonansskridt er utilgÃĶngelige.

Til at teste metoden brugte forskerne tre resonans-benchmarks: GSM8K og MATH500 til matematisk resonnering; og GPQA-Diamond til videnskabs-spÃļrgsmÃĨl pÃĨ doktor-niveau.

PÃĨ hver af disse benchmarks blev modellen givet enten et trivialt gÃĶt, sÃĨsom ‘1’ for numeriske svar; eller et tilfÃĶldigt-shufflet multiple-choice-tilbud, som startpunkt for verifikation. Der blev ikke tilfÃļjet nogen sÃĶrlig tilpasning eller forudgÃĨende viden, og grundlinjen for sammenligning var standard zero-shot chain-of-thought-prompting.

Testene blev udfÃļrt pÃĨ en fuld rÃĶkke af Qwen2.5 og Llama3 instruktions-tilpassede modeller, fra 1B til 72B (parametre) i stÃļrrelse. Qwen-modellerne, der blev brugt, var Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct og Qwen2.5-72B-Instruct. Llama3-varianten var Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct og Llama3.3-70B-Instruct.

Som vist nedenfor, holdt forbedringen fra Verification-First-prompting fast pÃĨ tvÃĶrs af modellernes stÃļrrelse, med klare gevinster synlige selv pÃĨ 1B parametre og fortsÃĶttende op til 72B:

PÃĨ tvÃĶrs af alle modellernes stÃļrrelse i Qwen2.5- og Llama3-familierne, overgik Verification-First-prompting konsekvent standard chain-of-thought-prompting pÃĨ GSM8K, MATH500 og GPQA-Diamond.

PÃĨ tvÃĶrs af alle modellernes stÃļrrelse i Qwen2.5- og Llama3-familierne, overgik Verification-First-prompting konsekvent standard chain-of-thought-prompting pÃĨ GSM8K, MATH500 og GPQA-Diamond.

Effekten var stÃĶrkest pÃĨ beregnings-intensivt matematisk benchmark, sÃĨsom GSM8K og MATH500, hvor verifikation af et forkert svar udlÃļste bedre resonans end at forsÃļge at lÃļse fra scratch. PÃĨ GPQA-Diamond, som afhÃĶnger mere af lagret viden end deduktiv struktur, var fordelene mindre, men konsekvente.

Den komputationelle omkostning af Verification-First var beskeden: I tabellen nedenfor kan vi se, at generering af en verifikations-trin tilfÃļjede omkring 20-50% flere output-tokens i forhold til standard chain-of-thought-prompting:

Gennemsnittet af output-tokens genereret under hver prompt-metode pÃĨ tvÃĶrs af GSM8K-, MATH500- og GPQA-benchmarks.

Gennemsnittet af output-tokens genereret under hver prompt-metode pÃĨ tvÃĶrs af GSM8K-, MATH500- og GPQA-benchmarks.

Trods dette, forblev den ekstra omkostning langt under den, der krÃĶves af strategier, der krÃĶver multiple sampled-completions eller rekursiv planlÃĶgning.

I grafen nedenfor kan vi se, hvor fÃļlsom metoden er over for kvaliteten af det gÃĶttede svar. Overraskende nok, selv nÃĨr gÃĶttet er trivialt (‘1’), urimeligt (‘2025’) eller et tilfÃĶldigt multiple-choice-tilbud, overgÃĨr Verification-First-prompting standard-prompting:

NÃļjagtighedsforbedringer fra Verification-First-prompting, nÃĨr modellen gives et trivialt, urimeligt eller korrekt svar at verificere pÃĨ tvÃĶrs af GSM8K, MATH500 og GPQA.

NÃļjagtighedsforbedringer fra Verification-First-prompting, nÃĨr modellen gives et trivialt, urimeligt eller korrekt svar at verificere pÃĨ tvÃĶrs af GSM8K, MATH500 og GPQA.

Som forventet, stiger nÃļjagtigheden yderligere, nÃĨr gÃĶttet er det korrekte svar; men metoden virkede godt uanset, hvilket tyder pÃĨ, at forbedringerne ikke blev drevet af informationen i det gÃĶttede svar selv, men simpelthen af handling af verifikation.

Iter-VF blev ogsÃĨ sammenlignet med fire test-tid-skaleringsstrategier, der opererer uden genoptrÃĶning eller opgave-specifik tilpasning. I Selvkorrektion blev modellen bedt om at revidere sine svar ved at reflektere over tidligere resonansskridt; i PHP blev tidligere svar fÃļjet til input som kontekstuelle hints, selv om der ikke blev givet nogen instruktioner om, hvordan de skulle bruges.

Desuden blev i Selvkonsekvens multiple resonansveje sampled og det endelige svar valgt ved flertalsafstemning; og endelig i Bedst-af-N blev flere outputs genereret uafhÃĶngigt og vurderet ved hjÃĶlp af en verifikationsprompt, hvor det hÃļjest vurderede svar blev valgt.

To varianter af Iter-VF blev implementeret: en, der blev initialiseret med et trivialt gÃĶt (‘1’); og en anden, der blev seedet med et standard CoT-output:

NÃļjagtighed og token-effektivitet pÃĨ MATH500 under Ãļgende output-budgetter, viser, at begge varianter af Iter-VF overgÃĨr alle baseline-metoder pÃĨ tvÃĶrs af modellernes stÃļrrelse.

NÃļjagtighed og token-effektivitet pÃĨ MATH500 under Ãļgende output-budgetter, viser, at begge varianter af Iter-VF overgÃĨr alle baseline-metoder pÃĨ tvÃĶrs af modellernes stÃļrrelse.

Iter-VF gav bedre resultater end alle andre metoder, nÃĨr den tilgÃĶngelige beregningskapacitet var lav, hvilket forfatterne tilskrev den mÃĨde, hvorpÃĨ den kontrollerer svarene, og ikke hvor godt de fÃļrste svar var (da bÃĨde VF- og CoT-varianten hurtigt nÃĨede tilsvarende nÃļjagtighed).

PHP fungerede dÃĨrligere, selv om den genbrugte tidligere svar som hints, sandsynligvis fordi LLM’er ikke udnyttede disse hints godt.

I modsÃĶtning til PHP og Selvkorrektion, der akkumulerer kontekst over iterationer, betragter Iter-VF kun det seneste svar pÃĨ hver gang. Dette Markovske tilgang undgÃĨr den akkumulerede forvirring af udvidede resonans-kÃĶder – en svaghed, der er sÃĶrligt skadelig for Selvkorrektion.

Parallele metoder som Selvkonsekvens og Bedst-af-N undgik dette problem, selv om deres forbedringer var langsommere og mere beskedne.

(BemÃĶrk: Resultat-sektionen, selv om den er udfÃļrlig, er en uvenlig og prolix lÃĶsning, og vi mÃĨ pÃĨ dette punkt forkorte det meste af den resterende dÃĶkning og henviser lÃĶseren til kilde-artiklen for flere detaljer).

Da testet pÃĨ GPT-5 Nano og GPT-5 Mini, lukkede kommercielle modeller, der skjuler den fulde resonans-spor og kun returnerer det endelige svar, forbedrede Iter-VF performances uden at afhÃĶnge af mellemliggende outputs. I tabellen nedenfor kan vi se forbedringer pÃĨ bÃĨde MATH500 og GPQA, hvilket bekrÃĶfter, at verify-then-generate-tilgangen forbliver brugbar, selv nÃĨr kun input og det endelige svar er tilgÃĶngelige:

NÃļjagtighed pÃĨ MATH500 og GPQA, nÃĨr Iter-VF anvendes pÃĨ GPT-5-modeller med skjulte resonans-spor.

NÃļjagtighed pÃĨ MATH500 og GPQA, nÃĨr Iter-VF anvendes pÃĨ GPT-5-modeller med skjulte resonans-spor.

Konklusion

Selv om den nye artikel drejer ind i uigennemsigtighed fra resultatsktionen og frem, er opdagelsen af en overordnet egenskab i en klasse af AI-modeller alligevel en fascinerende udvikling. Enhver, der regelmÃĶssigt bruger en LLM, har instinktivt udviklet en rÃĶkke tricks til at arbejde omkring modellens svagheder, da hver af dem bliver ÃĨbenbar med tiden, og mÃļnsteret opstÃĨr; og alle hÃĨber at finde en ‘trick’ sÃĨ anvendelig og generaliseret som denne.

En af de stÃļrste problemer ved at implementere og opdatere en kontekst-vindue i en LLM synes at vÃĶre at finde en balance mellem bevarelse af sessions-fremskridt og evnen til at udvikle sig i nye retninger, nÃĨr det er nÃļdvendigt, uden at falde i spurious hallucinationer eller afledt output. I det tilfÃĶlde, der prÃĶsenteres i den nye artikel, ser vi et eksempel pÃĨ en mild, men insisterende ‘vÃĶkkel-signal’, der synes at genfokusere og nulstille LLM’en uden tab af kontekst. Det vil vÃĶre interessant at se, om efterfÃļlgende projekter tilpasser og udvikler metoden.

Forskerne fremhÃĶver meget den store Ãļkonomi i deres nye metode – en overvejelse, der ville have haft langt mindre vÃĶgt blot 12 mÃĨneder tidligere. I disse dage gÃļr implikationerne af hyperskala-AI det klart, at ressourcebesparelser, der tidligere blev betragtet som pedantiske i ‘ren forskning’-ÃĶraen, nu er blevet kardinalt og afgÃļrende.

 

* VÃĶr venlig at bemÃĶrk, at jeg er begrÃĶnset i at inkludere det sÃĶdvanlige antal citater fra artiklen, da standarden for engelsk i nogle dele af den kunne forvirre lÃĶseren. Derfor har jeg taget friheden til at sammenfatte nÃļgle-insights i stedet og henviser lÃĶseren til kilde-artiklen for verificering.

Offentliggjort torsdag, 4. december 2025

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]