Andersons vinkel

Minska AI-bildhallucinationer genom att fÃķrstora dem

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
A Swami sprays a hallucinated small dragon with RAID bug-spray. SDXL, Flux.1D and Flux Kontext via Krita.

ChatGPT-liknande visionsmodeller “hallucinerar” ofta element som inte hÃķr hemma i en bild. En ny metod minskar dessa fel genom att visa modellen fÃķrstorade versioner av dess egna hallucinationer, baserat pÃĨ bildtexter – och sedan be den fÃķrsÃķka igen. Denna metod krÃĪver ingen omtrÃĪning eller extra data och kan tillÃĪmpas pÃĨ en mÃĪngd olika modeller och modelltyper.

 

En ny publikation frÃĨn Kina erbjuder en intressant synvinkel pÃĨ det irriterande och ihÃĨllande problemet med hallucinationer i AI-genererade bilder och videor – element som tydligt inte bÃķr finnas i bilden, baserat pÃĨ anvÃĪndarens begÃĪran och indata.

I sjÃĪlva verket lÃĨter systemet en bild beskrivas av modellen, som vanligt; den omvandlar sedan beskrivningen till en ny bild med hjÃĪlp av en text-till-bild-modell – och eventuella extra fÃķremÃĨl eller detaljer i denna andra bilden kommer att vara direkta representationer av modellens ursprungliga hallucinationer. Sedan, genom att jÃĪmfÃķra den ursprungliga och den genererade bilden, vÃĪgleder systemet fÃķrsiktigt modellen bort frÃĨn dessa fel nÃĪsta gÃĨng den fÃķrsÃķker:

En illustration av hur den nya metoden identifierar och minskar hallucinationer i bildtexter. Den vanliga modellen beskriver fÃĨglar som inte finns i den ursprungliga bilden, vilket leder till en rekonstruerad bild som lÃĪgger till dem. Dessa fel markeras i rÃķtt. I kontrast till det fÃķreslagna tillvÃĪgagÃĨngssÃĪttet undviker dessa uppfunna detaljer samtidigt som beskrivningen hÃĨlls specifik och flytande. KÃĪlla: https://arxiv.org/pdf/2509.21997

En illustration av hur den nya metoden identifierar och minskar hallucinationer i bildtexter. Den vanliga modellen beskriver fÃĨglar som inte finns i den ursprungliga bilden, vilket leder till en rekonstruerad bild som lÃĪgger till dem. Dessa fel markeras i rÃķtt. I kontrast till det fÃķreslagna tillvÃĪgagÃĨngssÃĪttet undviker dessa uppfunna detaljer samtidigt som beskrivningen hÃĨlls specifik och flytande. KÃĪlla: https://arxiv.org/pdf/2509.21997

Metoden bÃķrjar med att visa modellen riktiga bilder och lÃĨta den beskriva dem, inklusive vissa beskrivningar som innehÃĨller fÃķremÃĨl eller detaljer som inte faktiskt finns. Dessa hallucinerade beskrivningar anvÃĪnds sedan fÃķr att generera syntetiska bilder som gÃķr felen lÃĪttare att upptÃĪcka. Genom att jÃĪmfÃķra den riktiga och den genererade bilden lÃĪr sig systemet vilka interna mÃķnster i modellen som tenderar att producera pÃĨhittat innehÃĨll.

NÃĪr dessa felmÃķnster har identifierats kan de lagras och anvÃĪndas senare. NÃĪr modellen fÃĨr en ny bild justerar systemet dess interna signaler under beskrivningen, skjuter den bort frÃĨn de kÃĪnda mÃķnstren som orsakar hallucinationer. Detta fungerar i ett enda steg och krÃĪver inte extra data, omtrÃĪning eller ny bildgenerering vid testtiden.

Den intrasslade webben

I exemplet ovan, frÃĨn artikeln, kan vi se att sammanflÃĪtning sannolikt ÃĪr ansvarig fÃķr att fÃķrskÃķna “fÃĨglar” i indata-bilden, trots att den fÃķrsta bilden tycks innehÃĨlla inga fÃĨglar.

SammanflÃĪtning intrÃĪffar nÃĪr en modell insisterar pÃĨ att associera vissa begrepp med vissa andra begrepp, enbart fÃķr att de tvÃĨ (eller flera) begreppen tenderar att fÃķrekomma ofta tillsammans i den ursprungliga datadistributionen som modellen trÃĪnades pÃĨ. I detta fall kan modellen ha sett mÃĨnga bilder av plan+ fÃĨglar, vilket orsakar en association som inte gÃĪller fÃķr den specifika bilden, men ÃĪndÃĨ trÃĪnger in i den hÃĪrledda beskrivningen.

Även om sammanflÃĪtning kan mildras genom att stoppa trÃĪningen tidigare (vilket i allmÃĪnhet gÃķr modellen maximalt flexibel och anpassningsbar), minskar detta ocksÃĨ detaljerna och upplÃķsningen pÃĨ alla trÃĪnade begrepp, vilket lÃĪmnar modelltrÃĪnaren med det eviga dilemmat: skapa en modell som ÃĪr mycket flexibel och desammanflÃĪtad; eller skapa en modell som ÃĪr mer kraftfullt genererande, men ocksÃĨ mer benÃĪgen att producera “associerade” hallucinationer?

Om kvaliteten pÃĨ beskrivning och uppmÃĪrksamhet pÃĨ detaljer i originaldatan fÃķr en genererande modell hade varit bÃĪttre ÃĪn vad logistiken vanligtvis tillÃĨter, skulle beskrivningar fÃķr alla kÃĪllbilder ha detaljerat varje fÃķremÃĨl i varje bild, sÃĨ att den trÃĪnade modellen kunde ha tilldelat dem separata och desammanflÃĪtade poster i sin latenta utrymme.

Som det ÃĪr nu ÃĪr den sjÃĪlvgynnande metoden SEO-beskrivning, i kombination med det faktum att ad hoc hyperskala webbskrapning fÃķrblir den bÃĪsta kÃĪllan fÃķr att trÃĪna riktigt kraftfulla genererande modeller, innebÃĪr att bildbeskrivningar tenderar att falla betydligt kortare ÃĪn denna standard:

En illustration av hur svaga beskrivningar begrÃĪnsar anvÃĪndbarheten av LAION-bilder fÃķr att trÃĪna modeller som Stable Diffusion. MÃĨnga av textetiketterna ÃĪr grunt, vaga eller optimerade fÃķr SEO snarare ÃĪn korrekt beskrivning, vilket gÃķr det svÃĨrare fÃķr modellen att lÃĪra sig fina visuella begrepp som ansiktsdrag (ursprungskÃĪllan var https://rom1504.github.io/, nu defunct).

En illustration av hur svaga beskrivningar begrÃĪnsar anvÃĪndbarheten av LAION-bilder fÃķr att trÃĪna modeller som Stable Diffusion. MÃĨnga av textetiketterna ÃĪr grunt, vaga eller optimerade fÃķr SEO snarare ÃĪn korrekt beskrivning, vilket gÃķr det svÃĨrare fÃķr modellen att lÃĪra sig fina visuella begrepp som ansiktsdrag. (UrsprungskÃĪllan var https://rom1504.github.io/, nu defunct).

DÃĪrfÃķr, eftersom en grundlÃĪggande lÃķsning ÃĪr osannolik att nÃĨgonsin bli praktisk, har minskning av LLM/VLM-hallucinationer genom ompassningar och kompromisser blivit en stark understrÃķm i litteraturen.

Den nya kinesiska tekniken som presenterades denna vecka, hÃĪvdar fÃķrfattarna, testades Ãķver en mÃĪngd olika arkitekturer i olika fÃķrhÃĨllanden, och kunde indikera en anvÃĪndbar metod fÃķr att minska “hallucinationsfÃķroreningar”.

De sÃĪger:

‘Omfattande experiment Ãķver flera benchmark-tester visar att vÃĨr metod signifikant minskar hallucinationer pÃĨ objektnivÃĨ, attributnivÃĨ och relationsnivÃĨ, samtidigt som den till stor del bevarar ÃĨterkallande och beskrivningsrikedom.’

Den nya artikeln har titeln Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors och kommer frÃĨn tre forskare vid University of Science and Technology of China och Nanjing University.

Metod

FÃķrfattarna har utvecklat en slut-till-slut-pipeline, som visas nedan, designad fÃķr att exponera och undertrycka hallucinationer i bildtexter:

En illustration av hela pipelinen. En vision-sprÃĨk-modell genererar fÃķrst en beskrivning frÃĨn indata-bilden, som kan innehÃĨlla hallucinerat innehÃĨll. Denna beskrivning anvÃĪnds sedan fÃķr att producera en rekonstruerad bild via en text-till-bild-modell, vilket gÃķr att eventuella hallucinationer blir lÃĪttare att upptÃĪcka. Embeddings frÃĨn bÃĨde den ursprungliga och den rekonstruerade bilden extraheras och anvÃĪnds fÃķr att vÃĪgleda justeringar inuti dekodern, vilket hjÃĪlper modellen att undertrycka hallucinerade detaljer samtidigt som beskrivningskvaliteten bevaras.

En illustration av hela pipelinen. En vision-sprÃĨk-modell genererar fÃķrst en beskrivning frÃĨn indata-bilden, som kan innehÃĨlla hallucinerat innehÃĨll. Denna beskrivning anvÃĪnds sedan fÃķr att producera en rekonstruerad bild via en text-till-bild-modell, vilket gÃķr att eventuella hallucinationer blir lÃĪttare att upptÃĪcka. Embeddings frÃĨn bÃĨde den ursprungliga och den rekonstruerade bilden extraheras och anvÃĪnds fÃķr att vÃĪgleda justeringar inuti dekodern, vilket hjÃĪlper modellen att undertrycka hallucinerade detaljer samtidigt som beskrivningskvaliteten bevaras.

Startande frÃĨn en riktig indata-bild genererar en vision-sprÃĨk-modell en beskrivning som kan innehÃĨlla uppfunna fÃķremÃĨl eller relationer. Denna beskrivning matas sedan in i en text-till-bild-generator fÃķr att skapa en rekonstruerad bild som visar exakt vad beskrivningen beskriver. Genom att jÃĪmfÃķra denna rekonstruerade bild med den ursprungliga bilden blir det fabricerade innehÃĨllet uppenbart och mÃĪtbart, vilket omvandlar subtila fel i texten till synliga skillnader som systemet kan mÃĨlmedvetet rikta in sig pÃĨ och minska.

FÃķr att vÃĪgleda modellen bort frÃĨn att “uppfinna” detaljer jÃĪmfÃķr systemet tvÃĨ versioner av samma bild: den ursprungliga och en rekonstruerad baserad pÃĨ beskrivningen. Varje bild omvandlas till en komprimerad embedding som fÃĨngar dess innehÃĨll.

Den ursprungliga bilden fungerar som en tillfÃķrlitlig referens, medan den rekonstruerade bilden lyfter fram var hallucinationer kan ha smugit sig in. Genom att justera sina interna representationer fÃķr att nÃĪrma sig den ursprungliga och avlÃĪgsna sig frÃĨn den rekonstruerade, lÃĪr sig modellen att korrigera sig sjÃĪlv automatiskt. Eftersom denna process inte fÃķrlitar sig pÃĨ handjusterade regler eller yttre data, fÃķrblir den fullstÃĪndigt sjÃĪlvÃķvervakad.

Artikeln hÃĪvdar:

‘Hallucinationer i MLLM ÃĪr intrinsiskt svÃĨra att upptÃĪcka eftersom de ÃĪr sprÃĨkligt vÃĪlgjorda och ofta inte kan skiljas frÃĨn trogna beskrivningar pÃĨ textnivÃĨ. Diskrepansen ligger inte i sprÃĨklig sannolikhet utan i missfÃķrhÃĨllandet med visuella bevis, vilket modellen sjÃĪlv vanligtvis ÃĪr omedveten om.

‘FÃķr att hantera detta introducerar vi en hallucinationsexponeringsmekanism som utnyttjar generativ rekonstruktion fÃķr att omvandla implicita inkonsekvenser till explicita och observerbara signaler.’

Givet en indata-bild och dess beskrivning anvÃĪnder systemet FLUX.1-dev text-till-bild-modell fÃķr att ÃĨterskapa en bild frÃĨn beskrivningen ensam. Denna ÃĨterskapade bild tenderar att fÃķrstora meningen med beskrivningen, vilket gÃķr eventuella falska detaljer mer uppenbara. Dessa fÃķrstÃĪrkta fel fungerar sedan som anvÃĪndbara signaler som hjÃĪlper modellen att kÃĪnna igen och korrigera sina egna misstag.

FÃķr att testa sitt tillvÃĪgagÃĨngssÃĪtt injicerade fÃķrfattarna hallucinationer i beskrivningar och anvÃĪnde text-till-bild-modellen fÃķr att generera rekonstruerade bilder. Dessa bilder beskrevs sedan om av LLaVA, och den semantiska likheten mellan den ursprungliga och hallucinerade beskrivningen utvÃĪrderades:

En illustration av hur hallucinationsfÃķrstÃĪrkningsmekanismen gÃķr subtila fel synliga. Varje punkt visar likheten mellan beskrivningar av den ursprungliga och rekonstruerade bilderna fÃķr ett bild-beskrivningspar. Den orange linjen representerar likhet mÃĪtt direkt mellan den ursprungliga och hallucinerade beskrivningen, som fÃķrblir hÃķg och maskerar smÃĨ misstag; den blÃĨ linjen representerar likhet efter rekonstruktion, som sjunker skarpt, vilket visar att processen omvandlar dolda hallucinationer till tydliga semantiska markÃķrer som kan upptÃĪckas och korrigeras.

En illustration av hur hallucinationsfÃķrstÃĪrkningsmekanismen gÃķr subtila fel synliga. Varje punkt visar likheten mellan beskrivningar av den ursprungliga och rekonstruerade bilderna fÃķr ett bild-beskrivningspar. Den orange linjen representerar likhet mÃĪtt direkt mellan den ursprungliga och hallucinerade beskrivningen, som fÃķrblir hÃķg och maskerar smÃĨ misstag; den blÃĨ linjen representerar likhet efter rekonstruktion, som sjunker skarpt, vilket visar att processen omvandlar dolda hallucinationer till tydliga semantiska markÃķrer som kan upptÃĪckas och korrigeras.

Likheten sjunker skarpt efter rekonstruktion, vilket visar att processen gÃķr subtila fel mer upptÃĪckbara.

Data och tester

Att validera effektiviteten av den nya metoden innebar anvÃĪndning av tre lÃĪmpliga benchmark-tester: Bildtext-hallucinationsbedÃķmning med bildrelevans (CHAIR); MLLM-utvÃĪrdering benchmark (MME); och Poolbaserad objektsundersÃķkning (POPE).

FrÃĨn CHAIR-utgivningsartikeln: exempel pÃĨ hallucinerade fÃķremÃĨl genererade av tvÃĨ ledande beskrivningssystem, TopDown och NBT, dÃĪr varje modell uppfinner visuella element som inte finns i bilden, sÃĨsom bÃĪrbara datorer, handfat eller surfbrÃĪdor. KÃĪlla: https://arxiv.org/pdf/1809.02156

FrÃĨn CHAIR-utgivningsartikeln: exempel pÃĨ hallucinerade fÃķremÃĨl genererade av tvÃĨ ledande beskrivningssystem, TopDown och NBT, dÃĪr varje modell uppfinner visuella element som inte finns i bilden, sÃĨsom bÃĪrbara datorer, handfat eller surfbrÃĪdor. KÃĪlla: https://arxiv.org/pdf/1809.02156

StandardmÃĨtt som hallucinationsfrekvens eller ÃĨterkallande kan vara vilseledande, eftersom en modell kan undvika hallucinationer genom att producera korta eller vaga beskrivningar. FÃķr att ta hÃĪnsyn till avvÃĪgningen mellan ÃĨterkallande och hallucination anvÃĪndes en kombinerad mÃĨtt, kallad Hallucination och ÃĨterkallande (HAR@Îē), som utvÃĪrderar beskrivningar baserat pÃĨ bÃĨde noggrannhet och fullstÃĪndighet, och som tillÃĨter balansen att justeras beroende pÃĨ om undvikande av fel eller inkludering av mer information ÃĪr viktigare.

POPE anvÃĪndes fÃķr att utvÃĪrdera kontextkÃĪnsliga objekthallucinationer, och MME fÃķr att utvÃĪrdera attributnivÃĨhallucinationer, med bÃĨda ramade som ja/nej-bedÃķmningsuppgifter.

Experiment utfÃķrdes Ãķver olika representativa datamÃĪngder, med anvÃĪndning av den ovannÃĪmnda Flux-modellen och LLaVA-v1.5-7B-varianten. DatamÃĪngderna som anvÃĪndes var Microsoft COCO; A-OKVQA; och GQA.

Latent redigering utfÃķrdes fÃķr modellernas andra lager, i enlighet med tidigare relaterad forskning, medan hyperparametrar och temperatur var konsekventa Ãķver alla modeller.

Initiala resultat pÃĨ CHAIR presenteras nedan:

Prestanda pÃĨ CHAIR-benchmark fÃķr hallucinationsminskning, utvÃĪrderad med flera mÃĨtt.

Prestanda pÃĨ CHAIR-benchmark fÃķr hallucinationsminskning, utvÃĪrderad med flera mÃĨtt.

Av dessa resultat kommenterar fÃķrfattarna:

‘[VÃĨr metod presterar konsekvent bÃĪttre ÃĪn andra baslinjer pÃĨ bÃĨde CHAIRS och CHAIRI, vilket visar dess ÃķverlÃĪgsna effektivitet i att undertrycka hallucinationer. Samtidigt, ÃĪven om nÃĪstan alla metoder ofrÃĨnkomligen minskar ÃĨterkallande medan de undertrycker hallucinationer, vilket reflekterar en avvÃĪgning mellan trohet och informativitet, uppnÃĨr vÃĨr metod den minsta minskningen.

‘Detta visar att vÃĨr metod fÃĨngar en bred mÃĪngd grundfakta-objekt. Med HAR@Îē-mÃĨttet uppnÃĨr vÃĨr metod den hÃķgsta poÃĪngen, vilket lyfter fram dess fÃķrmÃĨga att minska hallucinationer samtidigt som den behÃĨller tÃĪckning.’

Forskarna tillskriver dessa starka resultat den dubbla ÃķvervakningsuppstÃĪllningen, dÃĪr ren semantik frÃĨn den ursprungliga bilden fÃķrstÃĪrktes, samtidigt som vilseledande signaler frÃĨn den rekonstruerade bilden undertrycktes. Eftersom justeringen riktade sig mot endast den riktning som var associerad med hallucinationer, lÃĪmnades resten av representationen intakt, vilket tillÃĪt systemet att korrigera fel utan att offra detaljer eller informativitet.

JÃĪmfÃķrelse av prestanda pÃĨ POPE-benchmark under olika konfigurationer och datamÃĪngder.

JÃĪmfÃķrelse av prestanda pÃĨ POPE-benchmark under olika konfigurationer och datamÃĪngder.

Med avseende pÃĨ resultaten pÃĨ POPE, som visas i resultattabellen ovan, hÃĪvdar artikeln:

‘Det kan observeras att vÃĨr metod konsekvent uppnÃĨr den bÃĪsta prestandan Ãķver alla instÃĪllningar. Noterbart kan vÃĨr metod uppnÃĨ upp till +5,95% noggrannhet och +6,85% F1-poÃĪng i genomsnitt, vilket ÃķvertrÃĪffar andra trÃĪningsfria tillvÃĪgagÃĨngssÃĪtt med en stor marginal.

‘DÃĪrfÃķr visar dessa resultat att vÃĨr metod erbjuder en tillfÃķrlitlig och generaliserbar lÃķsning Ãķver olika svÃĨrighetsnivÃĨer.’

FrÃĨn den tredje testomgÃĨngen, prestandajÃĪmfÃķrelser Ãķver MME.

FrÃĨn den tredje testomgÃĨngen, prestandajÃĪmfÃķrelser Ãķver MME.

Den sista huvudtesten var pÃĨ MME, med resultaten som visas ovan. Emellertid, bland andra utelÃĪmnanden, nÃĪmns metoden “OPERA”, som inte definieras nÃĨgonstans i den huvudsakliga artikeln eller bilagan. Även om fÃķrfattarna hÃĪvdar stark prestanda pÃĨ MME, utan tillrÃĪckliga definitioner av metoderna, bÃķr vi kanske lÃĪmna resultaten dÃĪr.

En illustration frÃĨn MME-benchmark med LLaVA-v1.5-7B, som visar hur baseline-modellen producerade ett hallucinerat svar medan den fÃķreslagna metoden gav det korrekta svaret, med den rekonstruerade bilden som gjorde hallucinationen mer uppenbar.

En illustration frÃĨn MME-benchmark med LLaVA-v1.5-7B, som visar hur baseline-modellen producerade ett hallucinerat svar medan den fÃķreslagna metoden gav det korrekta svaret, med den rekonstruerade bilden som gjorde hallucinationen mer uppenbar.

Slutsats

Även om denna artikel ÃĪr tydligt brÃĨdskande, och lider av brist pÃĨ struktur, fokus och tydlighet, som har blivit alltmer synligt i litteraturen under de senaste 12 mÃĨnaderna (kanske inte orelaterat till den snabbt vÃĪxande anvÃĪndningen av AI i akademisk forskning), fÃķrblir den centrala mekanismen som presenteras ÃĪndÃĨ genial.

Medan detta slut-till-slut-tillvÃĪgagÃĨngssÃĪtt inte krÃĪver omtrÃĪning, och verkar tillÃĪmpbart Ãķver en mÃĪngd olika arkitekturer, hade det varit insiktsfullt att se fler testkandidater; och det mÃĨste ocksÃĨ beaktas att ett sÃĨdant mellanliggande system kommer att introducera latency, och en viss grad av extra effektbehov – inte en bagatellfrÃĨga i stor skala.

 

* Onormalt presenterar artikeln resultat med rubriker som endast fÃķrklaras i bilagmaterialet, och inte i den huvudsakliga artikeln – en alltmer vanlig dÃĨlig vana i litteraturen, dÃĨ forskare fÃķrsÃķker begrÃĪnsa den centrala tesen till 8-9 sidor, ÃĪven nÃĪr materialet inte tillÃĨter det. I alla fall anvÃĪndes CHAIR-benchmarken, som utvÃĪrderar objekthallucinationer i beskrivningar, baserad pÃĨ en 500-bilds-MS-COCO-undersÃĪttning frÃĨn tidigare arbete. TvÃĨ former anvÃĪndes: CHAIRS, som mÃĪtte hur ofta hallucinationer fÃķrekom i en given beskrivning; och CHAIRI, som mÃĪtte hur mÃĨnga av de nÃĪmnda fÃķremÃĨlen som hallucinerades. HAR@Îē, introducerad i den huvudsakliga artikeln, definierades som en FÎē-liknande kombination av hallucinationsundertryckning och objektsÃĨterkallande.

Publicerad fÃķrsta gÃĨngen tisdagen den 30 september 2025

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]