Andersons vinkel

Minska AI-bildhallucinationer genom att förstora dem

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A Swami sprays a hallucinated small dragon with RAID bug-spray. SDXL, Flux.1D and Flux Kontext via Krita.

ChatGPT-liknande visionsmodeller “hallucinerar” ofta element som inte hör hemma i en bild. En ny metod minskar dessa fel genom att visa modellen förstorade versioner av dess egna hallucinationer, baserat på bildtexter – och sedan be den försöka igen. Denna metod kräver ingen omträning eller extra data och kan tillämpas på en mängd olika modeller och modelltyper.

 

En ny publikation från Kina erbjuder en intressant synvinkel på det irriterande och ihållande problemet med hallucinationer i AI-genererade bilder och videor – element som tydligt inte bör finnas i bilden, baserat på användarens begäran och indata.

I själva verket låter systemet en bild beskrivas av modellen, som vanligt; den omvandlar sedan beskrivningen till en ny bild med hjälp av en text-till-bild-modell – och eventuella extra föremål eller detaljer i denna andra bilden kommer att vara direkta representationer av modellens ursprungliga hallucinationer. Sedan, genom att jämföra den ursprungliga och den genererade bilden, vägleder systemet försiktigt modellen bort från dessa fel nästa gång den försöker:

En illustration av hur den nya metoden identifierar och minskar hallucinationer i bildtexter. Den vanliga modellen beskriver fåglar som inte finns i den ursprungliga bilden, vilket leder till en rekonstruerad bild som lägger till dem. Dessa fel markeras i rött. I kontrast till det föreslagna tillvägagångssättet undviker dessa uppfunna detaljer samtidigt som beskrivningen hålls specifik och flytande. Källa: https://arxiv.org/pdf/2509.21997

En illustration av hur den nya metoden identifierar och minskar hallucinationer i bildtexter. Den vanliga modellen beskriver fåglar som inte finns i den ursprungliga bilden, vilket leder till en rekonstruerad bild som lägger till dem. Dessa fel markeras i rött. I kontrast till det föreslagna tillvägagångssättet undviker dessa uppfunna detaljer samtidigt som beskrivningen hålls specifik och flytande. Källa: https://arxiv.org/pdf/2509.21997

Metoden börjar med att visa modellen riktiga bilder och låta den beskriva dem, inklusive vissa beskrivningar som innehåller föremål eller detaljer som inte faktiskt finns. Dessa hallucinerade beskrivningar används sedan för att generera syntetiska bilder som gör felen lättare att upptäcka. Genom att jämföra den riktiga och den genererade bilden lär sig systemet vilka interna mönster i modellen som tenderar att producera påhittat innehåll.

När dessa felmönster har identifierats kan de lagras och användas senare. När modellen får en ny bild justerar systemet dess interna signaler under beskrivningen, skjuter den bort från de kända mönstren som orsakar hallucinationer. Detta fungerar i ett enda steg och kräver inte extra data, omträning eller ny bildgenerering vid testtiden.

Den intrasslade webben

I exemplet ovan, från artikeln, kan vi se att sammanflätning sannolikt är ansvarig för att försköna “fåglar” i indata-bilden, trots att den första bilden tycks innehålla inga fåglar.

Sammanflätning inträffar när en modell insisterar på att associera vissa begrepp med vissa andra begrepp, enbart för att de två (eller flera) begreppen tenderar att förekomma ofta tillsammans i den ursprungliga datadistributionen som modellen tränades på. I detta fall kan modellen ha sett många bilder av plan+ fåglar, vilket orsakar en association som inte gäller för den specifika bilden, men ändå tränger in i den härledda beskrivningen.

Även om sammanflätning kan mildras genom att stoppa träningen tidigare (vilket i allmänhet gör modellen maximalt flexibel och anpassningsbar), minskar detta också detaljerna och upplösningen på alla tränade begrepp, vilket lämnar modelltränaren med det eviga dilemmat: skapa en modell som är mycket flexibel och desammanflätad; eller skapa en modell som är mer kraftfullt genererande, men också mer benägen att producera “associerade” hallucinationer?

Om kvaliteten på beskrivning och uppmärksamhet på detaljer i originaldatan för en genererande modell hade varit bättre än vad logistiken vanligtvis tillåter, skulle beskrivningar för alla källbilder ha detaljerat varje föremål i varje bild, så att den tränade modellen kunde ha tilldelat dem separata och desammanflätade poster i sin latenta utrymme.

Som det är nu är den självgynnande metoden SEO-beskrivning, i kombination med det faktum att ad hoc hyperskala webbskrapning förblir den bästa källan för att träna riktigt kraftfulla genererande modeller, innebär att bildbeskrivningar tenderar att falla betydligt kortare än denna standard:

En illustration av hur svaga beskrivningar begränsar användbarheten av LAION-bilder för att träna modeller som Stable Diffusion. Många av textetiketterna är grunt, vaga eller optimerade för SEO snarare än korrekt beskrivning, vilket gör det svårare för modellen att lära sig fina visuella begrepp som ansiktsdrag (ursprungskällan var https://rom1504.github.io/, nu defunct).

En illustration av hur svaga beskrivningar begränsar användbarheten av LAION-bilder för att träna modeller som Stable Diffusion. Många av textetiketterna är grunt, vaga eller optimerade för SEO snarare än korrekt beskrivning, vilket gör det svårare för modellen att lära sig fina visuella begrepp som ansiktsdrag. (Ursprungskällan var https://rom1504.github.io/, nu defunct).

Därför, eftersom en grundläggande lösning är osannolik att någonsin bli praktisk, har minskning av LLM/VLM-hallucinationer genom ompassningar och kompromisser blivit en stark underström i litteraturen.

Den nya kinesiska tekniken som presenterades denna vecka, hävdar författarna, testades över en mängd olika arkitekturer i olika förhållanden, och kunde indikera en användbar metod för att minska “hallucinationsföroreningar”.

De säger:

‘Omfattande experiment över flera benchmark-tester visar att vår metod signifikant minskar hallucinationer på objektnivå, attributnivå och relationsnivå, samtidigt som den till stor del bevarar återkallande och beskrivningsrikedom.’

Den nya artikeln har titeln Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors och kommer från tre forskare vid University of Science and Technology of China och Nanjing University.

Metod

Författarna har utvecklat en slut-till-slut-pipeline, som visas nedan, designad för att exponera och undertrycka hallucinationer i bildtexter:

En illustration av hela pipelinen. En vision-språk-modell genererar först en beskrivning från indata-bilden, som kan innehålla hallucinerat innehåll. Denna beskrivning används sedan för att producera en rekonstruerad bild via en text-till-bild-modell, vilket gör att eventuella hallucinationer blir lättare att upptäcka. Embeddings från både den ursprungliga och den rekonstruerade bilden extraheras och används för att vägleda justeringar inuti dekodern, vilket hjälper modellen att undertrycka hallucinerade detaljer samtidigt som beskrivningskvaliteten bevaras.

En illustration av hela pipelinen. En vision-språk-modell genererar först en beskrivning från indata-bilden, som kan innehålla hallucinerat innehåll. Denna beskrivning används sedan för att producera en rekonstruerad bild via en text-till-bild-modell, vilket gör att eventuella hallucinationer blir lättare att upptäcka. Embeddings från både den ursprungliga och den rekonstruerade bilden extraheras och används för att vägleda justeringar inuti dekodern, vilket hjälper modellen att undertrycka hallucinerade detaljer samtidigt som beskrivningskvaliteten bevaras.

Startande från en riktig indata-bild genererar en vision-språk-modell en beskrivning som kan innehålla uppfunna föremål eller relationer. Denna beskrivning matas sedan in i en text-till-bild-generator för att skapa en rekonstruerad bild som visar exakt vad beskrivningen beskriver. Genom att jämföra denna rekonstruerade bild med den ursprungliga bilden blir det fabricerade innehållet uppenbart och mätbart, vilket omvandlar subtila fel i texten till synliga skillnader som systemet kan målmedvetet rikta in sig på och minska.

För att vägleda modellen bort från att “uppfinna” detaljer jämför systemet två versioner av samma bild: den ursprungliga och en rekonstruerad baserad på beskrivningen. Varje bild omvandlas till en komprimerad embedding som fångar dess innehåll.

Den ursprungliga bilden fungerar som en tillförlitlig referens, medan den rekonstruerade bilden lyfter fram var hallucinationer kan ha smugit sig in. Genom att justera sina interna representationer för att närma sig den ursprungliga och avlägsna sig från den rekonstruerade, lär sig modellen att korrigera sig själv automatiskt. Eftersom denna process inte förlitar sig på handjusterade regler eller yttre data, förblir den fullständigt självövervakad.

Artikeln hävdar:

‘Hallucinationer i MLLM är intrinsiskt svåra att upptäcka eftersom de är språkligt välgjorda och ofta inte kan skiljas från trogna beskrivningar på textnivå. Diskrepansen ligger inte i språklig sannolikhet utan i missförhållandet med visuella bevis, vilket modellen själv vanligtvis är omedveten om.

‘För att hantera detta introducerar vi en hallucinationsexponeringsmekanism som utnyttjar generativ rekonstruktion för att omvandla implicita inkonsekvenser till explicita och observerbara signaler.’

Givet en indata-bild och dess beskrivning använder systemet FLUX.1-dev text-till-bild-modell för att återskapa en bild från beskrivningen ensam. Denna återskapade bild tenderar att förstora meningen med beskrivningen, vilket gör eventuella falska detaljer mer uppenbara. Dessa förstärkta fel fungerar sedan som användbara signaler som hjälper modellen att känna igen och korrigera sina egna misstag.

För att testa sitt tillvägagångssätt injicerade författarna hallucinationer i beskrivningar och använde text-till-bild-modellen för att generera rekonstruerade bilder. Dessa bilder beskrevs sedan om av LLaVA, och den semantiska likheten mellan den ursprungliga och hallucinerade beskrivningen utvärderades:

En illustration av hur hallucinationsförstärkningsmekanismen gör subtila fel synliga. Varje punkt visar likheten mellan beskrivningar av den ursprungliga och rekonstruerade bilderna för ett bild-beskrivningspar. Den orange linjen representerar likhet mätt direkt mellan den ursprungliga och hallucinerade beskrivningen, som förblir hög och maskerar små misstag; den blå linjen representerar likhet efter rekonstruktion, som sjunker skarpt, vilket visar att processen omvandlar dolda hallucinationer till tydliga semantiska markörer som kan upptäckas och korrigeras.

En illustration av hur hallucinationsförstärkningsmekanismen gör subtila fel synliga. Varje punkt visar likheten mellan beskrivningar av den ursprungliga och rekonstruerade bilderna för ett bild-beskrivningspar. Den orange linjen representerar likhet mätt direkt mellan den ursprungliga och hallucinerade beskrivningen, som förblir hög och maskerar små misstag; den blå linjen representerar likhet efter rekonstruktion, som sjunker skarpt, vilket visar att processen omvandlar dolda hallucinationer till tydliga semantiska markörer som kan upptäckas och korrigeras.

Likheten sjunker skarpt efter rekonstruktion, vilket visar att processen gör subtila fel mer upptäckbara.

Data och tester

Att validera effektiviteten av den nya metoden innebar användning av tre lämpliga benchmark-tester: Bildtext-hallucinationsbedömning med bildrelevans (CHAIR); MLLM-utvärdering benchmark (MME); och Poolbaserad objektsundersökning (POPE).

Från CHAIR-utgivningsartikeln: exempel på hallucinerade föremål genererade av två ledande beskrivningssystem, TopDown och NBT, där varje modell uppfinner visuella element som inte finns i bilden, såsom bärbara datorer, handfat eller surfbrädor. Källa: https://arxiv.org/pdf/1809.02156

Från CHAIR-utgivningsartikeln: exempel på hallucinerade föremål genererade av två ledande beskrivningssystem, TopDown och NBT, där varje modell uppfinner visuella element som inte finns i bilden, såsom bärbara datorer, handfat eller surfbrädor. Källa: https://arxiv.org/pdf/1809.02156

Standardmått som hallucinationsfrekvens eller återkallande kan vara vilseledande, eftersom en modell kan undvika hallucinationer genom att producera korta eller vaga beskrivningar. För att ta hänsyn till avvägningen mellan återkallande och hallucination användes en kombinerad mått, kallad Hallucination och återkallande (HAR@β), som utvärderar beskrivningar baserat på både noggrannhet och fullständighet, och som tillåter balansen att justeras beroende på om undvikande av fel eller inkludering av mer information är viktigare.

POPE användes för att utvärdera kontextkänsliga objekthallucinationer, och MME för att utvärdera attributnivåhallucinationer, med båda ramade som ja/nej-bedömningsuppgifter.

Experiment utfördes över olika representativa datamängder, med användning av den ovannämnda Flux-modellen och LLaVA-v1.5-7B-varianten. Datamängderna som användes var Microsoft COCO; A-OKVQA; och GQA.

Latent redigering utfördes för modellernas andra lager, i enlighet med tidigare relaterad forskning, medan hyperparametrar och temperatur var konsekventa över alla modeller.

Initiala resultat på CHAIR presenteras nedan:

Prestanda på CHAIR-benchmark för hallucinationsminskning, utvärderad med flera mått.

Prestanda på CHAIR-benchmark för hallucinationsminskning, utvärderad med flera mått.

Av dessa resultat kommenterar författarna:

‘[Vår metod presterar konsekvent bättre än andra baslinjer på både CHAIRS och CHAIRI, vilket visar dess överlägsna effektivitet i att undertrycka hallucinationer. Samtidigt, även om nästan alla metoder ofrånkomligen minskar återkallande medan de undertrycker hallucinationer, vilket reflekterar en avvägning mellan trohet och informativitet, uppnår vår metod den minsta minskningen.

‘Detta visar att vår metod fångar en bred mängd grundfakta-objekt. Med HAR@β-måttet uppnår vår metod den högsta poängen, vilket lyfter fram dess förmåga att minska hallucinationer samtidigt som den behåller täckning.’

Forskarna tillskriver dessa starka resultat den dubbla övervakningsuppställningen, där ren semantik från den ursprungliga bilden förstärktes, samtidigt som vilseledande signaler från den rekonstruerade bilden undertrycktes. Eftersom justeringen riktade sig mot endast den riktning som var associerad med hallucinationer, lämnades resten av representationen intakt, vilket tillät systemet att korrigera fel utan att offra detaljer eller informativitet.

Jämförelse av prestanda på POPE-benchmark under olika konfigurationer och datamängder.

Jämförelse av prestanda på POPE-benchmark under olika konfigurationer och datamängder.

Med avseende på resultaten på POPE, som visas i resultattabellen ovan, hävdar artikeln:

‘Det kan observeras att vår metod konsekvent uppnår den bästa prestandan över alla inställningar. Noterbart kan vår metod uppnå upp till +5,95% noggrannhet och +6,85% F1-poäng i genomsnitt, vilket överträffar andra träningsfria tillvägagångssätt med en stor marginal.

‘Därför visar dessa resultat att vår metod erbjuder en tillförlitlig och generaliserbar lösning över olika svårighetsnivåer.’

Från den tredje testomgången, prestandajämförelser över MME.

Från den tredje testomgången, prestandajämförelser över MME.

Den sista huvudtesten var på MME, med resultaten som visas ovan. Emellertid, bland andra utelämnanden, nämns metoden “OPERA”, som inte definieras någonstans i den huvudsakliga artikeln eller bilagan. Även om författarna hävdar stark prestanda på MME, utan tillräckliga definitioner av metoderna, bör vi kanske lämna resultaten där.

En illustration från MME-benchmark med LLaVA-v1.5-7B, som visar hur baseline-modellen producerade ett hallucinerat svar medan den föreslagna metoden gav det korrekta svaret, med den rekonstruerade bilden som gjorde hallucinationen mer uppenbar.

En illustration från MME-benchmark med LLaVA-v1.5-7B, som visar hur baseline-modellen producerade ett hallucinerat svar medan den föreslagna metoden gav det korrekta svaret, med den rekonstruerade bilden som gjorde hallucinationen mer uppenbar.

Slutsats

Även om denna artikel är tydligt brådskande, och lider av brist på struktur, fokus och tydlighet, som har blivit alltmer synligt i litteraturen under de senaste 12 månaderna (kanske inte orelaterat till den snabbt växande användningen av AI i akademisk forskning), förblir den centrala mekanismen som presenteras ändå genial.

Medan detta slut-till-slut-tillvägagångssätt inte kräver omträning, och verkar tillämpbart över en mängd olika arkitekturer, hade det varit insiktsfullt att se fler testkandidater; och det måste också beaktas att ett sådant mellanliggande system kommer att introducera latency, och en viss grad av extra effektbehov – inte en bagatellfråga i stor skala.

 

* Onormalt presenterar artikeln resultat med rubriker som endast förklaras i bilagmaterialet, och inte i den huvudsakliga artikeln – en alltmer vanlig dålig vana i litteraturen, då forskare försöker begränsa den centrala tesen till 8-9 sidor, även när materialet inte tillåter det. I alla fall användes CHAIR-benchmarken, som utvärderar objekthallucinationer i beskrivningar, baserad på en 500-bilds-MS-COCO-undersättning från tidigare arbete. Två former användes: CHAIRS, som mätte hur ofta hallucinationer förekom i en given beskrivning; och CHAIRI, som mätte hur många av de nämnda föremålen som hallucinerades. HAR@β, introducerad i den huvudsakliga artikeln, definierades som en Fβ-liknande kombination av hallucinationsundertryckning och objektsåterkallande.

Publicerad första gången tisdagen den 30 september 2025

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai