Andersons vinkel
Reducering af AI‑billedhallucinationer ved at overdrive dem

ChatGPT‑lignende vision‑modeller hallucinerer ofte elementer, der ikke hører til i et billede. En ny metode reducerer disse fejl ved at vise modellen overdrevne versioner af sine egne hallucinationer, baseret på billedtekster – og derefter bede den prøve igen. Tilgangen kræver ingen gen‑træning eller ekstra data og kan anvendes på en bred vifte af modeller og modeltyper.
En ny publikation fra Kina giver et interessant perspektiv på det irriterende vedvarende problem med hallucinationer i AI‑genererede billeder og videoer – elementer, der tydeligt ikke bør være i billedet i forhold til brugerens anmodning og input.
I bund og grund tager systemet et billede og lader modellen beskrive det, som sædvanligt; derefter omsætter det den billedtekst til et nyt billede ved hjælp af en tekst‑til‑billede‑model – og eventuelle ekstra objekter eller detaljer i dette andet billede vil være direkte repræsentationer af modellens oprindelige hallucinationer. Ved at sammenligne det oprindelige og det genererede billede styrer systemet blidt modellen væk fra disse fejl, næste gang den prøver:

En illustration af, hvordan den nye metode identificerer og reducerer hallucinationer i billedtekster. Den almindelige model beskriver fugle, der ikke findes i det oprindelige billede, hvilket fører til et rekonstrueret billede, der tilføjer dem. Disse fejl er markeret med rødt. I modsætning hertil undgår den foreslåede metode disse opfundne detaljer, mens billedteksten forbliver specifik og flydende. Source: https://arxiv.org/pdf/2509.21997
Metoden begynder med at vise modellen rigtige billeder og lade den beskrive dem, inklusive nogle beskrivelser, der indeholder objekter eller detaljer, som ikke faktisk er til stede. Disse hallucinerede billedtekster bruges derefter til at generere syntetiske billeder, så fejlene bliver lettere at opdage. Ved at sammenligne de rigtige og de genererede billeder lærer systemet, hvilke interne mønstre i modellen der har tendens til at producere opfundet indhold.
Når disse fejl‑mønstre er identificeret, kan de gemmes og bruges senere. Når modellen får et nyt billede, vil systemet justere dens interne signaler under billedtekstgenerering, og skubbe den væk fra de kendte mønstre, der forårsager hallucinationer. Dette sker i et enkelt gennemløb og kræver hverken ekstra data, gen‑træning eller ny billedgenerering på testtidspunktet.
Det indviklede net
I eksemplet ovenfor, fra artiklen, kan vi se, at entanglement sandsynligvis er ansvarlig for at overdrive ‘fugle’ i input‑billedet, selvom det første billede ser ud til ikke at indeholde nogen fugle.
Entanglement opstår, når en model insisterer på at forbinde visse begreber med andre begreber, blot fordi de to (eller flere) begreber ofte forekommer sammen i den oprindelige datadistribution, som modellen er trænet på. I dette tilfælde kan modellen have set mange billeder af fly+fugle, hvilket skaber en association, der ikke gælder for det specifikke billede, men som alligevel påvirker den afledte billedtekst.
Selvom entanglement kan afbødes ved at stoppe træningen tidligere (hvilket generelt gør modellen så fleksibel og tilpasningsdygtig som muligt), reducerer dette også detalje‑ og opløsningsniveauet for alle trænede begreber, så modeltræneren står over for det evige dilemma: skabe en model, der er meget fleksibel og frakoblet; eller skabe en model, der er mere kraftfuld i genereringen, men også mere tilbøjelig til at producere ‘associerede’ hallucinationer?
Hvis kvaliteten af billedtekstning og opmærksomheden på detaljer i kurateringen af de oprindelige data til en generativ model havde været bedre end logistik normalt tillader, ville billedteksterne for alle kildebilleder have detaljeret hver genstand i hvert billede, så den trænede model kunne have tildelt dem separate og frakoblede poster i sit latente rum.
Som det er nu, er den egeninteresserede praksis med SEO‑billedtekstning, kombineret med det faktum at ad hoc hyperskala‑web‑scraping forbliver den bedste kilde til at træne virkelig kraftfulde generative modeller, betyder at billedtekster ofte falder betydeligt under dette standard:

En illustration af, hvordan svage billedtekster begrænser nytten af LAION‑billeder til træning af modeller som Stable Diffusion. Mange af tekstetiketterne er overfladiske, vage eller optimeret til SEO i stedet for præcis beskrivelse, hvilket gør det sværere for modellen at lære fin‑granulerede visuelle begreber som ansigtstræk. (Original kilde var https://rom1504.github.io/, nu nedlagt).
Derfor, da en grundlæggende løsning sandsynligvis aldrig vil blive praktisk gennemførlig, er reduktionen af LLM/VLM‑hallucinationer gennem work‑arounds og kompromiser nu blevet en stærk undergren i litteraturen.
Den nye kinesiske teknik, der blev afsløret i denne uge, ifølge forfatterne, blev testet på tværs af en række arkitekturer under forskellige betingelser og kan indikere en nyttig måde at reducere ’hallucination‑forurening’ på.
De siger:
‘Omfattende eksperimenter på tværs af flere benchmarks viser, at vores metode markant reducerer hallucinationer på objekt‑, attribut‑ og relationsniveau, mens den i høj grad bevarer genkaldelse og billedtekst [richness].’
Den new paper har titlen Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors og kommer fra tre forskere ved University of Science and Technology of China samt Nanjing University.
Method
Forfatterne har udtænkt en ende‑til‑ende‑pipeline, vist nedenfor, designet til at afsløre og undertrykke hallucinationer i billedtekster:

En illustration af den fulde pipeline. En vision‑sprog‑model genererer først en billedtekst ud fra input‑billedet, som kan indeholde hallucineret indhold. Denne billedtekst bruges derefter til at producere et rekonstrueret billede via en tekst‑til‑billede‑model, så eventuelle hallucinationer lettere kan opdages. Indlejringer fra både det originale og det rekonstruerede billede udtrækkes og anvendes til at guide justeringer i dekoderen, hvilket hjælper modellen med at undertrykke hallucinerede detaljer, mens billedkvaliteten bevares.
Ud fra et reelt input‑billede genererer en vision‑sprog‑model en beskrivende billedtekst, som kan indeholde opfundne objekter eller relationer. Denne billedtekst føres derefter ind i en tekst‑til‑billede‑generator for at skabe et rekonstrueret billede, der viser præcis det, teksten beskriver. Sammenligningen mellem det rekonstruerede billede og det originale gør det fabrikerede indhold tydeligt og målbart, så subtile fejl i teksten omdannes til synlige forskelle, som systemet kan målrette og reducere.
For at lede modellen væk fra at ‘opfinde’ detaljer, sammenligner systemet to versioner af det samme billede: det originale og et rekonstrueret baseret på billedteksten. Hvert billede omdannes til en kompakt embedding, der indfanger dets indhold.
Det originale billede fungerer som en pålidelig reference, mens det rekonstruerede fremhæver, hvor hallucinationer kan have sneget sig ind. Ved at justere sine interne repræsentationer for at komme tættere på det originale og længere væk fra det rekonstruerede, lærer modellen automatisk at korrigere sig selv. Da denne proces ikke er afhængig af håndjusterede regler eller eksterne data, forbliver den fuldt self-supervised.
Papiret siger:
‘Hallucinationer i MLLM’er er intrinsisk svære at opdage, fordi de er sprogligt velformede og ofte uadskillelige fra troværdige beskrivelser på tekstniveau. Afvigelsen ligger ikke i sprogets plausibilitet, men i misjusteringen med visuel evidens, som modellen typisk er ufølsom over for.’
‘For at tackle dette introducerer vi en hallucination‑eksponeringsmekanisme, der udnytter generativ rekonstruktion til at omdanne implicitte inkonsistenser til eksplicitte og observerbare signaler.’
Givet et input‑billede og dets billedtekst bruger systemet FLUX.1-dev tekst‑til‑billede‑modellen til at genskabe et billede udelukkende ud fra billedteksten. Dette genskabte billede har en tendens til at overdrive betydningen af billedteksten, så falske detaljer bliver mere åbenbare. Disse forstærkede fejl fungerer derefter som nyttige signaler, der hjælper modellen med at genkende og rette sine egne fejl.
For at teste deres tilgang injicerede forfatterne hallucinationer i billedteksterne og brugte tekst‑til‑billede‑modellen til at generere rekonstruerede billeder. Disse billeder blev derefter gen‑beskrevet af LLaVA, og den semantiske lighed mellem de originale og de hallucinerede billedtekster blev evalueret:

En illustration af, hvordan hallucinationsforstærkningsmekanismen gør subtile fejl synlige. Hvert punkt viser ligheden mellem billedteksterne for den originale og den rekonstruerede version for ét billede‑tekst‑par. Den orange linje repræsenterer lighed målt direkte mellem originale og hallucinerede billedtekster, som forbliver høj og maskerer små fejl; den blå linje viser lighed efter rekonstruktion, som falder brat, hvilket viser, at processen omdanner skjulte hallucinationer til klare semantiske markører, der kan opdages og korrigeres.
Ligheden falder brat efter rekonstruktion, hvilket viser, at processen gør subtile fejl mere detekterbare.
Data og tests
Valideringen af den nye metodes effektivitet involverede brug af tre relevante benchmarks: Caption Hallucination Assessment with Image Relevance (CHAIR); MLLM Evaluation benchmark (MME); og Pooling-based Object Probing Evaluation (POPE).

Fra CHAIR-udgivelsespapiret: eksempler på hallucinerede objekter genereret af to førende billedtekstsystemer, TopDown og NBT, hvor hver model opfinder visuelle elementer, der faktisk ikke er til stede i billedet, såsom bærbare computere, vaske eller surfbrætter. Kilde: https://arxiv.org/pdf/1809.02156
Standardmålinger som hallucination rate eller recall kan være misvisende, da en model kan undgå hallucinationer blot ved at producere korte eller vage billedtekster. For at tage højde for afvejningen mellem recall og hallucination anvendes en kombineret måling kaldet Hallucination and Recall (HAR@β), som scorer billedtekster baseret på både nøjagtighed og fuldstændighed, og som gør det muligt at justere balancen afhængigt af, om det er vigtigere at undgå fejl eller at inkludere flere detaljer.
POPE blev brugt til at vurdere kontekstfølsomme objekt‑hallucinationer, og MME til at evaluere hallucinationer på attributniveau, begge indrammet som Ja‑eller‑Nej‑bedømmelsesopgaver.
Eksperimenterne blev udført på tværs af forskellige repræsentative datasæt ved brug af den førnævnte Flux‑model og LLaVA-v1.5-7B-varianten. De anvendte datasæt var Microsoft COCO; A-OKVQA; og GQA.
Latent redigering blev udført på modellens andet lag i overensstemmelse med prior related work, mens hyperparametre og temperatur var ens for alle modeller.
De indledende resultater på CHAIR præsenteres nedenfor*:

Præstation på CHAIR-benchmarket for reduktion af hallucinationer, vurderet med flere målepunkter.
Af disse resultater kommenterer forfatterne:
‘[Our method consistently outperforms other baselines on both CHAIRS and CHAIRI[*], hvilket demonstrerer dens overlegne effektivitet i at undertrykke hallucinationer. Samtidig, selvom næsten alle metoder uundgåeligt reducerer recall, mens de undertrykker hallucinationer, hvilket afspejler en afvejning mellem troværdighed og informationsrigdom, opnår vores tilgang det mindst mulige fald.’
‘Dette viser, at vores metode fanger et bredt spektrum af sandfærdige objekter. Med HAR@β‑målingen opnår vores metode den højeste score, hvilket fremhæver dens evne til at reducere hallucinationer samtidig med at opretholde dækning.’
Forskerne tilskriver disse stærke resultater den dobbelte supervision, hvor ren semantik fra den originale billede blev forstærket, samtidig med at vildledende signaler fra den rekonstruerede version blev undertrykt. Da justeringen kun målrettede den retning, der var forbundet med hallucinationer, forblev resten af repræsentationen intakt, så systemet kunne rette fejl uden at gå på kompromis med detaljer eller informationsrigdom.

Sammenligning af ydeevne på POPE-benchmarken under forskellige konfigurationer og datasæt.
Vedrørende resultaterne på POPE, vist i resultattabellen ovenfor, påstår artiklen:
‘Det kan observeres, at vores metode konsekvent opnår den bedste præstation på tværs af alle indstillinger. Bemærkelsesværdigt kan vores metode opnå op til +5,95 % nøjagtighed og +6,85 % F1‑score i gennemsnit, hvilket overgår andre træningsfri tilgange med en stor margin.’
‘Derfor demonstrerer disse resultater, at vores metode leverer en pålidelig og generaliserbar løsning på tværs af forskellige sværhedsgrader.’

Fra den tredje testrunde, ydeevnesammenligninger på MME.
Den sidste hovedtest var på MME, med resultaterne vist ovenfor. Dog nævner den blandt andre udeladelser metoden ‘OPERA’, som ikke er defineret nogen steder i hovedpapiret eller i bilaget. Selvom forfatterne påstår stærk præstation på MME, bør vi måske lade resultatafsnittet stå ved dette punkt uden tilstrækkelige definitioner af metoderne.

En illustration fra MME‑benchmarken med LLaVA‑v1.5‑7B, der viser, hvordan basismodellen producerer et hallucineret svar, mens den foreslåede metode gav det korrekte svar, og den rekonstruerede billedet gør hallucinationen mere tydelig.
Konklusion
Selvom dette papir tydeligt er hastigt sammensat og lider under manglende struktur, fokus og klarhed, som i løbet af de sidste 12 måneder er blevet stadig mere tydelig i litteraturen (måske ikke uafhængig af den hastigt voksende brug af AI i akademisk forskning), forbliver den centrale mekanisme, der præsenteres, genial.
Selvom denne ende‑til‑ende‑tilgang ikke kræver gen‑træning og ser ud til at kunne anvendes på tværs af en række arkitekturer, ville det have været indsigtsfuldt at se flere testkandidater; og det skal også overvejes, at et interstitielt system af denne type i det mindste vil introducere latenstid og et vist ekstra strømforbrug – ikke et ubetydeligt problem i stor skala.
* Unkonventionelt præsenterer hoveddelen af dette papir resultater med overskrifter, der kun forklares i bilagmaterialet og ikke i selve papiret – en stadig hyppigere dårlig vane i litteraturen, da forskere forsøger at begrænse den centrale tese til 8‑9 sider, selv når materialet ikke tillader det. Under alle omstændigheder var CHAIR‑benchmarken, der bruges til at evaluere objekt‑hallucination i billedtekster, baseret på et 500‑billeders MSCOCO‑undersæt fra tidligere arbejde. To former blev anvendt: CHAIRs, som måler hvor ofte hallucinationer forekom i en given billedtekst; og CHAIRI, som måler hvor mange af de nævnte objekter der blev hallucineret. HAR@β , introduceret i hovedpapiret, blev defineret som en Fβ-stil kombination af hallucinationsundertrykkelse og objekt‑genkaldelse.
Først offentliggjort tirsdag den 30. september 2025












