Andersons vinkel
Til at løse diffusion-modellers begrænsede forståelse af spejle og reflekser

Siden generativ AI fangede offentlighedens interesse, har forskningen i computersyn arbejdet mere intensivt med modeller, der kan forstå og gengive fysiske love. Det har dog i mindst fem år været en betydelig udfordring at lære maskinlæringssystemer at simulere tyngdekraft eller væskers dynamik.
Efter at latente diffusionsmodeller (LDM’er) blev dominerende inden for generativ AI, er forskerne blevet stadig mere optagede af deres begrænsede evne til at forstå og gengive fysiske fænomener. Problemet fik større betydning med OpenAI’s Sora og senere med de åbne videomodeller Hunyuan Video og Wan 2.1.
Utroværdige spejlbilleder
Det meste arbejde med at forbedre LDM’ers forståelse af fysik handler om at simulere gang, partikelfysik og andre former for newtonsk bevægelse. Disse områder får stor opmærksomhed, fordi en fejl i helt grundlæggende fysisk adfærd straks ødelægger troværdigheden af en AI-genereret video.
Et mindre, men voksende forskningsfelt undersøger dog en anden markant svaghed ved LDM’er: deres begrænsede evne til at skabe korrekte spejlbilleder.
Eksempler på fejl i spejlinger og den foreslåede metode fra studiet fra januar 2025, »Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections«. Kilde: https://arxiv.org/pdf/2409.14677

Eksempler på fejl i spejlinger og den foreslåede metode. Kilde: https://arxiv.org/pdf/2409.14677
Problemet fandtes allerede i CGI og er fortsat vigtigt i computerspil, hvor raytracing-algoritmer simulerer lysets vej, når det rammer overflader. De beregner, hvordan virtuelle stråler reflekteres fra eller bevæger sig gennem objekter for at skabe realistiske spejlinger, brydninger og skygger.
Hvert ekstra tilbagespring øger beregningsomkostningen kraftigt. Realtidsprogrammer må derfor afveje forsinkelse mod nøjagtighed ved at begrænse antallet af tilladte tilbagespring.
![A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing](https://www.unite.ai/wp-content/uploads/2025/04/ray-tracing.jpg)
En beregnet lysstråle i et traditionelt 3D- eller CGI-miljø. Kilde: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
En forkromet tekande foran et spejl kan skabe en næsten endeløs sløjfe af stråler mellem de reflekterende flader uden en tilsvarende praktisk gevinst i det færdige billede. Allerede to eller tre tilbagespring ligger normalt over, hvad seeren kan opfatte. Ét tilbagespring ville give et sort spejl, fordi lyset mindst skal gennemføre to strækninger for at danne en synlig spejling.
Hvert tilbagespring kan næsten fordoble renderingstiden. Hurtigere behandling af spejlinger giver derfor en stor mulighed for at forbedre kvaliteten af raytracing.
Spejlinger er også nødvendige for fotorealisme i mindre oplagte scener: en gade eller slagmark efter regn, den modsatte side af gaden i et butiksvindue eller en glasdør samt omgivelserne, der kan ses i en figurs briller.
En dobbelt spejling simuleret med traditionel compositing i en ikonisk scene fra The Matrix (1999).

Dobbelt spejling skabt med traditionel compositing i The Matrix (1999).
Billedproblemer
Populære metoder fra tiden før diffusionsmodeller, såsom Neural Radiance Fields (NeRF), og nyere løsninger som Gaussian Splatting har også haft svært ved at skabe naturlige spejlinger.
REF²-NeRF foreslog en NeRF-baseret metode til scener med en glasrude. Brydning og spejling modelleres med både synspunktafhængige og synspunktuafhængige komponenter. Dermed kan forskerne estimere brydende flader som glas og adskille direkte lys fra reflekteret lys.

Eksempler fra Ref²-NeRF-studiet. Kilde: https://arxiv.org/pdf/2311.17116
Andre nyere løsninger omfatter NeRFReN, Reflecting Reality og Metas Planar Reflection-Aware Neural Radiance Fields. For Gaussian Splatting har Mirror-3DGS, Reflective Gaussian Splatting og RefGaussian behandlet problemet, mens Nero i 2023 foreslog en særlig metode til at indarbejde reflekterende egenskaber i neurale repræsentationer.
MirrorVerse
Det er formentlig vanskeligere at få en diffusionsmodel til at følge spejlingens logik end at gøre det med eksplicit strukturelle metoder som Gaussian Splatting og NeRF. En sådan regel kan kun forankres pålideligt, hvis træningsdataene indeholder mange varierede eksempler fra en bred vifte af situationer. Resultatet afhænger derfor i høj grad af datasættets fordeling og kvalitet.
Denne form for adfærd tilføjes traditionelt med en LoRA eller ved finjustering af grundmodellen. Ingen af løsningerne er ideelle: En LoRA har en tendens til at trække resultaterne mod sine egne data, selv uden en udtrykkelig instruktion, mens dyr finjustering kan flytte modellen uigenkaldeligt væk fra hovedgrenen og skabe værktøjer, der er inkompatible med originalen eller andre varianter.
Forbedring af diffusionsmodeller ville kræve større opmærksomhed på spejlingens fysik i dataene. Mange andre svagheder kræver dog samme behandling. I meget store datasæt er skræddersyet udvælgelse vanskelig og dyr, så det er ikke realistisk at rette hver enkelt svaghed på denne måde.
Der dukker alligevel løsninger op. Det indiske MirrorVerse-projekt foreslår et forbedret datasæt og en forbedret træningsmetode, der skal løfte det aktuelle niveau for spejlinger i diffusionsmodeller.
MirrorVerse forbedrer de seneste metoder, men er stadig ikke perfekt. I ét eksempel er keramikkrukkerne forskudt i forhold til deres korrekte position. I et andet, hvor koppen slet ikke burde kunne ses i spejlet, indsættes en forkert spejling til højre trods den naturlige geometri.

MirrorVerse-resultater til højre sammenlignet med to tidligere metoder. Kilde: https://arxiv.org/pdf/2504.15397
Den nye metode er interessant, ikke blot som en mulig ny standard, men også fordi den viser, hvor vanskeligt problemet kan være for både billed- og videodiffusion. De nødvendige eksempler er ofte knyttet til bestemte handlinger og sammenhænge. LDM’er kan derfor fortsat være ringere end NeRF, Gaussian Splatting og traditionel CGI til denne opgave.
Studiet hedder MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Det er skrevet af tre forskere fra Vision and AI Lab, IISc Bangalore og Samsung R&D Institute Bangalore. Projektet har en projektside, et datasæt på Hugging Face og offentliggjort kildekode på GitHub.
Metode
Forfatterne viser først, hvor svært Stable Diffusion og Flux har ved at følge instruktioner om spejlinger. SD3.5 og Flux skaber ofte usammenhængende og geometrisk forkerte spejlbilleder.

SD3.5 og Flux har svært ved at skabe sammenhængende og geometrisk korrekte spejlinger.
De udviklede MirrorFusion 2.0, en generativ diffusionsmodel, som skal forbedre fotorealismen og den geometriske nøjagtighed af spejlinger i syntetiske billeder. Modellen trænes på det nye MirrorGen2-datasæt, som er udviklet til at afhjælpe tidligere metoders svage generalisering.
MirrorGen2 udvider tidligere metoder med tilfældig placering af objekter, tilfældige rotationer og eksplicit forankring til underlaget. Målet er at bevare plausible spejlinger for flere positurer og positioner i forhold til spejlet.

MirrorVerses syntetiske proces placerer, roterer og forankrer objekter tilfældigt og danner sammenhængende par.
For at repræsentere komplekse rumlige relationer indeholder processen også scener med semantisk sammenhængende objektpar. En stol kan eksempelvis kombineres med et bord. Når hovedobjektet er placeret og roteret, anbringes det andet objekt uden overlap i et særskilt område.
Forankring til underlaget forhindrer objekter i at svæve på en unaturlig måde, hvilket ofte sker, når syntetiske data fremstilles i stor skala eller med stærkt automatiserede metoder.
Data og test
SynMirrorV2
SynMirrorV2 skal gøre træningsdata til spejlinger mere varierede og realistiske. Dets 3D-objekter kommer fra Objaverse og Amazon Berkeley Objects (ABO) og forfines derefter med OBJECT 3DIT og filtreringen fra MirrorFusion V1 for at fjerne ressourcer af lav kvalitet. Det endelige korpus indeholder 66.062 objekter.

Eksempler fra Objaverse, som bruges i det nye systems korpus. Kilde: https://arxiv.org/pdf/2212.08051
Scenerne placerer objekterne på teksturerede gulve fra CC-Textures og foran HDRI-baggrunde fra PolyHaven, med vægspejle eller store rektangulære spejle. En lyskilde anbringes over og bag objekterne i en vinkel på 45 grader.
Objekterne skaleres til en enhedskube og placeres ved det på forhånd beregnede overlap mellem spejlets og kameraets synsfelter, så de er synlige. Der anvendes tilfældige rotationer omkring y-aksen, og en forankringsteknik modvirker svævende artefakter.
I komplekse scener opstilles flere objekter som sammenhængende par efter ABO-kategorier. De sekundære objekter placeres uden overlap, hvilket giver 3.140 scener med flere objekter, forskellige okklusioner og dybderelationer.

Renderede scener med flere objekter samt segmenterings- og dybdekort.
Træningsforløb
Da syntetisk realisme ikke er tilstrækkelig til at generalisere til virkelige data, udviklede forskerne et træningsforløb i tre faser til MirrorFusion 2.0.
I fase 1 initialiseres vægtene i konditionerings- og genereringsgrenene fra kontrolpunktet Stable Diffusion v1.5. Modellen finjusteres på delen af SynMirrorV2 med enkeltobjekter. I modsætning til Reflecting Reality fastlåses genereringsgrenen ikke. Træningen varer 40.000 iterationer.
I fase 2 lærer systemet gennem yderligere 10.000 iterationer på delen med flere objekter at håndtere okklusioner og komplekse rumlige opstillinger.
I fase 3 bruges endnu 10.000 iterationer med virkelige data fra MSD og dybdekort fremstillet af den monokulære Matterport3D-estimator.

Virkelige MSD-scener analyseret som dybde- og segmenteringskort. Kilde: https://arxiv.org/pdf/1908.09101
Tekstprompterne udelades under 20 % af træningen for at fremme brugen af dybdeinformation. Alle tre faser køres på fire NVIDIA A100-GPU’er med en læringsrate på 1e-5, en batch på fire elementer pr. GPU og AdamW-optimeringsalgoritmen.
Sværhedsgraden øges trinvis fra enkle syntetiske scener til mere krævende kompositioner for at forbedre overførslen til virkelige miljøer.
Evaluering
MirrorFusion 2.0 sammenlignes med MirrorFusion, den tidligere reference på området, på MirrorBenchV2 med scener med ét eller flere objekter. Kvalitative test bruger også MSD og Google Scanned Objects (GSO).
Evalueringen omfatter 2.991 enkeltobjektbilleder i kendte og ukendte kategorier samt 300 ABO-scener med to objekter. PSNR, SSIM og LPIPS måler kvaliteten af spejlingen i spejlets maskerede område, mens CLIP-lighed vurderer overensstemmelsen med prompterne.
I de kvantitative test bruges fire seeds pr. prompt, og billedet med den bedste SSIM-score vælges. MirrorFusion 2.0 overgår referencen for enkeltobjekter, og den version, som er trænet på flere objekter, overgår versionen uden denne træning i komplekse scener.

Kvantitative resultater på MirrorBenchV2, hvor MirrorFusion 2.0 overgår referencen.
Forfatterne konkluderer, at deres metode slår referencen, og at finjustering med flere objekter forbedrer vanskelige scener.
De mest fremhævede resultater er kvalitative. På MirrorBenchV2 bevarer referencen ikke korrekte spejlinger eller rumlige relationer: En stol vender forkert, og spejlinger af flere objekter forvrænges. Ifølge forfatterne gengiver MirrorFusion 2.0 stolens og sofaernes position, retning og struktur korrekt.

MirrorBenchV2-sammenligning: Den nye metode bevarer bedre position, retning og struktur.
Referencen skabte ofte forkerte rotationer og svævende objekter. Den nye model, trænet på SynMirrorV2, bevarer bedre retning og position i scener med ét eller flere objekter og skaber dermed mere realistiske og sammenhængende spejlinger.
På GSO forvrænger referencen strukturen og skaber ufuldstændige spejlinger. MirrorFusion 2.0 bevarer bedre rumlig integritet, geometri, farver og detaljer, også for objekter uden for træningsfordelingen.

GSO-sammenligning: MirrorFusion 2.0 bevarer bedre geometri, farve og detaljer.
Eksempelvis spejles håndtagene på en skuffe korrekt af den nye model, mens referencen giver et utroværdigt resultat. For en hvid og gul kop gengiver MirrorFusion 2.0 en overbevisende geometri med få artefakter.
Den sidste kvalitative test omhandler virkelige scener fra MSD. Forfatterne vurderer, at MirrorFusion 2.0 bedre gengiver komplekse detaljer, herunder genstande, der ligger tæt sammen på et bord, og flere spejle i et tredimensionelt miljø.

Virkelige MSD-resultater fra MirrorFusion, MirrorFusion 2.0 og versionen finjusteret på MSD.
Modellen klarede sig godt på MirrorBenchV2 og GSO, men havde i begyndelsen problemer med MSD. Finjustering på en del af MSD forbedrede rodede miljøer og scener med flere spejle og gav mere sammenhængende og detaljerede spejlinger i den reserverede testmængde.
I en brugerundersøgelse skal 84 % af deltagerne have foretrukket billederne fra MirrorFusion 2.0 frem for billederne fra referencen. Nærmere oplysninger findes i studiets bilag.

Resultater fra brugerundersøgelsen.
Studier og kildehenvisninger
Studier, datasæt, projektsider og tekniske kilder, der er citeret her:
- liquid dynamics
- past five years
- latent diffusion models
- increasingly focused
- Sora,
- Hunyuan Video
- Wan 2.1
- relative inability
- ray-tracing
- one of the most significant opportunities
- Neural Radiance Fields
- Gaussian Splatting
- REF2-NeRF
- NeRFReN
- Reflecting Reality
- project
- Mirror-3DGS
- Reflective Gaussian Splatting
- RefGaussian
- Nero project
- LoRA
- fine-tuning
- new paper
- associated project page
- dataset at Hugging Face
- released at GitHub
- Flux
- generalization
- Objaverse
- Amazon Berkeley Objects
- OBJECT 3DIT
- MirrorFusion project
- CC-Textures
- PolyHaven
- frustums
- weights
- v1.5
- split
- freeze
- MSD dataset
- Matterport3D
- AdamW
- Google Scanned Objects
- Peak Signal-to-Noise Ratio
- Structural Similarity Index
- Learned Perceptual Image Patch Similarity
- CLIP similarity
Konklusion
Flere af resultaterne er imponerende fremskridt. Det aktuelle niveau for opgaven er dog stadig så lavt, at en samlet set lidet overbevisende løsning kan vinde med en forholdsvis beskeden indsats. Diffusionens grundlæggende arkitektur er dårligt egnet til pålideligt at lære sammenhængende fysik; problemet synes derfor dårligt formuleret og vanskeligt at løse elegant.
At tilføje data for at udfylde hullerne i LDM’er er allerede standardmetoden med alle de nævnte ulemper. Hvis fremtidige store datasæt lægger større vægt på fordelingen og annoteringen af spejlinger, bør de resulterende modeller håndtere dette tilfælde bedre.
Det samme gælder imidlertid mange andre fejl ved LDM’er. Det er vanskeligt at afgøre, hvilken der fortjener det arbejde og den investering, som en løsning som denne kræver.
Først udgivet mandag den 28. april 2025. Tirsdag den 29. april: De sidste afsnit blev grammatisk rettet.












