Andersonin kulma
Heijastusmallien rajoitettu ymmärrys peileistä ja heijastuksista

Sen jälkeen kun generatiivinen tekoäly alkoi herättää laajaa kiinnostusta, konenäön tutkimuksessa on panostettu entistä enemmän malleihin, jotka ymmärtävät ja jäljittelevät fysiikan lakeja. Painovoiman ja nesteiden dynamiikan kaltaisten ilmiöiden opettaminen koneoppimisjärjestelmille on kuitenkin ollut merkittävä tutkimushaaste ainakin viiden viime vuoden ajan.
Kun piilevän avaruuden diffuusiomallit (LDM) nousivat generatiivisen tekoälyn hallitsevaksi arkkitehtuuriksi vuonna 2022, tutkijat alkoivat kiinnittää yhä enemmän huomiota niiden rajalliseen kykyyn ymmärtää ja tuottaa fyysisiä ilmiöitä. Kysymys on korostunut OpenAI:n Sora-videomallin sekä avoimen lähdekoodin Hunyuan Video- ja Wan 2.1 -mallien julkaisujen myötä.
Heikkoja heijastuksia
Suurin osa diffuusiomallien fysiikan ymmärtämistä parantavasta tutkimuksesta on keskittynyt kävelyn simulointiin, hiukkasfysiikkaan ja muihin Newtonin liikkeen osa-alueisiin. Ne ovat saaneet huomiota, koska virheet perustavanlaatuisessa liikkeessä rikkovat heti tekoälyvideon uskottavuuden.
Pieni mutta kasvava tutkimussuunta tarkastelee kuitenkin yhtä LDM-mallien suurimmista heikkouksista: niiden suhteellisen huonoa kykyä tuottaa täsmällisiä heijastuksia.
Tammikuussa 2025 julkaistun ”Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections” -tutkimuksen esimerkkejä heijastusten epäonnistumisista ja tutkijoiden omasta menetelmästä. Lähde: https://arxiv.org/pdf/2409.14677

Esimerkkejä heijastusten epäonnistumisista ja tutkimuksen omasta menetelmästä. Lähde: https://arxiv.org/pdf/2409.14677
Sama ongelma tunnettiin jo CGI-aikakaudella, ja se on yhä olennainen videopeleissä, joissa säteenseuranta laskee valon kulkua ja vuorovaikutusta pintojen kanssa. Menetelmä arvioi, miten virtuaaliset valonsäteet heijastuvat esineistä tai kulkevat niiden läpi, jotta heijastukset, taittuminen ja varjot näyttäisivät luonnollisilta.
Jokainen uusi heijastuskerta kasvattaa laskentakustannusta huomattavasti. Siksi reaaliaikaisten sovellusten on tasapainoteltava viiveen ja tarkkuuden välillä rajoittamalla sallittujen heijastusten määrää.
![A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing](https://www.unite.ai/wp-content/uploads/2025/04/ray-tracing.jpg)
Virtuaalisesti lasketun valonsäteen esitys perinteisessä 3D- eli CGI-ympäristössä. Lähde: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
Esimerkiksi peilin edessä olevan kromisen teekannun kuvaaminen voisi synnyttää lähes loputtoman silmukan, jossa säteet pomppivat heijastavien pintojen välillä ilman vastaavaa hyötyä lopulliselle kuvalle. Kahden tai kolmen heijastuksen syvyys ylittää useimmiten jo sen, mitä katsoja pystyy havaitsemaan. Yksi heijastus tuottaisi mustan peilin, koska näkyvä heijastus vaatii valolta vähintään kaksi matkaa.
Jokainen lisäaskel kasvattaa kustannusta jyrkästi ja voi jopa kaksinkertaistaa renderöintiajan. Siksi heijastusten tehokkaampi käsittely on yksi merkittävimmistä mahdollisuuksista parantaa säteenseurannan laatua.
Heijastukset ovat välttämättömiä fotorealismille myös vähemmän ilmeisissä tilanteissa: sateen kastelemalla kadulla tai taistelukentällä, liikkeen ikkunassa tai lasiovessa sekä hahmojen silmälaseissa, joissa ympäristön pitäisi näkyä.
Perinteisellä kompositoinnilla toteutettu kaksoisheijastus elokuvan The Matrix (1999) tunnetussa kohtauksessa.

Perinteisellä kompositoinnilla toteutettu kaksoisheijastus elokuvassa The Matrix (1999).
Kuvaongelmia
Ennen diffuusiomalleja suositut Neural Radiance Fields (NeRF) -menetelmät ja uudemmat Gaussian Splatting -ratkaisut ovat kamppailleet samoin luonnollisten heijastusten kanssa.
REF²-NeRF ehdotti lasivitriinejä sisältävien kohtausten mallintamista NeRF-menetelmällä. Taittuminen ja heijastus kuvattiin sekä katsojan näkökulmasta riippuvilla että siitä riippumattomilla osilla. Näin tutkijat pystyivät arvioimaan taittavat lasipinnat ja erottamaan suoran ja heijastuneen valon toisistaan.

Esimerkkejä Ref²-NeRF-tutkimuksesta. Lähde: https://arxiv.org/pdf/2311.17116
Muita NeRF-heijastusratkaisuja ovat viime vuosina olleet NeRFReN, Reflecting Reality ja Metan Planar Reflection-Aware Neural Radiance Fields. Gaussian Splatting -puolella Mirror-3DGS, Reflective Gaussian Splatting ja RefGaussian ovat käsitelleet samaa ongelmaa, ja vuoden 2023 Nero-projekti esitti oman tapansa lisätä heijastavia ominaisuuksia neuroverkkoesityksiin.
MirrorVerse
Diffuusiomallin saaminen noudattamaan heijastusten geometriaa on todennäköisesti vaikeampaa kuin rakenteisissa menetelmissä, kuten Gaussian Splattingissa ja NeRFissä. Diffuusiomalliin tällainen sääntö juurtuu luotettavasti vain, jos koulutusaineisto sisältää paljon vaihtelevia esimerkkejä monenlaisista tilanteista. Tulos riippuu siten vahvasti alkuperäisen aineiston jakaumasta ja laadusta.
Tällaisia käyttäytymismalleja lisätään tavallisesti LoRA-sovittimella tai perusmallin hienosäädöllä. Kumpikaan ei ole ihanteellinen: LoRA ohjaa tuotoksia oman opetusaineistonsa suuntaan ilman erillistä kehotettakin, kun taas kallis hienosäätö voi erottaa mallin pysyvästi päälinjasta ja synnyttää joukon työkaluja, jotka eivät toimi alkuperäisen tai muiden malliversioiden kanssa.
Diffuusiomallien parantaminen edellyttäisi, että opetusaineisto huomioi heijastusten fysiikan nykyistä paremmin. Samalla monet muutkin ongelmat tarvitsevat vastaavaa erityishuomiota. Hypermittakaavan aineistoissa räätälöity kuratointi on kallista ja vaikeaa, joten jokaisen heikkouden korjaaminen näin ei ole käytännöllistä.
Ratkaisuja syntyy silti ajoittain. Intiassa kehitetty MirrorVerse tarjoaa parannetun aineiston ja koulutusmenetelmän, joka pyrkii siirtämään diffuusiotutkimuksen heijastusten laatua eteenpäin.
Menetelmä parantaa aiempia ratkaisuja mutta ei ole täydellinen. Esimerkeissä keraamiset purkit ovat väärässä kohdassa, ja kuvaan, jossa kupin heijastusta ei geometrian mukaan pitäisi näkyä lainkaan, on pakotettu virheellinen heijastus.

MirrorVersen tulokset oikealla verrattuna kahteen aiempaan menetelmään. Lähde: https://arxiv.org/pdf/2504.15397
Uutta menetelmää kannattaa tarkastella paitsi mahdollisena tämänhetkisenä huippuratkaisuna myös osoituksena siitä, kuinka vaikea ongelma heijastus voi olla sekä kuva- että videodiffuusiolle. Tarvittavat esimerkit kietoutuvat usein tiettyihin toimintoihin ja tilanteisiin. Siksi LDM-mallit voivat jatkossakin jäädä jälkeen NeRFin, Gaussian Splattingin ja perinteisen CGI:n kaltaisista rakennekohtaisista menetelmistä.
Uusi tutkimus on nimeltään MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Sen tekijät työskentelevät Vision and AI Labissa, IISc Bangaloressa ja Samsung R&D Institute Bangaloressa. Tutkimuksella on projektisivu, Hugging Face -aineisto sekä GitHubissa julkaistu lähdekoodi.
Menetelmä
Tutkijat osoittavat aluksi, kuinka vaikeaa Stable Diffusionin ja Fluxin kaltaisten mallien on noudattaa heijastuksia koskevia kehotteita. Nykyiset SD3.5- ja Flux-mallit tuottavat usein epäjohdonmukaisia ja geometrisesti virheellisiä peilikuvia.

SD3.5- ja Flux-mallien vaikeuksia tuottaa johdonmukaisia ja geometrisesti täsmällisiä heijastuksia.
Tutkimuksessa kehitettiin MirrorFusion 2.0, diffuusiopohjainen generatiivinen malli, jonka tavoitteena on parantaa synteettisten kuvien peiliheijastusten fotorealismia ja geometrista tarkkuutta. Malli koulutettiin tutkijoiden uudella MirrorGen2-aineistolla, joka on suunniteltu korjaamaan aiempien menetelmien yleistämisongelmia.
MirrorGen2 laajentaa aiempia menetelmiä satunnaisella esineiden sijoittelulla, satunnaisilla kierroilla ja esineiden nimenomaisella kiinnittämisellä alustaan. Tavoitteena on säilyttää uskottava heijastus useissa asennoissa ja eri etäisyyksillä peilistä.

MirrorVersen synteettisen datan tuotantoputki sijoittaa, kiertää ja maadoittaa esineitä satunnaisesti sekä muodostaa semanttisesti johdonmukaisia pareja.
Monimutkaisia tilasuhteita varten aineisto sisältää myös toisiinsa sopiviksi valittuja esinepareja. Esimerkiksi tuoli yhdistetään pöytään. Ensisijaisen esineen sijoittamisen ja kiertämisen jälkeen toissijainen esine asetetaan niin, etteivät ne mene päällekkäin ja että kummallakin on oma tilansa.
Esineiden kiinnittäminen alustaan estää niitä leijumasta epäluontevasti. Tällaisia virheitä syntyy helposti, kun synteettistä aineistoa tuotetaan suuressa mittakaavassa ja pitkälle automatisoidusti.
Aineisto ja testit
SynMirrorV2
SynMirrorV2-aineisto suunniteltiin lisäämään peiliheijastusten koulutusdatan monipuolisuutta ja realismia. Sen 3D-esineet kerättiin Objaverse- ja Amazon Berkeley Objects (ABO) -aineistoista. Valikoimaa tarkennettiin OBJECT 3DIT -menetelmällä sekä aiemman MirrorFusion V1 -projektin suodatuksella heikkolaatuisten mallien poistamiseksi. Tuloksena oli 66 062 esineen kokoelma.

Esimerkkejä Objaverse-aineistosta, jota käytettiin uuden järjestelmän kuratoidun aineiston luomisessa. Lähde: https://arxiv.org/pdf/2212.08051
Kohtaukset rakennettiin sijoittamalla esineet CC-Textures-aineiston kuvioiduille lattioille ja PolyHavenin HDRI-taustoihin. Niissä käytettiin joko koko seinän peilejä tai korkeita suorakulmaisia peilejä. Valaistus vakioitiin esineiden ylä- ja takapuolelle 45 asteen kulmaan asetetulla aluelähteellä.
Esineet skaalattiin yksikkökuution sisään ja sijoitettiin peilin sekä kameran katselukartioiden ennalta laskettuun leikkaukseen, jotta ne näkyisivät kuvassa. Y-akselin ympäri tehtiin satunnaisia kiertoja, ja maadoitusmenetelmä esti leijuvia artefakteja.
Monimutkaisempiin kohtauksiin lisättiin useita esineitä ABO-luokkien semanttisesti johdonmukaisina pareina. Toissijaiset esineet asetettiin niin, etteivät ne menneet päällekkäin. Näin syntyi 3 140 monen esineen kohtausta, jotka kuvaavat erilaisia peittymisiä ja syvyyssuhteita.

Useita esineitä sisältäviä renderöityjä näkymiä sekä niiden segmentointi- ja syvyyskarttoja.
Koulutusprosessi
Pelkkä synteettinen realismi ei riittänyt yleistämään todelliseen maailmaan, joten tutkijat rakensivat MirrorFusion 2.0:lle kolmivaiheisen opetussuunnitelman.
Ensimmäisessä vaiheessa ehdollistavan ja tuottavan haaran painot alustettiin Stable Diffusion v1.5 -tarkistuspisteestä. Mallia hienosäädettiin SynMirrorV2:n yhden esineen koulutusosalla. Toisin kuin Reflecting Reality -hankkeessa, tuottavaa haaraa ei jäädytetty. Koulutusta tehtiin 40 000 iteraatiota.
Toisessa vaiheessa mallia hienosäädettiin vielä 10 000 iteraatiota SynMirrorV2:n monen esineen osalla, jotta se oppisi käsittelemään peittymisiä ja todellisia kohtauksia muistuttavia monimutkaisia tilasuhteita.
Kolmannessa vaiheessa tehtiin vielä 10 000 hienosäätöiteraatiota MSD-aineiston todellisilla kuvilla. Syvyyskartat tuotettiin Matterport3D:n monokulaarisella syvyysestimaattorilla.

MSD-aineiston todellisia kohtauksia syvyys- ja segmentointikartoiksi analysoituina. Lähde: https://arxiv.org/pdf/1908.09101
Koulutuksen aikana tekstikehote jätettiin pois 20 prosentissa tapauksista, jotta malli käyttäisi syvyystietoa mahdollisimman tehokkaasti. Kaikki vaiheet ajettiin neljällä NVIDIA A100 -grafiikkasuorittimella. Oppimisnopeus oli 1e-5, eräkoko neljä kutakin GPU:ta kohden ja optimoijana AdamW.
Vaikeustaso nousi asteittain yksinkertaisista synteettisistä kohtauksista haastavampiin sommitelmiin. Tavoitteena oli rakentaa kyky siirtää opittu luotettavasti todellisiin tilanteisiin.
Testaus
MirrorFusion 2.0:aa verrattiin aiempaan huipputasoon eli alkuperäiseen MirrorFusioniin MirrorBenchV2-aineistolla, joka sisältää sekä yhden että usean esineen kohtauksia. Laadullisia lisätestejä tehtiin MSD- ja Google Scanned Objects (GSO) -aineistoilla.
Arvioinnissa käytettiin 2 991 yhden esineen kuvaa sekä tutuista että ennennäkemättömistä luokista ja 300 kahden esineen ABO-kohtausta. Peilin maskatun alueen heijastuslaatua mitattiin PSNR-, SSIM- ja LPIPS-mittareilla. CLIP-yhtäläisyyttä käytettiin kuvien ja tekstikehotteiden vastaavuuden arviointiin.
Määrällisissä testeissä kullekin kehotteelle tuotettiin kuvat neljällä satunnaissiemenellä ja tuloksista valittiin parhaan SSIM-arvon saanut kuva. MirrorFusion 2.0 ylitti perustason yhden esineen testissä, ja monella esineellä koulutettu versio voitti ilman niitä koulutetun version monimutkaisissa kohtauksissa.

MirrorBenchV2:n yhden ja usean esineen määrälliset tulokset; MirrorFusion 2.0 ylitti perustason.
Tutkijoiden mukaan tulokset osoittavat, että menetelmä ylittää perustason ja monen esineen hienosäätö parantaa tuloksia vaikeissa tilanteissa.
Tekijät painottivat ennen kaikkea laadullisia tuloksia. MirrorBenchV2-vertailussa perustaso ei säilyttänyt heijastuksen tai tilasuhteiden täsmällisyyttä: tuolin suunta oli väärä ja useiden esineiden heijastukset vääristyivät. Tutkijoiden mukaan MirrorFusion 2.0 tuotti tuolin ja sohvat oikeassa sijainnissa, suunnassa ja rakenteessa.

MirrorBenchV2-vertailu: uusi menetelmä säilytti esineiden sijainnin, suunnan ja rakenteen perustasoa paremmin.
He arvioivat perustason tuottavan usein väärää kiertoa ja leijuvia esineitä. SynMirrorV2:lla koulutettu MirrorFusion 2.0 säilytti esineiden suunnan ja sijainnin paremmin sekä yhden että usean esineen kohtauksissa, mikä teki heijastuksista realistisempia ja yhtenäisempiä.
GSO-aineiston vertailussa perustaso kuvasi esinerakenteita väärin ja tuotti puutteellisia, vääristyneitä heijastuksia. Tekijöiden mukaan MirrorFusion 2.0 säilytti tilallisen eheyden ja tuotti täsmällisemmän geometrian, värin ja yksityiskohdat myös jakauman ulkopuolisille esineille.

GSO-aineiston vertailu: MirrorFusion 2.0 säilytti geometrian, värin ja yksityiskohdat paremmin.
Esimerkiksi laatikon kahvat heijastuivat MirrorFusion 2.0:ssa oikein, kun perustaso loi epäuskottavan tuloksen. Valko-keltaisen mukin kohdalla uusi malli tuotti vakuuttavan geometrian vähäisin artefaktein, kun perustaso ei kuvannut esineen muotoa ja ulkonäköä oikein.
Viimeinen laadullinen testi käytti todellista MSD-aineistoa. Tekijöiden mukaan MirrorFusion 2.0 kuvasi monimutkaisten kohtausten yksityiskohtia, kuten pöydälle kasautuneita esineitä ja useita peilejä kolmiulotteisessa ympäristössä, aiempaa tarkemmin.

Todellisten MSD-kohtausten tulokset MirrorFusionilla, MirrorFusion 2.0:lla ja MSD:llä hienosäädetyllä versiolla.
Malli toimi hyvin MirrorBenchV2- ja GSO-aineistoissa mutta kamppaili aluksi MSD:n monimutkaisten todellisten kohtausten kanssa. Hienosäätö MSD:n osajoukolla paransi sekavien ympäristöjen ja useiden peilien käsittelyä. Testiin jätetyissä kuvissa heijastukset olivat tämän jälkeen yhtenäisempiä ja yksityiskohtaisempia.
Käyttäjätutkimuksessa 84 prosenttia osallistujista piti MirrorFusion 2.0:n tuottamia kuvia perustason kuvia parempina. Tutkimuksen tarkemmat tiedot on sijoitettu artikkelin liitteeseen.

Käyttäjätutkimuksen tulokset.
Tutkimukset ja lähdelinkit
Artikkelissa käsitellyt tutkimukset, aineistot, projektisivut ja tekniset taustalähteet:
- liquid dynamics
- past five years
- latent diffusion models
- increasingly focused
- Sora,
- Hunyuan Video
- Wan 2.1
- relative inability
- ray-tracing
- one of the most significant opportunities
- Neural Radiance Fields
- Gaussian Splatting
- REF2-NeRF
- NeRFReN
- Reflecting Reality
- project
- Mirror-3DGS
- Reflective Gaussian Splatting
- RefGaussian
- Nero project
- LoRA
- fine-tuning
- new paper
- associated project page
- dataset at Hugging Face
- released at GitHub
- Flux
- generalization
- Objaverse
- Amazon Berkeley Objects
- OBJECT 3DIT
- MirrorFusion project
- CC-Textures
- PolyHaven
- frustums
- weights
- v1.5
- split
- freeze
- MSD dataset
- Matterport3D
- AdamW
- Google Scanned Objects
- Peak Signal-to-Noise Ratio
- Structural Similarity Index
- Learned Perceptual Image Patch Similarity
- CLIP similarity
Johtopäätös
Useat tutkimuksen tulokset parantavat aiempaa huipputasoa vakuuttavasti. Tämän tehtävän lähtötaso on kuitenkin niin heikko, että jo kohtalainen yhdistelmäratkaisu voi voittaa pienelläkin panostuksella. Diffuusiomallin perusrakenne ei sovi johdonmukaisen fysiikan luotettavaan oppimiseen ja esittämiseen, joten ongelma on huonosti asetettu eikä näytä tarjoavan eleganttia ratkaisua.
Lisäaineiston käyttäminen LDM-mallien puutteiden korjaamiseen on jo vakiintunut menetelmä kaikkine aiemmin mainittuine haittoineen. Jos tulevat suuren mittakaavan aineistot kiinnittävät enemmän huomiota heijastuksiin liittyvien esimerkkien jakaumaan ja annotointiin, niillä koulutetut mallit todennäköisesti käsittelevät heijastuksia paremmin.
Sama pätee kuitenkin moniin muihin LDM-tuotosten ongelmiin. On vaikea sanoa, mikä niistä ansaitsee eniten uuden tutkimuksen ehdottaman ratkaisun vaatimaa työtä ja rahaa.
Julkaistu ensimmäisen kerran maanantaina 28. huhtikuuta 2025. Tiistaina 29. huhtikuuta: viimeisten kappaleiden kielioppia korjattu.












