Andersonin kulma

Heijastusmallien rajoitettu ymmärrys peileistä ja heijastuksista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
ChatGPT-4o and Adobe Firefly

Sen jälkeen kun generatiivinen tekoäly alkoi herättää laajaa kiinnostusta, konenäön tutkimuksessa on panostettu entistä enemmän malleihin, jotka ymmärtävät ja jäljittelevät fysiikan lakeja. Painovoiman ja nesteiden dynamiikan kaltaisten ilmiöiden opettaminen koneoppimisjärjestelmille on kuitenkin ollut merkittävä tutkimushaaste ainakin viiden viime vuoden ajan.

Kun piilevän avaruuden diffuusiomallit (LDM) nousivat generatiivisen tekoälyn hallitsevaksi arkkitehtuuriksi vuonna 2022, tutkijat alkoivat kiinnittää yhä enemmän huomiota niiden rajalliseen kykyyn ymmärtää ja tuottaa fyysisiä ilmiöitä. Kysymys on korostunut OpenAI:n Sora-videomallin sekä avoimen lähdekoodin Hunyuan Video- ja Wan 2.1 -mallien julkaisujen myötä.

Heikkoja heijastuksia

Suurin osa diffuusiomallien fysiikan ymmärtämistä parantavasta tutkimuksesta on keskittynyt kävelyn simulointiin, hiukkasfysiikkaan ja muihin Newtonin liikkeen osa-alueisiin. Ne ovat saaneet huomiota, koska virheet perustavanlaatuisessa liikkeessä rikkovat heti tekoälyvideon uskottavuuden.

Pieni mutta kasvava tutkimussuunta tarkastelee kuitenkin yhtä LDM-mallien suurimmista heikkouksista: niiden suhteellisen huonoa kykyä tuottaa täsmällisiä heijastuksia.

Tammikuussa 2025 julkaistun ”Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections” -tutkimuksen esimerkkejä heijastusten epäonnistumisista ja tutkijoiden omasta menetelmästä. Lähde: https://arxiv.org/pdf/2409.14677

From the tammikuu 2025 paper 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', examples of 'reflection failure' versus the researchers' own approach. Source: https://arxiv.org/pdf/2409.14677

Esimerkkejä heijastusten epäonnistumisista ja tutkimuksen omasta menetelmästä. Lähde: https://arxiv.org/pdf/2409.14677

Sama ongelma tunnettiin jo CGI-aikakaudella, ja se on yhä olennainen videopeleissä, joissa säteenseuranta laskee valon kulkua ja vuorovaikutusta pintojen kanssa. Menetelmä arvioi, miten virtuaaliset valonsäteet heijastuvat esineistä tai kulkevat niiden läpi, jotta heijastukset, taittuminen ja varjot näyttäisivät luonnollisilta.

Jokainen uusi heijastuskerta kasvattaa laskentakustannusta huomattavasti. Siksi reaaliaikaisten sovellusten on tasapainoteltava viiveen ja tarkkuuden välillä rajoittamalla sallittujen heijastusten määrää.

A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Virtuaalisesti lasketun valonsäteen esitys perinteisessä 3D- eli CGI-ympäristössä. Lähde: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Esimerkiksi peilin edessä olevan kromisen teekannun kuvaaminen voisi synnyttää lähes loputtoman silmukan, jossa säteet pomppivat heijastavien pintojen välillä ilman vastaavaa hyötyä lopulliselle kuvalle. Kahden tai kolmen heijastuksen syvyys ylittää useimmiten jo sen, mitä katsoja pystyy havaitsemaan. Yksi heijastus tuottaisi mustan peilin, koska näkyvä heijastus vaatii valolta vähintään kaksi matkaa.

Jokainen lisäaskel kasvattaa kustannusta jyrkästi ja voi jopa kaksinkertaistaa renderöintiajan. Siksi heijastusten tehokkaampi käsittely on yksi merkittävimmistä mahdollisuuksista parantaa säteenseurannan laatua.

Heijastukset ovat välttämättömiä fotorealismille myös vähemmän ilmeisissä tilanteissa: sateen kastelemalla kadulla tai taistelukentällä, liikkeen ikkunassa tai lasiovessa sekä hahmojen silmälaseissa, joissa ympäristön pitäisi näkyä.

Perinteisellä kompositoinnilla toteutettu kaksoisheijastus elokuvan The Matrix (1999) tunnetussa kohtauksessa.

A simulated twin-reflection achieved via traditional compositing for an iconic scene in 'The Matrix' (1999).

Perinteisellä kompositoinnilla toteutettu kaksoisheijastus elokuvassa The Matrix (1999).

Kuvaongelmia

Ennen diffuusiomalleja suositut Neural Radiance Fields (NeRF) -menetelmät ja uudemmat Gaussian Splatting -ratkaisut ovat kamppailleet samoin luonnollisten heijastusten kanssa.

REF²-NeRF ehdotti lasivitriinejä sisältävien kohtausten mallintamista NeRF-menetelmällä. Taittuminen ja heijastus kuvattiin sekä katsojan näkökulmasta riippuvilla että siitä riippumattomilla osilla. Näin tutkijat pystyivät arvioimaan taittavat lasipinnat ja erottamaan suoran ja heijastuneen valon toisistaan.

Examples from the Ref2Nerf paper. Source: https://arxiv.org/pdf/2311.17116

Esimerkkejä Ref²-NeRF-tutkimuksesta. Lähde: https://arxiv.org/pdf/2311.17116

Muita NeRF-heijastusratkaisuja ovat viime vuosina olleet NeRFReN, Reflecting Reality ja Metan Planar Reflection-Aware Neural Radiance Fields. Gaussian Splatting -puolella Mirror-3DGS, Reflective Gaussian Splatting ja RefGaussian ovat käsitelleet samaa ongelmaa, ja vuoden 2023 Nero-projekti esitti oman tapansa lisätä heijastavia ominaisuuksia neuroverkkoesityksiin.

MirrorVerse

Diffuusiomallin saaminen noudattamaan heijastusten geometriaa on todennäköisesti vaikeampaa kuin rakenteisissa menetelmissä, kuten Gaussian Splattingissa ja NeRFissä. Diffuusiomalliin tällainen sääntö juurtuu luotettavasti vain, jos koulutusaineisto sisältää paljon vaihtelevia esimerkkejä monenlaisista tilanteista. Tulos riippuu siten vahvasti alkuperäisen aineiston jakaumasta ja laadusta.

Tällaisia käyttäytymismalleja lisätään tavallisesti LoRA-sovittimella tai perusmallin hienosäädöllä. Kumpikaan ei ole ihanteellinen: LoRA ohjaa tuotoksia oman opetusaineistonsa suuntaan ilman erillistä kehotettakin, kun taas kallis hienosäätö voi erottaa mallin pysyvästi päälinjasta ja synnyttää joukon työkaluja, jotka eivät toimi alkuperäisen tai muiden malliversioiden kanssa.

Diffuusiomallien parantaminen edellyttäisi, että opetusaineisto huomioi heijastusten fysiikan nykyistä paremmin. Samalla monet muutkin ongelmat tarvitsevat vastaavaa erityishuomiota. Hypermittakaavan aineistoissa räätälöity kuratointi on kallista ja vaikeaa, joten jokaisen heikkouden korjaaminen näin ei ole käytännöllistä.

Ratkaisuja syntyy silti ajoittain. Intiassa kehitetty MirrorVerse tarjoaa parannetun aineiston ja koulutusmenetelmän, joka pyrkii siirtämään diffuusiotutkimuksen heijastusten laatua eteenpäin.

Menetelmä parantaa aiempia ratkaisuja mutta ei ole täydellinen. Esimerkeissä keraamiset purkit ovat väärässä kohdassa, ja kuvaan, jossa kupin heijastusta ei geometrian mukaan pitäisi näkyä lainkaan, on pakotettu virheellinen heijastus.

Right-most, the results from MirrorVerse pitted against two prior approaches (central two columns). Source: https://arxiv.org/pdf/2504.15397

MirrorVersen tulokset oikealla verrattuna kahteen aiempaan menetelmään. Lähde: https://arxiv.org/pdf/2504.15397

Uutta menetelmää kannattaa tarkastella paitsi mahdollisena tämänhetkisenä huippuratkaisuna myös osoituksena siitä, kuinka vaikea ongelma heijastus voi olla sekä kuva- että videodiffuusiolle. Tarvittavat esimerkit kietoutuvat usein tiettyihin toimintoihin ja tilanteisiin. Siksi LDM-mallit voivat jatkossakin jäädä jälkeen NeRFin, Gaussian Splattingin ja perinteisen CGI:n kaltaisista rakennekohtaisista menetelmistä.

Uusi tutkimus on nimeltään MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Sen tekijät työskentelevät Vision and AI Labissa, IISc Bangaloressa ja Samsung R&D Institute Bangaloressa. Tutkimuksella on projektisivu, Hugging Face -aineisto sekä GitHubissa julkaistu lähdekoodi.

Menetelmä

Tutkijat osoittavat aluksi, kuinka vaikeaa Stable Diffusionin ja Fluxin kaltaisten mallien on noudattaa heijastuksia koskevia kehotteita. Nykyiset SD3.5- ja Flux-mallit tuottavat usein epäjohdonmukaisia ja geometrisesti virheellisiä peilikuvia.

From the paper: Current state-of-the-art text-to-image models, SD3.5 and Flux, exhibited significant challenges in producing consistent and geometrically accurate reflections when prompted to generate reflections in the scene.

SD3.5- ja Flux-mallien vaikeuksia tuottaa johdonmukaisia ja geometrisesti täsmällisiä heijastuksia.

Tutkimuksessa kehitettiin MirrorFusion 2.0, diffuusiopohjainen generatiivinen malli, jonka tavoitteena on parantaa synteettisten kuvien peiliheijastusten fotorealismia ja geometrista tarkkuutta. Malli koulutettiin tutkijoiden uudella MirrorGen2-aineistolla, joka on suunniteltu korjaamaan aiempien menetelmien yleistämisongelmia.

MirrorGen2 laajentaa aiempia menetelmiä satunnaisella esineiden sijoittelulla, satunnaisilla kierroilla ja esineiden nimenomaisella kiinnittämisellä alustaan. Tavoitteena on säilyttää uskottava heijastus useissa asennoissa ja eri etäisyyksillä peilistä.

Schema for the generation of synthetic data in MirrorVerse: the dataset generation pipeline applied key augmentations by randomly positioning, rotating, and grounding objects within the scene using the 3D-Positioner. Objects are also paired in semantically consistent combinations to simulate complex spatial relationships and occlusions, allowing the dataset to capture more realistic interactions in multi-object scenes.

MirrorVersen synteettisen datan tuotantoputki sijoittaa, kiertää ja maadoittaa esineitä satunnaisesti sekä muodostaa semanttisesti johdonmukaisia pareja.

Monimutkaisia tilasuhteita varten aineisto sisältää myös toisiinsa sopiviksi valittuja esinepareja. Esimerkiksi tuoli yhdistetään pöytään. Ensisijaisen esineen sijoittamisen ja kiertämisen jälkeen toissijainen esine asetetaan niin, etteivät ne mene päällekkäin ja että kummallakin on oma tilansa.

Esineiden kiinnittäminen alustaan estää niitä leijumasta epäluontevasti. Tällaisia virheitä syntyy helposti, kun synteettistä aineistoa tuotetaan suuressa mittakaavassa ja pitkälle automatisoidusti.

Aineisto ja testit

SynMirrorV2

SynMirrorV2-aineisto suunniteltiin lisäämään peiliheijastusten koulutusdatan monipuolisuutta ja realismia. Sen 3D-esineet kerättiin Objaverse- ja Amazon Berkeley Objects (ABO) -aineistoista. Valikoimaa tarkennettiin OBJECT 3DIT -menetelmällä sekä aiemman MirrorFusion V1 -projektin suodatuksella heikkolaatuisten mallien poistamiseksi. Tuloksena oli 66 062 esineen kokoelma.

Examples from the Objaverse dataset, used in the creation of the curated dataset for the new system. Source: https://arxiv.org/pdf/2212.08051

Esimerkkejä Objaverse-aineistosta, jota käytettiin uuden järjestelmän kuratoidun aineiston luomisessa. Lähde: https://arxiv.org/pdf/2212.08051

Kohtaukset rakennettiin sijoittamalla esineet CC-Textures-aineiston kuvioiduille lattioille ja PolyHavenin HDRI-taustoihin. Niissä käytettiin joko koko seinän peilejä tai korkeita suorakulmaisia peilejä. Valaistus vakioitiin esineiden ylä- ja takapuolelle 45 asteen kulmaan asetetulla aluelähteellä.

Esineet skaalattiin yksikkökuution sisään ja sijoitettiin peilin sekä kameran katselukartioiden ennalta laskettuun leikkaukseen, jotta ne näkyisivät kuvassa. Y-akselin ympäri tehtiin satunnaisia kiertoja, ja maadoitusmenetelmä esti leijuvia artefakteja.

Monimutkaisempiin kohtauksiin lisättiin useita esineitä ABO-luokkien semanttisesti johdonmukaisina pareina. Toissijaiset esineet asetettiin niin, etteivät ne menneet päällekkäin. Näin syntyi 3 140 monen esineen kohtausta, jotka kuvaavat erilaisia peittymisiä ja syvyyssuhteita.

Examples of rendered views from the authors' dataset containing multiple (more than two) objects, with illustrations of object segmentation and depth map visualizations seen below.

Useita esineitä sisältäviä renderöityjä näkymiä sekä niiden segmentointi- ja syvyyskarttoja.

Koulutusprosessi

Pelkkä synteettinen realismi ei riittänyt yleistämään todelliseen maailmaan, joten tutkijat rakensivat MirrorFusion 2.0:lle kolmivaiheisen opetussuunnitelman.

Ensimmäisessä vaiheessa ehdollistavan ja tuottavan haaran painot alustettiin Stable Diffusion v1.5 -tarkistuspisteestä. Mallia hienosäädettiin SynMirrorV2:n yhden esineen koulutusosalla. Toisin kuin Reflecting Reality -hankkeessa, tuottavaa haaraa ei jäädytetty. Koulutusta tehtiin 40 000 iteraatiota.

Toisessa vaiheessa mallia hienosäädettiin vielä 10 000 iteraatiota SynMirrorV2:n monen esineen osalla, jotta se oppisi käsittelemään peittymisiä ja todellisia kohtauksia muistuttavia monimutkaisia tilasuhteita.

Kolmannessa vaiheessa tehtiin vielä 10 000 hienosäätöiteraatiota MSD-aineiston todellisilla kuvilla. Syvyyskartat tuotettiin Matterport3D:n monokulaarisella syvyysestimaattorilla.

Examples from the MSD dataset, with real-world scenes analyzed into depth and segmentation maps. Source: https://arxiv.org/pdf/1908.09101

MSD-aineiston todellisia kohtauksia syvyys- ja segmentointikartoiksi analysoituina. Lähde: https://arxiv.org/pdf/1908.09101

Koulutuksen aikana tekstikehote jätettiin pois 20 prosentissa tapauksista, jotta malli käyttäisi syvyystietoa mahdollisimman tehokkaasti. Kaikki vaiheet ajettiin neljällä NVIDIA A100 -grafiikkasuorittimella. Oppimisnopeus oli 1e-5, eräkoko neljä kutakin GPU:ta kohden ja optimoijana AdamW.

Vaikeustaso nousi asteittain yksinkertaisista synteettisistä kohtauksista haastavampiin sommitelmiin. Tavoitteena oli rakentaa kyky siirtää opittu luotettavasti todellisiin tilanteisiin.

Testaus

MirrorFusion 2.0:aa verrattiin aiempaan huipputasoon eli alkuperäiseen MirrorFusioniin MirrorBenchV2-aineistolla, joka sisältää sekä yhden että usean esineen kohtauksia. Laadullisia lisätestejä tehtiin MSD- ja Google Scanned Objects (GSO) -aineistoilla.

Arvioinnissa käytettiin 2 991 yhden esineen kuvaa sekä tutuista että ennennäkemättömistä luokista ja 300 kahden esineen ABO-kohtausta. Peilin maskatun alueen heijastuslaatua mitattiin PSNR-, SSIM- ja LPIPS-mittareilla. CLIP-yhtäläisyyttä käytettiin kuvien ja tekstikehotteiden vastaavuuden arviointiin.

Määrällisissä testeissä kullekin kehotteelle tuotettiin kuvat neljällä satunnaissiemenellä ja tuloksista valittiin parhaan SSIM-arvon saanut kuva. MirrorFusion 2.0 ylitti perustason yhden esineen testissä, ja monella esineellä koulutettu versio voitti ilman niitä koulutetun version monimutkaisissa kohtauksissa.

Left, Quantitative results for single object reflection generation quality on the MirrorBenchV2 single object split. MirrorFusion 2.0 outperformed the baseline, with the best results shown in bold. Right, quantitative results for multiple object reflection generation quality on the MirrorBenchV2 multiple object split. MirrorFusion 2.0 trained with multiple objects outperformed the version trained without them, with the best results shown in bold.

MirrorBenchV2:n yhden ja usean esineen määrälliset tulokset; MirrorFusion 2.0 ylitti perustason.

Tutkijoiden mukaan tulokset osoittavat, että menetelmä ylittää perustason ja monen esineen hienosäätö parantaa tuloksia vaikeissa tilanteissa.

Tekijät painottivat ennen kaikkea laadullisia tuloksia. MirrorBenchV2-vertailussa perustaso ei säilyttänyt heijastuksen tai tilasuhteiden täsmällisyyttä: tuolin suunta oli väärä ja useiden esineiden heijastukset vääristyivät. Tutkijoiden mukaan MirrorFusion 2.0 tuotti tuolin ja sohvat oikeassa sijainnissa, suunnassa ja rakenteessa.

Comparison on MirrorBenchV2: the baseline failed to maintain accurate reflections and spatial consistency, showing incorrect chair orientation and distorted reflections of multiple objects, whereas (the authors contend) MirrorFusion 2.0 correctly renders the chair and the sofas, with accurate position, orientation, and structure.

MirrorBenchV2-vertailu: uusi menetelmä säilytti esineiden sijainnin, suunnan ja rakenteen perustasoa paremmin.

He arvioivat perustason tuottavan usein väärää kiertoa ja leijuvia esineitä. SynMirrorV2:lla koulutettu MirrorFusion 2.0 säilytti esineiden suunnan ja sijainnin paremmin sekä yhden että usean esineen kohtauksissa, mikä teki heijastuksista realistisempia ja yhtenäisempiä.

GSO-aineiston vertailussa perustaso kuvasi esinerakenteita väärin ja tuotti puutteellisia, vääristyneitä heijastuksia. Tekijöiden mukaan MirrorFusion 2.0 säilytti tilallisen eheyden ja tuotti täsmällisemmän geometrian, värin ja yksityiskohdat myös jakauman ulkopuolisille esineille.

Comparison on the GSO dataset. The baseline misrepresented object structure and produced incomplete, distorted reflections, while MirrorFusion 2.0, the authors contend, preserves spatial integrity and generates accurate geometry, color, and detail, even on out-of-distribution objects.

GSO-aineiston vertailu: MirrorFusion 2.0 säilytti geometrian, värin ja yksityiskohdat paremmin.

Esimerkiksi laatikon kahvat heijastuivat MirrorFusion 2.0:ssa oikein, kun perustaso loi epäuskottavan tuloksen. Valko-keltaisen mukin kohdalla uusi malli tuotti vakuuttavan geometrian vähäisin artefaktein, kun perustaso ei kuvannut esineen muotoa ja ulkonäköä oikein.

Viimeinen laadullinen testi käytti todellista MSD-aineistoa. Tekijöiden mukaan MirrorFusion 2.0 kuvasi monimutkaisten kohtausten yksityiskohtia, kuten pöydälle kasautuneita esineitä ja useita peilejä kolmiulotteisessa ympäristössä, aiempaa tarkemmin.

Real-world scene results comparing MirrorFusion, MirrorFusion 2.0, and MirrorFusion 2.0, fine-tuned on the MSD dataset. MirrorFusion 2.0, the authors contend, captures complex scene details more accurately, including cluttered objects on a table, and the presence of multiple mirrors within a three-dimensional environment. Only partial results are shown  here, due to the dimensions of the results in the original paper, to which we refer the reader for full results and better resolution.

Todellisten MSD-kohtausten tulokset MirrorFusionilla, MirrorFusion 2.0:lla ja MSD:llä hienosäädetyllä versiolla.

Malli toimi hyvin MirrorBenchV2- ja GSO-aineistoissa mutta kamppaili aluksi MSD:n monimutkaisten todellisten kohtausten kanssa. Hienosäätö MSD:n osajoukolla paransi sekavien ympäristöjen ja useiden peilien käsittelyä. Testiin jätetyissä kuvissa heijastukset olivat tämän jälkeen yhtenäisempiä ja yksityiskohtaisempia.

Käyttäjätutkimuksessa 84 prosenttia osallistujista piti MirrorFusion 2.0:n tuottamia kuvia perustason kuvia parempina. Tutkimuksen tarkemmat tiedot on sijoitettu artikkelin liitteeseen.

Results of the user study.

Käyttäjätutkimuksen tulokset.

Tutkimukset ja lähdelinkit

Artikkelissa käsitellyt tutkimukset, aineistot, projektisivut ja tekniset taustalähteet:

Johtopäätös

Useat tutkimuksen tulokset parantavat aiempaa huipputasoa vakuuttavasti. Tämän tehtävän lähtötaso on kuitenkin niin heikko, että jo kohtalainen yhdistelmäratkaisu voi voittaa pienelläkin panostuksella. Diffuusiomallin perusrakenne ei sovi johdonmukaisen fysiikan luotettavaan oppimiseen ja esittämiseen, joten ongelma on huonosti asetettu eikä näytä tarjoavan eleganttia ratkaisua.

Lisäaineiston käyttäminen LDM-mallien puutteiden korjaamiseen on jo vakiintunut menetelmä kaikkine aiemmin mainittuine haittoineen. Jos tulevat suuren mittakaavan aineistot kiinnittävät enemmän huomiota heijastuksiin liittyvien esimerkkien jakaumaan ja annotointiin, niillä koulutetut mallit todennäköisesti käsittelevät heijastuksia paremmin.

Sama pätee kuitenkin moniin muihin LDM-tuotosten ongelmiin. On vaikea sanoa, mikä niistä ansaitsee eniten uuden tutkimuksen ehdottaman ratkaisun vaatimaa työtä ja rahaa.

 

Julkaistu ensimmäisen kerran maanantaina 28. huhtikuuta 2025. Tiistaina 29. huhtikuuta: viimeisten kappaleiden kielioppia korjattu.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai