Unghiul lui Anderson
Rezolvarea limitărilor modelelor de difuzie în înțelegerea oglinzilor și reflexiilor

De când inteligența artificială generativă a atras atenția publicului, cercetarea în domeniul vederii computerizate a aprofundat dezvoltarea modelelor capabile să înțeleagă și să reproducă legile fizicii. Totuși, instruirea sistemelor de învățare automată pentru a simula gravitația sau dinamica fluidelor a rămas o provocare majoră timp de cel puțin cinci ani.
Pe măsură ce modelele de difuzie latentă (LDM) au ajuns să domine inteligența artificială generativă, cercetătorii au devenit tot mai preocupați de capacitatea lor limitată de a înțelege și reproduce fenomene fizice. Problema a căpătat o importanță sporită odată cu Sora de la OpenAI și apoi cu modelele video deschise Hunyuan Video și Wan 2.1.
Reflexii neconvingătoare
Cea mai mare parte a cercetării menite să îmbunătățească înțelegerea fizicii de către LDM-uri se concentrează pe simularea mersului, fizica particulelor și alte aspecte ale mișcării newtoniene. Aceste domenii atrag atenția deoarece o eroare într-un comportament fizic elementar distruge imediat autenticitatea unui videoclip generat de inteligența artificială.
O direcție mai restrânsă, dar în creștere, studiază însă una dintre marile slăbiciuni ale LDM-urilor: incapacitatea lor relativă de a produce reflexii corecte.
Exemple de eșecuri ale reflexiilor și ale metodei propuse în studiul din ianuarie 2025 „Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections”. Sursa: https://arxiv.org/pdf/2409.14677

Exemple de erori ale reflexiilor și ale metodei propuse. Sursa: https://arxiv.org/pdf/2409.14677
Problema exista deja în epoca imaginilor generate pe computer și rămâne importantă în jocurile video, unde algoritmii de ray tracing simulează traseul luminii atunci când aceasta interacționează cu suprafețele. Ei calculează felul în care razele virtuale ricoșează de pe obiecte sau trec prin ele pentru a crea reflexii, refracții și umbre realiste.
Fiecare ricoșeu suplimentar mărește considerabil costul de calcul. Aplicațiile în timp real trebuie, prin urmare, să echilibreze latența și precizia prin limitarea numărului de ricoșeuri permise.
![A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing](https://www.unite.ai/wp-content/uploads/2025/04/ray-tracing.jpg)
O rază calculată într-un mediu 3D sau CGI tradițional. Sursa: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
Un ceainic cromat așezat în fața unei oglinzi ar putea provoca o buclă aproape infinită de raze între suprafețele reflectorizante, fără un beneficiu practic echivalent pentru imaginea finală. Două sau trei ricoșeuri depășesc deja, în general, ceea ce poate percepe privitorul. Un singur ricoșeu ar produce o oglindă neagră, deoarece lumina trebuie să parcurgă cel puțin două trasee pentru a forma o reflexie vizibilă.
Fiecare ricoșeu poate aproape dubla timpul de randare. Prelucrarea mai rapidă a reflexiilor reprezintă astfel o oportunitate importantă de a îmbunătăți calitatea ray tracing-ului.
Reflexiile sunt indispensabile și pentru fotorealismul unor scene mai puțin evidente: o stradă sau un câmp de luptă după ploaie, partea opusă a străzii surprinsă într-o vitrină ori într-o ușă de sticlă sau mediul vizibil în ochelarii unui personaj.
O reflexie dublă simulată prin compoziție tradițională într-o scenă emblematică din The Matrix (1999).

Reflexie dublă creată prin compoziție tradițională în The Matrix (1999).
Probleme de imagine
Metodele populare de dinaintea modelelor de difuzie, precum Neural Radiance Fields (NeRF), și soluțiile mai recente, cum ar fi Gaussian Splatting, au întâmpinat la rândul lor dificultăți în producerea unor reflexii naturale.
REF²-NeRF a propus o metodă bazată pe NeRF pentru scenele care includ un geam. Refracția și reflexia sunt modelate cu componente dependente și independente de punctul de vedere. Cercetătorii pot astfel estima suprafețele refractive, inclusiv sticla, și pot separa lumina directă de cea reflectată.

Exemple din studiul Ref²-NeRF. Sursa: https://arxiv.org/pdf/2311.17116
Printre celelalte soluții recente se numără NeRFReN, Reflecting Reality și Planar Reflection-Aware Neural Radiance Fields de la Meta. Pentru Gaussian Splatting, Mirror-3DGS, Reflective Gaussian Splatting și RefGaussian au abordat problema, iar Nero a propus în 2023 o metodă specială de integrare a proprietăților reflectorizante în reprezentările neurale.
MirrorVerse
Probabil că este mai dificil să impui logica reflexiilor unui model de difuzie decât unor metode explicit structurale precum Gaussian Splatting și NeRF. O asemenea regulă poate fi ancorată în mod fiabil numai dacă datele de antrenare conțin numeroase exemple variate într-o gamă largă de situații. Rezultatul depinde, așadar, în mare măsură de distribuția și calitatea setului de date.
Aceste comportamente sunt adăugate în mod tradițional cu un LoRA sau prin reglarea fină a modelului de bază. Nicio soluție nu este ideală: un LoRA tinde să orienteze rezultatele către propriile date chiar și fără o instrucțiune explicită, în timp ce o reglare fină costisitoare poate îndepărta ireversibil modelul de ramura sa principală și poate crea instrumente incompatibile cu originalul sau cu alte variante.
Îmbunătățirea modelelor de difuzie ar necesita o atenție mai mare acordată fizicii reflexiilor în date. Însă multe alte slăbiciuni necesită același tratament. La scara seturilor uriașe de date, selecția personalizată este dificilă și costisitoare; corectarea fiecărei slăbiciuni în acest mod nu este, prin urmare, realistă.
Totuși, apar soluții. Proiectul indian MirrorVerse propune un set de date și o metodă de antrenare îmbunătățite pentru a avansa stadiul actual al reflexiilor în modelele de difuzie.
MirrorVerse îmbunătățește metodele recente, dar rămâne imperfect. Într-un exemplu, vasele din ceramică sunt deplasate față de poziția lor corectă. În altul, în care ceașca nu ar trebui să apară în oglindă, o reflexie eronată este introdusă în partea dreaptă, în pofida geometriei naturale.

Rezultatele MirrorVerse în dreapta, comparate cu două metode anterioare. Sursa: https://arxiv.org/pdf/2504.15397
Noua metodă merită atenție nu doar ca posibil nou reper, ci și fiindcă arată cât de greu de rezolvat poate fi această problemă atât pentru difuzia de imagini, cât și pentru cea video. Exemplele necesare sunt adesea legate de acțiuni și contexte specifice. Prin urmare, LDM-urile ar putea rămâne inferioare metodelor NeRF, Gaussian Splatting și imaginilor generate tradițional pentru această funcție.
Studiul se intitulează MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Este semnat de trei cercetători de la Vision and AI Lab, IISc Bangalore și Samsung R&D Institute Bangalore. Proiectul dispune de o pagină proprie, un set de date pe Hugging Face și cod sursă publicat pe GitHub.
Metodă
Autorii arată mai întâi cât de greu le este modelelor Stable Diffusion și Flux să respecte instrucțiunile referitoare la reflexii. SD3.5 și Flux produc adesea reflexii incoerente și incorecte din punct de vedere geometric.

SD3.5 și Flux întâmpină dificultăți în generarea unor reflexii coerente și corecte geometric.
Ei au dezvoltat MirrorFusion 2.0, un model generativ de difuzie menit să îmbunătățească fotorealismul și precizia geometrică a reflexiilor din imaginile sintetice. Modelul este antrenat pe noul set MirrorGen2, conceput să corecteze slaba generalizare a abordărilor anterioare.
MirrorGen2 extinde metodele anterioare prin poziționarea aleatorie a obiectelor, rotații aleatorii și ancorare explicită la sol. Scopul este de a păstra reflexii plauzibile pentru mai multe ipostaze și poziții în raport cu oglinda.

Fluxul sintetic MirrorVerse poziționează, rotește și ancorează aleatoriu obiectele și creează perechi coerente.
Pentru a reprezenta relații spațiale complexe, fluxul de lucru include și scene cu perechi de obiecte coerente semantic. De exemplu, un scaun este asociat cu o masă. După amplasarea și rotirea obiectului principal, cel de-al doilea este așezat fără suprapunere, într-o regiune distinctă.
Ancorarea la sol împiedică obiectele să plutească în mod necorespunzător, un defect frecvent atunci când datele sintetice sunt produse la scară mare sau prin metode puternic automatizate.
Date și teste
SynMirrorV2
SynMirrorV2 urmărește să diversifice și să facă mai realiste datele de antrenare pentru reflexii. Obiectele sale 3D provin din Objaverse și Amazon Berkeley Objects (ABO), apoi sunt rafinate cu OBJECT 3DIT și filtrarea MirrorFusion V1 pentru a elimina resursele de calitate slabă. Corpusul final cuprinde 66.062 de obiecte.

Exemple din Objaverse, folosit pentru corpusul noului sistem. Sursa: https://arxiv.org/pdf/2212.08051
Scenele așază aceste obiecte pe pardoseli texturate provenite din CC-Textures și pe fundaluri HDRI de la PolyHaven, în fața unor oglinzi de perete sau a unor oglinzi dreptunghiulare mari. O sursă de lumină este plasată deasupra și în spatele obiectelor, la 45 de grade.
Obiectele sunt redimensionate într-un cub unitar și amplasate la intersecția precalculată a câmpurilor vizuale ale oglinzii și camerei, pentru a le garanta vizibilitatea. Sunt aplicate rotații aleatorii în jurul axei y, iar o tehnică de ancorare evită artefactele plutitoare.
Pentru scenele complexe, mai multe obiecte sunt așezate în perechi coerente potrivit categoriilor ABO. Obiectele secundare evită suprapunerile, producând 3.140 de scene cu mai multe obiecte și cu diverse ocluziuni și relații de profunzime.

Scene randate cu mai multe obiecte și hărți de segmentare și profunzime.
Procesul de antrenare
Întrucât realismul sintetic nu este suficient pentru generalizarea la date reale, cercetătorii au elaborat un program în trei etape pentru MirrorFusion 2.0.
În etapa 1, ponderile ramurilor de condiționare și generare sunt inițializate cu punctul de control Stable Diffusion v1.5. Modelul este reglat fin pe porțiunea cu un singur obiect din SynMirrorV2. Spre deosebire de Reflecting Reality, ramura de generare nu este înghețată. Antrenarea durează 40.000 de iterații.
În etapa 2, alte 10.000 de iterații pe porțiunea cu mai multe obiecte învață sistemul să gestioneze ocluziunile și configurațiile spațiale complexe.
În etapa 3, alte 10.000 de iterații folosesc date reale din MSD și hărți de profunzime produse de estimatorul monocular Matterport3D.

Scene reale MSD analizate sub forma hărților de profunzime și segmentare. Sursa: https://arxiv.org/pdf/1908.09101
Prompturile text sunt omise în 20% din timpul antrenării pentru a favoriza utilizarea informațiilor de profunzime. Cele trei etape rulează pe patru GPU-uri NVIDIA A100, cu o rată de învățare de 1e-5, loturi de patru elemente pentru fiecare GPU și optimizatorul AdamW.
Dificultatea crește treptat, de la scene sintetice simple la compoziții mai solicitante, pentru a îmbunătăți transferul către lumea reală.
Evaluare
MirrorFusion 2.0 este comparat cu MirrorFusion, fostul reper al domeniului, pe MirrorBenchV2, folosind scene cu unul sau mai multe obiecte. Testele calitative folosesc și MSD și Google Scanned Objects (GSO).
Evaluarea cuprinde 2.991 de imagini cu un singur obiect din categorii cunoscute și necunoscute, precum și 300 de scene ABO cu două obiecte. PSNR, SSIM și LPIPS măsoară calitatea reflexiei în zona mascată a oglinzii, iar similaritatea CLIP evaluează alinierea cu prompturile.
Pentru testele cantitative se folosesc patru valori inițiale pentru fiecare prompt și se păstrează imaginea cu cel mai bun scor SSIM. MirrorFusion 2.0 depășește modelul de referință în cazul obiectelor unice, iar versiunea antrenată pe mai multe obiecte o depășește pe cea care nu a beneficiat de acest antrenament în scenele complexe.

Rezultate cantitative pe MirrorBenchV2; MirrorFusion 2.0 depășește reperul.
Autorii concluzionează că metoda lor depășește reperul și că reglarea pe mai multe obiecte îmbunătățește scenele dificile.
Rezultatele cele mai evidențiate sunt calitative. Pe MirrorBenchV2, reperul nu păstrează reflexii și relații spațiale corecte: orientarea unui scaun este greșită, iar reflexiile mai multor obiecte sunt deformate. Potrivit autorilor, MirrorFusion 2.0 redă corect poziția, orientarea și structura scaunului și canapelelor.

Comparație MirrorBenchV2: noua metodă păstrează mai bine poziția, orientarea și structura.
Modelul de referință producea adesea rotații greșite și obiecte plutitoare. Antrenat pe SynMirrorV2, noul model păstrează mai bine orientarea și poziția în scene cu unul sau mai multe obiecte, generând reflexii mai realiste și mai coerente.
Pe GSO, reperul deformează structura și creează reflexii incomplete. MirrorFusion 2.0 păstrează mai bine integritatea spațială, geometria, culorile și detaliile, chiar și pentru obiecte din afara distribuției de antrenare.

Comparație GSO: MirrorFusion 2.0 păstrează mai bine geometria, culoarea și detaliile.
De exemplu, mânerele unui sertar sunt reflectate corect de noul model, în timp ce reperul produce un rezultat neverosimil. Pentru o ceașcă albă și galbenă, MirrorFusion 2.0 redă o geometrie convingătoare, cu puține artefacte.
Ultimul test calitativ vizează scene reale din MSD. Autorii consideră că MirrorFusion 2.0 redă mai bine detalii complexe, printre care obiecte îngrămădite pe o masă și mai multe oglinzi într-un mediu tridimensional.

Rezultate MSD reale pentru MirrorFusion, MirrorFusion 2.0 și versiunea reglată pe MSD.
Modelul a funcționat bine pe MirrorBenchV2 și GSO, dar inițial a întâmpinat dificultăți pe MSD. Reglarea fină pe o parte din MSD a îmbunătățit mediile aglomerate și scenele cu mai multe oglinzi, oferind reflexii mai coerente și detaliate în setul de testare rezervat.
Într-un studiu cu utilizatori, 84% dintre participanți ar fi preferat imaginile MirrorFusion 2.0 celor produse de reper. Detaliile se găsesc în anexa lucrării.

Rezultatele studiului cu utilizatori.
Studii și legături către surse
Studii, seturi de date, pagini de proiect și surse tehnice citate aici:
- liquid dynamics
- past five years
- latent diffusion models
- increasingly focused
- Sora,
- Hunyuan Video
- Wan 2.1
- relative inability
- ray-tracing
- one of the most significant opportunities
- Neural Radiance Fields
- Gaussian Splatting
- REF2-NeRF
- NeRFReN
- Reflecting Reality
- project
- Mirror-3DGS
- Reflective Gaussian Splatting
- RefGaussian
- Nero project
- LoRA
- fine-tuning
- new paper
- associated project page
- dataset at Hugging Face
- released at GitHub
- Flux
- generalization
- Objaverse
- Amazon Berkeley Objects
- OBJECT 3DIT
- MirrorFusion project
- CC-Textures
- PolyHaven
- frustums
- weights
- v1.5
- split
- freeze
- MSD dataset
- Matterport3D
- AdamW
- Google Scanned Objects
- Peak Signal-to-Noise Ratio
- Structural Similarity Index
- Learned Perceptual Image Patch Similarity
- CLIP similarity
Concluzie
Mai multe rezultate reprezintă progrese impresionante. Cu toate acestea, stadiul actual al acestei sarcini rămâne atât de modest încât o soluție în ansamblu puțin convingătoare poate prevala cu un efort moderat. Arhitectura fundamentală a difuziei este slab adaptată învățării fiabile a unei fizici coerente; problema pare, prin urmare, formulată necorespunzător și puțin susceptibilă unei soluții elegante.
Adăugarea de date pentru a acoperi lacunele LDM-urilor este deja metoda standard, cu toate dezavantajele menționate. Dacă viitoarele corpusuri la scară mare acordă mai multă atenție distribuției și adnotării reflexiilor, modelele rezultate ar trebui să gestioneze mai bine acest caz.
Același lucru este însă valabil pentru numeroase alte deficiențe ale LDM-urilor. Este dificil de stabilit care dintre ele merită munca și investiția cerute de o soluție ca aceasta.
Publicat inițial luni, 28 aprilie 2025. Marți, 29 aprilie: corectarea gramaticii din ultimele paragrafe.












