Unghiul lui Anderson

Rezolvarea limitărilor modelelor de difuzie în înțelegerea oglinzilor și reflexiilor

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-4o and Adobe Firefly

De când inteligența artificială generativă a atras atenția publicului, cercetarea în domeniul vederii computerizate a aprofundat dezvoltarea modelelor capabile să înțeleagă și să reproducă legile fizicii. Totuși, instruirea sistemelor de învățare automată pentru a simula gravitația sau dinamica fluidelor a rămas o provocare majoră timp de cel puțin cinci ani.

Pe măsură ce modelele de difuzie latentă (LDM) au ajuns să domine inteligența artificială generativă, cercetătorii au devenit tot mai preocupați de capacitatea lor limitată de a înțelege și reproduce fenomene fizice. Problema a căpătat o importanță sporită odată cu Sora de la OpenAI și apoi cu modelele video deschise Hunyuan Video și Wan 2.1.

Reflexii neconvingătoare

Cea mai mare parte a cercetării menite să îmbunătățească înțelegerea fizicii de către LDM-uri se concentrează pe simularea mersului, fizica particulelor și alte aspecte ale mișcării newtoniene. Aceste domenii atrag atenția deoarece o eroare într-un comportament fizic elementar distruge imediat autenticitatea unui videoclip generat de inteligența artificială.

O direcție mai restrânsă, dar în creștere, studiază însă una dintre marile slăbiciuni ale LDM-urilor: incapacitatea lor relativă de a produce reflexii corecte.

Exemple de eșecuri ale reflexiilor și ale metodei propuse în studiul din ianuarie 2025 „Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections”. Sursa: https://arxiv.org/pdf/2409.14677

From the ianuarie 2025 paper 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', examples of 'reflection failure' versus the researchers' own approach. Source: https://arxiv.org/pdf/2409.14677

Exemple de erori ale reflexiilor și ale metodei propuse. Sursa: https://arxiv.org/pdf/2409.14677

Problema exista deja în epoca imaginilor generate pe computer și rămâne importantă în jocurile video, unde algoritmii de ray tracing simulează traseul luminii atunci când aceasta interacționează cu suprafețele. Ei calculează felul în care razele virtuale ricoșează de pe obiecte sau trec prin ele pentru a crea reflexii, refracții și umbre realiste.

Fiecare ricoșeu suplimentar mărește considerabil costul de calcul. Aplicațiile în timp real trebuie, prin urmare, să echilibreze latența și precizia prin limitarea numărului de ricoșeuri permise.

A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

O rază calculată într-un mediu 3D sau CGI tradițional. Sursa: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Un ceainic cromat așezat în fața unei oglinzi ar putea provoca o buclă aproape infinită de raze între suprafețele reflectorizante, fără un beneficiu practic echivalent pentru imaginea finală. Două sau trei ricoșeuri depășesc deja, în general, ceea ce poate percepe privitorul. Un singur ricoșeu ar produce o oglindă neagră, deoarece lumina trebuie să parcurgă cel puțin două trasee pentru a forma o reflexie vizibilă.

Fiecare ricoșeu poate aproape dubla timpul de randare. Prelucrarea mai rapidă a reflexiilor reprezintă astfel o oportunitate importantă de a îmbunătăți calitatea ray tracing-ului.

Reflexiile sunt indispensabile și pentru fotorealismul unor scene mai puțin evidente: o stradă sau un câmp de luptă după ploaie, partea opusă a străzii surprinsă într-o vitrină ori într-o ușă de sticlă sau mediul vizibil în ochelarii unui personaj.

O reflexie dublă simulată prin compoziție tradițională într-o scenă emblematică din The Matrix (1999).

A simulated twin-reflection achieved via traditional compositing for an iconic scene in 'The Matrix' (1999).

Reflexie dublă creată prin compoziție tradițională în The Matrix (1999).

Probleme de imagine

Metodele populare de dinaintea modelelor de difuzie, precum Neural Radiance Fields (NeRF), și soluțiile mai recente, cum ar fi Gaussian Splatting, au întâmpinat la rândul lor dificultăți în producerea unor reflexii naturale.

REF²-NeRF a propus o metodă bazată pe NeRF pentru scenele care includ un geam. Refracția și reflexia sunt modelate cu componente dependente și independente de punctul de vedere. Cercetătorii pot astfel estima suprafețele refractive, inclusiv sticla, și pot separa lumina directă de cea reflectată.

Examples from the Ref2Nerf paper. Source: https://arxiv.org/pdf/2311.17116

Exemple din studiul Ref²-NeRF. Sursa: https://arxiv.org/pdf/2311.17116

Printre celelalte soluții recente se numără NeRFReN, Reflecting Reality și Planar Reflection-Aware Neural Radiance Fields de la Meta. Pentru Gaussian Splatting, Mirror-3DGS, Reflective Gaussian Splatting și RefGaussian au abordat problema, iar Nero a propus în 2023 o metodă specială de integrare a proprietăților reflectorizante în reprezentările neurale.

MirrorVerse

Probabil că este mai dificil să impui logica reflexiilor unui model de difuzie decât unor metode explicit structurale precum Gaussian Splatting și NeRF. O asemenea regulă poate fi ancorată în mod fiabil numai dacă datele de antrenare conțin numeroase exemple variate într-o gamă largă de situații. Rezultatul depinde, așadar, în mare măsură de distribuția și calitatea setului de date.

Aceste comportamente sunt adăugate în mod tradițional cu un LoRA sau prin reglarea fină a modelului de bază. Nicio soluție nu este ideală: un LoRA tinde să orienteze rezultatele către propriile date chiar și fără o instrucțiune explicită, în timp ce o reglare fină costisitoare poate îndepărta ireversibil modelul de ramura sa principală și poate crea instrumente incompatibile cu originalul sau cu alte variante.

Îmbunătățirea modelelor de difuzie ar necesita o atenție mai mare acordată fizicii reflexiilor în date. Însă multe alte slăbiciuni necesită același tratament. La scara seturilor uriașe de date, selecția personalizată este dificilă și costisitoare; corectarea fiecărei slăbiciuni în acest mod nu este, prin urmare, realistă.

Totuși, apar soluții. Proiectul indian MirrorVerse propune un set de date și o metodă de antrenare îmbunătățite pentru a avansa stadiul actual al reflexiilor în modelele de difuzie.

MirrorVerse îmbunătățește metodele recente, dar rămâne imperfect. Într-un exemplu, vasele din ceramică sunt deplasate față de poziția lor corectă. În altul, în care ceașca nu ar trebui să apară în oglindă, o reflexie eronată este introdusă în partea dreaptă, în pofida geometriei naturale.

Right-most, the results from MirrorVerse pitted against two prior approaches (central two columns). Source: https://arxiv.org/pdf/2504.15397

Rezultatele MirrorVerse în dreapta, comparate cu două metode anterioare. Sursa: https://arxiv.org/pdf/2504.15397

Noua metodă merită atenție nu doar ca posibil nou reper, ci și fiindcă arată cât de greu de rezolvat poate fi această problemă atât pentru difuzia de imagini, cât și pentru cea video. Exemplele necesare sunt adesea legate de acțiuni și contexte specifice. Prin urmare, LDM-urile ar putea rămâne inferioare metodelor NeRF, Gaussian Splatting și imaginilor generate tradițional pentru această funcție.

Studiul se intitulează MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Este semnat de trei cercetători de la Vision and AI Lab, IISc Bangalore și Samsung R&D Institute Bangalore. Proiectul dispune de o pagină proprie, un set de date pe Hugging Face și cod sursă publicat pe GitHub.

Metodă

Autorii arată mai întâi cât de greu le este modelelor Stable Diffusion și Flux să respecte instrucțiunile referitoare la reflexii. SD3.5 și Flux produc adesea reflexii incoerente și incorecte din punct de vedere geometric.

From the paper: Current state-of-the-art text-to-image models, SD3.5 and Flux, exhibited significant challenges in producing consistent and geometrically accurate reflections when prompted to generate reflections in the scene.

SD3.5 și Flux întâmpină dificultăți în generarea unor reflexii coerente și corecte geometric.

Ei au dezvoltat MirrorFusion 2.0, un model generativ de difuzie menit să îmbunătățească fotorealismul și precizia geometrică a reflexiilor din imaginile sintetice. Modelul este antrenat pe noul set MirrorGen2, conceput să corecteze slaba generalizare a abordărilor anterioare.

MirrorGen2 extinde metodele anterioare prin poziționarea aleatorie a obiectelor, rotații aleatorii și ancorare explicită la sol. Scopul este de a păstra reflexii plauzibile pentru mai multe ipostaze și poziții în raport cu oglinda.

Schema for the generation of synthetic data in MirrorVerse: the dataset generation pipeline applied key augmentations by randomly positioning, rotating, and grounding objects within the scene using the 3D-Positioner. Objects are also paired in semantically consistent combinations to simulate complex spatial relationships and occlusions, allowing the dataset to capture more realistic interactions in multi-object scenes.

Fluxul sintetic MirrorVerse poziționează, rotește și ancorează aleatoriu obiectele și creează perechi coerente.

Pentru a reprezenta relații spațiale complexe, fluxul de lucru include și scene cu perechi de obiecte coerente semantic. De exemplu, un scaun este asociat cu o masă. După amplasarea și rotirea obiectului principal, cel de-al doilea este așezat fără suprapunere, într-o regiune distinctă.

Ancorarea la sol împiedică obiectele să plutească în mod necorespunzător, un defect frecvent atunci când datele sintetice sunt produse la scară mare sau prin metode puternic automatizate.

Date și teste

SynMirrorV2

SynMirrorV2 urmărește să diversifice și să facă mai realiste datele de antrenare pentru reflexii. Obiectele sale 3D provin din Objaverse și Amazon Berkeley Objects (ABO), apoi sunt rafinate cu OBJECT 3DIT și filtrarea MirrorFusion V1 pentru a elimina resursele de calitate slabă. Corpusul final cuprinde 66.062 de obiecte.

Examples from the Objaverse dataset, used in the creation of the curated dataset for the new system. Source: https://arxiv.org/pdf/2212.08051

Exemple din Objaverse, folosit pentru corpusul noului sistem. Sursa: https://arxiv.org/pdf/2212.08051

Scenele așază aceste obiecte pe pardoseli texturate provenite din CC-Textures și pe fundaluri HDRI de la PolyHaven, în fața unor oglinzi de perete sau a unor oglinzi dreptunghiulare mari. O sursă de lumină este plasată deasupra și în spatele obiectelor, la 45 de grade.

Obiectele sunt redimensionate într-un cub unitar și amplasate la intersecția precalculată a câmpurilor vizuale ale oglinzii și camerei, pentru a le garanta vizibilitatea. Sunt aplicate rotații aleatorii în jurul axei y, iar o tehnică de ancorare evită artefactele plutitoare.

Pentru scenele complexe, mai multe obiecte sunt așezate în perechi coerente potrivit categoriilor ABO. Obiectele secundare evită suprapunerile, producând 3.140 de scene cu mai multe obiecte și cu diverse ocluziuni și relații de profunzime.

Examples of rendered views from the authors' dataset containing multiple (more than two) objects, with illustrations of object segmentation and depth map visualizations seen below.

Scene randate cu mai multe obiecte și hărți de segmentare și profunzime.

Procesul de antrenare

Întrucât realismul sintetic nu este suficient pentru generalizarea la date reale, cercetătorii au elaborat un program în trei etape pentru MirrorFusion 2.0.

În etapa 1, ponderile ramurilor de condiționare și generare sunt inițializate cu punctul de control Stable Diffusion v1.5. Modelul este reglat fin pe porțiunea cu un singur obiect din SynMirrorV2. Spre deosebire de Reflecting Reality, ramura de generare nu este înghețată. Antrenarea durează 40.000 de iterații.

În etapa 2, alte 10.000 de iterații pe porțiunea cu mai multe obiecte învață sistemul să gestioneze ocluziunile și configurațiile spațiale complexe.

În etapa 3, alte 10.000 de iterații folosesc date reale din MSD și hărți de profunzime produse de estimatorul monocular Matterport3D.

Examples from the MSD dataset, with real-world scenes analyzed into depth and segmentation maps. Source: https://arxiv.org/pdf/1908.09101

Scene reale MSD analizate sub forma hărților de profunzime și segmentare. Sursa: https://arxiv.org/pdf/1908.09101

Prompturile text sunt omise în 20% din timpul antrenării pentru a favoriza utilizarea informațiilor de profunzime. Cele trei etape rulează pe patru GPU-uri NVIDIA A100, cu o rată de învățare de 1e-5, loturi de patru elemente pentru fiecare GPU și optimizatorul AdamW.

Dificultatea crește treptat, de la scene sintetice simple la compoziții mai solicitante, pentru a îmbunătăți transferul către lumea reală.

Evaluare

MirrorFusion 2.0 este comparat cu MirrorFusion, fostul reper al domeniului, pe MirrorBenchV2, folosind scene cu unul sau mai multe obiecte. Testele calitative folosesc și MSD și Google Scanned Objects (GSO).

Evaluarea cuprinde 2.991 de imagini cu un singur obiect din categorii cunoscute și necunoscute, precum și 300 de scene ABO cu două obiecte. PSNR, SSIM și LPIPS măsoară calitatea reflexiei în zona mascată a oglinzii, iar similaritatea CLIP evaluează alinierea cu prompturile.

Pentru testele cantitative se folosesc patru valori inițiale pentru fiecare prompt și se păstrează imaginea cu cel mai bun scor SSIM. MirrorFusion 2.0 depășește modelul de referință în cazul obiectelor unice, iar versiunea antrenată pe mai multe obiecte o depășește pe cea care nu a beneficiat de acest antrenament în scenele complexe.

Left, Quantitative results for single object reflection generation quality on the MirrorBenchV2 single object split. MirrorFusion 2.0 outperformed the baseline, with the best results shown in bold. Right, quantitative results for multiple object reflection generation quality on the MirrorBenchV2 multiple object split. MirrorFusion 2.0 trained with multiple objects outperformed the version trained without them, with the best results shown in bold.

Rezultate cantitative pe MirrorBenchV2; MirrorFusion 2.0 depășește reperul.

Autorii concluzionează că metoda lor depășește reperul și că reglarea pe mai multe obiecte îmbunătățește scenele dificile.

Rezultatele cele mai evidențiate sunt calitative. Pe MirrorBenchV2, reperul nu păstrează reflexii și relații spațiale corecte: orientarea unui scaun este greșită, iar reflexiile mai multor obiecte sunt deformate. Potrivit autorilor, MirrorFusion 2.0 redă corect poziția, orientarea și structura scaunului și canapelelor.

Comparison on MirrorBenchV2: the baseline failed to maintain accurate reflections and spatial consistency, showing incorrect chair orientation and distorted reflections of multiple objects, whereas (the authors contend) MirrorFusion 2.0 correctly renders the chair and the sofas, with accurate position, orientation, and structure.

Comparație MirrorBenchV2: noua metodă păstrează mai bine poziția, orientarea și structura.

Modelul de referință producea adesea rotații greșite și obiecte plutitoare. Antrenat pe SynMirrorV2, noul model păstrează mai bine orientarea și poziția în scene cu unul sau mai multe obiecte, generând reflexii mai realiste și mai coerente.

Pe GSO, reperul deformează structura și creează reflexii incomplete. MirrorFusion 2.0 păstrează mai bine integritatea spațială, geometria, culorile și detaliile, chiar și pentru obiecte din afara distribuției de antrenare.

Comparison on the GSO dataset. The baseline misrepresented object structure and produced incomplete, distorted reflections, while MirrorFusion 2.0, the authors contend, preserves spatial integrity and generates accurate geometry, color, and detail, even on out-of-distribution objects.

Comparație GSO: MirrorFusion 2.0 păstrează mai bine geometria, culoarea și detaliile.

De exemplu, mânerele unui sertar sunt reflectate corect de noul model, în timp ce reperul produce un rezultat neverosimil. Pentru o ceașcă albă și galbenă, MirrorFusion 2.0 redă o geometrie convingătoare, cu puține artefacte.

Ultimul test calitativ vizează scene reale din MSD. Autorii consideră că MirrorFusion 2.0 redă mai bine detalii complexe, printre care obiecte îngrămădite pe o masă și mai multe oglinzi într-un mediu tridimensional.

Real-world scene results comparing MirrorFusion, MirrorFusion 2.0, and MirrorFusion 2.0, fine-tuned on the MSD dataset. MirrorFusion 2.0, the authors contend, captures complex scene details more accurately, including cluttered objects on a table, and the presence of multiple mirrors within a three-dimensional environment. Only partial results are shown  here, due to the dimensions of the results in the original paper, to which we refer the reader for full results and better resolution.

Rezultate MSD reale pentru MirrorFusion, MirrorFusion 2.0 și versiunea reglată pe MSD.

Modelul a funcționat bine pe MirrorBenchV2 și GSO, dar inițial a întâmpinat dificultăți pe MSD. Reglarea fină pe o parte din MSD a îmbunătățit mediile aglomerate și scenele cu mai multe oglinzi, oferind reflexii mai coerente și detaliate în setul de testare rezervat.

Într-un studiu cu utilizatori, 84% dintre participanți ar fi preferat imaginile MirrorFusion 2.0 celor produse de reper. Detaliile se găsesc în anexa lucrării.

Results of the user study.

Rezultatele studiului cu utilizatori.

Studii și legături către surse

Studii, seturi de date, pagini de proiect și surse tehnice citate aici:

Concluzie

Mai multe rezultate reprezintă progrese impresionante. Cu toate acestea, stadiul actual al acestei sarcini rămâne atât de modest încât o soluție în ansamblu puțin convingătoare poate prevala cu un efort moderat. Arhitectura fundamentală a difuziei este slab adaptată învățării fiabile a unei fizici coerente; problema pare, prin urmare, formulată necorespunzător și puțin susceptibilă unei soluții elegante.

Adăugarea de date pentru a acoperi lacunele LDM-urilor este deja metoda standard, cu toate dezavantajele menționate. Dacă viitoarele corpusuri la scară mare acordă mai multă atenție distribuției și adnotării reflexiilor, modelele rezultate ar trebui să gestioneze mai bine acest caz.

Același lucru este însă valabil pentru numeroase alte deficiențe ale LDM-urilor. Este dificil de stabilit care dintre ele merită munca și investiția cerute de o soluție ca aceasta.

 

Publicat inițial luni, 28 aprilie 2025. Marți, 29 aprilie: corectarea gramaticii din ultimele paragrafe.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai