KÄ t Andersona
Naprawianie ograniczonego zrozumienia modeli dyfuzji lustr i odbiÄ

Od czasu, gdy sztuczna inteligencja zaczÄÅa przyciÄ gaÄ zainteresowanie publicznoÅci, dziedzina badaÅ nad widzeniem komputerowym pogÅÄbiÅa swoje zainteresowanie rozwijaniem modeli AI, ktÃģre sÄ w stanie zrozumieÄ i odtworzyÄ prawa fizyczne; jednak wyzwaniem byÅo nauczenie systemÃģw machine learning, aby symulowaÅy zjawiska takie jak grawitacja i dinamika pÅynÃģw, co byÅo znaczÄ cym celem badaÅ przez co najmniej ostatnie piÄÄ lat.
Od czasu, gdy modele dyfuzji latentnej (LDM) zdominowaÅy scenÄ generatywnej AI w 2022 roku, badacze coraz czÄÅciej koncentrujÄ siÄ na ograniczonej zdolnoÅci architektury LDM do zrozumienia i odtworzenia zjawisk fizycznych. Teraz ten problem zyskaÅ dodatkowÄ wagÄ wraz z przeÅomowym rozwojem generatywnego modelu wideo Sora firmy OpenAI oraz (moÅžliwie bardziej istotnym) niedawnym wydaniem otwartoÅšrÃģdÅowych modeli wideo Hunyuan i Wan 2.1.
Odbicia Åšle
WiÄkszoÅÄ badaÅ majÄ cych na celu poprawÄ zrozumienia fizyki przez LDM koncentrowaÅa siÄ na obszarach takich jak symulacja chodu, fizyka czÄ stek i inne aspekty ruchu Newtonowskiego. Te obszary przyciÄ gnÄÅy uwagÄ, poniewaÅž nieÅcisÅoÅci w podstawowych zachowaniach fizycznych natychmiast podwaÅžyÅyby autentycznoÅÄ generowanych przez AI wideo.
Jednak niewielki, ale rosnÄ cy nurt badaÅ koncentruje siÄ na jednej z najwiÄkszych sÅaboÅci LDM â wzglÄdnej niezdolnoÅci do generowania dokÅadnych odbiÄ.

Z papieru z stycznia 2025 roku âReflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflectionsâ, przykÅady âawarii odbiciaâ w porÃģwnaniu z podejÅciem autorÃģw. ÅđrÃģdÅo: https://arxiv.org/pdf/2409.14677
Problem ten byÅ rÃģwnieÅž wyzwaniem w erze CGI i pozostaje nim w branÅžy gier wideo, gdzie algoritmy ray-tracing symulujÄ ÅcieÅžkÄ ÅwiatÅa, gdy oddziaÅuje z powierzchniami. Ray-tracing oblicza, jak wirtualne promienie ÅwiatÅa odbijajÄ siÄ lub przechodzÄ przez obiekty, tworzÄ c realistyczne odbicia, zaÅamania i cienie.
JednakÅže, poniewaÅž kaÅžde dodatkowe odbicie znacznie zwiÄksza koszt obliczeniowy, aplikacje w czasie rzeczywistym muszÄ podejmowaÄ kompromis pomiÄdzy opÃģÅšnieniem a dokÅadnoÅciÄ , ograniczajÄ c liczbÄ dozwolonych odbiÄ promieni ÅwiatÅa.
![Przedstawienie wirtualnie obliczonego promienia ÅwiatÅa w tradycyjnej scenerii 3D (tj. CGI), z wykorzystaniem technologii i zasad po raz pierwszy opracowanych w latach 60. i ktÃģre osiÄ
gnÄÅy szczyt miÄdzy 1982 a 1993 rokiem (okresem miÄdzy 'Tronem' [1982] a 'Parkiem Jurajskim' [1993]). ÅđrÃģdÅo: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing](https://www.unite.ai/wp-content/uploads/2025/04/ray-tracing.jpg)
Przedstawienie wirtualnie obliczonego promienia ÅwiatÅa w tradycyjnej scenerii 3D (tj. CGI), z wykorzystaniem technologii i zasad po raz pierwszy opracowanych w latach 60. i ktÃģre osiÄ gnÄÅy szczyt miÄdzy 1982 a 1993 rokiem (okresem miÄdzy âTronemâ [1982] a âParkiem Jurajskimâ [1993]). ÅđrÃģdÅo: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
Na przykÅad, przedstawienie czajnika z chromu przed lustrem moÅže wymagaÄ procesu ray-tracing, w ktÃģrym promienie ÅwiatÅa odbijajÄ siÄ wielokrotnie miÄdzy powierzchniami odbijajÄ cymi, tworzÄ c niemal nieskoÅczonÄ pÄtlÄ z niewielkÄ praktycznÄ korzyÅciÄ dla koÅcowego obrazu. W wiÄkszoÅci przypadkÃģw gÅÄbokoÅÄ odbicia dwÃģch lub trzech odbiÄ juÅž przekracza to, co widz moÅže postrzegaÄ. Jedno odbicie spowodowaÅoby powstanie czarnego lustra, poniewaÅž ÅwiatÅo musi ukoÅczyÄ co najmniej dwie podrÃģÅže, aby utworzyÄ widoczne odbicie.
KaÅžde dodatkowe odbicie znacznie zwiÄksza koszt obliczeniowy, czÄsto podwajajÄ c czas renderowania, co sprawia, Åže szybsze obsÅugiwanie odbiÄ jest jednÄ z najwiÄkszych moÅžliwoÅci poprawy jakoÅci renderowania z wykorzystaniem ray-tracing.
Naturalnie, odbicia wystÄpujÄ i sÄ niezbÄdne do fotorealizmu w znacznie mniej oczywistych scenariuszach â takich jak odbijajÄ ca siÄ powierzchnia ulicy lub pola bitwy po deszczu; odbicie przeciwlegÅej ulicy w sklepowej witrynie lub szklanej drzwi; lub w okularach przedstawionych postaci, gdzie obiekty i Årodowiska mogÄ byÄ wymagane do pojawienia siÄ.

Symulowane podwÃģjne odbicie osiÄ gniÄte za pomocÄ tradycyjnego komponowania dla ikonicznej sceny w âMatrixieâ (1999).
Problemy z obrazem
Z tego powodu ramy, ktÃģre byÅy popularne przed pojawieniem siÄ modeli dyfuzji, takie jak Neural Radiance Fields (NeRF), oraz niektÃģre nowsze wyzwania, takie jak Gaussian Splatting, nadal majÄ swoje wÅasne trudnoÅci w odwzorowaniu odbiÄ w naturalny sposÃģb.
Projekt REF2-NeRF (przedstawiony poniÅžej) zaproponowaÅ metodÄ modelowania opartÄ na NeRF dla scen zawierajÄ cych szklanÄ obudowÄ. W tej metodzie zaÅamania i odbicia byÅy modelowane przy uÅžyciu elementÃģw zaleÅžnych i niezaleÅžnych od perspektywy widza. To podejÅcie pozwoliÅo badaczom oszacowaÄ powierzchnie, na ktÃģrych wystÄpowaÅo zaÅamanie, a w szczegÃģlnoÅci szklane powierzchnie, oraz umoÅžliwiÅo separacjÄ i modelowanie zarÃģwno bezpoÅrednich, jak i odbitych skÅadnikÃģw ÅwiatÅa.

PrzykÅady z papieru Ref2Nerf. ÅđrÃģdÅo: https://arxiv.org/pdf/2311.17116
Inne rozwiÄ zania NeRF dotyczÄ ce odbiÄ z ostatnich 4-5 lat obejmowaÅy NeRFReN, Reflecting Reality oraz projekt Planar Reflection-Aware Neural Radiance Fields firmy Meta z 2024 roku.
Dla GSplat, artykuÅy takie jak Mirror-3DGS, Reflective Gaussian Splatting i RefGaussian oferowaÅy rozwiÄ zania dotyczÄ ce problemu odbiÄ, natomiast projekt Nero z 2023 roku zaproponowaÅ specjalnÄ metodÄ wÅÄ czania cech odbijajÄ cych do reprezentacji neuronalnych.
MirrorVerse
Uzyskanie modelu dyfuzji, ktÃģry szanuje logikÄ odbiÄ, jest prawdopodobnie trudniejsze niÅž w przypadku podejÅÄ wyraÅšnie strukturalnych, nie-semantycznych, takich jak Gaussian Splatting i NeRF. W modelach dyfuzji reguÅa tego rodzaju jest prawdopodobnie tylko wtedy, gdy dane szkoleniowe zawierajÄ wiele rÃģÅžnych przykÅadÃģw w szerokim zakresie scenariuszy, co sprawia, Åže jest ona silnie zaleÅžna od dystrybucji i jakoÅci oryginalnego zbioru danych.
Tradycyjnie, dodawanie okreÅlonych zachowaÅ tego rodzaju jest domenÄ LoRA lub dostosowywania modelu podstawowego; jednak te rozwiÄ zania nie sÄ idealne, poniewaÅž LoRA ma tendencjÄ do skrzywienia danych wyjÅciowych w kierunku wÅasnych danych szkoleniowych, nawet bez podpowiedzi, podczas gdy dostosowywanie â poza tym, Åže jest drogie â moÅže odwrÃģciÄ gÅÃģwny model w sposÃģb nieodwracalny, tworzÄ c caÅy szereg powiÄ zanych narzÄdzi niestandardowych, ktÃģre nigdy nie bÄdÄ dziaÅaÄ z Åžadnym innym odÅamem modelu, w tym oryginalnym.
W ogÃģle, poprawa modeli dyfuzji wymaga, aby dane szkoleniowe poÅwiÄcaÅy wiÄkszÄ uwagÄ fizyce odbiÄ. Jednak wiele innych obszarÃģw rÃģwnieÅž wymaga podobnej specjalnej uwagi. W kontekÅcie zbiorÃģw danych o duÅžym stopniu skali, gdzie niestandardowa kuracja jest kosztowna i trudna, rozwiÄ zanie kaÅždej sÅaboÅci w ten sposÃģb jest niewykonalne.
Niemniej, rozwiÄ zania problemu odbiÄ LDM pojawiajÄ siÄ od czasu do czasu. Jednym z takich niedawnych wysiÅkÃģw, pochodzÄ cym z Indii, jest projekt MirrorVerse, ktÃģry oferuje ulepszony zbiÃģr danych i metodÄ szkolenia, zdolnÄ do poprawy stanu sztuki w tym konkretnym wyzwaniu w badaniach nad dyfuzjÄ .

Najbardziej na prawo, wyniki z MirrorVerse w porÃģwnaniu z dwoma poprzednimi podejÅciami (Årodkowe dwie kolumny). ÅđrÃģdÅo: https://arxiv.org/pdf/2504.15397
Jak widaÄ w powyÅžszym przykÅadzie (obraz tytuÅowy w PDF nowego badania), MirrorVerse poprawia wyniki w porÃģwnaniu z niedawnymi podejÅciami dotyczÄ cymi tego samego problemu, ale jest daleko od ideaÅu.
W gÃģrnej prawej czÄÅci obrazu widzimy, Åže ceramiczne dzbanki sÄ nieco na prawo od miejsca, w ktÃģrym powinny siÄ znajdowaÄ, a na poniÅžszym obrazie, ktÃģry technicznie nie powinien zawieraÄ odbicia kubka, niedokÅadne odbicie zostaÅo wstawione do prawej czÄÅci, wbrew logice naturalnych kÄ tÃģw odbicia.
Dlatego teÅž przyjrzymy siÄ nowej metodzie nie tyle dlatego, Åže moÅže reprezentowaÄ obecny stan sztuki w dyfuzji opartej na odbiciach, ale rÃģwnieÅž dlatego, aby zilustrowaÄ, w jakim stopniu moÅže to byÄ nierozwiÄ zywalny problem dla modeli dyfuzji latentnej, statycznej i wideo, poniewaÅž wymagane przykÅady danych o odbiciach sÄ najprawdopodobniej splecione z okreÅlonymi dziaÅaniami i scenariuszami.
Dlatego ta konkretna funkcja modeli LDM moÅže nadal nie speÅniaÄ oczekiwaÅ w porÃģwnaniu z podejÅciami specyficznych struktur, takimi jak NeRF, GSplat i tradycyjne CGI.
Nowy artykuÅ pt. MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World, pochodzi od trzech badaczy z Vision and AI Lab, IISc Bangalore, oraz Samsung R&D Institute w Bangalore. ArtykuÅ ma powiÄ zanÄ stronÄ projektu, a takÅže zbiÃģr danych w Hugging Face, z kodem ÅšrÃģdÅowym opublikowanym na GitHub.
Metoda
Badacze zauwaÅžajÄ na poczÄ tku, Åže modele takie jak Stable Diffusion i Flux majÄ trudnoÅci z poszanowaniem podpowiedzi opartych na odbiciach, ilustrujÄ c problem w nastÄpujÄ cy sposÃģb:

Z artykuÅu: BieÅžÄ ce modele generatywne, SD3.5 i Flux, wykazywaÅy znaczne trudnoÅci w generowaniu spÃģjnych i geometrycznie dokÅadnych odbiÄ, gdy zostanÄ poproszone o wygenerowanie ich w scenie.
Badacze opracowali MirrorFusion 2.0, model generatywny oparty na dyfuzji, ktÃģrego celem jest poprawa fotorealizmu i dokÅadnoÅci geometrycznej odbiÄ lustrzanych w syntetycznych obrazach. Szkolenie modelu opieraÅo siÄ na nowo opracowanym zbiorze danych autorÃģw, zatytuÅowanym MirrorGen2, zaprojektowanym w celu rozwiÄ zania sÅaboÅci ogÃģlnych, ktÃģre zaobserwowano w poprzednich podejÅciach.
MirrorGen2 rozwija wczeÅniejsze metody, wprowadzajÄ c losowe pozycjonowanie obiektÃģw, losowe obroty i jawne zakotwiczenie obiektÃģw, w celu zapewnienia, Åže odbicia pozostajÄ prawdopodobne w szerokim zakresie pozycji i ustawieÅ obiektÃģw wzglÄdem powierzchni lustra.

Schemat generowania danych syntetycznych w MirrorVerse: potok generowania danych zastosowaÅ kluczowe augmentacje, losowo pozycjonujÄ c, obracajÄ c i zakotwiczajÄ c obiekty w scenie przy uÅžyciu 3D-Positioner. Obiekty sÄ rÃģwnieÅž ÅÄ czone w semantycznie spÃģjnych parach, aby symulowaÄ zÅoÅžone relacje przestrzenne i zakrycia, umoÅžliwiajÄ c zbiorowi danych przechwytywanie bardziej realistycznych interakcji w scenach z wieloma obiektami.
Aby dalej wzmocniÄ zdolnoÅÄ modelu do radzenia sobie z zÅoÅžonymi ukÅadami przestrzennymi, potok MirrorGen2 obejmuje poÅÄ czone sceny obiektÃģw, umoÅžliwiajÄ c systemowi lepsze przedstawienie zakryÄ i interakcji miÄdzy wieloma elementami w ustawieniach odbijajÄ cych.
W artykule napisano:
âKategorie sÄ ÅÄ czone rÄcznie, aby zapewniÄ spÃģjnoÅÄ semantycznÄ â na przykÅad, ÅÄ czenie krzesÅa z stoÅem. Podczas renderowania, po pozycjonowaniu i obrÃģceniu gÅÃģwnego [obiektu], dodatkowy [obiekt] z poÅÄ czonej kategorii jest pobierany i ustawiany w taki sposÃģb, aby uniknÄ Ä nakÅadania siÄ, zapewniajÄ c odrÄbne regiony przestrzenne w scenie.â
W odniesieniu do jawnego zakotwiczenia obiektÃģw, tutaj autorzy upewnili siÄ, Åže wygenerowane obiekty byÅy âzakotwiczoneâ do podÅoÅža w danych syntetycznych, a nie âunosiÅy siÄâ w sposÃģb nieodpowiedni, co moÅže wystÄ piÄ, gdy dane syntetyczne sÄ generowane w duÅžym stopniu lub przy uÅžyciu wysoko zautomatyzowanych metod.
PoniewaÅž innowacja w zbiorze danych jest centralnym elementem nowoÅci artykuÅu, przejdziemy do tej sekcji wczeÅniej niÅž zwykle.
Dane i testy
SynMirrorV2
ZbiÃģr danych SynMirrorV2 autorÃģw zostaÅ opracowany w celu poprawy rÃģÅžnorodnoÅci i realizmu danych szkoleniowych dotyczÄ cych odbiÄ lustrzanych, zawierajÄ cych obiekty 3D pochodzÄ ce z Objaverse i Amazon Berkeley Objects (ABO), ktÃģre zostaÅy nastÄpnie przefiltrowane za pomocÄ OBJECT 3DIT, a takÅže procesu filtrowania z wersji 1 projektu MirrorFusion, w celu usuniÄcia niskiej jakoÅci aktywÃģw. W efekcie powstaÅ ulepszony zbiÃģr 66 062 obiektÃģw.

PrzykÅady z zestawu danych Objaverse, wykorzystane do stworzenia opracowanego zbioru danych dla nowego systemu. ÅđrÃģdÅo: https://arxiv.org/pdf/2212.08051
Budowa sceny obejmowaÅa umieszczenie tych obiektÃģw na podÅogach z CC-Textures i tÅach HDRI z repozytorium PolyHaven, przy uÅžyciu luster peÅnoÅcienne lub wysokich prostokÄ tnych. OÅwietlenie zostaÅo zunifikowane z obszarem ÅwiatÅa umieszczonym nad i za obiektami, pod kÄ tem 45 stopni. Obiekty zostaÅy skalibrowane, aby zmieÅciÄ siÄ w jednostkowej kostce i umieszczone przy uÅžyciu preobliczonego przeciÄcia lustra i frustum kamery, zapewniajÄ c widocznoÅÄ.
Losowe obroty zostaÅy zastosowane wokÃģÅ osi y, a technika zakotwiczenia zostaÅa uÅžyta, aby zapobiec âpÅywajÄ cym artefaktomâ.
Aby symulowaÄ bardziej zÅoÅžone sceny, zbiÃģr danych obejmuje rÃģwnieÅž wiele obiektÃģw ustawionych zgodnie z semantycznie spÃģjnymi parami na podstawie kategorii ABO. Obiekty wtÃģrne zostaÅy umieszczone w taki sposÃģb, aby uniknÄ Ä nakÅadania siÄ, tworzÄ c 3 140 scen z wieloma obiektami, zaprojektowanych w celu przechwycenia rÃģÅžnych zakryÄ i relacji gÅÄbokich.

PrzykÅady wyrenderowanych widokÃģw z zestawu danych autorÃģw, zawierajÄ cych wiele (wiÄcej niÅž dwa) obiektÃģw, z ilustracjami segmentacji obiektÃģw i wizualizacjami map gÅÄbokich poniÅžej.
Proces szkolenia
UznajÄ c, Åže realizm syntetyczny sam w sobie jest niewystarczajÄ cy do solidnego uogÃģlnienia na dane Åwiata rzeczywistego, badacze opracowali trzystopniowy proces szkolenia dla MirrorFusion 2.0.
W etapie 1 autorzy zainicjowali wagi zarÃģwno gaÅÄzi warunkujÄ cej, jak i generujÄ cej z punktu kontrolnego Stable Diffusion v1.5, a nastÄpnie dostosowali model do pojedynczego obiektu podziaÅu szkoleniowego zestawu danych SynMirrorV2. W przeciwieÅstwie do wspomnianego powyÅžej projektu Reflecting Reality, badacze nie zamrozili gaÅÄ Åš generujÄ cÄ . NastÄpnie przeszkolili model przez 40 000 iteracji.
W etapie 2 model zostaÅ dostosowany przez dodatkowe 10 000 iteracji na wielu obiektach podziaÅu szkoleniowego SynMirrorV2, w celu nauczenia systemu radzenia sobie z zakryciami i bardziej zÅoÅžonymi ukÅadami przestrzennymi, wystÄpujÄ cymi w realistycznych scenach.
Wreszcie, w etapie 3 przeprowadzono dodatkowe 10 000 iteracji dostosowywania przy uÅžyciu danych Åwiata rzeczywistego z zestawu danych MSD, przy uÅžyciu map gÅÄbokich wygenerowanych przez estymator gÅÄbokich Matterport3D.

PrzykÅady z zestawu danych MSD, z analizÄ scen Åwiata rzeczywistego na mapy gÅÄbokie i segmentacjÄ. ÅđrÃģdÅo: https://arxiv.org/pdf/1908.09101
Podczas szkolenia podpowiedzi tekstowe zostaÅy pominiÄte przez 20% czasu szkolenia, aby zachÄciÄ model do maksymalnego wykorzystania dostÄpnych informacji o gÅÄbokoÅci (tj. podejÅcie âzamaskowaneâ).
Szkolenie odbywaÅo siÄ na czterech kartach graficznych NVIDIA A100 dla wszystkich etapÃģw (specyfikacja VRAM nie jest podana, choÄ mogÅaby wynosiÄ 40 GB lub 80 GB na kartÄ). Zastosowano szybkoÅÄ uczenia 1e-5 z rozmiarem partii 4 na kartÄ graficznÄ , przy uÅžyciu optymalizatora AdamW.
Ten schemat szkolenia stopniowo zwiÄkszaÅ trudnoÅÄ zadaÅ przedstawianych modelowi, zaczynajÄ c od prostszych scen syntetycznych i stopniowo przechodzÄ c do bardziej wymagajÄ cych kompozycji, z zamiarem rozwoju solidnej przenoÅnoÅci na dane Åwiata rzeczywistego.
Testy
Autorzy ocenili MirrorFusion 2.0 w porÃģwnaniu z poprzednim stanem sztuki, MirrorFusion, ktÃģry sÅuÅžyÅ jako punkt odniesienia, oraz przeprowadzili eksperymenty na zestawie danych MirrorBenchV2, obejmujÄ c zarÃģwno sceny z jednym, jak i wieloma obiektami.
Dodatkowe testy jakoÅciowe zostaÅy przeprowadzone na prÃģbkach z zestawu danych MSD, a takÅže z zestawu danych Google Scanned Objects (GSO).
Ocena wykorzystywaÅa 2 991 obrazÃģw z jednym obiektem z kategorii widzianych i niewidzianych, oraz 300 scen z dwoma obiektami z ABO. WartoÅÄ zostaÅa zmierzona przy uÅžyciu wskaÅšnika sygnaÅu do szumu (PSNR); wskaÅšnika podobieÅstwa strukturalnego (SSIM); oraz naukowo pojÄtej podobieÅstwa patchÃģw obrazu (LPIPS), aby oceniÄ jakoÅÄ odbicia w regionie lustra. PodobieÅstwo CLIP zostaÅo wykorzystane do oceny wyrÃģwnania tekstowego z wejÅciowymi podpowiedziami.
W testach iloÅciowych autorzy wygenerowali obrazy przy uÅžyciu czterech nasion dla okreÅlonej podpowiedzi, a nastÄpnie wybrali wynikowy obraz z najlepszym wynikiem SSIM. Dwie tabelaryczne wyniki testÃģw iloÅciowych sÄ przedstawione poniÅžej.

Lewy: Wyniki iloÅciowe dla jakoÅci generowania odbiÄ obiektÃģw pojedynczych na podziale obiektÃģw pojedynczych MirrorBenchV2. MirrorFusion 2.0 przewyÅžszyÅ punkt odniesienia, z najlepszymi wynikami wyrÃģÅžnionymi pogrubieniem. Prawy: Wyniki iloÅciowe dla jakoÅci generowania odbiÄ obiektÃģw wielu na podziale obiektÃģw wielu MirrorBenchV2. MirrorFusion 2.0 przeszkolony z wieloma obiektami przewyÅžszyÅ wersjÄ przeszkolonÄ bez nich, z najlepszymi wynikami wyrÃģÅžnionymi pogrubieniem.
Autorzy komentujÄ :
â[Wyniki] pokazujÄ , Åže nasza metoda przewyÅžsza metodÄ punktu odniesienia, a dostosowanie do wielu obiektÃģw poprawia wyniki w zÅoÅžonych scenach.â
WiÄkszoÅÄ wynikÃģw, a takÅže te, ktÃģre sÄ podkreÅlane przez autorÃģw, dotyczÄ testÃģw jakoÅciowych. Ze wzglÄdu na wymiary tych ilustracji, moÅžemy tylko czÄÅciowo odtworzyÄ przykÅady z artykuÅu.

PorÃģwnanie na MirrorBenchV2: punkt odniesienia nie utrzymaÅ dokÅadnych odbiÄ i spÃģjnoÅci przestrzennej, pokazujÄ c nieprawidÅowÄ orientacjÄ krzesÅa i znieksztaÅcone odbicia wielu obiektÃģw, podczas gdy (jak twierdzÄ autorzy) MirrorFusion 2.0 prawidÅowo renderuje krzesÅo i kanapÄ, z dokÅadnÄ pozycjÄ , orientacjÄ i strukturÄ .
Z tych subiektywnych wynikÃģw autorzy twierdzÄ , Åže model punktu odniesienia nie byÅ w stanie prawidÅowo wyrenderowaÄ orientacji obiektu i relacji przestrzennych w odbiciach, czÄsto wytwarzajÄ c artefakty, takie jak nieprawidÅowa rotacja i unoszÄ ce siÄ obiekty. MirrorFusion 2.0, przeszkolony na SynMirrorV2, wedÅug autorÃģw, zachowuje prawidÅowÄ orientacjÄ obiektu i pozycjonowanie w scenach z jednym i wieloma obiektami, w wyniku czego otrzymuje siÄ bardziej realistyczne i spÃģjne odbicia.
PoniÅžej widzimy wyniki jakoÅciowe na wspomnianym zestawie danych GSO:

PorÃģwnanie na zestawie danych GSO. Punkt odniesienia Åšle przedstawiÅ strukturÄ obiektu i wytworzyÅ niekompletne, znieksztaÅcone odbicia, podczas gdy MirrorFusion 2.0, jak twierdzÄ autorzy, zachowuje integralnoÅÄ przestrzennÄ i generuje dokÅadnÄ geometriÄ, kolor i szczegÃģÅy, nawet w przypadku obiektÃģw poza zestawem danych.
Tutaj autorzy komentujÄ :
âMirrorFusion 2.0 generuje znacznie bardziej dokÅadne i realistyczne odbicia. Na przykÅad, w Fig. 5 (a â powyÅžej), MirrorFusion 2.0 prawidÅowo odbija uchwyty szuflady (wyrÃģÅžnione na zielono), podczas gdy model punktu odniesienia wytwarza nieprawdopodobne odbicie (wyrÃģÅžnione na czerwono). â
âPodobnie, dla âbiaÅo-ÅžÃģÅtej filiÅžankiâ w Fig. 5 (b), MirrorFusion 2.0 dostarcza przekonywujÄ cÄ geometriÄ z minimalnymi artefaktami, w przeciwieÅstwie do punktu odniesienia, ktÃģry nie jest w stanie dokÅadnie uchwyciÄ geometrii i wyglÄ du obiektu.â
Ostatni test jakoÅciowy zostaÅ przeprowadzony na zestawie danych MSD (czÄÅciowe wyniki poniÅžej):

Wyniki scen Åwiata rzeczywistego, porÃģwnujÄ ce MirrorFusion, MirrorFusion 2.0 i MirrorFusion 2.0, dostosowane do zestawu danych MSD. MirrorFusion 2.0, jak twierdzÄ autorzy, przechwytuje bardziej szczegÃģÅowe detale scen w sposÃģb bardziej dokÅadny, w tym zatÅoczone obiekty na stole i obecnoÅÄ wielu luster w trÃģjwymiarowym Årodowisku. Pokazujemy tylko czÄÅciowe wyniki, ze wzglÄdu na wymiary wynikÃģw w oryginalnym artykule, do ktÃģrego odsyÅamy czytelnika w celu uzyskania peÅnych wynikÃģw i lepszej rozdzielczoÅci.
Tutaj autorzy zauwaÅžajÄ , Åže chociaÅž MirrorFusion 2.0 dobrze radziÅ sobie z danymi MirrorBenchV2 i GSO, poczÄ tkowo miaÅ trudnoÅci ze zÅoÅžonymi scenami Åwiata rzeczywistego w zestawie danych MSD. Dostosowanie modelu do podzbioru MSD poprawiÅo jego zdolnoÅÄ do radzenia sobie z zatÅoczonymi Årodowiskami i wieloma lustrem, w wyniku czego otrzymano bardziej spÃģjne i szczegÃģÅowe odbicia w podziale testowym.
Ponadto przeprowadzono badanie uÅžytkownikÃģw, w ktÃģrym 84% uÅžytkownikÃģw preferowaÅo generacje z MirrorFusion 2.0 w porÃģwnaniu z metodÄ punktu odniesienia.

Wyniki badania uÅžytkownikÃģw.
PoniewaÅž szczegÃģÅy badania uÅžytkownikÃģw zostaÅy przeniesione do zaÅÄ cznika artykuÅu, odsyÅamy czytelnika tam w celu uzyskania szczegÃģÅÃģw badania.
Wnioski
ChociaÅž wiele z przedstawionych wynikÃģw to imponujÄ ce poprawki stanu sztuki, stan sztuki w tym konkretnym przypadku jest tak zÅy, Åže nawet nieprzekonywajÄ ce rozwiÄ zanie moÅže wygraÄ z minimalnym wysiÅkiem. Podstawowa architektura modelu dyfuzji jest niekorzystna dla niezawodnego uczenia siÄ i demonstracji spÃģjnej fizyki, tak Åže problem jest Åšle sformuÅowany i wydaje siÄ nie nadawaÄ siÄ do eleganckiego rozwiÄ zania.
Dalej, dodawanie danych do istniejÄ cych modeli jest juÅž standardowÄ metodÄ naprawy brakÃģw w wydajnoÅci LDM, z wszystkimi wymienionymi wczeÅniej wadami. Jest rozsÄ dnie przyjÄ Ä, Åže jeÅli przyszÅe duÅže zestawy danych bÄdÄ poÅwiÄcaÄ wiÄkszÄ uwagÄ dystrybucji (i adnotacji) punktÃģw danych zwiÄ zanych z odbiciami, moÅžemy oczekiwaÄ, Åže wynikowe modele bÄdÄ lepiej radziÄ sobie z tym scenariuszem.
JednakÅže, to samo dotyczy wielu innych sÅaboÅci w danych wyjÅciowych LDM â kto moÅže powiedzieÄ, ktÃģre z nich najbardziej zasÅugujÄ na wysiÅek i pieniÄ dze zaangaÅžowane w rodzaj rozwiÄ zania, ktÃģre autorzy nowego artykuÅu proponujÄ tutaj?
Â
Pierwotnie opublikowane w poniedziaÅek, 28 kwietnia 2025 r. Wtorek, 29 kwietnia: dokonano korekty gramatycznej w koÅcowych akapitach.












