Kąt Andersona

Naprawianie ograniczonego zrozumienia modeli dyfuzji lustr i odbić

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPT-4o and Adobe Firefly

Od czasu, gdy sztuczna inteligencja zaczęła przyciągać zainteresowanie publiczności, dziedzina badań nad widzeniem komputerowym pogłębiła swoje zainteresowanie rozwijaniem modeli AI, które są w stanie zrozumieć i odtworzyć prawa fizyczne; jednak wyzwaniem było nauczenie systemów machine learning, aby symulowały zjawiska takie jak grawitacja i dinamika płynów, co było znaczącym celem badań przez co najmniej ostatnie pięć lat.

Od czasu, gdy modele dyfuzji latentnej (LDM) zdominowały scenę generatywnej AI w 2022 roku, badacze coraz częściej koncentrują się na ograniczonej zdolności architektury LDM do zrozumienia i odtworzenia zjawisk fizycznych. Teraz ten problem zyskał dodatkową wagę wraz z przełomowym rozwojem generatywnego modelu wideo Sora firmy OpenAI oraz (możliwie bardziej istotnym) niedawnym wydaniem otwartoźródłowych modeli wideo Hunyuan i Wan 2.1.

Odbicia źle

Większość badań mających na celu poprawę zrozumienia fizyki przez LDM koncentrowała się na obszarach takich jak symulacja chodu, fizyka cząstek i inne aspekty ruchu Newtonowskiego. Te obszary przyciągnęły uwagę, ponieważ nieścisłości w podstawowych zachowaniach fizycznych natychmiast podważyłyby autentyczność generowanych przez AI wideo.

Jednak niewielki, ale rosnący nurt badań koncentruje się na jednej z największych słabości LDM – względnej niezdolności do generowania dokładnych odbić.

Z papieru z stycznia 2025 roku 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', przykłady 'awarii odbicia' w porównaniu z podejściem autorów. Źródło: https://arxiv.org/pdf/2409.14677

Z papieru z stycznia 2025 roku ‘Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections’, przykłady ‘awarii odbicia’ w porównaniu z podejściem autorów. Źródło: https://arxiv.org/pdf/2409.14677

Problem ten był również wyzwaniem w erze CGI i pozostaje nim w branży gier wideo, gdzie algoritmy ray-tracing symulują ścieżkę światła, gdy oddziałuje z powierzchniami. Ray-tracing oblicza, jak wirtualne promienie światła odbijają się lub przechodzą przez obiekty, tworząc realistyczne odbicia, załamania i cienie.

Jednakże, ponieważ każde dodatkowe odbicie znacznie zwiększa koszt obliczeniowy, aplikacje w czasie rzeczywistym muszą podejmować kompromis pomiędzy opóźnieniem a dokładnością, ograniczając liczbę dozwolonych odbić promieni światła.

Przedstawienie wirtualnie obliczonego promienia światła w tradycyjnej scenerii 3D (tj. CGI), z wykorzystaniem technologii i zasad po raz pierwszy opracowanych w latach 60. i które osiągnęły szczyt między 1982 a 1993 rokiem (okresem między 'Tronem' [1982] a 'Parkiem Jurajskim' [1993]). Źródło: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Przedstawienie wirtualnie obliczonego promienia światła w tradycyjnej scenerii 3D (tj. CGI), z wykorzystaniem technologii i zasad po raz pierwszy opracowanych w latach 60. i które osiągnęły szczyt między 1982 a 1993 rokiem (okresem między ‘Tronem’ [1982] a ‘Parkiem Jurajskim’ [1993]). Źródło: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Na przykład, przedstawienie czajnika z chromu przed lustrem może wymagać procesu ray-tracing, w którym promienie światła odbijają się wielokrotnie między powierzchniami odbijającymi, tworząc niemal nieskończoną pętlę z niewielką praktyczną korzyścią dla końcowego obrazu. W większości przypadków głębokość odbicia dwóch lub trzech odbić już przekracza to, co widz może postrzegać. Jedno odbicie spowodowałoby powstanie czarnego lustra, ponieważ światło musi ukończyć co najmniej dwie podróże, aby utworzyć widoczne odbicie.

Każde dodatkowe odbicie znacznie zwiększa koszt obliczeniowy, często podwajając czas renderowania, co sprawia, że szybsze obsługiwanie odbić jest jedną z największych możliwości poprawy jakości renderowania z wykorzystaniem ray-tracing.

Naturalnie, odbicia występują i są niezbędne do fotorealizmu w znacznie mniej oczywistych scenariuszach – takich jak odbijająca się powierzchnia ulicy lub pola bitwy po deszczu; odbicie przeciwległej ulicy w sklepowej witrynie lub szklanej drzwi; lub w okularach przedstawionych postaci, gdzie obiekty i środowiska mogą być wymagane do pojawienia się.

Symulowane podwójne odbicie osiągnięte za pomocą tradycyjnego komponowania dla ikonicznej sceny w 'Matrixie' (1999).

Symulowane podwójne odbicie osiągnięte za pomocą tradycyjnego komponowania dla ikonicznej sceny w ‘Matrixie’ (1999).

Problemy z obrazem

Z tego powodu ramy, które były popularne przed pojawieniem się modeli dyfuzji, takie jak Neural Radiance Fields (NeRF), oraz niektóre nowsze wyzwania, takie jak Gaussian Splatting, nadal mają swoje własne trudności w odwzorowaniu odbić w naturalny sposób.

Projekt REF2-NeRF (przedstawiony poniżej) zaproponował metodę modelowania opartą na NeRF dla scen zawierających szklaną obudowę. W tej metodzie załamania i odbicia były modelowane przy użyciu elementów zależnych i niezależnych od perspektywy widza. To podejście pozwoliło badaczom oszacować powierzchnie, na których występowało załamanie, a w szczególności szklane powierzchnie, oraz umożliwiło separację i modelowanie zarówno bezpośrednich, jak i odbitych składników światła.

Przykłady z papieru Ref2Nerf. Źródło: https://arxiv.org/pdf/2311.17116

Przykłady z papieru Ref2Nerf. Źródło: https://arxiv.org/pdf/2311.17116

Inne rozwiązania NeRF dotyczące odbić z ostatnich 4-5 lat obejmowały NeRFReN, Reflecting Reality oraz projekt Planar Reflection-Aware Neural Radiance Fields firmy Meta z 2024 roku.

Dla GSplat, artykuły takie jak Mirror-3DGS, Reflective Gaussian Splatting i RefGaussian oferowały rozwiązania dotyczące problemu odbić, natomiast projekt Nero z 2023 roku zaproponował specjalną metodę włączania cech odbijających do reprezentacji neuronalnych.

MirrorVerse

Uzyskanie modelu dyfuzji, który szanuje logikę odbić, jest prawdopodobnie trudniejsze niż w przypadku podejść wyraźnie strukturalnych, nie-semantycznych, takich jak Gaussian Splatting i NeRF. W modelach dyfuzji reguła tego rodzaju jest prawdopodobnie tylko wtedy, gdy dane szkoleniowe zawierają wiele różnych przykładów w szerokim zakresie scenariuszy, co sprawia, że jest ona silnie zależna od dystrybucji i jakości oryginalnego zbioru danych.

Tradycyjnie, dodawanie określonych zachowań tego rodzaju jest domeną LoRA lub dostosowywania modelu podstawowego; jednak te rozwiązania nie są idealne, ponieważ LoRA ma tendencję do skrzywienia danych wyjściowych w kierunku własnych danych szkoleniowych, nawet bez podpowiedzi, podczas gdy dostosowywanie – poza tym, że jest drogie – może odwrócić główny model w sposób nieodwracalny, tworząc cały szereg powiązanych narzędzi niestandardowych, które nigdy nie będą działać z żadnym innym odłamem modelu, w tym oryginalnym.

W ogóle, poprawa modeli dyfuzji wymaga, aby dane szkoleniowe poświęcały większą uwagę fizyce odbić. Jednak wiele innych obszarów również wymaga podobnej specjalnej uwagi. W kontekście zbiorów danych o dużym stopniu skali, gdzie niestandardowa kuracja jest kosztowna i trudna, rozwiązanie każdej słabości w ten sposób jest niewykonalne.

Niemniej, rozwiązania problemu odbić LDM pojawiają się od czasu do czasu. Jednym z takich niedawnych wysiłków, pochodzącym z Indii, jest projekt MirrorVerse, który oferuje ulepszony zbiór danych i metodę szkolenia, zdolną do poprawy stanu sztuki w tym konkretnym wyzwaniu w badaniach nad dyfuzją.

Najbardziej na prawo, wyniki z MirrorVerse w porównaniu z dwoma poprzednimi podejściami (środkowe dwie kolumny). Źródło: https://arxiv.org/pdf/2504.15397

Najbardziej na prawo, wyniki z MirrorVerse w porównaniu z dwoma poprzednimi podejściami (środkowe dwie kolumny). Źródło: https://arxiv.org/pdf/2504.15397

Jak widać w powyższym przykładzie (obraz tytułowy w PDF nowego badania), MirrorVerse poprawia wyniki w porównaniu z niedawnymi podejściami dotyczącymi tego samego problemu, ale jest daleko od ideału.

W górnej prawej części obrazu widzimy, że ceramiczne dzbanki są nieco na prawo od miejsca, w którym powinny się znajdować, a na poniższym obrazie, który technicznie nie powinien zawierać odbicia kubka, niedokładne odbicie zostało wstawione do prawej części, wbrew logice naturalnych kątów odbicia.

Dlatego też przyjrzymy się nowej metodzie nie tyle dlatego, że może reprezentować obecny stan sztuki w dyfuzji opartej na odbiciach, ale również dlatego, aby zilustrować, w jakim stopniu może to być nierozwiązywalny problem dla modeli dyfuzji latentnej, statycznej i wideo, ponieważ wymagane przykłady danych o odbiciach są najprawdopodobniej splecione z określonymi działaniami i scenariuszami.

Dlatego ta konkretna funkcja modeli LDM może nadal nie spełniać oczekiwań w porównaniu z podejściami specyficznych struktur, takimi jak NeRF, GSplat i tradycyjne CGI.

Nowy artykuł pt. MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World, pochodzi od trzech badaczy z Vision and AI Lab, IISc Bangalore, oraz Samsung R&D Institute w Bangalore. Artykuł ma powiązaną stronę projektu, a także zbiór danych w Hugging Face, z kodem źródłowym opublikowanym na GitHub.

Metoda

Badacze zauważają na początku, że modele takie jak Stable Diffusion i Flux mają trudności z poszanowaniem podpowiedzi opartych na odbiciach, ilustrując problem w następujący sposób:

Z artykułu: Bieżące modele generatywne, SD3.5 i Flux, wykazywały znaczne trudności w generowaniu spójnych i geometrycznie dokładnych odbić, gdy zostaną poproszone o wygenerowanie odbić w scenie.

Z artykułu: Bieżące modele generatywne, SD3.5 i Flux, wykazywały znaczne trudności w generowaniu spójnych i geometrycznie dokładnych odbić, gdy zostaną poproszone o wygenerowanie ich w scenie.

Badacze opracowali MirrorFusion 2.0, model generatywny oparty na dyfuzji, którego celem jest poprawa fotorealizmu i dokładności geometrycznej odbić lustrzanych w syntetycznych obrazach. Szkolenie modelu opierało się na nowo opracowanym zbiorze danych autorów, zatytułowanym MirrorGen2, zaprojektowanym w celu rozwiązania słabości ogólnych, które zaobserwowano w poprzednich podejściach.

MirrorGen2 rozwija wcześniejsze metody, wprowadzając losowe pozycjonowanie obiektów, losowe obroty i jawne zakotwiczenie obiektów, w celu zapewnienia, że odbicia pozostają prawdopodobne w szerokim zakresie pozycji i ustawień obiektów względem powierzchni lustra.

Schemat generowania danych syntetycznych w MirrorVerse: potok generowania danych zastosował kluczowe augmentacje, losowo pozycjonując, obracając i zakotwiczając obiekty w scenie przy użyciu 3D-Positioner. Obiekty są również łączone w semantycznie spójnych parach, aby symulować złożone relacje przestrzenne i zakrycia, umożliwiając zbiorowi danych przechwytywanie bardziej realistycznych interakcji w scenach z wieloma obiektami.

Schemat generowania danych syntetycznych w MirrorVerse: potok generowania danych zastosował kluczowe augmentacje, losowo pozycjonując, obracając i zakotwiczając obiekty w scenie przy użyciu 3D-Positioner. Obiekty są również łączone w semantycznie spójnych parach, aby symulować złożone relacje przestrzenne i zakrycia, umożliwiając zbiorowi danych przechwytywanie bardziej realistycznych interakcji w scenach z wieloma obiektami.

Aby dalej wzmocnić zdolność modelu do radzenia sobie z złożonymi układami przestrzennymi, potok MirrorGen2 obejmuje połączone sceny obiektów, umożliwiając systemowi lepsze przedstawienie zakryć i interakcji między wieloma elementami w ustawieniach odbijających.

W artykule napisano:

‘Kategorie są łączone ręcznie, aby zapewnić spójność semantyczną – na przykład, łączenie krzesła z stołem. Podczas renderowania, po pozycjonowaniu i obróceniu głównego [obiektu], dodatkowy [obiekt] z połączonej kategorii jest pobierany i ustawiany w taki sposób, aby uniknąć nakładania się, zapewniając odrębne regiony przestrzenne w scenie.’

W odniesieniu do jawnego zakotwiczenia obiektów, tutaj autorzy upewnili się, że wygenerowane obiekty były „zakotwiczone” do podłoża w danych syntetycznych, a nie „unosiły się” w sposób nieodpowiedni, co może wystąpić, gdy dane syntetyczne są generowane w dużym stopniu lub przy użyciu wysoko zautomatyzowanych metod.

Ponieważ innowacja w zbiorze danych jest centralnym elementem nowości artykułu, przejdziemy do tej sekcji wcześniej niż zwykle.

Dane i testy

SynMirrorV2

Zbiór danych SynMirrorV2 autorów został opracowany w celu poprawy różnorodności i realizmu danych szkoleniowych dotyczących odbić lustrzanych, zawierających obiekty 3D pochodzące z Objaverse i Amazon Berkeley Objects (ABO), które zostały następnie przefiltrowane za pomocą OBJECT 3DIT, a także procesu filtrowania z wersji 1 projektu MirrorFusion, w celu usunięcia niskiej jakości aktywów. W efekcie powstał ulepszony zbiór 66 062 obiektów.

Przykłady z zestawu danych Objaverse, wykorzystane do stworzenia opracowanego zbioru danych dla nowego systemu. Źródło: https://arxiv.org/pdf/2212.08051

Przykłady z zestawu danych Objaverse, wykorzystane do stworzenia opracowanego zbioru danych dla nowego systemu. Źródło: https://arxiv.org/pdf/2212.08051

Budowa sceny obejmowała umieszczenie tych obiektów na podłogach z CC-Textures i tłach HDRI z repozytorium PolyHaven, przy użyciu luster pełnościenne lub wysokich prostokątnych. Oświetlenie zostało zunifikowane z obszarem światła umieszczonym nad i za obiektami, pod kątem 45 stopni. Obiekty zostały skalibrowane, aby zmieścić się w jednostkowej kostce i umieszczone przy użyciu preobliczonego przecięcia lustra i frustum kamery, zapewniając widoczność.

Losowe obroty zostały zastosowane wokół osi y, a technika zakotwiczenia została użyta, aby zapobiec „pływającym artefaktom”.

Aby symulować bardziej złożone sceny, zbiór danych obejmuje również wiele obiektów ustawionych zgodnie z semantycznie spójnymi parami na podstawie kategorii ABO. Obiekty wtórne zostały umieszczone w taki sposób, aby uniknąć nakładania się, tworząc 3 140 scen z wieloma obiektami, zaprojektowanych w celu przechwycenia różnych zakryć i relacji głębokich.

Przykłady wyrenderowanych widoków z zestawu danych autorów, zawierających wiele (więcej niż dwa) obiektów, z ilustracjami segmentacji obiektów i wizualizacjami map głębokich poniżej.

Przykłady wyrenderowanych widoków z zestawu danych autorów, zawierających wiele (więcej niż dwa) obiektów, z ilustracjami segmentacji obiektów i wizualizacjami map głębokich poniżej.

Proces szkolenia

Uznając, że realizm syntetyczny sam w sobie jest niewystarczający do solidnego uogólnienia na dane świata rzeczywistego, badacze opracowali trzystopniowy proces szkolenia dla MirrorFusion 2.0.

W etapie 1 autorzy zainicjowali wagi zarówno gałęzi warunkującej, jak i generującej z punktu kontrolnego Stable Diffusion v1.5, a następnie dostosowali model do pojedynczego obiektu podziału szkoleniowego zestawu danych SynMirrorV2. W przeciwieństwie do wspomnianego powyżej projektu Reflecting Reality, badacze nie zamrozili gałąź generującą. Następnie przeszkolili model przez 40 000 iteracji.

W etapie 2 model został dostosowany przez dodatkowe 10 000 iteracji na wielu obiektach podziału szkoleniowego SynMirrorV2, w celu nauczenia systemu radzenia sobie z zakryciami i bardziej złożonymi układami przestrzennymi, występującymi w realistycznych scenach.

Wreszcie, w etapie 3 przeprowadzono dodatkowe 10 000 iteracji dostosowywania przy użyciu danych świata rzeczywistego z zestawu danych MSD, przy użyciu map głębokich wygenerowanych przez estymator głębokich Matterport3D.

Przykłady z zestawu danych MSD, z analizą scen świata rzeczywistego na mapy głębokie i segmentację.

Przykłady z zestawu danych MSD, z analizą scen świata rzeczywistego na mapy głębokie i segmentację. Źródło: https://arxiv.org/pdf/1908.09101

Podczas szkolenia podpowiedzi tekstowe zostały pominięte przez 20% czasu szkolenia, aby zachęcić model do maksymalnego wykorzystania dostępnych informacji o głębokości (tj. podejście „zamaskowane”).

Szkolenie odbywało się na czterech kartach graficznych NVIDIA A100 dla wszystkich etapów (specyfikacja VRAM nie jest podana, choć mogłaby wynosić 40 GB lub 80 GB na kartę). Zastosowano szybkość uczenia 1e-5 z rozmiarem partii 4 na kartę graficzną, przy użyciu optymalizatora AdamW.

Ten schemat szkolenia stopniowo zwiększał trudność zadań przedstawianych modelowi, zaczynając od prostszych scen syntetycznych i stopniowo przechodząc do bardziej wymagających kompozycji, z zamiarem rozwoju solidnej przenośności na dane świata rzeczywistego.

Testy

Autorzy ocenili MirrorFusion 2.0 w porównaniu z poprzednim stanem sztuki, MirrorFusion, który służył jako punkt odniesienia, oraz przeprowadzili eksperymenty na zestawie danych MirrorBenchV2, obejmując zarówno sceny z jednym, jak i wieloma obiektami.

Dodatkowe testy jakościowe zostały przeprowadzone na próbkach z zestawu danych MSD, a także z zestawu danych Google Scanned Objects (GSO).

Ocena wykorzystywała 2 991 obrazów z jednym obiektem z kategorii widzianych i niewidzianych, oraz 300 scen z dwoma obiektami z ABO. Wartość została zmierzona przy użyciu wskaźnika sygnału do szumu (PSNR); wskaźnika podobieństwa strukturalnego (SSIM); oraz naukowo pojętej podobieństwa patchów obrazu (LPIPS), aby ocenić jakość odbicia w regionie lustra. Podobieństwo CLIP zostało wykorzystane do oceny wyrównania tekstowego z wejściowymi podpowiedziami.

W testach ilościowych autorzy wygenerowali obrazy przy użyciu czterech nasion dla określonej podpowiedzi, a następnie wybrali wynikowy obraz z najlepszym wynikiem SSIM. Dwie tabelaryczne wyniki testów ilościowych są przedstawione poniżej.

Lewy: Wyniki ilościowe dla jakości generowania odbić obiektów pojedynczych na podziale obiektów pojedynczych MirrorBenchV2. MirrorFusion 2.0 przewyższył punkt odniesienia, z najlepszymi wynikami wyróżnionymi pogrubieniem. Prawy: Wyniki ilościowe dla jakości generowania odbić obiektów wielu na podziale obiektów wielu MirrorBenchV2. MirrorFusion 2.0 przeszkolony z wieloma obiektami przewyższył wersję przeszkoloną bez nich, z najlepszymi wynikami wyróżnionymi pogrubieniem.

Lewy: Wyniki ilościowe dla jakości generowania odbić obiektów pojedynczych na podziale obiektów pojedynczych MirrorBenchV2. MirrorFusion 2.0 przewyższył punkt odniesienia, z najlepszymi wynikami wyróżnionymi pogrubieniem. Prawy: Wyniki ilościowe dla jakości generowania odbić obiektów wielu na podziale obiektów wielu MirrorBenchV2. MirrorFusion 2.0 przeszkolony z wieloma obiektami przewyższył wersję przeszkoloną bez nich, z najlepszymi wynikami wyróżnionymi pogrubieniem.

Autorzy komentują:

‘[Wyniki] pokazują, że nasza metoda przewyższa metodę punktu odniesienia, a dostosowanie do wielu obiektów poprawia wyniki w złożonych scenach.’

Większość wyników, a także te, które są podkreślane przez autorów, dotyczą testów jakościowych. Ze względu na wymiary tych ilustracji, możemy tylko częściowo odtworzyć przykłady z artykułu.

Porównanie na MirrorBenchV2: punkt odniesienia nie utrzymał dokładnych odbić i spójności przestrzennej, pokazując nieprawidłową orientację krzesła i zniekształcone odbicia wielu obiektów, podczas gdy (jak twierdzą autorzy) MirrorFusion 2.0 prawidłowo renderuje krzesło i kanapę, z dokładną pozycją, orientacją i strukturą.

Porównanie na MirrorBenchV2: punkt odniesienia nie utrzymał dokładnych odbić i spójności przestrzennej, pokazując nieprawidłową orientację krzesła i zniekształcone odbicia wielu obiektów, podczas gdy (jak twierdzą autorzy) MirrorFusion 2.0 prawidłowo renderuje krzesło i kanapę, z dokładną pozycją, orientacją i strukturą.

Z tych subiektywnych wyników autorzy twierdzą, że model punktu odniesienia nie był w stanie prawidłowo wyrenderować orientacji obiektu i relacji przestrzennych w odbiciach, często wytwarzając artefakty, takie jak nieprawidłowa rotacja i unoszące się obiekty. MirrorFusion 2.0, przeszkolony na SynMirrorV2, według autorów, zachowuje prawidłową orientację obiektu i pozycjonowanie w scenach z jednym i wieloma obiektami, w wyniku czego otrzymuje się bardziej realistyczne i spójne odbicia.

Poniżej widzimy wyniki jakościowe na wspomnianym zestawie danych GSO:

Porównanie na zestawie danych GSO. Punkt odniesienia źle przedstawił strukturę obiektu i wytworzył niekompletne, zniekształcone odbicia, podczas gdy MirrorFusion 2.0, jak twierdzą autorzy, zachowuje integralność przestrzenną i generuje dokładną geometrię, kolor i szczegóły, nawet w przypadku obiektów poza zestawem danych.

Porównanie na zestawie danych GSO. Punkt odniesienia źle przedstawił strukturę obiektu i wytworzył niekompletne, zniekształcone odbicia, podczas gdy MirrorFusion 2.0, jak twierdzą autorzy, zachowuje integralność przestrzenną i generuje dokładną geometrię, kolor i szczegóły, nawet w przypadku obiektów poza zestawem danych.

Tutaj autorzy komentują:

‘MirrorFusion 2.0 generuje znacznie bardziej dokładne i realistyczne odbicia. Na przykład, w Fig. 5 (a – powyżej), MirrorFusion 2.0 prawidłowo odbija uchwyty szuflady (wyróżnione na zielono), podczas gdy model punktu odniesienia wytwarza nieprawdopodobne odbicie (wyróżnione na czerwono). ‘

‘Podobnie, dla „biało-żółtej filiżanki” w Fig. 5 (b), MirrorFusion 2.0 dostarcza przekonywującą geometrię z minimalnymi artefaktami, w przeciwieństwie do punktu odniesienia, który nie jest w stanie dokładnie uchwycić geometrii i wyglądu obiektu.’

Ostatni test jakościowy został przeprowadzony na zestawie danych MSD (częściowe wyniki poniżej):

Wyniki scen świata rzeczywistego, porównujące MirrorFusion, MirrorFusion 2.0 i MirrorFusion 2.0, dostosowane do zestawu danych MSD. MirrorFusion 2.0, jak twierdzą autorzy, przechwytuje bardziej szczegółowe detale scen w sposób bardziej dokładny, w tym zatłoczone obiekty na stole i obecność wielu luster w trójwymiarowym środowisku. Pokazujemy tylko częściowe wyniki, ze względu na wymiary wyników w oryginalnym artykule, do którego odsyłamy czytelnika w celu uzyskania pełnych wyników i lepszej rozdzielczości.

Wyniki scen świata rzeczywistego, porównujące MirrorFusion, MirrorFusion 2.0 i MirrorFusion 2.0, dostosowane do zestawu danych MSD. MirrorFusion 2.0, jak twierdzą autorzy, przechwytuje bardziej szczegółowe detale scen w sposób bardziej dokładny, w tym zatłoczone obiekty na stole i obecność wielu luster w trójwymiarowym środowisku. Pokazujemy tylko częściowe wyniki, ze względu na wymiary wyników w oryginalnym artykule, do którego odsyłamy czytelnika w celu uzyskania pełnych wyników i lepszej rozdzielczości.

Tutaj autorzy zauważają, że chociaż MirrorFusion 2.0 dobrze radził sobie z danymi MirrorBenchV2 i GSO, początkowo miał trudności ze złożonymi scenami świata rzeczywistego w zestawie danych MSD. Dostosowanie modelu do podzbioru MSD poprawiło jego zdolność do radzenia sobie z zatłoczonymi środowiskami i wieloma lustrem, w wyniku czego otrzymano bardziej spójne i szczegółowe odbicia w podziale testowym.

Ponadto przeprowadzono badanie użytkowników, w którym 84% użytkowników preferowało generacje z MirrorFusion 2.0 w porównaniu z metodą punktu odniesienia.

Wyniki badania użytkowników.

Wyniki badania użytkowników.

Ponieważ szczegóły badania użytkowników zostały przeniesione do załącznika artykułu, odsyłamy czytelnika tam w celu uzyskania szczegółów badania.

Wnioski

Chociaż wiele z przedstawionych wyników to imponujące poprawki stanu sztuki, stan sztuki w tym konkretnym przypadku jest tak zły, że nawet nieprzekonywające rozwiązanie może wygrać z minimalnym wysiłkiem. Podstawowa architektura modelu dyfuzji jest niekorzystna dla niezawodnego uczenia się i demonstracji spójnej fizyki, tak że problem jest źle sformułowany i wydaje się nie nadawać się do eleganckiego rozwiązania.

Dalej, dodawanie danych do istniejących modeli jest już standardową metodą naprawy braków w wydajności LDM, z wszystkimi wymienionymi wcześniej wadami. Jest rozsądnie przyjąć, że jeśli przyszłe duże zestawy danych będą poświęcać większą uwagę dystrybucji (i adnotacji) punktów danych związanych z odbiciami, możemy oczekiwać, że wynikowe modele będą lepiej radzić sobie z tym scenariuszem.

Jednakże, to samo dotyczy wielu innych słabości w danych wyjściowych LDM – kto może powiedzieć, które z nich najbardziej zasługują na wysiłek i pieniądze zaangażowane w rodzaj rozwiązania, które autorzy nowego artykułu proponują tutaj?

 

Pierwotnie opublikowane w poniedziałek, 28 kwietnia 2025 r. Wtorek, 29 kwietnia: dokonano korekty gramatycznej w końcowych akapitach.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai