Modele i platformy AI
LucidDreamer: Wysoka-jakościowa generacja 3D z wykorzystaniem Interval Score Matching

Ostatnie postępy w dziedzinie generatywnych modeli AI do tworzenia treści 3D oznaczały znaczący kamień milowy w modelach generatywnych. Otworzyły one drogę do nowych możliwości tworzenia aktywów 3D w różnych scenariuszach świata rzeczywistego. Cyfrowe aktywa 3D zajmują obecnie niezastąpione miejsce w naszej obecności cyfrowej, umożliwiając kompleksową wizualizację i interakcję z złożonymi środowiskami i obiektami, które odzwierciedlają nasze doświadczenia świata rzeczywistego. Te ramy generatywne AI są stosowane w różnych dziedzinach, w tym w animacji, architekturze, grach, rozszerzonej i wirtualnej rzeczywistości oraz wielu innych. Są one również wykorzystywane na dużą skalę w konferencjach online, handlu, edukacji i marketingu.
Jednak pomimo obietnic tych postępów w ramach generatywnych 3D, szerokie wykorzystanie technologii 3D wiąże się z poważnym problemem. Generowanie wysokiej jakości obrazów i treści 3D nadal wymaga znacznego czasu, wysiłku, zasobów i wykwalifikowanej ekspertyzy. Nawet jeśli te wymagania są spełnione, generowanie 3D z tekstu często nie powoduje wyrenderowania szczegółowych i wysokiej jakości modeli 3D. Ten problem renderowania i niskiej jakości generowania 3D jest bardziej powszechny w ramach, które wykorzystują metodę Score Distillation Sampling (SDS). Artykuł ten omówi znaczące braki obserwowane w modelach wykorzystujących metodę SDS, które wprowadzają nieścisłości i niską jakość kierunków aktualizacji, powodując efekt przesadnego wygładzania wygenerowanego wyjścia. Przedstawimy również ramę LucidDreamer, nowy podejście, które wykorzystuje metodę Interval Score Matching (ISM), aby pokonać problem przesadnego wygładzania. Zbadamy architekturę modelu i jego wydajność w porównaniu z ramami generatywnymi 3D na poziomie stanu sztuki. Zatem, zacznijmy.
LucidDreamer3D: Wprowadzenie do generacji 3D z wykorzystaniem Interval Score Matching
Głównym powodem, dla którego modele generowania 3D były tematem zainteresowania branży AI, jest ich szerokie zastosowanie w różnych dziedzinach i branżach, a także ich zdolność do produkcji treści 3D w czasie rzeczywistym. Ze względu na ich szerokie zastosowanie praktyczne, deweloperzy zaproponowali wiele podejść do generowania treści 3D, z których wyróżnia się generowanie 3D z tekstu ze względu na możliwość wykorzystania tylko opisów tekstowych do generowania wyobrażonych modeli 3D. Ramy generatywne 3D z tekstu osiągają to, wykorzystując wstępnie wytrenowany model dyfuzyjny obrazu jako silny obraz przed nadzorowanym treningiem modelu neuronalnego z parametryzowanymi cechami 3D, co pozwala na renderowanie obrazów 3D w sposób ciągły, zgodny z tekstem. Ta zdolność do renderowania stałych obrazów 3D opiera się na wykorzystaniu SDS, co umożliwia SDS działać jako podstawowy mechanizm przenoszenia wyników 2D z modeli dyfuzyjnych do ich odpowiedników 3D, umożliwiając trening modeli 3D bez wykorzystania obrazów treningowych. Pomimo ich skuteczności, ramy generatywne 3D wykorzystujące metodę SDS często cierpią z powodu zniekształceń i problemów z przesadnym wygładzaniem, co utrudnia praktyczne zastosowanie wysokiej jakości generowania 3D.
Aby rozwiązać problemy z przesadnym wygładzaniem, ramy LucidDreamer wdrożono podejście ISM lub Interval Score Matching, nowe podejście, które wykorzystuje dwie skuteczne mechanizmy. Po pierwsze, podejście ISM wykorzystuje metodę DDIM inversion, aby złagodzić efekt średniego spowodowany przez nieścisłości pseudo-Grund Truth, produkując odwracalną trajektorię dyfuzyjną. Po drugie, zamiast dopasowywać obrazy wyrenderowane przez model 3D z pseudo-Grund Truth, metoda ISM dopasowuje je między dwoma krokami w trajektorii dyfuzyjnej, co pomaga uniknąć wysokiego błędu rekonstrukcji, unikając rekonstrukcji jednego kroku. Wykorzystanie ISM zamiast SDS prowadzi do ciągłej wysokiej wydajności z bardzo realistycznymi i szczegółowymi wynikami.
Ogólnie ramy LucidDreamer mają na celu wniesienie następujących wkładów w dziedzinie generatywnych modeli 3D
- Dostarcza dogłębną analizę SDS, podstawowej koncepcji w ramach generatywnych 3D z tekstu, i identyfikuje jego kluczowe ograniczenia, takie jak niska jakość pseudo-Grund Truth i wyjaśnia efekt przesadnego wygładzania, z którym borykają się te ramy generatywne 3D.
- Aby przeciwdziałać ograniczeniom SDS, ramy LucidDreamer wprowadzają Interval Score Matching, nowe podejście, które wykorzystuje dopasowanie oparte na interwale i odwracalne trajektorie dyfuzyjne, aby przewyższyć SDS, produkując bardzo realistyczne i szczegółowe wyniki.
- Osiągają wyniki na poziomie stanu sztuki, integrując metodę ISM z 3D Gaussian Splatting, aby przewyższyć istniejące metody generowania treści 3D przy niskich kosztach treningu.
Ograniczenia SDS
Jak wcześniej wspomniano, SDS jest jednym z najpopularniejszych podejść do generowania 3D z tekstu, i szuka trybów dla warunkowego posterioru w przestrzeni latentnej DDPM. Podejście SDS również wykorzystuje wstępnie wytrenowany DDPM do modelowania warunkowego posterioru i dąży do destylacji reprezentacji 3D dla warunkowego posterioru, co jest osiągane przez minimalizację następującej dywergencji KL. Ponadto, podejście SDS również wykorzystuje ważone denoising score matching jako cel treningu DDP. Główny cel podejścia SDS można również uznać za dopasowanie widoku modelu 3D z pseudo-Grund Truth, oszacowanym przez DDPM w jednym kroku, chociaż proces destylacji często pomija kluczowe aspekty składnika DDPM, i poniższy rysunek pokazuje, jak wstępnie wytrenowany DDPM ma tendencję do przewidywania pseudo-Grund Truth z nieścisłymi cechami, i produkuje niską jakość wyjścia podczas procesu destylacji.

Jednak kierunki aktualizacji w niepożądanych okolicznościach są aktualizowane do reprezentacji 3D, co w końcu prowadzi do wyników przesadnie wygładzonych. Ponadto, warto zauważyć, że składnik DDPM jest wrażliwy na dane wejściowe, a cechy pseudo-Grund Truth zmieniają się znacząco nawet przy niewielkich zmianach danych wejściowych. Dodatkowo, losowość w pozycji kamery i składniku szumu wejściowego może dodać do fluktuacji, które są nieuniknione podczas destylacji. Optymalizacja danych wejściowych dla nieścisłych pseudo-Grund Truth prowadzi do wyników ze średnią cechą. Co więcej, podejście SDS uzyskuje pseudo-Grund Truth z jednym krokiem przewidywania dla wszystkich przedziałów czasowych i nie bierze pod uwagę ograniczeń jednego kroku DDPM, które nie są w stanie wyprodukować wysokiej jakości wyników, co wskazuje, że destylacja aktywów 3D lub obrazów z komponentem SDS może nie być najbardziej optymalnym podejściem.
LucidDreamer: Metodologia i Działanie
Ramy LucidDreamer wprowadzają podejście ISM, ale również opierają się na wnioskach z innych ram, w tym modelach generatywnych 3D z tekstu, modelach dyfuzyjnych i różniczkowalnych reprezentacjach 3D. Mówiąc to, przyjrzyjmy się szczegółowo architekturze i metodologii ram LucidDreamer.
Interval Score Matching lub ISM
Problemy z przesadnym wygładzaniem i niską jakością wyników, z którymi boryka się większość ram generatywnych 3D z tekstu, można przypisać ich wykorzystaniu podejścia SDS, które dąży do dopasowania pseudo-Grund Truth z reprezentacjami 3D, które jest nieścisłe i często ma niską jakość. Aby przeciwdziałać problemom podejścia SDS, ramy LucidDreamer wprowadzają ISM lub Interval Score Matching, nowe podejście, które składa się z dwóch etapów działania. W pierwszym etapie, komponent ISM uzyskuje bardziej spójne pseudo-Grund Truth podczas destylacji, niezależnie od losowości w pozycjach kamery i szumie. W drugim etapie, ramy generują pseudo-Grund Truth o lepszej jakości.
Inną znaczącą ograniczeniem SDS jest generowanie pseudo-Grund Truth z jednym krokiem przewidywania dla wszystkich przedziałów czasowych, co utrudnia gwarantowanie wysokiej jakości pseudo-Grund Truth, i stanowi podstawę do poprawy jakości wizualnej pseudo-Grund Truth. W podobny sposób, cel podejścia SDS można uznać za dopasowanie widoku modelu 3D z pseudo-Grund Truth, oszacowanym przez DDPM w jednym kroku, chociaż proces destylacji pomija kluczowy aspekt składnika DDPM, tzn. produkuje niską jakość pseudo-Grund Truth z nieścisłymi cechami podczas procesu destylacji.
Ogólnie, komponent ISM obiecuje dostarczyć kilka zalet w porównaniu z poprzednimi metodami wykorzystywanymi w modelach generatywnych 3D z tekstu. Po pierwsze, dzięki zdolności ISM do dostarczania wysokiej jakości pseudo-Grund Truth w sposób ciągły, jest w stanie produkować wyniki destylacji o wysokiej wierności z bardziej szczegółowymi strukturami i bogatszymi detalami, co eliminuje potrzebę dużej skali prowadzenia i zwiększa elastyczność tworzenia treści 3D. Po drugie, przejście z podejścia SDS do ISM ma marginalne nakłady obliczeniowe, szczególnie gdy podejście ISM nie kompromituje ogólnej wydajności, nawet jeśli wymaga dodatkowych kosztów obliczeniowych dla odwrócenia DDIM.

Powyższy rysunek pokazuje działanie podejścia ISM i dostarcza przegląd architektury ram LucidDreamer. Ramy najpierw inicjują 3D Gaussian Splatting, czyli reprezentacje 3D, z wykorzystaniem wstępnie wytrenowanego generatora 3D z tekstu z podpowiedzią. Następnie jest ono połączone z wstępnie wytrenowanym komponentem 2D DDPM, aby zakłócić losowe widoki na trajektorie latentne bezwarunkowe z wykorzystaniem odwrócenia DDIM, a następnie aktualizuje z wynikiem intervalu. Dzięki swojej architekturze, rdzeń optymalizacji komponentu ISM koncentruje się na aktualizacji reprezentacji 3D w kierunku pseudo-Grund Truth, które są wysokiej jakości i spójne, a jednocześnie przyjazne obliczeniowo. To podejście pozwala ISM na wyrównanie z podstawowymi celami podejścia SDS, jednocześnie doskonaląc istniejącą metodę.
Odwrócenie DDIM
Ramy LucidDreamer mają na celu wyprodukowanie bardziej spójnych pseudo-Grund Truth w zgodzie z reprezentacjami 3D. Dlatego, zamiast produkować reprezentacje 3D, ramy LucidDreamer wykorzystują podejście odwrócenia DDIM, aby przewidzieć latentne reprezentacje 3D z szumem i przewidzieć odwracalną trajektorię latentną w sposób iteracyjny. Ponadto, dzięki odwracalności odwrócenia DDIM, ramy LucidDreamer są w stanie zwiększyć spójność pseudo-Grund Truth znacząco we wszystkich przedziałach czasowych.
Zaawansowana Pipelina Generacji
Ramy LucidDreamer wprowadzają również zaawansowaną pipelinę, oprócz ISM, aby zbadać czynniki wpływające na jakość wizualną generowania 3D z tekstu, i wprowadzają 3D Gaussian Splatting lub 3DGS jako model generacji 3D i model generacji chmury punktów 3D do inicjacji.
3D Gaussian Splatting
Istniejące prace wskazują, że zwiększenie rozmiaru partii i rozdzielczości renderowania podczas treningu znacząco poprawia jakość wizualną. Jednak większość reprezentacji 3D, które są wykorzystywane w generowaniu 3D z tekstu, jest czasochłonna i wymaga dużej ilości pamięci. Z drugiej strony, podejście 3D Gaussian Splatting dostarcza wydajne wyniki w optymalizacji i renderowaniu, co pozwala zaawansowanej pipelinie w ramach LucidDreamer osiągnąć duży rozmiar partii i wysoką rozdzielczość renderowania, nawet przy ograniczonych zasobach obliczeniowych.
Inicjacja
Większość modeli generatywnych 3D z tekstu na poziomie stanu sztuki inicjuje swoje reprezentacje 3D z ograniczonymi geometriami, takimi jak koło, prostokąt lub cylinder, co często prowadzi do niepożądanych wyników w przypadku obiektów nieaxialnie symetrycznych. Z drugiej strony, ramy LucidDreamer wprowadzają 3D Gaussian Splatting jako reprezentacje 3D, co pozwala ramom przyjąć wiele generatorów punktowych z tekstu w sposób naturalny, aby wygenerować grube inicjacje z wejściami ludzkimi. Strategia inicjacji zwiększa znacząco prędkość zbieżności.
LucidDreamer: Eksperymenty i Wyniki
Generowanie 3D z Tekstu

Powyższy rysunek pokazuje wyniki wygenerowane przez model LucidDreamer z oryginalnym podejściem stabilnej dyfuzyjnej, natomiast poniższy rysunek omawia wyniki wygenerowane na różnych punktach kontrolnych dostrajania.

Jak widać, ramy LucidDreamer są w stanie generować bardzo spójne treści 3D z wykorzystaniem tekstu wejściowego i wskazówek semantycznych. Ponadto, z wykorzystaniem ISM, ramy LucidDreamer generują intratne i bardziej realistyczne obrazy, unikając typowych problemów, takich jak przesadna nasycenie lub przesadne wygładzanie, i wyróżniając się w generowaniu zarówno powszechnych obiektów, jak i kreatywnych tworów.
Ogólność ISM
Aby ocenić ogólność ISM, przeprowadzono porównanie między ISM a SDS w przedstawieniach jawnych i niejawnych, a wyniki są pokazane na poniższym rysunku.

Porównanie Jakościowe
Aby przeanalizować jakościową wydajność ram LucidDreamer, porównano je z aktualnymi modelami stanu sztuki, a aby zapewnić uczciwe porównanie, wykorzystano ramę stabilnej dyfuzyjnej 2.1 do destylacji, a wyniki są pokazane na poniższym rysunku. Jak widać, ramy dostarczają wyniki o wysokiej wierności i geometrycznie dokładne, przy jednoczesnym zużyciu mniejszych zasobów i czasu.

Ponadto, aby dostarczyć bardziej wszechstronną ocenę, deweloperzy również przeprowadzili badanie użytkowników. Ocena wybrała 28 podpowiedzi i wykorzystała różne podejścia do generowania 3D z tekstu, aby wygenerować obiekty. Wyniki zostały następnie uszeregowane przez użytkowników na podstawie stopnia zgodności z podpowiedzią wejściową i ich wierności.

LucidDreamer: Zastosowania
Ze względu na ich wyjątkową wydajność w szerokim zakresie zadań generowania 3D z tekstu, ramy LucidDreamer mają kilka potencjalnych zastosowań, w tym generowanie awatarów zero-shot, personalizowane generowanie 3D z tekstu i edycja 2D i 3D zero-shot.

Górny lewy rysunek pokazuje potencjał LucidDreamer w zadaniach edycji 2D i 3D, natomiast dolne lewe obrazy pokazują zdolność ram do generowania personalizowanych wyników 3D z tekstu z LoRA, a obraz po prawej stronie prezentuje możliwość generowania awatarów 3D.
Końcowe Myśli
W tym artykule omówiliśmy LucidDreamer, nowe podejście, które wykorzystuje metodę Interval Score Matching, aby pokonać problem przesadnego wygładzania, i omówiliśmy architekturę modelu i jego wydajność w porównaniu z ramami generatywnymi 3D na poziomie stanu sztuki. Omówiliśmy również, jak podejście SDS, powszechnie stosowane w modelach generatywnych 3D z tekstu, często prowadzi do przesadnego wygładzania wygenerowanych obrazów, i jak ramy LucidDreamer przeciwdziałają temu problemowi, wprowadzając nowe podejście, ISM, aby generować wysokiej jakości i bardziej realistyczne obrazy 3D. Wyniki i ocena wskazują na skuteczność ram LucidDreamer w szerokim zakresie zadań generowania 3D, i jak ramy już teraz przewyższają aktualne modele generatywne 3D. Wyjątkowa wydajność ram otwiera drogę do szerokiego zakresu zastosowań praktycznych, o których już wspomniano.












