Modele i platformy AI
DreamCraft3D: Hierarchiczna Generacja 3D z Użyciem Bootstrapped Diffusion Prior
Modele generatywne AI były gorącym tematem dyskusji w branży AI przez jakiś czas. Ostatni sukces modeli generatywnych 2D otworzył drogę do metod, których używamy do tworzenia treści wizualnych dzisiaj. Chociaż społeczność AI odniosła znaczący sukces z modelami generatywnymi 2D, generowanie treści 3D pozostaje dużym wyzwaniem dla głębokich ram generatywnych AI. Jest to szczególnie prawdziwe, ponieważ popyt na treści generowane 3D osiąga rekordowy poziom, napędzany przez szeroki zakres gier wizualnych, aplikacji, rzeczywistości wirtualnej i nawet kinematografii. Warto zauważyć, że chociaż istnieją ramy generatywne 3D, które dostarczają akceptowalne wyniki dla określonych kategorii i zadań, nie są one w stanie wydajnie generować obiektów 3D. Ten brak można przypisać brakowi obszernych danych 3D do szkolenia ram. Ostatnio deweloperzy zaproponowali wykorzystanie wskazówek dostarczonych przez wstępnie wyszkolone modele generatywne tekst-obraz, co okazało się obiecującym podejściem.
W tym artykule omówimy ramę DreamCraft3D, hierarchiczny model generujący treści 3D, który produkuje spójne i wysokiej jakości obiekty 3D o wysokiej jakości. Rama DreamCraft3D używa obrazu referencyjnego 2D, aby prowadzić etap rzeźbienia geometrii, poprawiając teksturę z naciskiem na rozwiązywanie problemów spójności spotykanych przez obecne ramy lub metody. Dodatkowo, rama DreamCraft3D wykorzystuje model dyfuzyjny zależny od widoku do destylacji wyników, pomagając w rzeźbieniu geometrii, która przyczynia się do spójnego renderowania.
Będziemy się bliżej przyglądać ramie DreamCraft3D do generacji treści 3D. Ponadto, będziemy badać koncepcję wykorzystania wstępnie wyszkolonych modeli Text-to-Image (T2I) do generacji treści 3D i będziemy sprawdzać, jak rama DreamCraft3D próbuje wykorzystać to podejście, aby wygenerować realistyczne treści 3D.
DreamCraft3D: Wprowadzenie
DreamCraft3D to hierarchiczna pipeline do generacji treści 3D. Rama DreamCraft3D próbuje wykorzystać najnowocześniejszą ramę generatywną T2I lub Text-to-Image, aby utworzyć wysokiej jakości obrazy 2D przy użyciu podpowiedzi tekstowej. Podejście pozwala ramie DreamCraft3D na maksymalizację możliwości najnowocześniejszych modeli dyfuzyjnych 2D w celu reprezentowania semantyki wizualnej opisanej w podpowiedzi tekstowej, przy zachowaniu swobody twórczej oferowanej przez te ramy generatywne 2D. Wygenerowany obraz jest następnie podnoszony do 3D z pomocą kaskadowego zwiększania tekstury geometrycznej i faz rzeźbienia geometrycznego, a specjalistyczne techniki są stosowane na każdym etapie z pomocą dekompozycji problemu.
W przypadku geometrii, rama DreamCraft3D koncentruje się głównie na globalnej strukturze 3D i spójności wielowidokowej, tworząc miejsce na kompromisy w szczegółowych teksturach w obrazach. Gdy rama rozwiązuje problemy związane z geometrią, przechodzi do optymalizacji spójnych i realistycznych tekstur, wdrażając dyfuzyjną 3D, która bootstraps podejście optymalizacji 3D. Są dwa kluczowe względy projektowe dla dwóch faz optymalizacji, a mianowicie rzeźbienia geometrycznego i zwiększania tekstury.
Mówiąc krótko, można by powiedzieć, że DreamCraft3D to rama generatywna AI, która wykorzystuje hierarchiczną pipeline generacji treści 3D, aby przekształcić obrazy 2D w ich odpowiedniki 3D, zachowując przy tym spójność 3D.
Wykorzystanie wstępnie wyszkolonych modeli T2I lub Text-to-Image
Pomysł wykorzystania wstępnie wyszkolonych modeli T2I lub Text-to-Image do generacji treści 3D został po raz pierwszy wprowadzony przez ramę DreamFusion w 2022 roku. Rama DreamFusion próbowała narzucić stratę destylacji wyników (SDS) w celu optymalizacji ramy 3D w taki sposób, aby renderowania w losowych punktach widzenia były zgodne z dystrybucjami obrazu warunkowanego tekstem, interpretowanymi przez wydajną ramę dyfuzyjną tekst-obraz. Chociaż podejście DreamFusion dało przyzwoite wyniki, były dwie główne problemy: rozmycie i przesadna nasycenie. Aby rozwiązać te problemy, ostatnie prace wdrożeniowe implementują różne strategie optymalizacji etapowej w celu poprawy straty destylacji 2D, co ostatecznie prowadzi do lepszej jakości i realistycznych obrazów 3D.
Jednak pomimo ostatnich sukcesów tych ram, nie są one w stanie dorównać możliwościom ram generatywnych 2D w syntezie złożonych treści. Ponadto, te ramy często są naznaczone „problemem Janusa”, stanem, w którym renderowania 3D, które indywidualnie wydają się prawdopodobne, wykazują stylistyczne i semantyczne niekonsekwencje, gdy są badane jako całość.
Aby rozwiązać problemy spotykane przez poprzednie prace, rama DreamCraft3D bada możliwość wykorzystania holistycznej hierarchicznej pipeline generacji treści 3D i szuka inspiracji w procesie artystycznym, w którym koncepcja jest najpierw spisana w postaci szkicu 2D, po czym artysta rzeźbi grubą geometrię, precyzyjnie dopracowuje szczegóły geometryczne i maluje wysokiej jakości tekstury. Podążając za tym samym podejściem, rama DreamCraft3D dzieli wyczerpujące zadania generacji treści 3D lub obrazu na różne zarządzalne etapy.
W pierwszym etapie, rama DreamCraft3D wdroża rzeźbienie geometryczne w celu wytworzenia spójnych i prawdopodobnych kształtów geometrycznych 3D, używając obrazu 2D jako odniesienia. Dodatkowo, etap ten nie tylko wykorzystuje stratę SDS do strat fotometrycznych i nowych widoków w punkcie widzenia odniesienia, ale rama również wprowadza szereg strategii w celu promowania spójności geometrycznej. Rama ma na celu wykorzystanie Zero-1-to-3, modelu translacji obrazu warunkowanego punktem widzenia, aby użyć obrazu odniesienia do modelowania dystrybucji nowych widoków. Ponadto, rama również przechodzi od reprezentacji powierzchni implicitej do reprezentacji siatki deformowalnej w celu odgrubnej do szczegółowej rafinacji geometrycznej.
Drugi etap ramy DreamCraft3D wykorzystuje podejście destylacji wyników z bootstrapem w celu zwiększenia tekstur obrazu, ponieważ obecne modele dyfuzyjne warunkowane widokiem są szkolone na ograniczonej ilości danych 3D, co powoduje, że często mają trudności z dopasowaniem wydajności lub wierności modeli dyfuzyjnych 2D. Dzięki temu ograniczeniu, rama DreamCraft3D dokształca model dyfuzyjny zgodnie z wielowidokowymi obrazami instancji 3D, która jest optymalizowana, a podejście to pomaga ramie w augmentacji tekstur 3D, zachowując przy tym spójność wielowidokową. Gdy model dyfuzyjny trenuje na tych wielowidokowych renderowaniach, dostarcza lepsze wskazówki do optymalizacji tekstury 3D, a podejście to pomaga ramie DreamCraft3D osiągnąć ogromną ilość detali tekstury, zachowując przy tym spójność widokową.

Jak można zobaczyć na powyższych obrazach, rama DreamCraft3D jest w stanie produkować kreatywne obrazy 3D i treści z realistycznymi teksturami i intratnymi strukturami geometrycznymi. Na pierwszym obrazie jest ciało Son Gokū, postaci anime zmieszanej z głową dzikiego dzika, natomiast na drugim obrazie jest beagle ubrany w strój detektywa. Poniżej znajdują się dodatkowe przykłady.

DreamCraft3D: Działanie i Architektura
Rama DreamCraft3D próbuje wykorzystać najnowocześniejszą ramę generatywną T2I lub Text-to-Image, aby utworzyć wysokiej jakości obrazy 2D przy użyciu podpowiedzi tekstowej. Podejście pozwala ramie DreamCraft3D na maksymalizację możliwości najnowocześniejszych modeli dyfuzyjnych 2D w celu reprezentowania semantyki wizualnej opisanej w podpowiedzi tekstowej, przy zachowaniu swobody twórczej oferowanej przez te ramy generatywne 2D. Wygenerowany obraz jest następnie podnoszony do 3D z pomocą kaskadowego zwiększania tekstury geometrycznej i faz rzeźbienia geometrycznego, a specjalistyczne techniki są stosowane na każdym etapie z pomocą dekompozycji problemu. Poniższy obraz krótko podsumowuje działanie ramy DreamCraft3D.

Przejdźmy do szczegółowego omówienia kluczowych względów projektowych dla faz zwiększania tekstury i rzeźbienia geometrycznego.
Rzeźbienie Geometryczne
Rzeźbienie geometryczne to pierwszy etap, w którym rama DreamCraft3D próbuje utworzyć model 3D w taki sposób, aby odpowiadał wyglądowi obrazu odniesienia w tym samym punkcie widzenia, przy jednoczesnym zapewnieniu maksymalnej prawdopodobieństwa nawet pod różnymi kątami widzenia. Aby zapewnić maksymalne prawdopodobieństwo, rama wykorzystuje stratę SDS, aby zachęcić do prawdopodobnego renderowania obrazu dla każdego indywidualnego próbkowanego widoku, który wstępnie wyszkolony model dyfuzyjny może rozpoznać. Dodatkowo, aby skutecznie wykorzystać wskazówki z obrazu odniesienia, rama karze różnice fotometryczne między obrazem odniesienia a renderowanym obrazem w punkcie widzenia odniesienia, a strata jest obliczana tylko wewnątrz obszaru przedniego widoku. Ponadto, aby zachęcić do zwiększenia szczegółowości sceny, rama wdroża również stratę maski, która renderuje sylwetkę. Mimo to, utrzymanie wyglądu i semantyki w różnych punktach widzenia w sposób ciągły nadal pozostaje wyzwaniem, dlatego rama wykorzystuje dodatkowe podejścia w celu wytworzenia szczegółowej i spójnej geometrii.
3D Świadoma Dyfuzyjna Prawdopodobieństwo
Metody optymalizacji 3D wykorzystujące tylko nadzorowaną supervizję są niedostatecznie określone, co jest głównym powodem, dla którego rama DreamCraft3D wykorzystuje Zero-1-to-3, model dyfuzyjny warunkowany widokiem, jako że model Zero-1-to-3 oferuje zwiększoną świadomość punktu widzenia, ponieważ został wyszkolony na większej skali danych 3D. Dodatkowo, model Zero-1-to-3 jest modelem dyfuzyjnym dopracowanym, który hallucynuje obraz w związku z pozycją kamery, danym obrazem odniesienia.
Postępowe Trening Widoku
Bezpośrednie pochodzenie wolnych widoków w 360 stopniach może prowadzić do artefaktów geometrycznych lub nieścisłości, takich jak dodatkowa noga na krześle, zdarzenie, które można przypisać niejasności w pojedynczym obrazie odniesienia. Aby rozwiązać ten problem, rama DreamCraft3D powiększa widoki treningowe postępowo, po czym dobrze ustalona geometria jest stopniowo propagowana w celu uzyskania wyników w 360 stopniach.
Destylacja Kroków Dyfuzyjnych
Rama DreamCraft3D wykorzystuje strategię destylacji kroków dyfuzyjnych w celu wyrównania z postępem optymalizacji 3D od grubej do szczegółowej. Na początku procesu optymalizacji, rama daje pierwszeństwo próbce większego kroku dyfuzyjnego, w celu zapewnienia globalnej struktury. Gdy rama postępuje z procesem treningu, liniowo zmniejsza zakres próbkowania w ciągu setek iteracji. Dzięki tej strategii, rama jest w stanie ustalić prawdopodobną globalną geometrię w wczesnych krokach optymalizacji, zanim zostaną dopracowane szczegóły strukturalne.
Szczegółowe Wzmocnienie Strukturalne
Rama DreamCraft3D optymalizuje reprezentację powierzchni implicitej, aby ustalić grubą strukturę. Rama następnie wykorzystuje ten wynik i łączy go z siatką tetrahedralną, aby zainicjować reprezentację siatki tekstur 3D, która rozdziela naukę tekstury i geometrii. Gdy rama jest gotowa ze wzmocnieniem strukturalnym, model jest w stanie zachować szczegóły wysokiej częstotliwości uzyskane z obrazu odniesienia, poprawiając wyłącznie tekstury.
Zwiększanie Tekstury z Użyciem Destylacji Wyników z Bootstrapem
Chociaż etap rzeźbienia geometrycznego kładzie nacisk na naukę szczegółowej i spójnej geometrii, to nieco rozmywa teksturę, co może być wynikiem zależności ramy od modelu priorytetowego 2D działającego w rozdzielczości grubej wraz z ograniczoną ostrością oferowaną przez model dyfuzyjny 3D. Dodatkowo, powszechne problemy z teksturą, w tym przesadne nasycenie i wygładzanie, pojawiają się w wyniku dużej bezpłatnej kontroli.
Rama wykorzystuje stratę destylacji wyników (VSD) w celu zwiększenia realizmu tekstur. Rama wybiera model dyfuzyjny stabilny w tej fazie, aby uzyskać wysokie rozdzielczościowe gradienty. Dodatkowo, rama utrzymuje siatkę tetrahedralną w celu promowania realistycznego renderowania i optymalizacji ogólnej struktury siatki. Podczas fazy treningu, rama DreamCraft3D nie wykorzystuje modelu Zero-1-to-3, ponieważ ma niekorzystny wpływ na jakość tekstur, a te niekonsekwentne tekstury mogą prowadzić do dziwnych wyników 3D.
Eksperymenty i Wyniki
Aby ocenić wydajność ramy DreamCraft3D, porównano ją z bieżącymi ramami stanu sztuki, a wyniki jakościowe i ilościowe są analizowane.
Porównanie z Modelami Podstawowymi
Aby ocenić wydajność, rama DreamCraft3D jest porównywana z 5 ramami stanu sztuki, w tym DreamFusion, Magic3D, ProlificDreamer, Magic123 i Make-it-3D. Testowy benchmark składa się z 300 obrazów wejściowych, które są mieszanką obrazów rzeczywistych i wygenerowanych przez model dyfuzyjny stabilny. Każdy obraz w teście ma podpowiedź tekstową, przewidywaną mapę głębi i maskę alpha dla pierwszego planu. Rama pobiera podpowiedzi tekstowe dla obrazów rzeczywistych z frameworku podpowiedzi obrazu.
Analiza Jakościowa
Poniższy obraz porównuje ramę DreamCraft3D z bieżącymi modelami podstawowymi, a jak widać, ramy, które polegają na podejściu tekst-3D, często spotykają problemy z wielowidokową spójnością.

Z jednej strony, mamy ramę ProlificDreamer, która oferuje realistyczne tekstury, ale nie radzi sobie z generowaniem wiarygodnego obiektu 3D. Ramy takie jak Make-it-3D, które polegają na metodach obraz-3D, potrafią tworzyć wysokiej jakości widoki frontalne, ale nie są w stanie utrzymać idealnej geometrii dla obrazów. Obrazy wygenerowane przez ramę Magic123 oferują lepszą regulację geometryczną, ale generują zbyt nasycenie i wygładzone tekstury geometryczne i szczegóły. W porównaniu z tymi ramami, rama DreamCraft3D, która wykorzystuje podejście destylacji wyników z bootstrapem, nie tylko utrzymuje spójność semantyczną, ale również poprawia ogólną różnorodność wyobrażeń.

Analiza Ilościowa
W celu wygenerowania przekonywujących obrazów 3D, które nie tylko przypominają obraz odniesienia, ale również konsekwentnie przekazują semantykę z różnych punktów widzenia, techniki wykorzystywane przez ramę DreamCraft3D są porównywane z modelami podstawowymi, a proces oceny wykorzystuje cztery metryki: PSNR i LPIPS do pomiaru wierności w punkcie widzenia odniesienia, Contextual Distance do oceny zgodności na poziomie pikseli i CLIP do szacowania spójności semantycznej. Wyniki są przedstawione na poniższym obrazie.

Wnioski
W tym artykule omówiliśmy ramę DreamCraft3D, hierarchiczną pipeline do generacji treści 3D. Rama DreamCraft3D próbuje wykorzystać najnowocześniejszą ramę generatywną T2I lub Text-to-Image, aby utworzyć wysokiej jakości obrazy 2D przy użyciu podpowiedzi tekstowej. Podejście pozwala ramie DreamCraft3D na maksymalizację możliwości najnowocześniejszych modeli dyfuzyjnych 2D w celu reprezentowania semantyki wizualnej opisanej w podpowiedzi tekstowej, przy zachowaniu swobody twórczej oferowanej przez te ramy generatywne 2D. Wygenerowany obraz jest następnie podnoszony do 3D z pomocą kaskadowego zwiększania tekstury geometrycznej i faz rzeźbienia geometrycznego, a specjalistyczne techniki są stosowane na każdym etapie z pomocą dekompozycji problemu. W wyniku tego podejścia, rama DreamCraft3D może produkować wysokiej jakości i spójne aktywa 3D z przekonywującymi teksturami, widocznymi z wielu kątów.












