Modely a platformy AI

DreamCraft3D: Hierarchická generace 3D s bootstrapped difúzním předchozím

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Generativní modely AI byly horkým tématem diskuse v rámci odvětví AI po nějakou dobu. Nedávný úspěch 2D generativních modelů připravil cestu pro metody, které používáme k vytváření vizuálního obsahu dnes. Ačkoli komunita AI dosáhla pozoruhodného úspěchu s 2D generativními modely, generování 3D obsahu zůstává velkou výzvou pro hluboké generativní rámce AI. To je zejména pravda, protože poptávka po 3D generovaném obsahu dosáhla rekordní úrovně, poháněné širokou škálou vizuálních her, aplikací, virtuální reality a dokonce i kinematografie. Je třeba poznamenat, že zatímco existují 3D generativní rámce AI, které poskytují přijatelné výsledky pro určité kategorie a úkoly, nejsou schopny efektivně generovat 3D objekty. Tento nedostatek lze připsat na vrub nedostatku rozsáhlých 3D dat pro školení rámců. Nedávno vývojáři navrhli využití vedení nabízeného předškolními text-to-image AI generativními modely, přístup, který ukázal slibné výsledky.

V tomto článku budeme diskutovat o rámci DreamCraft3D, hierarchickém modelu pro generování 3D obsahu, který produkuje koherentní a vysoce kvalitní 3D objekty. Rámec DreamCraft3D používá 2D referenční obraz k vedení geometrické sochařské fáze, zlepšuje texturu se zaměřením na řešení problémů konzistence, kterým čelí současné rámce nebo metody. Kromě toho rámec DreamCraft3D využívá view-dependent difúzní model pro skórovací destilaci vzorkování, což pomáhá při sochařství geometrie, která přispívá k koherentnímu vykreslování.

Budeme se blíže zabývat rámcem DreamCraft3D pro generování 3D obsahu. Dále budeme prozkoumávat koncept využití předškolních Text-to-Image (T2I) modelů pro generování 3D obsahu a zkoumáme, jak rámec DreamCraft3D využívá tento přístup k generování realistického 3D obsahu.

DreamCraft3D: Úvod

DreamCraft3D je hierarchický proces pro generování 3D obsahu. Rámec DreamCraft3D se snaží využít špičkový T2I nebo Text-to-Image generativní rámec k vytváření vysoce kvalitních 2D obrazů pomocí textového podnětu. Tento přístup umožňuje rámcu DreamCraft3D maximalizovat schopnosti špičkových 2D difúzních modelů pro reprezentaci vizuálních sémantik, jak je popsáno v textovém podnětu, zatímco zachovává kreativní svobodu nabízenou těmito 2D AI generativními rámci. Generovaný obraz je pak zvednut do 3D s pomocí kaskádového geometrického texturování a geometrického sochařského fáze, a specializované techniky jsou aplikovány v každé fázi s pomocí dekompozice problému.

Pro geometrii se rámec DreamCraft3D zaměřuje silně na globální 3D strukturu a multi-view konzistenci, a tak vytváří prostor pro kompromisy na detailní textury v obrazech. Jakmile rámec vyřeší problémy s geometrií, přesune se na optimalizaci koherentních a realistických textur implementací 3D-aware difúze, která bootstraps 3D optimalizační přístup. Existují dvě klíčové návrhové úvahy pro dvě optimalizační fáze, jmenovitě Geometrické sochařství a Texturování.

S tím vším řečeným by bylo bezpečné popsat DreamCraft3D jako AI generativní rámec, který využívá hierarchický 3D obsah generovací proces k transformaci 2D obrazů do jejich 3D protějšků, zatímco zachovává holistickou 3D konzistenci.

Využití předškolních T2I nebo Text-to-Image Modelů

Nápad využití předškolních T2I nebo Text-to-Image modelů pro generování 3D obsahu byl poprvé představen rámcem DreamFusion v roce 2022. Rámec DreamFusion se pokusil vynutit SDS nebo Skórovací destilaci vzorkování ztrátu k optimalizaci 3D rámce způsobem, který by vykreslování z náhodných pohledů odpovídalo textově podmíněným obrazovým distribucím, jak je interpretováno efektivním text-to-image difúzním rámcem. Ačkoli přístup DreamFusion poskytl přijatelné výsledky, existovaly dvě hlavní problémy, rozmazanost a přehnané nasycení. Pro řešení těchto problémů nedávné práce implementují různé stage-wise optimalizační strategie v pokusu o zlepšení 2D destilace ztráty, což nakonec vede k lepší kvalitě a realistickým 3D generovaným obrazům.

Nicméně, navzdory nedávnému úspěchu těchto rámců, nejsou schopny dosáhnout schopnosti 2D generativních rámců pro syntézu komplexního obsahu. Kromě toho tyto rámce jsou často zatíženy „Janus Issue“, podmínkou, kdy 3D vykreslování, které se zdá být individuálně přijatelné, ukazuje stylistické a sémantické nekonzistence, když jsou vyšetřeny jako celek.

Pro řešení problémů, kterým čelí předchozí práce, rámec DreamCraft3D prozkoumává možnost použití holistického hierarchického 3D obsah generovacího procesu a hledá inspiraci v manuálním uměleckém procesu, ve kterém je koncept nejprve napsán do 2D návrhu, po kterém umělec sochaří hrubou geometrii, rafinuje geometrické detaily a maluje vysoce kvalitní textury. Podle stejného přístupu rámec DreamCraft3D rozkládá úplné 3D obsah nebo obraz generovací úkoly do různých zvladatelných kroků.

V první fázi rámec DreamCraft3D nasazuje geometrické sochařství k produkci konzistentních a přijatelných 3D-geometrických tvarů pomocí 2D obrazu jako referenci. Kromě toho fáze nejen využívá SDS ztrátu pro fotometrické ztráty a nové pohledy na referenční pohled, ale rámec také zavádí řadu strategií pro podporu geometrické konzistence. Rámec se snaží využít Zero-1-to-3, pohled podmíněný image translation model, aby použil referenční obraz k modelování distribuce nových pohledů. Kromě toho rámec také přechází z implicitní povrchové reprezentace na mesh reprezentaci pro hrubou až jemnou geometrickou rafinaci.

Druhá fáze rámce DreamCraft3D využívá bootstrapped skórovací destilaci přístup k posílení textur obrazu, jelikož současné view-dependent difúzní modely jsou školeny na omezeném množství 3D dat, což je důvod, proč často zápasí s dosažením výkonu nebo věrnosti 2D difúzních modelů. Díky této limitaci rámec DreamCraft3D rafinuje difúzní model v souladu s multi-view obrazů 3D instance, která je optimalizována, a tento přístup pomáhá rámcu při augmentaci 3D textur, zatímco zachovává multi-view konzistenci. Když difúzní model trénuje na těchto multi-view renderování, poskytuje lepší vedení pro 3D texturovou optimalizaci, a tento přístup pomáhá rámcu DreamCraft3D dosáhnout velkého množství texturového detailu, zatímco zachovává pohled konzistenci.

Jak lze pozorovat na výše uvedených obrazech, rámec DreamCraft3D je schopen produkovat kreativní 3D obrazy a obsah s realistickými texturami a intrikátními geometrickými strukturami. V prvním obraze je tělo Son Goku, anime postava smíchaná s hlavou divokého kance, zatímco druhý obraz zobrazuje Beagla oblečeného v obleku detektiva. Následují další příklady.

DreamCraft3D: Práce a Architektura

Rámec DreamCraft3D se snaží využít špičkový T2I nebo Text-to-Image generativní rámec k vytváření vysoce kvalitních 2D obrazů pomocí textového podnětu. Tento přístup umožňuje rámcu DreamCraft3D maximalizovat schopnosti špičkových 2D difúzních modelů pro reprezentaci vizuálních sémantik, jak je popsáno v textovém podnětu, zatímco zachovává kreativní svobodu nabízenou těmito 2D AI generativními rámci. Generovaný obraz je pak zvednut do 3D s pomocí kaskádového geometrického texturování a geometrického sochařského fáze, a specializované techniky jsou aplikovány v každé fázi s pomocí dekompozice problému. Následující obraz stručně shrnuje fungování rámce DreamCraft3D.

Počkejme si na detailní pohled na klíčové návrhové úvahy pro texturování a geometrické sochařství.

Geometrické Sochařství

Geometrické sochařství je první fáze, ve které rámec DreamCraft3D se snaží vytvořit 3D model způsobem, který odpovídá vzhledu referenčního obrazu ve stejném referenčním pohledu, zatímco zajišťuje maximální přijatelnost i z různých úhlů pohledu. Pro zajištění maximální přijatelnosti rámec využívá SDS ztrátu k podpoře přijatelného obrazového vykreslování pro každý jednotlivý vzorek pohledu, který může rozpoznat předškolený difúzní model. Kromě toho, pro efektivní využití vedení z referenčního obrazu, rámec penalizuje fotometrické rozdíly mezi referenčním a vykresleným obrazem na referenčním pohledu, a ztráta je vypočtena pouze v popředí pohledu. Kromě toho, pro podporu scény sparsity, rámec také implementuje maskovou ztrátu, která vykresluje siluetu. Přesto, zachování vzhledu a sémantiky napříč zadními pohledy konzistentně stále zůstává výzvou, a proto rámec využívá další přístupy k produkci detailní a koherentní geometrie.

3D Aware Difúzní Předchozí

3D optimalizační metody využívající per-view supervize samotné jsou nedostačující, což je primární důvod, proč rámec DreamCraft3D využívá Zero-1-to-3, pohled podmíněný difúzní model, jelikož Zero-1-to-3 nabízí vylepšenou pohledovou povědomí, protože byl školen na větší škále 3D datových aktiv. Kromě toho, Zero-1-to-3 je jemně naladěný difúzní model, který hallucinuje obraz v souvislosti s kamerovým posem, daným referenčním obrazem.

Progresivní View Trénink

Derivace volných pohledů přímo v 360 stupních může vést k geometrickým artifactům nebo nesrovnalostem, jako je například extra noha na židli, událost, která může být připsána na vrub ambiguity inherence jediného referenčního obrazu. Pro řešení této překážky rámec DreamCraft3D rozšiřuje tréninkové pohledy progresivně, po kterém je dobře zavedená geometrie postupně propagována k získání výsledků v 360 stupních.

Difúzní Časový Krok Annealing

Rámec DreamCraft3D využívá difúzní časový krok annealing strategii v pokusu o vyrovnaní s 3D optimalizací coarse-to-fine progresí. Na začátku optimalizačního procesu rámec dává prioritu vzorkování větší difúzní časový krok, v pokusu o poskytnutí globální struktury. Jak rámec postupuje s tréninkovým procesem, lineárně anneals vzorkovací rozsah přes kurz stovek iterací. Díky annealing strategii rámec zvládne zavedení přijatelné globální geometrie během raných optimalizačních kroků před rafinováním strukturních detailů.

Podrobné Strukturní Vylepšení

Rámec DreamCraft3D optimalizuje implicitní povrchovou reprezentaci inicializací texturovaného 3D mesh reprezentace, která disentangles učení textury a geometrie. Když rámec dokončí strukturní vylepšení, model je schopen zachovat vysoké frekvenční detaily získané z referenčního obrazu rafinováním textur pouze.

Texturování pomocí Bootstrapped Skórovací Destilace

Ačkoli geometrické sochařství fáze zdůrazňuje učení detailní a koherentní geometrie, rozmaže texturu do jisté míry, což může být výsledkem rámce závislosti na 2D předchozím modelu, který funguje na hrubém rozlišení spolu s omezenou ostrostí nabízenou 3D difúzním modelem. Kromě toho, běžné texturové problémy, včetně přehnaného nasycení a přehnaného vyhlazování, vznikají v důsledku velké klasifikátor-free vedení.

Rámec využívá VSD nebo Variational Skórovací Destilaci ztrátu k augmentaci realismu textur. Rámec volí Stable Difúzní model během této fáze k získání high-rozlišení gradientů. Kromě toho, rámec drží tetrahedrální grid pevný, aby podporoval realistické vykreslování k optimalizaci celkové struktury mesh. Během učení fáze rámec DreamCraft3D nevyužívá Zero-1-to-3, jelikož má nepříznivý vliv na kvalitu textur, a tyto nekonzistentní textury mohou být opakující se, což vede k bizarním 3D výstupům.

Experimenty a Výsledky

Pro vyhodnocení výkonu rámce DreamCraft3D, je srovnán s aktuálními špičkovými rámci, a kvalitativní a kvantitativní výsledky jsou analyzovány.

Srovnání s Baseline Modely

Pro vyhodnocení výkonu, rámec DreamCraft3D je srovnán s 5 špičkovými rámci, včetně DreamFusion, Magic3D, ProlificDreamer, Magic123, a Make-it-3D. Testovací benchmark se skládá z 300 vstupních obrazů, které jsou směsí reálných obrazů a těch, které jsou generovány Stable Difúzním modelem. Každý obraz v testovacím benchmarku má textový podnět, předpovězenou hloubkovou mapu a alfa masku pro popředí. Rámec zdroje textové podněty pro reálné obrazy z obrazového titulkového rámce.

Kvalitativní Analýza

Následující obraz srovnává rámec DreamCraft3D s aktuálními baseline modely, a jak lze vidět, rámce, které spoléhají na text-to-3D přístup, často čelí multi-view konzistenci problémům.

Na jedné straně máte rámec ProlificDreamer, který nabízí realistické textury, ale selhává, když jde o generování přijatelného 3D objektu. Rámce, jako je Make-it-3D, které spoléhají na Image-to-3D metody, dokáží vytvořit high-kvalitní frontální pohledy, ale nemohou udržet ideální geometrii pro obrazy. Obrazy generované rámcem Magic123 nabízejí lepší geometrickou regularizaci, ale generují přehnaně nasycené a vyhlazené geometrické textury a detaily. Ve srovnání s těmito rámci, rámec DreamCraft3D, který využívá bootstrapped skórovací destilaci metodu, nejen zachovává sémantickou konzistenci, ale také zlepšuje celkovou imaginaci diverzitu.

Kvantitativní Analýza

V pokusu o generování přesvědčivých 3D obrazů, které nejen připomínají vstupní referenční obraz, ale také přenášejí sémantiku z různých perspektiv konzistentně, techniky použité rámcem DreamCraft3D jsou srovnány s baseline modely, a vyhodnocovací proces využívá čtyři metriky: PSNR a LPIPS pro měření věrnosti na referenčním pohledu, Contextual Distance pro hodnocení pixel-level kongruence, a CLIP pro odhad sémantické koherence. Výsledky jsou demonstrovány v následujícím obraze.

Závěr

V tomto článku jsme diskutovali o rámcu DreamCraft3D, hierarchickém procesu pro generování 3D obsahu. Rámec DreamCraft3D se snaží využít špičkový Text-to-Image (T2I) generativní rámec k vytváření vysoce kvalitních 2D obrazů pomocí textového podnětu. Tento přístup umožňuje rámcu DreamCraft3D maximalizovat schopnosti špičkových 2D difúzních modelů pro reprezentaci vizuálních sémantik, jak je popsáno v textovém podnětu, zatímco zachovává kreativní svobodu nabízenou těmito 2D AI generativními rámci. Generovaný obraz je pak transformován do 3D s pomocí kaskádového geometrického texturování a geometrického sochařského fáze, a specializované techniky jsou aplikovány v každé fázi s pomocí dekompozice problému. Jako výsledek tohoto přístupu, rámec DreamCraft3D může produkovat high-fidelity a konzistentní 3D aktiva s přesvědčivými texturami, viditelnými z více úhlů.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.