Modely a platformy AI

LucidDreamer: Vysokofidelity text-to-3D generace pomocí Interval Score Matching

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Poslední pokroky v text-to-3D generativních modelech AI označují významný milník v generativních modelech. Značně rozšiřují možnosti vytváření 3D aktiv ve mnoha skutečných scénářích. Digitální 3D aktiva nyní zaujímají nezastupitelné místo v naší digitální přítomnosti, umožňují komplexní vizualizaci a interakci s komplexními prostředími a objekty, které odrážejí naše skutečné zkušenosti. Tyto 3D generativní modely AI se používají v různých oblastech, včetně animace, architektury, her, rozšířené a virtuální reality a mnoha dalších. Používají se také široce na online konferencích, v maloobchodě, vzdělávání a marketingu.

Nicméně, navzdory slibům těchto pokroků v text-to-3D generativních modelech, rozsáhlé použití 3D technologií přináší jednu velkou otázku. Generování vysoce kvalitních 3D obrazů a médií stále vyžaduje značný čas, úsilí, zdroje a odborné znalosti. I když jsou tyto požadavky splněny, text-to-3D generace často selhává při renderování detailních a vysoce kvalitních 3D modelů. Tato otázka renderování a nízkokvalitní 3D generace je častější u modelů, které používají metodu Score Distillation Sampling (SDS). Tento článek bude diskutovat o významných nedostatcích pozorovaných u modelů, které používají metodu SDS, které zavádějí nekonzistence a nízkokvalitní aktualizační směry, což vede k efektu přebrždění generovaného výstupu. Představíme také rámec LucidDreamer, novou metodu, která používá Interval Score Matching (ISM), aby překonala problém přebrždění. Prozkoumáme architekturu modelu a jeho výkon ve srovnání se stávajícími text-to-3D generativními modely. Takže, pojďme začít.

LucidDreamer3D: Úvod do 3D generace pomocí Interval Score Matching

Hlavním důvodem, proč jsou 3D generativní modely tématem generativní AI, je jejich široké uplatnění v různých oblastech a odvětvích a jejich schopnost produkovat 3D obsah v reálném čase. Díky jejich širokému praktickému uplatnění vývojáři navrhli řadu přístupů pro generování 3D obsahu, z nichž text-to-3D generativní modely vynikají pro svou schopnost používat pouze textové popisy k generování imaginativních 3D modelů. Text-to-3D generativní modely dosahují tohoto pomocí předem trénovaného text-to-obrázkového difuzního modelu jako silného obrazu před dohledem tréninku neuronového parametrického 3D modelu, což umožňuje renderovat 3D obrazy konzistentně, které odpovídají textu. Tato schopnost renderovat konzistentní 3D obrazy je založena na použití Score Distillation Sampling (SDS) fundamentálně a umožňuje SDS působit jako jádrové mechanismy pro přenos 2D výsledků z difuzních modelů do jejich 3D protějšků, což umožňuje trénovat 3D modely bez použití trénovacích obrazů. Navzdory jejich účinnosti 3D generativní modely AI, které používají metodu SDS, často trpí problémy s deformací a přebržděním, které brání praktickému uplatnění vysoce kvalitní 3D generace.

Pro řešení problémů s přebržděním rámec LucidDreamer implementuje přístup Interval Score Matching (ISM), novou metodu, která používá dvě efektivní mechanismy. První, přístup ISM používá metodu DDIM inversion, aby zmírnil efekt průměrování způsobený nekonzistencemi pseudo-Ground Truth, produkováním invertibilní difuzní trajektorie. Druhý, místo toho, aby se shodovaly obrazy renderované 3D modelem s pseudo-Ground Truth, metoda ISM shoduje je mezi dvěma intervalovými kroky v difuzní trajektorii, což pomáhá vyhnout se vysoké rekonstrukční chybě tím, že se vyhýbá jednoduché rekonstrukci. Použití ISM místo SDS vede k konzistentnímu vysokému výkonu s vysoce realistickými a detailními výstupy.

Celkově rámec LucidDreamer má za cíl přispět k následujícím bodům v 3D generativních modelech AI

  1. Poskytuje hlubokou analýzu SDS, fundamentálního konceptu v text-to-3D generativních modelech, a identifikuje jeho klíčová omezení nízkokvalitních pseudo-Ground Truth a poskytuje vysvětlení pro efekt přebrždění, který postihuje tyto 3D generativní modely.
  2. Aby se zabránilo omezením metody SDS, rámec LucidDreamer představuje Interval Score Matching, novou metodu, která používá intervalové shodování a invertibilní difuzní trajektorie, aby překonala SDS a produkovala vysoce realistické a detailní výstupy.
  3. Dosahuje státního výkonu integrovaním metody ISM s 3D Gaussian Splatting, aby překonala stávající metody pro generování 3D obsahu s nízkými trénovacími náklady.

Omezení SDS

Jak bylo zmíněno dříve, SDS je jedním z nejpopulárnějších přístupů pro text-to-3D generativní modely a hledá režimy pro podmíněné posteriory v latentním prostoru DDPM. Přístup SDS také采用 předem trénovaného DDPM pro modelování podmíněného posteriory a snaží se destilovat 3D reprezentace pro podmíněné posteriory, které jsou dosaženy minimalizací následujícího rozdílu KL. Kromě toho, přístup SDS také znovu používá váženým cílem denoisování skóre pro trénink DDP. Hlavním cílem přístupu SDS lze také považovat za shodování pohledu 3D modelu s pseudo-ground truth, který je odhadnut v jednom kroku pomocí DDPM. Nicméně, vývojáři pozorovali, že proces destilace často přehlíží klíčové aspekty DDPM a následující obrázek demonstruje, jak předem trénovaný DDPM tenduje k předpovědi pseudo-ground truth s nekonzistentními rysy a produkuje nízkokvalitní výstup během procesu destilace.

Nicméně, aktualizační směry v nežádoucích okolnostech jsou aktualizovány na 3D reprezentace, které nakonec vedou k přebržděným výsledkům. Kromě toho, je třeba poznamenat, že komponenta DDPM je citlivá na vstup a rysy pseudo-ground truth se mění významně i při nejmenších změnách vstupu. Navíc, náhodnost v obou kamerových pozicích a šumu vstupů může přidat k fluktuacím, které jsou nevyhnutelné během destilace. Optimalizace vstupu pro nekonzistentní pseudo-Ground Truth vede k výsledkům s průměrnými rysy. Co více, přístup SDS získá pseudo-ground truth s jednoduchou predikcí pro všechny časové intervaly a nebere v úvahu omezení jednoduché predikce-DDPM komponenty, která není schopna produkovat vysoce kvalitní výstup, což naznačuje, že destilace 3D aktiv nebo obrazů se složkou SDS nemusí být nejlepším přístupem.

LucidDreamer: Metodologie a fungování

Rámec LucidDreamer představuje přístup ISM, ale také staví na znalostech z jiných rámců, včetně text-to-3D generativních modelů, difuzních modelů a diferencovatelných 3D reprezentačních rámců. S tím řečeným, pojďme se podívat na architekturu a metodologii rámce LucidDreamer.

Interval Score Matching nebo ISM

Problémy s přebržděním a nízkokvalitním výstupem, kterým čelí většina text-to-3D generativních modelů, lze připsat jejich použití metody SDS, která se snaží shodnout pseudo-ground truth s 3D reprezentacemi, které jsou nekonzistentní a často nízkokvalitní. Aby se zabránilo problémům metody SDS, rámec LucidDreamer představuje ISM nebo Interval Score Matching, novou metodu, která má dvě funkční fáze. V první fázi, komponenta ISM získá konzistentnější pseudo-ground truth během destilace bez ohledu na náhodnost v kamerových pozicích a šumu. Ve druhé fázi, rámec generuje pseudo-ground truth s lepší kvalitou.

Další významnou limitací metody SDS je generování pseudo-ground truth s jednoduchou predikcí pro všechny časové intervaly, což činí obtížným zajištění vysoce kvalitních pseudo-ground truth, a tvoří základ pro zlepšení vizuální kvality pseudo-ground truth. Podobně, cíl metody SDS lze považovat za shodování pohledu 3D modelu s pseudo-ground truth odhadnutou DDPM v jednom kroku, ačkoli proces destilace přehlíží klíčový aspekt komponenty DDPM, tj. produkuje nízkokvalitní pseudo-ground truth s nekonzistentními rysy během procesu destilace.

Celkově, komponenta ISM slibuje několik výhod oproti předchozím metodám používaným v text-to-3D generativních modelech. První, díky schopnosti ISM poskytovat konzistentní vysoce kvalitní pseudo-ground truth, je schopna produkovat vysoce kvalitní výstupy s jemnějšími strukturami a bohatšími detaily, což eliminuje potřebu velkých měřítek vedení a zvyšuje flexibilitu pro tvorbu 3D obsahu. Druhý, přechod z metody SDS na ISM má marginální výpočetní režii, zejména protože přístup ISM nevyžaduje kompromis na celkové efektivitě, i když vyžaduje dodatečné výpočetní náklady pro DDIM inversions.

Obrázek výše demonstruje fungování přístupu ISM a poskytuje přehled architektury rámce LucidDreamer. Rámec nejprve inicializuje Gaussian Splatting, tj. 3D reprezentace, pomocí předem trénovaného text-to-3D generátoru pomocí promptu. Je pak začleněn s předem trénovaným 2D DDPM komponentem, aby rušil náhodné pohledy na šumové nezávislé latentní trajektorie pomocí DDIM inversions, a poté aktualizuje s intervalovým skóre. Díky své architektuře, jádro optimalizace komponenty ISM se zaměřuje na aktualizaci 3D reprezentací směrem k pseudo-ground truth, které jsou vysoce kvalitní a konzistentní, a přitom výpočetně přátelské. Tento princip je tím, co umožňuje ISM shodovat se s fundamentálními cíli metody SDS, zatímco se zlepšuje stávající metoda.

DDIM Inversion

Rámec LucidDreamer má za cíl produkovat konzistentnější pseudo-ground truth v souladu s 3D reprezentacemi. Proto, namísto produkce 3D reprezentací, rámec LucidDreamer používá přístup DDIM inversion, aby predikoval šumové latentní 3D reprezentace a predikoval invertibilní šumovou latentní trajektorii v iterativním způsobem. Kromě toho, je to právě invertibilita DDIM inversion, která umožňuje rámcu LucidDreamer zvýšit konzistenci pseudo-ground truth významně pro všechny časové intervaly.

Pokročilá generační pipeline

Rámec LucidDreamer také představuje pokročilou pipeline kromě ISM, aby prozkoumal faktory ovlivňující vizuální kvalitu text-to-3D generace a představuje 3D Gaussian Splatting nebo 3DGS jako 3D generaci a 3D bodové mračno generace modely pro inicializaci.

3D Gaussian Splatting

Stávající práce ukázaly, že zvýšení velikosti batche a renderovacího rozlišení pro trénink zlepšuje vizuální kvalitu významně. Nicméně, většina učitelných 3D reprezentací přijatých pro text-to-3D generaci je časově a paměťově náročná. Naopak, přístup 3D Gaussian Splatting poskytuje efektivní výsledky v obou optimalizacích a renderování, což umožňuje pokročilé generativní pipeline v rámcu LucidDreamer dosáhnout velkých velikostí batche a vysokého rozlišení renderování, i při omezených výpočetních zdrojích.

Inicializace

Většina stávajících text-to-3D generativních rámců inicializuje své 3D reprezentace s omezenými geometriemi, jako je kruh, krabice nebo válec, což často vede k nežádoucím výstupům u neaxiálních symetrických objektů. Naopak, protože rámec LucidDreamer představuje 3D Gaussian Splatting jako 3D reprezentace, rámec může přijmout několik text-to-point generativních rámců přirozeně, aby generoval hrubou inicializaci s lidským vstupem. Strategie inicializace nakonec zvyšuje rychlost konvergence významně.

LucidDreamer: Experimenty a výsledky

Text-to-3D generace

Obrázek výše demonstruje výsledky generované modelem LucidDreamer s původním stabilním difuzním přístupem, zatímco následující obrázek hovoří o generovaných výsledcích na různých fine-tuned checkpoints.

Jak je vidět, rámec LucidDreamer je schopen generovat vysoce konzistentní 3D obsah pomocí vstupního textu a sémantických podnětů. Kromě toho, s použitím ISM, rámec LucidDreamer generuje intrikované a realističtější obrazy, zatímco se vyhýbá běžným problémům, jako je pře-sytění nebo pře-brždění, a vyniká v generování běžných objektů, stejně jako podporuje kreativní tvorbu.

Obecnost ISM

Pro vyhodnocení obecnosti ISM je provedeno srovnání mezi ISM a SDS v obou explicitních a implicitních reprezentacích a výsledky jsou demonstrovány v následujícím obrázku.

Kvalitativní srovnání

Pro analýzu kvalitativní efektivity rámce LucidDreamer je srovnán se stávajícími SoTA základními modely a pro zajištění spravedlivého srovnání je použit stabilní difuzní rámec 2.1 pro destilaci a výsledky jsou demonstrovány v následujícím obrázku. Jak je vidět, rámec dodává vysoce kvalitní a geometricky přesné výsledky, zatímco spotřebovává méně zdrojů a času.

Kromě toho, pro poskytnutí komplexnějšího vyhodnocení, vývojáři také provedli uživatelskou studii. Vyhodnocení vybralo 28 promptů a použilo různé text-to-3D generativní přístupy na každém promptu, aby generovalo objekty. Výsledky byly poté hodnoceny uživateli na základě stupně shody s vstupním promptem a jeho věrnosti.

LucidDreamer: Aplikace

Díky své výjimečnému výkonu na širokém spektru text-to-3D generativních úloh, rámec LucidDreamer má několik potenciálních aplikací, včetně generace avatarů bez výcviku, personalizované text-to-3D generace a generace 2D a 3D editací bez výcviku.

Horní levý obrázek demonstruje potenciál LucidDreamer v úkolech 2D a 3D editace bez výcviku, zatímco spodní levé obrázky demonstrují schopnost rámce generovat personalizované text-to-3D výstupy s LoRA, zatímco obrázek vpravo ukazuje schopnost rámce generovat 3D avatary.

Závěrečné myšlenky

V tomto článku jsme diskutovali o LucidDreamer, novém přístupu, který používá metodu Interval Score Matching (ISM), aby překonala problém přebrždění a diskutovali o architektuře modelu a jeho výkonu proti stávajícím text-to-3D generativním modelům. Také jsme diskutovali o tom, jak SDS nebo Score Distillation Sampling, běžný přístup implementovaný ve většině stávajících text-to-3D generativních modelech, často vede k přebrždění generovaných obrazů a jak rámec LucidDreamer řeší tento problém představou nové metody, metody Interval Score Matching (ISM), aby generoval vysoce kvalitní a realistické 3D obrazy. Výsledky a vyhodnocení ukazují účinnost rámce LucidDreamer na širokém spektru 3D generativních úloh a jak rámec již překonává stávající state-of-the-art 3D generativní modely. Výjimečný výkon rámce otevírá cestu pro širokou škálu praktických aplikací, jak jsme již diskutovali.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.