Modely a platformy AI
Zero123++: Jednotlivý obraz na konzistentní multi-pohled difuzní základový model

Minulé roky svědčí o rychlém pokroku ve výkonu, efektivitě a generativních schopnostech nově vznikajících novátorských AI generativních modelů, které využívají rozsáhlé datové sady a postupy generace 2D difuzí. Dnes jsou generativní modely AI extrémně schopné generovat různé formy 2D a do jisté míry i 3D mediálního obsahu, včetně textu, obrázků, videí, GIFů a dalšího.
V tomto článku budeme hovořit o rámci Zero123++, obrazem podmíněném difuzním generativním modelu AI, jehož cílem je generovat 3D-konzistentní multi-pohledové obrázky pomocí jediného vstupního obrázku. Aby se maximalizoval výhod získaný z předem trénovaných generativních modelů, rámec Zero123++ implementuje řadu trénovacích a podmíněných schémat, aby se minimalizoval rozsah úsilí potřebného pro jemné doladění z předem připravených difuzních modelů obrázků. Budeme se podrobněji zabývat architekturou, fungováním a výsledky rámce Zero123++ a analyzovat jeho schopnosti generovat konzistentní multi-pohledové obrázky vysoké kvality z jediného obrázku. Takže pojďme začít.
Zero123 a Zero123++: Úvod
Rámec Zero123++ je obrazem podmíněný difuzní generativní model AI, jehož cílem je generovat 3D-konzistentní multi-pohledové obrázky pomocí jediného vstupního obrázku. Rámec Zero123++ je pokračováním rámce Zero123 nebo Zero-1-to-3, který využívá techniku zero-shot novátorské syntézy obrazu k otevřenému zdrojovému převodu z jednoho obrázku na 3D. Ačkoli rámec Zero123++ nabízí slibné výsledky, obrázky generované rámcem mají viditelné geometrické nesrovnalosti, a to je hlavní důvod, proč stále existuje mezera mezi 3D scénami a multi-pohledovými obrázky.
Rámec Zero-1-to-3 slouží jako základ pro několik dalších rámců, včetně SyncDreamer, One-2-3-45, Consistent123 a dalších, které přidávají další vrstvy k rámcu Zero123, aby získaly konzistentnější výsledky při generování 3D obrázků. Další rámce, jako je ProlificDreamer, DreamFusion, DreamGaussian a další, využívají optimalizační přístup k získání 3D obrázků destilací 3D obrázku z různých nekonzistentních modelů. Ačkoli tyto techniky jsou efektivní a generují uspokojivé 3D obrázky, výsledky by se daly zlepšit implementací základního difuzního modelu, který by mohl generovat multi-pohledové obrázky konzistentně. V souladu s tím rámec Zero123++ využívá rámec Zero-1-to-3 a jemně doladí nový multi-pohledový základový difuzní model z Stable Diffusion.
V rámcu Zero-1-to-3 je každá novátorská perspektiva generována nezávisle, a tento přístup vede k nesrovnalostem mezi generovanými perspektivami, protože difuzní modely mají vzorkovací povahu. Aby se tento problém vyřešil, rámec Zero123++ využívá přístup s rozmístěním dlaždic, kdy je objekt obklopen šesti perspektivami do jednoho obrázku, a zajišťuje správné modelování společné distribuce multi-pohledových obrázků objektu.
Další velkou výzvou, se kterou se vývojáři pracující na rámcu Zero-1-to-3 setkávají, je to, že rámec nevyužívá plně možnosti, které nabízí Stable Diffusion, což vede k neefektivitě a dodatečným nákladům. Existují dva hlavní důvody, proč rámec Zero-1-to-3 nemůže maximalizovat možnosti, které nabízí Stable Diffusion
- Při trénování s podmínkami obrazu rámec Zero-1-to-3 nezařazuje místní nebo globální podmíněné mechanismy nabízené Stable Diffusion efektivně.
- Během trénování rámec Zero-1-to-3 využívá snížené rozlišení, přístup, při kterém je výstupní rozlišení sníženo pod trénovací rozlišení, což může snížit kvalitu generování obrázků pro modely Stable Diffusion.
Aby se tyto problémy vyřešily, rámec Zero123++ implementuje řadu podmíněných technik, které maximalizují využití zdrojů nabízených Stable Diffusion a zachovávají kvalitu generování obrázků pro modely Stable Diffusion.
Zlepšení podmínek a konzistence
V pokusům o zlepšení podmínek obrazu a konzistence multi-pohledových obrázků rámec Zero123++ implementoval různé techniky, jejichž primárním cílem je opětovné využití předchozích technik z předem trénovaného modelu Stable Diffusion.
Generace multi-pohledových obrázků
Nezbytnou vlastností generování konzistentních multi-pohledových obrázků spočívá v tom, že se správně modeluje společná distribuce více obrázků. V rámcu Zero-1-to-3 je korelace mezi multi-pohledovými obrázky ignorována, protože pro každý obrázek rámec modeluje podmíněnou marginální distribuci nezávisle a zvlášť. Avšak v rámcu Zero123++ vývojáři zvolili přístup s rozmístěním dlaždic, který dlaždice 6 obrázků do jednoho rámu/obrázku pro konzistentní generaci multi-pohledových obrázků, a proces je demonstrován v následujícím obrázku.

Navíc bylo zjištěno, že orientace objektů má tendenci být neurčitá, když se model trénuje na kamerových pozicích, a aby se tato neurčitost zabránila, rámec Zero-1-to-3 trénuje na kamerových pozicích s elevačními úhly a relativními azimuty k vstupu. Aby se tento přístup implementoval, je nutné znát elevační úhel pohledu vstupu, který se poté používá k určení relativní pozice mezi novými vstupními pohledy. V pokusu o určení tohoto elevačního úhlu rámce často přidávají modul pro odhad elevace, a tento přístup často vede k dodatečným chybám v potrubí.
Harmonogram šumu
Škálovaný lineární harmonogram, původní harmonogram šumu pro Stable Diffusion, se zaměřuje primárně na lokální detaily, ale jak je vidět na následujícím obrázku, má velmi málo kroků se sníženým poměrem signálu a šumu.

Tyto kroky s nízkým poměrem signálu a šumu se vyskytují na počátku fáze denoisingu, fáze, která je kritická pro určení globální nízkofrekvenční struktury. Snížení počtu kroků během fáze denoisingu, buď během interference nebo trénování, často vede k větší strukturní variaci. Ačkoli je tato konfigurace ideální pro generování jediného obrázku, omezuje schopnost rámce zajistit globální konzistenci mezi různými pohledy. Aby se tento problém vyřešil, rámec Zero123++ jemně doladí model LoRA na rámci Stable Diffusion 2 v-prediction, aby provedl toy úkol, a výsledky jsou demonstrovány níže.

Se škálou lineárního harmonogramu šumu model LoRA nezapadá, ale pouze mírně zesvětlí obrázek. Naopak, když pracuje s lineárním harmonogramem šumu, rámec LoRA generuje úspěšně prázdný obrázek, bez ohledu na vstupní podnět, což naznačuje dopad harmonogramu šumu na schopnost rámce přizpůsobit se novým požadavkům globálně.
Škálovaná referenční pozornost pro místní podmínky
Jednotlivý vstupní obrázek nebo podmíněné obrázky v rámcu Zero-1-to-3 jsou spojeny s hlukovými vstupy ve funkci pro obrazové podmínky.
Toto spojení vede k nesprávné pixelové prostorové korelaci mezi cílovým obrázkem a vstupem. Aby se zajistila správná místní podmíněná vstup, rámec Zero123++ využívá škálouvanou referenční pozornost, přístup, při kterém se běží denoising UNet model na extra referenčním obrázku, následovaný appendováním hodnotových matic a self-pozornosti klíče z referenčního obrázku do příslušných pozornostních vrstev, když je modelový vstup denoizován, a je demonstrován v následujícím obrázku.

Přístup referenční pozornosti je schopen vést difuzní model k generování obrázků, které sdílejí podobnou texturu s referenčním obrázkem, a semantický obsah bez jakéhokoli jemného doladění. S jemným doladěním přístup referenční pozornosti dodává lepší výsledky s latentním škálou.

Globální podmínky: FlexDiffuse
V původním přístupu Stable Diffusion jsou textové vložky jediným zdrojem globálních vložek, a přístup využívá rámec CLIP jako textový kódér pro provedení křížového vyšetření mezi textovými vložkami a modelovými latentními hodnotami. Výsledkem je, že vývojáři mohou využít zarovnání mezi textovými prostory a výslednými obrázky CLIP pro globální obrazové podmínky.
Rámec Zero123++ navrhuje využití trénovatelné varianty lineárního vedení mechanismu pro začlenění globální obrazové podmínky do rámce s minimálním jemným doladěním, a výsledky jsou demonstrovány níže. Jak je vidět, bez přítomnosti globální obrazové podmínky je kvalita generovaného obsahu rámcem uspokojivá pro viditelné oblasti, které odpovídají vstupnímu obrázku. Avšak kvalita generovaného obrázku rámcem pro neviditelné oblasti vykazuje významné zhoršení, které je způsobeno neschopností modelu odvodit globální sémantiku objektu.

Architektura modelu
Rámec Zero123++ je trénován se modelem Stable Diffusion 2v jako základem pomocí různých přístupů a technik uvedených v článku. Rámec Zero123++ je předtrénován na datové sadě Objaverse, která je vykreslena s náhodným osvětlením HDRI. Rámec také využívá fázový trénovací harmonogram, který je podobný přístupu používanému v rámci Stable Diffusion Image Variations, v pokusu o další minimalizaci rozsahu jemného doladění a zachování co nejvíce z předchozího rámce Stable Diffusion.
Funkce nebo architektura rámce Zero123++ lze dále rozdělit do sekvenčních kroků nebo fází. První fáze svědkem rámce jemného doladění matic KV a samo-pozornostních vrstev Stable Diffusion s AdamW jako optimalizátorem, 1000 zahřívacích kroků a kosinový harmonogram učení se maximalizuje na 7×10-5. Ve druhé fázi rámec využívá vysoce konzervativní konstantní harmonogram učení s 2000 zahřívacími sadami a využívá přístup Min-SNR pro maximalizaci efektivity během trénování.
Zero123++: Výsledky a srovnání výkonu
Kvalitativní výkon
Aby se vyhodnotil výkon rámce Zero123++ na základě kvality generovaných obrázků, je srovnán se SyncDreamerem a Zero-1-to-3-XL, dvěma z nejlepších rámců pro generování obsahu. Rámce jsou srovnány se čtyřmi vstupními obrázky s různým rozsahem. První obrázek je elektrický hraček kočka, pořízený přímo z datové sady Objaverse, a má velkou nejistotu na zadní straně objektu. Druhý je obrázek hasicího přístroje, a třetí je obrázek psa sedícího na raketě, vygenerovaný modelem SDXL. Poslední obrázek je anime ilustrace. Požadované elevační kroky pro rámce jsou dosaženy pomocí metody odhadu elevace rámce One-2-3-4-5, a odstranění pozadí je provedeno pomocí rámce SAM. Jak je vidět, rámec Zero123++ generuje vysoké kvalitní multi-pohledové obrázky konzistentně a je schopen generalizovat na out-of-domain 2D ilustrace a AI-generované obrázky stejně dobře.


Kvantitativní analýza
Aby se kvantitativně srovnal rámec Zero123++ se stávajícími rámcem Zero-1-to-3 a Zero-1-to-3-XL, vývojáři hodnotí skóre Learned Perceptual Image Patch Similarity (LPIPS) těchto modelů na validační sadě dat, podmnožině datové sady Objaverse. Aby se vyhodnotil výkon modelu na generování multi-pohledových obrázků, vývojáři dlaždice referenční obrázky a 6 generovaných obrázků, a poté vypočítají skóre LPIPS. Výsledky jsou demonstrovány níže a jak je vidět, rámec Zero123++ dosahuje nejlepšího výkonu na validační sadě.

Hodnocení text-to-multi-pohled
Aby se vyhodnotila schopnost rámce Zero123++ generovat text-to-multi-pohledový obsah, vývojáři nejprve využívají rámec SDXL s textovými podněty k vygenerování obrázku, a poté využívají rámec Zero123++ k vygenerovanému obrázku. Výsledky jsou demonstrovány níže a jak je vidět, ve srovnání se rámcem Zero-1-to-3, který nemůže garantovat konzistentní generování multi-pohledových obrázků, rámec Zero123++ vrací konzistentní, realistické a vysoce detailní multi-pohledové obrázky implementací přístupu text-to-image-to-multi-pohled nebo potrubí.

Zero123++ Depth ControlNet
Kromě základního rámce Zero123++ vývojáři také vydali rámec Depth ControlNet Zero123++, hloubkově řízenou verzi původního rámce, postavenou na architektuře ControlNet. Normalizované lineární obrázky jsou vykresleny v souladu s následujícím RGB obrázkem, a rámec ControlNet je trénován pro řízení geometrie rámce Zero123++ pomocí hloubkového vnímání.

Závěr
V tomto článku jsme hovořili o Zero123++, obrazem podmíněném difuzním generativním modelu AI, jehož cílem je generovat 3D-konzistentní multi-pohledové obrázky pomocí jediného vstupního obrázku. Aby se maximalizoval výhod získaný z předem trénovaných generativních modelů, rámec Zero123++ implementuje řadu trénovacích a podmíněných schémat, aby se minimalizoval rozsah úsilí potřebného pro jemné doladění z předem připravených difuzních modelů obrázků. Také jsme diskutovali o různých přístupech a vylepšeních implementovaných rámcem Zero123++, které mu umožňují dosáhnout výsledků srovnatelných s a někdy i překonávajících ty, které jsou dosaženy stávajícími rámcem.
Nicméně, navzdory své efektivitě a schopnosti generovat vysoké kvalitní multi-pohledové obrázky konzistentně, rámec Zero123++ stále má prostor pro zlepšení, s potenciálními oblastmi výzkumu, jako je dvoufázový model refiner, který by mohl vyřešit neschopnost rámce Zero123++ splnit globální požadavky na konzistenci. Další možností jsou další škálování, aby se dále vylepšila schopnost rámce Zero123++ generovat obrázky ještě vyšší kvality.
- Dvoufázový model refiner který by mohl vyřešit neschopnost rámce Zero123++ splnit globální požadavky na konzistenci.
- Další škálování které by mohlo dále vylepšit schopnost rámce Zero123++ generovat obrázky ještě vyšší kvality.












