Modely a platformy AI
Paint3D : Bezsvětlový difuzní model pro generování obrazů
Rychlý vývoj generativních modelů AI, zejména hlubokých generativních modelů AI, výrazně pokročil v oblasti generování přirozeného jazyka, generování 3D, generování obrazů a syntézy řeči. Tyto modely revolucionalizovaly produkci 3D v různých odvětvích. Nicméně, mnoho z nich čelí výzvě: jejich složitá struktura a generované sítě často nejsou kompatibilní s tradičními renderovacími kanály, jako je Physically Based Rendering (PBR). Difuzní modely, zejména bez osvětlovacích textur, prokázaly působivou generaci 3D aktiv s rozmanitými texturami, zlepšující 3D rámce ve filmovém průmyslu, herním průmyslu a AR/VR.
Tento článek představuje Paint3D, novou architekturu pro produkci rozmanitých, vysokorozlišených 2K UV textur pro netexturované 3D sítě, podmíněné vizuálními nebo textovými vstupy. Hlavní výzvou Paint3D je generování vysokokvalitních textur bez vestavěného osvětlení, umožňující uživateli重新 editovat nebo重新 osvětlit v moderních grafických kanálech. Paint3D využívá předem trénovaný 2D difuzní model pro fúzi více pohledů, generující počáteční hrubé texturové mapy. Tyto mapy však často vykazují osvětlovací artefakty a neúplné oblasti kvůli omezením 2D modelu při vypnutí osvětlovacích efektů a plném znázornění 3D tvarů. Prozkoumáme fungování Paint3D, jeho architekturu a srovnání s jinými hlubokými generativními rámci. Začněme.
Paint3D : Úvod
Schopnosti hlubokých generativních modelů AI v generování přirozeného jazyka, generování 3D a syntéze obrazů jsou dobře známy a implementovány v reálných aplikacích, revolucionalizujících průmysl 3D generování. Navzdory jejich pozoruhodným schopnostem moderní hluboké generativní modely AI generují sítě, které jsou charakterizovány složitou strukturou a chaotickými osvětlovacími texturami, které jsou často nekompatibilní s konvenčními renderovacími kanály, včetně PBR nebo Physically based Rendering. Jako hluboké generativní modely AI, tak i syntéza textur pokročila rychle, zejména při využití 2D difuzních modelů. Modely syntézy textur využívají předem trénované depth-to-image difuzní modely účinně k využití textových podmínek pro generování vysokokvalitních textur. Nicméně, tyto přístupy čelí potížím s předem osvětlenými texturami, které mohou výrazně ovlivnit finální renderování 3D prostředí a zavést osvětlovací chyby, když se světla mění v rámci běžných pracovních postupů, jak je demonstrováno na následující obrazovce.

Jak je vidět, texturová mapa s volným osvětlením funguje v souladu s tradičními renderovacími kanály a dodává přesné výsledky, zatímco texturová mapa s předem osvětlením obsahuje nevhodné stíny, když je aplikováno opětovné osvětlení. Na druhé straně, rámce generování textur trénované na 3D datech nabízejí alternativní přístup, ve kterém rámec generuje textury tím, že chápe geometrii konkrétního 3D objektu. Ačkoli mohou dodávat lepší výsledky, rámce generování textur trénované na 3D datech postrádají obecné schopnosti, které brání jejich schopnosti aplikovat model na 3D objekty mimo jejich trénovací data.
Aktuální modely generování textur čelí dvěma kritickým výzvám: využití obrazových vodítek nebo rozmanitých podnětů pro dosažení širšího stupně obecnosti napříč různými objekty a druhou výzvou je eliminace spjatého osvětlení z výsledků získaných z předem trénovaných modelů. Předem osvětlené textury mohou potenciálně interferovat s finálními výsledky texturovaných objektů v renderovacích kanálech a protože předem trénované 2D difuzní modely poskytují pouze 2D výsledky v pohledovém doméně, postrádají komplexní pochopení tvarů, což vede k tomu, že nejsou schopny udržet konzistenci pohledu pro 3D objekty.
Vzhledem k výše zmíněným výzvám se rámec Paint3D snaží vyvinout dvoustupňový model difuzní textury pro 3D objekty, který se generalizuje na různé předem trénované generativní modely a zachovává konzistenci pohledu při učení bez osvětlení.
Paint3D je dvoustupňový model generování textur z hrubého na jemné, který má za cíl využít silné vodítko podnětů a schopnosti generování obrazů předem trénovaných generativních modelů AI pro texturování 3D objektů. V prvním stupni rámec Paint3D nejprve vzorkuje multi-pohledové obrázky z předem trénovaného depth-aware 2D difuzního modelu progresivně, aby ermögnil generalizaci vysokokvalitních a bohatých texturových výsledků z rozmanitých podnětů. Model poté generuje počáteční texturovou mapu zpět-projekcí těchto obrázků na povrch 3D sítě. Ve druhém stupni se model zaměřuje na generování textur bez osvětlení implementací přístupů využívaných difuzními modely specializovanými na odstranění osvětlovacích vlivů a tvarově-aware úpravy neúplných oblastí. Během celého procesu je rámec Paint3D konzistentně schopen generovat vysokokvalitních 2K textury semanticky a eliminuje intrinsic osvětlovací efekty.

Shrnutí, Paint3D je novým generativním modelem z hrubého na jemné, který má za cíl produkovat rozmanité, bez osvětlení a vysokorozlišené 2K UV texturové mapy pro netexturované 3D sítě, aby dosáhl špičkového výkonu v texturování 3D objektů s různými podmíněnými vstupy, včetně textů a obrazů, a nabízí významnou výhodu pro syntézu a úkoly grafického editování.
Metodika a Architektura
Rámec Paint3D generuje a rafinuje texturové mapy progresivně, aby generoval rozmanité a vysokokvalitní texturové mapy pro 3D modely pomocí požadovaných podmíněných vstupů, včetně obrazů a podnětů, jak je demonstrováno na následující obrazovce.

V hrubém stupni využívá model Paint3D předem trénované 2D difuzní modely pro vzorkování multi-pohledových obrázků a poté vytváří počáteční texturové mapy zpět-projekcí těchto obrázků na povrch sítě. Ve druhém stupni, tj. rafinačním stupni, model Paint3D využívá difuzní proces v UV prostoru pro vylepšení hrubých texturových map, čímž dosahuje vysokokvalitních, inpainting a bez osvětlení funkčních textur, které zajišťují vizuální atraktivitu a kompletnost finální textury.
Stupeň 1: Progresivní Hrubá Generace Textur
V progresivním hrubém stupni generace textur generuje model Paint3D hrubou UV texturovou mapu pro 3D sítě, které využívají předem trénovaný depth-aware 2D difuzní model. Konkrétněji, model nejprve využívá různé kamerové pohledy pro vykreslení depth mapy, poté využívá depth podmínek pro vzorkování obrázků z image difuzního modelu a poté zpět-projektuje tyto obrázky na povrch sítě. Rámec provede vykreslování, vzorkování a zpět-projektování přístupů střídavě, aby vylepšil konzistenci texturových sítí, což nakonec pomáhá v progresivní generaci texturové mapy.
Model začíná generovat texturu viditelné oblasti s kamerovými pohledy zaměřenými na 3D síť a vykresluje 3D síť na depth mapu z prvního pohledu. Model poté vzorkuje texturový obrázek pro vzhledové a depth podmínky. Model poté zpět-projektuje obrázek na 3D síť. Pro pohledy provede model Paint3D podobný přístup, ale s mírnou změnou, provedením texturového vzorkování pomocí obrazové malby. Kromě toho, model bere v úvahu texturované oblasti z předchozích pohledů, umožňující renderovací procesu nejen výstupu depth obrázku, ale také částečně barevného RGB obrázku s neobarvenou maskou v aktuálním pohledu.
Model poté využívá depth-aware image inpainting model s inpainting encoder pro vyplnění neobarvené oblasti v RGB obrázku. Model poté generuje texturovou mapu z pohledu zpět-projekcí inpaintovaného obrázku na 3D síť pod aktuálním pohledem, umožňující modelu generovat texturovou mapu progresivně a dosáhnout celé hrubé struktury mapy. Nakonec, model rozšiřuje texturové vzorkování na scénu nebo objekt s více pohledy. Konkrétněji, model využívá pár kamer pro zachycení dvou depth map během počátečního texturového vzorkování z symetrických pohledů. Model poté kombinuje dvě depth mapy a komponuje depth grid. Model nahrazuje jedinou depth mapu depth gridem pro provedení multi-pohledového depth-aware texturového vzorkování.
Stupeň 2: Rafinace Textur v UV Prostoru
Ačkoli vzhled hrubých texturových map je logický, čelí některé výzvy, jako jsou texturové díry způsobené během vykreslování procesu samozakrytím nebo osvětlovacími stíny kvůli zapojení 2D difuzních modelů. Model Paint3D se snaží provést difuzní proces v UV prostoru na základě hrubé texturové mapy, snažící se zmírnit problémy a vylepšit vizuální atraktivitu texturové mapy ještě dále během rafinace textur. Nicméně, rafinace hlavního image difuzního modelu s texturovými mapami v UV prostoru zavádí texturovou nekonzistenci, protože texturová mapa je generována UV mapováním textury 3D povrchu, které rozděluje kontinuální texturu na řadu jednotlivých fragmentů v UV prostoru. Jako výsledek fragmentace, model nachází obtížné naučit se 3D adjacency vztahy mezi fragmenty, což vede k problémům s texturovou nekonzistencí.
Model rafinuje texturovou mapu v UV prostoru provedením difuzního procesu pod vedením texturových fragmentů adjacency informací. Je důležité poznamenat, že v UV prostoru, je position map, která reprezentuje 3D adjacency informace texturových fragmentů, s modelem, který zachází s každým non-background prvkem jako 3D bodovou souřadnicí. Během difuzního procesu, model fúzuje 3D adjacency informace přidáním individuální position map encoder do předem trénovaného image difuzního modelu. Nový encoder připomíná design ControlNet framework a má stejnou architekturu jako encoder implementovaný v image difuzním modelu s zero-convolution vrstvou spojující dva. Kromě toho, je texturový difuzní model trénován na datasetu skládajícího se z textur a position map, a model se učí předpovídat šum přidáný k noisy latent. Model poté optimalizuje position encoder a zmrazí trénovaný denoiser pro jeho image difuzní úkol.
Model poté současně využívá position podmíněného encoder a jiných encoder pro provedení rafinace úkolů v UV prostoru. V tomto ohledu, model má dvě rafinace schopnosti: UVHD nebo UV High Definition a UV inpainting. UVHD metoda je strukturována pro vylepšení vizuální atraktivity a estetiky texturové mapy. Pro dosažení UVHD, model využívá image enhance encoder a position encoder s difuzním modelem. Model využívá UV inpainting metodu pro vyplnění texturových děr v UV rovině, která je schopna vyhnout se samozakrytím problémům generovaných během vykreslování. V rafinačním stupni, model Paint3D nejprve provede UV inpainting a poté provede UVHD pro generování finální rafinované texturové mapy. Integrací obou rafinacích metod, je rámec Paint3D schopen produkovat kompletní, rozmanité, vysokorozlišené a bez osvětlení UV texturové mapy.
Paint3D : Experimenty a Výsledky
Model Paint3D využívá Stable Diffusion text2image model pro pomoc s úkoly generování textur, zatímco využívá image encoder komponent pro zpracování obrazových podmínek. Pro další vylepšení jeho uchopení podmíněných kontrol, jako je obrazová malba, depth a obrazová high definition, model Paint3D využívá ControlNet domain encodery. Model je implementován na PyTorch framework s vykreslováním a texturovými projekcemi implementovanými na Kaolin.
Srovnání Textu a Textur
Pro analýzu jeho výkonu, začínáme hodnocením efektu generování textur modelu Paint3D, když je podmíněný textovými podněty, a srovnáváme ho s aktuálními špičkovými rámci, včetně Text2Tex, TEXTure a LatentPaint. Jak je vidět na následující obrazovce, rámec Paint3D nejen exceluje v generování vysokokvalitních texturových detailů, ale také syntetizuje rozumně bez osvětlení texturovou mapu.

Ve srovnání, rámec Latent-Paint je náchylný k generování rozostlých textur, což vede k suboptimálním vizuálním efektům. Na druhé straně, rámec TEXTure generuje čisté textury, ale postrádá hladkost a vykazuje zřetelné švy a spoje. Nakonec, rámec Text2Tex generuje hladké textury pozoruhodně dobře, ale selhává při replikaci výkonu pro generování jemných textur s intrikátními detaily.
Následující obrazovka srovnává rámec Paint3D s aktuálními špičkovými rámci kvantitativně.

Jak je vidět, rámec Paint3D překonává všechny existující modely, a to značným rozdílem, s téměř 30% zlepšením v FID baseline a přibližně 40% zlepšením v KID baseline. Zlepšení v FID a KID baseline skóre demonstruje schopnost Paint3D generovat vysokokvalitní textury napříč rozmanitými objekty a kategoriemi.
Srovnání Obrazu a Textury
Pro generování generativních schopností modelu Paint3D pomocí vizuálních podnětů, využíváme model TEXTure jako baseline. Jak je zmíněno dříve, model Paint3D využívá image encoder z text2image modelu z Stable Diffusion. Jak je vidět na následující obrazovce, rámec Paint3D syntetizuje vynikající textury pozoruhodně dobře a je stále schopen udržet vysokou věrnost vůči obrazové kondici.

Na druhé straně, rámec TEXTure je schopen generovat texturu podobnou Paint3D, ale selhává při reprezentaci texturových detailů v obrazové kondici přesně. Kromě toho, jak je demonstrováno na následující obrazovce, rámec Paint3D dodává lepší FID a KID baseline skóre, když je srovnán s rámcem TEXTure, s prvním klesajícím z 40,83 na 26,86, zatímco druhý ukazuje pokles z 9,76 na 4,94.

Závěrečné Myšlenky
V tomto článku, jsme mluvili o Paint3D, novém rámci z hrubého na jemné, který je schopen produkovat bez osvětlení, rozmanité a vysokorozlišené 2K UV texturové mapy pro netexturované 3D sítě, podmíněné vizuálními nebo textovými vstupy. Hlavní výzvou rámce Paint3D je generování bez osvětlení vysokorozlišených 2K textur, které jsou semanticky konzistentní bez podmínění na obrazové nebo textové vstupy. Díky svému přístupu z hrubého na jemné, rámec Paint3D produkuje bez osvětlení, rozmanité a vysokorozlišené texturové mapy a dodává lepší výkon než aktuální špičkové rámce.












