Modele i platformy AI
Paint3D: BezÅwietlny Model Dyfuzji do Generacji ObrazÃģw
Szybki rozwÃģj modeli generatywnych AI, szczegÃģlnie gÅÄbokich modeli generatywnych AI, znacznie rozwinÄ Å moÅžliwoÅci w generowaniu jÄzyka naturalnego, generowaniu 3D, generowaniu obrazÃģw i syntezie mowy. Modele te rewolucjonizujÄ produkcjÄ 3D w rÃģÅžnych branÅžach. Jednak wiele z nich stoi przed wyzwaniem: ich zÅoÅžone poÅÄ czenia i wygenerowane siatki czÄsto nie sÄ kompatybilne z tradycyjnymi potokami renderowania, takimi jak Physically Based Rendering (PBR). Modele oparte na dyfuzji, szczegÃģlnie te bez tekstur oÅwietlenia, demonstrujÄ imponujÄ cÄ generacjÄ zasobÃģw 3D, poprawiajÄ c ramy 3D w filmach, grach i AR/VR.
Ten artykuÅ przedstawia Paint3D, nowatorskÄ ramÄ do produkcji rÃģÅžnorodnych, wysokiej rozdzielczoÅci map tekstur 2K UV dla nieutexturowanych siatek 3D, warunkowo na wejÅciach wizualnych lub tekstowych. GÅÃģwnym wyzwaniem Paint3D jest generowanie wysokiej jakoÅci tekstur bez wbudowanego oÅwietlenia, umoÅžliwiajÄ c uÅžytkownikom edycjÄ lub ponowne oÅwietlenie w ramach nowoczesnych potokÃģw graficznych. Wykorzystuje on wstÄpnie wytrenowany model dyfuzji 2D do fuzji wielowidokowej, generujÄ c poczÄ tkowe gruboziarniste mapy tekstur. Jednak te mapy czÄsto wykazujÄ artefakty oÅwietlenia i niepeÅne obszary ze wzglÄdu na ograniczenia modelu 2D w wyÅÄ czaniu efektÃģw oÅwietlenia i peÅnym przedstawianiu ksztaÅtÃģw 3D. BÄdziemy siÄ zagÅÄbiaÄ w dziaÅanie Paint3D, architekturÄ i porÃģwnania z innymi gÅÄbokimi ramami generatywnymi. Zaczynajmy.
Paint3D: Wprowadzenie
MoÅžliwoÅci modeli generatywnych AI w generowaniu jÄzyka naturalnego, generowaniu 3D i syntezie obrazÃģw sÄ dobrze znane i wdroÅžone w aplikacjach rzeczywistych, rewolucjonizujÄ c przemysÅ generowania 3D. Pomimo ich imponujÄ cych moÅžliwoÅci, nowoczesne gÅÄbokie ramy generatywne AI generujÄ siatki, ktÃģre charakteryzujÄ siÄ zÅoÅžonymi poÅÄ czeniami i chaotycznymi teksturami oÅwietlenia, czÄsto niezgodnymi z konwencjonalnymi potokami renderowania, w tym PBR lub Physically Based Rendering. Podobnie jak gÅÄbokie modele generatywne AI, synteza tekstur rÃģwnieÅž znacznie siÄ rozwinÄÅa, zwÅaszcza w wykorzystaniu modeli dyfuzji 2D. Modele syntezy tekstur wykorzystujÄ wstÄpnie wytrenowane modele dyfuzji gÅÄbokoÅci do efektywnego wykorzystania warunkÃģw tekstowych do generowania wysokiej jakoÅci tekstur. Jednak te podejÅcia napotykajÄ trudnoÅci z pre-oznaczonymi teksturami, ktÃģre mogÄ znacznie wpÅynÄ Ä na finalne renderowania Årodowiska 3D i wprowadziÄ bÅÄdy oÅwietlenia, gdy ÅwiatÅa sÄ zmieniane w ramach typowych workflow, jak to pokazano na poniÅžszym obrazie.

Jak moÅžna zaobserwowaÄ, mapa tekstury z wolnym oÅwietleniem dziaÅa w synchronizacji z tradycyjnymi potokami renderowania, dostarczajÄ c dokÅadne wyniki, podczas gdy mapa tekstury z pre-oÅwietleniem zawiera nieodpowiednie cienie, gdy jest stosowane ponowne oÅwietlenie. Z drugiej strony, ramy generowania tekstur wytrenowane na danych 3D oferujÄ alternatywne podejÅcie, w ktÃģrym ramy generujÄ tekstury, rozumiejÄ c geometriÄ okreÅlonego obiektu 3D. ChociaÅž mogÄ one dostarczyÄ lepsze wyniki, ramy generowania tekstur wytrenowane na danych 3D brakuje zdolnoÅci uogÃģlniania, co utrudnia ich zastosowanie do obiektÃģw 3D spoza ich danych szkoleniowych.
BieÅžÄ ce modele generowania tekstur stajÄ przed dwoma krytycznymi wyzwaniami: wykorzystaniem wskazÃģwek obrazu lub rÃģÅžnorodnych podpowiedzi, aby osiÄ gnÄ Ä szerszy stopieÅ uogÃģlnienia w rÃģÅžnych obiektach, oraz drugim wyzwaniem, jakim jest eliminacja sprzÄÅžonego oÅwietlenia w wynikach uzyskanych z wstÄpnego szkolenia. Pre-oznaczone tekstury mogÄ potencjalnie interferowaÄ z koÅcowymi wynikami obiektÃģw tekstur w silnikach renderowania, a poniewaÅž wstÄpnie wytrenowane modele dyfuzji 2D dostarczajÄ wyniki 2D tylko w dziedzinie widoku, brakuje im peÅnego zrozumienia ksztaÅtÃģw, co prowadzi do braku spÃģjnoÅci widoku dla obiektÃģw 3D.
Z powodu wymienionych wyÅžej wyzwaÅ, ramy Paint3D prÃģbujÄ opracowaÄ dwuetapowy model dyfuzji tekstur dla obiektÃģw 3D, ktÃģry uogÃģlnia siÄ do rÃģÅžnych wstÄpnie wytrenowanych modeli generatywnych i zachowuje spÃģjnoÅÄ widoku podczas nauki generowania tekstur bez oÅwietlenia.
Paint3D jest modelem generowania tekstur od gruboziarnistego do drobnego, ktÃģry ma na celu wykorzystanie silnych wskazÃģwek i zdolnoÅci generowania obrazÃģw wstÄpnie wytrenowanych modeli generatywnych AI do tekstur obiektÃģw 3D. W pierwszym etapie, ramy Paint3D najpierw prÃģbkujÄ obrazy wielowidokowe z wstÄpnie wytrenowanego modelu dyfuzji obrazu 2D, aby umoÅžliwiÄ uogÃģlnienie wysokiej jakoÅci i bogatych wynikÃģw tekstur z rÃģÅžnorodnych podpowiedzi. Model nastÄpnie generuje poczÄ tkowÄ mapÄ tekstury, projekujÄ c te obrazy na powierzchniÄ siatki. W drugim etapie, model koncentruje siÄ na generowaniu tekstur bez oÅwietlenia, wdraÅžajÄ c podejÅcia zastosowane w modelach dyfuzji specjalizujÄ cych siÄ w usuwaniu wpÅywÃģw oÅwietlenia i ulepszaniu niepeÅnych obszarÃģw. W trakcie caÅego procesu, ramy Paint3D sÄ w stanie generowaÄ wysokiej jakoÅci tekstury 2K semantycznie i eliminowaÄ wewnÄtrzne efekty oÅwietlenia.

PodsumowujÄ c, Paint3D jest nowatorskim modelem generatywnym AI, ktÃģry ma na celu produkcjÄ rÃģÅžnorodnych, bezÅwietlnych i wysokiej rozdzielczoÅci map tekstur 2K UV dla nieutexturowanych siatek 3D, aby osiÄ gnÄ Ä najwyÅžsze wyniki w teksturach 3D z rÃģÅžnymi warunkami wejÅciowymi, w tym tekstami i obrazami, i oferuje znaczÄ cÄ przewagÄ w syntezie i edycji grafiki.
Metodologia i Architektura
Ramy Paint3D generujÄ i ulepszajÄ mapy tekstur stopniowo, aby wygenerowaÄ rÃģÅžnorodne i wysokiej jakoÅci mapy tekstur dla modeli 3D, uÅžywajÄ c poÅžÄ danych warunkÃģw wejÅciowych, w tym obrazÃģw i podpowiedzi, jak to pokazano na poniÅžszym obrazie.

W etapie gruboziarnistym, model Paint3D wykorzystuje wstÄpnie wytrenowane modele dyfuzji obrazu 2D do prÃģbkowania obrazÃģw wielowidokowych, a nastÄpnie tworzy poczÄ tkowe mapy tekstur, projekujÄ c te obrazy na powierzchniÄ siatki. W drugim etapie, czyli etapie ulepszania, model Paint3D wykorzystuje proces dyfuzji w przestrzeni UV, aby ulepszyÄ mapy tekstur gruboziarnistych, osiÄ gajÄ c wysokiej jakoÅci, wypeÅnianie i funkcjÄ bez oÅwietlenia, co gwarantuje wizualnÄ atrakcyjnoÅÄ i kompletnoÅÄ koÅcowej tekstury.
Etap 1: PostÄpowe Generowanie Tekstur Gruboziarnistych
W etapie postÄpowego generowania tekstur gruboziarnistych, model Paint3D generuje mapÄ tekstury gruboziarnistÄ dla siatek 3D, wykorzystujÄ c wstÄpnie wytrenowany model dyfuzji gÅÄbokoÅci 2D. Konkretnie, model najpierw wykorzystuje rÃģÅžne widoki kamery do renderowania mapy gÅÄbi, a nastÄpnie wykorzystuje warunki gÅÄbi do prÃģbkowania obrazÃģw z modelu dyfuzji obrazu, a nastÄpnie projekuje te obrazy na powierzchniÄ siatki. Ramy wykonujÄ renderowanie, prÃģbkowanie i projekcjÄ podejÅÄ na przemian, aby poprawiÄ spÃģjnoÅÄ map tekstur, co ostatecznie pomaga w postÄpowym generowaniu mapy tekstury.
Model zaczyna generowaÄ teksturÄ widocznego obszaru z widokami kamery skupionymi na siatce 3D i renderuje siatkÄ 3D do mapy gÅÄbi z pierwszego widoku. Model nastÄpnie prÃģbkujÄ obraz tekstury dla warunku wyglÄ du i warunku gÅÄbi. Model nastÄpnie projekuje obraz na siatkÄ 3D. Dla punktÃģw widzenia, model Paint3D wykonuje podobne podejÅcie, ale z niewielkÄ zmianÄ , wykonywajÄ c proces prÃģbkowania tekstury przy uÅžyciu podejÅcia malowania obrazu. Ponadto, model bierze pod uwagÄ tekstury obszarÃģw z poprzednich widokÃģw, pozwalajÄ c procesowi renderowania nie tylko wyjÅÄ z obrazem gÅÄbi, ale takÅže z czÄÅciowo zakolorowanym obrazem RGB z maskÄ niekolorowanÄ w bieÅžÄ cym widoku.
Model nastÄpnie wykorzystuje model wypeÅniania obrazu zgodnego z gÅÄbiÄ z kodera wypeÅniania, aby wypeÅniÄ niekolorowany obszar w obrazie RGB. Model nastÄpnie generuje mapÄ tekstury z widoku, projekujÄ c wypeÅniony obraz na siatkÄ 3D pod bieÅžÄ cym widokiem, pozwalajÄ c modelowi generowaÄ mapÄ tekstury postÄpowo i dochodzÄ c do caÅej gruboziarnistej struktury mapy. Na koniec, model rozszerza proces prÃģbkowania tekstury do sceny lub obiektu z wieloma widokami. Konkretnie, model wykorzystuje parÄ kamer do przechwycenia dwÃģch map gÅÄbi podczas poczÄ tkowego prÃģbkowania tekstury z symetrycznych widokÃģw. Model nastÄpnie ÅÄ czy dwie mapy gÅÄbi i tworzy siatkÄ gÅÄbi. Model zastÄpuje pojedynczy obraz gÅÄbi siatkÄ gÅÄbi, aby wykonaÄ wielowidokowe prÃģbkowanie tekstury zgodne z gÅÄbiÄ .
Etap 2: Ulepszanie Tekstury w Przestrzeni UV
ChociaÅž wyglÄ d map tekstur gruboziarnistych jest logiczny, staje przed wyzwaniami, takimi jak dziury tekstury spowodowane podczas procesu renderowania przez samozacienienie lub cienie oÅwietlenia z powodu udziaÅu modeli dyfuzji 2D. Model Paint3D ma na celu wykonywanie procesu dyfuzji w przestrzeni UV na podstawie mapy tekstury gruboziarnistej, prÃģbujÄ c zÅagodziÄ problemy i poprawiÄ wizualnÄ atrakcyjnoÅÄ mapy tekstury podczas ulepszania tekstury. Jednak ulepszanie standardowego modelu dyfuzji obrazu z mapami tekstur w przestrzeni UV wprowadza nieciÄ gÅoÅÄ tekstury, poniewaÅž mapa tekstury jest generowana przez mapowanie UV powierzchni 3D, ktÃģre rozcinajÄ ciÄ gÅÄ teksturÄ na seriÄ oddzielnych fragmentÃģw w przestrzeni UV. W wyniku fragmentacji, model ma trudnoÅci z naukÄ relacji sÄ siedztwa 3D miÄdzy fragmentami, co prowadzi do problemÃģw nieciÄ gÅoÅci tekstury.
Model ulepsza mapÄ tekstury w przestrzeni UV, wykonujÄ c proces dyfuzji pod kierunkiem informacji o sÄ siedztwie fragmentÃģw tekstury. WaÅžne jest, aby zauwaÅžyÄ, Åže w przestrzeni UV, mapa poÅoÅženia reprezentuje informacje o sÄ siedztwie 3D fragmentÃģw tekstury, z modelem traktujÄ cym kaÅždy nie-tÅo element jako wspÃģÅrzÄdnÄ 3D. Podczas procesu dyfuzji, model ÅÄ czy informacje o sÄ siedztwie 3D, dodajÄ c indywidualny kodery mapy poÅoÅženia do wstÄpnie wytrenowanego modelu dyfuzji obrazu. Nowy kodery przypomina projekt ramy ControlNet i ma takÄ samÄ architekturÄ, jak kodery wdroÅžone w modelu dyfuzji obrazu, z warstwÄ zero-convolution ÅÄ czÄ cÄ je. Ponadto, model dyfuzji tekstury jest szkolony na zbiorze danych skÅadajÄ cym siÄ z map tekstur i map poÅoÅženia, a model uczy siÄ przewidywaÄ szum dodany do latentu. Model nastÄpnie optymalizuje kodery poÅoÅženia i zamyka wytrenowany denoiser dla zadania dyfuzji obrazu.
Model nastÄpnie wykorzystuje poÅoÅženie kodera warunkowego i innych koderÃģw, aby wykonaÄ zadania ulepszania w przestrzeni UV. W tym zakresie, model ma dwie moÅžliwoÅci ulepszania: UVHD lub UV High Definition i UV wypeÅnianie. Metoda UVHD jest zaprojektowana, aby poprawiÄ wizualnÄ atrakcyjnoÅÄ i estetykÄ mapy tekstury. Aby osiÄ gnÄ Ä UVHD, model wykorzystuje kodery wzmocnienia obrazu i kodery poÅoÅženia z modelem dyfuzji. Model wykorzystuje metodÄ wypeÅniania UV, aby wypeÅniÄ dziury tekstury w pÅaszczyÅšnie UV, co pozwala uniknÄ Ä problemÃģw samozacienienia generowanych podczas renderowania. W etapie ulepszania, model Paint3D najpierw wykonuje wypeÅnianie UV, a nastÄpnie wykonuje UVHD, aby wygenerowaÄ ostatecznÄ ulepszonÄ mapÄ tekstury. Poprzez integrowanie obu metod ulepszania, ramy Paint3D sÄ w stanie produkowaÄ kompletne, rÃģÅžnorodne, wysokiej rozdzielczoÅci i bezÅwietlne mapy tekstur UV.
Paint3D: Eksperymenty i Wyniki
Model Paint3D wykorzystuje model Stable Diffusion text2image, aby pomÃģc w zadaniach generowania tekstur, podczas gdy wykorzystuje skÅadnik kodera obrazu, aby obsÅuÅžyÄ warunki obrazu. Aby dalej poprawiÄ swojÄ kontrolÄ nad warunkami, takimi jak wypeÅnianie obrazu, gÅÄbokoÅÄ i wysoka rozdzielczoÅÄ obrazu, ramy Paint3D wykorzystujÄ kodery domenowe ControlNet. Model jest wdroÅžony w ramach PyTorch, z renderowaniem i projekcjÄ tekstury wdroÅžonymi w Kaolin.
PorÃģwnanie Tekstury z Teksturami
Aby przeanalizowaÄ swoje wyniki, zaczynamy od oceny efektu generowania tekstur Paint3D, gdy jest warunkowany przy uÅžyciu podpowiedzi tekstowych, i porÃģwnujemy go z ramami stanu sztuki, w tym Text2Tex, TEXTure i LatentPaint. Jak moÅžna zaobserwowaÄ na poniÅžszym obrazie, ramy Paint3D nie tylko wyrÃģÅžniajÄ siÄ w generowaniu wysokiej jakoÅci szczegÃģÅÃģw tekstury, ale takÅže syntetyzujÄ rozsÄ dnÄ mapÄ tekstury bez oÅwietlenia.

W porÃģwnaniu, ramy Latent-Paint sÄ skÅonne do generowania rozmytych tekstur, co prowadzi do nieoptymalnych efektÃģw wizualnych. Z drugiej strony, chociaÅž ramy TEXTure generujÄ wyraÅšne tekstury, brakuje im gÅadkoÅci i wykazujÄ widoczne szwy i poÅÄ czenia. Na koniec, ramy Text2Tex generujÄ gÅadkie tekstury w sposÃģb godny uwagi, ale nie sÄ w stanie odtworzyÄ wynikÃģw w generowaniu drobnych tekstur z intratnymi detalami.
PoniÅžszy obraz porÃģwnuje ramy Paint3D z ramami stanu sztuki iloÅciowo.

Jak moÅžna zaobserwowaÄ, ramy Paint3D przewyÅžszajÄ wszystkie istniejÄ ce modele, a to znacznÄ rÃģÅžnicÄ , z prawie 30% poprawÄ w bazie FID i okoÅo 40% poprawÄ w bazie KID. Poprawa w bazie FID i KID demonstruje zdolnoÅÄ Paint3D do generowania wysokiej jakoÅci tekstur w rÃģÅžnych obiektach i kategoriach.
PorÃģwnanie Obrazu z TeksturÄ
Aby wygenerowaÄ moÅžliwoÅci generatywne Paint3D przy uÅžyciu wizualnych podpowiedzi, wykorzystujemy model TEXTure jako bazÄ. Jak wczeÅniej wspomniano, model Paint3D wykorzystuje kodery obrazu z modelu text2image z Stable Diffusion. Jak moÅžna zobaczyÄ na poniÅžszym obrazie, ramy Paint3D syntetyzujÄ wyÅmienite tekstury w sposÃģb godny uwagi, a jednoczeÅnie sÄ w stanie utrzymaÄ wysokÄ wiernoÅÄ w stosunku do warunku obrazu.

Z drugiej strony, ramy TEXTure sÄ w stanie wygenerowaÄ teksturÄ podobnÄ do Paint3D, ale nie sÄ w stanie przedstawiÄ szczegÃģÅÃģw tekstury w warunku obrazu dokÅadnie. Ponadto, jak to pokazano na poniÅžszym obrazie, ramy Paint3D dostarczajÄ lepsze wyniki FID i KID w porÃģwnaniu z ramami TEXTure, z pierwszym spadajÄ cym z 40,83 do 26,86, a drugim spadajÄ cym z 9,76 do 4,94.

KoÅcowe MyÅli
W tym artykule omÃģwiliÅmy Paint3D, nowatorskÄ ramÄ, ktÃģra jest w stanie produkowaÄ bezÅwietlne, rÃģÅžnorodne i wysokiej rozdzielczoÅci mapy tekstur 2K UV dla nieutexturowanych siatek 3D, warunkowo na wejÅciach wizualnych lub tekstowych. GÅÃģwnym punktem ram Paint3D jest to, Åže sÄ one w stanie generowaÄ bezÅwietlne, wysokiej rozdzielczoÅci tekstury 2K, ktÃģre sÄ semantycznie spÃģjne, bez warunkowania na obrazie lub tekÅcie. DziÄki swojemu podejÅciu od gruboziarnistego do drobnego, ramy Paint3D produkujÄ bezÅwietlne, rÃģÅžnorodne i wysokiej rozdzielczoÅci mapy tekstur, i dostarczajÄ lepsze wyniki niÅž bieÅžÄ ce ramy stanu sztuki.












