Modele i platformy AI

Paint3D: Bezświetlny Model Dyfuzji do Generacji ObrazÃģw

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Szybki rozwÃģj modeli generatywnych AI, szczegÃģlnie głębokich modeli generatywnych AI, znacznie rozwinął moÅžliwości w generowaniu języka naturalnego, generowaniu 3D, generowaniu obrazÃģw i syntezie mowy. Modele te rewolucjonizują produkcję 3D w rÃģÅžnych branÅžach. Jednak wiele z nich stoi przed wyzwaniem: ich złoÅžone połączenia i wygenerowane siatki często nie są kompatybilne z tradycyjnymi potokami renderowania, takimi jak Physically Based Rendering (PBR). Modele oparte na dyfuzji, szczegÃģlnie te bez tekstur oświetlenia, demonstrują imponującą generację zasobÃģw 3D, poprawiając ramy 3D w filmach, grach i AR/VR.

Ten artykuł przedstawia Paint3D, nowatorską ramę do produkcji rÃģÅžnorodnych, wysokiej rozdzielczości map tekstur 2K UV dla nieutexturowanych siatek 3D, warunkowo na wejściach wizualnych lub tekstowych. GłÃģwnym wyzwaniem Paint3D jest generowanie wysokiej jakości tekstur bez wbudowanego oświetlenia, umoÅžliwiając uÅžytkownikom edycję lub ponowne oświetlenie w ramach nowoczesnych potokÃģw graficznych. Wykorzystuje on wstępnie wytrenowany model dyfuzji 2D do fuzji wielowidokowej, generując początkowe gruboziarniste mapy tekstur. Jednak te mapy często wykazują artefakty oświetlenia i niepełne obszary ze względu na ograniczenia modelu 2D w wyłączaniu efektÃģw oświetlenia i pełnym przedstawianiu kształtÃģw 3D. Będziemy się zagłębiać w działanie Paint3D, architekturę i porÃģwnania z innymi głębokimi ramami generatywnymi. Zaczynajmy.

Paint3D: Wprowadzenie

MoÅžliwości modeli generatywnych AI w generowaniu języka naturalnego, generowaniu 3D i syntezie obrazÃģw są dobrze znane i wdroÅžone w aplikacjach rzeczywistych, rewolucjonizując przemysł generowania 3D. Pomimo ich imponujących moÅžliwości, nowoczesne głębokie ramy generatywne AI generują siatki, ktÃģre charakteryzują się złoÅžonymi połączeniami i chaotycznymi teksturami oświetlenia, często niezgodnymi z konwencjonalnymi potokami renderowania, w tym PBR lub Physically Based Rendering. Podobnie jak głębokie modele generatywne AI, synteza tekstur rÃģwnieÅž znacznie się rozwinęła, zwłaszcza w wykorzystaniu modeli dyfuzji 2D. Modele syntezy tekstur wykorzystują wstępnie wytrenowane modele dyfuzji głębokości do efektywnego wykorzystania warunkÃģw tekstowych do generowania wysokiej jakości tekstur. Jednak te podejścia napotykają trudności z pre-oznaczonymi teksturami, ktÃģre mogą znacznie wpłynąć na finalne renderowania środowiska 3D i wprowadzić błędy oświetlenia, gdy światła są zmieniane w ramach typowych workflow, jak to pokazano na poniÅžszym obrazie.

Jak moÅžna zaobserwować, mapa tekstury z wolnym oświetleniem działa w synchronizacji z tradycyjnymi potokami renderowania, dostarczając dokładne wyniki, podczas gdy mapa tekstury z pre-oświetleniem zawiera nieodpowiednie cienie, gdy jest stosowane ponowne oświetlenie. Z drugiej strony, ramy generowania tekstur wytrenowane na danych 3D oferują alternatywne podejście, w ktÃģrym ramy generują tekstury, rozumiejąc geometrię określonego obiektu 3D. ChociaÅž mogą one dostarczyć lepsze wyniki, ramy generowania tekstur wytrenowane na danych 3D brakuje zdolności uogÃģlniania, co utrudnia ich zastosowanie do obiektÃģw 3D spoza ich danych szkoleniowych.

BieŞące modele generowania tekstur stają przed dwoma krytycznymi wyzwaniami: wykorzystaniem wskazÃģwek obrazu lub rÃģÅžnorodnych podpowiedzi, aby osiągnąć szerszy stopień uogÃģlnienia w rÃģÅžnych obiektach, oraz drugim wyzwaniem, jakim jest eliminacja sprzęŞonego oświetlenia w wynikach uzyskanych z wstępnego szkolenia. Pre-oznaczone tekstury mogą potencjalnie interferować z końcowymi wynikami obiektÃģw tekstur w silnikach renderowania, a poniewaÅž wstępnie wytrenowane modele dyfuzji 2D dostarczają wyniki 2D tylko w dziedzinie widoku, brakuje im pełnego zrozumienia kształtÃģw, co prowadzi do braku spÃģjności widoku dla obiektÃģw 3D.

Z powodu wymienionych wyÅžej wyzwań, ramy Paint3D prÃģbują opracować dwuetapowy model dyfuzji tekstur dla obiektÃģw 3D, ktÃģry uogÃģlnia się do rÃģÅžnych wstępnie wytrenowanych modeli generatywnych i zachowuje spÃģjność widoku podczas nauki generowania tekstur bez oświetlenia.

Paint3D jest modelem generowania tekstur od gruboziarnistego do drobnego, ktÃģry ma na celu wykorzystanie silnych wskazÃģwek i zdolności generowania obrazÃģw wstępnie wytrenowanych modeli generatywnych AI do tekstur obiektÃģw 3D. W pierwszym etapie, ramy Paint3D najpierw prÃģbkują obrazy wielowidokowe z wstępnie wytrenowanego modelu dyfuzji obrazu 2D, aby umoÅžliwić uogÃģlnienie wysokiej jakości i bogatych wynikÃģw tekstur z rÃģÅžnorodnych podpowiedzi. Model następnie generuje początkową mapę tekstury, projekując te obrazy na powierzchnię siatki. W drugim etapie, model koncentruje się na generowaniu tekstur bez oświetlenia, wdraÅžając podejścia zastosowane w modelach dyfuzji specjalizujących się w usuwaniu wpływÃģw oświetlenia i ulepszaniu niepełnych obszarÃģw. W trakcie całego procesu, ramy Paint3D są w stanie generować wysokiej jakości tekstury 2K semantycznie i eliminować wewnętrzne efekty oświetlenia.

Podsumowując, Paint3D jest nowatorskim modelem generatywnym AI, ktÃģry ma na celu produkcję rÃģÅžnorodnych, bezświetlnych i wysokiej rozdzielczości map tekstur 2K UV dla nieutexturowanych siatek 3D, aby osiągnąć najwyÅžsze wyniki w teksturach 3D z rÃģÅžnymi warunkami wejściowymi, w tym tekstami i obrazami, i oferuje znaczącą przewagę w syntezie i edycji grafiki.

Metodologia i Architektura

Ramy Paint3D generują i ulepszają mapy tekstur stopniowo, aby wygenerować rÃģÅžnorodne i wysokiej jakości mapy tekstur dla modeli 3D, uÅžywając poŞądanych warunkÃģw wejściowych, w tym obrazÃģw i podpowiedzi, jak to pokazano na poniÅžszym obrazie.

W etapie gruboziarnistym, model Paint3D wykorzystuje wstępnie wytrenowane modele dyfuzji obrazu 2D do prÃģbkowania obrazÃģw wielowidokowych, a następnie tworzy początkowe mapy tekstur, projekując te obrazy na powierzchnię siatki. W drugim etapie, czyli etapie ulepszania, model Paint3D wykorzystuje proces dyfuzji w przestrzeni UV, aby ulepszyć mapy tekstur gruboziarnistych, osiągając wysokiej jakości, wypełnianie i funkcję bez oświetlenia, co gwarantuje wizualną atrakcyjność i kompletność końcowej tekstury.

Etap 1: Postępowe Generowanie Tekstur Gruboziarnistych

W etapie postępowego generowania tekstur gruboziarnistych, model Paint3D generuje mapę tekstury gruboziarnistą dla siatek 3D, wykorzystując wstępnie wytrenowany model dyfuzji głębokości 2D. Konkretnie, model najpierw wykorzystuje rÃģÅžne widoki kamery do renderowania mapy głębi, a następnie wykorzystuje warunki głębi do prÃģbkowania obrazÃģw z modelu dyfuzji obrazu, a następnie projekuje te obrazy na powierzchnię siatki. Ramy wykonują renderowanie, prÃģbkowanie i projekcję podejść na przemian, aby poprawić spÃģjność map tekstur, co ostatecznie pomaga w postępowym generowaniu mapy tekstury.

Model zaczyna generować teksturę widocznego obszaru z widokami kamery skupionymi na siatce 3D i renderuje siatkę 3D do mapy głębi z pierwszego widoku. Model następnie prÃģbkuję obraz tekstury dla warunku wyglądu i warunku głębi. Model następnie projekuje obraz na siatkę 3D. Dla punktÃģw widzenia, model Paint3D wykonuje podobne podejście, ale z niewielką zmianą, wykonywając proces prÃģbkowania tekstury przy uÅžyciu podejścia malowania obrazu. Ponadto, model bierze pod uwagę tekstury obszarÃģw z poprzednich widokÃģw, pozwalając procesowi renderowania nie tylko wyjść z obrazem głębi, ale takÅže z częściowo zakolorowanym obrazem RGB z maską niekolorowaną w bieŞącym widoku.

Model następnie wykorzystuje model wypełniania obrazu zgodnego z głębią z kodera wypełniania, aby wypełnić niekolorowany obszar w obrazie RGB. Model następnie generuje mapę tekstury z widoku, projekując wypełniony obraz na siatkę 3D pod bieŞącym widokiem, pozwalając modelowi generować mapę tekstury postępowo i dochodząc do całej gruboziarnistej struktury mapy. Na koniec, model rozszerza proces prÃģbkowania tekstury do sceny lub obiektu z wieloma widokami. Konkretnie, model wykorzystuje parę kamer do przechwycenia dwÃģch map głębi podczas początkowego prÃģbkowania tekstury z symetrycznych widokÃģw. Model następnie łączy dwie mapy głębi i tworzy siatkę głębi. Model zastępuje pojedynczy obraz głębi siatką głębi, aby wykonać wielowidokowe prÃģbkowanie tekstury zgodne z głębią.

Etap 2: Ulepszanie Tekstury w Przestrzeni UV

ChociaÅž wygląd map tekstur gruboziarnistych jest logiczny, staje przed wyzwaniami, takimi jak dziury tekstury spowodowane podczas procesu renderowania przez samozacienienie lub cienie oświetlenia z powodu udziału modeli dyfuzji 2D. Model Paint3D ma na celu wykonywanie procesu dyfuzji w przestrzeni UV na podstawie mapy tekstury gruboziarnistej, prÃģbując złagodzić problemy i poprawić wizualną atrakcyjność mapy tekstury podczas ulepszania tekstury. Jednak ulepszanie standardowego modelu dyfuzji obrazu z mapami tekstur w przestrzeni UV wprowadza nieciągłość tekstury, poniewaÅž mapa tekstury jest generowana przez mapowanie UV powierzchni 3D, ktÃģre rozcinają ciągłą teksturę na serię oddzielnych fragmentÃģw w przestrzeni UV. W wyniku fragmentacji, model ma trudności z nauką relacji sąsiedztwa 3D między fragmentami, co prowadzi do problemÃģw nieciągłości tekstury.

Model ulepsza mapę tekstury w przestrzeni UV, wykonując proces dyfuzji pod kierunkiem informacji o sąsiedztwie fragmentÃģw tekstury. WaÅžne jest, aby zauwaÅžyć, Åže w przestrzeni UV, mapa połoÅženia reprezentuje informacje o sąsiedztwie 3D fragmentÃģw tekstury, z modelem traktującym kaÅždy nie-tło element jako wspÃģłrzędną 3D. Podczas procesu dyfuzji, model łączy informacje o sąsiedztwie 3D, dodając indywidualny kodery mapy połoÅženia do wstępnie wytrenowanego modelu dyfuzji obrazu. Nowy kodery przypomina projekt ramy ControlNet i ma taką samą architekturę, jak kodery wdroÅžone w modelu dyfuzji obrazu, z warstwą zero-convolution łączącą je. Ponadto, model dyfuzji tekstury jest szkolony na zbiorze danych składającym się z map tekstur i map połoÅženia, a model uczy się przewidywać szum dodany do latentu. Model następnie optymalizuje kodery połoÅženia i zamyka wytrenowany denoiser dla zadania dyfuzji obrazu.

Model następnie wykorzystuje połoÅženie kodera warunkowego i innych koderÃģw, aby wykonać zadania ulepszania w przestrzeni UV. W tym zakresie, model ma dwie moÅžliwości ulepszania: UVHD lub UV High Definition i UV wypełnianie. Metoda UVHD jest zaprojektowana, aby poprawić wizualną atrakcyjność i estetykę mapy tekstury. Aby osiągnąć UVHD, model wykorzystuje kodery wzmocnienia obrazu i kodery połoÅženia z modelem dyfuzji. Model wykorzystuje metodę wypełniania UV, aby wypełnić dziury tekstury w płaszczyÅšnie UV, co pozwala uniknąć problemÃģw samozacienienia generowanych podczas renderowania. W etapie ulepszania, model Paint3D najpierw wykonuje wypełnianie UV, a następnie wykonuje UVHD, aby wygenerować ostateczną ulepszoną mapę tekstury. Poprzez integrowanie obu metod ulepszania, ramy Paint3D są w stanie produkować kompletne, rÃģÅžnorodne, wysokiej rozdzielczości i bezświetlne mapy tekstur UV.

Paint3D: Eksperymenty i Wyniki

Model Paint3D wykorzystuje model Stable Diffusion text2image, aby pomÃģc w zadaniach generowania tekstur, podczas gdy wykorzystuje składnik kodera obrazu, aby obsłuÅžyć warunki obrazu. Aby dalej poprawić swoją kontrolę nad warunkami, takimi jak wypełnianie obrazu, głębokość i wysoka rozdzielczość obrazu, ramy Paint3D wykorzystują kodery domenowe ControlNet. Model jest wdroÅžony w ramach PyTorch, z renderowaniem i projekcją tekstury wdroÅžonymi w Kaolin.

PorÃģwnanie Tekstury z Teksturami

Aby przeanalizować swoje wyniki, zaczynamy od oceny efektu generowania tekstur Paint3D, gdy jest warunkowany przy uÅžyciu podpowiedzi tekstowych, i porÃģwnujemy go z ramami stanu sztuki, w tym Text2Tex, TEXTure i LatentPaint. Jak moÅžna zaobserwować na poniÅžszym obrazie, ramy Paint3D nie tylko wyrÃģÅžniają się w generowaniu wysokiej jakości szczegÃģłÃģw tekstury, ale takÅže syntetyzują rozsądną mapę tekstury bez oświetlenia.

W porÃģwnaniu, ramy Latent-Paint są skłonne do generowania rozmytych tekstur, co prowadzi do nieoptymalnych efektÃģw wizualnych. Z drugiej strony, chociaÅž ramy TEXTure generują wyraÅšne tekstury, brakuje im gładkości i wykazują widoczne szwy i połączenia. Na koniec, ramy Text2Tex generują gładkie tekstury w sposÃģb godny uwagi, ale nie są w stanie odtworzyć wynikÃģw w generowaniu drobnych tekstur z intratnymi detalami.

PoniÅžszy obraz porÃģwnuje ramy Paint3D z ramami stanu sztuki ilościowo.

Jak moÅžna zaobserwować, ramy Paint3D przewyÅžszają wszystkie istniejące modele, a to znaczną rÃģÅžnicą, z prawie 30% poprawą w bazie FID i około 40% poprawą w bazie KID. Poprawa w bazie FID i KID demonstruje zdolność Paint3D do generowania wysokiej jakości tekstur w rÃģÅžnych obiektach i kategoriach.

PorÃģwnanie Obrazu z Teksturą

Aby wygenerować moÅžliwości generatywne Paint3D przy uÅžyciu wizualnych podpowiedzi, wykorzystujemy model TEXTure jako bazę. Jak wcześniej wspomniano, model Paint3D wykorzystuje kodery obrazu z modelu text2image z Stable Diffusion. Jak moÅžna zobaczyć na poniÅžszym obrazie, ramy Paint3D syntetyzują wyśmienite tekstury w sposÃģb godny uwagi, a jednocześnie są w stanie utrzymać wysoką wierność w stosunku do warunku obrazu.

Z drugiej strony, ramy TEXTure są w stanie wygenerować teksturę podobną do Paint3D, ale nie są w stanie przedstawić szczegÃģłÃģw tekstury w warunku obrazu dokładnie. Ponadto, jak to pokazano na poniÅžszym obrazie, ramy Paint3D dostarczają lepsze wyniki FID i KID w porÃģwnaniu z ramami TEXTure, z pierwszym spadającym z 40,83 do 26,86, a drugim spadającym z 9,76 do 4,94.

Końcowe Myśli

W tym artykule omÃģwiliśmy Paint3D, nowatorską ramę, ktÃģra jest w stanie produkować bezświetlne, rÃģÅžnorodne i wysokiej rozdzielczości mapy tekstur 2K UV dla nieutexturowanych siatek 3D, warunkowo na wejściach wizualnych lub tekstowych. GłÃģwnym punktem ram Paint3D jest to, Åže są one w stanie generować bezświetlne, wysokiej rozdzielczości tekstury 2K, ktÃģre są semantycznie spÃģjne, bez warunkowania na obrazie lub tekście. Dzięki swojemu podejściu od gruboziarnistego do drobnego, ramy Paint3D produkują bezświetlne, rÃģÅžnorodne i wysokiej rozdzielczości mapy tekstur, i dostarczają lepsze wyniki niÅž bieŞące ramy stanu sztuki.

"InÅžynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złoÅžonych pojęć w tych dziedzinach poprzez swoje angaÅžujące i informacyjne dokumentacje.