Modele și platforme AI
Paint3D : Model de difuziune fără iluminare pentru generarea de imagini
Dezvoltarea rapidă a modelelor generative de inteligență artificială, în special a modelelor generative de inteligență artificială profundă, a avansat semnificativ capacitățile în generarea de limbaj natural, generarea de 3D, generarea de imagini și sinteza de vorbire. Aceste modele au revoluționat producția de 3D în diverse industrii. Cu toate acestea, multe dintre ele se confruntă cu o provocare: cablarea complexă și mesh-urile generate adesea nu sunt compatibile cu conductele de renderizare tradiționale, cum ar fi Renderizarea Fizică Bazată (PBR). Modelele bazate pe difuziune, în special cele fără texturi de iluminare, demonstrează o generare impresionantă de active 3D diverse, îmbunătățind cadrele 3D în cinematografie, jocuri și realitate augmentată/virtuală.
Acest articol introduce Paint3D, un cadru nou pentru producerea de hărți de textură 2K UV diverse și de înaltă rezoluție pentru mesh-urile 3D netexturate, condiționate de intrări vizuale sau textuale. Provocarea principală a Paint3D este generarea de texturi de înaltă calitate fără iluminare încorporată, permițând utilizatorilor să reediteze sau să rearanjeze iluminarea în cadrul conductelor de grafică moderne. Acesta utilizează un model de difuziune 2D preantrenat pentru fuziunea de texturi multi-vizuale, generând inițial hărți de textură grosiere. Cu toate acestea, aceste hărți adesea prezintă artefacte de iluminare și zone incomplete din cauza limitărilor modelului 2D în dezactivarea efectelor de iluminare și reprezentarea completă a formelor 3D. Vom explora funcționarea, arhitectura și comparațiile Paint3D cu alte cadre generative profunde. Să începem.
Paint3D : O introducere
Capacitățile modelelor generative de inteligență artificială profundă în generarea de limbaj natural, generarea de 3D și sinteza de imagini sunt bine cunoscute și implementate în aplicații reale, revoluționând industria de generare de 3D. În ciuda capacităților lor remarcabile, cadrele moderne de inteligență artificială generativă produc mesh-uri caracterizate de cablare complexă și texturi de iluminare haotice, adesea incompatibile cu conductele de renderizare convenționale, inclusiv PBR sau Renderizarea Fizică Bazată. La fel ca modelele generative de inteligență artificială profundă, sinteza de texturi a evoluat rapid, în special în utilizarea modelelor de difuziune 2D. Modelele de sinteză a texturilor utilizează modele de difuziune preantrenate pentru a utiliza condiții textuale și a genera texturi de înaltă calitate. Cu toate acestea, aceste abordări se confruntă cu dificultăți în ceea ce privește texturile preiluminate, care pot avea un impact semnificativ asupra renderizărilor finale ale mediului 3D și pot introduce erori de iluminare atunci când lumina este schimbată în cadrul fluxului de lucru comun, așa cum se demonstrează în imaginea de mai jos.

După cum se poate observa, harta de textură cu iluminare liberă funcționează în sincronizare cu conductele de renderizare tradiționale, livrând rezultate precise, în timp ce harta de textură cu preiluminare include umbre inadecvate atunci când se aplică reluminarea. Pe de altă parte, cadrele de generare a texturilor antrenate pe date 3D oferă o abordare alternativă, în care cadrul generează texturile prin înțelegerea geometriei complete a unui anumit obiect 3D. Deși ar putea livra rezultate mai bune, cadrele de generare a texturilor antrenate pe date 3D lipsesc de capacități de generalizare, ceea ce le împiedică să aplice modelul la obiecte 3D din afara datelor de antrenare.
Modelele actuale de generare a texturilor se confruntă cu două provocări critice: utilizarea îndrumării de imagine sau a prompturilor diverse pentru a obține un grad mai mare de generalizare pe diverse obiecte și, a doua provocare, eliminarea iluminării cuplate în rezultatele obținute din preantrenare. Texturile preiluminate pot interfera potențial cu rezultatele finale ale obiectelor texturate în cadrul motorului de renderizare și, deoarece modelele de difuziune 2D preantrenate oferă rezultate 2D doar în domeniul de vedere, ele lipsesc de o înțelegere cuprinzătoare a formelor, ceea ce le face incapabile să mențină consistența vederii pentru obiectele 3D.
Din cauza provocărilor menționate mai sus, cadrul Paint3D încearcă să dezvolte un model de difuziune a texturilor în două etape pentru obiecte 3D care se generalizează la diverse modele generative preantrenate și păstrează consistența vederii în timp ce învață generarea de texturi fără iluminare.
Paint3D este un model de generare a texturilor grosiere la fine, care își propune să valorifice îndrumarea puternică a prompturilor și capacitățile de generare a imaginilor ale modelelor generative de inteligență artificială preantrenate pentru a textura obiecte 3D. În prima etapă, cadrul Paint3D generează inițial o hartă de textură UV grosieră pentru mesh-urile 3D, utilizând un model de difuziune 2D preantrenat și conștient de adâncime. Modelul generează apoi o hartă de textură inițială prin proiectarea inversă a acestor imagini pe suprafața mesh-ului. În a doua etapă, modelul se concentrează pe generarea de texturi fără iluminare, implementând abordări utilizate de modelele de difuziune specializate în eliminarea influențelor de iluminare și rafinarea regiunilor incomplete. Pe parcursul procesului, cadrul Paint3D este capabil să genereze hărți de textură de înaltă calitate, semantic și să elimine efectele de iluminare intrinseci.

În rezumat, Paint3D este un model generativ de inteligență artificială nou, de la grosier la fin, care își propune să producă hărți de textură 2K UV diverse, fără iluminare și de înaltă rezoluție pentru mesh-urile 3D netexturate, pentru a obține performanțe de ultimă generație în texturarea obiectelor 3D cu diverse intrări condiționale, incluzând text și imagini, și oferă un avantaj semnificativ pentru sinteza și editarea grafică.
Metodologie și Arhitectură
Cadrul Paint3D generează și rafinează progresiv hărți de textură pentru a genera hărți de textură diverse și de înaltă calitate pentru modele 3D, utilizând intrări condiționale dorite, incluzând imagini și prompturi, așa cum se demonstrează în imaginea de mai jos.

În etapa grosieră, modelul Paint3D utilizează modele de difuziune 2D preantrenate pentru a sampila imagini multi-vizuale și apoi creează hărțile de textură inițiale prin proiectarea inversă a acestor imagini pe suprafața mesh-ului. În a doua etapă, respectiv etapa de rafinare, modelul Paint3D utilizează un proces de difuziune în spațiul UV pentru a îmbunătăți hărțile de textură grosiere, realizând astfel o funcție de înaltă calitate, de umplere și fără iluminare, care asigură atracția vizuală și completează textura finală.
Etapa 1: Generarea Progresivă a Texturilor Grosiere
În etapa de generare progresivă a texturilor grosiere, modelul Paint3D generează o hartă de textură UV grosieră pentru mesh-urile 3D, utilizând un model de difuziune 2D preantrenat și conștient de adâncime. Mai exact, modelul utilizează mai multe vederi ale camerei pentru a renderiza harta de adâncime, apoi sampilează imagini din modelul de difuziune a imaginii, utilizând condiții de adâncime, și apoi proiectează inverse aceste imagini pe suprafața mesh-ului. Cadrul efectuează rendering, sampeling și proiectare inversă alternativ pentru a îmbunătăți consistența texturilor mesh-urilor, ceea ce ajută în generarea progresivă a hărții de textură.
Modelul începe să genereze textura regiunii vizibile cu vederile camerei axate pe mesh-ul 3D și renderizează mesh-ul 3D într-o hartă de adâncime din prima vedere. Modelul sampilează apoi o imagine de textură pentru o condiție de aparență și o condiție de adâncime. Modelul proiectează apoi imaginea pe mesh-ul 3D. Pentru vederi, modelul Paint3D execută o abordare similară, dar cu o schimbare ușoară, efectuând procesul de sampeling a texturii utilizând o abordare de pictură a imaginii. Mai mult, modelul ia în considerare regiunile texturate din vederile anterioare, permițând procesului de renderizare să nu numai să producă o imagine de adâncime, ci și o imagine RGB parțial colorată cu o mască necolorată în vederea curentă.
Modelul utilizează apoi un model de umplere a imaginii conștient de adâncime, cu un encoder de umplere, pentru a umple zona necolorată din imaginea RGB. Modelul generează apoi harta de textură din vedere prin proiectarea inverse a imaginii umplute pe mesh-ul 3D sub vederea curentă, permițând modelului să genereze harta de textură progresiv și să ajungă la structura grosieră completă. În final, modelul extinde procesul de sampeling al texturii la o scenă sau obiect cu multiple vederi. Mai exact, modelul utilizează o pereche de camere pentru a captura două hărți de adâncime în timpul sampelării inițiale a texturii din vederi simetrice. Modelul combină apoi cele două hărți de adâncime și compune o grilă de adâncime. Modelul înlocuiește imaginea de adâncime unică cu grila de adâncime pentru a efectua sampelarea texturii multi-vizuale conștientă de adâncime.
Etapa 2: Rafinarea Texturilor în Spațiul UV
Deși aspectul hărților de textură grosiere este logic, acesta se confruntă cu unele provocări, cum ar fi găurile de textură cauzate în timpul procesului de renderizare de auto-ocluziune sau umbre de iluminare datorită implicării modelelor de difuziune 2D. Modelul Paint3D își propune să efectueze un proces de difuziune în spațiul UV pe baza unei hărți de textură grosiere, încercând să mitigeze problemele și să îmbunătățească atracția vizuală a hărții de textură și mai mult în timpul rafinării texturii. Cu toate acestea, rafinarea modelului de difuziune a imaginii cu hărțile de textură în spațiul UV introduce discontinuitatea texturii, deoarece harta de textură este generată prin mapping-ul UV al texturii suprafeței 3D, care taie textura continuă într-o serie de fragmente individuale în spațiul UV. Ca urmare a fragmentării, modelul găsește dificil să învețe relațiile de adiacență 3D între fragmente, ceea ce duce la probleme de discontinuitate a texturii.
Modelul rafinează harta de textură în spațiul UV prin efectuarea procesului de difuziune sub îndrumarea informațiilor de adiacență a fragmentelor de textură. Este important de remarcat că, în spațiul UV, harta de poziție reprezintă informațiile de adiacență 3D ale fragmentelor de textură, modelul tratând fiecare element non-fundal ca o coordonată 3D. În timpul procesului de difuziune, modelul fuzionează informațiile de adiacență 3D prin adăugarea unui encoder de poziție individual la modelul de difuziune a imaginii preantrenat. Noul encoder seamănă cu designul cadrului ControlNet și are aceeași arhitectură ca encoderul implementat în modelul de difuziune a imaginii, cu straturile de convoluție zero care leagă cele două. Mai mult, modelul de difuziune a texturii este antrenat pe un set de date care include hărți de textură și hărți de poziție, și modelul învață să prezică zgomotul adăugat la latentul zgomotos. Modelul optimizează apoi encoderul de poziție și îngheță denoiserul antrenat pentru sarcina de difuziune a imaginii.
Modelul utilizează apoi poziția encoder-ului condițional și a altor encodere pentru a efectua sarcini de rafinare în spațiul UV. În acest sens, modelul are două capacități de rafinare: UVHD sau UV de înaltă definiție și UV de umplere. Metoda UVHD este structurată pentru a îmbunătăți atracția vizuală și estetica hărții de textură. Pentru a obține UVHD, modelul utilizează un encoder de îmbunătățire a imaginii și un encoder de poziție, împreună cu modelul de difuziune. Modelul utilizează metoda de umplere UV pentru a umple găurile de textură din interiorul planului UV, care este capabilă să evite problemele de auto-ocluziune generate în timpul renderizării. În etapa de rafinare, modelul Paint3D efectuează mai întâi umplerea UV și apoi efectuează UVHD pentru a genera harta de textură rafinată finală. Prin integrarea celor două metode de rafinare, cadrul Paint3D este capabil să producă hărți de textură UV complete, diverse, de înaltă rezoluție și fără iluminare.
Paint3D : Experimente și Rezultate
Modelul Paint3D utilizează modelul de difuziune stabilă text2image pentru a-l ajuta cu sarcinile de generare a texturilor, în timp ce utilizează componenta de encoder de imagine pentru a gestiona condițiile de imagine. Pentru a-și îmbunătăți controlul asupra condițiilor, cum ar fi umplerea imaginii, adâncimea și definiția înaltă a imaginii, cadrul Paint3D utilizează encodere de domeniu ControlNet. Modelul este implementat pe framework-ul PyTorch, cu rendering și proiecții de textură implementate pe Kaolin.
Comparație Text la Texturi
Pentru a analiza performanța sa, începem prin evaluarea efectului de generare a texturilor Paint3D atunci când este condiționat utilizând prompturi textuale și îl comparăm cu cadrele de ultimă generație, incluzând Text2Tex, TEXTure și LatentPaint. Așa cum se poate observa în imaginea de mai jos, cadrul Paint3D nu numai că generează detalii de textură de înaltă calitate, dar sintetizează și o hartă de textură fără iluminare în mod rezonabil.

În comparație, cadrul Latent-Paint este predispus la generarea de texturi blurate, ceea ce duce la efecte vizuale suboptimale. Pe de altă parte, deși cadrul TEXTure generează texturi clare, acesta lipsește de netezime și prezintă splicing și cusături vizibile. În final, cadrul Text2Tex generează texturi netede în mod remarcabil, dar nu reușește să reproducă performanța pentru generarea de texturi fine cu detalii intricate.
Imaginea de mai jos compară cadrul Paint3D cu cadrele de ultimă generație în mod cantitativ.

Așa cum se poate observa, cadrul Paint3D depășește toate modelele existente, și cu o marjă semnificativă, cu o îmbunătățire de aproximativ 30% în linia de bază FID și o îmbunătățire de aproximativ 40% în linia de bază KID. Îmbunătățirea în liniile de bază FID și KID demonstrează capacitatea Paint3D de a genera texturi de înaltă calitate pe diverse obiecte și categorii.
Comparație Imagine la Textură
Pentru a genera capacitățile generative ale Paint3D utilizând prompturi vizuale, utilizăm modelul TEXTure ca bază. Așa cum s-a menționat anterior, modelul Paint3D utilizează un encoder de imagine din modelul text2image de la Stable Diffusion. Așa cum se poate vedea în imaginea de mai jos, cadrul Paint3D sintetizează texturi excepționale în mod remarcabil și este încă capabil să mențină fidelitate ridicată față de condiția de imagine.

Pe de altă parte, cadrul TEXTure este capabil să genereze o textură similară cu Paint3D, dar nu reușește să reprezinte detaliile texturii în condiția de imagine în mod precis. Mai mult, așa cum se demonstrează în imaginea de mai jos, cadrul Paint3D oferă scoruri FID și KID mai bune decât cadrul TEXTure, cu prima scăzând de la 40,83 la 26,86, în timp ce a doua arată o scădere de la 9,76 la 4,94.

Gânduri Finale
În acest articol, am discutat despre Paint3D, un cadru nou, de la grosier la fin, capabil să producă hărți de textură 2K UV diverse, fără iluminare și de înaltă rezoluție pentru mesh-urile 3D netexturate, condiționate de intrări vizuale sau textuale. Punctul forte al cadrului Paint3D este că este capabil să genereze texturi de înaltă rezoluție 2K fără iluminare, care sunt consistent semantic, fără a fi condiționate de intrări de imagine sau text. Datorită abordării sale de la grosier la fin, cadrul Paint3D produce hărți de textură fără iluminare, diverse și de înaltă rezoluție, și oferă o performanță mai bună decât cadrele actuale de ultimă generație.












