Modele și platforme AI
DreamCraft3D: Generare Ierarhică 3D cu Antrenare de Difuzie Inițială
Modelele generative de inteligență artificială au fost un subiect de discuție fierbinte în industria IA de ceva timp. Succesul recent al modelelor generative 2D a deschis calea pentru metodele pe care le folosim astăzi pentru a crea conținut vizual. Deși comunitatea IA a obținut succese remarcabile cu modelele generative 2D, generarea de conținut 3D rămâne o provocare majoră pentru cadrele generative profunde IA. Acest lucru este valabil mai ales având în vedere că cererea de conținut generat 3D a atins un nivel fără precedent, determinată de o gamă largă de jocuri vizuale, aplicații, realitate virtuală și chiar cinematografie. Este important de remarcat că, deși există cadre IA generative 3D care oferă rezultate acceptabile pentru anumite categorii și sarcini, ele nu pot genera eficient obiecte 3D. Această lipsă se datorează lipsei de date extinse 3D pentru antrenarea cadrelor. Recent, dezvoltatorii au propus utilizarea ghidării oferite de modelele IA generative pre-antrenate de la text la imagine, o abordare care a arătat rezultate promițătoare.
În acest articol, vom discuta despre cadru DreamCraft3D, un model ierarhic pentru generarea de conținut 3D care produce obiecte 3D coerente și de înaltă calitate. Cadru DreamCraft3D folosește o imagine de referință 2D pentru a ghida etapa de sculptură a geometriei, îmbunătățind textura cu accent pe rezolvarea problemelor de consistență întâlnite de cadrele sau metodele actuale. În plus, cadru DreamCraft3D utilizează un model de difuzie dependent de vedere pentru mostre de distilare a scorului, ajutând la sculptarea geometriei care contribuie la renderarea coerentă.
Vom face o analiză mai detaliată a cadru DreamCraft3D pentru generarea de conținut 3D. Mai mult, vom explora conceptul de utilizare a modelelor pre-antrenate Text-to-Image (T2I) pentru generarea de conținut 3D și vom examina cum cadru DreamCraft3D își propune să utilizeze această abordare pentru a genera conținut 3D realist.
DreamCraft3D: O Introducere
DreamCraft3D este un pipeline ierarhic pentru generarea de conținut 3D. Cadru DreamCraft3D încearcă să utilizeze un cadru generativ de ultimă oră de la text la imagine pentru a crea imagini 2D de înaltă calitate utilizând un prompt de text. Acestă abordare permite cadru DreamCraft3D să maximizeze capacitățile modelelor de difuzie 2D de ultimă oră pentru a reprezenta semantica vizuală descrisă în promptul de text, păstrând în același timp libertatea creativă oferită de aceste cadre generative 2D AI. Imaginea generată este apoi transformată în 3D cu ajutorul fazelor de îmbunătățire a texturii geometrice și de sculptură a geometriei, iar tehnici specializate sunt aplicate la fiecare etapă cu ajutorul descompunerii problemei.
Pentru geometrie, cadru DreamCraft3D se concentrează puternic pe structura globală 3D și pe consistența multi-vizuală, făcând loc pentru compromisuri asupra texturilor detaliate din imagini. Odată ce cadru elimină problemele legate de geometrie, se concentrează pe optimizarea texturilor coerente și realiste prin implementarea unei difuzii 3D conștiente care inițializează abordarea de optimizare 3D. Există două considerații de proiectare cheie pentru cele două faze de optimizare, și anume Sculptura Geometrică și Îmbunătățirea Texturii.
Cu toate acestea, ar fi sigur să descriem DreamCraft3D ca pe un cadru generativ AI care utilizează un pipeline ierarhic de generare a conținutului 3D pentru a transforma esențial imagini 2D în contrapartidele lor 3D, menținând în același timp coerența holistică 3D.
Utilizarea Modelelor Pre-antrenate T2I sau Text-to-Image
Ideea de a utiliza modele pre-antrenate T2I sau Text-to-Image pentru generarea de conținut 3D a fost introdusă pentru prima dată de cadru DreamFusion în 2022. Cadru DreamFusion a încercat să impună o pierdere de distilare a scorului (SDS) pentru a optimiza cadru 3D astfel încât renderările la puncte de vedere aleatorii să se alinieze cu distribuțiile de imagini condiționate de text interpretate de un cadru de difuzie de imagine-text eficient. Deși abordarea DreamFusion a oferit rezultate decente, au existat două probleme majore, blur și saturație excesivă. Pentru a aborda aceste probleme, lucrări recente implementează strategii de optimizare etapă cu etapă pentru a îmbunătăți pierderea de difuzie 2D, ceea ce duce în cele din urmă la imagini 3D generate de calitate superioară și mai realistă.
Cu toate acestea, în ciuda succesului recent al acestor cadre, ele nu pot egala capacitatea modelelor generative 2D de a sintetiza conținut complex. Mai mult, aceste cadre sunt adesea afectate de „problema Janus”, o condiție în care renderările 3D care par plauzibile individual arată incoerențe stilistice și semantice atunci când sunt examinate în ansamblu.
Pentru a aborda problemele întâmpinate de lucrările anterioare, cadru DreamCraft3D explorează posibilitatea utilizării unui pipeline ierarhic de generare a conținutului 3D și caută inspirație din procesul artistic manual în care un concept este mai întâi transpus într-un draft 2D, după care artistul sculptează geometria brută, rafinează detaliile geometrice și pictează texturi de înaltă fidelitate. Urmând aceeași abordare, cadru DreamCraft3D divide sarcinile exhaustive de generare a conținutului 3D sau a imaginilor în etape gestionabile.
În prima etapă, cadru DreamCraft3D utilizează sculptura geometrică pentru a produce forme geometrice 3D coerente și plauzibile utilizând imaginea 2D ca referință. Mai mult, etapa nu numai că utilizează pierderea SDS pentru pierderi fotometrice și pentru noi puncte de vedere la punctul de vedere de referință, dar cadru introduce și o serie de strategii pentru a promova consistența geometrică. Cadru își propune să utilizeze Zero-1-to-3, un model de traducere a imaginii condiționat de punct de vedere, pentru a utiliza imaginea de referință pentru a modela distribuția noilor puncte de vedere. În plus, cadru trece de la reprezentarea implicită a suprafeței la reprezentarea mesh pentru rafinarea geometrică de la gros la fin.
A doua etapă a cadru DreamCraft3D utilizează o abordare de distilare a scorului inițială pentru a îmbunătăți texturile imaginii, deoarece modelele de difuzie condiționate de punct de vedere actuale sunt antrenate pe o cantitate limitată de date 3D, ceea ce face ca acestea să lupte adesea pentru a egala performanța sau fidelitatea modelelor de difuzie 2D. Mulțumită acestei limitări, cadru DreamCraft3D ajustează modelul de difuzie în conformitate cu imagini multi-vizuale ale instanței 3D care este optimizată, și această abordare ajută cadru să îmbunătățească texturile 3D, menținând în același timp consistența multi-vizuală. Atunci când modelul de difuzie se antrenează pe aceste renderări multi-vizuale, oferă o ghidare mai bună pentru optimizarea texturii 3D, și această abordare ajută cadru DreamCraft3D să atingă un nivel ridicat de detaliu al texturii, menținând în același timp coerența vizuală.

Așa cum se poate observa în imaginile de mai sus, cadru DreamCraft3D este capabil să producă imagini 3D creative și conținut cu texturi realiste și structuri geometrice intricate. În prima imagine, este corpul lui Son Goku, un personaj de anime amestecat cu capul unui porc sălbatic care aleargă, în timp ce a doua imagine înfățișează un câine Beagle îmbrăcat în costumul unui detectiv. Următoarele sunt câteva exemple suplimentare.

DreamCraft3D: Funcționare și Arhitectură
Cadru DreamCraft3D încearcă să utilizeze un cadru generativ de ultimă oră de la text la imagine pentru a crea imagini 2D de înaltă calitate utilizând un prompt de text. Acestă abordare permite cadru DreamCraft3D să maximizeze capacitățile modelelor de difuzie 2D de ultimă oră pentru a reprezenta semantica vizuală descrisă în promptul de text, păstrând în același timp libertatea creativă oferită de aceste cadre generative 2D AI. Imaginea generată este apoi transformată în 3D cu ajutorul fazelor de îmbunătățire a texturii geometrice și de sculptură a geometriei, iar tehnici specializate sunt aplicate la fiecare etapă cu ajutorul descompunerii problemei. Următoarea imagine rezumă pe scurt funcționarea cadru DreamCraft3D.

Să avem o privire detaliată asupra considerațiilor de proiectare cheie pentru fazele de îmbunătățire a texturii și sculptură a geometriei.
Sculptura Geometrică
Sculptura Geometrică este prima etapă în care cadru DreamCraft3D încearcă să creeze un model 3D care se aliniază cu aspectul imaginii de referință la același punct de vedere de referință, asigurând în același timp o plauzibilitate maximă chiar și sub diferite unghiuri de vedere. Pentru a asigura o plauzibilitate maximă, cadru utilizează pierderea SDS pentru a încuraja renderări de imagini plauzibile pentru fiecare vedere eșantionată individual pe care un model de difuzie pre-antrenat îl poate recunoaște. Mai mult, pentru a utiliza eficient ghidarea oferită de imaginea de referință, cadru penalizează diferențele fotometrice dintre imaginea de referință și imaginea renderizată la punctul de vedere de referință, iar pierderea este calculată numai în regiunea din prim-plan a punctului de vedere. În plus, pentru a încuraja raritatea scenei, cadru implementează o pierdere de mască care renderizează silueta. Cu toate acestea, menținerea aspectului și a semanticilor de-a lungul punctelor de vedere din spate într-o manieră coerentă rămâne o provocare, ceea ce face ca cadru să utilizeze abordări suplimentare pentru a produce o geometrie detaliată și coerentă.
Difuzie 3D Conștientă
Metodele de optimizare 3D care utilizează doar supravegherea per-vizualizare sunt sub-constrânse, ceea ce face ca cadru DreamCraft3D să utilizeze Zero-1-to-3, un model de difuzie condiționat de punct de vedere, deoarece Zero-1-to-3 oferă o conștientizare îmbunătățită a punctului de vedere, deoarece a fost antrenat pe o scară mai largă de active 3D. Mai mult, Zero-1-to-3 este un model de difuzie fin-reglat care hallucinează imaginea în legătură cu poza camerei, dată fiind imaginea de referință.
Antrenare Progresivă a Vizualizării
Derivarea directă a punctelor de vedere libere în 360 de grade poate duce la artefacte geometrice sau discrepanțe, cum ar fi un picior suplimentar pe scaun, un eveniment care poate fi atribuit ambiguității unei singure imagini de referință. Pentru a aborda această barieră, cadru DreamCraft3D mărește progresiv punctele de vedere de antrenare, după care geometria bine stabilită este propagată treptat pentru a obține rezultate în 360 de grade.
Înălțare a Timpului de Difuzie
Cadru DreamCraft3D utilizează o strategie de înălțare a timpului de difuzie pentru a se alinia cu progresia de la gros la fin a optimizării 3D. La începutul procesului de optimizare, cadru dă prioritate mostrei unui timp de difuzie mai mare, pentru a oferi structura globală. Pe măsură ce cadru progresează în procesul de antrenare, reduce liniar intervalul de eșantionare a timpului de difuzie pe parcursul a sute de iterații. Mulțumită strategiei de înălțare, cadru reușește să stabilească o geometrie globală plauzibilă în etapele inițiale de optimizare, înainte de a rafina detaliile structurale.
Îmbunătățire Structurală Detaliată
Cadru DreamCraft3D optimizează inițial o reprezentare implicită a suprafeței pentru a stabili o structură brută. Apoi, cadru utilizează acest rezultat și îl combină cu o grilă tetraedrală deformabilă (DMTet) pentru a inițializa o reprezentare a mesh-ului 3D texturat, care desparte învățarea texturii și a geometriei. Atunci când cadru finalizează îmbunătățirea structurală, modelul este capabil să păstreze detalii de înaltă frecvență obținute din imaginea de referință, rafinând texturile exclusiv.
Îmbunătățirea Texturii prin Mostre de Scor Inițial
Deși etapa de sculptură a geometriei se concentrează pe învățarea unei geometrii detaliate și coerente, aceasta poate estompa textura într-o anumită măsură, ceea ce poate fi rezultatul dependenței cadru de un model prior 2D care funcționează la o rezoluție grosieră, împreună cu limitarea ascuțimii oferite de modelul de difuzie 3D. Mai mult, problemele comune de textură, inclusiv saturația excesivă și netezirea excesivă, apar ca urmare a unei ghidări libere de clasificator în mare măsură.
Cadru utilizează o pierdere de distilare a scorului variabil (VSD) pentru a îmbunătăți realismul texturilor. Cadru optează pentru un model de difuzie stabil în această etapă pentru a obține gradienti de înaltă rezoluție. Mai mult, cadru menține grila tetraedrală fixă pentru a promova renderizarea realistă și pentru a optimiza structura generală a mesh-ului. În timpul etapei de învățare, cadru DreamCraft3D nu utilizează Zero-1-to-3, deoarece are un efect advers asupra calității texturilor, și aceste texturi incoerente pot fi recurente, ceea ce duce la ieșiri 3D ciudate.
Experimente și Rezultate
Pentru a evalua performanța cadru DreamCraft3D, acesta este comparat cu cadre actuale de ultimă oră, și rezultatele calitative și cantitative sunt analizate.
Comparație cu Modelele de Referință
Pentru a evalua performanța, cadru DreamCraft3D este comparat cu 5 cadre de ultimă oră, incluzând DreamFusion, Magic3D, ProlificDreamer, Magic123 și Make-it-3D. Testul de referință constă în 300 de imagini de intrare care sunt o combinație de imagini din lumea reală și imagini generate de modelul de difuzie stabil. Fiecare imagine din testul de referință are un prompt de text, o hartă de adâncime predictivă și o mască alfa pentru prim-plan. Cadru obține prompturile de text pentru imagini reale de la un cadru de captionare a imaginilor.
Analiză Calitativă
Următoarea imagine compară cadru DreamCraft3D cu modelele de referință actuale, și, așa cum se poate vedea, cadrele care se bazează pe abordarea de la text la 3D se confruntă adesea cu probleme de consistență multi-vizuală.

Pe de o parte, aveți cadru ProlificDreamer care oferă texturi realiste, dar care nu reușește să genereze un obiect 3D plauzibil. Cadre precum Make-it-3D, care se bazează pe metodele de la imagine la 3D, reușesc să creeze vederi frontale de înaltă calitate, dar nu pot menține geometria ideală pentru imagini. Imaginile generate de cadru Magic123 oferă o regularizare geometrică mai bună, dar generează texturi și detalii geometrice suprasaturate și netezite excesiv. În comparație cu aceste cadre, cadru DreamCraft3D, care utilizează o metodă de distilare a scorului inițial, nu numai că menține coerența semantică, dar îmbunătățește și diversitatea imaginației.

Analiză Cantitativă
În încercarea de a genera imagini 3D convingătoare care nu numai că seamănă cu imaginea de referință, dar și transmit semantica într-o manieră coerentă din multiple perspective, tehnicile utilizate de cadru DreamCraft3D sunt comparate cu modelele de referință, și procesul de evaluare utilizează patru metrice: PSNR și LPIPS pentru măsurarea fidelității la punctul de vedere de referință, Distanța Contextuală pentru evaluarea congruenței la nivel de pixel, și CLIP pentru a estima coerența semantică. Rezultatele sunt demonstrate în imaginea de mai jos.

Concluzie
În acest articol, am discutat despre DreamCraft3D, un pipeline ierarhic pentru generarea de conținut 3D. Cadru DreamCraft3D își propune să utilizeze un cadru generativ de ultimă oră de la text la imagine pentru a crea imagini 2D de înaltă calitate utilizând un prompt de text. Această abordare permite cadru DreamCraft3D să maximizeze capacitățile modelelor de difuzie 2D de ultimă oră pentru a reprezenta semantica vizuală descrisă în promptul de text, păstrând în același timp libertatea creativă oferită de aceste cadre generative 2D AI. Imaginea generată este apoi transformată în 3D cu ajutorul fazelor de îmbunătățire a texturii geometrice și de sculptură a geometriei, iar tehnici specializate sunt aplicate la fiecare etapă cu ajutorul descompunerii problemei. Ca urmare a acestei abordări, cadru DreamCraft3D poate produce active 3D de înaltă fidelitate și consistență, cu texturi convingătoare, vizibile din multiple unghiuri.












