AI-modeller og platforme
DreamCraft3D: Hierarkisk 3D-generering med bootstrapped diffusion prior
Generative AI-modeller har været et varmt emne for diskussion inden for AI-industrien i en længere periode. Den seneste succes med 2D-generative modeller har banet vejen for de metoder, vi bruger til at oprette visuelt indhold i dag. Selvom AI-samfundet har opnået bemærkelsesværdig succes med 2D-generative modeller, er generering af 3D-indhold stadig en stor udfordring for dybe generative AI-rammer. Dette er særligt sandt, da efterspørgslen efter 3D-genereret indhold er på rekordhøjde, drevet af en bred vifte af visuelle spil, applikationer, virtuel virkelighed og selv film. Det er værd at bemærke, at selvom der findes 3D-generative AI-rammer, der leverer acceptabelt resultat for bestemte kategorier og opgaver, er de ude af stand til effektivt at generere 3D-objekter. Dette mangler kan tilskrives mangel på omfattende 3D-data til træning af rammerne. Ligeledes har udviklere foreslået at udnytte vejledningen fra forudtrænede tekst-til-billede AI-generative modeller, en tilgang, der har vist lovende resultater.
I denne artikel vil vi diskutere DreamCraft3D-rammen, en hierarkisk model til generering af 3D-indhold, der producerer kohærent og højkvalitets 3D-objekter med høj kvalitet. DreamCraft3D-rammen bruger et 2D-referencbillede til at guide geometri-sculptur-stadiet og forbedrer teksturen med fokus på at løse konsistensproblemer, der mødes af nuværende rammer eller metoder. Desuden bruger DreamCraft3D-rammen en view-afhængig diffusion-model til score-destillationsprøve, der hjælper med at skulpturere geometri, der bidrager til kohærent rendering.
Vi vil tage en nærmere kig på DreamCraft3D-rammen til generering af 3D-indhold. Desuden vil vi udforske begrebet om at udnytte forudtrænede Text-to-Image (T2I)-modeller til generering af 3D-indhold og se, hvordan DreamCraft3D-rammen søger at udnytte denne tilgang til at generere realistisk 3D-indhold.
DreamCraft3D: En introduktion
DreamCraft3D er en hierarkisk pipeline til generering af 3D-indhold. DreamCraft3D-rammen forsøger at udnytte en state-of-the-art T2I eller Text-to-Image generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Tilgangen giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition.
For geometri fokuserer DreamCraft3D-rammen stærkt på den globale 3D-struktur og multi-view konsistens, hvilket giver plads til kompromiser på de detaljerede teksturer i billederne. Når rammen har løst geometri-relaterede problemer, skifter den fokus til at optimere kohærent og realistisk tekstur ved at implementere en 3D-bevidst diffusion, der bootstrapper 3D-optimeringsmetoden. Der er to nøgle-designovervejelser for de to optimeringsfaser, nemlig den geometriske sculptur og tekstforbedring.
Med alt sagt og gjort ville det være sikkert at beskrive DreamCraft3D som en AI-generativ ramme, der udnytter en hierarkisk 3D-indholdsgenereringspipeline til at transformere 2D-billeder til deres 3D-modstykke, mens den fastholder den holistiske 3D-konsistens.
Udnyttelse af forudtrænede T2I eller Text-to-Image-modeller
Ideén om at udnytte forudtrænede T2I eller Text-to-Image-modeller til generering af 3D-indhold blev først introduceret af DreamFusion-rammen i 2022. DreamFusion-rammen forsøgte at påtvinge en SDS eller Score-Distillation-Sample-tab til at optimere 3D-rammen på en måde, så renderingerne ved tilfældige viewpoints ville være i overensstemmelse med tekst-betingede billedistributioner, som fortolkedes af en effektiv tekst-til-billede-diffusionsramme. Selvom DreamFusion-tilgangen leverede anstændige resultater, var der to større problemer: uklarhed og oversætning. For at tackle disse problemer implementerer nyere arbejder forskellige stadievise optimeringsstrategier i et forsøg på at forbedre 2D-destillations-taben, hvilket ultimativt fører til bedre kvalitet og realistiske 3D-genererede billeder.
Men på trods af den seneste succes med disse rammer, er de ude af stand til at matche evnen af 2D-generative rammer til at syntetisere komplekst indhold. Desuden er disse rammer ofte forhindret af “Janus-problemet”, en tilstand, hvor 3D-renderinger, der ser plausibelt ud individuelt, viser stilistiske og semantiske inkonsistenser, når de undersøges som en helhed.
For at tackle problemerne, som tidligere arbejder har mødt, udforsker DreamCraft3D-rammen muligheden for at bruge en holistisk hierarkisk 3D-indholdsgenereringspipeline og søger inspiration fra den manuelle kunstneriske proces, hvor et koncept først skrives ned i en 2D-skits, hvorefter kunstneren skulpterer den grove geometri, forfiner geometriens detaljer og maler højkvalitets-teksturer. Følgende samme tilgang, bryder DreamCraft3D-rammen den omfattende 3D-indholdsgenerering eller billedgenerering op i forskellige håndterbare trin.
I det første trin deployerer DreamCraft3D-rammen geometrisk sculptur for at producere konsistente og plausibelt 3D-geometriske former ved hjælp af 2D-billedet som reference. Desuden bruger trinet ikke kun SDS-taben til fotometriske tab og nye views ved reference-view, men rammen introducerer også en række strategier til at fremme geometrisk konsistens. Rammen søger at udnytte Zero-1-to-3, en viewpoint-betinget off-the-shelf billedoversættelsesmodel til at bruge reference-billedet til at model-distribuere nye views. Desuden overgår rammen fra implicit overflade-repræsentation til mesh-repræsentation for grov til fin geometrisk forfining.
Det andet trin i DreamCraft3D-rammen bruger en bootstrapped score-destillationsmetode til at forbedre teksturen på billedet, da den nuværende view-betingede diffusionsmodel er trænet på en begrænset mængde 3D-data, hvilket er årsagen til, at den ofte har svært ved at matche præstationen eller fideliteten af 2D-diffusionsmodeller. Takket være denne begrænsning finjusterer DreamCraft3D-rammen diffusionsmodellen i overensstemmelse med multi-view-billeder af den 3D-forekomst, der optimeres, og denne tilgang hjælper rammen med at forbedre 3D-teksturer, mens den fastholder multi-view-konsistens. Når diffusionsmodellen trænes på disse multi-view-renderinger, giver den bedre vejledning til 3D-teksturoptimering, og denne tilgang hjælper DreamCraft3D-rammen med at opnå en enorm mængde tekstur-detajler, mens den fastholder view-konsistens.

Som kan ses i billederne ovenfor, er DreamCraft3D-rammen i stand til at producere kreative 3D-billeder og indhold med realistiske teksturer og intrikate geometriske strukturer. I det første billede er kroppen af Son Goku, en anime-karakter, kombineret med hovedet af en løbende vildsvin, mens det andet billede forestiller en Beagle iført en detektivs dragt. Følgende er nogle yderligere eksempler.

DreamCraft3D: Arbejdende og Arkitektur
DreamCraft3D-rammen forsøger at udnytte en state-of-the-art T2I eller Text-to-Image generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Tilgangen giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition. Følgende billedet giver en kort oversigt over arbejdet i DreamCraft3D-rammen.

Lad os tage en detaljeret kig på de nøgle-designovervejelser for tekstforbedring og geometrisk sculptur-faser.
Geometrisk Sculptur
Geometrisk sculptur er det første trin, hvor DreamCraft3D-rammen forsøger at oprette en 3D-model, der er i overensstemmelse med udseendet af reference-billedet ved samme reference-view, mens den sikrer maksimal plausibilitet, selv under forskellige visningsvinkler. For at sikre maksimal plausibilitet bruger rammen SDS-taben til at fremme plausibelt billed-rendering for hver enkelt sampet view, som en forudtrænet diffusionsmodel kan genkende. Desuden bruger rammen også en mask-tab til at render silhuetten for at fremme scene-sparhed. Trods dette er det stadig en udfordring at fastholde udseende og semantik på tværs af bag-views konsistent, hvilket er årsagen til, at rammen anvender yderligere tilgange til at producere detaljerede og kohærente geometrier.
3D-bevidst Diffusion Prior
De 3D-optimeringsmetoder, der kun bruger per-view-supervision, er underbestemt, hvilket er den primære årsag til, at DreamCraft3D-rammen bruger Zero-1-to-3, en view-betinget diffusionsmodel, da Zero-1-to-3-rammen tilbyder en forbedret viewpoint-bevidsthed, da den er trænet på en større skala af 3D-data-aktiver. Desuden er Zero-1-to-3-rammen en finjusteret diffusionsmodel, der hallucinerer billedet i forhold til kameraets pose, givet reference-billedet.
Progressiv View-Træning
At aflede frit views direkte i 360 grad kan føre til geometriske artefakter eller inkonsistenser, som en ekstra ben på stolen, en begivenhed, der kan tilskrives den enkelt reference-billeds ambiguitet. For at tackle denne hindring udvider DreamCraft3D-rammen trænings-views progressivt, hvorefter den etablerede geometri gradvist propageres for at opnå resultater i 360 grader.
Diffusion Time Step Annealing
DreamCraft3D-rammen anvender en diffusion time step annealing-strategi i et forsøg på at tilpasse sig 3D-optimeringens coarse-to-fine-fremgang. I starten af optimeringsprocessen giver rammen prioritet til at samppe en større diffusion-tidssteg, i et forsøg på at give den globale struktur. Når rammen fortsætter med træningsprocessen, lineariserer den sampnings-området over hundredvis af iterationer. Takket være annealing-strategien formår rammen at etablere en plausibel global geometri under de tidlige optimerings-trin, før den forfiner de strukturelle detaljer.
Detaljeret Strukturel Forbedring
DreamCraft3D-rammen optimerer en implicit overflade-repræsentation initialt for at etablere en grov struktur. Rammen bruger herefter dette resultat og kombinerer det med en deformabel tetraedrisk grid eller DMTet til at initialisere en tekstureret 3D-mesh-repræsentation, der disentangler læring af tekstur og geometri. Når rammen er færdig med den strukturelle forbedring, kan modellen fastholde højfrekvente detaljer, der er erhvervet fra reference-billedet, ved at forfine teksturerne alene.
Texture Boosting ved hjælp af Bootstrapped Score Sampling
Selvom geometrisk sculptur-trinet fokuserer på at lære detaljerede og kohærente geometrier, kan det dog blurre teksturen en smule, hvilket kan være en følge af rammenens afhængighed af en 2D-prior-model, der opererer på en grov opløsning, samt den begrænsede skarphed, der tilbydes af 3D-diffusionsmodellen. Desuden opstår almindelige tekst-problemer, herunder over-mætning og over-glatning, som en følge af en stor klassifikator-fri vejledning.
Rammen bruger en VSD eller Variational Score-Distillation-tab til at forbedre realismen af teksturerne. Rammen vælger en Stable Diffusion-model under dette trin for at få højopløsnings-gradients. Desuden holder rammen tetraedrisk grid fast for at fremme realistisk rendering og optimere den overordnede struktur af mesh’en. Under læringen bruger DreamCraft3D-rammen ikke Zero-1-to-3-rammen, da den har en negativ effekt på teksturkvaliteten, og disse inkonsistente teksturer kan være tilbagevendende, hvilket kan føre til bizarre 3D-outputs.
Eksperimenter og Resultater
For at evaluere præstationen af DreamCraft3D-rammen, sammenlignes den med nuværende state-of-the-art-rammer, og de kvalitative og kvantitative resultater analyseres.
Sammenligning med Baseline-modeller
For at evaluere præstationen sammenlignes DreamCraft3D-rammen med 5 state-of-the-art-rammer, herunder DreamFusion, Magic3D, ProlificDreamer, Magic123 og Make-it-3D. Test-benchmarket består af 300 input-billeder, der er en blanding af virkelige billeder og billeder genereret af Stable Diffusion-rammen. Hvert billede i test-benchmarket har en tekstprompt, en forudsiget dybde-kort og en alpha-mask for forgrunden. Rammen henter tekstprompterne for de virkelige billeder fra en billed-underskrifts-ramme.
Kvalitativ Analyse
Følgende billede sammenligner DreamCraft3D-rammen med nuværende baseline-modeller, og som det kan ses, møder rammerne, der afhænger af tekst-til-3D-tilgangen, ofte multi-view-konsistens-problemer.

På den ene side har du ProlificDreamer-rammen, der tilbyder realistiske teksturer, men den mangler, når det kommer til at generere et plausibelt 3D-objekt. Rammer som Make-it-3D-rammen, der afhænger af Image-to-3D-metoder, kan oprette højkvalitets-frontale-views, men de kan ikke fastholde den ideelle geometri for billederne. Billederne genereret af Magic123-rammen tilbyder bedre geometrisk regularisering, men de genererer over-mættede og glattede geometriske teksturer og detaljer. Når sammenlignet med disse rammer, tilbyder DreamCraft3D-rammen, der bruger en bootstrapped score-destillationsmetode, ikke kun semantisk konsistens, men også forbedrer imagination-diversiteten.

Kvantitativ Analyse
I et forsøg på at generere overbevisende 3D-billeder, der ikke kun ligner input-reference-billedet, men også transmitterer semantik fra forskellige perspektiver konsistent, sammenlignes teknikkerne, der bruges af DreamCraft3D-rammen, med baseline-modeller, og evalueringen anvender fire metrikker: PSNR og LPIPS til at måle fidelitet ved reference-view, Contextual Distance til at bedømme pixel-niveau-kongruens og CLIP til at estimere semantisk kohærens. Resultaterne demonstreres i følgende billede.

Konklusion
I denne artikel har vi diskuteret DreamCraft3D, en hierarkisk pipeline til generering af 3D-indhold. DreamCraft3D-rammen søger at udnytte en state-of-the-art Text-to-Image (T2I) generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Denne tilgang giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition. Som følge af denne tilgang kan DreamCraft3D-rammen producere højkvalitets og konsistente 3D-aktiver med overbevisende teksturer, der kan ses fra multiple vinkler.












