AI-modeller og platforme

DreamCraft3D: Hierarkisk 3D-generering med bootstrapped diffusion prior

mm
Føj Unite.AI til dine foretrukne kilder på Google

Generative AI-modeller har været et varmt emne for diskussion inden for AI-industrien i en længere periode. Den seneste succes med 2D-generative modeller har banet vejen for de metoder, vi bruger til at oprette visuelt indhold i dag. Selvom AI-samfundet har opnået bemærkelsesværdig succes med 2D-generative modeller, er generering af 3D-indhold stadig en stor udfordring for dybe generative AI-rammer. Dette er særligt sandt, da efterspørgslen efter 3D-genereret indhold er på rekordhøjde, drevet af en bred vifte af visuelle spil, applikationer, virtuel virkelighed og selv film. Det er værd at bemærke, at selvom der findes 3D-generative AI-rammer, der leverer acceptabelt resultat for bestemte kategorier og opgaver, er de ude af stand til effektivt at generere 3D-objekter. Dette mangler kan tilskrives mangel på omfattende 3D-data til træning af rammerne. Ligeledes har udviklere foreslået at udnytte vejledningen fra forudtrænede tekst-til-billede AI-generative modeller, en tilgang, der har vist lovende resultater.

I denne artikel vil vi diskutere DreamCraft3D-rammen, en hierarkisk model til generering af 3D-indhold, der producerer kohærent og højkvalitets 3D-objekter med høj kvalitet. DreamCraft3D-rammen bruger et 2D-referencbillede til at guide geometri-sculptur-stadiet og forbedrer teksturen med fokus på at løse konsistensproblemer, der mødes af nuværende rammer eller metoder. Desuden bruger DreamCraft3D-rammen en view-afhængig diffusion-model til score-destillationsprøve, der hjælper med at skulpturere geometri, der bidrager til kohærent rendering.

Vi vil tage en nærmere kig på DreamCraft3D-rammen til generering af 3D-indhold. Desuden vil vi udforske begrebet om at udnytte forudtrænede Text-to-Image (T2I)-modeller til generering af 3D-indhold og se, hvordan DreamCraft3D-rammen søger at udnytte denne tilgang til at generere realistisk 3D-indhold.

DreamCraft3D: En introduktion

DreamCraft3D er en hierarkisk pipeline til generering af 3D-indhold. DreamCraft3D-rammen forsøger at udnytte en state-of-the-art T2I eller Text-to-Image generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Tilgangen giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition.

For geometri fokuserer DreamCraft3D-rammen stærkt på den globale 3D-struktur og multi-view konsistens, hvilket giver plads til kompromiser på de detaljerede teksturer i billederne. Når rammen har løst geometri-relaterede problemer, skifter den fokus til at optimere kohærent og realistisk tekstur ved at implementere en 3D-bevidst diffusion, der bootstrapper 3D-optimeringsmetoden. Der er to nøgle-designovervejelser for de to optimeringsfaser, nemlig den geometriske sculptur og tekstforbedring.

Med alt sagt og gjort ville det være sikkert at beskrive DreamCraft3D som en AI-generativ ramme, der udnytter en hierarkisk 3D-indholdsgenereringspipeline til at transformere 2D-billeder til deres 3D-modstykke, mens den fastholder den holistiske 3D-konsistens.

Udnyttelse af forudtrænede T2I eller Text-to-Image-modeller

Ideén om at udnytte forudtrænede T2I eller Text-to-Image-modeller til generering af 3D-indhold blev først introduceret af DreamFusion-rammen i 2022. DreamFusion-rammen forsøgte at påtvinge en SDS eller Score-Distillation-Sample-tab til at optimere 3D-rammen på en måde, så renderingerne ved tilfældige viewpoints ville være i overensstemmelse med tekst-betingede billedistributioner, som fortolkedes af en effektiv tekst-til-billede-diffusionsramme. Selvom DreamFusion-tilgangen leverede anstændige resultater, var der to større problemer: uklarhed og oversætning. For at tackle disse problemer implementerer nyere arbejder forskellige stadievise optimeringsstrategier i et forsøg på at forbedre 2D-destillations-taben, hvilket ultimativt fører til bedre kvalitet og realistiske 3D-genererede billeder.

Men på trods af den seneste succes med disse rammer, er de ude af stand til at matche evnen af 2D-generative rammer til at syntetisere komplekst indhold. Desuden er disse rammer ofte forhindret af “Janus-problemet”, en tilstand, hvor 3D-renderinger, der ser plausibelt ud individuelt, viser stilistiske og semantiske inkonsistenser, når de undersøges som en helhed.

For at tackle problemerne, som tidligere arbejder har mødt, udforsker DreamCraft3D-rammen muligheden for at bruge en holistisk hierarkisk 3D-indholdsgenereringspipeline og søger inspiration fra den manuelle kunstneriske proces, hvor et koncept først skrives ned i en 2D-skits, hvorefter kunstneren skulpterer den grove geometri, forfiner geometriens detaljer og maler højkvalitets-teksturer. Følgende samme tilgang, bryder DreamCraft3D-rammen den omfattende 3D-indholdsgenerering eller billedgenerering op i forskellige håndterbare trin.

I det første trin deployerer DreamCraft3D-rammen geometrisk sculptur for at producere konsistente og plausibelt 3D-geometriske former ved hjælp af 2D-billedet som reference. Desuden bruger trinet ikke kun SDS-taben til fotometriske tab og nye views ved reference-view, men rammen introducerer også en række strategier til at fremme geometrisk konsistens. Rammen søger at udnytte Zero-1-to-3, en viewpoint-betinget off-the-shelf billedoversættelsesmodel til at bruge reference-billedet til at model-distribuere nye views. Desuden overgår rammen fra implicit overflade-repræsentation til mesh-repræsentation for grov til fin geometrisk forfining.

Det andet trin i DreamCraft3D-rammen bruger en bootstrapped score-destillationsmetode til at forbedre teksturen på billedet, da den nuværende view-betingede diffusionsmodel er trænet på en begrænset mængde 3D-data, hvilket er årsagen til, at den ofte har svært ved at matche præstationen eller fideliteten af 2D-diffusionsmodeller. Takket være denne begrænsning finjusterer DreamCraft3D-rammen diffusionsmodellen i overensstemmelse med multi-view-billeder af den 3D-forekomst, der optimeres, og denne tilgang hjælper rammen med at forbedre 3D-teksturer, mens den fastholder multi-view-konsistens. Når diffusionsmodellen trænes på disse multi-view-renderinger, giver den bedre vejledning til 3D-teksturoptimering, og denne tilgang hjælper DreamCraft3D-rammen med at opnå en enorm mængde tekstur-detajler, mens den fastholder view-konsistens.

Som kan ses i billederne ovenfor, er DreamCraft3D-rammen i stand til at producere kreative 3D-billeder og indhold med realistiske teksturer og intrikate geometriske strukturer. I det første billede er kroppen af Son Goku, en anime-karakter, kombineret med hovedet af en løbende vildsvin, mens det andet billede forestiller en Beagle iført en detektivs dragt. Følgende er nogle yderligere eksempler.

DreamCraft3D: Arbejdende og Arkitektur

DreamCraft3D-rammen forsøger at udnytte en state-of-the-art T2I eller Text-to-Image generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Tilgangen giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition. Følgende billedet giver en kort oversigt over arbejdet i DreamCraft3D-rammen.

Lad os tage en detaljeret kig på de nøgle-designovervejelser for tekstforbedring og geometrisk sculptur-faser.

Geometrisk Sculptur

Geometrisk sculptur er det første trin, hvor DreamCraft3D-rammen forsøger at oprette en 3D-model, der er i overensstemmelse med udseendet af reference-billedet ved samme reference-view, mens den sikrer maksimal plausibilitet, selv under forskellige visningsvinkler. For at sikre maksimal plausibilitet bruger rammen SDS-taben til at fremme plausibelt billed-rendering for hver enkelt sampet view, som en forudtrænet diffusionsmodel kan genkende. Desuden bruger rammen også en mask-tab til at render silhuetten for at fremme scene-sparhed. Trods dette er det stadig en udfordring at fastholde udseende og semantik på tværs af bag-views konsistent, hvilket er årsagen til, at rammen anvender yderligere tilgange til at producere detaljerede og kohærente geometrier.

3D-bevidst Diffusion Prior

De 3D-optimeringsmetoder, der kun bruger per-view-supervision, er underbestemt, hvilket er den primære årsag til, at DreamCraft3D-rammen bruger Zero-1-to-3, en view-betinget diffusionsmodel, da Zero-1-to-3-rammen tilbyder en forbedret viewpoint-bevidsthed, da den er trænet på en større skala af 3D-data-aktiver. Desuden er Zero-1-to-3-rammen en finjusteret diffusionsmodel, der hallucinerer billedet i forhold til kameraets pose, givet reference-billedet.

Progressiv View-Træning

At aflede frit views direkte i 360 grad kan føre til geometriske artefakter eller inkonsistenser, som en ekstra ben på stolen, en begivenhed, der kan tilskrives den enkelt reference-billeds ambiguitet. For at tackle denne hindring udvider DreamCraft3D-rammen trænings-views progressivt, hvorefter den etablerede geometri gradvist propageres for at opnå resultater i 360 grader.

Diffusion Time Step Annealing

DreamCraft3D-rammen anvender en diffusion time step annealing-strategi i et forsøg på at tilpasse sig 3D-optimeringens coarse-to-fine-fremgang. I starten af optimeringsprocessen giver rammen prioritet til at samppe en større diffusion-tidssteg, i et forsøg på at give den globale struktur. Når rammen fortsætter med træningsprocessen, lineariserer den sampnings-området over hundredvis af iterationer. Takket være annealing-strategien formår rammen at etablere en plausibel global geometri under de tidlige optimerings-trin, før den forfiner de strukturelle detaljer.

Detaljeret Strukturel Forbedring

DreamCraft3D-rammen optimerer en implicit overflade-repræsentation initialt for at etablere en grov struktur. Rammen bruger herefter dette resultat og kombinerer det med en deformabel tetraedrisk grid eller DMTet til at initialisere en tekstureret 3D-mesh-repræsentation, der disentangler læring af tekstur og geometri. Når rammen er færdig med den strukturelle forbedring, kan modellen fastholde højfrekvente detaljer, der er erhvervet fra reference-billedet, ved at forfine teksturerne alene.

Texture Boosting ved hjælp af Bootstrapped Score Sampling

Selvom geometrisk sculptur-trinet fokuserer på at lære detaljerede og kohærente geometrier, kan det dog blurre teksturen en smule, hvilket kan være en følge af rammenens afhængighed af en 2D-prior-model, der opererer på en grov opløsning, samt den begrænsede skarphed, der tilbydes af 3D-diffusionsmodellen. Desuden opstår almindelige tekst-problemer, herunder over-mætning og over-glatning, som en følge af en stor klassifikator-fri vejledning.

Rammen bruger en VSD eller Variational Score-Distillation-tab til at forbedre realismen af teksturerne. Rammen vælger en Stable Diffusion-model under dette trin for at få højopløsnings-gradients. Desuden holder rammen tetraedrisk grid fast for at fremme realistisk rendering og optimere den overordnede struktur af mesh’en. Under læringen bruger DreamCraft3D-rammen ikke Zero-1-to-3-rammen, da den har en negativ effekt på teksturkvaliteten, og disse inkonsistente teksturer kan være tilbagevendende, hvilket kan føre til bizarre 3D-outputs.

Eksperimenter og Resultater

For at evaluere præstationen af DreamCraft3D-rammen, sammenlignes den med nuværende state-of-the-art-rammer, og de kvalitative og kvantitative resultater analyseres.

Sammenligning med Baseline-modeller

For at evaluere præstationen sammenlignes DreamCraft3D-rammen med 5 state-of-the-art-rammer, herunder DreamFusion, Magic3D, ProlificDreamer, Magic123 og Make-it-3D. Test-benchmarket består af 300 input-billeder, der er en blanding af virkelige billeder og billeder genereret af Stable Diffusion-rammen. Hvert billede i test-benchmarket har en tekstprompt, en forudsiget dybde-kort og en alpha-mask for forgrunden. Rammen henter tekstprompterne for de virkelige billeder fra en billed-underskrifts-ramme.

Kvalitativ Analyse

Følgende billede sammenligner DreamCraft3D-rammen med nuværende baseline-modeller, og som det kan ses, møder rammerne, der afhænger af tekst-til-3D-tilgangen, ofte multi-view-konsistens-problemer.

På den ene side har du ProlificDreamer-rammen, der tilbyder realistiske teksturer, men den mangler, når det kommer til at generere et plausibelt 3D-objekt. Rammer som Make-it-3D-rammen, der afhænger af Image-to-3D-metoder, kan oprette højkvalitets-frontale-views, men de kan ikke fastholde den ideelle geometri for billederne. Billederne genereret af Magic123-rammen tilbyder bedre geometrisk regularisering, men de genererer over-mættede og glattede geometriske teksturer og detaljer. Når sammenlignet med disse rammer, tilbyder DreamCraft3D-rammen, der bruger en bootstrapped score-destillationsmetode, ikke kun semantisk konsistens, men også forbedrer imagination-diversiteten.

Kvantitativ Analyse

I et forsøg på at generere overbevisende 3D-billeder, der ikke kun ligner input-reference-billedet, men også transmitterer semantik fra forskellige perspektiver konsistent, sammenlignes teknikkerne, der bruges af DreamCraft3D-rammen, med baseline-modeller, og evalueringen anvender fire metrikker: PSNR og LPIPS til at måle fidelitet ved reference-view, Contextual Distance til at bedømme pixel-niveau-kongruens og CLIP til at estimere semantisk kohærens. Resultaterne demonstreres i følgende billede.

Konklusion

I denne artikel har vi diskuteret DreamCraft3D, en hierarkisk pipeline til generering af 3D-indhold. DreamCraft3D-rammen søger at udnytte en state-of-the-art Text-to-Image (T2I) generativ ramme til at oprette højkvalitets 2D-billeder ved hjælp af en tekstprompt. Denne tilgang giver DreamCraft3D-rammen mulighed for at maksimere kapaciteten af state-of-the-art 2D-diffusionsmodeller til at repræsentere de visuelle semantikker, som beskrevet i tekstprompten, mens den fastholder den kreative frihed, der tilbydes af disse 2D AI-generative rammer. Billedet genereres herefter til 3D med hjælp af kaskaderet geometrisk tekstforbedring og geometrisk sculptur-faser, og specialiserede teknikker anvendes på hvert trin med hjælp af problemdekomposition. Som følge af denne tilgang kan DreamCraft3D-rammen producere højkvalitets og konsistente 3D-aktiver med overbevisende teksturer, der kan ses fra multiple vinkler.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.