AI-modeller og plattformer
DreamCraft3D: Hierarkisk 3D-generering med Bootstrapped Diffusion Prior
Generative AI-modeller har vært et varmt emne for diskusjon innen AI-bransjen i en stund. Den nylige suksessen med 2D-generative modeller har banet vei for metodene vi bruker til å lage visuell innhold i dag. Selv om AI-samfunnet har oppnådd bemerkelsesverdig suksess med 2D-generative modeller, er generering av 3D-innhold fortsatt en stor utfordring for dypt generative AI-rammeverk. Dette er særlig sant ettersom etterspørselen etter 3D-generert innhold når en rekordhøy, drevet av en rekke visuelle spill, applikasjoner, virtuell virkelighet og selv film. Det er verdt å merke seg at selv om det finnes 3D-generative AI-rammeverk som leverer akseptable resultater for bestemte kategorier og oppgaver, er de ikke i stand til å effektivt generere 3D-objekter. Dette manglet kan tilskrives mangelen på omfattende 3D-data for å trene rammeverkene. Nylig har utviklere foreslått å utnytte veiledningen som tilbys av forhånds trenede tekst-til-bilde AI-generative modeller, en tilnærming som har vist lovende resultater.
I denne artikkelen vil vi diskutere DreamCraft3D-rammeverket, et hierarkisk modell for generering av 3D-innhold som produserer kohesive og høykvalitets 3D-objekter av høy kvalitet. DreamCraft3D-rammeverket bruker et 2D-referansebilde for å guide geometri-skapingsfasen, og forbedrer teksturen med fokus på å løse konsistensproblemer som møtes av nåværende rammeverk eller metoder. I tillegg bruker DreamCraft3D-rammeverket en visningsavhengig diffusjonsmodell for score-destillasjonssampling, som hjelper til å skape geometri som bidrar til kohesiv rendering.
Vi vil ta en nærmere titt på DreamCraft3D-rammeverket for generering av 3D-innhold. Videre vil vi utforske konseptet med å utnytte forhånds trenede Text-to-Image (T2I)-modeller for generering av 3D-innhold og se hvordan DreamCraft3D-rammeverket søker å utnytte denne tilnærmingen for å generere realistisk 3D-innhold.
DreamCraft3D: En Introduksjon
DreamCraft3D er en hierarkisk pipeline for generering av 3D-innhold. DreamCraft3D-rammeverket søker å utnytte et state-of-the-art T2I eller tekst-til-bilde generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet.
For geometri, fokuserer DreamCraft3D-rammeverket tungt på den globale 3D-strukturen og multi-views-konsistens, og åpner dermed for kompromisser på detaljerteksturene i bildene. Når rammeverket har fjernet geometri-relaterte problemer, skifter det fokus til å optimere kohesive og realistiske teksturer ved å implementere en 3D-bevisst diffusjon som bootstrapper 3D-optimieringsmetoden. Det finnes to nøkkel-designoverveielser for de to optimieringsfasene, nemlig den geometriske skapingsfasen og tekstforbedringsfasen.
Med alt som er sagt, ville det være trygt å beskrive DreamCraft3D som et AI-generativt rammeverk som utnytter en hierarkisk 3D-innholdsgenereringspipeline for å transformere 2D-bilder til deres 3D-ekvivalenter, samtidig som det beholder den holistiske 3D-konsistensen.
Utnyttelse av Forhånds Trenede T2I eller Tekst-til-Bilde Modeller
Idéen om å utnytte forhånds trenede T2I eller tekst-til-bilde modeller for generering av 3D-innhold ble først introdusert av DreamFusion-rammeverket i 2022. DreamFusion-rammeverket forsøkte å påtvinge en SDS eller Score-Destillasjon Sample-tap for å optimere 3D-rammeverket på en måte som gjorde at renderinger fra tilfeldige visninger ville sammenfalle med tekst-betingede bildefordelinger som tolket av en effektiv tekst-til-bilde diffusjonsmodell. Selv om DreamFusion-tilnærmingen leverte anstendige resultater, var det to store problemer: uskarphet og overmetning. For å takle disse problemene, implementerer nyere arbeid forskjellige fasewise-optimieringsstrategier i et forsøk på å forbedre 2D-destillasjons-tapet, noe som til slutt fører til bedre kvalitet og realistiske 3D-genererte bilder.
Men, til tross for den nylige suksessen til disse rammeverkene, er de ikke i stand til å matche evnen til 2D-generative rammeverk til å syntetisere kompleks innhold. I tillegg er disse rammeverkene ofte plaget av “Janus-problemet”, en tilstand hvor 3D-renderinger som ser ut til å være plausibelt individuelt, viser stilistiske og semantiske inkonsistenser når de undersøkes som en helhet.
For å takle problemene som møtes av tidligere arbeid, utforsker DreamCraft3D-rammeverket muligheten for å bruke en holistisk hierarkisk 3D-innholdsgenereringspipeline, og søker inspirasjon fra den manuelle kunstneriske prosessen hvor et konsept først skrives ned i en 2D-utkast, etterfulgt av at kunstneren skaper den grove geometrien, finjusterer de geometriske detaljene og maler høykvalitets-teksturer. Følger samme tilnærming, DreamCraft3D-rammeverket bryter ned den omfattende 3D-innholdsgenererings- eller bildegenereringsoppgaven i flere håndterbare steg. Det starter med å generere et høykvalitets 2D-bilde ved hjelp av en tekstprompt, og går deretter videre med å bruke tekstforbedring og geometrisk skaping for å løfte bildet til 3D-stadiet. Å splitte prosessen i påfølgende steg hjelper DreamCraft3D-rammeverket til å maksimere potensialet for hierarkisk generering, noe som til slutt resulterer i overlegen kvalitet 3D-bildegenerering.
I den første fasen, deployerer DreamCraft3D-rammeverket geometrisk skaping for å produsere konsistente og plausibele 3D-geometriske former ved hjelp av 2D-bildet som referanse. I tillegg til å bruke SDS-tap for fotometriske tap og nye visninger ved referansevisningen, introduserer rammeverket også en rekke strategier for å fremme geometrisk konsistens. Rammeverket søker å utnytte Zero-1-to-3, en visningsbetinget off-the-shelf-bildeoversettelsesmodell, for å bruke referansebildet til å modellere fordelingen av nye visninger. I tillegg går rammeverket over fra implisitt overflate-representasjon til mesh-representasjon for grov til fin geometrisk finjustering.
Den andre fasen av DreamCraft3D-rammeverket bruker en bootstrapped score-destillasjonsmetode for å forbedre teksturen på bildet, da nåværende visningsbetingede diffusjonsmodeller er trenet på en begrenset mengde 3D-data, noe som gjør at de ofte sliter med å matche ytelsen eller trofastheten til 2D-diffusjonsmodeller. Takket være denne begrensningen, finjusterer DreamCraft3D-rammeverket diffusjonsmodellen i henhold til multi-views-bilder av 3D-eksempelet som optimeres, og denne tilnærmingen hjelper rammeverket til å augmentere 3D-teksturer samtidig som det beholder multi-views-konsistens. Når diffusjonsmodellen trener på disse multi-views-renderingene, gir den bedre veiledning for 3D-teksturoptimiering, og denne tilnærmingen hjelper DreamCraft3D-rammeverket til å oppnå en usedvanlig mengde teksturdetaljer samtidig som det beholder visningskonsistens.

Som kan observeres i bildene over, er DreamCraft3D-rammeverket i stand til å produsere kreative 3D-bilder og innhold med realistiske teksturer og intrikate geometriske strukturer. I det første bildet, er kroppen av Son Goku, en anime-figur blandet med hodet av en løpende villsvin, mens det andre bildet avbilder en Beagle kledd i en detektiv-drakt. Følgende er noen ekstra eksempler.

DreamCraft3D: Arbeid og Arkitektur
DreamCraft3D-rammeverket søker å utnytte et state-of-the-art T2I eller tekst-til-bilde generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet. Følgende bildet summerer kort opp arbeidet til DreamCraft3D-rammeverket.

La oss ta en detaljert titt på de nøkkel-designoverveielser for tekstforbedrings- og geometrisk skapingsfasene.
Geometrisk Skaping
Geometrisk skaping er den første fasen hvor DreamCraft3D-rammeverket søker å skape en 3D-modell som sammenfaller med utseendet til referansebildet ved samme referansevisning, samtidig som det sikrer maksimal plausibilitet selv under forskjellige visninger. For å sikre maksimal plausibilitet, bruker rammeverket SDS-tap for å fremme plausibelt bilde-rendering for hver enkelt samplet visning som en forhånds trenet diffusjonsmodell kan gjenkjenne. I tillegg til å bruke veiledning fra referansebildet effektivt, straffer rammeverket også fotometriske forskjeller mellom referanse- og renderede bilder ved referansevisningen, og tapet beregnes kun innenfor forgrunnsområdet til visningen. I tillegg til å fremme scene-sparsomhet, implementerer rammeverket også en mask-tap som renderer silhuetten. Likevel forblir det å beholde utseende og semantikk over bak-visninger konsistent en utfordring, noe som er grunnen til at rammeverket bruker ekstra tilnærminger for å produsere detaljerte og kohesive geometrier.
3D-Bevisst Diffusjon Prior
De 3D-optimieringsmetodene som bruker per-visnings-supervisjon alene er under-begrenset, noe som er den primære grunnen til at DreamCraft3D-rammeverket bruker Zero-1-to-3, en visningsbetinget diffusjonsmodell, som Zero-1-to-3-rammeverket tilbyr en forbedret visningsbevissthet siden det har blitt trenet på en større skala av 3D-data-ressurser. I tillegg er Zero-1-to-3-rammeverket en finjustert diffusjonsmodell som hallucinerer bildet i forhold til kamera-posen gitt referansebildet.
Progressiv Visnings-trening
Å kunne rendre frie visninger direkte i 360 grader kan føre til geometriske artefakter eller inkonsistenser, som for eksempel en ekstra bein på stolen, en hendelse som kan tilskrives ambiguiteten til en enkelt referansebilde. For å takle denne hindringen, utvider DreamCraft3D-rammeverket treningvisningene progressivt, og den etablerte geometrien blir deretter gradvis propagert for å oppnå resultater i 360 grader.
Diffusjonstids-steg-Annealing
DreamCraft3D-rammeverket bruker en diffusjonstids-steg-annealing-strategi i et forsøk på å sammenfalle med 3D-optimieringens grov-til-fin-progresjon. I begynnelsen av optimeringsprosessen, gir rammeverket prioritet til å sampel en større diffusjonstids-steg, i et forsøk på å gi den globale strukturen. Etter hvert som rammeverket fortsetter med treningprosessen, lineært annealer det sampel-området over løpet av hundrevis av iterasjoner. Takket være annealing-strategien, klarer rammeverket å etablere en plausibel global geometri under tidlige optimeringssteg før det finjusterer de strukturelle detaljene.
Detaljert Strukturell Forbedring
DreamCraft3D-rammeverket optimaliserer en implisitt overflate-representasjon initialt for å etablere en grov struktur. Rammeverket bruker deretter dette resultatet og kobler det med en deformerbar tetraedrisk grid eller DMTet for å initialisere en teksturert 3D-mesh-representasjon, som skiller læring av tekstur og geometri. Når rammeverket er ferdig med strukturell forbedring, er modellen i stand til å beholde høyfrekvente detaljer fra referansebildet ved å finjustere teksturene alene.
Tekstforbedring ved hjelp av Bootstrapped Score Sampling
Selv om geometrisk skapingsfasen legger vekt på å lære detaljerte og kohesive geometrier, kan den også uskarpe teksturen til en viss grad, noe som kan være et resultat av rammeverkets avhengighet av en 2D-prior-modell som opererer på en grov oppløsning, samt begrensningen på skarphet som tilbys av 3D-diffusjonsmodellen. I tillegg oppstår vanlige tekst-problemer, inkludert over-metning og over-glatting, som et resultat av en stor klassifikator-fri veiledning.
Rammeverket bruker en VSD eller Variational Score-Destillasjons-tap for å forbedre realisme i teksturene. Rammeverket velger en Stabil Diffusjonsmodell under denne fasen for å få høyoppløste gradienter. I tillegg holder rammeverket tetraedrisk grid fast for å fremme realistisk rendering og optimalisere den overordnede strukturen til mesh-en. Under læringen, bruker DreamCraft3D-rammeverket ikke Zero-1-to-3-rammeverket, da det har en negativ effekt på teksturkvaliteten, og disse inkonsistente teksturene kan være gjentakende, noe som kan føre til merkelige 3D-utdata.
Eksperimenter og Resultater
For å evaluere ytelsen til DreamCraft3D-rammeverket, sammenlignes det med nåværende state-of-the-art-rammeverk, og de kvalitative og kvantitative resultater analyseres.
Sammenligning med Baseline-modeller
For å evaluere ytelsen, sammenlignes DreamCraft3D-rammeverket med 5 state-of-the-art-rammeverk, inkludert DreamFusion, Magic3D, ProlificDreamer, Magic123 og Make-it-3D. Test-benchmarket består av 300 inndata-bilder som er en blanding av virkelige bilder og bilder generert av Stabil Diffusjons-rammeverket. Hver bilde i test-benchmarket har en tekstprompt, en predikert dybde-kart og en alpha-maske for forgrunnen. Rammeverket henter tekstpromptene for virkelige bilder fra et bilde-underskrifts-rammeverk.
Kvalitativ Analyse
Følgende bilde sammenligner DreamCraft3D-rammeverket med nåværende baseline-modeller, og som kan ses, møter rammeverkene som avhenger av tekst-til-3D-tilnærmingen ofte multi-views-konsistens-problemer.

På den ene siden har du ProlificDreamer-rammeverket som tilbyr realistiske teksturer, men det kommer til kort når det gjelder å generere et plausibelt 3D-objekt. Rammeverk som Make-it-3D-rammeverket som avhenger av bilde-til-3D-metoder, klarer å skape høykvalitets fron-views, men de kan ikke beholde den ideelle geometrien for bildene. Bildene generert av Magic123-rammeverket tilbyr bedre geometrisk regularisering, men de genererer over-mettede og glatte geometriske teksturer og detaljer. I sammenligning med disse rammeverkene, tilbyr DreamCraft3D-rammeverket, som bruker en bootstrapped score-destillasjonsmetode, ikke bare semantisk konsistens, men også forbedrer fantasien diversitet.

Kvantitativ Analyse
I et forsøk på å generere overbevisende 3D-bilder som ikke bare ligner inndata-referansebildet, men også overfører semantikk fra forskjellige perspektiver konsistent, sammenlignes teknikken brukt av DreamCraft3D-rammeverket med baseline-modeller, og evalueringen bruker fire metrikker: PSNR og LPIPS for å måle trofasthet ved referansevisningen, Contextual Distance for å vurdere piksel-nivå-kongruens, og CLIP for å estimere semantisk kohesjon. Resultatene demonstreres i følgende bilde.

Konklusjon
I denne artikkelen har vi diskutert DreamCraft3D, en hierarkisk pipeline for generering av 3D-innhold. DreamCraft3D-rammeverket søker å utnytte et state-of-the-art Text-to-Image (T2I) generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Denne tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet. Som et resultat av denne tilnærmingen, kan DreamCraft3D-rammeverket produsere høykvalitets og konsistente 3D-ressurser med overbevisende teksturer, som kan vises fra flere vinkler.












