AI-modeller og plattformer

DreamCraft3D: Hierarkisk 3D-generering med Bootstrapped Diffusion Prior

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Generative AI-modeller har vært et varmt emne for diskusjon innen AI-bransjen i en stund. Den nylige suksessen med 2D-generative modeller har banet vei for metodene vi bruker til å lage visuell innhold i dag. Selv om AI-samfunnet har oppnådd bemerkelsesverdig suksess med 2D-generative modeller, er generering av 3D-innhold fortsatt en stor utfordring for dypt generative AI-rammeverk. Dette er særlig sant ettersom etterspørselen etter 3D-generert innhold når en rekordhøy, drevet av en rekke visuelle spill, applikasjoner, virtuell virkelighet og selv film. Det er verdt å merke seg at selv om det finnes 3D-generative AI-rammeverk som leverer akseptable resultater for bestemte kategorier og oppgaver, er de ikke i stand til å effektivt generere 3D-objekter. Dette manglet kan tilskrives mangelen på omfattende 3D-data for å trene rammeverkene. Nylig har utviklere foreslått å utnytte veiledningen som tilbys av forhånds trenede tekst-til-bilde AI-generative modeller, en tilnærming som har vist lovende resultater.

I denne artikkelen vil vi diskutere DreamCraft3D-rammeverket, et hierarkisk modell for generering av 3D-innhold som produserer kohesive og høykvalitets 3D-objekter av høy kvalitet. DreamCraft3D-rammeverket bruker et 2D-referansebilde for å guide geometri-skapingsfasen, og forbedrer teksturen med fokus på å løse konsistensproblemer som møtes av nåværende rammeverk eller metoder. I tillegg bruker DreamCraft3D-rammeverket en visningsavhengig diffusjonsmodell for score-destillasjonssampling, som hjelper til å skape geometri som bidrar til kohesiv rendering.

Vi vil ta en nærmere titt på DreamCraft3D-rammeverket for generering av 3D-innhold. Videre vil vi utforske konseptet med å utnytte forhånds trenede Text-to-Image (T2I)-modeller for generering av 3D-innhold og se hvordan DreamCraft3D-rammeverket søker å utnytte denne tilnærmingen for å generere realistisk 3D-innhold.

DreamCraft3D: En Introduksjon

DreamCraft3D er en hierarkisk pipeline for generering av 3D-innhold. DreamCraft3D-rammeverket søker å utnytte et state-of-the-art T2I eller tekst-til-bilde generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet.

For geometri, fokuserer DreamCraft3D-rammeverket tungt på den globale 3D-strukturen og multi-views-konsistens, og åpner dermed for kompromisser på detaljerteksturene i bildene. Når rammeverket har fjernet geometri-relaterte problemer, skifter det fokus til å optimere kohesive og realistiske teksturer ved å implementere en 3D-bevisst diffusjon som bootstrapper 3D-optimieringsmetoden. Det finnes to nøkkel-designoverveielser for de to optimieringsfasene, nemlig den geometriske skapingsfasen og tekstforbedringsfasen.

Med alt som er sagt, ville det være trygt å beskrive DreamCraft3D som et AI-generativt rammeverk som utnytter en hierarkisk 3D-innholdsgenereringspipeline for å transformere 2D-bilder til deres 3D-ekvivalenter, samtidig som det beholder den holistiske 3D-konsistensen.

Utnyttelse av Forhånds Trenede T2I eller Tekst-til-Bilde Modeller

Idéen om å utnytte forhånds trenede T2I eller tekst-til-bilde modeller for generering av 3D-innhold ble først introdusert av DreamFusion-rammeverket i 2022. DreamFusion-rammeverket forsøkte å påtvinge en SDS eller Score-Destillasjon Sample-tap for å optimere 3D-rammeverket på en måte som gjorde at renderinger fra tilfeldige visninger ville sammenfalle med tekst-betingede bildefordelinger som tolket av en effektiv tekst-til-bilde diffusjonsmodell. Selv om DreamFusion-tilnærmingen leverte anstendige resultater, var det to store problemer: uskarphet og overmetning. For å takle disse problemene, implementerer nyere arbeid forskjellige fasewise-optimieringsstrategier i et forsøk på å forbedre 2D-destillasjons-tapet, noe som til slutt fører til bedre kvalitet og realistiske 3D-genererte bilder.

Men, til tross for den nylige suksessen til disse rammeverkene, er de ikke i stand til å matche evnen til 2D-generative rammeverk til å syntetisere kompleks innhold. I tillegg er disse rammeverkene ofte plaget av “Janus-problemet”, en tilstand hvor 3D-renderinger som ser ut til å være plausibelt individuelt, viser stilistiske og semantiske inkonsistenser når de undersøkes som en helhet.

For å takle problemene som møtes av tidligere arbeid, utforsker DreamCraft3D-rammeverket muligheten for å bruke en holistisk hierarkisk 3D-innholdsgenereringspipeline, og søker inspirasjon fra den manuelle kunstneriske prosessen hvor et konsept først skrives ned i en 2D-utkast, etterfulgt av at kunstneren skaper den grove geometrien, finjusterer de geometriske detaljene og maler høykvalitets-teksturer. Følger samme tilnærming, DreamCraft3D-rammeverket bryter ned den omfattende 3D-innholdsgenererings- eller bildegenereringsoppgaven i flere håndterbare steg. Det starter med å generere et høykvalitets 2D-bilde ved hjelp av en tekstprompt, og går deretter videre med å bruke tekstforbedring og geometrisk skaping for å løfte bildet til 3D-stadiet. Å splitte prosessen i påfølgende steg hjelper DreamCraft3D-rammeverket til å maksimere potensialet for hierarkisk generering, noe som til slutt resulterer i overlegen kvalitet 3D-bildegenerering.

I den første fasen, deployerer DreamCraft3D-rammeverket geometrisk skaping for å produsere konsistente og plausibele 3D-geometriske former ved hjelp av 2D-bildet som referanse. I tillegg til å bruke SDS-tap for fotometriske tap og nye visninger ved referansevisningen, introduserer rammeverket også en rekke strategier for å fremme geometrisk konsistens. Rammeverket søker å utnytte Zero-1-to-3, en visningsbetinget off-the-shelf-bildeoversettelsesmodell, for å bruke referansebildet til å modellere fordelingen av nye visninger. I tillegg går rammeverket over fra implisitt overflate-representasjon til mesh-representasjon for grov til fin geometrisk finjustering.

Den andre fasen av DreamCraft3D-rammeverket bruker en bootstrapped score-destillasjonsmetode for å forbedre teksturen på bildet, da nåværende visningsbetingede diffusjonsmodeller er trenet på en begrenset mengde 3D-data, noe som gjør at de ofte sliter med å matche ytelsen eller trofastheten til 2D-diffusjonsmodeller. Takket være denne begrensningen, finjusterer DreamCraft3D-rammeverket diffusjonsmodellen i henhold til multi-views-bilder av 3D-eksempelet som optimeres, og denne tilnærmingen hjelper rammeverket til å augmentere 3D-teksturer samtidig som det beholder multi-views-konsistens. Når diffusjonsmodellen trener på disse multi-views-renderingene, gir den bedre veiledning for 3D-teksturoptimiering, og denne tilnærmingen hjelper DreamCraft3D-rammeverket til å oppnå en usedvanlig mengde teksturdetaljer samtidig som det beholder visningskonsistens.

Som kan observeres i bildene over, er DreamCraft3D-rammeverket i stand til å produsere kreative 3D-bilder og innhold med realistiske teksturer og intrikate geometriske strukturer. I det første bildet, er kroppen av Son Goku, en anime-figur blandet med hodet av en løpende villsvin, mens det andre bildet avbilder en Beagle kledd i en detektiv-drakt. Følgende er noen ekstra eksempler.

DreamCraft3D: Arbeid og Arkitektur

DreamCraft3D-rammeverket søker å utnytte et state-of-the-art T2I eller tekst-til-bilde generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet. Følgende bildet summerer kort opp arbeidet til DreamCraft3D-rammeverket.

La oss ta en detaljert titt på de nøkkel-designoverveielser for tekstforbedrings- og geometrisk skapingsfasene.

Geometrisk Skaping

Geometrisk skaping er den første fasen hvor DreamCraft3D-rammeverket søker å skape en 3D-modell som sammenfaller med utseendet til referansebildet ved samme referansevisning, samtidig som det sikrer maksimal plausibilitet selv under forskjellige visninger. For å sikre maksimal plausibilitet, bruker rammeverket SDS-tap for å fremme plausibelt bilde-rendering for hver enkelt samplet visning som en forhånds trenet diffusjonsmodell kan gjenkjenne. I tillegg til å bruke veiledning fra referansebildet effektivt, straffer rammeverket også fotometriske forskjeller mellom referanse- og renderede bilder ved referansevisningen, og tapet beregnes kun innenfor forgrunnsområdet til visningen. I tillegg til å fremme scene-sparsomhet, implementerer rammeverket også en mask-tap som renderer silhuetten. Likevel forblir det å beholde utseende og semantikk over bak-visninger konsistent en utfordring, noe som er grunnen til at rammeverket bruker ekstra tilnærminger for å produsere detaljerte og kohesive geometrier.

3D-Bevisst Diffusjon Prior

De 3D-optimieringsmetodene som bruker per-visnings-supervisjon alene er under-begrenset, noe som er den primære grunnen til at DreamCraft3D-rammeverket bruker Zero-1-to-3, en visningsbetinget diffusjonsmodell, som Zero-1-to-3-rammeverket tilbyr en forbedret visningsbevissthet siden det har blitt trenet på en større skala av 3D-data-ressurser. I tillegg er Zero-1-to-3-rammeverket en finjustert diffusjonsmodell som hallucinerer bildet i forhold til kamera-posen gitt referansebildet.

Progressiv Visnings-trening

Å kunne rendre frie visninger direkte i 360 grader kan føre til geometriske artefakter eller inkonsistenser, som for eksempel en ekstra bein på stolen, en hendelse som kan tilskrives ambiguiteten til en enkelt referansebilde. For å takle denne hindringen, utvider DreamCraft3D-rammeverket treningvisningene progressivt, og den etablerte geometrien blir deretter gradvis propagert for å oppnå resultater i 360 grader.

Diffusjonstids-steg-Annealing

DreamCraft3D-rammeverket bruker en diffusjonstids-steg-annealing-strategi i et forsøk på å sammenfalle med 3D-optimieringens grov-til-fin-progresjon. I begynnelsen av optimeringsprosessen, gir rammeverket prioritet til å sampel en større diffusjonstids-steg, i et forsøk på å gi den globale strukturen. Etter hvert som rammeverket fortsetter med treningprosessen, lineært annealer det sampel-området over løpet av hundrevis av iterasjoner. Takket være annealing-strategien, klarer rammeverket å etablere en plausibel global geometri under tidlige optimeringssteg før det finjusterer de strukturelle detaljene.

Detaljert Strukturell Forbedring

DreamCraft3D-rammeverket optimaliserer en implisitt overflate-representasjon initialt for å etablere en grov struktur. Rammeverket bruker deretter dette resultatet og kobler det med en deformerbar tetraedrisk grid eller DMTet for å initialisere en teksturert 3D-mesh-representasjon, som skiller læring av tekstur og geometri. Når rammeverket er ferdig med strukturell forbedring, er modellen i stand til å beholde høyfrekvente detaljer fra referansebildet ved å finjustere teksturene alene.

Tekstforbedring ved hjelp av Bootstrapped Score Sampling

Selv om geometrisk skapingsfasen legger vekt på å lære detaljerte og kohesive geometrier, kan den også uskarpe teksturen til en viss grad, noe som kan være et resultat av rammeverkets avhengighet av en 2D-prior-modell som opererer på en grov oppløsning, samt begrensningen på skarphet som tilbys av 3D-diffusjonsmodellen. I tillegg oppstår vanlige tekst-problemer, inkludert over-metning og over-glatting, som et resultat av en stor klassifikator-fri veiledning.

Rammeverket bruker en VSD eller Variational Score-Destillasjons-tap for å forbedre realisme i teksturene. Rammeverket velger en Stabil Diffusjonsmodell under denne fasen for å få høyoppløste gradienter. I tillegg holder rammeverket tetraedrisk grid fast for å fremme realistisk rendering og optimalisere den overordnede strukturen til mesh-en. Under læringen, bruker DreamCraft3D-rammeverket ikke Zero-1-to-3-rammeverket, da det har en negativ effekt på teksturkvaliteten, og disse inkonsistente teksturene kan være gjentakende, noe som kan føre til merkelige 3D-utdata.

Eksperimenter og Resultater

For å evaluere ytelsen til DreamCraft3D-rammeverket, sammenlignes det med nåværende state-of-the-art-rammeverk, og de kvalitative og kvantitative resultater analyseres.

Sammenligning med Baseline-modeller

For å evaluere ytelsen, sammenlignes DreamCraft3D-rammeverket med 5 state-of-the-art-rammeverk, inkludert DreamFusion, Magic3D, ProlificDreamer, Magic123 og Make-it-3D. Test-benchmarket består av 300 inndata-bilder som er en blanding av virkelige bilder og bilder generert av Stabil Diffusjons-rammeverket. Hver bilde i test-benchmarket har en tekstprompt, en predikert dybde-kart og en alpha-maske for forgrunnen. Rammeverket henter tekstpromptene for virkelige bilder fra et bilde-underskrifts-rammeverk.

Kvalitativ Analyse

Følgende bilde sammenligner DreamCraft3D-rammeverket med nåværende baseline-modeller, og som kan ses, møter rammeverkene som avhenger av tekst-til-3D-tilnærmingen ofte multi-views-konsistens-problemer.

På den ene siden har du ProlificDreamer-rammeverket som tilbyr realistiske teksturer, men det kommer til kort når det gjelder å generere et plausibelt 3D-objekt. Rammeverk som Make-it-3D-rammeverket som avhenger av bilde-til-3D-metoder, klarer å skape høykvalitets fron-views, men de kan ikke beholde den ideelle geometrien for bildene. Bildene generert av Magic123-rammeverket tilbyr bedre geometrisk regularisering, men de genererer over-mettede og glatte geometriske teksturer og detaljer. I sammenligning med disse rammeverkene, tilbyr DreamCraft3D-rammeverket, som bruker en bootstrapped score-destillasjonsmetode, ikke bare semantisk konsistens, men også forbedrer fantasien diversitet.

Kvantitativ Analyse

I et forsøk på å generere overbevisende 3D-bilder som ikke bare ligner inndata-referansebildet, men også overfører semantikk fra forskjellige perspektiver konsistent, sammenlignes teknikken brukt av DreamCraft3D-rammeverket med baseline-modeller, og evalueringen bruker fire metrikker: PSNR og LPIPS for å måle trofasthet ved referansevisningen, Contextual Distance for å vurdere piksel-nivå-kongruens, og CLIP for å estimere semantisk kohesjon. Resultatene demonstreres i følgende bilde.

Konklusjon

I denne artikkelen har vi diskutert DreamCraft3D, en hierarkisk pipeline for generering av 3D-innhold. DreamCraft3D-rammeverket søker å utnytte et state-of-the-art Text-to-Image (T2I) generativt rammeverk for å lage høykvalitets 2D-bilder ved hjelp av en tekstprompt. Denne tilnærmingen tillater DreamCraft3D-rammeverket å maksimere evnene til state-of-the-art 2D-diffusjonsmodeller for å representere de visuelle semantikkene som beskrevet i tekstprompten, samtidig som det beholder den kreative friheten som tilbys av disse 2D AI-generative rammeverkene. Bildet som genereres, blir deretter løftet til 3D med hjelp av kaskadisk geometrisk tekstforbedring og geometrisk skapingsfaser, og spesialiserte tekniker blir brukt på hvert steg med hjelp av å dekomponere problemet. Som et resultat av denne tilnærmingen, kan DreamCraft3D-rammeverket produsere høykvalitets og konsistente 3D-ressurser med overbevisende teksturer, som kan vises fra flere vinkler.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.