AI-modellen en platforms

Dreamcraft3D: Hiërarchische 3D-generatie met Bootstrapped Diffusion Prior

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Generatieve AI-modellen zijn al een tijdje een hot topic in de AI-industrie. Het recente succes van 2D-generatieve modellen heeft de weg geplaveid voor de methoden die we vandaag gebruiken om visuele content te creëren. Hoewel de AI-gemeenschap opmerkelijk succes heeft behaald met 2D-generatieve modellen, blijft het genereren van 3D-content een grote uitdaging voor diepe generatieve AI-kaders. Dit is vooral zo omdat de vraag naar gegenereerde 3D-content een hoogtepunt bereikt, aangedreven door een breed scala aan visuele games, applicaties, virtuele realiteit en zelfs cinema. Het is de moeite waard om op te merken dat, hoewel er 3D-generatieve AI-kaders zijn die acceptabele resultaten leveren voor bepaalde categorieën en taken, ze niet in staat zijn om efficiënt 3D-objecten te genereren. Deze tekortkoming kan worden toegeschreven aan het gebrek aan uitgebreide 3D-gegevens voor het trainen van de kaders. Onlangs hebben ontwikkelaars voorgesteld om de richting te gebruiken die wordt aangeboden door voorgetrainde tekst-naar-afbeelding AI-generatieve modellen, een benadering die veelbelovende resultaten heeft laten zien.

In dit artikel zullen we de DreamCraft3D-kader bespreken, een hiërarchisch model voor het genereren van 3D-content dat coherente en hoogwaardige 3D-objecten van hoge kwaliteit produceert. De DreamCraft3D-kader gebruikt een 2D-referentie-afbeelding om de geometrische sculptuur-fase te leiden, waarbij de textuur wordt verbeterd met een focus op het aanpakken van consistentieproblemen die worden aangetroffen door huidige kaders of methoden. Bovendien maakt de DreamCraft3D-kader gebruik van een view-afhankelijk diffusie-model voor score-destillatie-monstering, waardoor de geometrie wordt gesculptureerd die bijdraagt aan coherente rendering.

We zullen een diepere duik nemen in de DreamCraft3D-kader voor 3D-contentgeneratie. Bovendien zullen we het concept van het gebruik van voorgetrainde Text-to-Image (T2I)-modellen voor 3D-contentgeneratie onderzoeken en bekijken hoe de DreamCraft3D-kader deze benadering gebruikt om realistische 3D-content te genereren.

DreamCraft3D: Een Inleiding

DreamCraft3D is een hiërarchische pijplijn voor het genereren van 3D-content. De DreamCraft3D-kader probeert een state-of-the-art T2I- of tekst-naar-afbeelding-generatief kader te gebruiken om hoogwaardige 2D-afbeeldingen te creëren met behulp van een tekstprompt. Deze benadering stelt de DreamCraft3D-kader in staat om de mogelijkheden van state-of-the-art 2D-diffusie-modellen te maximaliseren om de visuele semantiek te representeren zoals beschreven in de tekstprompt, terwijl het de creatieve vrijheid behoudt die wordt aangeboden door deze 2D AI-generatieve kaders. De gegenereerde afbeelding wordt vervolgens getransformeerd in 3D met behulp van gekaskadeerde geometrische textuurversterking en geometrische sculptuurfasen, en gespecialiseerde technieken worden toegepast in elke fase met behulp van de decompositie van het probleem.

Voor geometrie richt de DreamCraft3D-kader zich sterk op de globale 3D-structuur en multi-view-consistentie, waardoor compromissen mogelijk zijn op de gedetailleerde texturen in de afbeeldingen. Zodra de kader de geometrie-gerelateerde problemen heeft opgelost, richt het zich op het optimaliseren van coherente en realistische texturen door een 3D-bewust diffusie te implementeren die de 3D-optimalisatiebenadering bootstrapt. Er zijn twee belangrijke ontwerponderdelen voor de twee optimalisatiefasen, namelijk de geometrische sculptuur en de textuurversterking.

Met alles wat is gezegd, zou het veilig zijn om de DreamCraft3D te beschrijven als een AI-generatief kader dat een hiërarchische 3D-contentgeneratiepijplijn gebruikt om essentieel 2D-afbeeldingen te transformeren in hun 3D-tegenhangers, terwijl de holistische 3D-consistentie wordt behouden.

Gebruik van Voorgetrainde T2I- of Tekst-naar-Afbeelding-Modellen

Het idee om voorgetrainde T2I- of tekst-naar-afbeelding-modellen te gebruiken voor het genereren van 3D-content werd voor het eerst geïntroduceerd door de DreamFusion-kader in 2022. De DreamFusion-kader probeerde een SDS- of Score-Destillatie-Monster-verlies te implementeren om het 3D-kader te optimaliseren op een manier die de renderingen bij willekeurige viewpoints zou aligneren met de tekst-geconditioneerde afbeeldingsdistributies zoals geïnterpreteerd door een efficiënte tekst-naar-afbeelding-diffusie-kader. Hoewel de DreamFusion-benadering behoorlijke resultaten opleverde, waren er twee grote problemen, namelijk vaagheid en oververzadiging. Om deze problemen aan te pakken, implementeren recente werken verschillende fase-wijze optimalisatie-strategieën in een poging om de 2D-destillatie-verlies te verbeteren, wat uiteindelijk leidt tot betere kwaliteit en realistische 3D-gegenereerde afbeeldingen.

Het DreamCraft3D-kader onderzoekt de mogelijkheid om een holistische hiërarchische 3D-contentgeneratiepijplijn te gebruiken en zoekt inspiratie in het handmatige artistieke proces waarin een concept eerst wordt neergeschreven in een 2D-schets, waarna de artiest de ruwe geometrie sculpteert, de geometrische details verfijnt en hoge-kwaliteitstekturen schildert. Volgend op deze benadering, breekt de DreamCraft3D-kader de uitputtende 3D-content- of afbeeldingengeneratietaken op in verschillende beheersbare stappen.

In de eerste fase implementeert de DreamCraft3D-kader geometrische sculptuur om consistente en plausibele 3D-geometrische vormen te produceren met behulp van de 2D-afbeelding als referentie. Bovendien maakt de fase niet alleen gebruik van het SDS-verlies voor fotometrische verliezen en nieuwe views bij de referentieview, maar de kader introduceert ook een breed scala aan strategieën om geometrische consistentie te bevorderen.

De tweede fase van de DreamCraft3D-kader maakt gebruik van een bootstrapped score-destillatie-benadering om de texturen van de afbeelding te versterken, aangezien de huidige view-geconditioneerde diffusie-modellen zijn getraind op een beperkte hoeveelheid 3D-gegevens, waardoor ze vaak moeite hebben om de prestaties of fidélité van 2D-diffusie-modellen te evenaren.

Zoals te zien is in de bovenstaande afbeeldingen, is de DreamCraft3D-kader in staat om creatieve 3D-afbeeldingen en -content te produceren met realistische texturen en ingewikkelde geometrische structuren.

DreamCraft3D: Werking en Architectuur

De DreamCraft3D-kader probeert een state-of-the-art T2I- of tekst-naar-afbeelding-generatief kader te gebruiken om hoogwaardige 2D-afbeeldingen te creëren met behulp van een tekstprompt. Deze benadering stelt de DreamCraft3D-kader in staat om de mogelijkheden van state-of-the-art 2D-diffusie-modellen te maximaliseren om de visuele semantiek te representeren zoals beschreven in de tekstprompt, terwijl het de creatieve vrijheid behoudt die wordt aangeboden door deze 2D AI-generatieve kaders.

Laten we een diepere kijk nemen naar de belangrijkste ontwerponderdelen voor de textuurversterking en de geometrische sculptuurfasen.

Geometrische Sculptuur

Geometrische sculptuur is de eerste fase waarin de DreamCraft3D-kader probeert een 3D-model te creëren dat overeenkomt met het uiterlijk van de referentie-afbeelding bij dezelfde referentieview, terwijl het maximale plausibiliteit behoudt, zelfs onder verschillende kijkhoeken.

3D-Bewust Diffusie-Prior

De 3D-optimalisatie-methoden die gebruikmaken van per-view-supervisie alleen zijn onderbepaald, wat de belangrijkste reden is waarom de DreamCraft3D-kader gebruikmaakt van Zero-1-to-3, een view-geconditioneerde diffusie-model, aangezien het Zero-1-to-3-kader een verbeterde viewpoint-awareness biedt, aangezien het is getraind op een grotere schaal van 3D-gegevensassets.

Progressieve View-Training

Het direct afleiden van vrije views in 360 graden kan leiden tot geometrische artefacten of inconsistenties, zoals een extra been op de stoel, een gebeurtenis die kan worden toegeschreven aan de ambiguïteit van een enkele referentie-afbeelding.

Diffusie-Tijd-Stap-Annealing

De DreamCraft3D-kader maakt gebruik van een diffusie-tijd-stap-annealing-strategie in een poging om overeen te komen met de 3D-optimalisatie’s coarse-to-fine-progressie.

Gedetailleerde Structurele Verbetering

De DreamCraft3D-kader optimaliseert een impliciete oppervlakte-representatie aanvankelijk om een grove structuur te vestigen. De kader gebruikt vervolgens dit resultaat en koppelt het aan een deformeerbare tetraëder-rooster of DMTet om een getextureerde 3D-mesh-representatie te initialiseren, die het leren van textuur en geometrie ontwart.

Textuurversterking met Bootstrapped Score-Sampling

Hoewel de geometrische sculptuur-fase de nadruk legt op het leren van gedetailleerde en coherente geometrie, verbleekt de textuur enigszins, wat het gevolg kan zijn van de afhankelijkheid van de kader van een 2D-prior-model dat op een grove resolutie werkt, evenals de beperkte scherpte die wordt aangeboden door het 3D-diffusie-model.

De kader maakt gebruik van een VSD- of Variational Score-Destillatie-verlies om de realisme van de texturen te verhogen. De kader kiest voor een Stable Diffusie-model tijdens deze fase om hoog-resolutie-gradiënten te krijgen.

Experimenten en Resultaten

Om de prestaties van de DreamCraft3D-kader te evalueren, wordt deze vergeleken met huidige state-of-the-art-kaders, en de kwalitatieve en kwantitatieve resultaten worden geanalyseerd.

Vergelijking met Baseline-Modellen

Om de prestaties te evalueren, wordt de DreamCraft3D-kader vergeleken met 5 state-of-the-art-kaders, waaronder DreamFusion, Magic3D, ProlificDreamer, Magic123 en Make-it-3D.

Kwalitatieve Analyse

De volgende afbeelding vergelijkt de DreamCraft3D-kader met de huidige baseline-modellen, en zoals te zien is, hebben de kaders die afhankelijk zijn van de tekst-naar-3D-benadering vaak te maken met multi-view-consistentieproblemen.

Aan de ene kant hebt u de ProlificDreamer-kader die realistische texturen biedt, maar het ontbreekt aan het genereren van een plausibele 3D-object. Kaders zoals de Make-it-3D-kader die afhankelijk zijn van Image-to-3D-methoden, kunnen hoge-kwaliteit frontale views creëren, maar ze kunnen de ideale geometrie voor de afbeeldingen niet behouden.

Kwantitatieve Analyse

In een poging om overtuigende 3D-afbeeldingen te genereren die niet alleen de invoer-referentie-afbeelding lijken, maar ook semantiek vanuit verschillende perspectieven consistent overbrengen, worden de technieken die worden gebruikt door de DreamCraft3D-kader vergeleken met baseline-modellen, en de evaluatie-proces maakt gebruik van vier metrics: PSNR en LPIPS voor het meten van fidélité bij de referentieview, Contextuele Afstand voor het beoordelen van pixel-niveau-congruentie, en CLIP om de semantische coherentie te schatten.

Conclusie

In dit artikel hebben we de DreamCraft3D-kader besproken, een hiërarchische pijplijn voor het genereren van 3D-content. De DreamCraft3D-kader probeert een state-of-the-art T2I- of tekst-naar-afbeelding-generatief kader te gebruiken om hoogwaardige 2D-afbeeldingen te creëren met behulp van een tekstprompt. Deze benadering stelt de DreamCraft3D-kader in staat om de mogelijkheden van state-of-the-art 2D-diffusie-modellen te maximaliseren om de visuele semantiek te representeren zoals beschreven in de tekstprompt, terwijl het de creatieve vrijheid behoudt die wordt aangeboden door deze 2D AI-generatieve kaders. De gegenereerde afbeelding wordt vervolgens getransformeerd in 3D met behulp van gekaskadeerde geometrische textuurversterking en geometrische sculptuurfasen, en gespecialiseerde technieken worden toegepast in elke fase met behulp van de decompositie van het probleem. Als resultaat van deze benadering kan de DreamCraft3D-kader hoogwaardige en consistente 3D-assets produceren met overtuigende texturen, die vanuit meerdere hoeken kunnen worden bekeken.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.