AI-modeller och plattformar

DreamCraft3D: Hierarkisk 3D-generering med Bootstrapped Diffusion Prior

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Generativa AI-modeller har varit ett hett diskussionsämne inom AI-branschen under en tid. Den nyliga framgången med 2D-generativa modeller har banat väg för de metoder vi använder för att skapa visuellt innehåll idag. Även om AI-samhället har uppnått anmärkningsvärd framgång med 2D-generativa modeller, kvarstår generering av 3D-innehåll som en stor utmaning för djupa generativa AI-ramverk. Detta är särskilt sant eftersom efterfrågan på 3D-genererat innehåll når en rekordnivå, driven av en mängd olika visuella spel, applikationer, virtuell verklighet och till och med bio. Det är värt att notera att medan det finns 3D-generativa AI-ramverk som levererar acceptabla resultat för vissa kategorier och uppgifter, kan de inte effektivt generera 3D-objekt. Denna brist kan tillskrivas bristen på omfattande 3D-data för att träna ramverken. Nyligen har utvecklare föreslagit att man ska utnyttja den vägledning som erbjuds av förtränade text-till-bild AI-generativa modeller, en approach som har visat lovande resultat.

I den här artikeln kommer vi att diskutera DreamCraft3D-ramverket, en hierarkisk modell för generering av 3D-innehåll som producerar sammanhängande och högkvalitativa 3D-objekt av hög kvalitet. DreamCraft3D-ramverket använder en 2D-referensbild för att vägleda geometriskulpteringsstadiet, förbättrar texturen med fokus på att hantera sammanhängighetsproblem som möts av nuvarande ramverk eller metoder. Dessutom använder DreamCraft3D-ramverket en vyberoende diffusionsmodell för poängdestilleringsexempel, vilket bidrar till att skulptera geometri som bidrar till sammanhängande rendering.

Vi kommer att ta en närmare titt på DreamCraft3D-ramverket för 3D-innehållsgenerering. Dessutom kommer vi att undersöka begreppet att utnyttja förtränade Text-till-Bild (T2I)-modeller för 3D-innehållsgenerering och undersöka hur DreamCraft3D-ramverket syftar till att använda denna approach för att generera realistiskt 3D-innehåll.

DreamCraft3D: En introduktion

DreamCraft3D är en hierarkisk pipeline för generering av 3D-innehåll. DreamCraft3D-ramverket försöker utnyttja ett state-of-the-art T2I eller Text-till-Bild-generativt ramverk för att skapa högkvalitativa 2D-bilder med hjälp av en textprompt. Tillvägagångssättet tillåter DreamCraft3D-ramverket att maximera förmågan hos state-of-the-art 2D-diffusionsmodeller för att representera de visuella semantikerna som beskrivs i textprompten, samtidigt som det behåller den kreativa friheten som erbjuds av dessa 2D-AI-generativa ramverk. Den genererade bilden omvandlas sedan till 3D med hjälp av kasaderad geometrisk texturboostning och geometriskulpteringsfaser, och specialiserade tekniker tillämpas vid varje stadium med hjälp av att bryta ned problemet.

För geometri fokuserar DreamCraft3D-ramverket kraftigt på den globala 3D-strukturen och multi-vy-konsistensen, vilket gör plats för kompromisser när det gäller detaljerade texturer i bilderna. När ramverket har gjort sig av med geometrirelaterade problem, skiftar det fokus till att optimera sammanhängande och realistiska texturer genom att implementera en 3D-medveten diffusionsmodell som startar 3D-optimeringsmetoden. Det finns två viktiga designöverväganden för de två optimeringsfaserna, nämligen den geometriska skulpteringen och texturboostningen.

Med allt som sagts kan det vara säkert att beskriva DreamCraft3D som ett AI-generativt ramverk som utnyttjar en hierarkisk 3D-innehållsgenereringspipeline för att förvandla 2D-bilder till deras 3D-motsvarigheter samtidigt som den behåller den holistiska 3D-konsistensen.

Utnyttjande av förtränade T2I eller Text-till-Bild-modeller

Idén att utnyttja förtränade T2I eller Text-till-Bild-modeller för generering av 3D-innehåll introducerades först av DreamFusion-ramverket 2022. DreamFusion-ramverket försökte påtvinga en SDS eller Poängdestilleringsexempel-förlust för att optimera 3D-ramverket på ett sätt som renderingarna vid slumpmässiga vypunkter skulle stämma överens med textvillkorsbaserade bildfördelningar som tolkades av ett effektivt text-till-bild-diffusionsramverk. Även om DreamFusion-approachen levererade anständiga resultat, fanns det två stora problem, suddighet och övermättnad. För att hantera dessa problem implementerar nyliga arbeten olika fasvisa optimeringsstrategier i ett försök att förbättra 2D-destillationsförlusten, vilket i sin tur leder till bättre kvalitet och realistiska 3D-genererade bilder.

Men trots den nyliga framgången för dessa ramverk, kan de inte matcha förmågan hos 2D-generativa ramverk att syntetisera komplext innehåll. Dessutom är dessa ramverk ofta fyllda med “Janus-problemet”, en tillstånd där 3D-renderingar som verkar vara trovärdiga individuellt, visar stilistiska och semantiska inkonsekvenser när de undersöks som en helhet.

För att hantera de problem som tidigare arbeten mött, undersöker DreamCraft3D-ramverket möjligheten att använda en holistisk hierarkisk 3D-innehållsgenereringspipeline och söker inspiration från den manuella konstnärliga processen, där en idé först skrivs ner i en 2D-utkast, varefter konstnären skulpterar den grova geometrin, finjusterar de geometriska detaljerna och målar högkvalitativa texturer. Följande samma tillvägagångssätt, bryter DreamCraft3D-ramverket ned den uttömmande 3D-innehålls- eller bildgenereringsuppgiften i olika hanterbara steg.

I den första fasen, distribuerar DreamCraft3D-ramverket geometrisk skulptering för att producera sammanhängande och trovärdiga 3D-geometriska former med hjälp av 2D-bilden som referens. Dessutom använder fasen inte bara SDS-förlusten för fotometriska förluster och nya vyer vid referensvyn, utan ramverket introducerar också en mängd strategier för att främja geometrisk konsistens. Ramverket syftar till att utnyttja Zero-1-to-3, en vyvillkorsbaserad av-hyllningsbildöversättningsmodell, för att använda referensbilden för att modellera fördelningen av nya vyer. Dessutom övergår ramverket från implicit yta-representation till mesh-representation för grov till fin geometrisk raffinering.

Den andra fasen av DreamCraft3D-ramverket använder en startad poängdestilleringstillämpning för att förbättra texturerna på bilden, eftersom de nuvarande vyvillkorsbaserade diffusionsmodellerna tränas på en begränsad mängd 3D-data, vilket är varför de ofta kämpar för att matcha prestanda eller trohet hos 2D-diffusionsmodeller. Tack vare denna begränsning, finjusterar DreamCraft3D-ramverket diffusionsmodellen i enlighet med multi-vy-bilder av den 3D-instans som optimeras, och detta tillvägagångssätt hjälper ramverket att öka 3D-texturerna samtidigt som det behåller multi-vy-konsistens. När diffusionsmodellen tränas på dessa multi-vy-renderingar, ger den bättre vägledning för 3D-texturoptimering, och detta tillvägagångssätt hjälper DreamCraft3D-ramverket att uppnå en otrolig mängd texturdetaljer samtidigt som det behåller vy-konsistens.

Som kan observeras i ovanstående bilder, är DreamCraft3D-ramverket kapabelt att producera kreativa 3D-bilder och innehåll med realistiska texturer och intrikata geometriska strukturer. I den första bilden är kroppen av Son Goku, en anime-karaktär blandad med huvudet av en vildsvin som springer, medan den andra bilden visar en Beagle som är klädd i en detektivs dräkt. Följande är några ytterligare exempel.

DreamCraft3D: Arbete och Arkitektur

DreamCraft3D-ramverket försöker utnyttja ett state-of-the-art T2I eller Text-till-Bild-generativt ramverk för att skapa högkvalitativa 2D-bilder med hjälp av en textprompt. Tillvägagångssättet tillåter DreamCraft3D-ramverket att maximera förmågan hos state-of-the-art 2D-diffusionsmodeller för att representera de visuella semantikerna som beskrivs i textprompten, samtidigt som det behåller den kreativa friheten som erbjuds av dessa 2D-AI-generativa ramverk. Den genererade bilden omvandlas sedan till 3D med hjälp av kasaderad geometrisk texturboostning och geometriskulpteringsfaser, och specialiserade tekniker tillämpas vid varje stadium med hjälp av att bryta ned problemet. Följande bild sammanfattar kortfattat arbetet med DreamCraft3D-ramverket.

Låt oss ta en detaljerad titt på de viktigaste designövervägandena för texturboostningen och den geometriska skulpteringen.

Geometri Skulptering

Geometri skulptering är den första fasen där DreamCraft3D-ramverket försöker skapa en 3D-modell på ett sätt som stämmer överens med utseendet på referensbilden vid samma referensvy, samtidigt som det säkerställer maximal trovärdighet även under olika vyvinklar. För att säkerställa maximal trovärdighet, använder ramverket SDS-förlusten för att uppmuntra trovärdig bildrendering för varje enskild sampad vy som en förtränad diffusionsmodell kan känna igen. Dessutom, för att utnyttja vägledningen från referensbilden effektivt, straffar ramverket fotometriska skillnader mellan referensen och de renderade bilderna vid referensvyn, och förlusten beräknas endast inom förgrundsområdet för vyn. Dessutom, för att uppmuntra scenens sparsamhet, implementerar ramverket också en maskförlust som renderar silhuetten. Trots detta, kvarstår att upprätthålla utseende och semantik över bakvyer konsekvent fortfarande en utmaning, vilket är varför ramverket använder ytterligare tillvägagångssätt för att producera detaljerad och sammanhängande geometri.

3D-medveten Diffusion Prior

De 3D-optimeringsmetoder som använder per-vy-supervision ensam är underbestämda, vilket är den primära anledningen till att DreamCraft3D-ramverket använder Zero-1-to-3, en vyvillkorsbaserad diffusionsmodell, eftersom Zero-1-to-3-ramverket erbjuder en förbättrad vyvillkorsmedvetenhet, eftersom det har tränats på en större skala av 3D-data tillgångar. Dessutom är Zero-1-to-3-ramverket en finjusterad diffusionsmodell som hallucinerar bilden i relation till kamerapositionen, givet referensbilden.

Progressiv Vyträning

Att direkt erhålla fria vyer i 360 grader kan leda till geometriska artefakter eller diskrepanser, som en extra ben på stolen, ett evenemang som kan tillskrivas den inneboende tvetydigheten hos en enda referensbild. För att hantera detta hinder, utökar DreamCraft3D-ramverket träningsvyerna progressivt, varefter den etablerade geometrin gradvis propageras för att erhålla resultat i 360 grader.

Diffusion Tidsstegs Avtrappning

DreamCraft3D-ramverket använder en diffusion tidsstegs avtrappningsstrategi i ett försök att stämma överens med 3D-optimeringens grov-till-fine-progression. I början av optimeringsprocessen, ger ramverket prioritet till att sampla en större diffusions-tidssteg, i ett försök att tillhandahålla den globala strukturen. När ramverket fortsätter med träningsprocessen, linjärt avtrappar det sampelintervallet under loppet av hundratals iterationer. Tack vare avtrappningsstrategin, lyckas ramverket etablera en trovärdig global geometri under de tidiga optimeringsstegen, innan det finjusterar de strukturella detaljerna.

Detailed Strukturell Förbättring

DreamCraft3D-ramverket optimerar en implicit yta-representation initialt för att etablera en grov struktur. Ramverket använder sedan detta resultat och kopplar det med en deformabel tetraedrisk grid eller DMTet för att initiera en texturerad 3D-mesh-representation, som lösgör inlärningen av textur och geometri. När ramverket är färdigt med den strukturella förbättringen, kan modellen behålla högfrekventa detaljer som erhållits från referensbilden genom att finjustera texturerna ensamma.

Texturboostning med hjälp av Startad Poängdestillering

Även om den geometriska skulpteringsfasen betonar inlärning av detaljerad och sammanhängande geometri, suddar den texturen till en viss grad, vilket kan vara ett resultat av ramverkets beroende av en 2D-prior-modell som opererar vid en grov upplösning, tillsammans med den begränsade skärpan som erbjuds av 3D-diffusionsmodellen. Dessutom uppstår vanliga texturproblem, inklusive övermättnad och över-smoothing, som ett resultat av en stor klassificeringsfri vägledning.

Ramverket använder en VSD eller Variational Poängdestillering-förlust för att öka realismen i texturerna. Ramverket väljer en Stabil Diffusionsmodell under denna fas för att erhålla högupplösta gradienter. Dessutom håller ramverket den tetraedriska griden fast för att främja realistisk rendering och optimera den övergripande strukturen på meshen. Under inlärningsstadiet, använder DreamCraft3D-ramverket inte Zero-1-to-3-ramverket, eftersom det har en negativ effekt på texturkvaliteten, och dessa inkonsekventa texturer kan vara återkommande, vilket kan leda till bisarra 3D-utgångar.

Experiment och Resultat

För att utvärdera prestandan hos DreamCraft3D-ramverket, jämförs det med nuvarande state-of-the-art-ramverk, och de kvalitativa och kvantitativa resultaten analyseras.

Jämförelse med Baslinje-modeller

För att utvärdera prestandan, jämförs DreamCraft3D-ramverket med 5 state-of-the-art-ramverk, inklusive DreamFusion, Magic3D, ProlificDreamer, Magic123 och Make-it-3D. Testbenchmarken består av 300 inmatningsbilder som är en blandning av realvärldsbilder och bilder genererade av Stabil Diffusionsramverket. Varje bild i testbenchmarken har en textprompt, en förutsagd djupkarta och en alfa-mask för förgrunden. Ramverket hämtar textprompten för de reala bilderna från en bildrubriksramverk.

Kvalitativ Analys

Följande bild jämför DreamCraft3D-ramverket med nuvarande baslinje-modeller, och som kan ses, möter ramverken som förlitar sig på text-till-3D-approachen ofta multi-vy-konsistensproblem.

Å ena sidan har du ProlificDreamer-ramverket som erbjuder realistiska texturer, men det brister när det gäller att generera en trovärdig 3D-modell. Ramverk som Make-it-3D-ramverket som förlitar sig på Bild-till-3D-metoder kan skapa högkvalitativa främre vyer, men de kan inte upprätthålla den ideala geometrin för bilderna. Bilderna genererade av Magic123-ramverket erbjuder bättre geometrisk regularisering, men de genererar övermättade och släta geometriska texturer och detaljer. När jämfört med dessa ramverk, erbjuder DreamCraft3D-ramverket som använder en startad poängdestillering-metod, inte bara semantisk konsistens, utan det förbättrar också den övergripande fantasifullheten.

Kvantitativ Analys

I ett försök att generera övertygande 3D-bilder som inte bara liknar inmatningsreferensbilden, utan också förmedlar semantik från olika vyer konsekvent, jämförs de tekniker som används av DreamCraft3D-ramverket med baslinje-modellerna, och utvärderingsprocessen använder fyra metoder: PSNR och LPIPS för att mäta trohet vid referensvyn, Contextual Distance för att bedöma pixelnivå-kongruens, och CLIP för att uppskatta semantisk kohärens. Resultaten visas i följande bild.

Slutsats

I den här artikeln har vi diskuterat DreamCraft3D, en hierarkisk pipeline för generering av 3D-innehåll. DreamCraft3D-ramverket syftar till att utnyttja ett state-of-the-art Text-till-Bild (T2I) generativt ramverk för att skapa högkvalitativa 2D-bilder med hjälp av en textprompt. Detta tillvägagångssätt tillåter DreamCraft3D-ramverket att maximera förmågan hos state-of-the-art 2D-diffusionsmodeller för att representera de visuella semantikerna som beskrivs i textprompten, samtidigt som det behåller den kreativa friheten som erbjuds av dessa 2D-AI-generativa ramverk. Den genererade bilden omvandlas sedan till 3D med hjälp av kasaderad geometrisk texturboostning och geometriskulpteringsfaser, och specialiserade tekniker tillämpas vid varje stadium med hjälp av att bryta ned problemet. Som ett resultat av detta tillvägagångssätt, kan DreamCraft3D-ramverket producera högkvalitativa och konsekventa 3D-tillgångar med övertygande texturer, som kan ses från flera vinklar.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.