AI-modeller og plattformer

Paint3D : Lysfri Diffusjonsmodell for Bildegenerering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Rask utvikling av AI-generative modeller, spesielt dype generative AI-modeller, har betydelig utvidet kapasiteter i naturlig språkgenerering, 3D-generering, bildegenerering og tale syntese. Disse modellene har revolusjonert 3D-produksjon i ulike industrier. Imidlertid møter mange en utfordring: deres komplekse kobling og genererte mesh ofte er ikke kompatible med tradisjonelle rendering-pipelines som Physically Based Rendering (PBR). Diffusjonsbaserte modeller, særlig uten lys teksturer, demonstrerer imponerende mangfoldige 3D-assettgenerering, og forbedrer 3D-rammeverk i filmproduksjon, spill og AR/VR.

Dette artikkelen introduserer Paint3D, et nytt rammeverk for å produsere mangfoldige, høyoppløste 2K UV-teksturkart for utekstede 3D-mesh, betinget av visuelle eller tekstuelle innputt. Paint3Ds hovedutfordring er å generere høykvalitets teksturer uten innbyggede lys, og muliggjøre brukerredigering eller relighting innen moderne grafikkpipeliner. Det anvender en forhåndstrening 2D-diffusjonsmodell for multi-view-teksturfusjon, og genererer initialt grove teksturkart. Imidlertid viser disse kartene ofte lysartefakter og ufullstendige områder på grunn av 2D-modellens begrensninger i å deaktivere lysvirkninger og fullstendig representere 3D-former. Vi skal dykke ned i Paint3Ds funksjoner, arkitektur og sammenligninger med andre dype generative rammeverk. La oss begynne.

Paint3D : En Introduksjon

Kapasitetene til dype generative AI-modeller i naturlig språkgenerering, 3D-generering og bilde syntese er velkjent og implementert i virkelige applikasjoner, og har revolusjonert 3D-genereringsindustrien. Til tross for deres bemerkelsesverdige kapasiteter, genererer moderne dype generative AI-rammeverk mesh som er karakterisert av kompleks kobling og kaotiske lys teksturer som ofte er ukompatible med konvensjonelle rendering-pipelines, inkludert PBR eller Physically Based Rendering. Liksom dype generative AI-modeller, har tekstursyntese også fremmet raskt, spesielt i å anvende 2D-diffusjonsmodeller. Tekstursyntesemodeller anvender forhåndstrening dybde-til-bilde diffusjonsmodeller effektivt for å anvende tekstuelle betingelser til å generere høykvalitets teksturer. Imidlertid møter disse tilnærmingene vanskeligheter med forhåndsbelyste teksturer som kan ha en betydelig innvirkning på de endelige 3D-miljørendringene og innføre lysfeil når lysene endres innen vanlige arbeidsflyter, som vist i følgende bilde. 

Som det kan observeres, fungerer teksturkartet med fri lys i samspill med tradisjonelle rendering-pipelines og leverer nøyaktige resultater, mens teksturkartet med forhåndsbelysning inkluderer upassende skygger når relighting anvendes. På den andre siden, tilbyr teksturgenereringsrammeverk trent på 3D-data en alternativ tilnærming hvor rammeverket genererer teksturene ved å forstå en bestemt 3D-objekts hele geometri. Selv om de måtte levere bedre resultater, mangler teksturgenereringsrammeverk trent på 3D-data generaliseringskapasiteter, noe som hemmer deres evne til å anvende modellen til 3D-objekter utenfor deres treningsdata. 

Gjeldende teksturgenereringsmodeller møter to kritiske utfordringer: å anvende bildeveiledning eller mangfoldige promter for å oppnå en bredere grad av generalisering over ulike objekter, og den andre utfordringen er å eliminere koblet lys på resultater fra forhåndstrening. Forhåndsbelyste teksturer kan potensielt interferere med de endelige resultater av teksturerte objekter innen rendering-motorer, og siden forhåndstrening 2D-diffusjonsmodeller bare gir 2D-resultater i visdområdet, mangler de en fullstendig forståelse av former, noe som gjør det vanskelig for dem å opprettholde visuell konsistens for 3D-objekter. 

På grunn av utfordringene nevnt ovenfor, forsøker Paint3D-rammeverket å utvikle en dobbelstegs teksturdiffusjonsmodell for 3D-objekter som generaliserer til ulike forhåndstrening generative modeller og opprettholder visuell konsistens samtidig som det lærer lysfrie teksturgenerering. 

Paint3D er en dobbelstegs grov-til-fin teksturgenereringsmodell som har som mål å utnytte de sterke promtveiledningene og bildegenereringskapasitetene til forhåndstrening generative AI-modeller for å teksturere 3D-objekter. I den første fasen, sampler Paint3D-rammeverket multi-view-bilder fra en forhåndstrening dybdebevisst 2D-bilde-diffusjonsmodell progressivt for å muliggjøre generalisering av høykvalitets- og rike teksturresultater fra mangfoldige promter. Modellen genererer deretter en initial teksturkart ved å projisere disse bildene tilbake på 3D-mesh-overflaten. I den andre fasen, fokuserer modellen på å generere lysfrie teksturer ved å implementere tilnærmingene som er anvendt av diffusjonsmodeller spesialisert i fjerning av lyspåvirkninger og formbevisst forbedring av ufullstendige områder. Gjennom hele prosessen, er Paint3D-rammeverket konsistent i stand til å generere høykvalitets 2K-teksturer semantisk, og eliminerer intrinsiske lysvirkninger. 

For å sammenfatte, er Paint3D en ny dobbelstegs generativ AI-modell som har som mål å produsere mangfoldige, lysfrie og høyoppløste 2K UV-teksturkart for utekstede 3D-mesh for å oppnå statens kunstneriske ytelse i teksturering av 3D-objekter med ulike betingede innputt, inkludert tekst og bilder, og tilbyr en betydelig fordel for syntese- og grafikkredigeringsoppgaver. 

Metodologi og Arkitektur

Paint3D-rammeverket genererer og forbedrer teksturkart progressivt for å generere mangfoldige og høykvalitets teksturkart for 3D-modeller med ønskede betingede innputt, inkludert bilder og promter, som vist i følgende bilde. 

I den grove fasen, anvender Paint3D-modellen en forhåndstrening 2D-bilde-diffusjonsmodell for å sample multi-view-bilder, og deretter skaper den initialt teksturkart ved å projisere disse bildene tilbake på mesh-overflaten. I den andre fasen, dvs. forbedringsfasen, anvender Paint3D-modellen en diffusjonsprosess i UV-rommet for å forbedre grove teksturkart, og oppnår dermed høykvalitets-, inpainting- og lysfrie funksjoner som sikrer den visuelle appell og fullstendigheten av den endelige teksturen. 

Fase 1: Progressiv Grov Teksturgenerering

I den progressive grove teksturgenereringsfasen, genererer Paint3D-modellen en grov UV-teksturkart for 3D-mesh som anvender en forhåndstrening dybdebevisst 2D-diffusjonsmodell. For å være mer spesifik, anvender modellen først ulike kamerautsikter for å rendre dybdekart, deretter anvender den dybdebetingelser for å sample bilder fra bilde-diffusjonsmodellen, og deretter projiserer den disse bildene tilbake på mesh-overflaten. Rammeverket utfører rendering, sampling og projeksjonsteknikker alternativt for å forbedre konsistensen av teksturmaterialet, noe som til slutt hjelper i den progressive genereringen av teksturkartet. 

Modellen starter med å generere teksturen av det synlige området med kamerautsikter som fokuserer på 3D-mesh, og renderer 3D-mesh til en dybdekart fra den første utsikten. Modellen sampler deretter en teksturbilde for en fremtoningsbetingelse og en dybdebetingelse. Modellen projiserer deretter bildet tilbake på 3D-mesh. For utsiktene, utfører Paint3D-modellen en lignende tilnærming, men med en liten endring ved å utføre tekstursamplingprosessen ved å anvende en bilde-malingsteknikk. Videre, tar modellen de teksturerte områdene fra tidligere utsikter i betraktning, noe som tillater renderingprosessen å ikke bare utgive en dybdebilde, men også en delvis farget RGB-bilde med en ukolorert maske i den nåværende utsikten. 

Modellen anvender deretter en dybdebevisst bilde-inpainting-modell med en inpainting-encoder for å fylle den ukolorerte areaen innen RGB-bildet. Modellen genererer deretter teksturkartet fra utsikten ved å projisere det inpainted bildet tilbake på 3D-mesh under den nåværende utsikten, noe som tillater modellen å generere teksturkartet progressivt, og ankommer til hele den grove strukturkartet. Til slutt, utvider modellen tekstursamplingprosessen til en scene eller objekt med flere utsikter. For å være mer spesifik, anvender modellen et par kameraer for å fange to dybdekart under den initielle tekstursampling fra symmetriske utsikter. Modellen kombinerer deretter de to dybdekartene og komponerer en dybdegrid. Modellen erstatter den enkelt dybdebildet med dybdegriden for å utføre multi-view-dybdebevisst tekstursampling. 

Fase 2: Teksturforbedring i UV-Rommet

Selv om utseendet til grove teksturkart er logisk, møter det noen utfordringer, som teksturhull generert under renderingprosessen på grunn av selv-occlusion eller lys-skygger på grunn av involvering av 2D-bilde-diffusjonsmodeller. Paint3D-modellen forsøker å utføre en diffusjonsprosess i UV-rommet basert på et grovt teksturkart, og forsøker å mildne disse problemene og forbedre den visuelle appell av teksturkartet ytterligere under teksturforbedring. Imidlertid, å forbedre den vanlige bilde-diffusjonsmodellen med teksturkart i UV-rommet, introduserer tekstur-ujevnhet, siden teksturkartet er generert av UV-mapping av teksturen på 3D-overflaten som klipper den kontinuerlige teksturen inn i en rekke enkelt-fragmenter i UV-rommet. Som et resultat av fragmenteringen, finner modellen det vanskelig å lære 3D-adjacensforholdene blant fragmentene, noe som fører til tekstur-ujevnhet-problemer. 

Modellen forbedrer teksturkartet i UV-rommet ved å utføre diffusjonsprosessen under veiledning av tekstur-fragmenters adjacensinformasjon. Det er viktig å merke seg at i UV-rommet, er det posisjonskartet som representerer 3D-adjacensinformasjonen til tekstur-fragmentene, med modellen som behandler hver ikke-bakgrunns-element som en 3D-punktkoordinat. Under diffusjonsprosessen, fusjonerer modellen 3D-adjacensinformasjonen ved å legge til en individuell posisjons-encoder til den forhåndstrening bilde-diffusjonsmodellen. Den nye encoderen ligner designen av ControlNet-rammeverket og har samme arkitektur som encoderen implementert i bilde-diffusjonsmodellen, med null-convolusjonslaget som kobler de to sammen. Videre, er tekstur-diffusjonsmodellen trent på en datasett som består av tekstur- og posisjonskart, og modellen lærer å forutsi støyen som er lagt til den støyende latenten. Modellen optimaliserer deretter posisjons-encoderen og fryser den trente denoiseren for dens bilde-diffusjonsoppgave. 

Modellen utfører deretter samtidig posisjonen av betinget encoder og andre encodere for å utføre forbedringsoppgaver i UV-rommet. I denne sammenhengen, har modellen to forbedringskapasiteter: UVHD eller UV High Definition og UV-inpainting. UVHD-metoden er strukturert for å forbedre den visuelle appell og estetikken av teksturkartet. For å oppnå UVHD, anvender modellen en bilde-forbedrings-encoder og en posisjons-encoder med diffusjonsmodellen. Modellen anvender UV-inpainting-metoden for å fylle tekstur-hullene innen UV-planet, noe som er i stand til å unngå selv-occlusion-problemer generert under rendering. I forbedringsfasen, utfører Paint3D-modellen først UV-inpainting og deretter UVHD for å generere det endelige forbedrede teksturkartet. Ved å integrere de to forbedringsmetodene, er Paint3D-rammeverket i stand til å produsere fullstendige, mangfoldige, høyoppløste og lysfrie UV-teksturkart. 

Paint3D : Eksperimenter og Resultater

Paint3D-modellen anvender Stable Diffusion-tekst-til-bilde-modellen for å assistere den med teksturgenereringsoppgaver, mens den anvender bilde-encoder-komponenten for å håndtere bilde-betingelser. For å ytterligere forbedre dens grep på betingede kontroller som bilde-inpainting, dybde og bilde-høydefinisjon, anvender Paint3D-rammeverket ControlNet-domene-encodere. Modellen er implementert på PyTorch-rammeverket med rendering og tekstur-projeksjoner implementert på Kaolin. 

Tekst til Teksturer Sammenligning

For å analysere dens ytelse, starter vi med å evaluere Paint3D’s teksturgenererings-effekt når betinget med tekstuelle promter, og sammenligner det med statens kunstneriske rammeverk, inkludert Text2Tex, TEXTure og LatentPaint. Som det kan observeres i følgende bilde, excellerer Paint3D-rammeverket ikke bare i å generere høykvalitets-teksturdetaljer, men det synthesiserer også en lysfri teksturkart rimelig godt. 

I sammenligning, er Latent-Paint-rammeverket utsatt for å generere blurrede teksturer som resulterer i underoptimal visuell effekt. På den andre siden, selv om TEXTure-rammeverket genererer klare teksturer, mangler det smidighet og viser merkbar splicing og søm. Til slutt, genererer Text2Tex-rammeverket smidige teksturer bemerkelsesverdig godt, men det mislykkes i å replikere ytelsen for å generere fine teksturer med intrikate detaljer. 

Følgende bilde sammenligner Paint3D-rammeverket med statens kunstneriske rammeverk kvantitativt. 

Som det kan observeres, overgår Paint3D-rammeverket alle eksisterende modeller, og med en betydelig margin på nærmere 30% forbedring i FID-baselinjen og omtrent 40% forbedring i KID-baselinjen. Forbedringen i FID- og KID-baselinjene demonstrerer Paint3D’s evne til å generere høykvalitets-teksturer over ulike objekter og kategorier. 

Bilde til Tekstur Sammenligning

For å generere Paint3D’s generative kapasiteter ved å anvende visuelle promter, anvender vi TEXTure-modellen som baselinjen. Som nevnt tidligere, anvender Paint3D-modellen en bilde-encoder kilde fra tekst-til-bilde-modellen fra Stable Diffusion. Som det kan sees i følgende bilde, synthesiserer Paint3D-rammeverket eksquisitte teksturer bemerkelsesverdig godt, og er fortsatt i stand til å opprettholde høy trofasthet i forhold til bilde-betingelsen. 

På den andre siden, er TEXTure-rammeverket i stand til å generere en tekstur som ligner Paint3D, men det mislykkes i å representere tekstur-detaljene i bilde-betingelsen nøyaktig. Videre, som demonstrert i følgende bilde, leverer Paint3D-rammeverket bedre FID- og KID-baselinjer sammenlignet med TEXTure-rammeverket, med den førstnevnte som synker fra 40,83 til 26,86, mens den sistnevnte viser en nedgang fra 9,76 til 4,94. 

Slutt tanker

I denne artikkelen, har vi talt om Paint3D, et nytt rammeverk for å produsere mangfoldige, høyoppløste 2K UV-teksturkart for utekstede 3D-mesh, betinget av visuelle eller tekstuelle innputt. Paint3D-rammeverkets hovedutfordring er å generere lysfrie høyoppløste 2K UV-teksturer som er semantisk konsistente uten å være betinget av bilde- eller tekst-innputt. På grunn av dens grov-til-fin-tilnærming, produserer Paint3D-rammeverket lysfrie, mangfoldige og høyoppløste teksturkart, og leverer bedre ytelse enn statens kunstneriske rammeverk. 

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.