AI-modeller og plattformer
Paint3D : Lysfri Diffusjonsmodell for Bildegenerering
Rask utvikling av AI-generative modeller, spesielt dype generative AI-modeller, har betydelig utvidet kapasiteter i naturlig språkgenerering, 3D-generering, bildegenerering og tale syntese. Disse modellene har revolusjonert 3D-produksjon i ulike industrier. Imidlertid møter mange en utfordring: deres komplekse kobling og genererte mesh ofte er ikke kompatible med tradisjonelle rendering-pipelines som Physically Based Rendering (PBR). Diffusjonsbaserte modeller, særlig uten lys teksturer, demonstrerer imponerende mangfoldige 3D-assettgenerering, og forbedrer 3D-rammeverk i filmproduksjon, spill og AR/VR.
Dette artikkelen introduserer Paint3D, et nytt rammeverk for å produsere mangfoldige, høyoppløste 2K UV-teksturkart for utekstede 3D-mesh, betinget av visuelle eller tekstuelle innputt. Paint3Ds hovedutfordring er å generere høykvalitets teksturer uten innbyggede lys, og muliggjøre brukerredigering eller relighting innen moderne grafikkpipeliner. Det anvender en forhåndstrening 2D-diffusjonsmodell for multi-view-teksturfusjon, og genererer initialt grove teksturkart. Imidlertid viser disse kartene ofte lysartefakter og ufullstendige områder på grunn av 2D-modellens begrensninger i å deaktivere lysvirkninger og fullstendig representere 3D-former. Vi skal dykke ned i Paint3Ds funksjoner, arkitektur og sammenligninger med andre dype generative rammeverk. La oss begynne.
Paint3D : En Introduksjon
Kapasitetene til dype generative AI-modeller i naturlig språkgenerering, 3D-generering og bilde syntese er velkjent og implementert i virkelige applikasjoner, og har revolusjonert 3D-genereringsindustrien. Til tross for deres bemerkelsesverdige kapasiteter, genererer moderne dype generative AI-rammeverk mesh som er karakterisert av kompleks kobling og kaotiske lys teksturer som ofte er ukompatible med konvensjonelle rendering-pipelines, inkludert PBR eller Physically Based Rendering. Liksom dype generative AI-modeller, har tekstursyntese også fremmet raskt, spesielt i å anvende 2D-diffusjonsmodeller. Tekstursyntesemodeller anvender forhåndstrening dybde-til-bilde diffusjonsmodeller effektivt for å anvende tekstuelle betingelser til å generere høykvalitets teksturer. Imidlertid møter disse tilnærmingene vanskeligheter med forhåndsbelyste teksturer som kan ha en betydelig innvirkning på de endelige 3D-miljørendringene og innføre lysfeil når lysene endres innen vanlige arbeidsflyter, som vist i følgende bilde.

Som det kan observeres, fungerer teksturkartet med fri lys i samspill med tradisjonelle rendering-pipelines og leverer nøyaktige resultater, mens teksturkartet med forhåndsbelysning inkluderer upassende skygger når relighting anvendes. På den andre siden, tilbyr teksturgenereringsrammeverk trent på 3D-data en alternativ tilnærming hvor rammeverket genererer teksturene ved å forstå en bestemt 3D-objekts hele geometri. Selv om de måtte levere bedre resultater, mangler teksturgenereringsrammeverk trent på 3D-data generaliseringskapasiteter, noe som hemmer deres evne til å anvende modellen til 3D-objekter utenfor deres treningsdata.
Gjeldende teksturgenereringsmodeller møter to kritiske utfordringer: å anvende bildeveiledning eller mangfoldige promter for å oppnå en bredere grad av generalisering over ulike objekter, og den andre utfordringen er å eliminere koblet lys på resultater fra forhåndstrening. Forhåndsbelyste teksturer kan potensielt interferere med de endelige resultater av teksturerte objekter innen rendering-motorer, og siden forhåndstrening 2D-diffusjonsmodeller bare gir 2D-resultater i visdområdet, mangler de en fullstendig forståelse av former, noe som gjør det vanskelig for dem å opprettholde visuell konsistens for 3D-objekter.
På grunn av utfordringene nevnt ovenfor, forsøker Paint3D-rammeverket å utvikle en dobbelstegs teksturdiffusjonsmodell for 3D-objekter som generaliserer til ulike forhåndstrening generative modeller og opprettholder visuell konsistens samtidig som det lærer lysfrie teksturgenerering.
Paint3D er en dobbelstegs grov-til-fin teksturgenereringsmodell som har som mål å utnytte de sterke promtveiledningene og bildegenereringskapasitetene til forhåndstrening generative AI-modeller for å teksturere 3D-objekter. I den første fasen, sampler Paint3D-rammeverket multi-view-bilder fra en forhåndstrening dybdebevisst 2D-bilde-diffusjonsmodell progressivt for å muliggjøre generalisering av høykvalitets- og rike teksturresultater fra mangfoldige promter. Modellen genererer deretter en initial teksturkart ved å projisere disse bildene tilbake på 3D-mesh-overflaten. I den andre fasen, fokuserer modellen på å generere lysfrie teksturer ved å implementere tilnærmingene som er anvendt av diffusjonsmodeller spesialisert i fjerning av lyspåvirkninger og formbevisst forbedring av ufullstendige områder. Gjennom hele prosessen, er Paint3D-rammeverket konsistent i stand til å generere høykvalitets 2K-teksturer semantisk, og eliminerer intrinsiske lysvirkninger.

For å sammenfatte, er Paint3D en ny dobbelstegs generativ AI-modell som har som mål å produsere mangfoldige, lysfrie og høyoppløste 2K UV-teksturkart for utekstede 3D-mesh for å oppnå statens kunstneriske ytelse i teksturering av 3D-objekter med ulike betingede innputt, inkludert tekst og bilder, og tilbyr en betydelig fordel for syntese- og grafikkredigeringsoppgaver.
Metodologi og Arkitektur
Paint3D-rammeverket genererer og forbedrer teksturkart progressivt for å generere mangfoldige og høykvalitets teksturkart for 3D-modeller med ønskede betingede innputt, inkludert bilder og promter, som vist i følgende bilde.

I den grove fasen, anvender Paint3D-modellen en forhåndstrening 2D-bilde-diffusjonsmodell for å sample multi-view-bilder, og deretter skaper den initialt teksturkart ved å projisere disse bildene tilbake på mesh-overflaten. I den andre fasen, dvs. forbedringsfasen, anvender Paint3D-modellen en diffusjonsprosess i UV-rommet for å forbedre grove teksturkart, og oppnår dermed høykvalitets-, inpainting- og lysfrie funksjoner som sikrer den visuelle appell og fullstendigheten av den endelige teksturen.
Fase 1: Progressiv Grov Teksturgenerering
I den progressive grove teksturgenereringsfasen, genererer Paint3D-modellen en grov UV-teksturkart for 3D-mesh som anvender en forhåndstrening dybdebevisst 2D-diffusjonsmodell. For å være mer spesifik, anvender modellen først ulike kamerautsikter for å rendre dybdekart, deretter anvender den dybdebetingelser for å sample bilder fra bilde-diffusjonsmodellen, og deretter projiserer den disse bildene tilbake på mesh-overflaten. Rammeverket utfører rendering, sampling og projeksjonsteknikker alternativt for å forbedre konsistensen av teksturmaterialet, noe som til slutt hjelper i den progressive genereringen av teksturkartet.
Modellen starter med å generere teksturen av det synlige området med kamerautsikter som fokuserer på 3D-mesh, og renderer 3D-mesh til en dybdekart fra den første utsikten. Modellen sampler deretter en teksturbilde for en fremtoningsbetingelse og en dybdebetingelse. Modellen projiserer deretter bildet tilbake på 3D-mesh. For utsiktene, utfører Paint3D-modellen en lignende tilnærming, men med en liten endring ved å utføre tekstursamplingprosessen ved å anvende en bilde-malingsteknikk. Videre, tar modellen de teksturerte områdene fra tidligere utsikter i betraktning, noe som tillater renderingprosessen å ikke bare utgive en dybdebilde, men også en delvis farget RGB-bilde med en ukolorert maske i den nåværende utsikten.
Modellen anvender deretter en dybdebevisst bilde-inpainting-modell med en inpainting-encoder for å fylle den ukolorerte areaen innen RGB-bildet. Modellen genererer deretter teksturkartet fra utsikten ved å projisere det inpainted bildet tilbake på 3D-mesh under den nåværende utsikten, noe som tillater modellen å generere teksturkartet progressivt, og ankommer til hele den grove strukturkartet. Til slutt, utvider modellen tekstursamplingprosessen til en scene eller objekt med flere utsikter. For å være mer spesifik, anvender modellen et par kameraer for å fange to dybdekart under den initielle tekstursampling fra symmetriske utsikter. Modellen kombinerer deretter de to dybdekartene og komponerer en dybdegrid. Modellen erstatter den enkelt dybdebildet med dybdegriden for å utføre multi-view-dybdebevisst tekstursampling.
Fase 2: Teksturforbedring i UV-Rommet
Selv om utseendet til grove teksturkart er logisk, møter det noen utfordringer, som teksturhull generert under renderingprosessen på grunn av selv-occlusion eller lys-skygger på grunn av involvering av 2D-bilde-diffusjonsmodeller. Paint3D-modellen forsøker å utføre en diffusjonsprosess i UV-rommet basert på et grovt teksturkart, og forsøker å mildne disse problemene og forbedre den visuelle appell av teksturkartet ytterligere under teksturforbedring. Imidlertid, å forbedre den vanlige bilde-diffusjonsmodellen med teksturkart i UV-rommet, introduserer tekstur-ujevnhet, siden teksturkartet er generert av UV-mapping av teksturen på 3D-overflaten som klipper den kontinuerlige teksturen inn i en rekke enkelt-fragmenter i UV-rommet. Som et resultat av fragmenteringen, finner modellen det vanskelig å lære 3D-adjacensforholdene blant fragmentene, noe som fører til tekstur-ujevnhet-problemer.
Modellen forbedrer teksturkartet i UV-rommet ved å utføre diffusjonsprosessen under veiledning av tekstur-fragmenters adjacensinformasjon. Det er viktig å merke seg at i UV-rommet, er det posisjonskartet som representerer 3D-adjacensinformasjonen til tekstur-fragmentene, med modellen som behandler hver ikke-bakgrunns-element som en 3D-punktkoordinat. Under diffusjonsprosessen, fusjonerer modellen 3D-adjacensinformasjonen ved å legge til en individuell posisjons-encoder til den forhåndstrening bilde-diffusjonsmodellen. Den nye encoderen ligner designen av ControlNet-rammeverket og har samme arkitektur som encoderen implementert i bilde-diffusjonsmodellen, med null-convolusjonslaget som kobler de to sammen. Videre, er tekstur-diffusjonsmodellen trent på en datasett som består av tekstur- og posisjonskart, og modellen lærer å forutsi støyen som er lagt til den støyende latenten. Modellen optimaliserer deretter posisjons-encoderen og fryser den trente denoiseren for dens bilde-diffusjonsoppgave.
Modellen utfører deretter samtidig posisjonen av betinget encoder og andre encodere for å utføre forbedringsoppgaver i UV-rommet. I denne sammenhengen, har modellen to forbedringskapasiteter: UVHD eller UV High Definition og UV-inpainting. UVHD-metoden er strukturert for å forbedre den visuelle appell og estetikken av teksturkartet. For å oppnå UVHD, anvender modellen en bilde-forbedrings-encoder og en posisjons-encoder med diffusjonsmodellen. Modellen anvender UV-inpainting-metoden for å fylle tekstur-hullene innen UV-planet, noe som er i stand til å unngå selv-occlusion-problemer generert under rendering. I forbedringsfasen, utfører Paint3D-modellen først UV-inpainting og deretter UVHD for å generere det endelige forbedrede teksturkartet. Ved å integrere de to forbedringsmetodene, er Paint3D-rammeverket i stand til å produsere fullstendige, mangfoldige, høyoppløste og lysfrie UV-teksturkart.
Paint3D : Eksperimenter og Resultater
Paint3D-modellen anvender Stable Diffusion-tekst-til-bilde-modellen for å assistere den med teksturgenereringsoppgaver, mens den anvender bilde-encoder-komponenten for å håndtere bilde-betingelser. For å ytterligere forbedre dens grep på betingede kontroller som bilde-inpainting, dybde og bilde-høydefinisjon, anvender Paint3D-rammeverket ControlNet-domene-encodere. Modellen er implementert på PyTorch-rammeverket med rendering og tekstur-projeksjoner implementert på Kaolin.
Tekst til Teksturer Sammenligning
For å analysere dens ytelse, starter vi med å evaluere Paint3D’s teksturgenererings-effekt når betinget med tekstuelle promter, og sammenligner det med statens kunstneriske rammeverk, inkludert Text2Tex, TEXTure og LatentPaint. Som det kan observeres i følgende bilde, excellerer Paint3D-rammeverket ikke bare i å generere høykvalitets-teksturdetaljer, men det synthesiserer også en lysfri teksturkart rimelig godt.

I sammenligning, er Latent-Paint-rammeverket utsatt for å generere blurrede teksturer som resulterer i underoptimal visuell effekt. På den andre siden, selv om TEXTure-rammeverket genererer klare teksturer, mangler det smidighet og viser merkbar splicing og søm. Til slutt, genererer Text2Tex-rammeverket smidige teksturer bemerkelsesverdig godt, men det mislykkes i å replikere ytelsen for å generere fine teksturer med intrikate detaljer.
Følgende bilde sammenligner Paint3D-rammeverket med statens kunstneriske rammeverk kvantitativt.

Som det kan observeres, overgår Paint3D-rammeverket alle eksisterende modeller, og med en betydelig margin på nærmere 30% forbedring i FID-baselinjen og omtrent 40% forbedring i KID-baselinjen. Forbedringen i FID- og KID-baselinjene demonstrerer Paint3D’s evne til å generere høykvalitets-teksturer over ulike objekter og kategorier.
Bilde til Tekstur Sammenligning
For å generere Paint3D’s generative kapasiteter ved å anvende visuelle promter, anvender vi TEXTure-modellen som baselinjen. Som nevnt tidligere, anvender Paint3D-modellen en bilde-encoder kilde fra tekst-til-bilde-modellen fra Stable Diffusion. Som det kan sees i følgende bilde, synthesiserer Paint3D-rammeverket eksquisitte teksturer bemerkelsesverdig godt, og er fortsatt i stand til å opprettholde høy trofasthet i forhold til bilde-betingelsen.

På den andre siden, er TEXTure-rammeverket i stand til å generere en tekstur som ligner Paint3D, men det mislykkes i å representere tekstur-detaljene i bilde-betingelsen nøyaktig. Videre, som demonstrert i følgende bilde, leverer Paint3D-rammeverket bedre FID- og KID-baselinjer sammenlignet med TEXTure-rammeverket, med den førstnevnte som synker fra 40,83 til 26,86, mens den sistnevnte viser en nedgang fra 9,76 til 4,94.

Slutt tanker
I denne artikkelen, har vi talt om Paint3D, et nytt rammeverk for å produsere mangfoldige, høyoppløste 2K UV-teksturkart for utekstede 3D-mesh, betinget av visuelle eller tekstuelle innputt. Paint3D-rammeverkets hovedutfordring er å generere lysfrie høyoppløste 2K UV-teksturer som er semantisk konsistente uten å være betinget av bilde- eller tekst-innputt. På grunn av dens grov-til-fin-tilnærming, produserer Paint3D-rammeverket lysfrie, mangfoldige og høyoppløste teksturkart, og leverer bedre ytelse enn statens kunstneriske rammeverk.












