AI-modeller og plattformer
Paint3D: En InnfÃļring
Utviklingen av dype generative AI-modeller har akselerert utviklingen av AI med bemerkelsesverdige evner i naturlig sprÃĨkgenerering, 3D-generering, bildegenerering og tale-syntese. 3D-generative modeller har forandret mange bransjer og anvendelser, og har revolusjonert det nÃĨvÃĶrende 3D-produksjonslandskapet. Imidlertid mÃļter mange nÃĨvÃĶrende dype generative modeller en vanlig hindring: kompleks kobling og genererte mesh med lys-teksturer er ofte uforenlig med tradisjonelle rendering-pipelines som PBR (Physically Based Rendering). Diffusjons-baserte modeller, som genererer 3D-objekter uten lys-teksturer, besitter bemerkelsesverdige evner for divers 3D-objektgenerering, og forbedrer eksisterende 3D-rammeverk over hele bransjer som filmproduksjon, spill og forbedret virkelighet.
I denne artikkelen skal vi diskutere Paint3D, et nytt coarse-to-fine-rammeverk som kan produsere diverse, hÃļyopplÃļselige 2K UV-teksturer for uteksturede 3D-mesh, betinget pÃĨ enten visuelle eller tekstuelle innputt. Hovedutfordringen som Paint3D lÃļser er ÃĨ generere hÃļykvalitets-teksturer uten ÃĨ innlemme lys-informasjon, slik at brukerne kan redigere eller omligne innen moderne grafikk-pipelines. For ÃĨ lÃļse dette problemet, bruker Paint3D-rammeverket et forhÃĨndstreent 2D-diffusjonsmodell for ÃĨ utfÃļre multi-viewport-teksturfusjon og generere viewport-betingede bilder, som fÃļrst produserer en grov tekstur-mappe. Imidlertid, siden 2D-modeller ikke fullstendig kan deaktivere lys-effekter eller fullstendig representere 3D-former, kan tekstur-mappen vise lys-artefakter og ufullstendige omrÃĨder.
I denne artikkelen skal vi undersÃļke Paint3D-rammeverket i dybden, og sammenligne det med nÃĨvÃĶrende deep generative rammeverk. La oss begynne.
Paint3D: En InnfÃļring
Dype generative AI-modeller har demonstrert bemerkelsesverdige evner i naturlig sprÃĨkgenerering, 3D-generering og bilde-syntese, og er implementert i virkelige anvendelser, og har revolusjonert 3D-genererings-industrien. Imidlertid, til tross for deres bemerkelsesverdige evner, produserer moderne dype generative AI-rammeverk ofte mesh med kompleks kobling og kaotiske lys-teksturer som er uforenlig med konvensjonelle rendering-pipelines, inkludert Physically Based Rendering (PBR). Liksom, tekstur-syntese har fremmet raskt, spesielt med bruk av 2D-diffusjonsmodeller. Disse modellene bruker effektivt forhÃĨndstreente dybde-til-bilde-diffusjonsmodeller og tekst-betingelser for ÃĨ generere hÃļykvalitets-teksturer. Imidlertid, en betydelig utfordring bestÃĨr: forhÃĨndslÃļste teksturer kan negativt pÃĨvirke den endelige 3D-miljÃļ-renderingen, og introdusere lys-feil nÃĨr lysene justeres innen vanlige arbeidsflyter, som vist i fÃļlgende bilde.

Som observert, fungerer tekstur-kart uten forhÃĨndslÃļsning sammen med tradisjonelle rendering-pipelines, og leverer nÃļyaktige resultater. I motsetning, inkluderer tekstur-kart med forhÃĨndslÃļsning uÃļnskede skygger nÃĨr omligning brukes. Tekstur-genererings-rammeverk trent pÃĨ 3D-data tilbyr en alternativ tilnÃĶrming, og genererer teksturer ved ÃĨ forstÃĨ en bestemt 3D-objekts hele geometri. Imidlertid, selv om disse rammeverkene kan levere bedre resultater, mangler de generaliserings-evnene som trengs for ÃĨ anvende modellen pÃĨ 3D-objekter utenfor deres treningsdata.
NÃĨvÃĶrende tekstur-genererings-modeller mÃļter to kritiske utfordringer: ÃĨ oppnÃĨ bred generalisering over forskjellige objekter ved hjelp av bilde-veiledning eller diverse pÃĨminnelser, og ÃĨ eliminere koblet lys fra forhÃĨndstrening-resultater. ForhÃĨndslÃļste teksturer kan forstyrre den endelige teksturen pÃĨ teksturede objekter innen rendering-motorer. I tillegg, siden forhÃĨndstreente 2D-diffusjonsmodeller bare gir 2D-resultater i viewport-domÃĶnet, mangler de en omfattende forstÃĨelse av former, og fÃļrer til inkonsistenser i ÃĨ opprettholde viewport-konsistens for 3D-objekter.
For ÃĨ lÃļse disse utfordringene, utvikler Paint3D-rammeverket et dual-stage tekstur-diffusjonsmodell for 3D-objekter som generaliserer over forskjellige forhÃĨndstreente generative modeller og opprettholder viewport-konsistens mens det genererer lys-frie teksturer.
Paint3D er et dual-stage, coarse-to-fine tekstur-genereringsmodell som utnytter de sterke pÃĨminnelser og bilde-genererings-evnene til forhÃĨndstreente generative AI-modeller for ÃĨ teksturere 3D-objekter. I den fÃļrste fasen, sampler Paint3D multi-viewport-bilder fra et forhÃĨndstreent dybde-til-bilde-diffusjonsmodell progressivt, og muliggjÃļr generalisering av hÃļykvalitets-teksturer fra diverse pÃĨminnelser. Modellen genererer sÃĨ en initial tekstur-mappe ved ÃĨ projisere disse bildene tilbake pÃĨ 3D-mesh-overflaten. I den andre fasen, fokuserer modellen pÃĨ ÃĨ generere lys-frie teksturer ved ÃĨ implementere tilnÃĶrminger som brukes av diffusjonsmodeller som spesialiserer seg pÃĨ ÃĨ fjerne lys-pÃĨvirkninger og forbedre form-tilknyttede ufullstendige omrÃĨder. Gjennom hele prosessen, genererer Paint3D-rammeverket konsistent hÃļykvalitets-2K-teksturer semantisk, og eliminerer intrinsiske lys-effekter.

I sammenfatning, er Paint3D et nytt, coarse-to-fine generativt AI-modell designet for ÃĨ produsere diverse, lys-frie, hÃļyopplÃļselige 2K UV-teksturer for uteksturede 3D-mesh. Det har som mÃĨl ÃĨ oppnÃĨ state-of-the-art-ytelse i teksturering av 3D-objekter med forskjellige betingede innputt, inkludert tekst og bilder, og tilbyr betydelige fordeler for syntese og grafikk-redigering-oppgaver.
Metodologi og Arkitektur
Paint3D-rammeverket genererer og forbedrer tekstur-kart progressivt for ÃĨ produsere diverse og hÃļykvalitets-teksturer for 3D-modeller ved hjelp av betingede innputt som bilder og pÃĨminnelser, som vist i fÃļlgende bilde.

Steg 1: Progressiv Grov Tekstur-Generering
I den fÃļrste fasen, coarse-tekstur-generering, bruker Paint3D forhÃĨndstreente 2D-bilde-diffusjonsmodeller for ÃĨ sample multi-viewport-bilder, som sÃĨ projiseres tilbake pÃĨ mesh-overflaten for ÃĨ skape den initielle tekstur-kart. Denne fasen begynner med ÃĨ generere en dybde-kart fra forskjellige kamera-viewport. Modellen bruker dybde-betingelser for ÃĨ sample bilder fra diffusjonsmodellen, som sÃĨ projiseres tilbake pÃĨ 3D-mesh-overflaten. Denne alternativ rendering, sampling og projeksjon-tilnÃĶrming forbedrer konsistensen av tekstur-mesh og hjelper med ÃĨ generere tekstur-kart progressivt.
Prosessen begynner med de synlige omrÃĨdene av 3D-mesh, og fokuserer pÃĨ ÃĨ generere tekstur fra den fÃļrste kamera-viewport ved ÃĨ rendre 3D-mesh til en dybde-kart. Et tekstur-bilde samples basert pÃĨ utseende og dybde-betingelser, og projiseres tilbake pÃĨ mesh. Denne metoden gjentas for pÃĨfÃļlgende viewport, og inkorporerer tidligere teksturer for ÃĨ rendre ikke bare en dybde-bilde, men ogsÃĨ en delvis farget RGB-bilde med ufargede masker. Modellen bruker en dybde-til-bilde-inpainting-encoder for ÃĨ fylle ufargede omrÃĨder, og genererer en fullstendig grov tekstur-kart ved ÃĨ projisere inpaintede bilder tilbake pÃĨ 3D-mesh.
For mer komplekse scener eller objekter, bruker modellen flere viewport. FÃļrst, fanger den to dybde-kart fra symmetriske viewport og kombinerer dem i en dybde-grid, som erstatter en enkelt dybde-bilde for multi-viewport-dybde-til-tekstur-sampling.
Steg 2: Tekstur-Forbedring i UV-Rom
Til tross for ÃĨ generere logiske grove tekstur-kart, oppstÃĨr utfordringer som tekstur-hull fra rendering-prosesser og lys-skygger fra 2D-bilde-diffusjonsmodeller. For ÃĨ lÃļse disse, utfÃļrer Paint3D en diffusjons-prosess i UV-rom basert pÃĨ den grove tekstur-kart, og forbedrer det visuelle uttrykket og lÃļser problemene.
Imidlertid, kan forbedring av tekstur-kart i UV-rom introdusere diskontinuiteter pÃĨ grunn av fragmentering av kontinuerlige teksturer i separate fragmenter. For ÃĨ mildne dette, forbedrer Paint3D tekstur-kart ved ÃĨ bruke naboinformasjonen til tekstur-fragmenter. I UV-rom, representerer posisjons-kartet 3D-naboinformasjonen til tekstur-fragmenter, og behandler hver non-bakgrunns-element som en 3D-punktkoordinat. Modellen bruker en ekstra posisjons-kart-encoder, lignende ControlNet, for ÃĨ integrere denne naboinformasjonen under diffusjons-prosessen.
Modellen bruker samtidig posisjonen til den betingede encoder og andre encodere for ÃĨ utfÃļre forbedrings-oppgaver i UV-rom, og tilbyr to evner: UVHD (UV High Definition) og UV-inpainting. UVHD forbedrer det visuelle uttrykket og estetikken, og bruker en bilde-forbedrings-encoder og posisjons-encoder med diffusjonsmodellen. UV-inpainting fyller tekstur-hull, og unngÃĨr selv-occlusion-problemer fra rendering. Forbedrings-fasen begynner med UV-inpainting, og fÃļlges av UVHD for ÃĨ produsere en endelig forbedret tekstur-kart.
Ved ÃĨ integrere disse forbedrings-metodene, genererer Paint3D-rammeverket fullstendige, diverse, hÃļyopplÃļselige og lys-frie UV-teksturer, og gjÃļr det til en robust lÃļsning for teksturering av 3D-objekter.
Paint3D: Eksperimenter og Resultater
Paint3D-modellen bruker Stable Diffusion text2image-modellen for ÃĨ hjelpe med tekstur-genererings-oppgaver, mens bilde-encoder-komponenten hÃĨndterer bilde-betingelser. For ÃĨ forbedre kontrollen over betingede oppgaver som bilde-inpainting, dybde-hÃĨndtering og hÃļyopplÃļselige bilder, bruker Paint3D-rammeverket ControlNet-domene-encodere. Modellen er implementert pÃĨ PyTorch-rammeverket, og rendering og tekstur-projeksjoner utfÃļres pÃĨ Kaolin.
Tekst til Teksturer Sammenligning
For ÃĨ evaluere Paint3D-s ytelse, begynner vi med ÃĨ analysere dens tekstur-generering nÃĨr den er betinget med tekstlige pÃĨminnelser, og sammenligner det med nÃĨvÃĶrende state-of-the-art-rammeverk som Text2Tex, TEXTure og LatentPaint. Som vist i fÃļlgende bilde, overgÃĨr Paint3D-rammeverket ikke bare i ÃĨ generere hÃļykvalitets-tekstur-detajler, men ogsÃĨ i ÃĨ syntetisere en lys-fri tekstur-kart.
Ved ÃĨ utnytte de robuste evnene til Stable Diffusion og ControlNet-encodere, tilbyr Paint3D overlegen tekstur-kvalitet og fleksibilitet. Sammenligningen hÃļydepunkter Paint3D-s evne til ÃĨ produsere detaljerte, hÃļyopplÃļselige teksturer uten innlemmet lys, og gjÃļr det til en ledende lÃļsning for 3D-teksturering-oppgaver.

I sammenligning, er Latent-Paint-rammeverket utsatt for ÃĨ generere uklare teksturer som resulterer i underoptimalt visuelt uttrykk. PÃĨ den andre siden, selv om TEXTure-rammeverket genererer klare teksturer, mangler det smidighet og viser merkbar splicing og sÃļm. Til slutt, genererer Text2Tex-rammeverket glatte teksturer merkelig godt, men det feiler i ÃĨ replikere ytelsen for ÃĨ generere fine teksturer med intrikate detaljer. FÃļlgende bilde sammenligner Paint3D-rammeverket med nÃĨvÃĶrende state-of-the-art-rammeverk kvantitativt.

Som det kan observeres, overgÃĨr Paint3D-rammeverket alle eksisterende modeller, og med en betydelig margin pÃĨ nesten 30% forbedring i FID-baselinjen og omtrent 40% forbedring i KID-baselinjen. Forbedringen i FID- og KID-baselinjene demonstrerer Paint3D-s evne til ÃĨ generere hÃļykvalitets-teksturer over diverse objekter og kategorier.
Bilde til Tekstur Sammenligning
For ÃĨ generere Paint3D-s generative evner ved hjelp av visuelle pÃĨminnelser, bruker vi TEXTure-modellen som baselinjen. Som nevnt tidligere, bruker Paint3D-modellen en bilde-encoder fra text2image-modellen fra Stable Diffusion. Som det kan sees i fÃļlgende bilde, syntetiserer Paint3D-rammeverket usedvanlige teksturer merkelig godt, og er fortsatt i stand til ÃĨ opprettholde hÃļy trofasthet i forhold til bilde-betingelsen.

PÃĨ den andre siden, er TEXTure-rammeverket i stand til ÃĨ generere en tekstur lik Paint3D, men det feiler i ÃĨ representere tekstur-detajlene i bilde-betingelsen nÃļyaktig. Videre, som demonstrert i fÃļlgende bilde, leverer Paint3D-rammeverket bedre FID- og KID-baselinje-resultater enn TEXTure-rammeverket, med den fÃļrste som gÃĨr ned fra 40,83 til 26,86, mens den andre viser en nedgang fra 9,76 til 4,94.

Slutt tanker
I denne artikkelen har vi diskutert Paint3D, et nytt coarse-to-fine-rammeverk som kan produsere lys-frie, diverse og hÃļyopplÃļselige 2K UV-teksturer for uteksturede 3D-mesh, betinget pÃĨ enten visuelle eller tekstlige innputt. Hoved-hÃļydepunktet til Paint3D-rammeverket er at det er i stand til ÃĨ generere lys-frie hÃļyopplÃļselige 2K UV-teksturer som er semantisk konsistente uten ÃĨ vÃĶre betinget pÃĨ bilde- eller tekst-innputt. Takket vÃĶre sin coarse-to-fine-tilnÃĶrming, produserer Paint3D-rammeverket lys-frie, diverse og hÃļyopplÃļselige tekstur-kart, og leverer bedre ytelse enn nÃĨvÃĶrende state-of-the-art-rammeverk.












