AI-modeller og platforme
Paint3D: En lysfri diffusionsmodel til billedgenerering
Den hurtige udvikling af AI-generative modeller, især dybe generative AI-modeller, har betydeligt udvidet mulighederne for naturlig sproggenerering, 3D-generering, billedgenerering og tale-syntese. Disse modeller har revolutioneret 3D-produktion i forskellige brancher. Men mange står over for en udfordring: deres komplekse wiring og genererede mesh’er er ofte ikke kompatible med traditionelle renderings-pipelines som f.eks. Physically Based Rendering (PBR). Diffusionsbaserede modeller, især uden lys-texturer, viser imponerende diverse 3D-aktivgenerering og forbedrer 3D-rammer i filmproduktion, spil og AR/VR.
Denne artikel introducerer Paint3D, et nyt framework til produktion af diverse, højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur, betinget af visuelle eller tekstuelle input. Paint3D’s primære udfordring er at generere højkvalitets-texturer uden indbygget belysning, hvilket muliggør bruger-redigering eller gen-belysning inden for moderne grafik-pipelines. Det anvender en pre-trænet 2D-diffusionsmodel til multi-view texture-fusion, genererer initialt grove teksturkort. Men disse kort viser ofte belysnings-artefakter og ufuldstændige områder på grund af 2D-modellens begrænsninger i at deaktivere lys-effekter og fuldt ud repræsentere 3D-former. Vi vil dykke ned i Paint3D’s funktionsmåde, arkitektur og sammenligninger med andre dybe generative rammer. Lad os begynde.
Paint3D: En introduktion
Evnerne hos dybe generative AI-modeller i naturlig sproggenerering, 3D-generering og billedsyntese er velkendte og implementeret i virkelige anvendelser, hvilket har revolutioneret 3D-genereringsindustrien. Trods deres bemærkelsesværdige evner genererer moderne dybe generative AI-rammer mesh’er, der er karakteriseret ved kompleks wiring og kaotisk belysnings-textur, der ofte er inkompatibel med konventionelle renderings-pipelines, herunder PBR eller Physically Based Rendering. Ligesom dybe generative AI-modeller har texture-syntese også udviklet sig hurtigt, især i brugen af 2D-diffusionsmodeller. Texture-syntese-modeller anvender pre-trænede depth-to-image-diffusionsmodeller effektivt til at anvende tekst-betingelser til at generere højkvalitets-texturer. Men disse tilgange står over for problemer med for-lyst texturer, der kan have en betydelig indvirkning på den endelige 3D-miljø-rendering og introducere lys-fejl, når lyset ændres inden for de almindelige arbejdsgange, som vist i følgende billede.

Som det kan observeres, fungerer tekstur-kortet med fri belysning i harmoni med de traditionelle renderings-pipelines og leverer præcise resultater, mens tekstur-kortet med for-lyst belysning indeholder upassende skygger, når gen-belysning anvendes. På den anden side tilbyder texture-genererings-rammer, der er trænet på 3D-data, en alternativ tilgang, hvor rammen genererer teksturer ved at forstå en bestemt 3D-objects fulde geometri. Selv om de måske leverer bedre resultater, mangler texture-genererings-rammer, der er trænet på 3D-data, generaliserings-evner, hvilket hindrer deres evne til at anvende modellen til 3D-objekter uden for deres træningsdata.
Nuværende texture-genererings-modeller står over for to kritiske udfordringer: brugen af billed-vejledning eller diverse prompts til at opnå en bredere grad af generalisering på tværs af forskellige objekter, og den anden udfordring er elimineringen af koblet belysning på resultaterne fra for-træning. For-lyst texturer kan potentielt forstyrre den endelige teksturering af objekter inden for renderings-motorer, og da de pre-trænede 2D-diffusionsmodeller kun giver 2D-resultater i vis-domænet, mangler de en fuldstændig forståelse af former, hvilket fører til, at de ikke kan opretholde vis-konsistens for 3D-objekter.
På grund af de nævnte udfordringer forsøger Paint3D-rammen at udvikle en dual-stage texture-diffusionsmodel til 3D-objekter, der generaliserer til forskellige pre-trænede generative modeller og bevare vis-konsistens, samtidig med at den lærer lys-fri tekstur-generering.
Paint3D er en dual-stage grov til fin tekstur-genereringsmodel, der søger at udnytte de stærke prompt-vejledning og billed-genererings-evner hos pre-trænede generative AI-modeller til at teksturere 3D-objekter. I den første fase sampler Paint3D-rammen multi-view-billeder fra en pre-trænet dybde-bevidst 2D-billed-diffusionsmodel progressivt for at muliggøre generalisering af højkvalitets- og rig tekstur-resultater fra diverse prompts. Modellen genererer derefter en initial tekstur-kort ved at projektere disse billeder på 3D-mesh-overfladen. I den anden fase fokuserer modellen på at generere lys-frie texturer ved at implementere tilgange, der er anvendt af diffusionsmodeller specialiseret i fjernelse af lys-påvirkninger og form-bevidst forbedring af ufuldstændige områder. Gennem hele processen er Paint3D-rammen konsekvent i stand til at generere højkvalitets-2K-texturer semantisk og eliminerer intrinsiske belysnings-effekter.

For at sammenfatte er Paint3D en ny grov til fin generativ AI-model, der søger at producere diverse, lys-frie og højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur for at opnå state-of-the-art-præstation i teksturering af 3D-objekter med forskellige betingelser, herunder tekst og billeder, og tilbyder en betydelig fordel for syntese- og grafik-redigering-opgaver.
Metodologi og Arkitektur
Paint3D-rammen genererer og forbedrer tekstur-kort progressivt for at generere diverse og højkvalitets-textur-kort til 3D-modeller med ønskede betingelser, herunder billeder og prompts, som vist i følgende billede.

I den grove fase anvender Paint3D-modellen pre-trænede 2D-billed-diffusionsmodeller til at sample multi-view-billeder og derefter oprette de initialt tekstur-kort ved at projektere disse billeder på mesh-overfladen. I den anden fase, dvs. forbedrings-fasen, anvender Paint3D-modellen en diffusions-proces i UV-rummet til at forbedre de grove tekstur-kort, hvilket opnår højkvalitets-, inpainting- og lys-fri funktion, der sikrer den visuelle appel og fuldstændighed af den endelige tekstur.
Stage 1: Progressiv grov tekstur-generering
I den progressive grove tekstur-genererings-fase genererer Paint3D-modellen en grov UV-textur-kort til 3D-mesh’er, der anvender en pre-trænet dybde-bevidst 2D-diffusionsmodel. For at være mere specifik anvender modellen først forskellige kamera-views til at rendre dybde-kortet, derefter anvender den dybde-betingelser til at sample billeder fra billed-diffusions-modellen og derefter projektere disse billeder på mesh-overfladen. Rammen udfører rendering-, sampling- og projekterings-tilgange alternativt for at forbedre konsistensen af tekstur-mesh’er, hvilket ultimativt hjælper med den progressive generering af tekstur-kortet.
Modellen starter med at generere teksturen af den synlige region med kamera-views, der fokuserer på 3D-mesh’en, og render 3D-mesh’en til et dybde-kort fra den første view. Modellen sampler derefter en tekstur-billede for en fremtrædelses-betingelse og en dybde-betingelse. Modellen projekterer derefter billedet på 3D-mesh’en. For kamera-views udfører Paint3D-modellen en lignende tilgang, men med en lille ændring ved at udføre tekstur-sampling-processen ved hjælp af en billed-male-tilgang. Dessuden tager modellen de teksturerede områder fra tidligere kamera-views i betragtning, hvilket tillader renderings-processen ikke kun at udgive et dybde-billede, men også et delvist farvet RGB-billede med en ufarget maske i den aktuelle view.
Modellen anvender derefter en dybde-bevidst billed-inpainting-model med en inpainting-encoder til at udfylde den ufargede område inden for RGB-billedet. Modellen genererer derefter tekstur-kortet fra view ved at projektere det inpainted-billede på 3D-mesh-under den aktuelle view, hvilket tillader modellen at generere tekstur-kortet progressivt og ankomme til den fuldstændige grove struktur-kort. Til sidst udvider modellen tekstur-sampling-processen til en scene eller objekt med multiple views. For at være mere specifik anvender modellen et par kameraer til at fange to dybde-kort under den første tekstur-sampling fra symmetriske kamera-views. Modellen kombinerer derefter de to dybde-kort og komponerer et dybde-grid. Modellen erstatter den enkelt dybde-billede med dybde-gridet til at udføre multi-view dybde-bevidst tekstur-sampling.
Stage 2: Tekstur-forbedring i UV-rummet
Selv om udseendet af grove tekstur-kort er logisk, står det over for nogle udfordringer, såsom tekstur-huller, der opstår under renderings-processen på grund af selv-occlusion eller lys-skygger på grund af anvendelsen af 2D-billed-diffusionsmodeller. Paint3D-modellen søger at udføre en diffusions-proces i UV-rummet på basis af en grov tekstur-kort for at mildne disse problemer og forbedre den visuelle appel af tekstur-kortet yderligere under tekstur-forbedring. Men forbedring af den mainstream billed-diffusions-model med tekstur-kort i UV-rummet introducerer tekstur-discontinuitet, da tekstur-kortet er genereret af UV-mapping af 3D-overfladens tekstur, der skærer den kontinuerte tekstur i en række separate fragmenter i UV-rummet. Som følge af fragmenteringen har modellen svært ved at lære 3D-nærheds-forhold mellem fragmenterne, hvilket fører til tekstur-discontinuitets-problemer.
Modellen forbedrer tekstur-kortet i UV-rummet ved at udføre diffusions-processen under vejledning af tekstur-fragmenters nærheds-information. Det er vigtigt at bemærke, at i UV-rummet repræsenterer position-kortet 3D-nærheds-informationen af tekstur-fragmenter, hvor modellen behandler hver non-baggrundselement som en 3D-punktkoordinat. Under diffusions-processen fusionerer modellen 3D-nærheds-informationen ved at tilføje en individuel position-kort-encoder til den pre-trænede billed-diffusions-model. Den nye encoder ligner designet af ControlNet-rammen og har samme arkitektur som encoderen implementeret i billed-diffusions-modellen med zero-convolution-laget, der forbinder de to. Dessuden er tekstur-diffusions-modellen trænet på en dataset, der består af tekstur- og position-kort, og modellen lærer at forudsige støjen, der er tilføjet til den støjende latente. Modellen optimerer derefter position-encoderen og fryser den trænede støj-reducer for dens billed-diffusions-opgave.
Modellen anvender derefter positionen af betinget encoder og andre encodere til at udføre forbedrings-opgaver i UV-rummet. I denne henseende har modellen to forbedrings-evner: UVHD eller UV High Definition og UV-inpainting. UVHD-metoden er struktureret til at forbedre den visuelle appel og æstetikken af tekstur-kortet. For at opnå UVHD anvender modellen en billed-forbedrings-encoder og en position-encoder med diffusions-modellen. Modellen anvender UV-inpainting-metoden til at udfylde tekstur-hullerne inden for UV-planen, der kan undgå selv-occlusion-problemer, der opstår under renderings-processen. I forbedrings-fasen udfører Paint3D-modellen først UV-inpainting og derefter UVHD for at generere det endelige forbedrede tekstur-kort. Ved at integrere de to forbedrings-metoder kan Paint3D-rammen producere fuldstændige, diverse, højopløselige og lys-frie UV-textur-kort.
Paint3D: Eksperimenter og resultater
Paint3D-modellen anvender Stable Diffusion-text2image-modellen til at hjælpe den med tekstur-genererings-opgaver, mens den anvender billed-encoder-komponenten til at håndtere billed-betingelser. For yderligere at forbedre dens greb om betingede kontroller som billed-inpainting, dybde og billed-høj-definition anvender Paint3D-rammen ControlNet-domæne-encodere. Modellen er implementeret på PyTorch-rammen med rendering og tekstur-projektioner implementeret på Kaolin.
Tekst til texturer-sammenligning
For at analysere dens præstation starter vi med at evaluere Paint3D’s tekstur-genererings-effekt, når den er betinget af tekstuelle prompts, og sammenligner den med state-of-the-art-rammer, herunder Text2Tex, TEXTure og LatentPaint. Som det kan observeres i følgende billede, udfører Paint3D-rammen ikke kun generering af højkvalitets-tekstur-detajler, men den syntetiserer også en lys-fri tekstur-kort rimeligt godt.

I sammenligning er Latent-Paint-rammen tilbøjelig til at generere uklare texturer, der resulterer i underoptimal visuel effekt. På den anden side, selv om TEXTure-rammen genererer klare texturer, mangler den glatthed og viser tydelige sammenføjninger og søm. Til sidst genererer Text2Tex-rammen glatte texturer bemærkelsesværdigt godt, men den kan ikke gentage præstationen for generering af fine texturer med intrikate detaljer.
Følgende billede sammenligner Paint3D-rammen med state-of-the-art-rammer kvantitativt.

Som det kan observeres, udfører Paint3D-rammen bedre end alle eksisterende modeller, og med en betydelig margin på næsten 30% forbedring i FID-basen og ca. 40% forbedring i KID-basen. Forbedringen i FID- og KID-basen viser Paint3D’s evne til at generere højkvalitets-texturer på tværs af diverse objekter og kategorier.
Billede til tekstur-sammenligning
For at generere Paint3D’s generative evner ved hjælp af visuelle prompts, anvender vi TEXTure-modellen som baseline. Som nævnt tidligere anvender Paint3D-modellen en billed-encoder fra text2image-modellen fra Stable Diffusion. Som det kan ses i følgende billede, syntetiserer Paint3D-rammen udsøgte texturer bemærkelsesværdigt godt og kan stadig opretholde høj trofasthed i forhold til billed-betingelsen.

På den anden side kan TEXTure-rammen generere en tekstur, der ligner Paint3D, men den mangler at repræsentere tekstur-detajlerne i billed-betingelsen nøjagtigt. Dessuten, som vist i følgende billede, leverer Paint3D-rammen bedre FID- og KID-baseline-scores, når sammenlignet med TEXTure-rammen, hvor den første falder fra 40,83 til 26,86, mens den sidste viser en fald fra 9,76 til 4,94.

Endelige tanker
I denne artikel har vi talt om Paint3D, en grov til fin ny ramme, der kan producere lys-frie, diverse og højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur, betinget af visuelle eller tekstuelle input. Paint3D-rammens primære højdepunkt er, at den kan generere lys-frie højopløselige 2K UV-texturer, der er semantisk konsistente uden at være betinget af billed- eller tekst-input. Takket være sin grov til fin-tilgang producerer Paint3D-rammen lys-frie, diverse og højopløselige tekstur-kort og leverer bedre præstation end nuværende state-of-the-art-rammer.












