AI-modeller og platforme

Paint3D: En lysfri diffusionsmodel til billedgenerering

mm
Føj Unite.AI til dine foretrukne kilder på Google

Den hurtige udvikling af AI-generative modeller, især dybe generative AI-modeller, har betydeligt udvidet mulighederne for naturlig sproggenerering, 3D-generering, billedgenerering og tale-syntese. Disse modeller har revolutioneret 3D-produktion i forskellige brancher. Men mange står over for en udfordring: deres komplekse wiring og genererede mesh’er er ofte ikke kompatible med traditionelle renderings-pipelines som f.eks. Physically Based Rendering (PBR). Diffusionsbaserede modeller, især uden lys-texturer, viser imponerende diverse 3D-aktivgenerering og forbedrer 3D-rammer i filmproduktion, spil og AR/VR.

Denne artikel introducerer Paint3D, et nyt framework til produktion af diverse, højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur, betinget af visuelle eller tekstuelle input. Paint3D’s primære udfordring er at generere højkvalitets-texturer uden indbygget belysning, hvilket muliggør bruger-redigering eller gen-belysning inden for moderne grafik-pipelines. Det anvender en pre-trænet 2D-diffusionsmodel til multi-view texture-fusion, genererer initialt grove teksturkort. Men disse kort viser ofte belysnings-artefakter og ufuldstændige områder på grund af 2D-modellens begrænsninger i at deaktivere lys-effekter og fuldt ud repræsentere 3D-former. Vi vil dykke ned i Paint3D’s funktionsmåde, arkitektur og sammenligninger med andre dybe generative rammer. Lad os begynde.

Paint3D: En introduktion

Evnerne hos dybe generative AI-modeller i naturlig sproggenerering, 3D-generering og billedsyntese er velkendte og implementeret i virkelige anvendelser, hvilket har revolutioneret 3D-genereringsindustrien. Trods deres bemærkelsesværdige evner genererer moderne dybe generative AI-rammer mesh’er, der er karakteriseret ved kompleks wiring og kaotisk belysnings-textur, der ofte er inkompatibel med konventionelle renderings-pipelines, herunder PBR eller Physically Based Rendering. Ligesom dybe generative AI-modeller har texture-syntese også udviklet sig hurtigt, især i brugen af 2D-diffusionsmodeller. Texture-syntese-modeller anvender pre-trænede depth-to-image-diffusionsmodeller effektivt til at anvende tekst-betingelser til at generere højkvalitets-texturer. Men disse tilgange står over for problemer med for-lyst texturer, der kan have en betydelig indvirkning på den endelige 3D-miljø-rendering og introducere lys-fejl, når lyset ændres inden for de almindelige arbejdsgange, som vist i følgende billede.

Som det kan observeres, fungerer tekstur-kortet med fri belysning i harmoni med de traditionelle renderings-pipelines og leverer præcise resultater, mens tekstur-kortet med for-lyst belysning indeholder upassende skygger, når gen-belysning anvendes. På den anden side tilbyder texture-genererings-rammer, der er trænet på 3D-data, en alternativ tilgang, hvor rammen genererer teksturer ved at forstå en bestemt 3D-objects fulde geometri. Selv om de måske leverer bedre resultater, mangler texture-genererings-rammer, der er trænet på 3D-data, generaliserings-evner, hvilket hindrer deres evne til at anvende modellen til 3D-objekter uden for deres træningsdata.

Nuværende texture-genererings-modeller står over for to kritiske udfordringer: brugen af billed-vejledning eller diverse prompts til at opnå en bredere grad af generalisering på tværs af forskellige objekter, og den anden udfordring er elimineringen af koblet belysning på resultaterne fra for-træning. For-lyst texturer kan potentielt forstyrre den endelige teksturering af objekter inden for renderings-motorer, og da de pre-trænede 2D-diffusionsmodeller kun giver 2D-resultater i vis-domænet, mangler de en fuldstændig forståelse af former, hvilket fører til, at de ikke kan opretholde vis-konsistens for 3D-objekter.

På grund af de nævnte udfordringer forsøger Paint3D-rammen at udvikle en dual-stage texture-diffusionsmodel til 3D-objekter, der generaliserer til forskellige pre-trænede generative modeller og bevare vis-konsistens, samtidig med at den lærer lys-fri tekstur-generering.

Paint3D er en dual-stage grov til fin tekstur-genereringsmodel, der søger at udnytte de stærke prompt-vejledning og billed-genererings-evner hos pre-trænede generative AI-modeller til at teksturere 3D-objekter. I den første fase sampler Paint3D-rammen multi-view-billeder fra en pre-trænet dybde-bevidst 2D-billed-diffusionsmodel progressivt for at muliggøre generalisering af højkvalitets- og rig tekstur-resultater fra diverse prompts. Modellen genererer derefter en initial tekstur-kort ved at projektere disse billeder på 3D-mesh-overfladen. I den anden fase fokuserer modellen på at generere lys-frie texturer ved at implementere tilgange, der er anvendt af diffusionsmodeller specialiseret i fjernelse af lys-påvirkninger og form-bevidst forbedring af ufuldstændige områder. Gennem hele processen er Paint3D-rammen konsekvent i stand til at generere højkvalitets-2K-texturer semantisk og eliminerer intrinsiske belysnings-effekter.

For at sammenfatte er Paint3D en ny grov til fin generativ AI-model, der søger at producere diverse, lys-frie og højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur for at opnå state-of-the-art-præstation i teksturering af 3D-objekter med forskellige betingelser, herunder tekst og billeder, og tilbyder en betydelig fordel for syntese- og grafik-redigering-opgaver.

Metodologi og Arkitektur

Paint3D-rammen genererer og forbedrer tekstur-kort progressivt for at generere diverse og højkvalitets-textur-kort til 3D-modeller med ønskede betingelser, herunder billeder og prompts, som vist i følgende billede.

I den grove fase anvender Paint3D-modellen pre-trænede 2D-billed-diffusionsmodeller til at sample multi-view-billeder og derefter oprette de initialt tekstur-kort ved at projektere disse billeder på mesh-overfladen. I den anden fase, dvs. forbedrings-fasen, anvender Paint3D-modellen en diffusions-proces i UV-rummet til at forbedre de grove tekstur-kort, hvilket opnår højkvalitets-, inpainting- og lys-fri funktion, der sikrer den visuelle appel og fuldstændighed af den endelige tekstur.

Stage 1: Progressiv grov tekstur-generering

I den progressive grove tekstur-genererings-fase genererer Paint3D-modellen en grov UV-textur-kort til 3D-mesh’er, der anvender en pre-trænet dybde-bevidst 2D-diffusionsmodel. For at være mere specifik anvender modellen først forskellige kamera-views til at rendre dybde-kortet, derefter anvender den dybde-betingelser til at sample billeder fra billed-diffusions-modellen og derefter projektere disse billeder på mesh-overfladen. Rammen udfører rendering-, sampling- og projekterings-tilgange alternativt for at forbedre konsistensen af tekstur-mesh’er, hvilket ultimativt hjælper med den progressive generering af tekstur-kortet.

Modellen starter med at generere teksturen af den synlige region med kamera-views, der fokuserer på 3D-mesh’en, og render 3D-mesh’en til et dybde-kort fra den første view. Modellen sampler derefter en tekstur-billede for en fremtrædelses-betingelse og en dybde-betingelse. Modellen projekterer derefter billedet på 3D-mesh’en. For kamera-views udfører Paint3D-modellen en lignende tilgang, men med en lille ændring ved at udføre tekstur-sampling-processen ved hjælp af en billed-male-tilgang. Dessuden tager modellen de teksturerede områder fra tidligere kamera-views i betragtning, hvilket tillader renderings-processen ikke kun at udgive et dybde-billede, men også et delvist farvet RGB-billede med en ufarget maske i den aktuelle view.

Modellen anvender derefter en dybde-bevidst billed-inpainting-model med en inpainting-encoder til at udfylde den ufargede område inden for RGB-billedet. Modellen genererer derefter tekstur-kortet fra view ved at projektere det inpainted-billede på 3D-mesh-under den aktuelle view, hvilket tillader modellen at generere tekstur-kortet progressivt og ankomme til den fuldstændige grove struktur-kort. Til sidst udvider modellen tekstur-sampling-processen til en scene eller objekt med multiple views. For at være mere specifik anvender modellen et par kameraer til at fange to dybde-kort under den første tekstur-sampling fra symmetriske kamera-views. Modellen kombinerer derefter de to dybde-kort og komponerer et dybde-grid. Modellen erstatter den enkelt dybde-billede med dybde-gridet til at udføre multi-view dybde-bevidst tekstur-sampling.

Stage 2: Tekstur-forbedring i UV-rummet

Selv om udseendet af grove tekstur-kort er logisk, står det over for nogle udfordringer, såsom tekstur-huller, der opstår under renderings-processen på grund af selv-occlusion eller lys-skygger på grund af anvendelsen af 2D-billed-diffusionsmodeller. Paint3D-modellen søger at udføre en diffusions-proces i UV-rummet på basis af en grov tekstur-kort for at mildne disse problemer og forbedre den visuelle appel af tekstur-kortet yderligere under tekstur-forbedring. Men forbedring af den mainstream billed-diffusions-model med tekstur-kort i UV-rummet introducerer tekstur-discontinuitet, da tekstur-kortet er genereret af UV-mapping af 3D-overfladens tekstur, der skærer den kontinuerte tekstur i en række separate fragmenter i UV-rummet. Som følge af fragmenteringen har modellen svært ved at lære 3D-nærheds-forhold mellem fragmenterne, hvilket fører til tekstur-discontinuitets-problemer.

Modellen forbedrer tekstur-kortet i UV-rummet ved at udføre diffusions-processen under vejledning af tekstur-fragmenters nærheds-information. Det er vigtigt at bemærke, at i UV-rummet repræsenterer position-kortet 3D-nærheds-informationen af tekstur-fragmenter, hvor modellen behandler hver non-baggrundselement som en 3D-punktkoordinat. Under diffusions-processen fusionerer modellen 3D-nærheds-informationen ved at tilføje en individuel position-kort-encoder til den pre-trænede billed-diffusions-model. Den nye encoder ligner designet af ControlNet-rammen og har samme arkitektur som encoderen implementeret i billed-diffusions-modellen med zero-convolution-laget, der forbinder de to. Dessuden er tekstur-diffusions-modellen trænet på en dataset, der består af tekstur- og position-kort, og modellen lærer at forudsige støjen, der er tilføjet til den støjende latente. Modellen optimerer derefter position-encoderen og fryser den trænede støj-reducer for dens billed-diffusions-opgave.

Modellen anvender derefter positionen af betinget encoder og andre encodere til at udføre forbedrings-opgaver i UV-rummet. I denne henseende har modellen to forbedrings-evner: UVHD eller UV High Definition og UV-inpainting. UVHD-metoden er struktureret til at forbedre den visuelle appel og æstetikken af tekstur-kortet. For at opnå UVHD anvender modellen en billed-forbedrings-encoder og en position-encoder med diffusions-modellen. Modellen anvender UV-inpainting-metoden til at udfylde tekstur-hullerne inden for UV-planen, der kan undgå selv-occlusion-problemer, der opstår under renderings-processen. I forbedrings-fasen udfører Paint3D-modellen først UV-inpainting og derefter UVHD for at generere det endelige forbedrede tekstur-kort. Ved at integrere de to forbedrings-metoder kan Paint3D-rammen producere fuldstændige, diverse, højopløselige og lys-frie UV-textur-kort.

Paint3D: Eksperimenter og resultater

Paint3D-modellen anvender Stable Diffusion-text2image-modellen til at hjælpe den med tekstur-genererings-opgaver, mens den anvender billed-encoder-komponenten til at håndtere billed-betingelser. For yderligere at forbedre dens greb om betingede kontroller som billed-inpainting, dybde og billed-høj-definition anvender Paint3D-rammen ControlNet-domæne-encodere. Modellen er implementeret på PyTorch-rammen med rendering og tekstur-projektioner implementeret på Kaolin.

Tekst til texturer-sammenligning

For at analysere dens præstation starter vi med at evaluere Paint3D’s tekstur-genererings-effekt, når den er betinget af tekstuelle prompts, og sammenligner den med state-of-the-art-rammer, herunder Text2Tex, TEXTure og LatentPaint. Som det kan observeres i følgende billede, udfører Paint3D-rammen ikke kun generering af højkvalitets-tekstur-detajler, men den syntetiserer også en lys-fri tekstur-kort rimeligt godt.

I sammenligning er Latent-Paint-rammen tilbøjelig til at generere uklare texturer, der resulterer i underoptimal visuel effekt. På den anden side, selv om TEXTure-rammen genererer klare texturer, mangler den glatthed og viser tydelige sammenføjninger og søm. Til sidst genererer Text2Tex-rammen glatte texturer bemærkelsesværdigt godt, men den kan ikke gentage præstationen for generering af fine texturer med intrikate detaljer.

Følgende billede sammenligner Paint3D-rammen med state-of-the-art-rammer kvantitativt.

Som det kan observeres, udfører Paint3D-rammen bedre end alle eksisterende modeller, og med en betydelig margin på næsten 30% forbedring i FID-basen og ca. 40% forbedring i KID-basen. Forbedringen i FID- og KID-basen viser Paint3D’s evne til at generere højkvalitets-texturer på tværs af diverse objekter og kategorier.

Billede til tekstur-sammenligning

For at generere Paint3D’s generative evner ved hjælp af visuelle prompts, anvender vi TEXTure-modellen som baseline. Som nævnt tidligere anvender Paint3D-modellen en billed-encoder fra text2image-modellen fra Stable Diffusion. Som det kan ses i følgende billede, syntetiserer Paint3D-rammen udsøgte texturer bemærkelsesværdigt godt og kan stadig opretholde høj trofasthed i forhold til billed-betingelsen.

På den anden side kan TEXTure-rammen generere en tekstur, der ligner Paint3D, men den mangler at repræsentere tekstur-detajlerne i billed-betingelsen nøjagtigt. Dessuten, som vist i følgende billede, leverer Paint3D-rammen bedre FID- og KID-baseline-scores, når sammenlignet med TEXTure-rammen, hvor den første falder fra 40,83 til 26,86, mens den sidste viser en fald fra 9,76 til 4,94.

Endelige tanker

I denne artikel har vi talt om Paint3D, en grov til fin ny ramme, der kan producere lys-frie, diverse og højopløselige 2K UV-texturkort til 3D-mesh’er uden tekstur, betinget af visuelle eller tekstuelle input. Paint3D-rammens primære højdepunkt er, at den kan generere lys-frie højopløselige 2K UV-texturer, der er semantisk konsistente uden at være betinget af billed- eller tekst-input. Takket være sin grov til fin-tilgang producerer Paint3D-rammen lys-frie, diverse og højopløselige tekstur-kort og leverer bedre præstation end nuværende state-of-the-art-rammer.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.