AI-modeller og platforme
Paint3D: En Introduktion
Udviklingen af dybe generative AI-modeller har accelereret udviklingen af AI med bemÃĶrkelsesvÃĶrdige evner i naturlig sproggenerering, 3D-generering, billedegenerering og tale-syntese. 3D-generative modeller har forandret mange industrier og anvendelser og har revolutioneret den nuvÃĶrende 3D-produktionslandskab. Men mange nuvÃĶrende dybe generative modeller mÃļder et fÃĶlles problem: kompleks kabling og genererede meshâer med lys-texturer er ofte inkompatible med traditionelle renderings-pipelines som PBR (Physically Based Rendering). Diffusions-baserede modeller, som genererer 3D-aktiver uden lys-texturer, besidder bemÃĶrkelsesvÃĶrdige evner til divers 3D-aktiver-generering og udvider eksisterende 3D-rammer pÃĨ tvÃĶrs af industrier som film, spil og forstÃĶrket/virtuel virkelighed.
I denne artikel vil vi diskutere Paint3D, en ny, grov-til-fine ramme, der kan producere diverse, hÃļjoplÃļselige 2K UV-texturkort til 3D-meshâer uden tekstur, betinget af enten visuelle eller tekstuelle input. Det primÃĶre problem, som Paint3D lÃļser, er generering af hÃļjkvalitets-texturer uden at indlejre lys-information, sÃĨ brugerne kan redigere eller genskabe lys-inden for moderne grafik-pipelines. For at lÃļse dette problem anvender Paint3D-rammen en forudtrÃĶnet 2D-diffusionsmodel til at udfÃļre multi-view-textur-fusion og generere view-betingede billeder, som initialt producerer en grov teksturkort. Men da 2D-modeller ikke fuldstÃĶndigt kan deaktivere lys-effekter eller fuldstÃĶndigt reprÃĶsentere 3D-former, kan teksturkortet udvise lys-artefakter og ufuldstÃĶndige omrÃĨder.
I denne artikel vil vi udforske Paint3D-rammen i dybden, undersÃļge dens arbejde og arkitektur, og sammenligne den med state-of-the-art dybe generative rammer. SÃĨ lad os starte.
Paint3D: En Introduktion
Dybe generative AI-modeller har demonstreret bemÃĶrkelsesvÃĶrdige evner i naturlig sproggenerering, 3D-generering og billede-syntese, og er blevet implementeret i virkelige anvendelser, hvilket har revolutioneret 3D-genererings-industrien. Men pÃĨ trods af deres bemÃĶrkelsesvÃĶrdige evner producerer moderne dybe generative AI-rammer ofte meshâer med kompleks kabling og kaotisk lys-textur, der er inkompatibelt med konventionelle renderings-pipelines, herunder Physically Based Rendering (PBR). Ligesom texture-syntese har fremgangen hurtigt, isÃĶr med brug af 2D-diffusionsmodeller. Disse modeller anvender effektivt forudtrÃĶnede dybde-til-billede-diffusionsmodeller og tekst-betingelser til at generere hÃļjkvalitets-texturer. Men et betydeligt problem bestÃĨr: forud-lyste texturer kan have en negativ indvirkning pÃĨ den endelige 3D-miljÃļ-rendering, introducere lys-fejl, nÃĨr lysene justeres inden for almindelige arbejdsgange, som vist i fÃļlgende billede.

Som observeret fungerer teksturkort uden forud-lysning sammen med traditionelle renderings-pipelines, leverer prÃĶcise resultater. I modsÃĶtning hertil indeholder teksturkort med forud-lysning uheldige skygger, nÃĨr genskabning af lys anvendes. Texture-genererings-rammer, der er trÃĶnet pÃĨ 3D-data, tilbyder en alternativ tilgang, genererer texturer ved at forstÃĨ en bestemt 3D-objects fulde geometri. Selv om disse rammer mÃĨske leverer bedre resultater, mangler de den generaliserings-evne, der er nÃļdvendig for at anvende modellen pÃĨ 3D-objekter uden for deres trÃĶningsdata.
NuvÃĶrende texture-genererings-modeller mÃļder to kritiske udfordringer: opnÃĨelse af bred generalisering pÃĨ tvÃĶrs af forskellige objekter ved hjÃĶlp af billed-vejledning eller diverse prompts, og eliminering af koblet lys fra forud-trÃĶnings-resultater. Forud-lyste texturer kan forstyrre den endelige teksturerede objekters resultater inden for renderings-motorer. Derudover, da forudtrÃĶnede 2D-diffusionsmodeller kun leverer 2D-resultater i view-domÃĶnet, mangler de en omfattende forstÃĨelse af former, hvilket fÃļrer til inkonsistenser i vedligeholdelse af view-konsistens for 3D-objekter.
For at lÃļse disse udfordringer udvikler Paint3D-rammen en dual-stage texture-diffusionsmodel for 3D-objekter, der generaliserer pÃĨ tvÃĶrs af forskellige forudtrÃĶnede generative modeller og bevarer view-konsistens, mens den genererer lys-frie texturer.
Paint3D er en dual-stage, grov-til-fine texture-genereringsmodel, der udnytter den stÃĶrke prompt-vejledning og billede-genererings-evner fra forudtrÃĶnede generative AI-modeller til at teksturere 3D-objekter. I den fÃļrste fase sampler Paint3D multi-view-billeder fra en forudtrÃĶnet dybde-til-billede-diffusionsmodel progressivt, hvilket muliggÃļr generalisering af hÃļjkvalitets, rig tekstur-resultater fra diverse prompts. Modellen genererer derefter en initial teksturkort ved at projicere disse billeder tilbage pÃĨ 3D-mesh-overfladen. I den anden fase fokuserer modellen pÃĨ at generere lys-frie texturer ved at implementere tilgange, der anvendes af diffusionsmodeller, der specialiserer sig i at fjerne lys-pÃĨvirkninger og forfine form-tilhÃļrende ufuldstÃĶndige omrÃĨder. Gennem hele processen genererer Paint3D-rammen konsekvent hÃļjkvalitets 2K-texturer semantisk, eliminerer intrinsiske lys-effekter.

I sammenfattende form er Paint3D en ny, grov-til-fine generativ AI-model designet til at producere diverse, lys-frie, hÃļjoplÃļselige 2K UV-texturkort for 3D-meshâer uden tekstur. Den sigter mod at opnÃĨ state-of-the-art-prÃĶstationer i teksturering af 3D-objekter med forskellige betingede input, herunder tekst og billeder, og tilbyder betydelige fordele for syntese- og grafik-redigering-opgaver.
Metodologi og Arkitektur
Paint3D-rammen genererer og forfiner teksturkort progressivt for at producere diverse og hÃļjkvalitets-texturer for 3D-modeller ved hjÃĶlp af betingede input som billeder og prompts, som vist i fÃļlgende billede.

Stage 1: Progressiv Grov Texture-Generering
I den fÃļrste fase anvender Paint3D forudtrÃĶnede 2D-billede-diffusionsmodeller til at sample multi-view-billeder, der derefter projiceres tilbage pÃĨ mesh-overfladen for at skabe de initielle teksturkort. Denne fase begynder med at generere en dybde-kort fra forskellige kamera-views. Modellen anvender dybde-betingelser til at sample billeder fra diffusionsmodellen, der derefter projiceres tilbage pÃĨ 3D-mesh-overfladen. Denne alternative rendering, sampling og projicering tilgang forbedrer konsistensen af tekstur-meshâer og hjÃĶlper med at generere teksturkort progressivt.
Processen starter med de synlige omrÃĨder af 3D-meshâen, fokuserer pÃĨ at generere tekstur fra den fÃļrste kamera-view ved at rendre 3D-meshâen til en dybde-kort. Et tekstur-billede samples derefter baseret pÃĨ udseende og dybde-betingelser og projiceres tilbage pÃĨ meshâen. Denne metode gentages for efterfÃļlgende viewpoints, integrerer tidligere teksturer for at rendre ikke kun en dybde-billede, men ogsÃĨ en delvist farvet RGB-billede med ufargede masker. Modellen anvender en dybde-til-billede-inpainting-encoder til at udfylde ufargede omrÃĨder, genererer en fuldstÃĶndig grov teksturkort ved at projicere inpainted billeder tilbage pÃĨ 3D-meshâen.
For mere komplekse scener eller objekter anvender modellen multiple views. Initialt fanger den to dybde-kort fra symmetriske viewpoints og kombinerer dem i en dybde-grid, der erstatter en enkelt dybde-billede for multi-view dybde-til-textur-sampling.
Stage 2: Texture-Forfining i UV-Rum
Trods generering af logiske grove teksturkort opstÃĨr udfordringer som tekstur-huller fra renderings-processer og lys-skygger fra 2D-billede-diffusionsmodeller. For at lÃļse disse udfordringer udfÃļrer Paint3D en diffusions-proces i UV-rum baseret pÃĨ den grove teksturkort, forbedrer det visuelle udseende og lÃļser problemerne.
Men forfining af teksturkortet i UV-rum kan introducere diskontinuiteter pÃĨ grund af fragmentering af kontinuerte texturer i separate fragmenter. For at mildne dette forfiner Paint3D teksturkortet ved at anvende tilhÃļrende information om tekstur-fragmenter. I UV-rum reprÃĶsenterer position-kortet 3D-tilhÃļrende information om tekstur-fragmenter, behandler hver non-baggrundselement som en 3D-punktkoordinat. Modellen anvender en ekstra position-kort-encoder, lignende ControlNet, til at integrere denne tilhÃļrende information under diffusions-processen.
Modellen anvender samtidig positionen af den betingede encoder og andre encodere til at udfÃļre forfinings-opgaver i UV-rum, tilbyder to evner: UVHD (UV High Definition) og UV-inpainting. UVHD forbedrer det visuelle udseende og ÃĶstetikken, anvender en billede-forbedrings-encoder og position-encoder med diffusionsmodellen. UV-inpainting udfylder tekstur-huller, undgÃĨr selv-occlusion-problemer fra rendering. Forfinings-fasen starter med UV-inpainting, efterfulgt af UVHD for at producere en endelig forfinet teksturkort.
Ved at integrere disse forfinings-metoder genererer Paint3D-rammen fuldstÃĶndige, diverse, hÃļjoplÃļselige og lys-frie UV-texturkort, hvilket gÃļr det til en robust lÃļsning for teksturering af 3D-objekter.
Paint3D: Eksperimenter og Resultater
Paint3D-modellen anvender Stable Diffusion text2image-modellen til at hjÃĶlpe med tekstur-genererings-opgaver, mens billed-encoder-komponenten hÃĨndterer billed-betingelser. For at forbedre kontrollen over betingede opgaver som billed-inpainting, dybde-hÃĨndtering og hÃļjdefinitions-billeder anvender Paint3D-rammen ControlNet-domÃĶne-encodere. Modellen er implementeret pÃĨ PyTorch-rammen, med rendering og tekstur-projektioner udfÃļrt pÃĨ Kaolin.
Tekst til Texturer Sammenligning
For at evaluere Paint3Dâs prÃĶstationer starter vi med at analysere dens tekstur-generering, nÃĨr betinget med tekstuelle prompts, sammenligner det med state-of-the-art-rammer som Text2Tex, TEXTure og LatentPaint. Som vist i fÃļlgende billede excellerer Paint3D-rammen ikke kun i generering af hÃļjkvalitets tekstur-detajler, men syntetiserer ogsÃĨ en lys-fri teksturkort effektivt.
Ved at udnytte de robuste evner fra Stable Diffusion og ControlNet-encodere tilbyder Paint3D overlegen tekstur-kvalitet og fleksibilitet. Sammenligningen fremhÃĶver Paint3Dâs evne til at producere detaljerede, hÃļjoplÃļselige texturer uden indlejret lys, hvilket gÃļr det til en fÃļrende lÃļsning for 3D-tekstur-opgaver.

I sammenligning er Latent-Paint-rammen tilbÃļjelig til at generere uklare texturer, der resulterer i underoptimalt visuelt udseende. PÃĨ den anden side genererer TEXTure-rammen klare texturer, men mangler glatthed og viser bemÃĶrkelsesvÃĶrdige sammenfÃļjninger og sÃļm. Endelig genererer Text2Tex-rammen glatte texturer bemÃĶrkelsesvÃĶrdigt godt, men den kan ikke replikere prÃĶstationen for generering af fine texturer med intrikate detaljer. FÃļlgende billede sammenligner Paint3D-rammen med state-of-the-art-rammer kvantitativt.Â

Som det kan observeres, overgÃĨr Paint3D-rammen alle eksisterende modeller og med en betydelig margin pÃĨ nÃĶsten 30% forbedring i FID-basen og ca. 40% forbedring i KID-basen. Forbedringen i FID- og KID-basen viser Paint3Dâs evne til at generere hÃļjkvalitets-texturer pÃĨ tvÃĶrs af diverse objekter og kategorier.Â
Billede til Texture Sammenligning
For at generere Paint3Dâs generative evner ved hjÃĶlp af visuelle prompts anvender vi TEXTure-modellen som baseline. Som nÃĶvnt tidligere anvender Paint3D-modellen en billed-encoder fra text2image-modellen fra Stable Diffusion. Som det kan ses i fÃļlgende billede syntetiserer Paint3D-rammen udsÃļgte texturer bemÃĶrkelsesvÃĶrdigt godt og kan stadig opretholde hÃļj trofasthed i forhold til billed-betingelsen.Â

PÃĨ den anden side kan TEXTure-rammen generere en tekstur, der ligner Paint3D, men den mangler at reprÃĶsentere tekstur-detajlerne i billed-betingelsen nÃļjagtigt. Desuden, som vist i fÃļlgende billede, leverer Paint3D-rammen bedre FID- og KID-basen-scores, nÃĨr sammenlignet med TEXTure-rammen, hvor den fÃļrste falder fra 40,83 til 26,86, mens den sidste viser en fald fra 9,76 til 4,94.Â

Endelige Tanker
I denne artikel har vi talt om Paint3D, en ny, grov-til-fine ramme, der kan producere lys-frie, diverse, hÃļjoplÃļselige 2K UV-texturkort for 3D-meshâer uden tekstur, betinget af enten visuelle eller tekstuelle input. Det primÃĶre hÃļjdepunkt ved Paint3D-rammen er, at den kan generere lys-frie hÃļjoplÃļselige 2K-texturer, der er semantisk konsistente uden at vÃĶre betinget af billed- eller tekst-input. Takket vÃĶre sin grov-til-fine tilgang producerer Paint3D-rammen lys-frie, diverse, hÃļjoplÃļselige teksturkort og leverer bedre prÃĶstation end nuvÃĶrende state-of-the-art-rammer.Â












