AI-modeller og platforme

Paint3D: En Introduktion

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Udviklingen af dybe generative AI-modeller har accelereret udviklingen af AI med bemÃĶrkelsesvÃĶrdige evner i naturlig sproggenerering, 3D-generering, billedegenerering og tale-syntese. 3D-generative modeller har forandret mange industrier og anvendelser og har revolutioneret den nuvÃĶrende 3D-produktionslandskab. Men mange nuvÃĶrende dybe generative modeller mÃļder et fÃĶlles problem: kompleks kabling og genererede mesh’er med lys-texturer er ofte inkompatible med traditionelle renderings-pipelines som PBR (Physically Based Rendering). Diffusions-baserede modeller, som genererer 3D-aktiver uden lys-texturer, besidder bemÃĶrkelsesvÃĶrdige evner til divers 3D-aktiver-generering og udvider eksisterende 3D-rammer pÃĨ tvÃĶrs af industrier som film, spil og forstÃĶrket/virtuel virkelighed.

I denne artikel vil vi diskutere Paint3D, en ny, grov-til-fine ramme, der kan producere diverse, hÃļjoplÃļselige 2K UV-texturkort til 3D-mesh’er uden tekstur, betinget af enten visuelle eller tekstuelle input. Det primÃĶre problem, som Paint3D lÃļser, er generering af hÃļjkvalitets-texturer uden at indlejre lys-information, sÃĨ brugerne kan redigere eller genskabe lys-inden for moderne grafik-pipelines. For at lÃļse dette problem anvender Paint3D-rammen en forudtrÃĶnet 2D-diffusionsmodel til at udfÃļre multi-view-textur-fusion og generere view-betingede billeder, som initialt producerer en grov teksturkort. Men da 2D-modeller ikke fuldstÃĶndigt kan deaktivere lys-effekter eller fuldstÃĶndigt reprÃĶsentere 3D-former, kan teksturkortet udvise lys-artefakter og ufuldstÃĶndige omrÃĨder.

I denne artikel vil vi udforske Paint3D-rammen i dybden, undersÃļge dens arbejde og arkitektur, og sammenligne den med state-of-the-art dybe generative rammer. SÃĨ lad os starte.

Paint3D: En Introduktion

Dybe generative AI-modeller har demonstreret bemÃĶrkelsesvÃĶrdige evner i naturlig sproggenerering, 3D-generering og billede-syntese, og er blevet implementeret i virkelige anvendelser, hvilket har revolutioneret 3D-genererings-industrien. Men pÃĨ trods af deres bemÃĶrkelsesvÃĶrdige evner producerer moderne dybe generative AI-rammer ofte mesh’er med kompleks kabling og kaotisk lys-textur, der er inkompatibelt med konventionelle renderings-pipelines, herunder Physically Based Rendering (PBR). Ligesom texture-syntese har fremgangen hurtigt, isÃĶr med brug af 2D-diffusionsmodeller. Disse modeller anvender effektivt forudtrÃĶnede dybde-til-billede-diffusionsmodeller og tekst-betingelser til at generere hÃļjkvalitets-texturer. Men et betydeligt problem bestÃĨr: forud-lyste texturer kan have en negativ indvirkning pÃĨ den endelige 3D-miljÃļ-rendering, introducere lys-fejl, nÃĨr lysene justeres inden for almindelige arbejdsgange, som vist i fÃļlgende billede.

Som observeret fungerer teksturkort uden forud-lysning sammen med traditionelle renderings-pipelines, leverer prÃĶcise resultater. I modsÃĶtning hertil indeholder teksturkort med forud-lysning uheldige skygger, nÃĨr genskabning af lys anvendes. Texture-genererings-rammer, der er trÃĶnet pÃĨ 3D-data, tilbyder en alternativ tilgang, genererer texturer ved at forstÃĨ en bestemt 3D-objects fulde geometri. Selv om disse rammer mÃĨske leverer bedre resultater, mangler de den generaliserings-evne, der er nÃļdvendig for at anvende modellen pÃĨ 3D-objekter uden for deres trÃĶningsdata.

NuvÃĶrende texture-genererings-modeller mÃļder to kritiske udfordringer: opnÃĨelse af bred generalisering pÃĨ tvÃĶrs af forskellige objekter ved hjÃĶlp af billed-vejledning eller diverse prompts, og eliminering af koblet lys fra forud-trÃĶnings-resultater. Forud-lyste texturer kan forstyrre den endelige teksturerede objekters resultater inden for renderings-motorer. Derudover, da forudtrÃĶnede 2D-diffusionsmodeller kun leverer 2D-resultater i view-domÃĶnet, mangler de en omfattende forstÃĨelse af former, hvilket fÃļrer til inkonsistenser i vedligeholdelse af view-konsistens for 3D-objekter.

For at lÃļse disse udfordringer udvikler Paint3D-rammen en dual-stage texture-diffusionsmodel for 3D-objekter, der generaliserer pÃĨ tvÃĶrs af forskellige forudtrÃĶnede generative modeller og bevarer view-konsistens, mens den genererer lys-frie texturer.

Paint3D er en dual-stage, grov-til-fine texture-genereringsmodel, der udnytter den stÃĶrke prompt-vejledning og billede-genererings-evner fra forudtrÃĶnede generative AI-modeller til at teksturere 3D-objekter. I den fÃļrste fase sampler Paint3D multi-view-billeder fra en forudtrÃĶnet dybde-til-billede-diffusionsmodel progressivt, hvilket muliggÃļr generalisering af hÃļjkvalitets, rig tekstur-resultater fra diverse prompts. Modellen genererer derefter en initial teksturkort ved at projicere disse billeder tilbage pÃĨ 3D-mesh-overfladen. I den anden fase fokuserer modellen pÃĨ at generere lys-frie texturer ved at implementere tilgange, der anvendes af diffusionsmodeller, der specialiserer sig i at fjerne lys-pÃĨvirkninger og forfine form-tilhÃļrende ufuldstÃĶndige omrÃĨder. Gennem hele processen genererer Paint3D-rammen konsekvent hÃļjkvalitets 2K-texturer semantisk, eliminerer intrinsiske lys-effekter.

I sammenfattende form er Paint3D en ny, grov-til-fine generativ AI-model designet til at producere diverse, lys-frie, hÃļjoplÃļselige 2K UV-texturkort for 3D-mesh’er uden tekstur. Den sigter mod at opnÃĨ state-of-the-art-prÃĶstationer i teksturering af 3D-objekter med forskellige betingede input, herunder tekst og billeder, og tilbyder betydelige fordele for syntese- og grafik-redigering-opgaver.

Metodologi og Arkitektur

Paint3D-rammen genererer og forfiner teksturkort progressivt for at producere diverse og hÃļjkvalitets-texturer for 3D-modeller ved hjÃĶlp af betingede input som billeder og prompts, som vist i fÃļlgende billede.

Stage 1: Progressiv Grov Texture-Generering

I den fÃļrste fase anvender Paint3D forudtrÃĶnede 2D-billede-diffusionsmodeller til at sample multi-view-billeder, der derefter projiceres tilbage pÃĨ mesh-overfladen for at skabe de initielle teksturkort. Denne fase begynder med at generere en dybde-kort fra forskellige kamera-views. Modellen anvender dybde-betingelser til at sample billeder fra diffusionsmodellen, der derefter projiceres tilbage pÃĨ 3D-mesh-overfladen. Denne alternative rendering, sampling og projicering tilgang forbedrer konsistensen af tekstur-mesh’er og hjÃĶlper med at generere teksturkort progressivt.

Processen starter med de synlige omrÃĨder af 3D-mesh’en, fokuserer pÃĨ at generere tekstur fra den fÃļrste kamera-view ved at rendre 3D-mesh’en til en dybde-kort. Et tekstur-billede samples derefter baseret pÃĨ udseende og dybde-betingelser og projiceres tilbage pÃĨ mesh’en. Denne metode gentages for efterfÃļlgende viewpoints, integrerer tidligere teksturer for at rendre ikke kun en dybde-billede, men ogsÃĨ en delvist farvet RGB-billede med ufargede masker. Modellen anvender en dybde-til-billede-inpainting-encoder til at udfylde ufargede omrÃĨder, genererer en fuldstÃĶndig grov teksturkort ved at projicere inpainted billeder tilbage pÃĨ 3D-mesh’en.

For mere komplekse scener eller objekter anvender modellen multiple views. Initialt fanger den to dybde-kort fra symmetriske viewpoints og kombinerer dem i en dybde-grid, der erstatter en enkelt dybde-billede for multi-view dybde-til-textur-sampling.

Stage 2: Texture-Forfining i UV-Rum

Trods generering af logiske grove teksturkort opstÃĨr udfordringer som tekstur-huller fra renderings-processer og lys-skygger fra 2D-billede-diffusionsmodeller. For at lÃļse disse udfordringer udfÃļrer Paint3D en diffusions-proces i UV-rum baseret pÃĨ den grove teksturkort, forbedrer det visuelle udseende og lÃļser problemerne.

Men forfining af teksturkortet i UV-rum kan introducere diskontinuiteter pÃĨ grund af fragmentering af kontinuerte texturer i separate fragmenter. For at mildne dette forfiner Paint3D teksturkortet ved at anvende tilhÃļrende information om tekstur-fragmenter. I UV-rum reprÃĶsenterer position-kortet 3D-tilhÃļrende information om tekstur-fragmenter, behandler hver non-baggrundselement som en 3D-punktkoordinat. Modellen anvender en ekstra position-kort-encoder, lignende ControlNet, til at integrere denne tilhÃļrende information under diffusions-processen.

Modellen anvender samtidig positionen af den betingede encoder og andre encodere til at udfÃļre forfinings-opgaver i UV-rum, tilbyder to evner: UVHD (UV High Definition) og UV-inpainting. UVHD forbedrer det visuelle udseende og ÃĶstetikken, anvender en billede-forbedrings-encoder og position-encoder med diffusionsmodellen. UV-inpainting udfylder tekstur-huller, undgÃĨr selv-occlusion-problemer fra rendering. Forfinings-fasen starter med UV-inpainting, efterfulgt af UVHD for at producere en endelig forfinet teksturkort.

Ved at integrere disse forfinings-metoder genererer Paint3D-rammen fuldstÃĶndige, diverse, hÃļjoplÃļselige og lys-frie UV-texturkort, hvilket gÃļr det til en robust lÃļsning for teksturering af 3D-objekter.

Paint3D: Eksperimenter og Resultater

Paint3D-modellen anvender Stable Diffusion text2image-modellen til at hjÃĶlpe med tekstur-genererings-opgaver, mens billed-encoder-komponenten hÃĨndterer billed-betingelser. For at forbedre kontrollen over betingede opgaver som billed-inpainting, dybde-hÃĨndtering og hÃļjdefinitions-billeder anvender Paint3D-rammen ControlNet-domÃĶne-encodere. Modellen er implementeret pÃĨ PyTorch-rammen, med rendering og tekstur-projektioner udfÃļrt pÃĨ Kaolin.

Tekst til Texturer Sammenligning

For at evaluere Paint3D’s prÃĶstationer starter vi med at analysere dens tekstur-generering, nÃĨr betinget med tekstuelle prompts, sammenligner det med state-of-the-art-rammer som Text2Tex, TEXTure og LatentPaint. Som vist i fÃļlgende billede excellerer Paint3D-rammen ikke kun i generering af hÃļjkvalitets tekstur-detajler, men syntetiserer ogsÃĨ en lys-fri teksturkort effektivt.

Ved at udnytte de robuste evner fra Stable Diffusion og ControlNet-encodere tilbyder Paint3D overlegen tekstur-kvalitet og fleksibilitet. Sammenligningen fremhÃĶver Paint3D’s evne til at producere detaljerede, hÃļjoplÃļselige texturer uden indlejret lys, hvilket gÃļr det til en fÃļrende lÃļsning for 3D-tekstur-opgaver.

I sammenligning er Latent-Paint-rammen tilbÃļjelig til at generere uklare texturer, der resulterer i underoptimalt visuelt udseende. PÃĨ den anden side genererer TEXTure-rammen klare texturer, men mangler glatthed og viser bemÃĶrkelsesvÃĶrdige sammenfÃļjninger og sÃļm. Endelig genererer Text2Tex-rammen glatte texturer bemÃĶrkelsesvÃĶrdigt godt, men den kan ikke replikere prÃĶstationen for generering af fine texturer med intrikate detaljer.  FÃļlgende billede sammenligner Paint3D-rammen med state-of-the-art-rammer kvantitativt. 

Som det kan observeres, overgÃĨr Paint3D-rammen alle eksisterende modeller og med en betydelig margin pÃĨ nÃĶsten 30% forbedring i FID-basen og ca. 40% forbedring i KID-basen. Forbedringen i FID- og KID-basen viser Paint3D’s evne til at generere hÃļjkvalitets-texturer pÃĨ tvÃĶrs af diverse objekter og kategorier. 

Billede til Texture Sammenligning

For at generere Paint3D’s generative evner ved hjÃĶlp af visuelle prompts anvender vi TEXTure-modellen som baseline. Som nÃĶvnt tidligere anvender Paint3D-modellen en billed-encoder fra text2image-modellen fra Stable Diffusion. Som det kan ses i fÃļlgende billede syntetiserer Paint3D-rammen udsÃļgte texturer bemÃĶrkelsesvÃĶrdigt godt og kan stadig opretholde hÃļj trofasthed i forhold til billed-betingelsen. 

PÃĨ den anden side kan TEXTure-rammen generere en tekstur, der ligner Paint3D, men den mangler at reprÃĶsentere tekstur-detajlerne i billed-betingelsen nÃļjagtigt. Desuden, som vist i fÃļlgende billede, leverer Paint3D-rammen bedre FID- og KID-basen-scores, nÃĨr sammenlignet med TEXTure-rammen, hvor den fÃļrste falder fra 40,83 til 26,86, mens den sidste viser en fald fra 9,76 til 4,94. 

Endelige Tanker

I denne artikel har vi talt om Paint3D, en ny, grov-til-fine ramme, der kan producere lys-frie, diverse, hÃļjoplÃļselige 2K UV-texturkort for 3D-mesh’er uden tekstur, betinget af enten visuelle eller tekstuelle input. Det primÃĶre hÃļjdepunkt ved Paint3D-rammen er, at den kan generere lys-frie hÃļjoplÃļselige 2K-texturer, der er semantisk konsistente uden at vÃĶre betinget af billed- eller tekst-input. Takket vÃĶre sin grov-til-fine tilgang producerer Paint3D-rammen lys-frie, diverse, hÃļjoplÃļselige teksturkort og leverer bedre prÃĶstation end nuvÃĶrende state-of-the-art-rammer. 

En ingeniÃļr af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kÃĶrlighed og forstÃĨelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.