AI-modeller och plattformar
Paint3D : Ljuslös Diffusionsmodell för Bildgenerering
Den snabba utvecklingen av AI-generativa modeller, särskilt djupa generativa AI-modeller, har avsevärt förbättrat förmågor inom naturligt språkgenerering, 3D-generering, bildgenerering och tal syntes. Dessa modeller har revolutionerat 3D-produktion inom olika branscher. Men många står inför en utmaning: deras komplexa kopplingar och genererade nät oftast är inte kompatibla med traditionella renderingpipelines som Physically Based Rendering (PBR). Diffusionsbaserade modeller, särskilt utan ljusbilder, visar imponerande mångfaldig 3D-tillgångsgenerering, förbättrar 3D-ramverk i filmproduktion, spel och AR/VR.
Den här artikeln introducerar Paint3D, ett nytt ramverk för att producera mångfaldiga, högupplösta 2K UV-texturkartor för otexurerade 3D-nät, villkorade på visuella eller textuella indata. Paint3D:s huvudsakliga utmaning är att generera högkvalitativa texturer utan inbäddad belysning, som möjliggör användarredigering eller omlysning inom moderna grafikpipelines. Det använder ett förtränat 2D-diffusionsmodell för multi-vytexturfusion, som genererar initiala grova texturkartor. Men dessa kartor visar ofta belysningsartefakter och ofullständiga områden på grund av 2D-modellens begränsningar i att inaktivera belysningseffekter och fullständigt representera 3D-former. Vi kommer att dyka in i Paint3D:s funktioner, arkitektur och jämförelser med andra djupa generativa ramverk. Låt oss börja.
Paint3D : En Introduktion
Förmågorna hos djupa generativa AI-modeller i naturligt språkgenerering, 3D-generering och bildsyntes är välkända och implementerade i realtidstillämpningar, revolutionerande 3D-genereringsindustrin. Trots deras anmärkningsvärda förmågor genererar moderna djupa generativa AI-ramverk nät som karakteriseras av komplexa kopplingar och kaotiska belysnings-texturer som ofta är inkompatibla med konventionella renderingpipelines, inklusive PBR eller Physically Based Rendering. Liksom djupa generativa AI-modeller har texturensyntes också framskridit snabbt, särskilt i användningen av 2D-diffusionsmodeller. Texturensyntesmodeller använder förtränade djup-till-bild-diffusionsmodeller effektivt för att använda textvillkor för att generera högkvalitativa texturer. Men dessa tillvägagångssätt möter svårigheter med förbelysade texturer som kan ha en betydande inverkan på den slutliga 3D-miljörenderingen och introducera belysningsfel när ljusen ändras inom vanliga arbetsflöden, som visas i följande bild.

Som det kan observeras, fungerar texturkartan med fri belysning i samklang med traditionella renderingpipelines och levererar exakta resultat, medan texturkartan med förbelysning innehåller olämpliga skuggor när omlysning tillämpas. Å andra sidan erbjuder texturensyntesramverk som tränats på 3D-data en alternativ tillvägagångssätt, där ramverket genererar texturerna genom att förstå en specifik 3D-objekts helgeometri. Även om de kan leverera bättre resultat, saknar texturensyntesramverk som tränats på 3D-data generaliseringsförmågor, vilket hindrar deras förmåga att tillämpa modellen på 3D-objekt utanför deras träningsdata.
Nuvarande texturensyntesmodeller möter två kritiska utmaningar: att använda bildstyrning eller mångfaldiga prompter för att uppnå en bredare grad av generalisering över olika objekt, och den andra utmaningen är att eliminera kopplad belysning på resultaten från förträning. De förbelysade texturerna kan potentiellt störa den slutliga utgången av de texturerade objekten inom renderingmotorer, och eftersom de förtränade 2D-diffusionsmodellerna endast tillhandahåller 2D-resultat i vydomänen, saknar de en fullständig förståelse av former, vilket gör det svårt för dem att upprätthålla vykonsekvens för 3D-objekt.
På grund av de ovan nämnda utmaningarna försöker Paint3D-ramverket att utveckla ett tvåstegs-texturdiffusionsmodell för 3D-objekt som generaliserar till olika förtränade generativa modeller och bevarar vykonsekvens medan det lär sig belysningslös texturgenerering.
Paint3D är ett tvåstegs grov till fin texturgenereringsmodell som syftar till att utnyttja den starka promptstyrningen och bildgenereringsförmågorna hos förtränade generativa AI-modeller för att texturera 3D-objekt. I det första steget genererar Paint3D-ramverket först multi-vybilder från ett förtränat djupmedvetet 2D-bild-diffusionsmodell progressivt för att möjliggöra generalisering av högkvalitativa och rika texturresultat från mångfaldiga prompter. Modellen genererar sedan en initial texturkarta genom att backprojicera dessa bilder på 3D-nätets yta. I det andra steget fokuserar modellen på att generera belysningslösa texturer genom att implementera tillvägagångssätt som används av diffusionsmodeller specialiserade på att ta bort belysningseffekter och formmedveten förfining av ofullständiga områden. Under hela processen är Paint3D-ramverket konsekvent i att generera högkvalitativa 2K-texturer semantiskt och eliminerar intrinsiska belysningseffekter.

För att sammanfatta är Paint3D ett nytt grov till fin generativt AI-modell som syftar till att producera mångfaldiga, belysningslösa och högupplösta 2K UV-texturkartor för otexurerade 3D-nät för att uppnå topppresterande i texturering av 3D-objekt med olika villkorliga indata, inklusive text och bilder, och erbjuder en betydande fördel för syntes och grafikredigeringsuppgifter.
Metodik och Arkitektur
Paint3D-ramverket genererar och förfinar texturkartor progressivt för att generera mångfaldiga och högkvalitativa texturkartor för 3D-modeller med önskade villkorliga indata, inklusive bilder och prompter, som visas i följande bild.

I det grova steget använder Paint3D-modellen förtränade 2D-bild-diffusionsmodeller för att sampla multi-vybilder och skapar sedan de initiala texturkartorna genom att backprojicera dessa bilder på nätets yta. I det andra steget, dvs. förfiningssteget, använder Paint3D-modellen en diffusionsprocess i UV-rymden för att förbättra de grova texturkartorna, vilket uppnår högkvalitativa, inpainting och belysningslösa funktioner som säkerställer den visuella attraktionen och fullständigheten hos den slutliga texturen.
Steg 1: Progressiv Grov Texturgenerering
I den progressiva grova texturgenereringssteget genererar Paint3D-modellen en grov UV-texturkarta för 3D-nätet som använder ett förtränat djupmedvetet 2D-diffusionsmodell. Mer specifikt använder modellen först olika kameravyer för att rendera djupkartan, sedan använder den djupvillkor för att sampla bilder från bild-diffusionsmodellen och backprojicerar sedan dessa bilder på nätets yta. Ramverket utför rendering, sampel och backprojicering tillvägagångssätt alternativt för att förbättra texturkartans konsekvens, vilket slutligen hjälper till att progressivt generera texturkartan.
Modellen börjar generera texturen för det synliga området med kameravyer som fokuserar på 3D-nätet och renderar 3D-nätet till en djupkarta från den första vyn. Modellen sampar sedan en texturbild för en utseendevillkor och en djupvillkor. Modellen backprojicerar sedan bilden på 3D-nätet. För vyerna utför Paint3D-modellen en liknande tillvägagångssätt men med en liten förändring genom att utföra textursampelprocessen med en bildmålningsteknik. Dessutom tar modellen de texturerade områdena från tidigare vyer i beaktande, vilket gör att renderingprocessen inte bara producerar en djupbild, utan också en partiellt färgad RGB-bild med en ofärgad mask i den aktuella vyn.
Modellen använder sedan en djupmedveten bildinpainting-modell med en inpainting-encoder för att fylla den ofärgade området inom RGB-bilden. Modellen genererar sedan texturkartan från vyn genom att backprojicera den inpaintade bilden på 3D-nätet under den aktuella vyn, vilket gör att modellen kan generera texturkartan progressivt och nå den fullständiga grova strukturkartan. Slutligen utökar modellen textursampelprocessen till en scen eller objekt med flera vyer. Mer specifikt använder modellen ett par kameror för att fånga två djupkartor under den initiala textursampeln från symmetriska vyer. Modellen kombinerar sedan de två djupkartorna och komponerar en djupgrid. Modellen ersätter den enskilda djupbilden med djupgriden för att utföra multi-vy djupmedveten textursampel.
Steg 2: Texturförfining i UV-Rymden
Även om den grova texturkartans utseende är logiskt, möter den vissa utmaningar som texturhål orsakade under renderingprocessen av självocclusion eller belysnings-skuggor på grund av inblandningen av 2D-bild-diffusionsmodeller. Paint3D-modellen syftar till att utföra en diffusionsprocess i UV-rymden baserat på en grov texturkarta, för att mildra problemen och förbättra den visuella attraktionen hos texturkartan ännu mer under texturförfining. Men att förfiningsmodellera den vanliga bild-diffusionsmodellen med texturkartor i UV-rymden introducerar texturdiskontinuitet, eftersom texturkartan genereras av UV-mappningen av texturen på 3D-ytan som skär den kontinuerliga texturen i en serie enskilda fragment i UV-rymden. Som ett resultat av fragmenteringen har modellen svårt att lära sig 3D-adjacensrelationerna mellan fragmenten, vilket leder till texturdiskontinuitetsproblem.
Modellen förfinar texturkartan i UV-rymden genom att utföra diffusionsprocessen under vägledning av texturfragmentens adjacensinformation. Det är viktigt att notera att i UV-rymden är det positionskartan som representerar 3D-adjacensinformationen för texturfragment, med modellen som behandlar varje icke-bakgrunds-element som en 3D-punktkoordinat. Under diffusionsprocessen fusionerar modellen 3D-adjacensinformationen genom att lägga till en individuell positions-encoder till det förtränade bild-diffusionsmodellen. Den nya encodern liknar designen av ControlNet-ramverket och har samma arkitektur som encodern som implementeras i bild-diffusionsmodellen med zero-convolutionslagret som kopplar de två. Dessutom är texturens diffusionsmodell tränad på en dataset som består av textur- och positionskartor, och modellen lär sig att förutsäga bruset som läggs till den bullriga latenten. Modellen optimerar sedan positions-encodern och fryser den tränade desinseraren för dess bild-diffusionsuppgift.
Modellen använder sedan positionen för villkors-encodern och andra encodare för att utföra förfiningsuppgifter i UV-rymden. I detta avseende har modellen två förfiningsförmågor: UVHD eller UV High Definition och UV-inpainting. UVHD-metoden är strukturerad för att förbättra den visuella attraktionen och estetiken hos texturkartan. För att uppnå UVHD använder modellen en bildförbättrings-encoder och en positions-encoder med diffusionsmodellen. Modellen använder UV-inpainting-metoden för att fylla texturhål inom UV-planet, som kan undvika självocclusion-problem som genereras under rendering. I förfiningssteget utför Paint3D-modellen först UV-inpainting och sedan UVHD för att generera den slutliga förfinade texturkartan. Genom att integrera de två förfiningsmetoderna kan Paint3D-ramverket producera fullständiga, mångfaldiga, högupplösta och belysningslösa UV-texturkartor.
Paint3D : Experiment och Resultat
Paint3D-modellen använder Stable Diffusion-text2image-modellen för att assistera den med texturgenereringsuppgifter, medan den använder bild-encoder-komponenten för att hantera bildvillkor. För att ytterligare förbättra dess grepp om villkorliga kontroller som bildinpainting, djup och bildhögupplösning, använder Paint3D-ramverket ControlNet-domän-encodare. Modellen implementeras på PyTorch-ramverket med rendering och texturprojektioner implementerade på Kaolin.
Text till Texturer Jämförelse
För att analysera dess prestanda börjar vi med att utvärdera Paint3D:s texturgenereringsverkan när den är villkorad med textprompter och jämför den med toppmoderna ramverk, inklusive Text2Tex, TEXTure och LatentPaint. Som det kan observeras i följande bild, Paint3D-ramverket excellerar inte bara i att generera högkvalitativa texturdetaljer, utan det syntheserar också en belysningsfri texturkarta på ett rimligt sätt.

I jämförelse är Latent-Paint-ramverket benägen att generera suddiga texturer som resulterar i undermåliga visuella effekter. Å andra sidan, även om TEXTure-ramverket genererar tydliga texturer, saknar det smidighet och visar märkbara splicing och sömmar. Slutligen genererar Text2Tex-ramverket släta texturer på ett anmärkningsvärt sätt, men det misslyckas med att replikera prestandan för att generera fina texturer med intrikata detaljer.
Följande bild jämför Paint3D-ramverket med toppmoderna ramverk kvantitativt.

Som det kan observeras, överträffar Paint3D-ramverket alla existerande modeller, och med en betydande marginal, med nästan 30% förbättring i FID-baslinjen och ungefär 40% förbättring i KID-baslinjen. Förbättringen i FID- och KID-baslinjerna visar Paint3D:s förmåga att generera högkvalitativa texturer över olika objekt och kategorier.
Bild till Textur Jämförelse
För att generera Paint3D:s generativa förmågor med visuella prompter, använder vi TEXTure-modellen som baslinjen. Som nämnts tidigare, använder Paint3D-modellen en bild-encoder som hämtats från text2image-modellen från Stable Diffusion. Som det kan ses i följande bild, syntheserar Paint3D-ramverket exquisita texturer på ett anmärkningsvärt sätt och kan fortfarande upprätthålla hög trohet i förhållande till bildvillkoret.

Å andra sidan, är TEXTure-ramverket i stånd att generera en textur som liknar Paint3D, men det misslyckas med att representera texturdetaljerna i bildvillkoret på ett exakt sätt. Dessutom, som visas i följande bild, levererar Paint3D-ramverket bättre FID- och KID-baslinjer när det jämförs med TEXTure-ramverket, med den första minskningen från 40,83 till 26,86, medan den senare visar en minskning från 9,76 till 4,94.

Slutliga Tankar
I den här artikeln har vi talat om Paint3D, ett nytt ramverk som kan producera belysningslösa, mångfaldiga och högupplösta 2K UV-texturkartor för otexurerade 3D-nät, villkorade på visuella eller textuella indata. Paint3D-ramverkets huvudsakliga utmärkelse är att det kan generera belysningslösa högupplösta 2K UV-texturer som är semantiskt konsekventa utan att vara villkorade på bild- eller textinmatningar. På grund av dess grov till fin-tillvägagångssätt, producerar Paint3D-ramverket belysningslösa, mångfaldiga och högupplösta texturkartor och levererar bättre prestanda än nuvarande toppmoderna ramverk.












