AI-modeller og platforme
Zero123++: Enkelt billede til konsistent multi-view diffusion base model

De seneste par år har set en hurtig fremgang i ydelsen, effektiviteten og generative evner af nye, innovative AI-generative modeller, der udnytter omfattende datasæt og 2D-diffusionsgenereringspraksis. I dag er generative AI-modeller ekstremt dygtige til at generere forskellige former for 2D- og til en vis grad 3D-medieindhold, herunder tekst, billeder, videoer, GIF’er og mere.
I denne artikel vil vi tale om Zero123++-rammen, en billedbetinget diffusionsgenerativ AI-model, der har til formål at generere 3D-konsistente multi-view-billeder ved hjælp af et enkelt billedindput. For at maksimere fordelene ved tidligere forudtrænede generative modeller implementerer Zero123++-rammen flere trænings- og betingelsesskemaer for at minimere den indsats, det kræver at finjustere fra færdige diffusionsbilledmodeller. Vi vil dykke dybere i arkitekturen, virkemåden og resultaterne af Zero123++-rammen og analysere dens evne til at generere konsistente multi-view-billeder af høj kvalitet fra et enkelt billede. Så lad os komme i gang.
Zero123 og Zero123++: En introduktion
Zero123++-rammen er en billedbetinget diffusionsgenerativ AI-model, der har til formål at generere 3D-konsistente multi-view-billeder ved hjælp af et enkelt billedindput. Zero123++-rammen er en fortsættelse af Zero123 eller Zero-1-til-3-rammen, der udnytter zero-shot-novel-view-billedsynthese-teknik til at bane vejen for åbent kilde-enkelt-billede-til-3D-konverteringer. Selvom Zero123++-rammen leverer lovende resultater, har billederne genereret af rammen synlige geometriske inkonsistenser, og det er hovedårsagen til, at der stadig er et gab mellem 3D-scener og multi-view-billeder.
Zero-1-til-3-rammen fungerer som grundlag for flere andre rammer, herunder SyncDreamer, One-2-3-45, Consistent123 og mere, der tilføjer ekstra lag til Zero123-rammen for at opnå mere konsistente resultater, når det gælder generation af 3D-billeder. Andre rammer som ProlificDreamer, DreamFusion, DreamGaussian og mere følger en optimeringsbaseret tilgang for at opnå 3D-billeder ved at destillere et 3D-billede fra forskellige inkonsistente modeller. Selvom disse teknikker er effektive og genererer tilfredsstillende 3D-billeder, kan resultaterne forbedres med implementeringen af en basisdiffusionsmodel, der kan generere multi-view-billeder konsistent. Derfor tager Zero123++-rammen Zero-1-til-3 og finjusterer en ny multi-view-basisdiffusionsmodel fra Stable Diffusion.
I Zero-1-til-3-rammen genereres hver ny view uafhængigt, og denne tilgang fører til inkonsistenser mellem de genererede views, da diffusionsmodeller har en stikprøve-natur. For at tackle dette problem adopterer Zero123++-rammen en tiling-layout-tilgang, hvor objektet omgives af seks views i ét billede, og sikrer korrekt modellering for den fælles distribution af et objekts multi-view-billeder.
En anden stor udfordring, som udviklere, der arbejder på Zero-1-til-3-rammen, står over for, er, at den underudnytter de muligheder, der tilbydes af Stable Diffusion, hvilket ultimativt fører til ineffektivitet og øgede omkostninger. Der er to primære årsager til, at Zero-1-til-3-rammen ikke kan maksimere de muligheder, der tilbydes af Stable Diffusion
- Når der trænes med billedbetingelser, inkorporerer Zero-1-til-3-rammen ikke lokale eller globale betingelsesmekanismer, der tilbydes af Stable Diffusion, effektivt.
- Under træning bruger Zero-1-til-3-rammen reduceret opløsning, en tilgang, hvor outputopløsningen reduceres under træningsopløsningen, hvilket kan reducere kvaliteten af billedgenerering for Stable Diffusion-modeller.
For at tackle disse problemer implementerer Zero123++-rammen en række betingelses-teknikker, der maksimerer udnyttelsen af ressourcer, der tilbydes af Stable Diffusion, og opretholder kvaliteten af billedgenerering for Stable Diffusion-modeller.
Forbedring af betingelser og konsistens
I et forsøg på at forbedre billedbetingelser og multi-view-billedkonsistens implementerede Zero123++-rammen forskellige teknikker med det primære mål at genbruge tidligere teknikker fra den forudtrænede Stable Diffusion-model.
Multi-view-generering
Den uundværlige kvalitet ved at generere konsistente multi-view-billeder ligger i at modellere den fælles distribution af flere billeder korrekt. I Zero-1-til-3-rammen ignoreres korrelationen mellem multi-view-billeder, fordi rammen modellerer den betingede marginale distribution uafhængigt og separat for hvert billede. Men i Zero123++-rammen har udviklerne valgt en tiling-layout-tilgang, der tiler 6 billeder i ét billede/ramme for konsistent multi-view-generering, og processen demonstreres i det følgende billede.

Derudover er det blevet bemærket, at objektorienteringer har tilbøjelighed til at afklare, når modellen trænes på kamerapositioner, og for at forhindre denne afklaring træner Zero-1-til-3-rammen på kamerapositioner med højdevinkler og relativ azimut i forhold til input. For at implementere denne tilgang er det nødvendigt at kende højdevinklen for inputbilledets view, der derefter bruges til at bestemme den relative pose mellem nye input-views. I et forsøg på at kende denne højdevinkel tilføjer rammer ofte en højdeestimationsmodul, og denne tilgang kommer ofte på bekostning af yderligere fejl i pipeline.
Støj-schedule
Scaled-linear-schedule, den originale støj-schedule for Stable Diffusion, fokuserer primært på lokale detaljer, men som det kan ses i det følgende billede, har den meget få trin med lavere SNR eller signal-støj-forhold.

Disse trin med lavt signal-støj-forhold forekommer tidligt under denoising-stadiet, et stadium, der er afgørende for at bestemme den globale lavfrekvensstruktur. Reduktion af antallet af trin under denoising-stadiet, enten under interference eller træning, resulterer ofte i en større struktural variation. Selvom denne opsætning er ideel til enkelt-billede-generering, begrænser den rammens evne til at sikre global konsistens mellem forskellige views. For at overvinde dette hurdle finjusterer Zero123++-rammen en LoRA-model på Stable Diffusion 2-v-prediction-rammen til at udføre en legetøj-opgave, og resultaterne demonstreres nedenfor.

Med den scaled-linear støj-schedule overfylder LoRA-modellen ikke, men hvider kun billedet lidt. Omvendt, når man arbejder med den lineære støj-schedule, genererer LoRA-rammen en blankt billede succesfuldt uanset input-prompten, hvilket indikerer støj-schedules indvirkning på rammens evne til at tilpasse sig nye krav globalt.
Skaleret reference-attention til lokale betingelser
Det enkelt-billede-input eller billedbetingelserne i Zero-1-til-3-rammen konkateneres med de støjende input i feature-dimensionen for at blive støjede for billedbetingelser.
Denne konkatenering fører til en forkert pixel-vis spatial korrespondance mellem målbilledet og input. For at give korrekt lokal betingelses-input udnytter Zero123++-rammen en skaleret reference-attention, en tilgang, hvor man kører en denoising UNet-model på en ekstra reference-billede, efterfulgt af appendation af værdi-matricer og selv-attention-nøgle fra reference-billedet til de respektive attention-lag, når modellens input bliver denoiseret, og processen demonstreres i det følgende figur.

Reference-attention-tilgangen er i stand til at guide diffusionsmodellen til at generere billeder, der deler lignende tekstur med reference-billedet, og semantisk indhold uden nogen finjustering. Med finjustering leverer reference-attention-tilgangen overlegne resultater med latent skaleret.

Global betingelse: FlexDiffuse
I den originale Stable Diffusion-tilgang er tekst-embeddingerne den eneste kilde til globale embeddinger, og tilgangen udnytter CLIP-rammen som en tekst-encoder til at udføre kryds-forhør mellem tekst-embeddingerne og modellens latente. Resultatet er, at udviklerne er frie til at bruge alignmentet mellem tekst-rummet og de resulterende CLIP-billeder til at bruge det til global billedbetingelser.
Zero123++-rammen foreslår at udnytte en trænbar variant af den lineære guidance-mekanisme til at inkorporere den globale billedbetingelse i rammen med minimal finjustering nødvendig, og resultaterne demonstreres i det følgende billede. Som det kan ses, uden global billedbetingelse er kvaliteten af indholdet genereret af rammen tilfredsstillende for synlige områder, der svarer til input-billedet. Men kvaliteten af billedet genereret af rammen for usete områder oplever en betydelig forringelse, hvilket primært skyldes modellens manglende evne til at slutte sig til objektets globale semantik.

Model-arkitektur
Zero123++-rammen er trænet med Stable Diffusion 2v-modellen som grundlag ved hjælp af de forskellige tilgange og teknikker, der er nævnt i artiklen. Zero123++-rammen er forudtrænet på Objaverse-datasættet, der er renderet med tilfældig HDRI-belysning. Rammen udnytter også den faserede træningsskema-tilgang, der bruges i Stable Diffusion Image Variations-rammen i et forsøg på yderligere at minimere den finjustering, der kræves, og bevare så meget som muligt af den forudgående Stable Diffusion.
Arbejdet eller arkitekturen af Zero123++-rammen kan yderligere deles i sekventielle trin eller faser. Første fase ser rammen finjustere KV-matricerne af cross-attention-lag og selv-attention-lag af Stable Diffusion med AdamW som optimizer, 1000 warm-up-trin og cosinus-læringsrate-schedule maksimerer ved 7×10-5. I anden fase udnytter rammen en højst konservativ konstant læringsrate med 2000 warm-up-sæt og udnytter Min-SNR-tilgangen til at maksimere effektiviteten under træningen.
Zero123++: Resultater og performancesammenligning
Kvalitativ ydelse
For at vurderere Zero123++-rammens ydelse på basis af dens kvalitet genererer det sammenlignes med SyncDreamer og Zero-1-til-3-XL, to af de bedste statiske kunst-til-stand-rammer for indholdsgenerering. Rammerne sammenlignes mod fire input-billeder med forskellige omfang. Det første billede er en elektrisk legetøj-kat, taget direkte fra Objaverse-datasættet, og det har en stor usikkerhed på bagsiden af objektet. Andet er billedet af en brandslukker, og det tredje er billedet af en hund, der sidder på en raket, genereret af SDXL-modellen. Det sidste billede er en anime-illustration. De nødvendige højde-trin for rammerne opnås ved at bruge One-2-3-4-5-rammens højde-estimationsmetode, og baggrundsfjernelse opnås ved at bruge SAM-rammen. Som det kan ses, genererer Zero123++-rammen høj-kvalitets multi-view-billeder konsistent og er i stand til at generalisere til out-of-domain 2D-illustrationer og AI-genererede billeder lige så godt.


Kvantitativ analyse
For at kvantitativt sammenligne Zero123++-rammen med statiske kunst-til-stand Zero-1-til-3 og Zero-1-til-3-XL-rammer vurderer udviklerne den Lærte Perceptual Image Patch Similarity (LPIPS)-score for disse modeller på validerings-datasættets del, en undermængde af Objaverse-datasættet. For at evaluere modellens ydelse på multi-view-billedgenerering tiler udviklerne ground truth-reference-billeder og 6 genererede billeder henholdsvis og beregner derefter LPIPS-scoren. Resultaterne demonstreres nedenfor, og som det kan tydeligt ses, opnår Zero123++-rammen den bedste ydelse på validerings-datasættet.

Tekst til multi-view-evaluering
For at evaluere Zero123++-rammens evne til tekst-til-multi-view-indholdsgenerering bruger udviklerne først SDXL-rammen med tekst-prompts til at generere et billede og derefter udnytter Zero123++-rammen til det genererede billede. Resultaterne demonstreres i det følgende billede, og som det kan ses, sammenlignet med Zero-1-til-3-rammen, der ikke kan garantere konsistent multi-view-generering, returnerer Zero123++-rammen konsistente, realistiske og højtdetaljerede multi-view-billeder ved at implementere tekst-til-billede-til-multi-view-tilgangen eller pipeline.

Zero123++ Dybde ControlNet
Ud over den grundlæggende Zero123++-ramme har udviklerne også udgivet Depth ControlNet Zero123++, en dybde-kontrolleret version af den originale ramme bygget med ControlNet-arkitekturen. De normaliserede lineære billeder renderes i respekt med de efterfølgende RGB-billeder, og en ControlNet-ramme trænes til at kontrollere geometrien af Zero123++-rammen ved hjælp af dybde-perception.

Konklusion
I denne artikel har vi talt om Zero123++, en billedbetinget diffusionsgenerativ AI-model, der har til formål at generere 3D-konsistente multi-view-billeder ved hjælp af et enkelt billedindput. For at maksimere fordelene ved tidligere forudtrænede generative modeller implementerer Zero123++-rammen flere trænings- og betingelsesskemaer for at minimere den indsats, det kræver at finjustere fra færdige diffusionsbilledmodeller. Vi har også diskuteret de forskellige tilgange og forbedringer, der er implementeret af Zero123++-rammen for at opnå resultater, der er sammenlignelige med og endda overgår dem, der er opnået af nuværende statiske kunst-til-stand-rammer.
Men selvom den er effektiv og kan generere høj-kvalitets multi-view-billeder konsistent, har Zero123++-rammen stadig nogen plads til forbedring, med potentielle områder for forskning som
- To-trins-refiner-model, der måske kan løse Zero123++’s manglende evne til at opfylde globale krav til konsistens.
- Yderligere skalaforbedringer for at yderligere forbedre Zero123++’s evne til at generere billeder af endnu højere kvalitet.












