AI-modeller og plattformer
Zero123++: En enkelt bilde til konsistent multi-view diffusjonsbasemodell

De siste årene har vi sett en rask fremgang i ytelsen, effektiviteten og genereringsmulighetene til nye, innovative AI-genereringsmodeller som utnytter omfattende datasett og 2D-diffusjonspraksis. I dag er genereringsmodellene usedvanlig dyktige til å generere forskjellige former for 2D- og, i noen grad, 3D-medieinnhold, inkludert tekst, bilder, videoer, GIF-er og mer.
I denne artikkelen skal vi diskutere Zero123++-rammeverket, et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. For å maksimere fordelen fra tidligere forhånds trenede genereringsmodeller, implementerer Zero123++-rammeverket flere trenings- og betingelsesordninger for å minimere den innsatsen det tar å finjustere fra ferdige diffusjonsbilmodeller. Vi skal dykke dyptere inn i arkitekturen, virkemåten og resultater fra Zero123++-rammeverket, og analysere dens evne til å generere konsistente multi-view-bilder av høy kvalitet fra et enkelt bilde. La oss begynne.
Zero123 og Zero123++: En introduksjon
Zero123++-rammeverket er et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. Zero123++-rammeverket er en fortsettelse av Zero123- eller Zero-1-til-3-rammeverket som utnytter zero-shot nytt synsbilde-syntese-teknikk for å pionere åpen kilde-enkeltbilde-til-3D-omdanninger. Selv om Zero123++-rammeverket leverer lovende resultater, har bildene generert av rammeverket synlige geometriske inkonsistenser, og det er hovedårsaken til at gapet mellom 3D-scener og multi-view-bilder fortsatt eksisterer.
Zero-1-til-3-rammeverket tjener som grunnlag for flere andre rammeverk, inkludert SyncDreamer, One-2-3-45, Consistent123 og mer, som legger til ekstra lag til Zero123-rammeverket for å oppnå mer konsistente resultater når det gjelder å generere 3D-bilder. Andre rammeverk, som ProlificDreamer, DreamFusion, DreamGaussian og mer, følger en optimaliseringsbasert tilnærming for å oppnå 3D-bilder ved å destillere en 3D-bilde fra forskjellige inkonsistente modeller. Selv om disse teknikkene er effektive og genererer tilfredsstillende 3D-bilder, kan resultater forbedres med implementeringen av en base-diffusjonsmodell i stand til å generere multi-view-bilder konsistent.
I Zero-1-til-3-rammeverket genereres hver nytt synsbilde uavhengig, og denne tilnærmingen fører til inkonsistenser mellom de genererte bildene, ettersom diffusjonsmodellene har en stikprøve-egenskap. For å takle dette problemet, adopterer Zero123++-rammeverket en tiling-layout-tilnærming, hvor objektet omgitt av seks bilder legges sammen til ett enkelt bilde, og sikrer korrekt modellering for den felles distribusjonen av et objekts multi-view-bilder.
En annen stor utfordring som utviklere som arbeider med Zero-1-til-3-rammeverket møter, er at det underutnytter kapasiteten som tilbys av Stable Diffusion, noe som ultimate fører til ineffektivitet og økte kostnader. Det er to hovedårsaker til at Zero-1-til-3-rammeverket ikke kan maksimere kapasiteten som tilbys av Stable Diffusion
- Når det gjelder trening med bilde-betingelser, inkorporerer Zero-1-til-3-rammeverket ikke lokale eller globale betingelsesmekanismer som tilbys av Stable Diffusion effektivt.
- Under trening bruker Zero-1-til-3-rammeverket redusert oppløsning, en tilnærming hvor utgangsoppløsningen reduseres under treningsoppløsningen, noe som kan redusere kvaliteten på bilde-generering for Stable Diffusion-modeller.
For å takle disse problemene, implementerer Zero123++-rammeverket en rekke betingelses-teknikker som maksimerer utnyttelsen av ressurser som tilbys av Stable Diffusion og opprettholder kvaliteten på bilde-generering for Stable Diffusion-modeller.
Forbedring av betingelser og konsistens
I et forsøk på å forbedre bilde-betingelser og multi-view-bilde-konsistens, implementerte Zero123++-rammeverket forskjellige teknikker, med hovedmålet å gjenbruke tidligere tekniker fra det forhånds trenede Stable Diffusion-modellen.
Multi-view-generering
Den uerstattelige kvaliteten på å generere konsistente multi-view-bilder ligger i å modellere den felles distribusjonen av flere bilder korrekt. I Zero-1-til-3-rammeverket ignoreres korrelasjonen mellom multi-view-bilder, ettersom rammeverket modellerer den betingede marginale distribusjonen uavhengig og separat for hvert bilde. Imidlertid, i Zero123++-rammeverket, har utviklerne valgt en tiling-layout-tilnærming som legger 6 bilder sammen til ett enkelt bilde for konsistent multi-view-generering, og prosessen demonstreres i følgende bilde.

Videre har det blitt observert at objekt-orienteringer tenderer til å uskarpere når modellen trenes på kamera-pose, og for å forebygge denne uskarpen, trenes Zero-1-til-3-rammeverket på kamera-pose med høyde-vinkler og relativ azimuth til inngangen. For å implementere denne tilnærmingen, er det nødvendig å kjenne til høyde-vinkelen til utsiktspunktet til inngangen, som deretter brukes til å bestemme den relative posen mellom nye inngangs-utsikter. I et forsøk på å kjenne til denne høyde-vinkelen, legger rammeverkene ofte til en høyde-estimeringsmodul, og denne tilnærmingen kommer ofte på bekostning av ekstra feil i pipeline-en.
Støy-schedule
Skalert lineær schedule, den opprinnelige støy-schedule for Stable Diffusion, fokuserer primært på lokale detaljer, men som det kan ses i følgende bilde, har den svært få steg med lavere SNR eller signal-til-støy-forhold.

Disse stegene med lavt signal-til-støy-forhold skjer tidlig under denøyning-stadiet, et stadium som er avgjørende for å bestemme den globale lavfrekvens-strukturen. Redusere antallet steg under denøyning-stadiet, enten under interferens eller trening, resulterer ofte i en større struktur-variighet. Selv om denne oppsettet er ideelt for enkelt-bilde-generering, begrenser det rammeverkets evne til å sikre global konsistens mellom forskjellige utsikter. For å overvinne denne hindringen, finjusterer Zero123++-rammeverket en LoRA-modell på Stable Diffusion 2-v-prediksjons-rammeverket for å utføre en leke-oppgave, og resultater demonstreres nedenfor.

Med den skalerte lineære støy-schedule, overfitter ikke LoRA-modellen, men hvitner bare bildet litt. Omvendt, når det gjelder den lineære støy-schedule, genererer LoRA-rammeverket en blank bilde suksessfullt uavhengig av inngangs-prompten, og dette indikerer støy-schedulens innvirkning på rammeverkets evne til å tilpasse seg nye krav globalt.
Skalert referanse-oppmerksomhet for lokale betingelser
Det enkelt-bilde-inngangen eller betingelses-bildene i Zero-1-til-3-rammeverket er konkateneret med de støyende inngangene i funksjons-dimensjonen for å bli støyende for bilde-betingelser.
Denne konkateneringen fører til en feil pixel-til-pixel romlig korrespondanse mellom målbildet og inngangs-bildet. For å gi korrekt lokal betingelses-inngang, bruker Zero123++-rammeverket en skalert referanse-oppmerksomhet, en tilnærming hvor en avrensnings-UNet-modell refereres til en ekstra referanse-bilde, etterfulgt av appendasjon av verdi-matriser og selv-oppmerksomhet-nøkkel fra referanse-bildet til de respektive oppmerksomhets-lagene når modell-inngangen avrenses, og prosessen demonstreres i følgende figur.

Referanse-oppmerksomhets-tilnærmingen er i stand til å guide diffusjons-modellen til å generere bilder som deler lignende tekstur med referanse-bildet, og semantisk innhold uten noen finjustering. Med finjustering, leverer referanse-oppmerksomhets-tilnærmingen overlegne resultater med latent skalert.

Global betingelse: FlexDiffuse
I den opprinnelige Stable Diffusion-tilnærmingen er tekst-embeddingene den eneste kilden til globale embeddinger, og tilnærmingen bruker CLIP-rammeverket som en tekst-encoder for å utføre kryss-eksaminasjoner mellom tekst-embeddingene og modell-latentene. Resultatmessig er utviklerne frie til å bruke sammenligningen mellom tekst-rommene og de resulterende CLIP-bildene for å bruke det til global bilde-betingelser.
Zero123++-rammeverket foreslår å bruke en trening-variant av den lineære guidansen-mekanismen for å inkorporere global bilde-betingelse i rammeverket med minimal finjustering nødvendig, og resultater demonstreres i følgende bilde. Som det kan ses, uten global bilde-betingelse, er kvaliteten på innholdet generert av rammeverket tilfredsstillende for synlige regioner som korresponderer med inngangs-bildet. Imidlertid vitner kvaliteten på bildet generert av rammeverket for usette regioner om en betydelig forverring, og dette skyldes hovedsakelig modellens evne til å slutte om objektets globale semantikk.

Modell-arkitektur
Zero123++-rammeverket er trenet med Stable Diffusion 2v-modellen som grunnlag, ved å bruke forskjellige tilnærminger og tekniker nevnt i artikkelen. Zero123++-rammeverket er forhånds trenet på Objaverse-datasettet, som er rendret med tilfeldig HDRI-lys. Rammeverket adopterer også den fase-til-trening-schedule-tilnærmingen brukt i Stable Diffusion Image Variations-rammeverket i et forsøk på å minimere den finjusteringen som kreves, og å bevare så mye som mulig av den tidligere Stable Diffusion.
Arbeidet eller arkitekturen til Zero123++-rammeverket kan videre deles inn i sekvensielle steg eller faser. Den første fasen vitner om at rammeverket finjusterer KV-matrisene til kryss-oppmerksomhets-lagene og selv-oppmerksomhets-lagene til Stable Diffusion med AdamW som optimizer, 1000 varm-opp-steg og den kosinus-lærings-raten maksimerer ved 7×10-5. I den andre fasen, bruker rammeverket en høyt konservativ konstant lærings-rate med 2000 varm-opp-sett, og bruker Min-SNR-tilnærmingen for å maksimere effektiviteten under treningen.
Zero123++: Resultater og ytelses-sammenligning
Kvalitativ ytelse
For å vurdere ytelsen til Zero123++-rammeverket basert på kvaliteten generert, sammenlignes det mot SyncDreamer og Zero-1-til-3-XL, to av de beste statiske kunst-til-tilfelle-rammeverk for innholdsgenerering. Rammeverkene sammenlignes mot fire inngangs-bilder med forskjellige omfang. Den første bildet er en elektrisk leke-katt, tatt direkte fra Objaverse-datasettet, og det har en stor usikkerhet på baksiden av objektet. Den andre er bildet av en brann-sluknings-apparat, og den tredje er bildet av en hund som sitter på en rakett, generert av SDXL-modellen. Den siste bildet er en anime-illustrasjon. De nødvendige høyde-stegene for rammeverkene oppnås ved å bruke One-2-3-4-5-rammeverkets høyde-estimerings-metode, og bakgrunn-fjerning oppnås ved å bruke SAM-rammeverket. Som det kan ses, genererer Zero123++-rammeverket høy-kvalitets multi-view-bilder konsistent, og er i stand til å generalisere til utenfor-domene 2D-illustrasjoner og AI-genererte bilder like godt.


Kvantitativ analyse
For å sammenligne Zero123++-rammeverket kvantitativt mot statiske kunst-til-tilfelle-rammeverk som Zero-1-til-3 og Zero-1-til-3-XL, vurderer utviklerne den lærte perseptuelle bilde-patch-lignende (LPIPS)-scoren til disse modellene på validerings-datasettet, en undergruppe av Objaverse-datasettet. For å vurdere modellens ytelse på multi-view-bilde-generering, legger utviklerne sammen grunn-sannhets-referanse-bildene og 6 genererte bilder, og beregner deretter LPIPS-scoren. Resultatene demonstreres nedenfor, og som det kan ses, oppnår Zero123++-rammeverket den beste ytelsen på validerings-datasettet.

Tekst-til-multi-view-evaluering
For å vurdere Zero123++-rammeverkets evne til å generere tekst-til-multi-view-innhold, bruker utviklerne først SDXL-rammeverket med tekst-prompter for å generere et bilde, og deretter bruker Zero123++-rammeverket bildet generert. Resultatene demonstreres i følgende bilde, og som det kan ses, sammenlignet med Zero-1-til-3-rammeverket som ikke kan garantere konsistent multi-view-generering, returnerer Zero123++-rammeverket konsistente, realistiske og høyt-detaljerte multi-view-bilder ved å implementere tekst-til-bilde-til-multi-view-tilnærmingen eller pipeline-en.

Zero123++ Dybde ControlNet
I tillegg til det grunnleggende Zero123++-rammeverket, har utviklerne også lansert Depth ControlNet Zero123++, en dybde-kontrollert versjon av det opprinnelige rammeverket bygget ved å bruke ControlNet-arkitekturen. De normaliserte lineære bildene rendres i henhold til de påfølgende RGB-bildene, og en ControlNet-rammeverk trenes for å kontrollere geometrien til Zero123++-rammeverket ved å bruke dybde-persepsjon.

Konklusjon
I denne artikkelen har vi diskutert Zero123++, et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. For å maksimere fordelen fra tidligere forhånds trenede genereringsmodeller, implementerer Zero123++-rammeverket flere trenings- og betingelsesordninger for å minimere den innsatsen det tar å finjustere fra ferdige diffusjonsbilmodeller. Vi har også diskutert de forskjellige tilnærminger og forbedringene som er implementert av Zero123++-rammeverket for å oppnå resultater som er sammenlignbare med, og sogar overgår de som er oppnådd av nåværende statiske kunst-til-tilfelle-rammeverk.
Imidlertid, til tross for sin effektivitet og evne til å generere høy-kvalitets multi-view-bilder konsistent, har Zero123++-rammeverket fortsatt noen rom for forbedring, med potensielle områder for forskning som en To-trinns-refineringsmodell som kan løse Zero123++-rammeverkets evne til å møte globale krav til konsistens. Ytterligere skala-oppskaleringer kan også forbedre Zero123++-rammeverkets evne til å generere bilder av enda høyere kvalitet.
- To-trinns-refineringsmodell som kan løse Zero123++-rammeverkets evne til å møte globale krav til konsistens.
- Ytterligere skala-oppskaleringer for å forbedre Zero123++-rammeverkets evne til å generere bilder av enda høyere kvalitet.












