AI-modeller og plattformer

Zero123++: En enkelt bilde til konsistent multi-view diffusjonsbasemodell

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

De siste årene har vi sett en rask fremgang i ytelsen, effektiviteten og genereringsmulighetene til nye, innovative AI-genereringsmodeller som utnytter omfattende datasett og 2D-diffusjonspraksis. I dag er genereringsmodellene usedvanlig dyktige til å generere forskjellige former for 2D- og, i noen grad, 3D-medieinnhold, inkludert tekst, bilder, videoer, GIF-er og mer.

I denne artikkelen skal vi diskutere Zero123++-rammeverket, et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. For å maksimere fordelen fra tidligere forhånds trenede genereringsmodeller, implementerer Zero123++-rammeverket flere trenings- og betingelsesordninger for å minimere den innsatsen det tar å finjustere fra ferdige diffusjonsbilmodeller. Vi skal dykke dyptere inn i arkitekturen, virkemåten og resultater fra Zero123++-rammeverket, og analysere dens evne til å generere konsistente multi-view-bilder av høy kvalitet fra et enkelt bilde. La oss begynne.

Zero123 og Zero123++: En introduksjon

Zero123++-rammeverket er et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. Zero123++-rammeverket er en fortsettelse av Zero123- eller Zero-1-til-3-rammeverket som utnytter zero-shot nytt synsbilde-syntese-teknikk for å pionere åpen kilde-enkeltbilde-til-3D-omdanninger. Selv om Zero123++-rammeverket leverer lovende resultater, har bildene generert av rammeverket synlige geometriske inkonsistenser, og det er hovedårsaken til at gapet mellom 3D-scener og multi-view-bilder fortsatt eksisterer.

Zero-1-til-3-rammeverket tjener som grunnlag for flere andre rammeverk, inkludert SyncDreamer, One-2-3-45, Consistent123 og mer, som legger til ekstra lag til Zero123-rammeverket for å oppnå mer konsistente resultater når det gjelder å generere 3D-bilder. Andre rammeverk, som ProlificDreamer, DreamFusion, DreamGaussian og mer, følger en optimaliseringsbasert tilnærming for å oppnå 3D-bilder ved å destillere en 3D-bilde fra forskjellige inkonsistente modeller. Selv om disse teknikkene er effektive og genererer tilfredsstillende 3D-bilder, kan resultater forbedres med implementeringen av en base-diffusjonsmodell i stand til å generere multi-view-bilder konsistent.

I Zero-1-til-3-rammeverket genereres hver nytt synsbilde uavhengig, og denne tilnærmingen fører til inkonsistenser mellom de genererte bildene, ettersom diffusjonsmodellene har en stikprøve-egenskap. For å takle dette problemet, adopterer Zero123++-rammeverket en tiling-layout-tilnærming, hvor objektet omgitt av seks bilder legges sammen til ett enkelt bilde, og sikrer korrekt modellering for den felles distribusjonen av et objekts multi-view-bilder.

En annen stor utfordring som utviklere som arbeider med Zero-1-til-3-rammeverket møter, er at det underutnytter kapasiteten som tilbys av Stable Diffusion, noe som ultimate fører til ineffektivitet og økte kostnader. Det er to hovedårsaker til at Zero-1-til-3-rammeverket ikke kan maksimere kapasiteten som tilbys av Stable Diffusion

  1. Når det gjelder trening med bilde-betingelser, inkorporerer Zero-1-til-3-rammeverket ikke lokale eller globale betingelsesmekanismer som tilbys av Stable Diffusion effektivt.
  2. Under trening bruker Zero-1-til-3-rammeverket redusert oppløsning, en tilnærming hvor utgangsoppløsningen reduseres under treningsoppløsningen, noe som kan redusere kvaliteten på bilde-generering for Stable Diffusion-modeller.

For å takle disse problemene, implementerer Zero123++-rammeverket en rekke betingelses-teknikker som maksimerer utnyttelsen av ressurser som tilbys av Stable Diffusion og opprettholder kvaliteten på bilde-generering for Stable Diffusion-modeller.

Forbedring av betingelser og konsistens

I et forsøk på å forbedre bilde-betingelser og multi-view-bilde-konsistens, implementerte Zero123++-rammeverket forskjellige teknikker, med hovedmålet å gjenbruke tidligere tekniker fra det forhånds trenede Stable Diffusion-modellen.

Multi-view-generering

Den uerstattelige kvaliteten på å generere konsistente multi-view-bilder ligger i å modellere den felles distribusjonen av flere bilder korrekt. I Zero-1-til-3-rammeverket ignoreres korrelasjonen mellom multi-view-bilder, ettersom rammeverket modellerer den betingede marginale distribusjonen uavhengig og separat for hvert bilde. Imidlertid, i Zero123++-rammeverket, har utviklerne valgt en tiling-layout-tilnærming som legger 6 bilder sammen til ett enkelt bilde for konsistent multi-view-generering, og prosessen demonstreres i følgende bilde.

Videre har det blitt observert at objekt-orienteringer tenderer til å uskarpere når modellen trenes på kamera-pose, og for å forebygge denne uskarpen, trenes Zero-1-til-3-rammeverket på kamera-pose med høyde-vinkler og relativ azimuth til inngangen. For å implementere denne tilnærmingen, er det nødvendig å kjenne til høyde-vinkelen til utsiktspunktet til inngangen, som deretter brukes til å bestemme den relative posen mellom nye inngangs-utsikter. I et forsøk på å kjenne til denne høyde-vinkelen, legger rammeverkene ofte til en høyde-estimeringsmodul, og denne tilnærmingen kommer ofte på bekostning av ekstra feil i pipeline-en.

Støy-schedule

Skalert lineær schedule, den opprinnelige støy-schedule for Stable Diffusion, fokuserer primært på lokale detaljer, men som det kan ses i følgende bilde, har den svært få steg med lavere SNR eller signal-til-støy-forhold.

Disse stegene med lavt signal-til-støy-forhold skjer tidlig under denøyning-stadiet, et stadium som er avgjørende for å bestemme den globale lavfrekvens-strukturen. Redusere antallet steg under denøyning-stadiet, enten under interferens eller trening, resulterer ofte i en større struktur-variighet. Selv om denne oppsettet er ideelt for enkelt-bilde-generering, begrenser det rammeverkets evne til å sikre global konsistens mellom forskjellige utsikter. For å overvinne denne hindringen, finjusterer Zero123++-rammeverket en LoRA-modell på Stable Diffusion 2-v-prediksjons-rammeverket for å utføre en leke-oppgave, og resultater demonstreres nedenfor.

Med den skalerte lineære støy-schedule, overfitter ikke LoRA-modellen, men hvitner bare bildet litt. Omvendt, når det gjelder den lineære støy-schedule, genererer LoRA-rammeverket en blank bilde suksessfullt uavhengig av inngangs-prompten, og dette indikerer støy-schedulens innvirkning på rammeverkets evne til å tilpasse seg nye krav globalt.

Skalert referanse-oppmerksomhet for lokale betingelser

Det enkelt-bilde-inngangen eller betingelses-bildene i Zero-1-til-3-rammeverket er konkateneret med de støyende inngangene i funksjons-dimensjonen for å bli støyende for bilde-betingelser.

Denne konkateneringen fører til en feil pixel-til-pixel romlig korrespondanse mellom målbildet og inngangs-bildet. For å gi korrekt lokal betingelses-inngang, bruker Zero123++-rammeverket en skalert referanse-oppmerksomhet, en tilnærming hvor en avrensnings-UNet-modell refereres til en ekstra referanse-bilde, etterfulgt av appendasjon av verdi-matriser og selv-oppmerksomhet-nøkkel fra referanse-bildet til de respektive oppmerksomhets-lagene når modell-inngangen avrenses, og prosessen demonstreres i følgende figur.

Referanse-oppmerksomhets-tilnærmingen er i stand til å guide diffusjons-modellen til å generere bilder som deler lignende tekstur med referanse-bildet, og semantisk innhold uten noen finjustering. Med finjustering, leverer referanse-oppmerksomhets-tilnærmingen overlegne resultater med latent skalert.

Global betingelse: FlexDiffuse

I den opprinnelige Stable Diffusion-tilnærmingen er tekst-embeddingene den eneste kilden til globale embeddinger, og tilnærmingen bruker CLIP-rammeverket som en tekst-encoder for å utføre kryss-eksaminasjoner mellom tekst-embeddingene og modell-latentene. Resultatmessig er utviklerne frie til å bruke sammenligningen mellom tekst-rommene og de resulterende CLIP-bildene for å bruke det til global bilde-betingelser.

Zero123++-rammeverket foreslår å bruke en trening-variant av den lineære guidansen-mekanismen for å inkorporere global bilde-betingelse i rammeverket med minimal finjustering nødvendig, og resultater demonstreres i følgende bilde. Som det kan ses, uten global bilde-betingelse, er kvaliteten på innholdet generert av rammeverket tilfredsstillende for synlige regioner som korresponderer med inngangs-bildet. Imidlertid vitner kvaliteten på bildet generert av rammeverket for usette regioner om en betydelig forverring, og dette skyldes hovedsakelig modellens evne til å slutte om objektets globale semantikk.

Modell-arkitektur

Zero123++-rammeverket er trenet med Stable Diffusion 2v-modellen som grunnlag, ved å bruke forskjellige tilnærminger og tekniker nevnt i artikkelen. Zero123++-rammeverket er forhånds trenet på Objaverse-datasettet, som er rendret med tilfeldig HDRI-lys. Rammeverket adopterer også den fase-til-trening-schedule-tilnærmingen brukt i Stable Diffusion Image Variations-rammeverket i et forsøk på å minimere den finjusteringen som kreves, og å bevare så mye som mulig av den tidligere Stable Diffusion.

Arbeidet eller arkitekturen til Zero123++-rammeverket kan videre deles inn i sekvensielle steg eller faser. Den første fasen vitner om at rammeverket finjusterer KV-matrisene til kryss-oppmerksomhets-lagene og selv-oppmerksomhets-lagene til Stable Diffusion med AdamW som optimizer, 1000 varm-opp-steg og den kosinus-lærings-raten maksimerer ved 7×10-5. I den andre fasen, bruker rammeverket en høyt konservativ konstant lærings-rate med 2000 varm-opp-sett, og bruker Min-SNR-tilnærmingen for å maksimere effektiviteten under treningen.

Zero123++: Resultater og ytelses-sammenligning

Kvalitativ ytelse

For å vurdere ytelsen til Zero123++-rammeverket basert på kvaliteten generert, sammenlignes det mot SyncDreamer og Zero-1-til-3-XL, to av de beste statiske kunst-til-tilfelle-rammeverk for innholdsgenerering. Rammeverkene sammenlignes mot fire inngangs-bilder med forskjellige omfang. Den første bildet er en elektrisk leke-katt, tatt direkte fra Objaverse-datasettet, og det har en stor usikkerhet på baksiden av objektet. Den andre er bildet av en brann-sluknings-apparat, og den tredje er bildet av en hund som sitter på en rakett, generert av SDXL-modellen. Den siste bildet er en anime-illustrasjon. De nødvendige høyde-stegene for rammeverkene oppnås ved å bruke One-2-3-4-5-rammeverkets høyde-estimerings-metode, og bakgrunn-fjerning oppnås ved å bruke SAM-rammeverket. Som det kan ses, genererer Zero123++-rammeverket høy-kvalitets multi-view-bilder konsistent, og er i stand til å generalisere til utenfor-domene 2D-illustrasjoner og AI-genererte bilder like godt.

Kvantitativ analyse

For å sammenligne Zero123++-rammeverket kvantitativt mot statiske kunst-til-tilfelle-rammeverk som Zero-1-til-3 og Zero-1-til-3-XL, vurderer utviklerne den lærte perseptuelle bilde-patch-lignende (LPIPS)-scoren til disse modellene på validerings-datasettet, en undergruppe av Objaverse-datasettet. For å vurdere modellens ytelse på multi-view-bilde-generering, legger utviklerne sammen grunn-sannhets-referanse-bildene og 6 genererte bilder, og beregner deretter LPIPS-scoren. Resultatene demonstreres nedenfor, og som det kan ses, oppnår Zero123++-rammeverket den beste ytelsen på validerings-datasettet.

Tekst-til-multi-view-evaluering

For å vurdere Zero123++-rammeverkets evne til å generere tekst-til-multi-view-innhold, bruker utviklerne først SDXL-rammeverket med tekst-prompter for å generere et bilde, og deretter bruker Zero123++-rammeverket bildet generert. Resultatene demonstreres i følgende bilde, og som det kan ses, sammenlignet med Zero-1-til-3-rammeverket som ikke kan garantere konsistent multi-view-generering, returnerer Zero123++-rammeverket konsistente, realistiske og høyt-detaljerte multi-view-bilder ved å implementere tekst-til-bilde-til-multi-view-tilnærmingen eller pipeline-en.

Zero123++ Dybde ControlNet

I tillegg til det grunnleggende Zero123++-rammeverket, har utviklerne også lansert Depth ControlNet Zero123++, en dybde-kontrollert versjon av det opprinnelige rammeverket bygget ved å bruke ControlNet-arkitekturen. De normaliserte lineære bildene rendres i henhold til de påfølgende RGB-bildene, og en ControlNet-rammeverk trenes for å kontrollere geometrien til Zero123++-rammeverket ved å bruke dybde-persepsjon.

Konklusjon

I denne artikkelen har vi diskutert Zero123++, et bilde-betinget diffusjons-genereringsmodell som har som mål å generere 3D-konsistente multi-view-bilder fra et enkelt bildeinngang. For å maksimere fordelen fra tidligere forhånds trenede genereringsmodeller, implementerer Zero123++-rammeverket flere trenings- og betingelsesordninger for å minimere den innsatsen det tar å finjustere fra ferdige diffusjonsbilmodeller. Vi har også diskutert de forskjellige tilnærminger og forbedringene som er implementert av Zero123++-rammeverket for å oppnå resultater som er sammenlignbare med, og sogar overgår de som er oppnådd av nåværende statiske kunst-til-tilfelle-rammeverk.

Imidlertid, til tross for sin effektivitet og evne til å generere høy-kvalitets multi-view-bilder konsistent, har Zero123++-rammeverket fortsatt noen rom for forbedring, med potensielle områder for forskning som en To-trinns-refineringsmodell som kan løse Zero123++-rammeverkets evne til å møte globale krav til konsistens. Ytterligere skala-oppskaleringer kan også forbedre Zero123++-rammeverkets evne til å generere bilder av enda høyere kvalitet.

  • To-trinns-refineringsmodell som kan løse Zero123++-rammeverkets evne til å møte globale krav til konsistens.
  • Ytterligere skala-oppskaleringer for å forbedre Zero123++-rammeverkets evne til å generere bilder av enda høyere kvalitet.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.