AI-modeller og plattformer

LucidDreamer: Høytilpasset tekst-til-3D-generering via Interval Score Matching

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

De nylige fremstegene i tekst-til-3D-generative AI-rammer har markert en betydelig milepæl i generative modeller. De åpner vei for nye muligheter i å lage 3D-aktiva over mange virkelige scenarioer. Digitale 3D-aktiva har nå en uunnværlig plass i vår digitale tilstedeværelse, og muliggjør omfattende visualisering og interaksjon med komplekse miljøer og objekter som speiler våre virkelige erfaringer. Disse 3D-generative AI-rammene brukes i ulike domener, inkludert animasjon, arkitektur, spill, forbedret og virtuell virkelighet, og mye mer. De brukes også omfattende i nettbaserte konferanser, detaljhandel, utdanning og markedsføring.

Men, til tross for de løftede forventningene til disse fremstegene i tekst-til-3D-generative rammer, kommer den omfattende bruken av 3D-teknologier med en stor utfordring. Å generere høykvalitets 3D-bilder og medieinnhold krever fortsatt betydelig tid, innsats, ressurser og spesialisert ekspertise. Selv med disse kravene oppfylt, kan tekst-til-3D-generering ofte ikke rendre detaljerte og høykvalitets 3D-modeller. Dette problemet med rendering og lavkvalitets 3D-generering er mer utbredt i rammer som bruker Score Distillation Sampling (SDS)-metoden. Denne artikkelen vil diskutere de bemerkelsesverdige manglene som er observert i modeller som bruker SDS-metoden, som introduserer inkonsistenser og lavkvalitets oppdateringsretninger, noe som resulterer i en over-smoothing-effekt på det genererte utgangspunktet. Vi vil også introdusere LucidDreamer-rammen, en ny tilnærming som bruker Interval Score Matching (ISM)-metoden for å overvinne over-smoothing-problemet. Vi skal utforske modellens arkitektur og dens ytelse mot state-of-the-art tekst-til-3D-generative rammer. Så, la oss begynne.

LucidDreamer3D: En introduksjon til 3D-generering ved hjelp av Interval Score Matching

En viktig årsak til at 3D-genereringsmodeller har vært et samtaleemne i den generative AI-industrien er på grunn av deres vidstrakte anvendelser over ulike domener og industrier, og deres evne til å produsere 3D-innhold i sanntid. Takket være deres vidstrakte praktiske anvendelser, har utviklere foreslått flere 3D-innholdsgenereringsmetoder, hvor tekst-til-3D-generative rammer utmerker seg fra resten på grunn av deres evne til å bruke bare tekstbeskrivelser til å generere fantasifulle 3D-modeller. Tekst-til-3D-generative rammer oppnår dette ved å bruke en forhånds trenet tekst-til-bilde-diffusjonsmodell som en sterk bilde før overoppsving av en neuralparametrisert 3D-modell, og slik å rendre 3D-bilder konsistent som stemmer overens med teksten. Denne evnen til å rendre konsistente 3D-bilder er basert på bruken av Score Distillation Sampling i grunn, og lar SDS fungere som den sentrale mekanismen for å bringe 2D-resultater fra diffusjonsmodeller til deres 3D-ekvivalenter, og slik å muliggjøre trening av 3D-modeller uten å bruke treningsbilder. Til tross for deres effektivitet, lider 3D-generative AI-rammer som bruker SDS-metoden ofte under forvrengning og over-smoothing-problemer som hindrer de praktiske implementeringene av høykvalitets 3D-generering.

For å takle over-smoothing-problemet, implementerer LucidDreamer-rammen en ISM eller Interval Score Matching-tilnærming, en ny tilnærming som bruker to effektive mekanismer. Først bruker ISM-tilnærmingen DDIM-inversjon-metoden til å mildne den gjennomsnittlige effekten forårsaket av pseudo-Grund Truth-inkonsistenser ved å produsere en inverserbar diffusjonstrajektorie. For det andre, i stedet for å matche bildene som er rendret av 3D-modellen med pseudo-Grund Truth-ene, matcher ISM-metoden dem mellom to intervallesteg i diffusjonstrajektorien, noe som hjelper den til å unngå høy rekonstruksjonsfeil ved å unngå en-stegs-rekonstruksjon. Bruken av ISM over SDS resulterer i konsistent høy ytelse med svært realistiske og detaljerte utgangspunkter.

Overordnet sett har LucidDreamer-rammen til hensikt å bidra med følgende i 3D-generativ AI

  1. Gir en dybdeanalyse av SDS, det grunnleggende konseptet i tekst-til-3D-generative rammer, og identifiserer dens nøkkelbegrensninger av lavkvalitets pseudo-Grund Truth-er, og gir en forklaring på over-smoothing-effekten som møtes av disse 3D-generative rammer.
  2. For å motvirke begrensningene som er pålagt av SDS-tilnærmingen, introduserer LucidDreamer-rammen Interval Score Matching, en ny tilnærming som bruker interval-basert matching og inverserbar diffusjonstrajektorie for å overgå SDS ved å produsere svært realistiske og detaljerte utgangspunkter.
  3. Oppnår state-of-the-art-ytelse ved å integrere ISM-metoden med 3D-Gaussian Splatting for å overgå eksisterende metoder for 3D-innholdsgenerering med lave treningskostnader.

SDS-begrensninger

Som nevnt tidligere, er SDS en av de mest populære tilnærmingene for tekst-til-3D-generering, og den søker moduser for betinget post-prior i latentrommet til DDPM. SDS-tilnærmingen adopterer også en forhånds trenet DDPM for å modellere den betingede post-prior, og har til hensikt å destillere 3D-representasjonene for betinget post-prior som oppnås ved å minimere følgende KL-divergens. Videre, har SDS-tilnærmingen også gjenbrukt den vektete støyende score-matching-objektivet for DDP-trening. Det primære objektivet til SDS-tilnærmingen kan også sees som å matche utsikten til 3D-modellen med pseudo-grund-truth-estimatet i ett enkelt steg av DDPM. Men, utviklere har observert at destilleringprosessen ofte overseer nøkkelaspekter av DDPM, og følgende figur demonstrerer hvordan en forhånds trenet DDPM tenderer til å prediktere pseudo-grund-truth-er med inkonsistente trekk, og produserer lavkvalitetsutgang under destilleringprosessen.

Men, oppdateringsretninger under uønskede omstendigheter oppdateres til 3D-representasjoner som til slutt resulterer i over-smoothede resultater. Videre, er det verdt å merke seg at DDPM-komponenten er inngangs-sensitiv, og trekkene til pseudo-grund-truth-ene endrer seg betydelig selv med små endringer i inngangen. Tillegg av tilfeldighet i både kamera-pose og støy-komponenten i inngangene kan også legge til fluktuasjonene som er uunngåelige under destillering. Optimere inngangen for inkonsistente pseudo-grund-truth-er resulterer i gjennomsnittlige resultater. Hva mer er at SDS-tilnærmingen oppnår pseudo-grund-truth-er med enkelt-stegs-prediksjon for alle tidsintervaller, og tar ikke hensyn til begrensningene til en enkelt-stegs-DDPM-komponent som ikke kan produsere høykvalitetsutgang, noe som indikerer at destillering av 3D-aktiva eller bilder med SDS-komponenten kanskje ikke er den mest ideelle tilnærmingen.

LucidDreamer: Metodologi og arbeid

LucidDreamer-rammen introduserer ISM-tilnærmingen, men den bygger også på læringene fra andre rammer, inkludert tekst-til-3D-generative modeller, diffusjonsmodeller og differensierbare 3D-representasjonsrammer. Med det sagt, la oss se nærmere på arkitekturen og metodologien til LucidDreamer-rammen.

Interval Score Matching eller ISM

Over-smoothing- og lavkvalitetsutgangs-problemene som møtes av de fleste tekst-til-3D-generative rammer kan tilskrives deres bruk av SDS-tilnærpingen som søker å matche pseudo-grund-truth-ene med 3D-representasjonene som er inkonsistent og ofte av lav kvalitet. For å motvirke problemene som møtes av SDS, introduserer LucidDreamer-rammen ISM eller Interval Score Matching, en ny tilnærping som har to arbeidsfaser. I den første fasen, oppnår ISM-komponenten mer konsistente pseudo-grund-truth-er under destillering, uavhengig av tilfeldighet i kamera-pose og støy. I den andre fasen, genererer rammen pseudo-grund-truth-er med bedre kvalitet.

En annen betydelig begrensning til SDS er generering av pseudo-grund-truth-er med enkelt-stegs-prediksjon for alle tidsintervaller, noe som gjør det vanskelig å garantere høykvalitets pseudo-grund-truth-er, og det danner grunnlaget for å forbedre den visuelle kvaliteten til pseudo-grund-truth-ene. På en lignende måte, kan SDS-objektivet sees som å matche utsikten til 3D-modellen med pseudo-grund-truth-estimatet av DDPM i ett enkelt steg, selv om destilleringprosessen overseer en kritisk aspekt av DDPM-komponenten, nemlig at den produserer lavkvalitets pseudo-grund-truth-er med inkonsistente trekk under destilleringprosessen.

Overordnet sett, lover ISM-komponenten å levere flere fordeler over tidligere metoder som er brukt i tekst-til-3D-generative modeller. Først, takket være ISM-tilnærpingens evne til å levere høykvalitets pseudo-grund-truth-er konsistent, er den i stand til å produsere høykvalitets-destillering-utgang med finere strukturer og rikere detaljer, noe som eliminerer behovet for stor skala-veiledning, og øker fleksibiliteten for 3D-innholdsskapning. For det andre, overgangen fra SDS-tilnærpingen til ISM-tilnærpingen har marginale beregningsmessige overhoder, særlig siden ISM-tilnærpingen ikke kompromitterer med den overordnede effektiviteten, selv om den krever ekstra beregningskostnader for DDIM-inversjoner.

Figuren over demonstrerer arbeidet til ISM-tilnærpingen, og gir en oversikt over arkitekturen til LucidDreamer-rammen. Rammen initialiserer først Gaussian Splatting, dvs. 3D-representasjonene, ved hjelp av en forhånds trenet tekst-til-3D-generativ modell ved hjelp av en prompt. Den inkorporerer deretter en forhånds trenet 2D-DDPM-komponent for å forstyrre tilfeldige visninger til støyende ubetingede latente trajektorier ved hjelp av DDIM-inversjoner, og deretter oppdaterer med interval-scoren. Takket være dens arkitektur, fokuserer kjernen til å optimere ISM-komponenten på å oppdatere 3D-representasjonene mot pseudo-grund-truth-er som er av høy kvalitet og har konsistente trekk, men som er beregningsmessig vennlige. Dette prinsippet er det som lar ISM åtte å stemme overens med de grunnleggende objektene til SDS-tilnærpingen, samtidig som den refinerer den eksisterende metoden.

DDIM-inversjon

LucidDreamer-rammen har til hensikt å produsere mer konsistente pseudo-grund-truth-er i overensstemmelse med 3D-representasjonene. Derfor, i stedet for å produsere 3D-representasjoner, bruker LucidDreamer-rammen DDIM-inversjons-tilnærpingen til å prediktere støy-latente 3D-representasjoner, og prediktere en inverserbar støy-latent trajektorie på en iterativ måte. Videre, er det på grunn av inverserbarheten til DDIM-inversjon at LucidDreamer-rammen er i stand til å øke konsistensen til pseudo-grund-truth-ene betydelig for alle tidsintervaller.

Avansert genereringspipeline

LucidDreamer-rammen introduserer også en avansert pipeline i tillegg til ISM for å utforske faktorene som påvirker den visuelle kvaliteten til tekst-til-3D-generering, og introduserer 3D-Gaussian Splatting eller 3DGS som 3D-generering og 3D-punktsky-genereringsmodeller for initialisering.

3D-Gaussian Splatting

Eksisterende arbeider har indikert at økning av batch-størrelse og renderingsoppløsning for trening forbedrer den visuelle kvaliteten betydelig. Men, de fleste lærbare 3D-representasjoner som er adoptert for tekst-til-3D-generering er tids- og minnekreverende. På den andre siden, gir 3D-Gaussian Splatting-tilnærpingen effektive resultater både i optimisering og rendering, noe som lar den avanserte genereringspipelinen i LucidDreamer-rammen å oppnå stor batch-størrelse samt høyoppløst rendering, selv når den opererer med begrensede beregningsressurser.

Initialisering

De fleste state-of-the-art tekst-til-3D-generative rammer initialiserer sine 3D-representasjoner med begrensede geometrier som sirkel, boks eller sylinder, noe som ofte resulterer i uønskede utgangspunkter på ikke-akse-symmetriske objekter. På den andre siden, ettersom LucidDreamer-rammen introduserer 3D-Gaussian Splatting som 3D-representasjoner, kan rammen naturlig adoptere flere tekst-til-punkt-generative rammer for å generere en grov initialisering med menneskelige innganger. Initialiseringsstrategien booster konvergenshastigheten betydelig.

LucidDreamer: Eksperimenter og resultater

Tekst-til-3D-generering

Figuren over demonstrerer resultater generert av LucidDreamer-modellen med den opprinnelige stabile diffusjons-tilnærpingen, mens den følgende figuren diskuterer de genererte resultater på ulike finjusterte kontrollpunkter.

Som det kan ses, er LucidDreamer-rammen i stand til å generere høykonsistente 3D-innhold ved hjelp av inngangsteksten og semantiske hint. Videre, med bruk av ISM, genererer LucidDreamer-rammen intrikate og mer realistiske bilder mens den unngår vanlige problemer som over-metning eller over-smoothing, og utmerker seg i å generere vanlige objekter samt å støtte kreative skaperverk.

ISM-generellhet

For å evaluere ISM-generellhet, gjennomføres en sammenligning mellom ISM og SDS-metodene i både eksplisitte og implisitte representasjoner, og resultater demonstreres i den følgende figuren.

Kvalitativ sammenligning

For å analysere den kvalitative effektiviteten til LucidDreamer-rammen, sammenlignes den mot nåværende SoTA-baselinjemodeller, og for å sikre en rettferdig sammenligning, brukes Stable Diffusion 2.1-rammen for destillering, og resultater demonstreres i den følgende figuren. Som det kan ses, leverer rammen høykvalitets- og geometrisk nøyaktige resultater mens den forbruker færre ressurser og tid.

Videre, for å gi en mer omfattende evaluering, gjennomfører utviklerne også en brukerstudie. Evalueringen velger 28 promter og bruker ulike tekst-til-3D-generative metoder på hver prompt for å generere objekter. Resultatene ble deretter rangert av brukerne basert på graden av overensstemmelse med inngangsprompten og dens trofasthet.

LucidDreamer: Anvendelser

Takket være dens usedvanlige ytelse på en bred rekke tekst-til-3D-generative oppgaver, har LucidDreamer-rammen flere potensielle anvendelser, inkludert null-skudd-avatargenerering, personlig tekst-til-3D-generering og null-skudd-2D- og 3D-redigering.

Bilde øverst til venstre demonstrerer LucidDreamer-rammens potensiale i null-skudd-2D- og 3D-redigeringsoppgaver, mens bildene nederst til venstre demonstrerer rammenens evne til å generere personlige tekst-til-3D-utgangspunkter med LoRA, mens bildet til høyre viser rammenens evne til å generere 3D-avatarter.

Slutt tanker

I denne artikkelen, har vi diskutert LucidDreamer, en ny tilnærming som bruker Interval Score Matching-metoden for å overvinne over-smoothing-problemet, og diskutert modellens arkitektur og dens ytelse mot state-of-the-art tekst-til-3D-generative rammer. Vi har også diskutert hvordan SDS eller Score Distillation Sampling, en vanlig metode implementert i de fleste state-of-the-art tekst-til-3D-generative modeller, ofte resulterer i over-smoothing av de genererte bildene, og hvordan LucidDreamer-rammen motvirker dette problemet ved å introdusere en ny tilnærping, Interval Score Matching-tilnærpingen, for å generere høykvalitets- og mer realistiske 3D-bilder. Resultatene og evalueringen indikerer effektiviteten til LucidDreamer-rammen på en bred rekke 3D-generative oppgaver, og hvordan rammen allerede utfører bedre enn nåværende state-of-the-art 3D-generative modeller. Den usedvanlige ytelsen til rammen åpner opp for en bred rekke praktiske anvendelser, som allerede er diskutert.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.