AI-modeller og plattformer
LucidDreamer: Høytilpasset tekst-til-3D-generering via Interval Score Matching

De nylige fremstegene i tekst-til-3D-generative AI-rammer har markert en betydelig milepæl i generative modeller. De åpner vei for nye muligheter i å lage 3D-aktiva over mange virkelige scenarioer. Digitale 3D-aktiva har nå en uunnværlig plass i vår digitale tilstedeværelse, og muliggjør omfattende visualisering og interaksjon med komplekse miljøer og objekter som speiler våre virkelige erfaringer. Disse 3D-generative AI-rammene brukes i ulike domener, inkludert animasjon, arkitektur, spill, forbedret og virtuell virkelighet, og mye mer. De brukes også omfattende i nettbaserte konferanser, detaljhandel, utdanning og markedsføring.
Men, til tross for de løftede forventningene til disse fremstegene i tekst-til-3D-generative rammer, kommer den omfattende bruken av 3D-teknologier med en stor utfordring. Å generere høykvalitets 3D-bilder og medieinnhold krever fortsatt betydelig tid, innsats, ressurser og spesialisert ekspertise. Selv med disse kravene oppfylt, kan tekst-til-3D-generering ofte ikke rendre detaljerte og høykvalitets 3D-modeller. Dette problemet med rendering og lavkvalitets 3D-generering er mer utbredt i rammer som bruker Score Distillation Sampling (SDS)-metoden. Denne artikkelen vil diskutere de bemerkelsesverdige manglene som er observert i modeller som bruker SDS-metoden, som introduserer inkonsistenser og lavkvalitets oppdateringsretninger, noe som resulterer i en over-smoothing-effekt på det genererte utgangspunktet. Vi vil også introdusere LucidDreamer-rammen, en ny tilnærming som bruker Interval Score Matching (ISM)-metoden for å overvinne over-smoothing-problemet. Vi skal utforske modellens arkitektur og dens ytelse mot state-of-the-art tekst-til-3D-generative rammer. Så, la oss begynne.
LucidDreamer3D: En introduksjon til 3D-generering ved hjelp av Interval Score Matching
En viktig årsak til at 3D-genereringsmodeller har vært et samtaleemne i den generative AI-industrien er på grunn av deres vidstrakte anvendelser over ulike domener og industrier, og deres evne til å produsere 3D-innhold i sanntid. Takket være deres vidstrakte praktiske anvendelser, har utviklere foreslått flere 3D-innholdsgenereringsmetoder, hvor tekst-til-3D-generative rammer utmerker seg fra resten på grunn av deres evne til å bruke bare tekstbeskrivelser til å generere fantasifulle 3D-modeller. Tekst-til-3D-generative rammer oppnår dette ved å bruke en forhånds trenet tekst-til-bilde-diffusjonsmodell som en sterk bilde før overoppsving av en neuralparametrisert 3D-modell, og slik å rendre 3D-bilder konsistent som stemmer overens med teksten. Denne evnen til å rendre konsistente 3D-bilder er basert på bruken av Score Distillation Sampling i grunn, og lar SDS fungere som den sentrale mekanismen for å bringe 2D-resultater fra diffusjonsmodeller til deres 3D-ekvivalenter, og slik å muliggjøre trening av 3D-modeller uten å bruke treningsbilder. Til tross for deres effektivitet, lider 3D-generative AI-rammer som bruker SDS-metoden ofte under forvrengning og over-smoothing-problemer som hindrer de praktiske implementeringene av høykvalitets 3D-generering.
For å takle over-smoothing-problemet, implementerer LucidDreamer-rammen en ISM eller Interval Score Matching-tilnærming, en ny tilnærming som bruker to effektive mekanismer. Først bruker ISM-tilnærmingen DDIM-inversjon-metoden til å mildne den gjennomsnittlige effekten forårsaket av pseudo-Grund Truth-inkonsistenser ved å produsere en inverserbar diffusjonstrajektorie. For det andre, i stedet for å matche bildene som er rendret av 3D-modellen med pseudo-Grund Truth-ene, matcher ISM-metoden dem mellom to intervallesteg i diffusjonstrajektorien, noe som hjelper den til å unngå høy rekonstruksjonsfeil ved å unngå en-stegs-rekonstruksjon. Bruken av ISM over SDS resulterer i konsistent høy ytelse med svært realistiske og detaljerte utgangspunkter.
Overordnet sett har LucidDreamer-rammen til hensikt å bidra med følgende i 3D-generativ AI
- Gir en dybdeanalyse av SDS, det grunnleggende konseptet i tekst-til-3D-generative rammer, og identifiserer dens nøkkelbegrensninger av lavkvalitets pseudo-Grund Truth-er, og gir en forklaring på over-smoothing-effekten som møtes av disse 3D-generative rammer.
- For å motvirke begrensningene som er pålagt av SDS-tilnærmingen, introduserer LucidDreamer-rammen Interval Score Matching, en ny tilnærming som bruker interval-basert matching og inverserbar diffusjonstrajektorie for å overgå SDS ved å produsere svært realistiske og detaljerte utgangspunkter.
- Oppnår state-of-the-art-ytelse ved å integrere ISM-metoden med 3D-Gaussian Splatting for å overgå eksisterende metoder for 3D-innholdsgenerering med lave treningskostnader.
SDS-begrensninger
Som nevnt tidligere, er SDS en av de mest populære tilnærmingene for tekst-til-3D-generering, og den søker moduser for betinget post-prior i latentrommet til DDPM. SDS-tilnærmingen adopterer også en forhånds trenet DDPM for å modellere den betingede post-prior, og har til hensikt å destillere 3D-representasjonene for betinget post-prior som oppnås ved å minimere følgende KL-divergens. Videre, har SDS-tilnærmingen også gjenbrukt den vektete støyende score-matching-objektivet for DDP-trening. Det primære objektivet til SDS-tilnærmingen kan også sees som å matche utsikten til 3D-modellen med pseudo-grund-truth-estimatet i ett enkelt steg av DDPM. Men, utviklere har observert at destilleringprosessen ofte overseer nøkkelaspekter av DDPM, og følgende figur demonstrerer hvordan en forhånds trenet DDPM tenderer til å prediktere pseudo-grund-truth-er med inkonsistente trekk, og produserer lavkvalitetsutgang under destilleringprosessen.

Men, oppdateringsretninger under uønskede omstendigheter oppdateres til 3D-representasjoner som til slutt resulterer i over-smoothede resultater. Videre, er det verdt å merke seg at DDPM-komponenten er inngangs-sensitiv, og trekkene til pseudo-grund-truth-ene endrer seg betydelig selv med små endringer i inngangen. Tillegg av tilfeldighet i både kamera-pose og støy-komponenten i inngangene kan også legge til fluktuasjonene som er uunngåelige under destillering. Optimere inngangen for inkonsistente pseudo-grund-truth-er resulterer i gjennomsnittlige resultater. Hva mer er at SDS-tilnærmingen oppnår pseudo-grund-truth-er med enkelt-stegs-prediksjon for alle tidsintervaller, og tar ikke hensyn til begrensningene til en enkelt-stegs-DDPM-komponent som ikke kan produsere høykvalitetsutgang, noe som indikerer at destillering av 3D-aktiva eller bilder med SDS-komponenten kanskje ikke er den mest ideelle tilnærmingen.
LucidDreamer: Metodologi og arbeid
LucidDreamer-rammen introduserer ISM-tilnærmingen, men den bygger også på læringene fra andre rammer, inkludert tekst-til-3D-generative modeller, diffusjonsmodeller og differensierbare 3D-representasjonsrammer. Med det sagt, la oss se nærmere på arkitekturen og metodologien til LucidDreamer-rammen.
Interval Score Matching eller ISM
Over-smoothing- og lavkvalitetsutgangs-problemene som møtes av de fleste tekst-til-3D-generative rammer kan tilskrives deres bruk av SDS-tilnærpingen som søker å matche pseudo-grund-truth-ene med 3D-representasjonene som er inkonsistent og ofte av lav kvalitet. For å motvirke problemene som møtes av SDS, introduserer LucidDreamer-rammen ISM eller Interval Score Matching, en ny tilnærping som har to arbeidsfaser. I den første fasen, oppnår ISM-komponenten mer konsistente pseudo-grund-truth-er under destillering, uavhengig av tilfeldighet i kamera-pose og støy. I den andre fasen, genererer rammen pseudo-grund-truth-er med bedre kvalitet.
En annen betydelig begrensning til SDS er generering av pseudo-grund-truth-er med enkelt-stegs-prediksjon for alle tidsintervaller, noe som gjør det vanskelig å garantere høykvalitets pseudo-grund-truth-er, og det danner grunnlaget for å forbedre den visuelle kvaliteten til pseudo-grund-truth-ene. På en lignende måte, kan SDS-objektivet sees som å matche utsikten til 3D-modellen med pseudo-grund-truth-estimatet av DDPM i ett enkelt steg, selv om destilleringprosessen overseer en kritisk aspekt av DDPM-komponenten, nemlig at den produserer lavkvalitets pseudo-grund-truth-er med inkonsistente trekk under destilleringprosessen.
Overordnet sett, lover ISM-komponenten å levere flere fordeler over tidligere metoder som er brukt i tekst-til-3D-generative modeller. Først, takket være ISM-tilnærpingens evne til å levere høykvalitets pseudo-grund-truth-er konsistent, er den i stand til å produsere høykvalitets-destillering-utgang med finere strukturer og rikere detaljer, noe som eliminerer behovet for stor skala-veiledning, og øker fleksibiliteten for 3D-innholdsskapning. For det andre, overgangen fra SDS-tilnærpingen til ISM-tilnærpingen har marginale beregningsmessige overhoder, særlig siden ISM-tilnærpingen ikke kompromitterer med den overordnede effektiviteten, selv om den krever ekstra beregningskostnader for DDIM-inversjoner.

Figuren over demonstrerer arbeidet til ISM-tilnærpingen, og gir en oversikt over arkitekturen til LucidDreamer-rammen. Rammen initialiserer først Gaussian Splatting, dvs. 3D-representasjonene, ved hjelp av en forhånds trenet tekst-til-3D-generativ modell ved hjelp av en prompt. Den inkorporerer deretter en forhånds trenet 2D-DDPM-komponent for å forstyrre tilfeldige visninger til støyende ubetingede latente trajektorier ved hjelp av DDIM-inversjoner, og deretter oppdaterer med interval-scoren. Takket være dens arkitektur, fokuserer kjernen til å optimere ISM-komponenten på å oppdatere 3D-representasjonene mot pseudo-grund-truth-er som er av høy kvalitet og har konsistente trekk, men som er beregningsmessig vennlige. Dette prinsippet er det som lar ISM åtte å stemme overens med de grunnleggende objektene til SDS-tilnærpingen, samtidig som den refinerer den eksisterende metoden.
DDIM-inversjon
LucidDreamer-rammen har til hensikt å produsere mer konsistente pseudo-grund-truth-er i overensstemmelse med 3D-representasjonene. Derfor, i stedet for å produsere 3D-representasjoner, bruker LucidDreamer-rammen DDIM-inversjons-tilnærpingen til å prediktere støy-latente 3D-representasjoner, og prediktere en inverserbar støy-latent trajektorie på en iterativ måte. Videre, er det på grunn av inverserbarheten til DDIM-inversjon at LucidDreamer-rammen er i stand til å øke konsistensen til pseudo-grund-truth-ene betydelig for alle tidsintervaller.
Avansert genereringspipeline
LucidDreamer-rammen introduserer også en avansert pipeline i tillegg til ISM for å utforske faktorene som påvirker den visuelle kvaliteten til tekst-til-3D-generering, og introduserer 3D-Gaussian Splatting eller 3DGS som 3D-generering og 3D-punktsky-genereringsmodeller for initialisering.
3D-Gaussian Splatting
Eksisterende arbeider har indikert at økning av batch-størrelse og renderingsoppløsning for trening forbedrer den visuelle kvaliteten betydelig. Men, de fleste lærbare 3D-representasjoner som er adoptert for tekst-til-3D-generering er tids- og minnekreverende. På den andre siden, gir 3D-Gaussian Splatting-tilnærpingen effektive resultater både i optimisering og rendering, noe som lar den avanserte genereringspipelinen i LucidDreamer-rammen å oppnå stor batch-størrelse samt høyoppløst rendering, selv når den opererer med begrensede beregningsressurser.
Initialisering
De fleste state-of-the-art tekst-til-3D-generative rammer initialiserer sine 3D-representasjoner med begrensede geometrier som sirkel, boks eller sylinder, noe som ofte resulterer i uønskede utgangspunkter på ikke-akse-symmetriske objekter. På den andre siden, ettersom LucidDreamer-rammen introduserer 3D-Gaussian Splatting som 3D-representasjoner, kan rammen naturlig adoptere flere tekst-til-punkt-generative rammer for å generere en grov initialisering med menneskelige innganger. Initialiseringsstrategien booster konvergenshastigheten betydelig.
LucidDreamer: Eksperimenter og resultater
Tekst-til-3D-generering

Figuren over demonstrerer resultater generert av LucidDreamer-modellen med den opprinnelige stabile diffusjons-tilnærpingen, mens den følgende figuren diskuterer de genererte resultater på ulike finjusterte kontrollpunkter.

Som det kan ses, er LucidDreamer-rammen i stand til å generere høykonsistente 3D-innhold ved hjelp av inngangsteksten og semantiske hint. Videre, med bruk av ISM, genererer LucidDreamer-rammen intrikate og mer realistiske bilder mens den unngår vanlige problemer som over-metning eller over-smoothing, og utmerker seg i å generere vanlige objekter samt å støtte kreative skaperverk.
ISM-generellhet
For å evaluere ISM-generellhet, gjennomføres en sammenligning mellom ISM og SDS-metodene i både eksplisitte og implisitte representasjoner, og resultater demonstreres i den følgende figuren.

Kvalitativ sammenligning
For å analysere den kvalitative effektiviteten til LucidDreamer-rammen, sammenlignes den mot nåværende SoTA-baselinjemodeller, og for å sikre en rettferdig sammenligning, brukes Stable Diffusion 2.1-rammen for destillering, og resultater demonstreres i den følgende figuren. Som det kan ses, leverer rammen høykvalitets- og geometrisk nøyaktige resultater mens den forbruker færre ressurser og tid.

Videre, for å gi en mer omfattende evaluering, gjennomfører utviklerne også en brukerstudie. Evalueringen velger 28 promter og bruker ulike tekst-til-3D-generative metoder på hver prompt for å generere objekter. Resultatene ble deretter rangert av brukerne basert på graden av overensstemmelse med inngangsprompten og dens trofasthet.

LucidDreamer: Anvendelser
Takket være dens usedvanlige ytelse på en bred rekke tekst-til-3D-generative oppgaver, har LucidDreamer-rammen flere potensielle anvendelser, inkludert null-skudd-avatargenerering, personlig tekst-til-3D-generering og null-skudd-2D- og 3D-redigering.

Bilde øverst til venstre demonstrerer LucidDreamer-rammens potensiale i null-skudd-2D- og 3D-redigeringsoppgaver, mens bildene nederst til venstre demonstrerer rammenens evne til å generere personlige tekst-til-3D-utgangspunkter med LoRA, mens bildet til høyre viser rammenens evne til å generere 3D-avatarter.
Slutt tanker
I denne artikkelen, har vi diskutert LucidDreamer, en ny tilnærming som bruker Interval Score Matching-metoden for å overvinne over-smoothing-problemet, og diskutert modellens arkitektur og dens ytelse mot state-of-the-art tekst-til-3D-generative rammer. Vi har også diskutert hvordan SDS eller Score Distillation Sampling, en vanlig metode implementert i de fleste state-of-the-art tekst-til-3D-generative modeller, ofte resulterer i over-smoothing av de genererte bildene, og hvordan LucidDreamer-rammen motvirker dette problemet ved å introdusere en ny tilnærping, Interval Score Matching-tilnærpingen, for å generere høykvalitets- og mer realistiske 3D-bilder. Resultatene og evalueringen indikerer effektiviteten til LucidDreamer-rammen på en bred rekke 3D-generative oppgaver, og hvordan rammen allerede utfører bedre enn nåværende state-of-the-art 3D-generative modeller. Den usedvanlige ytelsen til rammen åpner opp for en bred rekke praktiske anvendelser, som allerede er diskutert.












