AI-modeller og platforme

LucidDreamer: Højtilfældigt tekst-til-3D-generering via Interval Score Matching

mm
Føj Unite.AI til dine foretrukne kilder på Google

De seneste fremskridt i tekst-til-3D-generative AI-rammer har markeret en betydelig milepæl i generative modeller. De baner vejen for nye muligheder for at oprette 3D-aktiver i talrige virkelige scenarier. Digitale 3D-aktiver har nu en uundværlig plads i vores digitale tilstedeværelse, hvilket muliggør omfattende visualisering og interaktion med komplekse miljøer og objekter, der spejler vores virkelige erfaringer. Disse 3D-generative AI-rammer anvendes i forskellige domæner, herunder animation, arkitektur, spil, forstærket og virtuel virkelighed og meget mere. De anvendes også omfattende på online-konferencer, detailhandel, uddannelse og marketing.

Men på trods af de fremskridt i tekst-til-3D-generative rammer, kommer den omfattende brug af 3D-teknologier med en stor udfordring. Generering af højkvalitets 3D-billeder og medieindhold kræver stadig betydelig tid, indsats, ressourcer og specialiseret ekspertise. Selv med disse krav opfyldt, kan tekst-til-3D-generering ofte ikke rendre detaljerede og højkvalitets 3D-modeller. Dette problem med rendering og lavkvalitets 3D-generering er mere udbredt i rammer, der anvender Score Distillation Sampling (SDS)-metoden. Dette artikel vil diskutere de bemærkelsesværdige mangler, der er observeret i modeller, der anvender SDS-metoden, som introducerer inkonsistenser og lavkvalitets opdateringsretninger, hvilket resulterer i en over-glatteringsvirkning på den genererede output. Vi vil også introducere LucidDreamer-rammen, en ny tilgang, der anvender Interval Score Matching (ISM)-metoden til at overvinde over-glatteringsproblemet. Vi vil udforske modellens arkitektur og dens præstation i forhold til state-of-the-art tekst-til-3D-generative rammer. Så lad os komme i gang.

LucidDreamer3D: En introduktion til 3D-generering med Interval Score Matching

En stor grund til, at 3D-genereringsmodeller har været samtaleemnet i den generative AI-industri, er på grund af deres vidt forgrenede anvendelser på tværs af forskellige domæner og industrier, samt deres evne til at producere 3D-indhold i realtid. Takket være deres vidt forgrenede praktiske anvendelser, har udviklere foreslået talrige 3D-indholdsgenereringsmetoder, hvoraf tekst-til-3D-generative rammer står ud fra resten på grund af deres evne til at bruge intet andet end tekstbeskrivelser til at generere imaginative 3D-modeller. Tekst-til-3D-generative rammer opnår dette ved at bruge en forudtrænet tekst-til-billeddiffusionsmodel til at supervisere træningen af en neuralparametreret 3D-model, hvilket muliggør rendering af 3D-billeder, der er konsekvent og samstemmende med teksten.

For at tackle over-glatteringsproblemerne implementerer LucidDreamer-rammen en ISM- eller Interval Score Matching-tilgang, en ny tilgang, der anvender to effektive mekanismer. Først anvender ISM-tilgangen DDIM-inversionsmetoden til at mitigere gennemsnitsvirkningen, der skyldes pseudo-Grund Sandheds inkonsistenser, ved at producere en inversibel diffusionsbane. For det andet matcher den ikke billederne, der renderes af 3D-modellen, med pseudo-Grund Sandhederne, men matcher dem mellem to intervaltrin i diffusionsbanen, hvilket hjælper med at undgå høj rekonstruktionsfejl ved at undgå enkelttrinsrekonstruktion.

Samlet set har LucidDreamer-rammen til formål at bidrage med følgende i 3D-generativ AI

  1. Tilbyder en dybdegående analyse af SDS, det grundlæggende begreb i tekst-til-3D-generative rammer, og identificerer dets nøglebegrænsninger af lavkvalitets pseudo-Grund Sandheder, og giver en forklaring på over-glatteringsvirkningen, der opleves af disse 3D-generative rammer.
  2. For at modgå begrænsningerne, der er påført af SDS-tilgangen, introducerer LucidDreamer-rammen Interval Score Matching, en ny tilgang, der anvender intervalbaseret matching og inversibel diffusionsbane til at overgå SDS ved at producere højrealistiske og detaljerede output.
  3. Opnår state-of-the-art-præstation ved at integrere ISM-metoden med 3D-Gaussian Splatting for at overgå eksisterende metoder til 3D-indholdsgenerering med lave træningsomkostninger.

SDS-begrænsninger

Som nævnt tidligere er SDS en af de mest populære tilgange til tekst-til-3D-generering, og den søger modus for betinget post prior i den latente rum af DDPM. SDS-tilgangen anvender også en forudtrænet DDPM til at modellere den betingede posterior, og sigter mod at destillere 3D-repræsentationer for betinget posterior, der opnås ved at minimere følgende KL-divergens.

LucidDreamer: Metodik og arbejdsgang

LucidDreamer-rammen introducerer ISM-tilgangen, men den bygger også på erfaringer fra andre rammer, herunder tekst-til-3D-generative modeller, diffusionsmodeller og differentiable 3D-repræsentationsrammer. Med det sagt, lad os tage en nærmere kig på arkitekturen og metodikken i LucidDreamer-rammen.

Interval Score Matching eller ISM

Over-glatterings- og lavkvalitetsoutput-problemerne, der opleves af de fleste tekst-til-3D-generative rammer, kan tilskrives deres brug af SDS-tilgangen, der søger at matche pseudo-Grund Sandheden med 3D-repræsentationerne, der er inkonsistent og ofte af lav kvalitet. For at modgå problemerne, der opleves af SDS, introducerer LucidDreamer-rammen ISM eller Interval Score Matching, en ny tilgang, der har to arbejdstrin.

En anden stor begrænsning af SDS er generering af pseudo-Grund Sandheder med enkelttrinsprædiktion for alle tidsintervaller, hvilket gør det vanskeligt at garantere højkvalitets pseudo-Grund Sandheder, og det danner grundlag for at forbedre den visuelle kvalitet af pseudo-Grund Sandhederne.

DDIM-inversion

LucidDreamer-rammen sigter mod at producere mere konsekvente pseudo-Grund Sandheder i overensstemmelse med 3D-repræsentationerne. Derfor anvender LucidDreamer-rammen i stedet DDIM-inversionsmetoden til at forudsige støjlatent 3D-repræsentationer og forudsiger en inversibel støjlatent bane i en iterativ måde.

Avanceret genereringspipeline

LucidDreamer-rammen introducerer også en avanceret pipeline til at udforske faktorerne, der påvirker den visuelle kvalitet af tekst-til-3D-generering, og introducerer 3D-Gaussian Splatting eller 3DGS som 3D-genererings- og 3D-punktskygenereringsmodeller til initialisering.

3D-Gaussian Splatting

Eksisterende arbejder har vist, at øgning af batchstørrelsen og renderingsopløsningen under træning forbedrer den visuelle kvalitet betydeligt. Men de fleste lærbare 3D-repræsentationer, der anvendes til tekst-til-3D-generering, er tids- og memorykrævende. På den anden side giver 3D-Gaussian Splatting-tilgangen effektive resultater i både optimering og rendering, hvilket muliggør, at den avancerede genereringspipeline i LucidDreamer-rammen kan opnå stor batchstørrelse samt højopløsningsrendering, selv med begrænsede computermæssige ressourcer.

Initialisering

De fleste state-of-the-art tekst-til-3D-generative rammer initialiserer deres 3D-repræsentationer med begrænsede geometrier som cirkel, boks eller cylinder, hvilket ofte resulterer i uønskede output på ikke-aksiale symmetriske objekter. På den anden side kan LucidDreamer-rammen, da den introducerer 3D-Gaussian Splatting som 3D-repræsentationer, naturligt tilpasse sig til flere tekst-til-punkts-generative rammer til at generere en grov initialisering med menneskelige indtastninger.

LucidDreamer: Eksperimenter og resultater

Tekst-til-3D-generering

Figurerne ovenfor demonstrerer resultaterne, der er genereret af LucidDreamer-modellen med den originale stabile diffusionsmetode, mens den følgende figur diskuterer de genererede resultater på forskellige finjusterede checkpoints.

Som det kan ses, er LucidDreamer-rammen i stand til at generere højkonsekvent 3D-indhold ved hjælp af inputteksten og semantiske hints. Desuden genererer LucidDreamer-rammen med hjælp af ISM intrikate og mere realistiske billeder, mens den undgår almindelige problemer som overmætning eller over-glatteringsproblemer og excellerer i generering af almindelige objekter samt støtter kreative skabninger.

ISM-generelisering

For at evaluere ISM-genereliseringen gennemføres en sammenligning mellem ISM- og SDS-metoderne i både eksplisit og implicit repræsentation, og resultaterne demonstreres i følgende figur.

Kvalitativ sammenligning

For at analysere den kvalitative effektivitet af LucidDreamer-rammen sammenlignes den med aktuelle SoTA-baselinemodeller, og for at sikre en fair sammenligning anvendes Stable Diffusion 2.1-rammen til destillation, og resultaterne demonstreres i følgende figur. Som det kan ses, leverer rammen højtilfældige og geometrisk nøjagtige resultater, mens den forbruger færre ressourcer og tid.

Desuden gennemføres en brugerundersøgelse for at give en mere omfattende evaluering. Evalueringen vælger 28 prompts og anvender forskellige tekst-til-3D-generative tilgange på hver prompt til at generere objekter. Resultaterne blev derefter rangeret af brugerne på basis af graden af overensstemmelse med inputprompten og dens troværdighed.

LucidDreamer: Anvendelser

På grund af dens exceptionelle præstation på en bred vifte af tekst-til-3D-genereringsopgaver har LucidDreamer-rammen flere potentielle anvendelser, herunder Zero-shot avatar-generering, personlig tekst-til-3D-generering og Zero-shot 2D- og 3D-redigering.

Figurerne ovenfor demonstrerer LucidDreamer-rammens potentiale i Zero-shot 2D- og 3D-redigering samt dens evne til at generere personlige tekst-til-3D-output med LoRA samt dens evne til at generere 3D-avatare.

Endelige tanker

I denne artikel har vi talt om LucidDreamer, en ny tilgang, der anvender Interval Score Matching-metoden til at overvinde over-glatteringsproblemet, og diskuteret modellens arkitektur og dens præstation i forhold til state-of-the-art tekst-til-3D-generative rammer. Vi har også talt om, hvordan SDS eller Score Distillation Sampling, en almindelig tilgang i de fleste state-of-the-art tekst-til-3D-generative modeller, ofte resulterer i over-glatteringsproblemer i de genererede billeder, og hvordan LucidDreamer-rammen modgår dette problem ved at introducere en ny tilgang, Interval Score Matching-tilgangen, til at generere højtilfældige og mere realistiske 3D-billeder. Resultaterne og evalueringen indikerer effektiviteten af LucidDreamer-rammen på en bred vifte af 3D-genereringsopgaver og hvordan rammen allerede opfører sig bedre end aktuelle state-of-the-art 3D-generative modeller. Den exceptionelle præstation af rammen åbner op for en bred vifte af praktiske anvendelser, som allerede er diskuteret.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.