Modelli e piattaforme di IA
LucidDreamer: Alta fedeltà di generazione testo-3D tramite Interval Score Matching

Le recenti avanzate nel campo dei framework di generazione testo-3D hanno segnato un importante traguardo nei modelli generativi. Ciò apre la strada a nuove possibilità nella creazione di asset 3D in numerosi scenari del mondo reale. Gli asset digitali 3D occupano ora un posto indispensabile nella nostra presenza digitale, consentendo una visualizzazione e un’interazione complete con ambienti e oggetti complessi che riflettono le nostre esperienze nel mondo reale. Questi framework di generazione testo-3D vengono applicati in vari domini, tra cui animazione, architettura, gaming, realtà aumentata e virtuale e molto altro. Vengono anche utilizzati ampiamente in conferenze online, retail, istruzione e marketing.
Tuttavia, nonostante le promesse di questi avanzamenti nei framework di generazione testo-3D, l’utilizzo estensivo delle tecnologie 3D presenta un problema importante. La generazione di immagini e contenuti multimediali 3D di alta qualità richiede ancora notevoli tempo, sforzo, risorse e competenze specialistiche. Anche quando queste esigenze vengono soddisfatte, la generazione testo-3D spesso non riesce a produrre modelli 3D dettagliati e di alta qualità. Questo problema di rendering e generazione 3D di bassa qualità è più diffuso nei framework che utilizzano il metodo Score Distillation Sampling (SDS). Questo articolo discuterà delle carenze più significative osservate nei modelli che utilizzano il metodo SDS, che introducono incongruenze e direzioni di aggiornamento di bassa qualità, portando a un effetto di sovrasmussamento sull’output generato. Presenteremo anche il framework LucidDreamer, un approccio innovativo che utilizza il metodo Interval Score Matching (ISM) per superare il problema di sovrasmussamento. Esploreremo l’architettura del modello e le sue prestazioni rispetto ai framework generativi testo-3D attuali. Quindi, iniziamo.
LucidDreamer3D: Introduzione alla generazione 3D tramite Interval Score Matching
Un motivo importante per cui i modelli di generazione 3D sono stati al centro dell’industria dell’intelligenza artificiale generativa è la loro ampia applicazione in vari domini e settori, nonché la loro capacità di produrre contenuti 3D in tempo reale. Grazie alle loro ampie applicazioni pratiche, gli sviluppatori hanno proposto numerosi approcci per la generazione di contenuti 3D, tra cui spicca la generazione testo-3D per la sua capacità di utilizzare solo descrizioni testuali per generare modelli 3D immaginativi. I framework di generazione testo-3D raggiungono ciò utilizzando un modello di diffusione immagine pre-addestrato come immagine forte prima di supervisionare l’addestramento di un modello neurale parametrizzato 3D, consentendo così la rendering di immagini 3D coerenti che si allineano con il testo. Questa capacità di rendering immagini 3D costanti si basa sull’utilizzo fondamentale del Score Distillation Sampling, e consente all’SDS di agire come meccanismo centrale per portare risultati 2D dai modelli di diffusione ai loro omologhi 3D, abilitando così l’addestramento di modelli 3D senza l’uso di immagini di addestramento. Nonostante la loro efficacia, i framework di generazione 3D che utilizzano il metodo SDS spesso soffrono di problemi di distorsione e sovrasmussamento che ostacolano le implementazioni pratiche della generazione 3D ad alta fedeltà.
Per affrontare i problemi di sovrasmussamento, il framework LucidDreamer implementa un approccio Interval Score Matching (ISM), un approccio innovativo che utilizza due meccanismi efficaci. In primo luogo, l’approccio ISM utilizza il metodo di inversione DDIM per mitigare l’effetto di mediazione causato dalle incongruenze della pseudo-verità di base producendo una traiettoria di diffusione invertibile. In secondo luogo, invece di far corrispondere le immagini renderizzate dal modello 3D con le pseudo-verità di base, il metodo ISM le fa corrispondere tra due passaggi di intervallo nella traiettoria di diffusione, aiutandolo così a evitare errori di ricostruzione elevati evitando la ricostruzione in un solo passo. L’utilizzo di ISM rispetto a SDS comporta prestazioni costantemente elevate con output realistici e dettagliati.
Nel complesso, il framework LucidDreamer mira a fare i seguenti contributi nell’intelligenza artificiale generativa 3D
- Fornisce un’analisi approfondita dell’SDS, il concetto fondamentale nei framework di generazione testo-3D, e identifica le sue limitazioni principali di pseudo-verità di base di bassa qualità, e fornisce una spiegazione per l’effetto di sovrasmussamento che i framework di generazione 3D affrontano.
- Per contrastare le limitazioni poste dall’approccio SDS, il framework LucidDreamer introduce l’Interval Score Matching, un approccio innovativo che utilizza l’abbinamento basato su intervalli e traiettorie di diffusione invertibili per superare l’SDS producendo output realistici e dettagliati.
- Raggiunge le prestazioni attuali integrando il metodo ISM con lo Splatting Gaussiano 3D per superare i metodi esistenti per la generazione di contenuti 3D con bassi costi di addestramento.
Limitazioni dell’SDS
Come menzionato in precedenza, l’SDS è uno degli approcci più popolari per la generazione testo-3D, e cerca modi per il post-priori condizionale nello spazio latente del DDPM. L’approccio SDS adotta anche un modello DDPM pre-addestrato per modellare il post-priori condizionale, e mira a distillare le rappresentazioni 3D per il post-priori condizionale che viene raggiunto minimizzando la seguente divergenza KL. Inoltre, l’approccio SDS riutilizza l’obiettivo di abbinamento del punteggio di denoising ponderato per l’addestramento DDP. L’obiettivo principale dell’approccio SDS può anche essere visto come far corrispondere la vista del modello 3D con la pseudo-verità di base stimata dal DDPM in un solo passo, sebbene il processo di distillazione spesso trascuri aspetti chiave del componente DDPM, e la figura seguente dimostra come un DDPM pre-addestrato tenda a prevedere pseudo-verità di base con caratteristiche inconsistenti, e produce output di bassa qualità durante il processo di distillazione.

Tuttavia, le direzioni di aggiornamento in circostanze indesiderabili vengono aggiornate alle rappresentazioni 3D che alla fine portano a risultati sovrasmussati. Inoltre, è importante notare che il componente DDPM è sensibile all’input, e le caratteristiche della pseudo-verità di base cambiano significativamente anche con il minimo cambiamento dell’input. Inoltre, la casualità nella posa della camera e nel componente di rumore degli input potrebbe aggiungere alle fluttuazioni che sono inevitabili durante la distillazione. Ottimizzare l’input per pseudo-verità di base inconsistenti porta a risultati mediati sulle caratteristiche. Ciò che più conta è che l’approccio SDS ottiene pseudo-verità di base con una previsione a un solo passo per tutti gli intervalli di tempo, e non tiene conto delle limitazioni di un componente DDPM a un solo passo che non è in grado di produrre output di alta qualità, il che indica che la distillazione di asset o immagini 3D con il componente SDS potrebbe non essere l’approccio più ideale.
LucidDreamer: Metodologia e Funzionamento
Il framework LucidDreamer introduce l’approccio ISM, ma si basa anche sulle conoscenze acquisite da altri framework, tra cui modelli di generazione testo-3D, modelli di diffusione e framework di rappresentazione 3D differenziabili. Detto questo, analizziamo in dettaglio l’architettura e la metodologia del framework LucidDreamer.
Interval Score Matching o ISM
I problemi di sovrasmussamento e di bassa qualità degli output che la maggior parte dei framework di generazione testo-3D affronta possono essere attribuiti all’utilizzo dell’approccio SDS che mira a far corrispondere la pseudo-verità di base con le rappresentazioni 3D, che è incongruente e spesso di qualità scadente. Per contrastare i problemi affrontati dall’SDS, il framework LucidDreamer introduce l’ISM o Interval Score Matching, un approccio innovativo che ha due fasi operative. Nella prima fase, il componente ISM ottiene pseudo-verità di base più coerenti durante la distillazione, indipendentemente dalla casualità nelle pose della camera e nel rumore. Nella seconda fase, il framework genera pseudo-verità di base di migliore qualità.
Un’altra limitazione significativa dell’SDS è la generazione di pseudo-verità di base con una previsione a un solo passo per tutti gli intervalli di tempo, il che rende difficile garantire pseudo-verità di base di alta qualità, e costituisce la base per migliorare la qualità visiva delle pseudo-verità di base. In un senso simile, l’obiettivo dell’SDS può essere visto come far corrispondere la vista del modello 3D con la pseudo-verità di base stimata dal DDPM in un solo passo, sebbene il processo di distillazione trascuri un aspetto critico del componente DDPM, ovvero produce pseudo-verità di base di bassa qualità con caratteristiche inconsistenti durante il processo di distillazione.
Nel complesso, il componente ISM promette di offrire diversi vantaggi rispetto ai metodi precedenti utilizzati nei modelli di generazione testo-3D. In primo luogo, grazie alla capacità dell’ISM di fornire pseudo-verità di base di alta qualità in modo coerente, è in grado di produrre output di distillazione ad alta fedeltà con strutture più fini e dettagli più ricchi, eliminando così la necessità di una grande guida di scala e aumentando la flessibilità per la creazione di contenuti 3D. In secondo luogo, il passaggio dall’approccio SDS all’approccio ISM ha un sovraccarico computazionale marginale, specialmente poiché l’approccio ISM non compromette l’efficienza complessiva, anche se richiede costi computazionali aggiuntivi per le inversioni DDIM.

La figura sopra illustra il funzionamento dell’approccio ISM e fornisce una panoramica dell’architettura del framework LucidDreamer. Il framework inizia inizializzando lo Splatting Gaussiano, ovvero le rappresentazioni 3D, utilizzando un generatore testo-3D pre-addestrato con un prompt. Viene quindi incorporato con un componente DDPM 2D pre-addestrato per disturbare viste casuali a traiettorie latenti non condizionali utilizzando inversioni DDIM, e quindi aggiorna con il punteggio dell’intervallo. Grazie alla sua architettura, il nucleo dell’ottimizzazione del componente ISM si concentra sull’aggiornamento delle rappresentazioni 3D verso pseudo-verità di base di alta qualità e coerenti con le caratteristiche, ma computazionalmente amichevoli. Questo principio è ciò che consente all’ISM di allinearsi con gli obiettivi fondamentali dell’approccio SDS, raffinando il metodo esistente.
Inversione DDIM
Il framework LucidDreamer mira a produrre pseudo-verità di base più coerenti allineate con le rappresentazioni 3D. Pertanto, invece di produrre rappresentazioni 3D, il framework LucidDreamer utilizza l’approccio di inversione DDIM per prevedere rappresentazioni 3D latenti di rumore e prevede una traiettoria latente di rumore invertibile in modo iterativo. Inoltre, è grazie all’invertibilità dell’inversione DDIM che il framework LucidDreamer è in grado di aumentare notevolmente la coerenza della pseudo-verità di base per tutti gli intervalli di tempo.
Pipeline di Generazione Avanzata
Il framework LucidDreamer introduce anche una pipeline avanzata in aggiunta all’ISM per esplorare i fattori che influenzano la qualità visiva della generazione testo-3D, e introduce lo Splatting Gaussiano 3D o 3DGS come modello di generazione 3D e modello di generazione di nuvole di punti 3D per l’inizializzazione.
Splatting Gaussiano 3D
Lavori esistenti hanno indicato che l’aumento della dimensione del batch e della risoluzione di rendering per l’addestramento migliora notevolmente la qualità visiva. Tuttavia, la maggior parte delle rappresentazioni 3D apprendibili adottate per la generazione testo-3D sono dispendiose in termini di tempo e memoria. D’altra parte, l’approccio di Splatting Gaussiano 3D fornisce risultati efficienti sia nell’ottimizzazione che nel rendering, il che consente alla pipeline di generazione avanzata nel framework LucidDreamer di raggiungere una grande dimensione del batch e un rendering ad alta risoluzione anche quando opera con risorse computazionali limitate.
Inizializzazione
La maggior parte dei framework di generazione testo-3D attuali inizializza le rappresentazioni 3D con geometrie limitate come cerchi, scatole o cilindri, il che spesso porta a output indesiderati su oggetti non simmetrici assiali. D’altra parte, poiché il framework LucidDreamer introduce lo Splatting Gaussiano 3D come rappresentazioni 3D, il framework può adottare naturalmente diversi framework di generazione testo-punti per generare un’inizializzazione grossolana con input umani. La strategia di inizializzazione aumenta notevolmente la velocità di convergenza.
LucidDreamer: Esperimenti e Risultati
Generazione Testo-3D

La figura sopra illustra i risultati generati dal modello LucidDreamer con l’approccio di diffusione stabile originale, mentre la figura seguente discute i risultati generati su diversi checkpoint di fine-tuning.

Come si può vedere, il framework LucidDreamer è in grado di generare contenuti 3D estremamente coerenti utilizzando il testo di input e i suggerimenti semantici. Inoltre, con l’utilizzo dell’ISM, il framework LucidDreamer genera immagini intricate e più realistiche evitando problemi comuni come la sovrassaturazione o il sovrasmussamento, e si distingue nella generazione di oggetti comuni e nel supporto alla creazione creativa.
Generalizzabilità dell’ISM
Per valutare la generalizzabilità dell’ISM, viene condotto un confronto tra l’ISM e l’SDS sia in rappresentazioni esplicite che implicite, e i risultati sono illustrati nell’immagine seguente.

Confronto Qualitativo
Per analizzare l’efficienza qualitativa del framework LucidDreamer, viene confrontato con i modelli di riferimento attuali, e per garantire un confronto equo, utilizza il framework di diffusione stabile 2.1 per la distillazione, e i risultati sono illustrati nell’immagine seguente. Come si può vedere, il framework fornisce risultati ad alta fedeltà e geometricamente precisi mentre consuma meno risorse e tempo.

Inoltre, per fornire una valutazione più completa, gli sviluppatori conducono anche uno studio utente. La valutazione seleziona 28 prompt e utilizza diversi approcci di generazione testo-3D su ogni prompt per generare oggetti. I risultati vengono quindi classificati dagli utenti in base al grado di allineamento con il prompt di input e alla fedeltà.

LucidDreamer: Applicazioni
Grazie alle sue prestazioni eccezionali in una vasta gamma di compiti di generazione testo-3D, il framework LucidDreamer ha diverse applicazioni potenziali, tra cui la generazione di avatar zero-shot, la generazione testo-3D personalizzata e la modifica 2D e 3D zero-shot.

L’immagine in alto a sinistra dimostra il potenziale del LucidDreamer nei compiti di modifica 2D e 3D zero-shot, mentre le immagini in basso a sinistra dimostrano la capacità del framework di generare output testo-3D personalizzati con LoRA, mentre l’immagine a destra mostra la capacità del framework di generare avatar 3D.
Pensieri Finali
In questo articolo, abbiamo discusso del LucidDreamer, un approccio innovativo che utilizza il metodo Interval Score Matching o ISM per superare il problema di sovrasmussamento, e abbiamo discusso dell’architettura del modello e delle sue prestazioni rispetto ai framework generativi testo-3D attuali. Abbiamo anche discusso di come l’SDS o Score Distillation Sampling, un approccio comune implementato nella maggior parte dei modelli di generazione testo-3D, spesso porti a un sovrasmussamento delle immagini generate, e di come il framework LucidDreamer contrasti questo problema introducendo un nuovo approccio, l’approccio Interval Score Matching, per generare immagini 3D ad alta fedeltà e più realistiche. I risultati e la valutazione indicano l’efficacia del framework LucidDreamer in una vasta gamma di compiti di generazione 3D, e di come il framework abbia già prestazioni migliori dei modelli generativi 3D attuali. Le prestazioni eccezionali del framework aprono la strada a una vasta gamma di applicazioni pratiche, come già discusso.












