Modelli e piattaforme di IA
Zero123++: Un modello di base di diffusione multi-vista coerente da un’immagine singola

Negli ultimi anni, abbiamo assistito a un rapido avanzamento delle prestazioni, dell’efficienza e delle capacità generative di modelli di intelligenza artificiale generativi emergenti che sfruttano dataset estensivi e pratiche di generazione di diffusione 2D. Oggi, i modelli di intelligenza artificiale generativi sono estremamente capaci di generare diverse forme di contenuti multimediali 2D e, in qualche misura, 3D, tra cui testo, immagini, video, GIF e molto altro.
In questo articolo, parleremo del framework Zero123++, un modello di intelligenza artificiale generativa condizionata da immagini con l’obiettivo di generare immagini multi-vista coerenti con una singola immagine di input. Per massimizzare il vantaggio derivato da modelli generativi pre-addestrati, il framework Zero123++ implementa numerosi schemi di addestramento e condizionamento per minimizzare lo sforzo necessario per adattare i modelli di immagini di diffusione pre-confezionati. Esploreremo l’architettura, il funzionamento e i risultati del framework Zero123++ e analizzeremo le sue capacità di generare immagini multi-vista coerenti di alta qualità da una singola immagine. Quindi, iniziamo.
Zero123 e Zero123++: Un’introduzione
Il framework Zero123++ è un modello di intelligenza artificiale generativa condizionata da immagini che mira a generare immagini multi-vista coerenti con una singola immagine di input. Il framework Zero123++ è una continuazione del framework Zero123 o Zero-1-to-3, che sfrutta la tecnica di sintesi di immagini di vista nuova zero-shot per pionierare le conversioni da singola immagine a 3D open-source. Sebbene il framework Zero123++ offra prestazioni promettenti, le immagini generate dal framework presentano visibili incongruenze geometriche, che sono la principale ragione per cui esiste ancora un divario tra scene 3D e immagini multi-vista.
Il framework Zero-1-to-3 serve come base per altri framework, tra cui SyncDreamer, One-2-3-45, Consistent123 e molti altri, che aggiungono strati aggiuntivi al framework Zero123 per ottenere risultati più coerenti nella generazione di immagini 3D. Altri framework, come ProlificDreamer, DreamFusion, DreamGaussian e molti altri, seguono un approccio basato sull’ottimizzazione per ottenere immagini 3D distillando un’immagine 3D da vari modelli incoerenti. Sebbene queste tecniche siano efficaci e generino immagini 3D soddisfacenti, i risultati potrebbero essere migliorati implementando un modello di base di diffusione in grado di generare immagini multi-vista coerentemente. Di conseguenza, il framework Zero123++ prende il framework Zero-1-to-3 e adatta un nuovo modello di base di diffusione multi-vista da Stable Diffusion.
Nel framework Zero-1-to-3, ogni vista nuova è generata indipendentemente, un approccio che porta a incongruenze tra le viste generate, poiché i modelli di diffusione hanno una natura di campionamento. Per affrontare questo problema, il framework Zero123++ adotta un approccio di layout a tile, con l’oggetto circondato da sei viste in un’unica immagine, garantendo la modellazione corretta della distribuzione congiunta delle immagini multi-vista di un oggetto.
Un’altra sfida importante affrontata dagli sviluppatori che lavorano sul framework Zero-1-to-3 è che esso sottovaluta le capacità offerte da Stable Diffusion, il che porta a inefficienze e costi aggiuntivi. Ci sono due motivi principali per cui il framework Zero-1-to-3 non può massimizzare le capacità offerte da Stable Diffusion
- Quando si addestra con condizioni di immagine, il framework Zero-1-to-3 non incorpora meccanismi di condizionamento locale o globale offerti da Stable Diffusion in modo efficace.
- Durante l’addestramento, il framework Zero-1-to-3 utilizza una risoluzione ridotta, un approccio in cui la risoluzione di output viene ridotta al di sotto della risoluzione di addestramento, il che può ridurre la qualità della generazione di immagini per i modelli di Stable Diffusion.
Per affrontare questi problemi, il framework Zero123++ implementa una serie di tecniche di condizionamento che massimizzano l’utilizzo delle risorse offerte da Stable Diffusion e mantengono la qualità della generazione di immagini per i modelli di Stable Diffusion.
Miglioramento della condizionamento e della coerenza
Nel tentativo di migliorare la condizionamento di immagine e la coerenza di immagini multi-vista, il framework Zero123++ ha implementato diverse tecniche, con l’obiettivo principale di riutilizzare tecniche precedenti derivanti dal modello di Stable Diffusion pre-addestrato.
Generazione multi-vista
La qualità indispensabile della generazione di immagini multi-vista coerenti risiede nel modellare correttamente la distribuzione congiunta di più immagini. Nel framework Zero-1-to-3, la correlazione tra immagini multi-vista è ignorata, poiché per ogni immagine, il framework modella la distribuzione marginale condizionale in modo indipendente e separato. Tuttavia, nel framework Zero123++, gli sviluppatori hanno optato per un approccio di layout a tile che unisce 6 immagini in un’unica immagine/quadro per la generazione di immagini multi-vista coerenti, e il processo è dimostrato nell’immagine seguente.

Inoltre, è stato notato che le orientazioni degli oggetti tendono a essere ambigue quando si addestra il modello su pose di camera, e per prevenire questa ambiguità, il framework Zero-1-to-3 si addestra su pose di camera con angoli di elevazione e azimut relativi all’input. Per implementare questo approccio, è necessario conoscere l’angolo di elevazione della vista dell’input, che viene quindi utilizzato per determinare la posa relativa tra le viste di input nuove.
Pianificazione del rumore
La pianificazione lineare scalata, la pianificazione del rumore originale per Stable Diffusion, si concentra principalmente sui dettagli locali, ma come si può vedere nell’immagine seguente, ha pochi passaggi con un rapporto segnale/rumore (SNR) più basso.

Questi passaggi con un rapporto segnale/rumore più basso si verificano all’inizio della fase di denoising, una fase cruciale per determinare la struttura globale a bassa frequenza. Ridurre il numero di passaggi durante la fase di denoising, sia durante l’interferenza che durante l’addestramento, spesso comporta una maggiore variazione strutturale. Sebbene questo setup sia ideale per la generazione di immagini singole, limita la capacità del framework di garantire la coerenza globale tra diverse viste.
Attenzione di riferimento scalata per condizioni locali
L’input di vista singola o le immagini di condizionamento nel framework Zero-1-to-3 vengono concatenati con gli input rumorosi nella dimensione delle caratteristiche per essere rumorosi per la condizionamento di immagine.
Questa concatenazione porta a una corrispondenza spaziale pixel-per-pixel errata tra l’immagine di destinazione e l’input. Per fornire un input di condizionamento locale corretto, il framework Zero123++ utilizza un’attenzione di riferimento scalata, un approccio in cui si esegue un modello di denoising UNet su un’immagine di riferimento aggiuntiva, seguito dall’appendice di matrici di valore e chiave di auto-attenzione dall’immagine di riferimento ai rispettivi strati di attenzione quando l’input del modello viene denoised, e il processo è dimostrato nella figura seguente.

L’approccio di attenzione di riferimento è in grado di guidare il modello di diffusione a generare immagini che condividono una texture simile all’immagine di riferimento e un contenuto semantico senza alcun addestramento. Con l’addestramento, l’approccio di attenzione di riferimento fornisce risultati superiori con il latente scalato.

Condizionamento globale: FlexDiffuse
Nell’approccio originale di Stable Diffusion, le embedding di testo sono l’unica fonte di embedding globali, e l’approccio utilizza il framework CLIP come encoder di testo per eseguire esami incrociati tra le embedding di testo e i latenti del modello. Di conseguenza, gli sviluppatori sono liberi di utilizzare l’allineamento tra gli spazi di testo e le immagini CLIP risultanti per utilizzarlo per la condizionamento di immagine globale.
Il framework Zero123++ propone di utilizzare una variante addestrabile del meccanismo di guida lineare per incorporare la condizionamento di immagine globale nel framework con un minimo addestramento necessario, e i risultati sono dimostrati nell’immagine seguente. Come si può vedere, senza la presenza di una condizionamento di immagine globale, la qualità del contenuto generato dal framework è soddisfacente per le aree visibili che corrispondono all’immagine di input. Tuttavia, la qualità dell’immagine generata dal framework per le aree non visibili subisce un deterioramento significativo, principalmente a causa dell’incapacità del modello di inferire la semantica globale dell’oggetto.

Architettura del modello
Il framework Zero123++ è addestrato con il modello Stable Diffusion 2v come base utilizzando gli approcci e le tecniche menzionate nell’articolo. Il framework Zero123++ è pre-addestrato sul dataset Objaverse reso con illuminazione HDRI casuale. Il framework adotta anche l’approccio di pianificazione dell’addestramento fase per fase utilizzato nel framework Stable Diffusion Image Variations per minimizzare ulteriormente la quantità di addestramento necessario e preservare il più possibile il modello di Stable Diffusion precedente.
Il funzionamento o l’architettura del framework Zero123++ può essere ulteriormente suddiviso in passaggi o fasi sequenziali. La prima fase vede il framework addestrare le matrici KV dei layer di cross-attenzione e i layer di auto-attenzione di Stable Diffusion con AdamW come ottimizzatore, 1000 passi di riscaldamento e la pianificazione della velocità di apprendimento del coseno che massimizza a 7×10-5. Nella seconda fase, il framework utilizza una velocità di apprendimento costante molto conservativa con 2000 set di riscaldamento e utilizza l’approccio Min-SNR per massimizzare l’efficienza durante l’addestramento.
Zero123++: Risultati e confronto delle prestazioni
Prestazioni qualitative
Per valutare le prestazioni del framework Zero123++ in base alla qualità generata, viene confrontato con SyncDreamer e Zero-1-to-3-XL, due dei migliori framework di stato dell’arte per la generazione di contenuti. I framework vengono confrontati con quattro immagini di input diverse. La prima immagine è un gatto giocattolo elettrico, preso direttamente dal dataset Objaverse, e presenta un’incertezza significativa sulla parte posteriore dell’oggetto. Il secondo è l’immagine di un estintore, e il terzo è l’immagine di un cane seduto su un razzo, generata dal modello SDXL. L’ultima immagine è un’illustrazione anime. I passaggi di elevazione necessari per i framework vengono raggiunti utilizzando il metodo di stima dell’elevazione del framework One-2-3-4-5, e la rimozione dello sfondo viene eseguita utilizzando il framework SAM. Come si può vedere, il framework Zero123++ genera immagini multi-vista di alta qualità coerentemente e è in grado di generalizzare a illustrazioni 2D fuori dal dominio e immagini generate da AI altrettanto bene.


Analisi quantitativa
Per confrontare quantitativamente il framework Zero123++ con i framework di stato dell’arte Zero-1-to-3 e Zero-1-to-3 XL, gli sviluppatori valutano il punteggio di similarità di immagine patch appresa (LPIPS) di questi modelli sui dati di convalida, un subset del dataset Objaverse. Per valutare le prestazioni del modello nella generazione di immagini multi-vista, gli sviluppatori uniscono le immagini di riferimento di base e 6 immagini generate rispettivamente, e quindi calcolano il punteggio LPIPS. I risultati sono dimostrati di seguito e, come si può vedere chiaramente, il framework Zero123++ raggiunge le migliori prestazioni sul set di convalida.

Valutazione testo-multi-vista
Per valutare la capacità del framework Zero123++ di generare contenuti testo-multi-vista, gli sviluppatori utilizzano prima il framework SDXL con prompt di testo per generare un’immagine, e quindi utilizzano il framework Zero123++ sull’immagine generata. I risultati sono dimostrati nell’immagine seguente, e come si può vedere, rispetto al framework Zero-1-to-3 che non può garantire la generazione di immagini multi-vista coerenti, il framework Zero123++ restituisce immagini multi-vista coerenti, realistiche e dettagliate implementando l’approccio di pipeline testo-Immagine-multi-vista.

Zero123++ Depth ControlNet
Oltre al framework Zero123++ di base, gli sviluppatori hanno anche rilasciato il framework Depth ControlNet Zero123++, una versione controllata della profondità del framework originale costruito utilizzando l’architettura ControlNet. Le immagini lineari normalizzate vengono rese in relazione alle immagini RGB successive, e un framework ControlNet viene addestrato per controllare la geometria del framework Zero123++ utilizzando la percezione della profondità.

Conclusione
In questo articolo, abbiamo parlato del framework Zero123++, un modello di intelligenza artificiale generativa condizionata da immagini con l’obiettivo di generare immagini multi-vista coerenti con una singola immagine di input. Per massimizzare il vantaggio derivato da modelli generativi pre-addestrati, il framework Zero123++ implementa numerosi schemi di addestramento e condizionamento per minimizzare lo sforzo necessario per adattare i modelli di immagini di diffusione pre-confezionati. Abbiamo anche discusso gli approcci e i miglioramenti implementati dal framework Zero123++ che gli consentono di raggiungere risultati paragonabili a, e addirittura superiori a, quelli raggiunti dai framework di stato dell’arte attuali.
Tuttavia, nonostante la sua efficienza e la sua capacità di generare immagini multi-vista coerenti di alta qualità, il framework Zero123++ ha ancora margini di miglioramento, con aree di ricerca potenziali come un modello di raffinamento a due fasi che potrebbe risolvere l’incapacità del framework Zero123++ di soddisfare i requisiti globali di coerenza. Inoltre, ulteriori miglioramenti potrebbero essere apportati con l’aggiunta di funzionalità per generare immagini di qualità ancora più elevate.
- Modello di raffinamento a due fasi che potrebbe risolvere l’incapacità del framework Zero123++ di soddisfare i requisiti globali di coerenza.
- Miglioramenti aggiuntivi per ulteriormente migliorare la capacità del framework Zero123++ di generare immagini di qualità ancora più elevate.












