Modelli e piattaforme di IA

Concept Sliders: Controllo Preciso nei Modelli di Diffusione con Adattatori LoRA

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Grazie alle loro capacità, i modelli di diffusione testo-immagine sono diventati immensamente popolari nella comunità artistica. Tuttavia, i modelli attuali, compresi quelli di stato dell’arte, spesso lottano per mantenere il controllo sui concetti e gli attributi visivi nelle immagini generate, portando a output insoddisfacenti. La maggior parte dei modelli si basa esclusivamente su prompt testuali, il che presenta sfide nella modulazione di attributi continui come l’intensità del tempo, la nitidezza delle ombre, le espressioni facciali o l’età di una persona in modo preciso. CiÃē rende difficile per gli utenti finali regolare le immagini per soddisfare le loro esigenze specifiche. Inoltre, sebbene questi framework generativi producono immagini di alta qualità e realistiche, sono soggetti a distorsioni come volti distorti o dita mancanti.

Per superare queste limitazioni, gli sviluppatori hanno proposto l’uso di Concept Sliders interpretabili. Questi slider promettono un maggiore controllo per gli utenti finali sugli attributi visivi, migliorando la generazione e la modifica delle immagini all’interno dei modelli di diffusione. I Concept Sliders nei modelli di diffusione funzionano identificando una direzione di parametro corrispondente a un concetto individuale mentre minimizzano l’interferenza con altri attributi. Il framework crea questi slider utilizzando immagini di esempio o un set di prompt, stabilendo cosÃŽ direzioni per concetti testuali e visivi.

In definitiva, l’uso di Concept Sliders nei modelli di diffusione testo-immagine puÃē risultare in una generazione di immagini con un minimo grado di interferenza e un maggiore controllo sul output finale, aumentando anche la realismo percepito senza alterare il contenuto delle immagini, e generando cosÃŽ immagini realistiche. In questo articolo, discuteremo il concetto di utilizzo di Concept Sliders nei framework testo-immagine in maggiore profondità e analizzeremo come il loro uso possa portare a una generazione di immagini di qualità superiore.

Introduzione ai Concept Sliders

Come menzionato in precedenza, i framework di diffusione testo-immagine attuali spesso lottano per controllare i concetti e gli attributi visivi nelle immagini generate, portando a risultati insoddisfacenti. Inoltre, molti di questi modelli trovano difficile modulare gli attributi continui, contribuendo ulteriormente a output insoddisfacenti. I Concept Sliders possono aiutare a mitigare questi problemi, potenziando i creatori di contenuti e gli utenti finali con un maggiore controllo sul processo di generazione delle immagini e risolvendo le sfide affrontate dai framework attuali.

La maggior parte dei modelli di diffusione testo-immagine attuali si basa sulla modifica diretta del prompt testuale per controllare gli attributi dell’immagine. Sebbene questo approccio consenta la generazione di immagini, non ÃĻ ottimale in quanto la modifica del prompt puÃē alterare drasticamente la struttura dell’immagine. Un altro approccio utilizzato da questi framework coinvolge tecniche post-hoc, che invertono il processo di diffusione e modificano le attenzioni incrociate per modificare i concetti visivi. Tuttavia, le tecniche post-hoc hanno limitazioni, supportando solo un numero limitato di modifiche simultanee e richiedendo passaggi di interferenza individuali per ogni nuovo concetto. Inoltre, possono introdurre un’intreccio concettuale se non progettate con cura.

In contrasto, i Concept Sliders offrono una soluzione piÃđ efficiente per la generazione di immagini. Questi adattatori leggeri e facili da usare possono essere applicati a modelli pre-addestrati, migliorando il controllo e la precisione sui concetti desiderati in un’unica interferenza con minima intreccio. I Concept Sliders consentono anche la modifica di concetti visivi non coperti dalle descrizioni testuali, una caratteristica che li distingue dai metodi di editing basati su prompt testuali. Sebbene i metodi di personalizzazione basati su immagini possano aggiungere token per concetti basati su immagini, sono difficili da implementare per la modifica delle immagini. I Concept Sliders, d’altra parte, consentono agli utenti finali di fornire un numero limitato di immagini accoppiate che definiscono un concetto desiderato. I slider generalizzano quindi questo concetto e lo applicano automaticamente ad altre immagini, mirando a migliorare la realismo e a correggere distorsioni come quelle nelle mani.

I Concept Sliders si sforzano di apprendere e affrontare problemi comuni a quattro concetti di intelligenza artificiale generativa e framework di diffusione: Modifica di Immagini, Metodi basati sulla Guida, Modifica del Modello e Direzioni Semantiche.

Modifica di Immagini

I framework di intelligenza artificiale attuali si concentrano sull’uso di un input condizionale per guidare la struttura dell’immagine o manipolano le attenzioni incrociate dell’immagine sorgente con il prompt di destinazione per abilitare la modifica di immagini singole nei framework di diffusione testo-immagine. Di conseguenza, questi approcci possono essere implementati solo su immagini singole e richiedono anche l’ottimizzazione della base latente per ogni immagine a causa della struttura geometrica in evoluzione nel tempo tra i prompt.

Metodi basati sulla Guida

L’uso di metodi di guida basati su classificatori liberi ha indicato la loro capacità di migliorare la qualità delle immagini generate e aumentare l’allineamento testo-immagine. Incorporando termini di guida durante l’interferenza, il metodo migliora la limitata composizionalità ereditata dai framework di diffusione e puÃē essere utilizzato per guidare attraverso concetti non sicuri nei framework di diffusione.

Modifica del Modello

L’uso di Concept Sliders puÃē anche essere visto come una tecnica di modifica del modello che utilizza un adattatore di basso rango per output un singolo attributo semantico che consente un controllo continuo allineato con l’attributo. I metodi di personalizzazione basati sulla fine-tuning sono quindi utilizzati per personalizzare il framework e aggiungere nuovi concetti. Inoltre, la tecnica di diffusione personalizzata propone un modo per ottimizzare le layer di cross-attenzione per incorporare nuovi concetti visivi nei modelli di diffusione pre-addestrati. Al contrario, la tecnica di diffusione testuale propone di ottimizzare un vettore di incorporamento per attivare le capacità del modello e introdurre concetti testuali nel framework.

Direzioni Semantiche in GAN

La manipolazione degli attributi semantici ÃĻ una delle caratteristiche chiave delle Reti Generative Avversarie, con le traiettorie dello spazio latente trovate allineate in modo auto-supervisionato. Nei framework di diffusione, queste traiettorie dello spazio latente esistono nei layer intermedi dell’architettura U-Net, e la direzione principale degli spazi latenti nei framework di diffusione cattura la semantica globale. I Concept Sliders addestrano sottospazi di basso rango corrispondenti ad attributi speciali direttamente e ottengono direzioni di editing precise e localizzate utilizzando testo o immagini accoppiate per ottimizzare le direzioni globali.

Concept Sliders: Architettura e Funzionamento

Modelli di Diffusione e Adattatori LoRA o di Basso Rango

I modelli di diffusione sono essenzialmente una sottoclasse di framework di intelligenza artificiale generativa che operano sul principio di sintetizzare dati invertendo un processo di diffusione. Il processo di diffusione in avanti aggiunge inizialmente rumore ai dati, quindi la transizione da uno stato organizzato a un rumore gaussiano completo. L’obiettivo principale dei modelli di diffusione ÃĻ invertire il processo di diffusione denoising gradualmente l’immagine e campionando un rumore gaussiano casuale per generare un’immagine. Nelle applicazioni del mondo reale, l’obiettivo principale dei framework di diffusione ÃĻ prevedere il rumore vero quando il rumore gaussiano completo viene fornito come input con input aggiuntivi come condizionamento e timestep.

La tecnica degli adattatori LoRA o di basso rango decomporre gli aggiornamenti dei pesi durante la fine-tuning per abilitare un adattamento efficiente di grandi framework pre-addestrati su compiti a valle. La tecnica LoRA decomporre gli aggiornamenti dei pesi per un layer di un modello pre-addestrato rispetto sia alle dimensioni di input che di output e vincola l’aggiornamento a uno spazio a bassa dimensionalità.

Concept Sliders

L’obiettivo principale dei Concept Sliders ÃĻ servire come un approccio per fine-tuning gli adattatori LoRA su un framework di diffusione per facilitare un maggiore controllo sugli attributi di concetto bersaglio e lo stesso ÃĻ dimostrato nell’immagine seguente.

Quando condizionati su concetti bersaglio, i Concept Sliders apprendono direzioni di parametri di basso rango per aumentare o diminuire l’espressione di attributi specifici. Per un modello e il suo concetto bersaglio, l’obiettivo principale dei Concept Sliders ÃĻ ottenere un modello migliorato che modifica la probabilità di aumentare gli attributi e diminuire la probabilità di sopprimere gli attributi per un’immagine quando condizionata sul concetto bersaglio per aumentare la probabilità di aumentare gli attributi e diminuire la probabilità di sopprimere gli attributi. Utilizzando la riparametrizzazione e la formula di Tweedie, il framework introduce un processo di rumore variabile nel tempo e esprime ogni punteggio come una previsione di denoising. Inoltre, l’obiettivo di disentanglement ottimizza i moduli nei Concept Sliders mantenendo costanti i pesi pre-addestrati e il fattore di scala introdotto durante la formulazione LoRA viene modificato durante l’interferenza. Il fattore di scala facilita anche l’aggiustamento della forza dell’edit e rende gli edit piÃđ forti senza dover riaddestrare il framework, come dimostrato nell’immagine seguente.

I metodi di editing utilizzati in precedenza dai framework consentivano edit piÃđ forti riaddestrando il framework con una guida aumentata. Tuttavia, la scalatura del fattore di scala durante l’interferenza produce gli stessi risultati di editing senza aumentare il costo di riaddestramento e il tempo.

Apprendimento di Concetti Visivi

I Concept Sliders sono progettati per controllare concetti visivi che i prompt testuali non possono definire bene e questi slider sfruttano piccoli set di dati che sono accoppiati prima o dopo per addestrare su questi concetti. Il contrasto tra le immagini accoppiate consente ai slider di apprendere i concetti visivi. Inoltre, il processo di addestramento dei Concept Sliders ottimizza il componente LoRA implementato sia nella direzione in avanti che in quella inversa. Di conseguenza, il componente LoRA si allinea con la direzione che causa gli effetti visivi in entrambe le direzioni.

Concept Sliders: Risultati di Implementazione

Per analizzare il guadagno in termini di prestazioni, gli sviluppatori hanno valutato l’uso di Concept Sliders principalmente sul framework Stable Diffusion XL, un framework ad alta risoluzione da 1024 pixel con esperimenti aggiuntivi condotti sul framework Stable Diffusion v1.4 con i modelli addestrati per 500 epoche ciascuno.

Concept Sliders Testuali

Per valutare le prestazioni dei Concept Sliders testuali, ÃĻ stato validato su un set di 30 concetti basati su testo e il metodo ÃĻ stato confrontato con due baseline che utilizzano un prompt testuale standard per un numero fisso di timestep e poi inizia la composizione aggiungendo prompt per guidare l’immagine. Come si puÃē vedere nella figura seguente, l’uso di Concept Sliders risulta in un punteggio CLIP costantemente piÃđ alto e una riduzione costante del punteggio LPIPS rispetto al framework originale senza Concept Sliders.

Come si puÃē vedere nell’immagine sopra, l’uso di Concept Sliders consente un editing preciso degli attributi desiderati durante il processo di generazione dell’immagine mantenendo la struttura generale dell’immagine.

Concept Sliders Visivi

I modelli di diffusione testo-immagine che utilizzano solo prompt testuali spesso trovano difficile mantenere un alto grado di controllo sugli attributi visivi come i capelli facciali o le forme degli occhi. Per garantire un miglior controllo sugli attributi granulari, i Concept Sliders sfruttano una guida testuale opzionale accoppiata con set di immagini. Come si puÃē vedere nella figura seguente, i Concept Sliders creano slider individuali per “dimensione degli occhi” e “forma delle sopracciglia” che catturano le trasformazioni desiderate utilizzando le immagini accoppiate.

I risultati possono essere ulteriormente raffinati fornendo testi specifici in modo che la direzione si concentri su quella regione facciale e crei slider con controllo passo-passo sull’attributo bersaglio.

Composizione di Slider

Uno dei principali vantaggi dell’uso di Concept Sliders ÃĻ la loro composabilità, che consente agli utenti di combinare piÃđ slider per un maggiore controllo piuttosto che concentrarsi su un singolo concetto alla volta, il che puÃē essere attribuito alle direzioni dei slider di basso rango utilizzate nei Concept Sliders. Inoltre, poichÃĐ i Concept Sliders sono adattatori LoRA leggeri, sono facili da condividere e possono anche essere facilmente sovrapposti ai modelli di diffusione. Gli utenti possono anche regolare piÃđ controlli simultaneamente per guidare generazioni complesse scaricando set di slider interessanti.

L’immagine seguente dimostra le capacità di composizione dei concept slider e piÃđ slider sono composti progressivamente in ogni riga da sinistra a destra, consentendo cosÃŽ la navigazione di spazi di concetti ad alta dimensionalità con un maggiore controllo sui concetti.

Miglioramento della Qualità dell’Immagine

Sebbene i framework di diffusione testo-immagine di stato dell’arte e i modelli generativi di larga scala come il modello Stable Diffusion XL siano in grado di generare immagini realistiche e di alta qualità, spesso soffrono di distorsioni come oggetti sfocati o avvolti anche se i parametri di questi framework di stato dell’arte sono dotati della capacità latente di generare output di alta qualità con meno generazioni. L’uso di Concept Sliders puÃē risultare nella generazione di immagini con meno distorsioni sbloccando le vere capacità di questi modelli identificando direzioni di parametri di basso rango.

Risoluzione dei Problemi delle Mani

La generazione di immagini con mani realistiche ÃĻ sempre stata una sfida per i framework di diffusione e l’uso di Concept Sliders ha un controllo diretto sulla tendenza a distorcere le mani. L’immagine seguente dimostra l’effetto dell’uso dei Concept Sliders “risoluzione dei problemi delle mani” che consente al framework di generare immagini con mani piÃđ realistiche.

Slider di Riparazione

L’uso di Concept Sliders non solo puÃē risultare nella generazione di mani piÃđ realistiche, ma ha anche mostrato il loro potenziale nel migliorare la realismo generale delle immagini generate dal framework. I Concept Sliders identificano una singola direzione di parametro di basso rango che consente lo spostamento delle immagini da problemi di distorsione comuni e i risultati sono dimostrati nell’immagine seguente.

Pensieri Finali

In questo articolo, abbiamo discusso dei Concept Sliders, un nuovo paradigma semplice ma scalabile che consente un controllo interpretabile sul output generato nei modelli di diffusione. L’uso di Concept Sliders mira a risolvere i problemi affrontati dai framework di diffusione testo-immagine attuali che trovano difficile mantenere il controllo richiesto sui concetti e gli attributi visivi inclusi nell’immagine generata, che spesso porta a output insoddisfacenti. Inoltre, la maggior parte dei modelli di diffusione testo-immagine trova difficile modulare gli attributi continui in un’immagine che spesso porta a output insoddisfacenti. L’uso di Concept Sliders potrebbe consentire ai framework di diffusione testo-immagine di mitigare questi problemi e potenziare i creatori di contenuti e gli utenti finali con un maggiore controllo sul processo di generazione delle immagini e risolvere i problemi affrontati dai framework attuali.

Un ingegnere per professione, uno scrittore per passione. Kunal ÃĻ uno scrittore tecnico con un profondo amore e comprensione di AI e ML, dedicato a semplificare concetti complessi in questi campi attraverso la sua documentazione coinvolgente e informativa.