Modelli e piattaforme di IA

Modifica semantica di immagini ad alta precisione con EditGAN

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Reti Adversarie Generative o GAN hanno trovato nuove applicazioni nell’industria di editing di immagini. Negli ultimi mesi, EditGAN sta guadagnando popolarità nell’industria AI/ML perchÃĐ ÃĻ un metodo innovativo per la modifica semantica di immagini ad alta precisione e qualità.

Parleremo del modello EditGAN nel dettaglio e vi spiegheremo perchÃĐ potrebbe rivelarsi un punto di svolta nell’industria di editing di immagini semantiche.

Iniziamo. Ma prima di scoprire cosa ÃĻ EditGAN, ÃĻ importante capire l’importanza di EditGAN e perchÃĐ rappresenta un passo avanti significativo.

PerchÃĐ EditGAN?

Sebbene le architetture GAN tradizionali abbiano aiutato l’industria di editing di immagini basata su AI a progredire notevolmente, ci sono alcune sfide importanti nella costruzione di un’architettura GAN da zero.

  1. Durante la fase di training, un’architettura GAN richiede una grande quantità di dati etichettati con annotazioni di segmentazione semantica.
  2. Sono in grado di fornire solo un controllo di alto livello.
  3. E spesso, si limitano a interpolare avanti e indietro tra le immagini.

Si puÃē osservare che, sebbene le architetture GAN tradizionali facciano il loro lavoro, non sono efficaci per un’ampia diffusione. L’efficienza scarsa dell’architettura GAN tradizionale ÃĻ il motivo per cui EditGAN ÃĻ stato introdotto da NVIDIA (NVDA ) nel 2022.

EditGAN ÃĻ stato proposto come un metodo efficace per la modifica semantica di immagini ad alta precisione e qualità, con la capacità di consentire agli utenti di modificare le immagini alterando le loro maschere di segmentazione dettagliate. Una delle ragioni per cui EditGAN ÃĻ un metodo scalabile per le attività di editing di immagini ÃĻ a causa della sua architettura.

Il modello EditGAN ÃĻ costruito su un framework GAN che modella immagini e segmentazioni semantiche congiuntamente e richiede solo una manciata di dati di training etichettati o annotati. Gli sviluppatori di EditGAN hanno tentato di incorporare un’immagine nello spazio latente del GAN per modificare efficacemente l’immagine eseguendo un’ottimizzazione del codice latente condizionale in base all’edit della segmentazione. Inoltre, per amortizzare l’ottimizzazione, il modello tenta di trovare “vettori di editing” nello spazio latente che realizzano gli edit.

L’architettura del framework EditGAN consente al modello di apprendere un numero arbitrario di vettori di editing che possono quindi essere applicati direttamente ad altre immagini con alta velocità ed efficienza. Inoltre, i risultati sperimentali indicano che EditGAN puÃē modificare le immagini con un livello di dettaglio mai visto prima, preservando al massimo la qualità dell’immagine.

Per riassumere perchÃĐ abbiamo bisogno di EditGAN, ÃĻ il primo framework di editing di immagini basato su GAN che offre

  1. Un editing ad alta precisione.
  2. PuÃē funzionare con una manciata di dati etichettati.
  3. PuÃē essere distribuito efficacemente in scenari in tempo reale.
  4. Consente la composizionalità per piÃđ edit contemporaneamente.
  5. Funziona su immagini generate da GAN, immagini incorporate in realtà e anche immagini fuori dal dominio.

Modifica semantica di immagini ad alta precisione con EditGAN

StyleGAN2, un framework GAN di stato dell’arte per la sintesi di immagini, ÃĻ il componente principale di generazione di immagini di EditGAN. Il framework StyleGAN2 mappa codici latenti tratti da una distribuzione normale multivariata e li mappa in immagini realistiche.

StyleGAN2 ÃĻ un modello generativo profondo che ÃĻ stato addestrato per sintetizzare immagini della piÃđ alta qualità possibile, oltre ad acquisire una comprensione semantica delle immagini modellate.

Allenamento e inferenza della segmentazione

Il modello EditGAN incorpora un’immagine nello spazio latente del GAN utilizzando l’ottimizzazione e un encoder per eseguire la segmentazione su una nuova immagine e l’allenamento del ramo di segmentazione. Il framework EditGAN continua a costruire su lavori precedenti e addestra un encoder per incorporare le immagini nello spazio latente. L’obiettivo principale qui ÃĻ addestrare l’encoder che consiste in perdite standard L2 e LPIPS utilizzando campioni da GAN e dati di training reali. Inoltre, il modello regolarizza anche l’encoder in modo esplicito utilizzando i codici latenti quando lavora con i campioni GAN.

Di conseguenza, il modello incorpora le immagini annotate del set di dati etichettate con segmentazione semantica nello spazio latente e utilizza la perdita di entropia incrociata per addestrare il ramo di segmentazione del generatore.

Utilizzo della modifica della segmentazione per trovare la semantica nello spazio latente

Lo scopo principale di EditGAN ÃĻ sfruttare la distribuzione congiunta di segmentazioni semantiche e immagini per la modifica di immagini ad alta precisione. Supponiamo di avere un’immagine x che deve essere modificata, quindi il modello incorpora l’immagine nello spazio latente di EditGAN o utilizza i campioni dell’immagine del modello stesso. Il ramo di segmentazione genera y o la segmentazione corrispondente, principalmente perchÃĐ entrambe le immagini RGB e le segmentazioni condividono gli stessi codici latenti w. Gli sviluppatori possono quindi utilizzare strumenti di etichettatura o pittura digitale per modificare la segmentazione e modificarla manualmente in base alle loro esigenze.

Diversi modi di editing durante l’inferenza

I vettori di editing dello spazio latente ottenuti utilizzando l’ottimizzazione possono essere descritti come semanticamente significativi e sono spesso disaccoppiati con diversi attributi. Pertanto, per modificare una nuova immagine, il modello puÃē incorporare direttamente l’immagine nello spazio latente e eseguire le stesse operazioni di editing che il modello ha appreso in precedenza, senza eseguire nuovamente l’ottimizzazione dall’inizio. È sicuro dire che i vettori di editing che il modello apprende amortizzano l’ottimizzazione che era essenziale per modificare l’immagine inizialmente.

È degno di nota che gli sviluppatori non hanno ancora perfezionato la disaccoppiatura e i vettori di editing spesso non restituiscono i migliori risultati quando utilizzati per altre immagini. Tuttavia, il problema puÃē essere superato rimuovendo gli artifact di editing da altre parti dell’immagine eseguendo alcuni passaggi di ottimizzazione aggiuntivi durante il test time.

Sulla base delle nostre attuali conoscenze, il framework EditGAN puÃē essere utilizzato per modificare le immagini in tre diversi modi.

  • Editing in tempo reale con vettori di editing

Per immagini localizzate e disaccoppiate, il modello modifica le immagini applicando vettori di editing appresi in precedenza con diverse scale e manipola le immagini a velocità interattive.

  • Utilizzo del raffinamento auto-supervisionato per editing basato su vettori

Per immagini localizzate che non sono disaccoppiate perfettamente con altre parti dell’immagine, il modello inizia a modificare l’immagine utilizzando vettori di editing appresi in precedenza e rimuove gli artifact di editing eseguendo alcuni passaggi di ottimizzazione aggiuntivi durante il test time.

  • Editing basato sull’ottimizzazione

Per eseguire modifiche su larga scala e specifiche dell’immagine, il modello esegue l’ottimizzazione dall’inizio perchÃĐ i vettori di editing non possono essere utilizzati per eseguire questi tipi di trasferimenti ad altre immagini.

Implementazione

Il framework EditGAN ÃĻ stato valutato su immagini distribuite in quattro diverse categorie: Auto, Uccelli, Gatti e Volti. Il ramo di segmentazione del modello ÃĻ stato addestrato utilizzando immagini-mask pairs di 16, 30, 30, 16 come dati di training etichettati per Auto, Uccelli, Gatti e Volti rispettivamente. Quando l’immagine deve essere modificata solo utilizzando l’ottimizzazione o quando il modello tenta di apprendere i vettori di editing, il modello esegue 100 passaggi di ottimizzazione utilizzando l’ottimizzatore Adam.

Per il set di dati Gatti, Auto e Volti, il modello utilizza immagini reali dal set di test di DatasetGAN che non sono state utilizzate per addestrare il framework GAN per eseguire la funzionalità di editing. Queste immagini vengono incorporate direttamente nello spazio latente di EditGAN utilizzando l’ottimizzazione e la codifica. Per la categoria Uccelli, l’editing viene mostrato su immagini generate da GAN.

Risultati

Risultati qualitativi

Risultati nel dominio

L’immagine sopra dimostra le prestazioni del framework EditGAN quando applica i vettori di editing appresi in precedenza su nuove immagini e raffina le immagini utilizzando 30 passaggi di ottimizzazione. Queste operazioni di editing eseguite dal framework EditGAN sono disaccoppiate per tutte le classi e preservano la qualità generale delle immagini. Confrontando i risultati di EditGAN con altri framework, si puÃē osservare che il framework EditGAN supera altri metodi nell’esecuzione di edit ad alta precisione e complessi, preservando l’identità del soggetto e la qualità dell’immagine allo stesso tempo.

CiÃē che ÃĻ sorprendente ÃĻ che il framework EditGAN puÃē eseguire modifiche ad alta precisione come dilatare le pupille o modificare i raggi delle ruote di un’auto. Inoltre, EditGAN puÃē anche essere utilizzato per modificare le parti semantiche di oggetti che hanno solo pochi pixel o per eseguire modifiche su larga scala di un’immagine. È degno di nota che le diverse operazioni di editing del framework EditGAN sono in grado di generare immagini manipulate diverse da quelle che appaiono nei dati di training GAN.

Risultati fuori dal dominio

Per valutare le prestazioni di EditGAN fuori dal dominio, il framework ÃĻ stato testato sul set di dati MetFaces. Il modello EditGAN utilizza immagini reali di volti nel dominio per creare vettori di editing. Il modello incorpora quindi i ritratti di MetFaces fuori dal dominio utilizzando un processo di ottimizzazione di 100 passaggi e applica i vettori di editing tramite un processo di raffinamento auto-supervisionato di 30 passaggi. I risultati possono essere visti nell’immagine seguente.

Risultati quantitativi

Per misurare le capacità di editing di immagini di EditGAN in modo quantitativo, il modello utilizza un benchmark di editing del sorriso che ÃĻ stato introdotto per la prima volta da MaskGAN. I volti con espressione neutra vengono sostituiti con volti sorridenti e le prestazioni vengono misurate su tre parametri.

  • Correttezza semantica

Il modello utilizza un classificatore di attributi di sorriso pre-addestrato per misurare se i volti nelle immagini mostrano espressioni sorridenti dopo l’editing.

  • Qualità dell’immagine a livello di distribuzione

La distanza di incipienza di Kernel (KID) e la distanza di incipienza di Frechet (FID) vengono calcolate tra il set di test di CelebA e 400 immagini di test modificate.

  • Conservazione dell’identità

La capacità del modello di preservare l’identità dei soggetti quando si modifica l’immagine viene misurata utilizzando una rete di estrazione di caratteristiche ArcFace pre-addestrata.

La tabella sopra confronta le prestazioni del framework EditGAN con altri modelli di base sul benchmark di editing del sorriso. Il metodo seguito dal framework EditGAN per ottenere tali risultati ÃĻ confrontato con tre diverse basi.

  • MaskGAN

MaskGAN prende immagini non sorridenti insieme alle loro maschere di segmentazione e una maschera di segmentazione di sorriso di destinazione come input. È degno di nota che, rispetto a EditGAN, il framework MaskGAN richiede una grande quantità di dati annotati.

  • Editing locale

EditGAN confronta anche le sue prestazioni con l’editing locale, un metodo utilizzato per raggruppare le caratteristiche GAN per implementare l’editing locale e dipende dalle immagini di riferimento.

  • InterFaceGAN

Come EditGAN, InterFaceGAN tenta di trovare vettori di editing nello spazio latente del modello. Tuttavia, a differenza di EditGAN, il modello InterFaceGAN utilizza una grande quantità di dati annotati, classificatori di attributi ausiliari e non ha la precisione di editing fine.

  • StyleGAN2Distillation

Questo metodo crea un approccio alternativo che non richiede necessariamente l’incorporazione di immagini reali e utilizza invece un modello di vettori di editing per creare un set di dati di training.

Limitazioni

PoichÃĐ EditGAN si basa sul framework GAN, ha la stessa limitazione di qualsiasi altro modello GAN: puÃē funzionare solo con immagini che possono essere modellate dal GAN. La limitazione di EditGAN di funzionare con immagini modellate da GAN ÃĻ il principale motivo per cui ÃĻ difficile implementare EditGAN in diversi scenari. Tuttavia, ÃĻ degno di nota che le modifiche ad alta precisione di EditGAN possono essere trasferite facilmente ad altre immagini diverse utilizzando i vettori di editing.

Conclusione

Una delle principali ragioni per cui GAN non ÃĻ uno standard industriale nel campo dell’editing di immagini ÃĻ a causa della sua limitata praticità. I framework GAN di solito richiedono una grande quantità di dati di training annotati e non restituiscono spesso un’alta efficienza e accuratezza.

EditGAN tenta di affrontare le sfide presentate dai framework GAN convenzionali e tenta di essere un metodo efficace per la modifica semantica di immagini ad alta qualità e precisione. I risultati finora hanno indicato che EditGAN offre effettivamente ciÃē che afferma e sta già funzionando meglio di alcune delle attuali pratiche e modelli standard dell’industria.

Un ingegnere per professione, uno scrittore per passione. Kunal ÃĻ uno scrittore tecnico con un profondo amore e comprensione di AI e ML, dedicato a semplificare concetti complessi in questi campi attraverso la sua documentazione coinvolgente e informativa.