Modelli e piattaforme di IA
Modifica semantica di immagini ad alta precisione con EditGAN
Reti Adversarie Generative o GAN hanno trovato nuove applicazioni nellâindustria di editing di immagini. Negli ultimi mesi, EditGAN sta guadagnando popolarità nellâindustria AI/ML perchÃĐ ÃĻ un metodo innovativo per la modifica semantica di immagini ad alta precisione e qualità .
Parleremo del modello EditGAN nel dettaglio e vi spiegheremo perchÃĐ potrebbe rivelarsi un punto di svolta nellâindustria di editing di immagini semantiche.
Iniziamo. Ma prima di scoprire cosa ÃĻ EditGAN, ÃĻ importante capire lâimportanza di EditGAN e perchÃĐ rappresenta un passo avanti significativo.
PerchÃĐ EditGAN?
Sebbene le architetture GAN tradizionali abbiano aiutato lâindustria di editing di immagini basata su AI a progredire notevolmente, ci sono alcune sfide importanti nella costruzione di unâarchitettura GAN da zero.
- Durante la fase di training, unâarchitettura GAN richiede una grande quantità di dati etichettati con annotazioni di segmentazione semantica.
- Sono in grado di fornire solo un controllo di alto livello.
- E spesso, si limitano a interpolare avanti e indietro tra le immagini.
Si puÃē osservare che, sebbene le architetture GAN tradizionali facciano il loro lavoro, non sono efficaci per unâampia diffusione. Lâefficienza scarsa dellâarchitettura GAN tradizionale ÃĻ il motivo per cui EditGAN ÃĻ stato introdotto da NVIDIA (NVDA ) nel 2022.
EditGAN ÃĻ stato proposto come un metodo efficace per la modifica semantica di immagini ad alta precisione e qualità , con la capacità di consentire agli utenti di modificare le immagini alterando le loro maschere di segmentazione dettagliate. Una delle ragioni per cui EditGAN ÃĻ un metodo scalabile per le attività di editing di immagini ÃĻ a causa della sua architettura.
Il modello EditGAN ÃĻ costruito su un framework GAN che modella immagini e segmentazioni semantiche congiuntamente e richiede solo una manciata di dati di training etichettati o annotati. Gli sviluppatori di EditGAN hanno tentato di incorporare unâimmagine nello spazio latente del GAN per modificare efficacemente lâimmagine eseguendo unâottimizzazione del codice latente condizionale in base allâedit della segmentazione. Inoltre, per amortizzare lâottimizzazione, il modello tenta di trovare âvettori di editingâ nello spazio latente che realizzano gli edit.
Lâarchitettura del framework EditGAN consente al modello di apprendere un numero arbitrario di vettori di editing che possono quindi essere applicati direttamente ad altre immagini con alta velocità ed efficienza. Inoltre, i risultati sperimentali indicano che EditGAN puÃē modificare le immagini con un livello di dettaglio mai visto prima, preservando al massimo la qualità dellâimmagine.
Per riassumere perchÃĐ abbiamo bisogno di EditGAN, ÃĻ il primo framework di editing di immagini basato su GAN che offre
- Un editing ad alta precisione.
- PuÃē funzionare con una manciata di dati etichettati.
- PuÃē essere distribuito efficacemente in scenari in tempo reale.
- Consente la composizionalità per piÃđ edit contemporaneamente.
- Funziona su immagini generate da GAN, immagini incorporate in realtà e anche immagini fuori dal dominio.
Modifica semantica di immagini ad alta precisione con EditGAN
StyleGAN2, un framework GAN di stato dellâarte per la sintesi di immagini, ÃĻ il componente principale di generazione di immagini di EditGAN. Il framework StyleGAN2 mappa codici latenti tratti da una distribuzione normale multivariata e li mappa in immagini realistiche.
StyleGAN2 ÃĻ un modello generativo profondo che ÃĻ stato addestrato per sintetizzare immagini della piÃđ alta qualità possibile, oltre ad acquisire una comprensione semantica delle immagini modellate.
Allenamento e inferenza della segmentazione
Il modello EditGAN incorpora unâimmagine nello spazio latente del GAN utilizzando lâottimizzazione e un encoder per eseguire la segmentazione su una nuova immagine e lâallenamento del ramo di segmentazione. Il framework EditGAN continua a costruire su lavori precedenti e addestra un encoder per incorporare le immagini nello spazio latente. Lâobiettivo principale qui ÃĻ addestrare lâencoder che consiste in perdite standard L2 e LPIPS utilizzando campioni da GAN e dati di training reali. Inoltre, il modello regolarizza anche lâencoder in modo esplicito utilizzando i codici latenti quando lavora con i campioni GAN.
Di conseguenza, il modello incorpora le immagini annotate del set di dati etichettate con segmentazione semantica nello spazio latente e utilizza la perdita di entropia incrociata per addestrare il ramo di segmentazione del generatore.
Utilizzo della modifica della segmentazione per trovare la semantica nello spazio latente
Lo scopo principale di EditGAN ÃĻ sfruttare la distribuzione congiunta di segmentazioni semantiche e immagini per la modifica di immagini ad alta precisione. Supponiamo di avere unâimmagine x che deve essere modificata, quindi il modello incorpora lâimmagine nello spazio latente di EditGAN o utilizza i campioni dellâimmagine del modello stesso. Il ramo di segmentazione genera y o la segmentazione corrispondente, principalmente perchÃĐ entrambe le immagini RGB e le segmentazioni condividono gli stessi codici latenti w. Gli sviluppatori possono quindi utilizzare strumenti di etichettatura o pittura digitale per modificare la segmentazione e modificarla manualmente in base alle loro esigenze.

Diversi modi di editing durante lâinferenza
I vettori di editing dello spazio latente ottenuti utilizzando lâottimizzazione possono essere descritti come semanticamente significativi e sono spesso disaccoppiati con diversi attributi. Pertanto, per modificare una nuova immagine, il modello puÃē incorporare direttamente lâimmagine nello spazio latente e eseguire le stesse operazioni di editing che il modello ha appreso in precedenza, senza eseguire nuovamente lâottimizzazione dallâinizio. Ã sicuro dire che i vettori di editing che il modello apprende amortizzano lâottimizzazione che era essenziale per modificare lâimmagine inizialmente.
à degno di nota che gli sviluppatori non hanno ancora perfezionato la disaccoppiatura e i vettori di editing spesso non restituiscono i migliori risultati quando utilizzati per altre immagini. Tuttavia, il problema puÃē essere superato rimuovendo gli artifact di editing da altre parti dellâimmagine eseguendo alcuni passaggi di ottimizzazione aggiuntivi durante il test time.
Sulla base delle nostre attuali conoscenze, il framework EditGAN puÃē essere utilizzato per modificare le immagini in tre diversi modi.
- Editing in tempo reale con vettori di editing
Per immagini localizzate e disaccoppiate, il modello modifica le immagini applicando vettori di editing appresi in precedenza con diverse scale e manipola le immagini a velocità interattive.
- Utilizzo del raffinamento auto-supervisionato per editing basato su vettori
Per immagini localizzate che non sono disaccoppiate perfettamente con altre parti dellâimmagine, il modello inizia a modificare lâimmagine utilizzando vettori di editing appresi in precedenza e rimuove gli artifact di editing eseguendo alcuni passaggi di ottimizzazione aggiuntivi durante il test time.
- Editing basato sullâottimizzazione
Per eseguire modifiche su larga scala e specifiche dellâimmagine, il modello esegue lâottimizzazione dallâinizio perchÃĐ i vettori di editing non possono essere utilizzati per eseguire questi tipi di trasferimenti ad altre immagini.
Implementazione
Il framework EditGAN ÃĻ stato valutato su immagini distribuite in quattro diverse categorie: Auto, Uccelli, Gatti e Volti. Il ramo di segmentazione del modello ÃĻ stato addestrato utilizzando immagini-mask pairs di 16, 30, 30, 16 come dati di training etichettati per Auto, Uccelli, Gatti e Volti rispettivamente. Quando lâimmagine deve essere modificata solo utilizzando lâottimizzazione o quando il modello tenta di apprendere i vettori di editing, il modello esegue 100 passaggi di ottimizzazione utilizzando lâottimizzatore Adam.
Per il set di dati Gatti, Auto e Volti, il modello utilizza immagini reali dal set di test di DatasetGAN che non sono state utilizzate per addestrare il framework GAN per eseguire la funzionalità di editing. Queste immagini vengono incorporate direttamente nello spazio latente di EditGAN utilizzando lâottimizzazione e la codifica. Per la categoria Uccelli, lâediting viene mostrato su immagini generate da GAN.
Risultati
Risultati qualitativi
Risultati nel dominio

Lâimmagine sopra dimostra le prestazioni del framework EditGAN quando applica i vettori di editing appresi in precedenza su nuove immagini e raffina le immagini utilizzando 30 passaggi di ottimizzazione. Queste operazioni di editing eseguite dal framework EditGAN sono disaccoppiate per tutte le classi e preservano la qualità generale delle immagini. Confrontando i risultati di EditGAN con altri framework, si puÃē osservare che il framework EditGAN supera altri metodi nellâesecuzione di edit ad alta precisione e complessi, preservando lâidentità del soggetto e la qualità dellâimmagine allo stesso tempo.
CiÃē che ÃĻ sorprendente ÃĻ che il framework EditGAN puÃē eseguire modifiche ad alta precisione come dilatare le pupille o modificare i raggi delle ruote di unâauto. Inoltre, EditGAN puÃē anche essere utilizzato per modificare le parti semantiche di oggetti che hanno solo pochi pixel o per eseguire modifiche su larga scala di unâimmagine. Ã degno di nota che le diverse operazioni di editing del framework EditGAN sono in grado di generare immagini manipulate diverse da quelle che appaiono nei dati di training GAN.
Risultati fuori dal dominio
Per valutare le prestazioni di EditGAN fuori dal dominio, il framework ÃĻ stato testato sul set di dati MetFaces. Il modello EditGAN utilizza immagini reali di volti nel dominio per creare vettori di editing. Il modello incorpora quindi i ritratti di MetFaces fuori dal dominio utilizzando un processo di ottimizzazione di 100 passaggi e applica i vettori di editing tramite un processo di raffinamento auto-supervisionato di 30 passaggi. I risultati possono essere visti nellâimmagine seguente.

Risultati quantitativi
Per misurare le capacità di editing di immagini di EditGAN in modo quantitativo, il modello utilizza un benchmark di editing del sorriso che ÃĻ stato introdotto per la prima volta da MaskGAN. I volti con espressione neutra vengono sostituiti con volti sorridenti e le prestazioni vengono misurate su tre parametri.
- Correttezza semantica
Il modello utilizza un classificatore di attributi di sorriso pre-addestrato per misurare se i volti nelle immagini mostrano espressioni sorridenti dopo lâediting.
- Qualità dellâimmagine a livello di distribuzione
La distanza di incipienza di Kernel (KID) e la distanza di incipienza di Frechet (FID) vengono calcolate tra il set di test di CelebA e 400 immagini di test modificate.
- Conservazione dellâidentitÃ
La capacità del modello di preservare lâidentità dei soggetti quando si modifica lâimmagine viene misurata utilizzando una rete di estrazione di caratteristiche ArcFace pre-addestrata.

La tabella sopra confronta le prestazioni del framework EditGAN con altri modelli di base sul benchmark di editing del sorriso. Il metodo seguito dal framework EditGAN per ottenere tali risultati ÃĻ confrontato con tre diverse basi.
- MaskGAN
MaskGAN prende immagini non sorridenti insieme alle loro maschere di segmentazione e una maschera di segmentazione di sorriso di destinazione come input. à degno di nota che, rispetto a EditGAN, il framework MaskGAN richiede una grande quantità di dati annotati.
- Editing locale
EditGAN confronta anche le sue prestazioni con lâediting locale, un metodo utilizzato per raggruppare le caratteristiche GAN per implementare lâediting locale e dipende dalle immagini di riferimento.
- InterFaceGAN
Come EditGAN, InterFaceGAN tenta di trovare vettori di editing nello spazio latente del modello. Tuttavia, a differenza di EditGAN, il modello InterFaceGAN utilizza una grande quantità di dati annotati, classificatori di attributi ausiliari e non ha la precisione di editing fine.
- StyleGAN2Distillation
Questo metodo crea un approccio alternativo che non richiede necessariamente lâincorporazione di immagini reali e utilizza invece un modello di vettori di editing per creare un set di dati di training.

Limitazioni
PoichÃĐ EditGAN si basa sul framework GAN, ha la stessa limitazione di qualsiasi altro modello GAN: puÃē funzionare solo con immagini che possono essere modellate dal GAN. La limitazione di EditGAN di funzionare con immagini modellate da GAN ÃĻ il principale motivo per cui ÃĻ difficile implementare EditGAN in diversi scenari. Tuttavia, ÃĻ degno di nota che le modifiche ad alta precisione di EditGAN possono essere trasferite facilmente ad altre immagini diverse utilizzando i vettori di editing.
Conclusione
Una delle principali ragioni per cui GAN non ÃĻ uno standard industriale nel campo dellâediting di immagini ÃĻ a causa della sua limitata praticità . I framework GAN di solito richiedono una grande quantità di dati di training annotati e non restituiscono spesso unâalta efficienza e accuratezza.
EditGAN tenta di affrontare le sfide presentate dai framework GAN convenzionali e tenta di essere un metodo efficace per la modifica semantica di immagini ad alta qualità e precisione. I risultati finora hanno indicato che EditGAN offre effettivamente ciÃē che afferma e sta già funzionando meglio di alcune delle attuali pratiche e modelli standard dellâindustria.












