Angolo di Anderson

GAN come renderizzatore di volti per la CGI “tradizionale”

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Opinione Quando le Reti Adversarie Generative (GAN) hanno dimostrato per la prima volta la loro capacità di riprodurre volti 3D realistici in modo sorprendente, l’avvento ha scatenato una corsa all’oro per il potenziale inesplorato delle GAN nella creazione di video temporali coerenti con volti umani.

In qualche parte dello spazio latente della GAN, sembrava che ci dovesse essere un ordine nascosto e una logica semantica – uno schema di logica semantica nascente, sepolto nei codici latenti, che avrebbe permesso a una GAN di generare piÃđ viste coerenti e piÃđ interpretazioni (come cambiamenti di espressione) dello stesso volto – e successivamente offrire un metodo di video deepfake temporale convincente che avrebbe superato gli autoencoder.

La produzione di output ad alta risoluzione sarebbe stata banale, rispetto agli ambienti a bassa risoluzione in cui le limitazioni della GPU costringono DeepFaceLab e FaceSwap a operare, mentre la “zona di scambio” di un volto (nei flussi di lavoro degli autoencoder) sarebbe diventata la “zona di creazione” di una GAN, informata da un pugno di immagini di input, o anche solo da una singola immagine.

Non ci sarebbe piÃđ stato un mismatch tra il “scambio” e il “host” dei volti, perchÃĐ l’intera immagine sarebbe stata generata da scratch, compresi capelli, lineamenti del viso e le estremità piÃđ esterne dei tratti del viso, che spesso si rivelano una sfida per i deepfake “tradizionali” degli autoencoder.

L’inverno del video facciale GAN

Come si ÃĻ poi scoperto, non sarebbe stato cosÃŽ facile. Alla fine, la disentanglement si ÃĻ rivelata la questione centrale e rimane la sfida principale. Come si puÃē mantenere un’identità facciale distinta e cambiare la sua posa o espressione senza raccogliere un corpus di migliaia di immagini di riferimento che insegnino a una rete neurale cosa succede quando queste modifiche sono apportate, nel modo in cui i sistemi degli autoencoder fanno cosÃŽ laboriosamente?

In seguito, il pensiero successivo nella ricerca sulla sintesi e sull’attuazione facciale GAN ÃĻ stato che un’identità di input potrebbe forse essere resa soggetta a trasformazioni teleologiche, generiche, template che non sono specifiche dell’identità. Un esempio di ciÃē sarebbe applicare un’espressione a un volto GAN che non era presente in nessuna delle immagini di quella persona che la GAN conosce.

Dal paper del 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, espressioni template vengono applicate a un volto di input dal set di dati FFHQ. Fonte: https://arxiv.org/pdf/2205.06102.pdf

Dal paper del 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, espressioni template vengono applicate a un volto di input dal set di dati FFHQ. Fonte: https://arxiv.org/pdf/2205.06102.pdf

È ovvio che un approccio “una taglia per tutti” non puÃē coprire la diversità delle espressioni facciali uniche di un individuo. Dobbiamo chiederci se un sorriso unico come quello di Jack Nicholson o Willem Dafoe potrebbe mai ricevere un’interpretazione fedele sotto l’influenza di tali codici latenti “media”.

Chi ÃĻ questo affascinante straniero latino? Sebbene il metodo GAN produca un volto piÃđ realistico e ad alta risoluzione, la trasformazione non ÃĻ informata da molte immagini reali dell'attore, come nel caso di DeepFaceLab, che si allena estensivamente e spesso a spese di un database di migliaia di tali immagini. Qui (sullo sfondo) un modello DeepFaceLab viene importato in DeepFaceLive, un'implementazione di streaming del software popolare e controverso. Esempi sono da https://www.youtube.com/watch?v=9tr35y-yQRY (2022) e https://arxiv.org/pdf/2205.06102.pdf.

Chi ÃĻ questo affascinante straniero latino? Sebbene il metodo GAN produca un volto piÃđ realistico e ad alta risoluzione, la trasformazione non ÃĻ informata da molte immagini reali dell’attore, come nel caso di DeepFaceLab, che si allena estensivamente su un database di migliaia di tali immagini, e di conseguenza la somiglianza ÃĻ compromessa. Esempi sono da https://www.youtube.com/watch?v=9tr35y-yQRY (2022) e https://arxiv.org/pdf/2205.06102.pdf.

Un certo numero di editor di espressioni facciali GAN sono stati proposti negli ultimi anni, la maggior parte dei quali tratta identità sconosciute, dove la fedeltà delle trasformazioni ÃĻ impossibile per il lettore casuale da conoscere, poichÃĐ queste non sono facce familiari.

Identità oscure trasformate nell'offerta del 2020 Cascade-EF-GAN. Fonte: https://arxiv.org/pdf/2003.05905.pdf

Identità oscure trasformate nell’offerta del 2020 Cascade-EF-GAN. Fonte: https://arxiv.org/pdf/2003.05905.pdf

Forse l’editor di volti GAN che ha ricevuto il maggior interesse (e citazioni) negli ultimi tre anni ÃĻ InterFaceGAN, che puÃē eseguire traversate nello spazio latente in codici latenti relativi alla posa (angolo della telecamera/volto), espressione, età, razza, genere e altre qualità essenziali.

Le capacità di “morphing” degli anni ’80 di InterFaceGAN e framework simili sono principalmente un modo per illustrare il percorso verso la trasformazione come un’immagine viene riproiettata nuovamente attraverso un codice latente appropriato (come “età”). In termini di produzione di filmati video con continuità temporale, tali schemi fino ad oggi sono qualificati come “disastri impressionanti”.

Se si aggiunge a ciÃē la difficoltà di creare capelli coerenti temporalmente, e il fatto che la tecnica di esplorazione/manipolazione del codice latente non ha linee guida temporali innate per lavorare (e ÃĻ difficile sapere come iniettare tali linee guida in un framework progettato per generare immagini fisse e che non ha una provvisione nativa per l’output video), potrebbe essere logico concludere che GAN non ÃĻ tutto ciÃē che serve per la sintesi video facciale.

Pertanto, gli sforzi successivi hanno prodotto miglioramenti incrementali nella disentanglement, mentre altri hanno aggiunto altre convenzioni nel computer vision come uno “strato di guida”, come l’uso della segmentazione semantica come meccanismo di controllo nel paper del tardo 2021 paper SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing.

La segmentazione semantica come metodo di strumentalità dello spazio latente in SemanticStyleGAN. Fonte: https://semanticstylegan.github.io/

La segmentazione semantica come metodo di strumentalità dello spazio latente in SemanticStyleGAN. Fonte: https://semanticstylegan.github.io/

Guida parametrica

La comunità di ricerca sulla sintesi facciale GAN si sta dirigendo sempre piÃđ verso l’uso di volti CGI parametrici “tradizionali” come metodo per guidare e portare ordine ai codici latenti impressionanti ma indisciplinati in uno spazio latente GAN.

Sebbene i primitivi facciali parametrici siano stati un pilastro della ricerca nel computer vision per oltre vent’anni, l’interesse per questo approccio ÃĻ cresciuto di recente, con l’aumento dell’uso di primitivi CGI Skinned Multi-Person Linear Model (SMPL) e con l’Sparse Trained Articulated Human Body Regressor (STAR) framework.

SMPL (in questo caso una variante chiamata SMPL-X) puÃē imporre una mesh parametrica CGI che si accorda con la stima della posa (inclusi gli espressioni, se necessario) dell'intero corpo umano rappresentato in un'immagine, consentendo nuove operazioni da eseguire sull'immagine utilizzando la mesh parametrica come guida volumetrica o percettiva. Fonte: https://arxiv.org/pdf/1904.05866.pdf

SMPL (in questo caso una variante chiamata SMPL-X) puÃē imporre una mesh parametrica CGI che si accorda con la stima della posa (inclusi gli espressioni, se necessario) dell’intero corpo umano rappresentato in un’immagine, consentendo nuove operazioni da eseguire sull’immagine utilizzando la mesh parametrica come guida volumetrica o percettiva. Fonte: https://arxiv.org/pdf/1904.05866.pdf

Lo sviluppo piÃđ acclamato in questa linea ÃĻ stata l’iniziativa “Rendering with Style” di Disney del 2019, che ha fuso l’uso di mappe di texture tradizionali con immagini generate da GAN, nel tentativo di creare un output animato migliorato e “stile deepfake”.

Vecchio e nuovo, nell'approccio ibrido di Disney per i deepfake generati da GAN. Fonte: https://www.youtube.com/watch?v=TwpLqTmvqVk

Vecchio e nuovo, nell’approccio ibrido di Disney per i deepfake generati da GAN. Fonte: https://www.youtube.com/watch?v=TwpLqTmvqVk

L’approccio di Disney impone facce CGI tradizionali in una rete StyleGAN2 per “inpaint” soggetti umani in “aree problematiche”, dove la coerenza temporale ÃĻ un problema per la generazione di video – aree come la texture della pelle.

Il flusso di lavoro di Rendering with Style.

Il flusso di lavoro di Rendering with Style.

PoichÃĐ la testa CGI parametrica che guida questo processo puÃē essere regolata e modificata per adattarsi all’utente, il volto generato da GAN puÃē riflettere quei cambiamenti, inclusi cambi di posa e espressione del viso.

Sebbene progettato per unire la strumentalità della CGI con il realismo naturale dei volti GAN, alla fine, i risultati dimostrano il peggio di entrambi i mondi e non riescono ancora a mantenere la texture dei capelli e nemmeno la posizione delle caratteristiche di base coerenti:

Un nuovo tipo di valley of the uncanny emerge da Rendering with Style, sebbene il principio conservi ancora un certo potenziale.

Un nuovo tipo di valley of the uncanny emerge da Rendering with Style, sebbene il principio conservi ancora un certo potenziale.

Il paper del 2020 paper StyleRig: Rigging StyleGAN for 3D Control over Portrait Images adotta un approccio sempre piÃđ popolare, con l’uso di modelli di volto 3D morphable (3DMM) come proxy per alterare le caratteristiche in un ambiente StyleGAN, in questo caso attraverso una rete di rigging chiamata RigNet:

I 3DMM fungono da proxy per le interpretazioni dello spazio latente in StyleRig. Fonte: https://arxiv.org/pdf/2004.00121.pdf

I 3DMM fungono da proxy per le interpretazioni dello spazio latente in StyleRig. Fonte: https://arxiv.org/pdf/2004.00121.pdf

Tuttavia, come al solito con queste iniziative, i risultati fino ad oggi sembrano limitati a manipolazioni di posa minime e cambi di espressione/”affetto” “non informati”.

StyleRig migliora il livello di controllo, sebbene i capelli coerenti temporalmente rimangano una sfida irrisolta. Fonte: https://www.youtube.com/watch?v=eaW_P85wQ9k

StyleRig migliora il livello di controllo, sebbene i capelli coerenti temporalmente rimangano una sfida irrisolta. Fonte: https://www.youtube.com/watch?v=eaW_P85wQ9k

Un output simile puÃē essere trovato nel MOST-GAN di Mitsubishi Research, un paper del 2021 che utilizza 3DMM non lineari come architettura di disentanglement, ma che lotta per raggiungere un movimento dinamico e coerente.

L’ultima ricerca che tenta di strumentalità e disentanglement ÃĻ One-Shot Face Reenactment on Megapixels, che utilizza nuovamente teste parametriche 3DMM come interfaccia utente per StyleGAN.

Nel flusso di lavoro MegaFR di One-Shot Face Reenactment, la rete esegue la sintesi facciale combinando un'immagine del mondo reale invertita con parametri presi da un modello 3DMM renderizzato. Fonte: https://arxiv.org/pdf/2205.13368.pdf

Nel flusso di lavoro MegaFR di One-Shot Face Reenactment, la rete esegue la sintesi facciale combinando un’immagine del mondo reale invertita con parametri presi da un modello 3DMM renderizzato. Fonte: https://arxiv.org/pdf/2205.13368.pdf

OSFR appartiene a una classe crescente di editor di volti GAN che cercano di sviluppare flussi di lavoro di editing lineari nello stile di Photoshop/After Effects, dove l’utente puÃē immettere un’immagine desiderata su cui possono essere applicate trasformazioni, piuttosto che cercare attraverso lo spazio latente per codici latenti relativi a un’identità.

Ancora una volta, le espressioni parametriche rappresentano un metodo sovrastante e non personalizzato per iniettare espressioni, portando a manipolazioni che sembrano “uncanny” nel loro modo, non sempre positivo.

Espressioni iniettate in OSFR.

Espressioni iniettate in OSFR.

Come lavori precedenti, OSFR puÃē inferire pose originali da un’unica immagine e puÃē anche eseguire “frontalizzazione”, dove un’immagine con posa decentrata viene tradotta in un’immagine di primo piano:

Immagini originali (in alto) e immagini di primo piano inferite da una delle implementazioni di OSFR descritte nel nuovo paper.

Immagini originali (in alto) e immagini di primo piano inferite da una delle implementazioni di OSFR descritte nel nuovo paper.

In pratica, questo tipo di inferenza ÃĻ simile a alcuni dei principi di fotogrammetria che sottostanno ai Campi di Radiance Neurale (NeRF), tranne che la geometria qui deve essere definita da una sola foto, piuttosto che dalle 3-4 prospettive che consentono a NeRF di interpretare le pose intermedie mancanti e creare scene neurali 3D esplorabili con esseri umani.

(Tuttavia, NeRF non ÃĻ tutto ciÃē di cui si ha bisogno, poichÃĐ presenta un insieme quasi diverso di ostacoli per le GAN in termini di produzione di sintesi video facciale)

GAN ha un posto nella sintesi video facciale?

Raggiungere espressioni dinamiche e pose fuori dalla distribuzione da un’unica immagine di origine sembra essere un’ossessione alchemica nella ricerca sulla sintesi facciale GAN attualmente, principalmente perchÃĐ le GAN sono l’unico metodo attualmente in grado di produrre volti neurali ad alta risoluzione e fedeltà relativamente alta: sebbene i framework deepfake degli autoencoder possano allenarsi su molte pose e espressioni reali, devono operare a risoluzioni di input/output limitate dalla VRAM e richiedono un “host”; mentre NeRF ÃĻ altrettanto limitato e, a differenza degli altri due approcci, non ha attualmente metodologie stabilite per cambiare espressioni facciali e soffre di limitata editabilità in generale.

Sembra che l’unico modo in avanti per un sistema di sintesi CGI/GAN facciale accurato sia che una nuova iniziativa trovi un modo per assemblare un’entità di identità multi-foto all’interno dello spazio latente, dove un codice latente per un’identità non debba viaggiare attraverso l’intero spazio latente per sfruttare parametri di posa non correlati, ma possa fare riferimento alle proprie immagini del mondo reale come riferimenti per le trasformazioni.

Anche in tale caso, o anche se un’intera rete StyleGAN fosse allenata su un set di volti di un’unica identità (simile ai set di allenamento che gli autoencoder utilizzano), la logica semantica mancante dovrebbe ancora probabilmente essere fornita da tecnologie ausiliarie come la segmentazione semantica o i volti 3DMM parametrici, che, in tale scenario, avrebbero almeno piÃđ materiale con cui lavorare.

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]