Ãngulo de Anderson
GAN como Renderizador de Rostos para CGI “Tradicional”

OpiniÃĢo Quando as Redes AdversÃĄrias Generativas (GANs) demonstraram pela primeira vez sua capacidade de reproduzir rostos 3D realistas de forma impressionante, o advento desencadeou uma corrida ao ouro para o potencial inexplorado das GANs para criar vÃdeos temporais consistentes com rostos humanos.
Em algum lugar no espaço latente da GAN, parecia que havia uma ordem e racionalidade ocultas â um esquema de lÃģgica semÃĒntica nascente, enterrado nos cÃģdigos latentes, que permitiria que uma GAN gerasse vistas e interpretaçÃĩes consistentes (como mudanças de expressÃĢo) do mesmo rosto â e, subsequentemente, oferecesse um mÃĐtodo de vÃdeo deepfake temporalmente convincente que superaria os autoencoders.
A saÃda de alta resoluçÃĢo seria trivial, em comparaçÃĢo com os ambientes de baixa resoluçÃĢo nos quais as restriçÃĩes de GPU forçam o DeepFaceLab e o FaceSwap a operar, enquanto a âzona de trocaâ de um rosto (nos fluxos de trabalho de autoencoders) se tornaria a âzona de criaçÃĢoâ de uma GAN, informada por uma handful de imagens de entrada, ou mesmo apenas uma imagem.
NÃĢo haveria mais disparidade entre os rostos âtrocaâ e âhospedeiroâ, porque a totalidade da imagem seria gerada do zero, incluindo cabelo, linhas da mandÃbula e as extremidades mais externas das linhas faciais, que frequentemente provam ser um desafio para os deepfakes âtradicionaisâ de autoencoders.
O Inverno de VÃdeo Facial GAN
Como se revelou, nÃĢo seria tÃĢo fÃĄcil. Em Última anÃĄlise, a desentanglement provou ser a questÃĢo central e continua sendo o principal desafio. Como manter uma identidade facial distinta e mudar sua pose ou expressÃĢo sem reunir um corpus de milhares de imagens de referÊncia que ensinem uma rede neural o que acontece quando essas mudanças sÃĢo realizadas, da mesma forma que os sistemas de autoencoders fazem laboriosamente?
Em vez disso, o pensamento subsequente na pesquisa de sÃntese e atuaçÃĢo facial GAN foi que uma identidade de entrada poderia talvez ser submetida a transformaçÃĩes genÃĐricas, modeladas e nÃĢo especÃficas de identidade. Um exemplo disso seria aplicar uma expressÃĢo a um rosto GAN que nÃĢo estava presente em nenhuma das imagens daquela pessoa que a GAN conhece.

A partir do artigo de 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, expressÃĩes modeladas sÃĢo aplicadas a um rosto de entrada do conjunto de dados FFHQ. Fonte: https://arxiv.org/pdf/2205.06102.pdf
à Ãģbvio que uma abordagem âtamanho Únicoâ nÃĢo pode cobrir a diversidade de expressÃĩes faciais Únicas de um indivÃduo. Devemos nos perguntar se um sorriso tÃĢo Único quanto o de Jack Nicholson ou Willem Dafoe poderia receber uma interpretaçÃĢo fiel sob a influÊncia de tais cÃģdigos latentes de âmÃĐdia expressÃĢoâ.

Quem ÃĐ este charmoso estranho latino? Embora o mÃĐtodo GAN produza um rosto mais realista e de alta resoluçÃĢo, a transformaçÃĢo nÃĢo ÃĐ informada por mÚltiplas imagens do mundo real do ator, como ÃĐ o caso do DeepFaceLab, que treina extensivamente em um banco de dados de milhares de tais imagens, e consequentemente a semelhança ÃĐ comprometida. Aqui (fundo) um modelo DeepFaceLab ÃĐ importado para o DeepFaceLive, uma implementaçÃĢo de streaming do software popular e controverso. Exemplos sÃĢo de https://www.youtube.com/watch?v=9tr35y-yQRY (2022) e https://arxiv.org/pdf/2205.06102.pdf.
Um nÚmero de editores de expressÃĢo facial GAN foram propostos nos Últimos anos, a maioria deles lidando com identidades desconhecidas, onde a fidelidade das transformaçÃĩes ÃĐ impossÃvel para o leitor casual saber, pois esses nÃĢo sÃĢo rostos familiares.

Identidades obscuras transformadas na oferta de 2020 Cascade-EF-GAN. Fonte: https://arxiv.org/pdf/2003.05905.pdf
Talvez o editor de rosto GAN que tenha recebido o maior interesse (e citaçÃĩes) nos Últimos trÊs anos seja InterFaceGAN, que pode realizar travessias no espaço latente em cÃģdigos latentes relacionados à pose (ÃĒngulo da cÃĒmera/rosto), expressÃĢo, idade, raça, gÊnero e outras qualidades essenciais.
As capacidades de âmorphingâ do estilo dos anos 80 do InterFaceGAN e frameworks semelhantes sÃĢo principalmente uma forma de ilustrar o caminho em direçÃĢo à transformaçÃĢo enquanto uma imagem ÃĐ reprojeta de volta por meio de um cÃģdigo latente apropriado (como âidadeâ). Em termos de produzir filmagens de vÃdeo com continuidade temporal, esses esquemas atÃĐ o momento se qualificam como âdesastres impressionantesâ.
Se vocÊ acrescentar a isso a dificuldade de criar cabelo temporariamente consistente, e o fato de que a tÃĐcnica de exploraçÃĢo/manipulaçÃĢo de cÃģdigos latentes nÃĢo tem diretrizes temporais inatas para trabalhar (e ÃĐ difÃcil saber como injetar essas diretrizes em um framework projetado para acomodar e gerar imagens estÃĄticas, e que nÃĢo tem provisÃĢo nativa para saÃda de vÃdeo), pode ser lÃģgico concluir que GAN nÃĢo ÃĐ Tudo o que VocÊ Precisa âĒ para sÃntese de vÃdeo facial.
Portanto, esforços subsequentes renderam melhorias incrementais na desentanglement, enquanto outros acoplaram outras convençÃĩes em visÃĢo computacional como uma âcamada de orientaçÃĢoâ, como o uso de segmentaçÃĢo semÃĒntica como um mecanismo de controle no artigo de 2021 paper SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing.

SegmentaçÃĢo semÃĒntica como um mÃĐtodo de instrumentalidade no espaço latente em SemanticStyleGAN. Fonte: https://semanticstylegan.github.io/
OrientaçÃĢo ParamÃĐtrica
A comunidade de pesquisa de sÃntese facial GAN estÃĄ se dirigindo cada vez mais para o uso de âCGI tradicionalâ paramÃĐtrico como um mÃĐtodo para guiar e trazer ordem para os cÃģdigos latentes impressionantes, mas indisciplinados, no espaço latente de uma GAN.
Embora os primitivos faciais paramÃĐtricos tenham sido uma caracterÃstica da pesquisa de visÃĢo computacional por mais de vinte anos, o interesse nessa abordagem cresceu recentemente, com o uso crescente do Skinned Multi-Person Linear Model (SMPL) primitivos CGI, uma abordagem pioneira pelo Instituto Max Planck e ILM, e desde entÃĢo aprimorada com o Sparse Trained Articulated Human Body Regressor (STAR) framework.

SMPL (neste caso, uma variante chamada SMPL-X) pode impor uma malha paramÃĐtrica CGI que concorda com a pose estimada (incluindo expressÃĩes, se necessÃĄrio) de todo o corpo humano apresentado em uma imagem, permitindo que novas operaçÃĩes sejam realizadas na imagem usando a malha paramÃĐtrica como uma diretriz volumÃĐtrica ou perceptual. Fonte: https://arxiv.org/pdf/1904.05866.pdf
O desenvolvimento mais aclamado nessa linha foi a iniciativa âRendering with Styleâ da Disney em 2019, que fundiu o uso de mapas de textura tradicionais com imagens geradas por GAN, em uma tentativa de criar saÃdas animadas aprimoradas e âestilo deepfakeâ:

Velho encontra novo, na abordagem hÃbrida da Disney para deepfakes gerados por GAN. Fonte: https://www.youtube.com/watch?v=TwpLqTmvqVk
A abordagem da Disney impÃĩe facetas CGI tradicionalmente renderizadas em uma rede StyleGAN2 para âpintarâ assuntos faciais humanos em âÃĄreas problemÃĄticasâ, onde a consistÊncia temporal ÃĐ uma questÃĢo para a geraçÃĢo de vÃdeo â ÃĄreas como textura de pele.

O fluxo de trabalho de Rendering with Style.
Desde que a cabeça CGI paramÃĐtrica que guia esse processo possa ser ajustada e alterada para atender ao usuÃĄrio, o rosto gerado por GAN pode refletir essas alteraçÃĩes, incluindo mudanças de pose e expressÃĢo da cabeça.
Embora projetado para casar a instrumentalidade da CGI com o realismo natural dos rostos GAN, no final, os resultados demonstram o pior de ambos os mundos e ainda falham em manter a textura do cabelo e atÃĐ mesmo a posiçÃĢo bÃĄsica das caracterÃsticas consistentes:

Um novo tipo de vale incÃīmodo emerge do Rendering with Style, embora o princÃpio ainda mantenha algum potencial.
O artigo de 2020 paper StyleRig: Rigging StyleGAN for 3D Control over Portrait Images segue uma abordagem cada vez mais popular, com o uso de modelos de rosto 3D moldÃĄveis (3DMMs) como procuraçÃĩes para alterar caracterÃsticas em um ambiente StyleGAN, neste caso por meio de uma rede de rigging chamada RigNet:

3DMMs atuam como procuraçÃĩes para interpretaçÃĩes do espaço latente em StyleRig. Fonte: https://arxiv.org/pdf/2004.00121.pdf
No entanto, como de costume com essas iniciativas, os resultados atÃĐ o momento parecem limitados a manipulaçÃĩes mÃnimas de pose e mudanças de expressÃĢo ânÃĢo informadasâ.

StyleRig melhora o nÃvel de controle, embora o cabelo temporalmente consistente permaneça um desafio nÃĢo resolvido. Fonte: https://www.youtube.com/watch?v=eaW_P85wQ9k
Trabalho semelhante pode ser encontrado no MOST-GAN da Mitsubishi Research, um artigo de 2021 que usa 3DMMs nÃĢo lineares como uma arquitetura de desentanglement, mas que tambÃĐm luta para alcançar movimento dinÃĒmico e consistente.
A Última pesquisa que tenta instrumentalidade e desentanglement ÃĐ One-Shot Face Reenactment on Megapixels, que novamente usa cabeças paramÃĐtricas 3DMM como uma interface amigÃĄvel para o StyleGAN.

No fluxo de trabalho MegaFR do One-Shot Face Reenactment, a rede realiza sÃntese facial combinando uma imagem do mundo real invertida com parÃĒmetros tirados de um modelo 3DMM renderizado. Fonte: https://arxiv.org/pdf/2205.13368.pdf
OSFR pertence a uma classe crescente de editores de rosto GAN que buscam desenvolver fluxos de trabalho de ediçÃĢo linear do estilo Photoshop/After Effects, onde o usuÃĄrio pode inserir uma imagem desejada na qual transformaçÃĩes podem ser aplicadas, em vez de procurar pelo espaço latente por cÃģdigos latentes relacionados a uma identidade.
Novamente, expressÃĩes paramÃĐtricas representam um mÃĐtodo abrangente e nÃĢo personalizado de injeçÃĢo de expressÃĢo, levando a manipulaçÃĩes que parecem âincÃīmodasâ de sua prÃģpria maneira, nem sempre positiva.
Como trabalhos anteriores, o OSFR pode inferir poses originais de uma Única imagem e tambÃĐm realizar âfrontalizaçÃĢoâ, onde uma imagem com pose descentrada ÃĐ traduzida em uma fotografia de rosto:

Imagem original (acima) e imagem de rosto inferida de uma das implementaçÃĩes do OSFR detalhadas no novo artigo.
Na prÃĄtica, esse tipo de inferÊncia ÃĐ semelhante a alguns dos princÃpios de fotogrametria que fundamentam Campos de RadiÃĒncia Neural (NeRF), exceto que a geometria aqui deve ser definida por uma Única foto, em vez das 3-4 vistas que permitem que o NeRF interprete as poses intersticiais ausentes e crie cenas neurais 3D explorÃĄveis com humanos.
(No entanto, o NeRF nÃĢo ÃĐ Tudo o que VocÊ Precisa âĒ, pois apresenta um conjunto quase diferente de obstÃĄculos para GANs em termos de produzir sÃntese de vÃdeo facial)
O GAN Tem um Lugar na SÃntese de VÃdeo Facial?
Alcançar expressÃĩes dinÃĒmicas e poses fora do alcance de uma Única imagem de origem parece ser uma obsessÃĢo alquÃmica na pesquisa de sÃntese facial GAN no momento, principalmente porque as GANs sÃĢo o Único mÃĐtodo atualmente capaz de produzir rostos neurais de alta resoluçÃĢo e fidelidade relativamente alta: embora os frameworks de deepfake de autoencoder possam treinar em uma multidÃĢo de poses e expressÃĩes do mundo real, eles devem operar em resoluçÃĩes de entrada/saÃda restritas por VRAM e exigem um âhospedeiroâ; enquanto o NeRF ÃĐ igualmente restrito e â ao contrÃĄrio das outras duas abordagens â atualmente nÃĢo tem metodologias estabelecidas para alterar expressÃĩes faciais e sofre de ediçÃĢo limitada em geral.
Parece que a Única maneira de avançar para um sistema de sÃntese de rosto CGI/GAN preciso ÃĐ que uma nova iniciativa encontre alguma maneira de montar uma entidade de identidade multi-foto dentro do espaço latente, onde um cÃģdigo latente para a identidade de uma pessoa nÃĢo precise viajar por todo o espaço latente para explorar parÃĒmetros de pose nÃĢo relacionados, mas possa se referir à s suas prÃģprias imagens do mundo real como referÊncias para transformaçÃĩes.
Even em tal caso, ou mesmo se uma rede StyleGAN inteira fosse treinada em um conjunto de faces de identidade Única (semelhante aos conjuntos de treinamento que os autoencoders usam), a lÃģgica semÃĒntica ausente ainda provavelmente precisaria ser fornecida por tecnologias auxiliares, como segmentaçÃĢo semÃĒntica ou faces 3DMM paramÃĐtricas, que, nesse cenÃĄrio, pelo menos teriam mais material para trabalhar.













