Ângulo de Anderson
A Adobe Research Estende a Edição de Rostos Desembaraçados com GAN

Não é difícil entender por que a entrelaçamento é um problema na síntese de imagens, pois é frequentemente um problema em outras áreas da vida; por exemplo, é muito mais difícil remover curry de um prato de curry do que descartar o picles de um hambúrguer, e é praticamente impossível desdocar um copo de café. Algumas coisas simplesmente vêm em pacotes.
Da mesma forma, o entrelaçamento é um obstáculo para as arquiteturas de síntese de imagens que gostariam de separar recursos e conceitos diferentes ao usar aprendizado de máquina para criar ou editar rostos (ou cães, barcos, ou qualquer outro domínio).
Se você pudesse separar fios como idade, gênero, cor do cabelo, tom de pele, emoção, e assim por diante, você teria o início de uma real instrumentação e flexibilidade em um quadro que pudesse criar e editar imagens de rostos em um nível realmente granular, sem arrastar “passageiros” indesejados nessas conversões.
Com o máximo de entrelaçamento (acima à esquerda), tudo o que você pode fazer é alterar a imagem de uma rede GAN aprendida para a imagem de outra pessoa.
Isso é basicamente usar a tecnologia de visão computacional mais recente para alcançar algo que foi resolvido por outros meios há mais de trinta anos.
Com algum grau de separação (‘Separação Média’ na imagem acima), é possível realizar mudanças baseadas em estilo, como cor do cabelo, expressão, aplicação cosmética e rotação limitada da cabeça, entre outras.

Fonte: FEAT: Edição de Rostos com Atenção, fevereiro 2022, https://arxiv.org/pdf/2202.02713.pdf
Houve várias tentativas nos últimos dois anos para criar ambientes interativos de edição de rostos que permitam ao usuário alterar características faciais com controles deslizantes e outras interações de UI tradicionais, mantendo as características principais do rosto alvo intactas ao fazer adições ou alterações. No entanto, isso provou ser um desafio devido ao entrelaçamento de recursos/estilos subjacente no espaço latente da GAN.
Por exemplo, o traço óculos é frequentemente emaranhado com o traço envelhecido, significando que adicionar óculos pode também “envelhecer” o rosto, enquanto envelhecer o rosto pode adicionar óculos, dependendo do grau de separação de recursos de alto nível aplicada (veja “Testes” abaixo para exemplos).
Além disso, tem sido quase impossível alterar a cor do cabelo e outros aspectos do cabelo sem que os fios de cabelo e a disposição sejam recalculados, o que dá um efeito de “borbulhamento”, de transição.

Fonte: Demo InterFaceGAN (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w
Travessia Latente-Latente GAN
Um novo artigo liderado pela Adobe apresentado para WACV 2022 oferece uma abordagem inovadora para essas questões subjacentes em um artigo intitulado Latente para Latente: um Mapeador Aprendido para Edição de Preservação de Identidade de Múltiplos Atributos Faciais em Imagens Geradas por StyleGAN.

Material suplementar do artigo Latente para Latente: um Mapeador Aprendido para Edição de Preservação de Identidade de Múltiplos Atributos Faciais em Imagens Geradas por StyleGAN. Aqui vemos que as características básicas no rosto aprendido não são arrastadas para alterações não relacionadas. Veja o vídeo incorporado no final do artigo para mais detalhes e resolução. Fonte: https://www.youtube.com/watch?v=rf_61llRH0Q
O artigo é liderado pelo cientista aplicado da Adobe Siavash Khodadadeh, juntamente com quatro outros pesquisadores da Adobe e um pesquisador do Departamento de Ciência da Computação da Universidade da Flórida Central.
O artigo é interessante em parte porque a Adobe tem operado nesse espaço por algum tempo, e é tentador imaginar essa funcionalidade entrando em um projeto do Creative Suite nos próximos anos; mas principalmente porque a arquitetura criada para o projeto assume uma abordagem diferente para manter a integridade visual em um editor de rostos GAN enquanto as alterações estão sendo aplicadas.
Os autores declaram:
‘[Nós] treinamos uma rede neural para realizar uma transformação latente-latente que encontra a codificação latente correspondente à imagem com o atributo alterado. Como a técnica é de um único disparo, não depende de uma trajetória linear ou não linear da mudança gradual dos atributos.
‘Ao treinar a rede de ponta a ponta sobre o pipeline de geração completo, o sistema pode se adaptar aos espaços latentes de arquiteturas de geradores prontas para uso. Propriedades de conservação, como manter a identidade da pessoa, podem ser codificadas na forma de perdas de treinamento.
‘Uma vez que a rede latente-latente foi treinada, ela pode ser reutilizada para imagens arbitrárias sem retreinamento.’
Isso significa que a arquitetura proposta chega com o usuário final em um estado concluído. Ela ainda precisa executar uma rede neural em recursos locais, mas novas imagens podem ser “inseridas” e prontas para alteração quase imediatamente, desde que o quadro seja suficientemente desacoplado para não precisar de treinamento adicional de imagem específica.

Gênero e cabelo facial alterados à medida que os controles deslizantes traçam caminhos aleatórios e arbitrários pelo espaço latente, não apenas ‘varrendo entre os pontos finais’. Veja o vídeo incorporado no final do artigo para mais transformações em melhor resolução.
Entre os principais feitos no trabalho está a capacidade da rede de “congelar” identidades no espaço latente alterando apenas o atributo em um vetor de destino e fornecendo “termos de correção” que conservam identidades sendo transformadas.
Essencialmente, a rede proposta está incorporada em uma arquitetura mais ampla que orquestra todos os elementos processados, que passam por componentes pré-treinados com pesos congelados que não produzirão efeitos laterais indesejados nas transformações.
Como o processo de treinamento depende de tripletos que podem ser gerados por uma imagem inicial (sob inversão GAN) ou uma codificação latente inicial existente, o processo de treinamento inteiro é não supervisionado, com as ações tácitas do conjunto usual de sistemas de rotulagem e curadoria em tais sistemas efetivamente incorporadas na arquitetura. Na verdade, o novo sistema usa reconhecedores de atributos prontos para uso:
‘[O] número de atributos que nossa rede pode controlar independentemente é limitado apenas pelas capacidades do reconhecedor(s) – se você tiver um reconhecedor para um atributo, podemos adicioná-lo a rostos arbitrários. Em nossos experimentos, treinamos a rede latente-latente para permitir a ajuste de 35 atributos faciais diferentes, mais do que qualquer abordagem anterior.’
A sistema incorpora uma salvaguarda adicional contra transformações “efeitos colaterais” indesejados:
‘[A] rede latente-latente mapeará um vetor latente para si mesmo, aumentando ainda mais a persistência estável da identidade do alvo.’
Reconhecimento Facial
Um problema recorrente com editores de rostos GAN e baseados em codificador/decodificador nos últimos anos tem sido que as transformações aplicadas tendem a degradar a semelhança. Para combater isso, o projeto da Adobe usa uma rede de reconhecimento facial incorporada chamada FaceNet como discriminador.

Arquitetura do projeto, veja abaixo à esquerda para a inclusão da FaceNet. Fonte: Latente para Latente: um Mapeador Aprendido para Edição de Preservação de Identidade de Múltiplos Atributos Faciais em Imagens Geradas por StyleGAN, OpenAccess.
(Em uma nota pessoal, isso parece um movimento encorajador em direção à integração de sistemas de identificação facial e reconhecimento de expressão padrão em redes gerativas, provavelmente o melhor caminho para superar o mapeamento cego pixel a pixel que domina as atuais arquiteturas de deepfakes ao custo da fidelidade de expressão e outros domínios importantes no setor de geração de rostos.)
Acesso a Todas as Áreas no Espaço Latente
Outra característica impressionante da estrutura é sua capacidade de viajar arbitrariamente entre transformações potenciais no espaço latente, por vontade do usuário. Vários sistemas anteriores que forneciam interfaces exploratórias frequentemente deixavam o usuário essencialmente “varrendo” entre linhas de tempo de transformação de recursos fixos – impressionante, mas frequentemente uma experiência linear ou prescrita.

A partir de Melhorando o Equilíbrio GAN Aumentando a Consciência Espacial: aqui o usuário varre uma gama de pontos de transição potenciais entre dois locais no espaço latente, mas dentro dos limites de locais pré-treinados no espaço latente. Para aplicar outros tipos de transformação com base no mesmo material, reconfiguração e/ou retreinamento é necessário. Fonte: https://genforce.github.io/eqgan/
Além disso, o usuário também pode “congelar” manualmente elementos que deseja conservar durante o processo de transformação. Dessa forma, o usuário pode garantir que (por exemplo) os fundos não sejam alterados ou que os olhos sejam mantidos abertos ou fechados.
Dados
A rede de regressão de atributos foi treinada em três redes: FFHQ, CelebAMask-HQ e uma rede local gerada por GAN, obtida por amostragem de 400.000 vetores do espaço Z do StyleGAN-V2.
Imagens fora do conjunto de dados (OOD) foram filtradas e atributos extraídos usando a Face API da Microsoft, com o conjunto de imagens resultante dividido em 90/10, deixando 721.218 imagens de treinamento e 72.172 imagens de teste para comparar.
Testes
Embora a rede experimental tenha sido inicialmente configurada para acomodar 35 transformações potenciais, essas foram reduzidas a oito para realizar testes análogos contra as estruturas comparáveis InterFaceGAN, GANSpace e StyleFlow.
Os oito atributos selecionados foram Idade, Calvície, Barba, Expressão, Gênero, Óculos, Tom e Inclinação. Foi necessário reconfigurar as estruturas concorrentes para alguns dos oito atributos que não estavam provisionados na distribuição original, como adicionar calvície e barba ao InterFaceGAN.
Como esperado, um maior nível de entrelaçamento ocorreu nas arquiteturas rivais. Por exemplo, em um teste, o InterFaceGAN e o StyleFlow mudaram o gênero do assunto quando solicitado a aplicar idade:

Duas das estruturas concorrentes incluíram uma mudança de gênero na transformação ‘idade’, também mudando a cor do cabelo sem solicitação direta do usuário.
Além disso, duas das rivais descobriram que óculos e idade são facetas inseparáveis:
Não é uma vitória uniforme para a pesquisa: como pode ser visto no vídeo incorporado no final do artigo, a estrutura é a menos eficaz ao tentar extrapolar ângulos diversos (inclinação), enquanto o GANSpace tem um melhor resultado geral para idade e a imposição de óculos. A estrutura latente-latente empatou com o GANSpace e o StyleFlow em relação à adição de tom (ângulo da cabeça).

Resultados calculados com base em uma calibração do detector de rostos MTCNN. Resultados mais baixos são melhores.
Para mais detalhes e melhor resolução dos exemplos, confira o vídeo acompanhante abaixo.
Publicado pela primeira vez em 16 de fevereiro de 2022.














