Ângulo de Anderson

Novo Método de Deepfake Resolve o Problema do ‘Hospedeiro Facial’

mm
Adicione Unite.AI às suas fontes preferidas no Google

Apesar de vários anos de hiperbolização midiática sobre o potencial das imagens de deepfake para minar nossa longa confiança na autenticidade das filmagens de vídeo, todos os métodos atualmente populares dependem de encontrar ‘hospedeiros faciais’ que sejam amplamente semelhantes em forma ao rosto alvo.

Onde a filmagem original apresenta um rosto amplo, mas o sujeito alvo tem um rosto estreito, os resultados sempre foram problemáticos, porque tal transferência envolve cortar parte do rosto original e reconstruir o plano de fundo agora exposto. Os pacotes atuais, como o DeepFaceLab e o FaceSwap, são capazes de produzir resultados limitados quando a configuração é revertida (estreito>amplo), mas não têm nenhuma facilidade para lidar convincentemente com esse cenário.

Agora, uma colaboração entre a Tencent e a Universidade de Xiamen, na China, desenvolveu uma nova abordagem, intitulada HifiFace, projetada para corrigir essa deficiência.

Dois deepfakes do HifiFace, o primeiro de Anne Hathaway, onde uma boa semelhança é obtida apesar da incompatibilidade da forma do rosto do hospedeiro. O HifiFace também se sai bem em alvos com óculos, tradicionalmente um obstáculo nos deepfakes.

Dois deepfakes do HifiFace, o primeiro de Anne Hathaway, onde uma boa semelhança é obtida apesar da incompatibilidade da forma do rosto do hospedeiro. O HifiFace também se sai bem em alvos com óculos, tradicionalmente um obstáculo nos deepfakes. Fonte: https://arxiv.org/pdf/2106.09965.pdf

Reconstrução de um Rosto de Deepfake

As abordagens anteriores, como a de 2019, Subject Agnostic Face Swapping and Reenactment (FSGAN), dependiam de 3DMM fitting (3D Morphable Models) ou outras metodologias baseadas em reconhecimento de marcos faciais ou transformação, onde os lineamentos faciais do rosto a ser “sobrescrito” ditam pretty much os limites da troca;

Fonte: https://github.com/Yinghao-Li/3DMM-fitting

Detecção de marcos faciais 3DMM. Fonte: https://github.com/Yinghao-Li/3DMM-fitting

Embora os métodos concorrentes tenham se baseado em recursos derivados de redes de reconhecimento facial, esses são principalmente destinados a reconstituir a textura em vez da estrutura, e produzem um efeito “de máscara” em casos onde o rosto do hospedeiro não é totalmente compatível (ou seja, os limites e a forma da linha do cabelo, da mandíbula e das bochechas).

Para resolver essas questões, os pesquisadores chineses, baseados no Laboratório de Análise e Computação de Mídia da Universidade, desenvolveram uma rede de ponta a ponta que regressa os coeficientes do rosto alvo e do rosto de origem usando um modelo de reconstrução 3D, que é então re-combinado como informações de forma, e concatenado com informações de vetor de identidade de uma rede de reconhecimento facial.

Essas informações geométricas são então alimentadas em um modelo codificador-decodificador como informações estruturais, misturando com a expressão e a disposição do rosto alvo, que são aproveitadas como fontes auxiliares para a transferência precisa.

Fusão Facial Semântica

Além disso, o HifiFace inclui um componente de Fusão Facial Semântica (SFF), que usa um recurso de baixo nível no codificador para preservar informações espaciais e de textura, sem sacrificar a identidade da imagem alvo. Recursos do codificador e decodificador são integrados em uma máscara adaptativa aprendida, e as informações de plano de fundo são misturadas na saída por meio da máscara facial aprendida.

HifiFace em ação. Fonte: https://johann.wang/HifiFace/

HifiFace em ação. Fonte: https://johann.wang/HifiFace/

Desta forma, o HifiFace se afasta do uso de limites faciais originais como um limite rígido, usando uma segmentação semântica facial dilatada, na qual o modelo pode realizar uma fusão adaptativa melhor nas bordas do rosto.

Duas abordagens anteriores (topo e inferior esquerdo), e a nova arquitetura do HifiFace, que consiste em um codificador, decodificador, extrator de identidade de forma 3D e módulo SFF.

Duas abordagens anteriores (topo e inferior esquerdo), e a nova arquitetura do HifiFace, que consiste em um codificador, decodificador, extrator de identidade de forma 3D e módulo SFF.

Em uma comparação com os métodos anteriores FSGAN, SimSwap e FaceShifter, o HifiFace demonstra uma reconstrução superior da forma do rosto, pois não está aproximando elementos “fantasmas” onde as delimitações faciais confundem o mapeamento identidade>identidade, mas definitivamente os reconstrói.

Testes

Os pesquisadores implementaram o sistema usando os conjuntos de dados VGGFace2 e DeepGlint Asian-Celeb. Os rostos foram alinhados via 5 marcos externos e recortados para 256×256 pixels. Uma rede de melhoria de retrato também foi usada para gerar uma versão de 512×512 pixels, para um modelo de alta resolução adicional. O modelo foi treinado sob Adam.

Embora o FaceShifter preserve a identidade bem, não consegue lidar com questões como expressão, cor e oclusão tão eficazmente quanto o HifiFace, e tem uma estrutura de rede mais complexa. O FSGAN tem problemas ao transferir a iluminação da origem para o alvo.

Os pesquisadores usam FaceForensics++ para comparações quantitativas, amostrando dez quadros cada em um lote de vídeos convertidos nos métodos concorrentes, e encontrando que o HifiFace alcançou uma pontuação de recuperação de ID superior. Ao testar uma série de outros fatores, como a qualidade da imagem, os pesquisadores também encontraram que seu método superou as metodologias rivais.

Os lineamentos faciais de Benedict Cumberbatch são reproduzidos fielmente.

Os lineamentos faciais de Benedict Cumberbatch são reproduzidos fielmente.

O trabalho representa um passo adiante na abstração do material de origem para que seja apenas um modelo grosseiro no qual identidades precisas podem ser transferidas. Alguns dos pacotes FOSS atuais, incluindo o DeepFaceLab, apresentam funcionalidades nascentes para substituição de cabeça completa, mas, como o HifiFace, esses não levam em conta o cabelo, e são mais eficazes em “construir” um rosto do que em “esculpir” um para combinar com um alvo de origem desejado.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai