Ãngulo de Anderson
Identificando Deepfakes de Celebridades a Partir de RegiÃĩes Faciais Externas

Uma nova colaboraçÃĢo entre a Microsoft e uma universidade chinesa propÃīs uma nova maneira de identificar deepfakes de celebridades, aproveitando as limitaçÃĩes das tÃĐcnicas de deepfake atuais para reconhecer identidades que foram âprojetadasâ em outras pessoas.
A abordagem ÃĐ chamada de Identity Consistency Transformer (ICT), e funciona comparando as partes mais externas do rosto (mandÃbula, maçÃĢs do rosto, linha do cabelo e outras linhas marginais externas) com o interior do rosto. O sistema explora dados de imagens pÚblicas disponÃveis de pessoas famosas, o que limita sua eficÃĄcia a celebridades populares, cujas imagens estÃĢo disponÃveis em grandes nÚmeros em conjuntos de dados de visÃĢo computacional amplamente disponÃveis e na internet.

A cobertura de falsificaçÃĢo de faces em sete tÃĐcnicas: DeepFake em FF+; DeepFake no Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; e DF-VAE. Pacotes populares como DeepFaceLab e FaceSwap fornecem cobertura semelhantemente limitada. Fonte: https://arxiv.org/pdf/2203.01318.pdf
Como a imagem acima ilustra, os mÃĐtodos atuais de deepfaking sÃĢo bastante limitados em termos de recursos e dependem de ârostos hospedeirosâ (a imagem ou vÃdeo de uma pessoa que terÃĄ sua identidade substituÃda pelo deepfake) para minimizar evidÊncias de substituiçÃĢo facial.
Embora mÃĐtodos variados possam abranger a testa completa e uma grande parte das ÃĄreas da mandÃbula e da maçÃĢ do rosto, todos sÃĢo mais ou menos limitados dentro do quadro do rosto hospedeiro.

Um mapa de saliÊncia que enfatiza as âidentidades internasâ e âexternasâ calculadas pelo ICT. Onde uma correspondÊncia facial interna ÃĐ estabelecida, mas a identidade externa nÃĢo corresponde, o ICT avalia a imagem como falsa.
Nos testes, o ICT provou ser capaz de detectar conteÚdo de deepfake em ambientes favorÃĄveis ao deepfake, como vÃdeos de baixa resoluçÃĢo, onde o conteÚdo do vÃdeo inteiro ÃĐ degradado por artefatos de compressÃĢo, ajudando a esconder evidÊncias residuais do processo de deepfake â uma circunstÃĒncia que confunde muitos mÃĐtodos de detecçÃĢo de deepfake concorrentes.

O ICT supera os concorrentes no reconhecimento de conteÚdo de deepfake. Veja o vÃdeo incorporado no final do artigo para mais exemplos e melhor resoluçÃĢo. Veja o vÃdeo de fonte incorporado no final do artigo para mais exemplos. Fonte: https://www.youtube.com/watch?v=zgF50dcymj8
O artigo ÃĐ intitulado Proteger Celebridades com Identity Consistency Transformer, e vem de nove pesquisadores afiliados à Universidade de CiÊncia e Tecnologia da China, Microsoft Research Asia e Microsoft Cloud + AI.
A Lacuna de Credibilidade
Existem pelo menos um par de razÃĩes pelas quais algoritmos de troca de faces populares, como DeepFaceLab e FaceSwap, negligenciam a ÃĄrea mais externa das identidades faciais trocadas.
Em primeiro lugar, o treinamento de modelos de deepfake ÃĐ demorado e crÃtico em termos de recursos, e a adoçÃĢo de ârostos hospedeirosâ compatÃveis libera ciclos de GPU e ÃĐpocas para se concentrar nas ÃĄreas internas relativamente imutÃĄveis do rosto, que usamos para distinguir a identidade (jÃĄ que variÃĄveis como flutuaçÃĢo de peso e envelhecimento sÃĢo menos provÃĄveis de alterar esses traços faciais centrais no curto prazo).
Em segundo lugar, a maioria das abordagens de deepfake (e isso certamente ÃĐ o caso com o DeepFaceLab, o software usado pelos praticantes mais populares ou notÃģrios) tem uma capacidade limitada de replicar âmargens de faceâ como ÃĄreas da bochecha e da mandÃbula, e ÃĐ limitada pelo fato de que seu cÃģdigo upstream (2017) nÃĢo abordou extensivamente essa questÃĢo.
Nos casos em que as identidades nÃĢo correspondem bem, o algoritmo de deepfake deve âpintarâ ÃĄreas de fundo ao redor do rosto, o que ele faz de forma desajeitada, mesmo nas mÃĢos dos melhores deepfakers, como Ctrl Shift Face, cuja saÃda foi usada nos estudos do artigo.

O melhor dos melhores: stills de um vÃdeo de deepfake do renomado deepfaker Ctrl-Shift-Face, trocando Jim Carrey por Gary Oldman. Esse trabalho representa provavelmente o melhor resultado atualmente disponÃvel via DeepFaceLab e tÃĐcnicas de pÃģs-processamento. No entanto, as trocas permanecem limitadas à atençÃĢo relativamente escassa que o DFL dÃĄ à face externa, exigindo um esforço hercÚleo de curaçÃĢo de dados e treinamento para abordar as linhas mais externas. Fonte: https://www.youtube.com/watch?v=x8igrh1eyLk
Essa âarte de distraçÃĢoâ, ou desvio de atençÃĢo, em grande parte escapa à atençÃĢo pÚblica na preocupaçÃĢo atual com o realismo crescente dos deepfakes, porque nossas faculdades crÃticas em torno dos deepfakes ainda estÃĢo se desenvolvendo alÃĐm da fase de âchoque e admiraçÃĢoâ.
Identidades Divididas
O novo artigo observa que a maioria dos mÃĐtodos anteriores de detecçÃĢo de deepfake confia em artefatos que traem o processo de troca, como poses de cabeça inconsistentes e piscar, entre numerous outras tÃĐcnicas. Apenas esta semana, um novo artigo de detecçÃĢo de deepfake propÃīs usar a âassinaturaâ dos diferentes tipos de modelos no framework FaceSwap para ajudar a identificar vÃdeo forjado criado com ele (veja imagem abaixo).

Identificando deepfakes caracterizando as assinaturas de diferentes tipos de modelos no framework FaceSwap. Fonte: https://arxiv.org/pdf/2202.12951.pdf
Ao contrÃĄrio, a arquitetura do ICT cria duas identidades aninhadas separadas para uma pessoa, cada uma das quais deve ser verificada antes que a identidade inteira seja concluÃda como âverdadeiraâ ou âfalsaâ.

Arquitetura para as fases de treinamento e teste do ICT.
A divisÃĢo de identidades ÃĐ facilitada por um Transformador de visÃĢo, que realiza identificaçÃĢo facial antes de dividir as regiÃĩes pesquisadas em tokens pertencentes à s identidades internas ou externas.

Distribuindo patches entre os dois signos de identidade paralelos.
O artigo afirma:
âInfelizmente, os mÃĐtodos existentes de verificaçÃĢo facial tendem a caracterizar a regiÃĢo mais discriminativa, ou seja, a face interna para verificaçÃĢo e falham em capturar as informaçÃĩes de identidade na face externa. Com o Identity Consistency Transformer, treinamos um modelo para aprender um par de vetores de identidade, um para a face interna e o outro para a face externa, projetando um Transformador tal que as identidades internas e externas possam ser aprendidas simultaneamente em um modelo unificado.â
Como nÃĢo hÃĄ um modelo existente para esse protocolo de identificaçÃĢo, os autores criaram uma nova forma de perda de consistÊncia que pode atuar como uma mÃĐtrica de autenticidade. O âtoken internoâ e o âtoken externoâ que resultam do modelo de extraçÃĢo de identidade sÃĢo adicionados aos patches de incorporaçÃĢo produzidos por frameworks de identificaçÃĢo facial.
Dados e Treinamento
A rede ICT foi treinada no conjunto de dados MS-Celeb-1M da Microsoft Research, que contÃĐm 10 milhÃĩes de imagens de faces de celebridades que cobrem um milhÃĢo de identidades, incluindo atores, polÃticos e muitos outros tipos de figuras proeminentes. De acordo com o procedimento do mÃĐtodo anterior Face X-ray (outra iniciativa da Microsoft Research), a rotina de geraçÃĢo de deepfakes do ICT troca regiÃĩes internas e externas de faces tiradas desse conjunto de dados para criar material para testar o algoritmo.
Para realizar essas trocas internas, o ICT identifica duas imagens no conjunto de dados que exibem poses de cabeça e marcos faciais semelhantes, gera uma regiÃĢo de mÃĄscara das caracterÃsticas centrais (na qual uma troca pode ser realizada) e realiza uma troca de deepfake com correçÃĢo de cor RGB.
A razÃĢo pela qual o ICT ÃĐ limitado à identificaçÃĢo de celebridades ÃĐ que ele depende (em sua variaçÃĢo mais eficaz) de um conjunto de referÊncia novo que incorpora vetores faciais derivados de um corpus central (neste caso, MS-Celeb-1M, embora a referÊncia possa ser estendida a imagens disponÃveis na rede, o que provavelmente existiria apenas em qualidade e quantidade suficientes para figuras pÚblicas bem conhecidas).
Esses pares de vetores derivados atuam como tokens de autenticidade para verificar as regiÃĩes da face interna e externa em conjunto.
Os autores observam que os tokens obtidos desses mÃĐtodos representam ârecursos de alto nÃvelâ, resultando em um processo de detecçÃĢo de deepfake que ÃĐ mais provÃĄvel de sobreviver em ambientes desafiadores, como vÃdeo de baixa resoluçÃĢo ou degradado.
Crucialmente, o ICT nÃĢo procura evidÊncias baseadas em artefatos, mas sim se concentra em mÃĐtodos de verificaçÃĢo de identidade mais de acordo com tÃĐcnicas de reconhecimento facial â uma abordagem que ÃĐ difÃcil com dados de baixo volume, como ÃĐ o caso da investigaçÃĢo de incidentes de deepfake revenge porn contra alvos nÃĢo famosos.
Testes
Treinado no MS-Celeb-1M, o ICT foi entÃĢo dividido em versÃĩes auxiliadas por referÊncia e âcegasâ do algoritmo e testado contra uma variedade de conjuntos de dados e mÃĐtodos concorrentes. Esses incluÃam FaceForensics++ (FF++), um conjunto de dados de 1000 vÃdeos autÊnticos e de deepfake criados em quatro mÃĐtodos, incluindo Face2Face e FaceSwap; o Deepfake Detection (DFD) do Google, que tambÃĐm ÃĐ composto por milhares de vÃdeos de deepfake gerados pelo Google; Celeb-DeepFake v1 (CD1), que apresenta 408 vÃdeos reais e 795 sintetizados de baixo artefato; Celeb-DeepFake v2, uma extensÃĢo do V1 que contÃĐm 590 vÃdeos reais e 5.639 falsos; e o Deeper-Forensics (Deeper) da China em 2020.
Esses sÃĢo os conjuntos de dados; os mÃĐtodos de detecçÃĢo nos desafios de teste foram Multi-task, MesoInc4, Capsule, Xception-c0, c2 (um mÃĐtodo empregado no FF++), FWA/DSP-FW da Universidade de Albany, Two-Branch, PCL+I2G e o mÃĐtodo de discrepÃĒncia de contexto de Yuval Nirkin.
Os mÃĐtodos de detecçÃĢo mencionados visam detectar tipos especÃficos de manipulaçÃĢo facial. AlÃĐm disso, os autores do novo artigo testaram ofertas mais gerais de detecçÃĢo de deepfake Face X-ray, FFD da Universidade Estadual de Michigan, CNNDetection e Patch-Forensics do MIT CSAIL.
O resultado mais evidente dos testes ÃĐ que os mÃĐtodos concorrentes caem drasticamente em eficÃĄcia à medida que a resoluçÃĢo e a qualidade do vÃdeo diminuem. Como parte do potencial mais grave para a penetraçÃĢo de deepfakes em nossos poderes discriminativos reside (nÃĢo menos no momento atual) em vÃdeos nÃĢo HD ou degradados, isso parece ser um resultado significativo.

Na figura acima, as linhas azul e vermelha indicam a resiliÊncia dos mÃĐtodos ICT à degradaçÃĢo de imagem em todas as ÃĄreas, exceto o obstÃĄculo do ruÃdo gaussiano (nÃĢo uma probabilidade em footagens do tipo Zoom e webcam), enquanto a confiabilidade dos mÃĐtodos concorrentes despencam.
Na tabela de resultados abaixo, vemos a eficÃĄcia dos vÃĄrios mÃĐtodos de detecçÃĢo de deepfake nos conjuntos de dados nÃĢo vistos. Resultados cinza e asteriscados indicam comparaçÃĢo a partir de resultados publicados originalmente em projetos de cÃģdigo fechado, que nÃĢo podem ser verificados externamente. Em quase todos os quadros comparÃĄveis, o ICT supera as abordagens de detecçÃĢo de deepfake concorrentes (mostradas em negrito) nos conjuntos de dados testados.

Como um teste adicional, os autores executaram o conteÚdo do canal do YouTube do aclamado deepfaker Ctrl Shift Face e encontraram que os mÃĐtodos concorrentes alcançaram pontuaçÃĩes de identificaçÃĢo notavelmente inferiores:

NotÃĄvel aqui ÃĐ que os mÃĐtodos FF++ (Xception-c23) e FFD, que alcançam algumas das pontuaçÃĩes mais altas em alguns dos testes gerais do novo artigo, aqui alcançam uma pontuaçÃĢo muito mais baixa do que o ICT em um contexto ârealâ de conteÚdo de deepfake de alto esforço.
Os autores concluem o artigo com a esperança de que seus resultados direcionem a comunidade de detecçÃĢo de deepfake para iniciativas semelhantes que se concentrem em recursos de alto nÃvel mais facilmente generalizÃĄveis e se afastem da âguerra friaâ da detecçÃĢo de artefatos, na qual os mÃĐtodos mais recentes sÃĢo rotineiramente obviados por
Check out the accompanying supplementary video below for more examples of ICT identifying deepfake content that often outfoxes alternative methods.
Â
Â
Publicado pela primeira vez em 4 de março de 2022.












