Ángulo de Anderson

Detección de Deepfakes basada en Rasgos Biométricos Humanos Originales

mm
Añade Unite.AI a tus fuentes preferidas en Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

Un nuevo artículo de investigación de investigadores en Italia y Alemania propone un método para detectar vídeos deepfakes basado en el comportamiento biométrico facial y de voz, en lugar de artefactos creados por sistemas de síntesis facial, soluciones de watermarking costosas o otros enfoques más engorrosos.

El marco requiere una entrada de 10 o más vídeos variados y no falsos del sujeto. Sin embargo, no requiere ser entrenado, reentrenado o aumentado en vídeos por caso, ya que el modelo incorporado ya ha abstracto las distancias vectoriales probables entre vídeos reales y falsos de una manera ampliamente aplicable.

El aprendizaje contrastivo subyace al enfoque de POI-Forensics. Los vectores derivados del material de origen en una base por caso se comparan con los mismos vectores en un vídeo falso potencial, con facetas y rasgos extraídos de ambos componentes de vídeo y audio de la filmación potencialmente falsa. Fuente: https://arxiv.org/pdf/2204.03083.pdf

El aprendizaje contrastivo subyace al enfoque de POI-Forensics. Los vectores derivados del material de origen en una base por caso se comparan con los mismos vectores en un vídeo falso potencial, con facetas y rasgos extraídos de ambos componentes de vídeo y audio de la filmación potencialmente falsa. Fuente: https://arxiv.org/pdf/2204.03083.pdf

Titulado POI-Forensics, el enfoque se basa en movimientos y pistas de audio únicos del individuo real que se está deepfaking.

Aunque un sistema de este tipo podría permitir marcos de autenticación completamente automatizados y “pre-renderizados” para celebridades, políticos, influencers de YouTube y otras personas para las que hay mucho material de vídeo disponible, también podría adaptarse a un marco en el que las víctimas ordinarias de tecnologías deepfake podrían tener una plataforma para demostrar la inautenticidad de los ataques contra ellos.

Visualizaciones de características extraídas de vídeos genuinos y falsos a través de cuatro sujetos en POI-Forensics, a través del marco t-SNE.

Visualizaciones de características extraídas de vídeos genuinos y falsos a través de cuatro sujetos en POI-Forensics, a través del marco t-SNE.

Los autores afirman que POI-Forensics logra un nuevo estado de la técnica en la detección de deepfakes. A través de una variedad de conjuntos de datos comunes en este campo, el marco se informa que logra una mejora en las puntuaciones AUC del 3%, 10% y 7% para vídeos de alta calidad, baja calidad y “atacados”, respectivamente. Los investigadores prometen lanzar el código pronto.

El rendimiento de POI-Forensics contra los marcos SOTA rivales pDFDC, DeepFakeTIMIT, FakeAVCelebV2 y KoDF. El entrenamiento en cada caso se realizó en FaceForensics++, ID-Reveal y el método de los autores en VoxCeleb2. Los resultados incluyen vídeos de alta y baja calidad.

El rendimiento de POI-Forensics contra los marcos SOTA rivales pDFDC, DeepFakeTIMIT, FakeAVCelebV2 y KoDF. El entrenamiento en cada caso se realizó en FaceForensics++ y el método de los autores ID-Reveal en VoxCeleb2. Los resultados incluyen vídeos de alta y baja calidad.

Los autores declaran:

‘El entrenamiento se lleva a cabo exclusivamente en vídeos de caras hablando reales, por lo que el detector no depende de ningún método de manipulación específico y produce la mayor capacidad de generalización. Además, nuestro método puede detectar tanto ataques de un solo modo (solo audio, solo vídeo) como ataques de múltiples modos (audio-vídeo), y es robusto a vídeos de baja calidad o dañados al basarse solo en características semánticas de alto nivel.’

El nuevo artículo, que incorpora elementos de algunos de los proyectos de visión de los autores de 2021, se titula Detección de Deepfakes de Personas de Interés Audiovisuales, y es un esfuerzo conjunto entre la Universidad de Federico II en Nápoles y la Universidad Técnica de Múnich.

La Carrera de Armas de los Deepfakes

Para derrotar a un sistema de detección de este tipo, los sistemas de síntesis de deepfakes y humanos necesitarían la capacidad de simular al menos las pistas biométricas visuales y de audio de la persona objetivo de la síntesis – tecnología que está muchos años por delante y que probablemente permanecerá en el ámbito de sistemas cerrados y propietarios desarrollados por empresas de VFX, que tendrán la ventaja de la cooperación y participación de las personas objetivo (o sus herederos, en el caso de la simulación de personas fallecidas).

El enfoque anterior de los autores, ID-Reveal, se centró enteramente en la información visual. Fuente: https://arxiv.org/pdf/2012.02512.pdf

El enfoque anterior de los autores, ID-Reveal, se centró enteramente en la información visual. Fuente: https://arxiv.org/pdf/2012.02512.pdf

Los métodos de deepfakes exitosos y populares como FaceSwap y DeepFaceLab/Live actualmente no tienen capacidad para crear aproximaciones biométricas tan granulares, y se basan en impersonadores talentosos en los que se impone la identidad falsa, y mucho más comúnmente en filmaciones en el mundo real de personas “similares”. Tampoco la estructura del código base de 2017, que tiene poca modularidad y que sigue siendo la fuente de DFL y FaceSwap, hace que sea factible agregar esta funcionalidad.

Estos dos paquetes de deepfakes dominantes se basan en autoencoders. Los métodos alternativos de síntesis humana pueden utilizar un enfoque de Red Adversaria Generativa (GAN) o Campo de Radiación Neural (NeRF) para recrear la identidad humana; pero ambas líneas de investigación tienen años de trabajo por delante incluso para producir vídeos humanos completamente fotorealistas.

Con la excepción del audio (voces falsas), la simulación biométrica está muy abajo en la lista de desafíos que enfrenta la síntesis de imágenes humanas. En cualquier caso, reproducir el timbre y otras cualidades de la voz humana no reproduce sus peculiaridades y “señales”, o la forma en que el sujeto real utiliza la construcción semántica. Por lo tanto, incluso la perfección de la simulación de voz generada por IA no resuelve el posible firewall de la autenticidad biométrica.

En Arxiv solo, varias estrategias de detección de deepfakes y innovaciones se lanzan cada semana. Los enfoques recientes se han centrado en Homogeneidad de Voz y Rostro, Histograma de Patrón Binario Local (FF-LBPH), percepción humana de deepfakes de audio, análisis de bordes de rostro, contabilización de la degradación de vídeo, y ‘Balística Forense’ – entre muchos otros.

El análisis de histogramas segmentados es una de las últimas técnicas ofrecidas para mejorar la detección de deepfakes. Fuente: https://arxiv.org/pdf/2203.09928.pdf

El análisis de histogramas segmentados es una de las últimas técnicas ofrecidas para mejorar la detección de deepfakes. Fuente: https://arxiv.org/pdf/2203.09928.pdf

Enfoque, Datos y Arquitectura

POI-Forensics adopta un enfoque multimodal para la verificación de identidad, aprovechando las biométricas suaves basadas en pistas visuales y de audio. El marco cuenta con redes de audio y vídeo separadas, que en última instancia derivan datos vectoriales característicos que se pueden comparar con las mismas características extraídas en un vídeo deepfake potencial bajo estudio.

La arquitectura de POI-Forensics.

La arquitectura conceptual de POI-Forensics.

Se pueden realizar análisis de fusión y separados (audio o vídeo) en los clips objetivo, llegando finalmente a un índice de similitud de POI. La función de pérdida contrastiva utilizada se basa en una colaboración académica de 2021 entre Google Research, Boston University, Snap Inc. y MIT.

El conjunto de datos base se dividió en una base por identidad. Se utilizaron 4608 identidades para el entrenamiento, con 512 restantes para la validación. Las 500 identidades utilizadas en FakeAVCelebV2 (un candidato de prueba, véase a continuación) se excluyeron para obtener resultados no polarizados.

Las dos redes se entrenaron durante 12 épocas con un tamaño de lote inusualmente grande de 2304 lotes por época, con cada lote compuesto por 8×8 segmentos de vídeo – 8 segmentos para 8 identidades diferentes. Se utilizó el optimizador Adam con decaimiento de peso desacoplado a una tasa de aprendizaje de 10−4, y un decaimiento de peso de 0,01.

Pruebas y Resultados

Los conjuntos de datos de deepfakes probados para el proyecto fueron el conjunto de datos de desafío de detección de deepfakes, que presenta intercambios de caras en 68 sujetos, de los cuales se seleccionaron 44 identidades que tienen más de nueve vídeos relacionados, totalizando 920 vídeos reales y 2925 vídeos falsos; DeepFake-TIMIT, un conjunto de datos basado en GAN que presenta 320 vídeos de 32 sujetos, totalizando 290 vídeos reales y 580 vídeos falsos de al menos cuatro segundos de duración; FakeAVCelebV2, que comprende 500 vídeos reales de Voxceleb2, y aproximadamente 20.000 vídeos falsos de varios conjuntos de datos, a los que se agregó audio clonado falso con SV2TTS para la compatibilidad; y KoDF, un conjunto de datos de deepfakes coreano con 403 identidades falsificadas a través de FaceSwap, DeepFaceLab y FSGAN, así como tres modelos de movimiento de primer orden (FOMM).

El último también presenta síntesis de cara impulsada por audio ATFHP, y salida de Wav2Lip, con los autores que utilizan un conjunto de datos derivado que presenta 276 vídeos reales y 544 vídeos falsos.

Las métricas utilizadas incluyeron el área bajo la curva de características de operación del receptor (AUC), y una tasa de “falsa alarma” del 10% aproximada, que sería problemática en marcos que incorporan y entrenan en datos falsos, pero que se evita por el hecho de que POI-Forensics solo toma como entrada vídeos reales.

Los métodos se probaron contra el detector de deepfakes de Seferbekov, que logró el primer lugar en el desafío de detección de deepfakes de Kaggle; FTCN (Red de Convolución Temporal Completa), una colaboración entre la Universidad de Xiamen en China y Microsoft Research Asia; LipForensics, un trabajo conjunto de 2021 entre el Imperial College de Londres y Facebook; y ID-Reveal, un proyecto anterior de varios de los investigadores del nuevo artículo, que omite un aspecto de audio y que utiliza modelos morfológicos 3D en combinación con un escenario de juego adversarial para detectar salidas falsas.

En los resultados (ver la tabla anterior), POI-Forensics superó al líder de referencia Seferbekov en un 2,5% en AUC y un 1,5% en términos de precisión. El rendimiento fue más competitivo en otros conjuntos de datos en alta calidad.

Sin embargo, el nuevo enfoque demostró una ventaja notable sobre todos los métodos de referencia competidores para vídeos de baja calidad, que siguen siendo el escenario más probable en el que los deepfakes pueden engañar a los espectadores casuales, basándose en contextos “del mundo real”.

Los autores afirman:

‘De hecho, en este escenario desafiante, solo los enfoques basados en identidad siguen proporcionando un buen rendimiento, ya que se basan en características semánticas de alto nivel, bastante robustas a las alteraciones de la imagen.’

Considerando que POI-Forensics solo utiliza vídeo real como material de origen, el logro es arguablemente mayor, y sugiere que utilizar los rasgos biométricos nativos de las posibles víctimas de deepfakes es un camino valioso hacia la evasión de la “guerra fría de artefactos” entre el software de deepfakes y las soluciones de detección de deepfakes.

En una prueba final, los investigadores agregaron ruido adversario a la entrada, un método que puede engañar a los clasificadores de manera confiable. El método de firma de gradiente rápido ya venerable sigue siendo particularmente efectivo en este regard.

Prediciblemente, las estrategias de ataque adversario redujeron la tasa de éxito en todos los métodos y conjuntos de datos, con AUC descendiendo en incrementos entre el 10% y el 38%. Sin embargo, solo POI-Forensics y el método anterior de los autores ID-Reveal pudieron mantener un rendimiento razonable bajo este escenario de ataque, lo que sugiere que las características de alto nivel asociadas con las biométricas suaves son extraordinariamente resistentes a la evasión de la detección de deepfakes.

Los autores concluyen:

‘En general, creemos que nuestro método es un primer paso; en particular, el uso de características semánticas de alto nivel es una vía prometedora para la investigación futura. Además, el análisis multimodal podría enriquecerse aún más al incluir más información de otros dominios, como los datos textuales.’

 

Publicado por primera vez el 8 de abril de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]