Ángulo de Anderson
Fidelidad vs. Realismo en Videos Deepfake

No todos los practicantes de deepfake comparten el mismo objetivo: el impulso de la investigación en síntesis de imágenes – respaldado por influyentes defensores como Adobe, NVIDIA y Facebook – es avanzar en el estado del arte para que las técnicas de aprendizaje automático puedan recrear o sintetizar la actividad humana a alta resolución y en las condiciones más desafiantes (fidelidad).
Por el contrario, el objetivo de aquellos que desean utilizar tecnologías de deepfake para difundir información falsa es crear simulaciones plausibles de personas reales por métodos distintos a la mera veracidad de las caras deepfake. En este escenario, factores como el contexto y la plausibilidad son casi tan importantes como el potencial de un video para simular caras (realismo).
Este enfoque de “prestidigitación” se extiende a la degradación de la calidad de la imagen final de un video deepfake, para que todo el video (y no solo la porción engañosa representada por una cara deepfake) tenga una apariencia coherente que sea precisa para la calidad esperada del medio.
‘Coherente’ no tiene que significar ‘bueno’ – es suficiente que la calidad sea consistente en todo el contenido original y el contenido insertado y adulterado, y se ajuste a las expectativas. En términos de salida de transmisión de VOIP en plataformas como Skype y Zoom, la barra puede ser sorprendentemente baja, con video entrecortado, jerky, y una amplia gama de posibles artefactos de compresión, así como algoritmos de ‘suavizado’ diseñados para reducir sus efectos – que en sí mismos constituyen una gama adicional de efectos ‘no auténticos’ que hemos aceptado como corolarios de las limitaciones y excentricidades de la transmisión en vivo.

DeepFaceLive en acción: esta versión de transmisión del software de deepfake premier DeepFaceLab puede proporcionar realismo contextual al presentar falsificaciones en el contexto de una calidad de video limitada, completa con problemas de reproducción y otros artefactos de conexión recurrentes. Fuente: https://www.youtube.com/watch?v=IL517EgYH8U
Degradación Incorporada
De hecho, los dos paquetes de deepfake más populares (ambos derivados del código fuente controvertido de 2017) contienen componentes destinados a integrar la cara deepfake en el contexto de video ‘histórico’ o de menor calidad al degradar la cara generada. En DeepFaceLab, el parámetro bicubic_degrade_power logra esto, y en FaceSwap, la configuración ‘grain’ en la configuración de Ffmpeg ayuda a la integración de la cara falsa al preservar el grano durante la codificación*.

La configuración ‘grain’ en FaceSwap ayuda a la integración auténtica en contenido de video no HQ y contenido heredado que puede presentar efectos de grano de película que son relativamente raros en la actualidad.
A menudo, en lugar de un video deepfake completo e integrado, los deepfakers producen una serie aislada de archivos PNG con canales alfa, cada imagen que muestra solo la cara sintética de salida, para que la secuencia de imágenes se pueda convertir en video en plataformas con capacidades de efectos de degradación más sofisticadas, como Adobe After Effects, antes de que los elementos falsos y reales se unan para el video final.
Además de estas degradaciones intencionales, el contenido del trabajo de deepfake se recompresa con frecuencia, ya sea algorítmicamente (donde las plataformas de redes sociales buscan ahorrar ancho de banda produciendo versiones más ligeras de las cargas de los usuarios) en plataformas como YouTube y Facebook, o mediante el reprocesamiento del trabajo original en GIFs animados, secciones de detalles u otros flujos de trabajo diversamente motivados que tratan la versión original como un punto de partida y luego introducen una compresión adicional.
Contextos Realistas de Detección de Deepfake
Con esto en mente, un nuevo artículo de Suiza ha propuesto una revisión de la metodología detrás de los enfoques de detección de deepfake, enseñando a los sistemas de detección a aprender las características del contenido de deepfake cuando se presenta en contextos degradados intencionalmente.

Augmentación de datos estocástica aplicada a uno de los conjuntos de datos utilizados en el nuevo artículo, con ruido gaussiano, corrección gamma y desenfoque gaussiano, así como artefactos de compresión JPEG. Fuente: https://arxiv.org/pdf/2203.11807.pdf
En el nuevo artículo, los investigadores argumentan que los paquetes de detección de deepfake vanguardistas se basan en condiciones de referencia poco realistas para el contexto de las métricas que aplican, y que la salida de deepfake ‘degradada’ puede caer por debajo del umbral de calidad mínimo para la detección, aunque su contenido ‘grungy’ realista es probable que engañe a los espectadores debido a una atención correcta al contexto.
Los investigadores han instituido un proceso de degradación de datos ‘realista’ que logra mejorar la generalización de los detectores de deepfake líderes, con solo una pérdida marginal de precisión en las tasas de detección originales obtenidas por datos ‘limpios’. También ofrecen un nuevo marco de evaluación que puede evaluar la robustez de los detectores de deepfake en condiciones del mundo real, respaldado por estudios de ablation extensivos.
El artículo se titula Un Nuevo Enfoque para Mejorar la Detección de Deepfake Basada en Aprendizaje en Condiciones Realistas, y proviene de investigadores del Grupo de Procesamiento de Señales de Multimedia (MMSPG) y la Escuela Politécnica Federal de Lausana (EPFL), ambos con sede en Lausana.
Confusión Útil
Esfuerzos anteriores para incorporar salida degradada en enfoques de detección de deepfake incluyen la red neuronal Mixup, una oferta de 2018 de MIT y FAIR, y AugMix, una colaboración de 2020 entre DeepMind y Google, ambos métodos de augmentación de datos que intentan ‘ensuciar’ el material de entrenamiento de una manera que tiende a ayudar a la generalización.
Los investigadores del nuevo trabajo también notan estudios previos que aplicaron ruido gaussiano y artefactos de compresión a los datos de entrenamiento para establecer los límites de la relación entre una característica derivada y el ruido en el que se encuentra.
El nuevo estudio ofrece una canalización que simula las condiciones comprometidas de ambos el proceso de adquisición para la imagen y la compresión y los diversos algoritmos que pueden degradar aún más la salida de la imagen en el proceso de distribución. Al incorporar este flujo de trabajo del mundo real en un marco de evaluación, es posible producir datos de entrenamiento para detectores de deepfake que son más resistentes a los artefactos.

La lógica conceptual y el flujo de trabajo para el nuevo enfoque.
El proceso de degradación se aplicó a dos conjuntos de datos populares y exitosos utilizados para la detección de deepfake: FaceForensics++ y Celeb-DFv2. Además, los marcos de detección de deepfake líderes Capsule-Forensics y XceptionNet se entrenaron en las versiones adulteradas de los dos conjuntos de datos.
Los detectores se entrenaron con el optimizador Adam durante 25 y 10 épocas, respectivamente. Para la transformación del conjunto de datos, se muestrearon aleatoriamente 100 cuadros de cada video de entrenamiento, con 32 cuadros extraídos para pruebas, antes de la adición de procesos de degradación.
Las distorsiones consideradas para el flujo de trabajo fueron ruido, donde se aplicó ruido gaussiano de media cero a seis niveles variables; redimensionamiento, para simular la resolución reducida de la filmación al aire libre típica, que puede afectar típicamente a los detectores; compresión, donde se aplicaron niveles de compresión JPEG variables en los datos; suavizado, donde se evaluaron tres filtros de suavizado típicos utilizados en la ‘desenoización’; mejora, donde se ajustaron contraste y brillo; y combinaciones, donde se aplicaron simultáneamente cualquier mezcla de tres de los métodos anteriores a una sola imagen.
Pruebas y Resultados
Al probar los datos, los investigadores adoptaron tres métricas: Precisión (ACC); Área bajo la Curva de la Característica del Receptor (AUC); y puntuación F1.
Los investigadores probaron las versiones entrenadas con estándares de los dos detectores de deepfake contra los datos adulterados y encontraron que les faltaba:
‘En general, la mayoría de las distorsiones y procesos realistas son extremadamente perjudiciales para los detectores de deepfake basados en aprendizaje entrenados normalmente. Por ejemplo, el método Capsule-Forensics muestra puntuaciones AUC muy altas en ambos conjuntos de pruebas FFpp y Celeb-DFv2 no comprimidos después del entrenamiento en los conjuntos de datos respectivos, pero luego sufre una caída drástica en el rendimiento en los datos modificados de nuestro marco de evaluación. Tendencias similares se han observado con el detector XceptionNet.’
Por el contrario, el rendimiento de los dos detectores mejoró notablemente al ser entrenados en los datos transformados, con cada detector ahora más capaz de detectar medios engañosos no vistos.
‘El esquema de augmentación de datos mejora significativamente la robustez de los dos detectores y, al mismo tiempo, mantienen un alto rendimiento en los datos originales no alterados.’

Comparaciones de rendimiento entre los conjuntos de datos brutos y aumentados utilizados en los dos detectores de deepfake evaluados en el estudio.
El artículo concluye:
‘Los métodos de detección actuales están diseñados para lograr el mejor rendimiento posible en benchmarks específicos. Esto a menudo resulta en sacrificar la capacidad de generalización a escenarios más realistas. En este artículo, se propone un esquema de augmentación de datos cuidadosamente concebido basado en el proceso de degradación de imagen natural.’
‘Experimentos extensivos muestran que la técnica simple pero efectiva mejora significativamente la robustez del modelo contra diversas distorsiones y operaciones de procesamiento realistas en flujos de trabajo de imagen típicos.’
* La coincidencia de grano en la cara generada es una función de transferencia de estilo durante el proceso de conversión.
Publicado por primera vez el 29 de marzo de 2022. Actualizado a las 8:33 p.m. EST para aclarar el uso de grano en Ffmpeg.












