Ángulo de Anderson

Codificación de Imágenes Contra el Uso en Sistemas de Síntesis y Deepfake

mm
Añade Unite.AI a tus fuentes preferidas en Google

La línea de investigación más conocida en el creciente sector de investigación anti-deepfake implica sistemas que pueden reconocer artefactos o otras características supuestamente distinguibles de deepfakes, sintetizados o falsificados en video y contenido de imagen.

Estos enfoques utilizan una variedad de tácticas, incluyendo detección de profundidad, disrupción de la regularidad del video, variaciones en la iluminación del monitor (en posibles llamadas de video deepfakes en vivo), rasgos biométricos, regiones externas de la cara, e incluso los poderes ocultos del sistema subconsciente humano.

Lo que estos, y métodos similares tienen en común es que, para cuando se despliegan, los mecanismos centrales que están luchando ya han sido entrenados con éxito en miles, o cientos de miles de imágenes raspadas de la web – imágenes de las que los sistemas autoencoder pueden derivar fácilmente características clave y crear modelos que pueden imponer una identidad falsa en metraje de video o imágenes sintetizadas – incluso en tiempo real.

En resumen, para cuando dichos sistemas están activos, el caballo ya ha salido del establo.

Imágenes Hostiles a las Arquitecturas de Deepfake/Síntesis

A modo de una actitud más preventiva hacia la amenaza de los deepfakes y la síntesis de imágenes, una rama menos conocida de la investigación en este sector implica las posibilidades inherentes en hacer que todas esas fotos de origen sean desagradables para los sistemas de síntesis de imágenes de IA, generalmente de maneras imperceptibles o apenas perceptibles.

Ejemplos incluyen FakeTagger, una propuesta de 2021 de varias instituciones en EE. UU. y Asia, que codifica mensajes en las imágenes; estos codigos son resistentes al proceso de generalización y pueden recuperarse incluso después de que las imágenes hayan sido raspadas de la web y entrenadas en una Red Generativa Adversaria (GAN) del tipo más famosamente encarnado por thispersondoesnotexist.com y sus numerosos derivados.

FakeTagger codifica información que puede sobrevivir al proceso de generalización al entrenar una GAN, lo que hace posible saber si una imagen en particular contribuyó a las capacidades generativas del sistema. Fuente: https://arxiv.org/pdf/2009.09869.pdf

FakeTagger codifica información que puede sobrevivir al proceso de generalización al entrenar una GAN, lo que hace posible saber si una imagen en particular contribuyó a las capacidades generativas del sistema. Fuente: https://arxiv.org/pdf/2009.09869.pdf

Para ICCV 2021, otro esfuerzo internacional instituyó huellas dactilares artificiales para modelos generativos, (ver imagen a continuación) que nuevamente produce ‘huellas dactilares’ recuperables desde la salida de una GAN de síntesis de imágenes como StyleGAN2.

Incluso bajo una variedad de manipulaciones extremas, recortes y sustituciones de cara, las huellas dactilares que pasan por ProGAN siguen siendo recuperables. Fuente: https://arxiv.org/pdf/2007.08457.pdf

Incluso bajo una variedad de manipulaciones extremas, recortes y sustituciones de cara, las huellas dactilares que pasan por ProGAN siguen siendo recuperables. Fuente: https://arxiv.org/pdf/2007.08457.pdf

Otras iteraciones de este concepto incluyen un proyecto de 2018 de IBM y un esquema de marca de agua digital en el mismo año, de Japón.

Más innovadoramente, una iniciativa de 2021 de la Universidad de Aeronáutica y Astronáutica de Nanjing buscó ‘encriptar’ imágenes de entrenamiento de tal manera que se entrenarían efectivamente solo en sistemas autorizados, pero fallarían catastróficamente si se usaban como datos de origen en una tubería de entrenamiento de síntesis de imágenes genérica.

En esencia, todos estos métodos caen bajo la categoría de esteganografía, pero en todos los casos, la información de identificación única en las imágenes necesita estar codificada como tal ‘característica’ esencial de una imagen que no haya posibilidad de que una arquitectura autoencoder o GAN la descarte como ‘ruido’ o datos no esenciales, sino que la codificará junto con otros rasgos faciales.

Al mismo tiempo, el proceso no puede permitir que distorsione o afecte visualmente la imagen tanto que sea percibida por espectadores casuales como defectuosa o de baja calidad.

TAFIM

Ahora, un nuevo esfuerzo de investigación alemán (de la Universidad Técnica de Múnich y Sony Europe RDC Stuttgart) ha propuesto una técnica de codificación de imágenes mediante la cual los modelos de deepfake o marcos de tipo StyleGAN que se entrenan en imágenes procesadas producirán una salida inutilizable azul o blanca, respectivamente.

Las perturbaciones de imagen de bajo nivel de TAFIM abordan varios tipos posibles de distorsión/sustitución de cara, forzando a los modelos entrenados en las imágenes a producir una salida distorsionada, y se informa que es aplicable incluso en escenarios en tiempo real como la transmisión de deepfake en tiempo real de DeepFaceLive. Fuente: https://arxiv.org/pdf/2112.09151.pdf

Las perturbaciones de imagen de bajo nivel de TAFIM abordan varios tipos posibles de distorsión/sustitución de cara, forzando a los modelos entrenados en las imágenes a producir una salida distorsionada, y se informa que es aplicable incluso en escenarios en tiempo real como la transmisión de deepfake en tiempo real de DeepFaceLive. Fuente: https://arxiv.org/pdf/2112.09151.pdf

El documento, titulado TAFIM: Ataques Adversariales Dirigidos contra Manipulaciones de Imágenes Faciales, utiliza una red neuronal para codificar perturbaciones apenas perceptibles en las imágenes. Después de que las imágenes se entrenan y generalizan en una arquitectura de síntesis, el modelo resultante producirá una salida descolorida para la identidad de entrada si se usa en mezcla de estilos o sustitución de cara directa.

ReCodificando la Web..?

Sin embargo, en este caso, no estamos aquí para examinar los detalles y la arquitectura de la última versión de este concepto popular, sino para considerar la practicidad de la idea en su conjunto – particularmente a la luz de la creciente controversia sobre el uso de imágenes públicamente raspadas para alimentar marcos de síntesis de imágenes como Stable Diffusion, y las subsiguientes implicaciones legales de derivación de software comercial de contenido que puede (al menos en algunas jurisdicciones) eventualmente demostrar protección legal contra la ingestión en arquitecturas de síntesis de IA.

Los enfoques proactivos y basados en la codificación, como los descritos anteriormente, conllevan un costo no pequeño. Al menos, implicarían instituir nuevas y extendidas rutinas de compresión en bibliotecas de procesamiento web estándar como ImageMagick, que alimentan una gran cantidad de procesos de carga, incluyendo muchas interfaces de carga de redes sociales, encargadas de convertir imágenes de usuario originales de gran tamaño en versiones optimizadas más adecuadas para compartir y distribuir en red, y también para efectuar transformaciones como recortes y otros aumentos.

La pregunta principal que esto plantea es: ¿se implementaría tal esquema ‘hacia adelante’, o se pretendería una implementación más amplia y retrospectiva, que abordara los medios históricos que pueden haber estado disponibles, ‘no corruptos’, durante décadas?

Plataformas como Netflix no son renuentes al gasto de recodificar un catálogo con nuevos códecs que pueden ser más eficientes, o podrían proporcionar beneficios al usuario o proveedor; de manera similar, la conversión de YouTube de su contenido histórico al códec H.264, aparentemente para acomodar a Apple TV, una tarea logísticamente monumental, no se consideró prohibitivamente difícil, a pesar de la escala.

Irónicamente, incluso si grandes porciones de contenido de medios en Internet se convirtieran en sujetos de recodificación en un formato que resiste el entrenamiento, el conjunto limitado de conjuntos de datos de visión por computadora influyentes permanecería sin afectar. Sin embargo, presumiblemente, los sistemas que los utilizan como datos de origen comenzarían a disminuir en calidad de salida, ya que el contenido con marca de agua interferiría con los procesos transformadores de las arquitecturas.

Conflicto Político

En términos políticos, hay una tensión aparente entre la determinación de los gobiernos de no quedarse atrás en el desarrollo de la IA y hacer concesiones a la preocupación pública sobre el uso ad hoc de contenido de audio, video e imagen disponible en Internet como un recurso abundante para sistemas de IA transformadores.

Oficialmente, los gobiernos occidentales están inclinados a la leniencia en cuanto a la capacidad del sector de investigación de visión por computadora para utilizar medios públicamente disponibles, no menos porque algunos de los países asiáticos más autocráticos tienen mucha más libertad para dar forma a sus flujos de trabajo de desarrollo de manera que beneficie a sus propios esfuerzos de investigación – solo uno de los factores que sugiere que China se está convirtiendo en el líder global en IA.

En abril de 2022, el Tribunal de Apelaciones de EE. UU. afirmó que los datos web de acceso público son juego limpio para fines de investigación, a pesar de las protestas en curso de LinkedIn, que desea que sus perfiles de usuario estén protegidos de dichos procesos.

Si la imagen resistente a la IA no va a convertirse en un estándar de sistema, no hay nada que impida que algunas de las principales fuentes de datos de entrenamiento implementen tales sistemas, de modo que su propia salida se vuelva improductiva en el espacio latente.

El factor esencial en tales despliegues específicos de la empresa es que las imágenes deben ser innatamente resistentes al entrenamiento. Las técnicas de procedencia basadas en blockchain y movimientos como la Iniciativa de Autenticidad de Contenido se preocupan más por probar que las imágenes han sido falsificadas o ‘estiladas’, en lugar de prevenir los mecanismos que hacen posibles tales transformaciones.

Inspección Casual

Mientras que se han presentado propuestas para utilizar métodos de blockchain para autenticar la verdadera procedencia y apariencia de una imagen de origen que puede haber sido incluida posteriormente en un conjunto de datos de entrenamiento, esto no evita en sí mismo el entrenamiento de imágenes, ni proporciona una forma de probar, a partir de la salida de dichos sistemas, que las imágenes se incluyeron en el conjunto de datos de entrenamiento.

En un enfoque de marca de agua para excluir imágenes del entrenamiento, sería importante no confiar en que las imágenes de origen de un conjunto de datos influyente estén disponibles públicamente para inspección. En respuesta a los gritos de los artistas sobre la ingesta liberal de su trabajo por parte de Stable Diffusion, el sitio web haveibeentrained.com permite a los usuarios subir imágenes y verificar si es probable que hayan sido incluidas en el conjunto de datos LAION5B que alimenta a Stable Diffusion:

'Lenna', literalmente la chica de la portada para la investigación de visión por computadora hasta hace poco, es ciertamente una contribuyente a Stable Diffusion. Fuente: https://haveibeentrained.com/

‘Lenna’, literalmente la chica de la portada para la investigación de visión por computadora hasta hace poco, es ciertamente una contribuyente a Stable Diffusion. Fuente: https://haveibeentrained.com/

Sin embargo, casi todos los conjuntos de datos de deepfake tradicionales, por ejemplo, se extraen casualmente de video y imágenes de Internet en bases de datos no públicas donde solo algún tipo de marca de agua neuralmente resistente podría exponer el uso de imágenes específicas para crear imágenes y video derivados.

Además, los usuarios de Stable Diffusion están comenzando a agregar contenido – ya sea a través de la fine-tuning (continuando el entrenamiento del punto de referencia oficial del modelo con pares de imagen/texto adicionales) o la Inversión Textual, que agrega un elemento o persona específicos – que no aparecerá en ninguna búsqueda a través de las miles de millones de imágenes de LAION.

Incrustación de Marcas de Agua en el Origen

Una aplicación potencial aún más extrema de la marca de agua de imagen de origen es incluir información oculta y no obvia en la salida de captura cruda, video o imágenes, de cámaras comerciales. Aunque el concepto se experimentó y se implementó con cierta energía en la década de 2000, como respuesta a la amenaza emergente de la piratería de multimedia, el principio es técnicamente aplicable también para hacer que el contenido de los medios sea resistente o repelente a los sistemas de aprendizaje automático.

Una implementación, planteada en una solicitud de patente de finales de la década de 1990, propuso utilizar Transformadas de Coseno Discreto para incrustar ‘subimágenes’ esteganográficas en video y imágenes fijas, sugiriendo que la rutina podría ser ‘incorporada como una característica integrada para dispositivos de grabación digital, como cámaras fijas y de video’.

En una solicitud de patente de finales de la década de 1990, Lenna está imbuida con marcas de agua ocultas que pueden recuperarse según sea necesario. Fuente: https://www.freepatentsonline.com/6983057.pdf

En una solicitud de patente de finales de la década de 1990, Lenna está imbuida con marcas de agua ocultas que pueden recuperarse según sea necesario. Fuente: https://www.freepatentsonline.com/6983057.pdf

Un enfoque menos sofisticado es imponer marcas de agua claramente visibles en las imágenes a nivel de dispositivo – una característica que no es atractiva para la mayoría de los usuarios y es redundante en el caso de artistas y profesionales de los medios, que pueden proteger los datos de origen y agregar su propia marca o prohibiciones según lo consideren oportuno (no menos, las empresas de imágenes de stock).

Aunque al menos una cámara actualmente permite la imposición opcional de marcas de agua basadas en logotipos que podrían señalar el uso no autorizado en un modelo de IA derivado, la eliminación de logotipos a través de la IA se está volviendo bastante trivial, y incluso comercializada casualmente.

 

Publicado por primera vez el 25 de septiembre de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai