Ángulo de Anderson

Los Deepfakes más pequeños pueden ser la mayor amenaza

mm
Añade Unite.AI a tus fuentes preferidas en Google
Public domain images + Flux.1 Kontext Pro and Adobe Firefly

Las herramientas de inteligencia artificial conversacional, como ChatGPT y Google Gemini, ahora se utilizan para crear deepfakes que no intercambian caras, sino que, de manera más sutil, pueden reescribir toda la historia dentro de una imagen. Al cambiar gestos, objetos y fondos, estas ediciones engañan tanto a los detectores de inteligencia artificial como a los humanos, lo que aumenta las apuestas para detectar lo que es real en línea.

 

En el clima actual, particularmente después de la legislación significativa como la ley TAKE IT DOWN, muchos de nosotros asociamos los deepfakes y la síntesis de identidad impulsada por inteligencia artificial con el porno no consensuado y la manipulación política – en general, distorsiones groseras de la verdad.

Esto nos acostumbra a esperar que las imágenes manipuladas por inteligencia artificial siempre estén dirigidas a contenido de alto riesgo, donde la calidad de la representación y la manipulación del contexto pueden lograr un golpe de credibilidad, al menos a corto plazo.

Historicamente, sin embargo, alteraciones mucho más sutiles han tenido a menudo un efecto más siniestro y duradero – como la habilidad fotográfica de vanguardia que permitió a Stalin eliminar a aquellos que habían caído en desgracia del registro fotográfico, como se satiriza en la novela de George Orwell 1984, donde el protagonista Winston Smith pasa sus días reescribiendo la historia y teniendo fotos creadas, destruidas y ‘enmendadas’.

En el siguiente ejemplo, el problema con la segunda imagen es que ‘no sabemos lo que no sabemos’ – que el ex jefe de la policía secreta de Stalin, Nikolai Yezhov, solía ocupar el espacio donde ahora solo hay una barrera de seguridad:

Ahora lo ves, ahora no... La manipulación fotográfica de la era de Stalin elimina a un miembro del partido desacreditado de la historia. Fuente: Dominio público, a través de https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

Ahora lo ves, ahora no… La manipulación fotográfica de la era de Stalin elimina a un miembro del partido desacreditado de la historia. Fuente: Dominio público, a través de https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

Corrientes de este tipo, repetidas con frecuencia, persisten de muchas maneras; no solo culturalmente, sino también en la visión por computadora, que deriva tendencias de temas y motivos estadísticamente dominantes en los conjuntos de datos de entrenamiento. Para dar un ejemplo, el hecho de que los teléfonos inteligentes hayan reducido la barrera de entrada y masivamente reducido el costo de la fotografía, significa que su iconografía se ha asociado inevitablemente con muchos conceptos abstractos, incluso cuando esto no es apropiado.

Si el deepfaking convencional se puede percibir como un acto de ‘agresión’, las alteraciones perniciosas y persistentes en los medios audiovisuales son más similares a ‘manipulación’. Además, la capacidad de este tipo de deepfaking para pasar desapercibido hace que sea difícil identificarlo a través de sistemas de detección de deepfakes de vanguardia (que buscan cambios groseros). Este enfoque es más similar a la erosión del agua que desgasta la roca durante un período sostenido, que a una roca lanzada a la cabeza.

MultiFakeVerse

Los investigadores de Australia han hecho un intento por abordar la falta de atención a los ‘sutiles’ deepfakes en la literatura, curando un nuevo conjunto de datos sustancial de manipulaciones de imágenes centradas en personas que alteran el contexto, la emoción y la narrativa sin cambiar la identidad central del sujeto:

Muestras del nuevo conjunto de datos, pares de reales y falsos, con algunas alteraciones más sutiles que otras. Tenga en cuenta, por ejemplo, la pérdida de autoridad de la mujer asiática, en la esquina inferior derecha, ya que su estetoscopio de médico es eliminado por la inteligencia artificial. Al mismo tiempo, la sustitución del bloc de notas del médico por la pizarra no tiene un ángulo semántico obvio. Fuente: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview

Muestras del nuevo conjunto de datos, pares de reales y falsos, con algunas alteraciones más sutiles que otras. Fuente: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview

Titulado MultiFakeVerse, el conjunto de datos consiste en 845,826 imágenes generadas a través de modelos de lenguaje de visión (VLM), que pueden ser accesados en línea y descargados, con permiso.

Los autores afirman:

‘Este enfoque basado en VLM permite alteraciones semánticas y conscientes del contexto, como modificar acciones, escenas y interacciones entre humanos y objetos, en lugar de intercambios de identidad sintéticos o ediciones de bajo nivel y específicas de región que son comunes en los conjuntos de datos existentes.

‘Nuestros experimentos revelan que los actuales modelos de detección de deepfakes y los observadores humanos luchan por detectar estas manipulaciones sutiles pero significativas.’

Los investigadores probaron tanto a humanos como a sistemas de detección de deepfakes líderes en su nuevo conjunto de datos para ver qué tan bien se podían identificar estas manipulaciones sutiles. Los participantes humanos lucharon, clasificando correctamente las imágenes como reales o falsas solo alrededor del 62% del tiempo, y tuvieron aún más dificultad para determinar qué partes de la imagen habían sido alteradas.

Los detectores de deepfakes existentes, entrenados en su mayoría en conjuntos de datos de intercambio de caras o inpainting más obvios, también funcionaron mal, a menudo fallando al registrar que se había producido alguna manipulación. Incluso después de ajustar en MultiFakeVerse, las tasas de detección permanecieron bajas, lo que demuestra cómo los sistemas actuales manejan mal estos ediciones narrativas impulsadas.

El nuevo artículo se titula Multiverse a través de deepfakes: El conjunto de datos MultiFakeVerse de manipulaciones visuales y conceptuales centradas en personas, y proviene de cinco investigadores de la Universidad de Monash en Melbourne y la Universidad de Curtin en Perth. El código y los datos relacionados se han publicado en GitHub, además de la alojamiento de Hugging Face mencionado anteriormente.

Método

El conjunto de datos MultiFakeVerse se construyó a partir de cuatro conjuntos de imágenes del mundo real que presentan a personas en diversas situaciones: EMOTIC; PISC, PIPA, y PIC 2.0. Comenzando con 86,952 imágenes originales, los investigadores produjeron 758,041 versiones manipuladas.

Los marcos Gemini-2.0-Flash y ChatGPT-4o se utilizaron para proponer seis ediciones mínimas para cada imagen – ediciones diseñadas para alterar sutilmente cómo se percibiría la persona más prominente en la imagen por parte de un espectador.

Los modelos se instruyeron para generar modificaciones que harían que el sujeto pareciera ingenuo, orgulloso, arrepentido, inexperimentado, o despreocupado, o para ajustar algún elemento factual dentro de la escena. Junto con cada edición, los modelos también produjeron una expresión de referencia para identificar claramente el objetivo de la modificación, asegurando que el proceso de edición posterior pudiera aplicar cambios a la persona o objeto correcto dentro de cada imagen.

Los autores aclaran:

‘Tenga en cuenta que expresión de referencia es un dominio ampliamente explorado en la comunidad, que significa una frase que puede desambiguar el objetivo en una imagen, por ejemplo, para una imagen con dos hombres sentados en un escritorio, uno hablando por teléfono y el otro mirando documentos, una expresión de referencia adecuada del último sería el hombre de la izquierda sosteniendo un papel.’

Una vez definidas las ediciones, la manipulación de la imagen real se llevó a cabo mediante la instrucción a los modelos de lenguaje de visión para aplicar los cambios especificados mientras dejaban intacto el resto de la escena. Los investigadores probaron tres sistemas para esta tarea: GPT-Image-1; Gemini-2.0-Flash-Image-Generation; y ICEdit.

Después de generar veintidós mil imágenes de muestra, Gemini-2.0-Flash emergió como el método más consistente, produciendo ediciones que se mezclaban naturalmente con la escena sin introducir artefactos visibles; ICEdit a menudo produjo falsificaciones más obvias, con defectos notables en las regiones alteradas; y GPT-Image-1 ocasionalmente afectó partes no deseadas de la imagen, en parte debido a su conformidad con relaciones de aspecto de salida fijas.

Análisis de imágenes

Cada imagen manipulada se comparó con su original para determinar cuánto de la imagen había sido alterada. Las diferencias a nivel de píxel entre las dos versiones se calcularon, con ruido aleatorio pequeño filtrado para centrarse en ediciones significativas. En algunas imágenes, solo se vieron afectadas áreas pequeñas; en otras, hasta ochenta por ciento de la escena se modificó.

Para evaluar cuánto cambió el significado de cada imagen a la luz de estas alteraciones, se generaron subtítulos para las imágenes originales y manipuladas utilizando el modelo de lenguaje de visión ShareGPT-4V.

Estos subtítulos se convirtieron en incrustaciones utilizando Long-CLIP, lo que permitió una comparación de cuánto había divergido el contenido entre versiones. Los cambios semánticos más fuertes se observaron en casos donde los objetos cercanos a o directamente relacionados con la persona habían sido alterados, ya que estos pequeños ajustes podían cambiar significativamente la forma en que se interpretaba la imagen.

Gemini-2.0-Flash se utilizó para clasificar el tipo de manipulación aplicada a cada imagen, en función de dónde y cómo se realizaron las ediciones. Las manipulaciones se agruparon en tres categorías: edición a nivel de persona implicaba cambios en la expresión facial del sujeto, postura, mirada, ropa u otros rasgos personales; edición a nivel de objeto afectaba a los objetos conectados a la persona, como los objetos que sostenían o interactuaban con en el primer plano; y edición a nivel de escena implicaba elementos de fondo o aspectos más amplios de la configuración que no involucraban directamente a la persona.

La tubería de generación del conjunto de datos MultiFakeVerse comienza con imágenes reales, donde los modelos de lenguaje de visión proponen ediciones narrativas que apuntan a personas, objetos o escenas. Estas instrucciones se aplican luego mediante modelos de edición de imágenes. El panel derecho muestra la proporción de manipulaciones a nivel de persona, objeto y escena en todo el conjunto de datos. Fuente: https://arxiv.org/pdf/2506.00868

La tubería de generación del conjunto de datos MultiFakeVerse comienza con imágenes reales, donde los modelos de lenguaje de visión proponen ediciones narrativas que apuntan a personas, objetos o escenas. Fuente: https://arxiv.org/pdf/2506.00868

Dado que las imágenes individuales podían contener varios tipos de ediciones al mismo tiempo, se mapeó la distribución de estas categorías en todo el conjunto de datos. Aproximadamente un tercio de las ediciones se dirigieron solo a la persona, alrededor de una quinta afectaron solo a la escena, y alrededor de una sexta se limitaron a los objetos.

Evaluación del impacto perceptual

Gemini-2.0-Flash se utilizó para evaluar cómo podrían alterar las manipulaciones la percepción del espectador en seis áreas: emoción, identidad personal, dinámica de poder, narrativa de la escena, intención de la manipulación y preocupaciones éticas.

Para emoción, las ediciones a menudo se describieron con términos como alegre, atractivo o accesible, lo que sugiere cambios en la forma en que los sujetos se enmarcan emocionalmente. En términos narrativos, palabras como profesional o diferente indicaron cambios en la historia o la configuración implícita:

Gemini-2.0-Flash se instruyó para evaluar cómo cada manipulación afectó seis aspectos de la percepción del espectador. Izquierda: estructura de ejemplo de la instrucción que guía la evaluación del modelo. Derecha: nubes de palabras que resumen los cambios en emoción, identidad, narrativa de la escena, intención, dinámica de poder y preocupaciones éticas en todo el conjunto de datos.

Gemini-2.0-Flash se instruyó para evaluar cómo cada manipulación afectó seis aspectos de la percepción del espectador.

Las descripciones de los cambios de identidad incluyeron términos como más joven, juguetón y vulnerable, lo que muestra cómo los cambios menores podían influir en la forma en que se percibían a los individuos. La intención detrás de muchas ediciones se etiquetó como persuasiva, engañosa o estética. Si bien la mayoría de las ediciones se juzgaron como que planteaban solo preocupaciones éticas leves, una pequeña fracción se vio como que llevaba implicaciones éticas moderadas o graves.

Ejemplos del conjunto de datos MultiFakeVerse que muestran cómo los pequeños ediciones cambian la percepción del espectador. Las cajas amarillas resaltan las regiones alteradas, con análisis adjunto de los cambios en emoción, identidad, narrativa y preocupaciones éticas.

Ejemplos del conjunto de datos MultiFakeVerse que muestran cómo los pequeños ediciones cambian la percepción del espectador.

Métricas

La calidad visual del conjunto de datos MultiFakeVerse se evaluó utilizando tres métricas estándar: Relación de señal a ruido pico (PSNR); Índice de similitud estructural (SSIM); y Distancia de Fréchet de Inception (FID):

Puntuaciones de calidad de imagen para MultiFakeVerse medidas por PSNR, SSIM y FID.

Puntuaciones de calidad de imagen para MultiFakeVerse medidas por PSNR, SSIM y FID.

La puntuación SSIM de 0.5774 refleja un grado moderado de similitud, coherente con el objetivo de preservar la mayor parte de la imagen mientras se aplican ediciones dirigidas; la puntuación FID de 3.30 sugiere que las imágenes generadas mantienen una alta calidad y diversidad; y un valor PSNR de 66.30 decibelios indica que las imágenes retienen una buena fidelidad visual después de la manipulación.

Estudio de usuario

Se realizó un estudio de usuario para ver qué tan bien las personas podían detectar los falsos sutiles en MultiFakeVerse. Dieciocho participantes se les mostraron cincuenta imágenes, divididas equitativamente entre ejemplos reales y manipulados que cubrían una variedad de tipos de edición. Cada persona se le pidió que clasificara si la imagen era real o falsa, y, si falsa, para identificar qué tipo de manipulación se había aplicado.

La precisión general para decidir entre real y falso fue del 61.67 por ciento, lo que significa que los participantes malclasificaron las imágenes más de un tercio del tiempo.

Los autores afirman:

‘Al analizar las predicciones humanas de los niveles de manipulación para las imágenes falsas, se encontró que la intersección promedio sobre la unión entre las predicciones y los niveles de manipulación reales fue del 24.96%.

‘Esto muestra que no es trivial para los observadores humanos identificar las regiones de manipulación en nuestro conjunto de datos.’

La creación del conjunto de datos MultiFakeVerse requirió recursos computacionales extensos: para generar instrucciones de edición, se realizaron más de 845,000 llamadas a la API a los modelos Gemini y GPT, con estas tareas de instrucción costando alrededor de $1000; producir las imágenes basadas en Gemini costó aproximadamente $2,867; y generar imágenes utilizando GPT-Image-1 costó alrededor de $200. Las imágenes de ICEdit se crearon localmente en una GPU NVIDIA A6000, completando la tarea en aproximadamente veinticuatro horas.

Pruebas

Antes de las pruebas, el conjunto de datos se dividió en conjuntos de entrenamiento, validación y prueba dividiendo primero el 70% de las imágenes reales para el entrenamiento; el 10% para la validación; y el 20% para la prueba. Las imágenes manipuladas generadas a partir de cada imagen real se asignaron al mismo conjunto que su imagen original.

Más ejemplos de contenido real (izquierda) y alterado (derecha) del conjunto de datos.

Más ejemplos de contenido real (izquierda) y alterado (derecha) del conjunto de datos.

El rendimiento en la detección de falsos se midió utilizando la precisión a nivel de imagen (si el sistema clasifica correctamente toda la imagen como real o falsa) y puntuaciones F1. Para la localización de regiones manipuladas, la evaluación utilizó Área bajo la curva (AUC), puntuaciones F1 y intersección sobre la unión (IoU).

El conjunto de datos MultiFakeVerse se utilizó contra los sistemas de detección de deepfakes líderes en el conjunto de prueba completo, con los marcos rivales siendo CnnSpot; AntifakePrompt; TruFor; y el basado en lenguaje de visión SIDA. Cada modelo se evaluó primero en modo de disparo cero, utilizando sus pesos preentrenados originales sin ajuste adicional.

Dos modelos, CnnSpot y SIDA, se ajustaron en los datos de entrenamiento de MultiFakeVerse para evaluar si el ajuste mejoraba el rendimiento.

Resultados de detección de deepfakes en MultiFakeVerse bajo condiciones de disparo cero y ajuste. Los números entre paréntesis muestran los cambios después del ajuste.

Resultados de detección de deepfakes en MultiFakeVerse bajo condiciones de disparo cero y ajuste.

De estos resultados, los autores afirman:

‘[Los] modelos entrenados en falsificaciones de inpainting anteriores luchan por identificar nuestras falsificaciones basadas en edición de VLM, particularmente, CNNSpot tiende a clasificar casi todas las imágenes como reales. AntifakePrompt tiene el mejor rendimiento de disparo cero con una precisión promedio de clasificación de 66.87% y una puntuación F1 de 55.55%.

‘Después de ajustar en nuestro conjunto de entrenamiento, observamos una mejora en el rendimiento en ambos CNNSpot y SIDA-13B, con CNNSpot superando a SIDA-13B en términos de precisión promedio de clasificación (por 1.92%) y puntuación F1 (por 1.97%).’

SIDA-13B se evaluó en MultiFakeVerse para medir con qué precisión podría localizar las regiones manipuladas dentro de cada imagen. El modelo se probó tanto en modo de disparo cero como después de ajustar en el conjunto de datos.

En su estado original, alcanzó una puntuación de intersección sobre la unión de 13.10, una puntuación F1 de 19.92 y una AUC de 14.06, lo que refleja un rendimiento de localización débil.

Después del ajuste, las puntuaciones mejoraron a 24.74 para IoU, 39.40 para F1 y 37.53 para AUC. Sin embargo, incluso con el entrenamiento adicional, el modelo todavía tuvo dificultades para encontrar exactamente dónde se habían realizado las ediciones, lo que destaca lo difícil que puede ser detectar este tipo de cambios pequeños y dirigidos.

Conclusión

El nuevo estudio expone un punto ciego tanto en la percepción humana como en la máquina: mientras que gran parte del debate público sobre los deepfakes se ha centrado en intercambios de identidad llamativos, estos ‘edits narrativos’ más silenciosos son más difíciles de detectar y potencialmente más corrosivos a largo plazo.

À medida que los sistemas como ChatGPT y Gemini asumen un papel más activo en la generación de este tipo de contenido, y à medida que nosotros mismos participamos cada vez más en alterar la realidad de nuestros propios flujos de fotos, los modelos de detección que confían en detectar manipulaciones burdas pueden ofrecer una defensa inadecuada.

Lo que MultiFakeVerse demuestra no es que la detección haya fallado, sino que al menos parte del problema puede estar cambiando a una forma más difícil y lenta: una en la que las pequeñas mentiras visuales se acumulan sin ser detectadas.

 

Publicado por primera vez el jueves 5 de junio de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]