Ángulo de Anderson

JPEG AI difumina la línea entre imágenes reales y sintéticas

mm
Añade Unite.AI a tus fuentes preferidas en Google
Created with ChatGPT-4o and Adobe Firefly

En febrero de este año, se publicó el estándar internacional JPEG AI, después de varios años de investigación dirigida a utilizar técnicas de aprendizaje automático para producir un códec de imagen más pequeño y fácil de transmitir y almacenar, sin pérdida de calidad perceptual.

De la publicación oficial de JPEG AI, una comparación entre la Relación Señal-Ruido Pico (PSNR) y el enfoque de aprendizaje automático de JPEG AI. Fuente: https://jpeg.org/jpegai/documentation.html

De la publicación oficial de JPEG AI, una comparación entre la Relación Señal-Ruido Pico (PSNR) y el enfoque de aprendizaje automático de JPEG AI. Fuente: https://jpeg.org/jpegai/documentation.html

Una posible razón por la que este avance hizo pocos titulares es que los PDF básicos para este anuncio no estaban disponibles a través de portales de acceso libre como Arxiv. Sin embargo, Arxiv ya había presentado varios estudios que examinaban la importancia de JPEG AI en varios aspectos, incluidos los artefactos de compresión poco comunes del método y su importancia para la forensia.

Un estudio comparó los artefactos de compresión, incluidos los de un borrador anterior de JPEG AI, y encontró que el nuevo método tenía tendencia a difuminar el texto, lo que no es un asunto menor en casos donde el códec podría contribuir a una cadena de evidencia. Fuente: https://arxiv.org/pdf/2411.06810

Un estudio comparó los artefactos de compresión, incluidos los de un borrador anterior de JPEG AI, y encontró que el nuevo método tenía tendencia a difuminar el texto, lo que no es un asunto menor en casos donde el códec podría contribuir a una cadena de evidencia. Fuente: https://arxiv.org/pdf/2411.06810

Debido a que JPEG AI altera las imágenes de maneras que imitan los artefactos de los generadores de imágenes sintéticas, las herramientas forenses existentes tienen dificultades para diferenciar la imaginería real de la falsa:

Después de la compresión JPEG AI, los algoritmos de vanguardia ya no pueden separar de manera confiable el contenido auténtico de las regiones manipuladas en mapas de localización, según un artículo reciente (marzo de 2025). Las imágenes de ejemplo que se ven a la izquierda son imágenes manipuladas/falsas, donde las regiones manipuladas están claramente delineadas bajo técnicas forenses estándar (imagen del centro). Sin embargo, la compresión JPEG AI presta a las imágenes falsas una capa de credibilidad (imagen de la derecha). Fuente: https://arxiv.org/pdf/2412.03261

Después de la compresión JPEG AI, los algoritmos de vanguardia ya no pueden separar de manera confiable el contenido auténtico de las regiones manipuladas en mapas de localización, según un artículo reciente (marzo de 2025). Las imágenes de ejemplo que se ven a la izquierda son imágenes manipuladas/falsas, donde las regiones manipuladas están claramente delineadas bajo técnicas forenses estándar (imagen del centro). Sin embargo, la compresión JPEG AI presta a las imágenes falsas una capa de credibilidad (imagen de la derecha). Fuente: https://arxiv.org/pdf/2412.03261

Una razón es que JPEG AI se entrena utilizando una arquitectura de modelo similar a la utilizada por los sistemas generativos que las herramientas forenses pretenden detectar:

El nuevo artículo ilustra la similitud entre las metodologías de la compresión de imágenes impulsada por IA y las imágenes generadas por IA reales. Fuente: https://arxiv.org/pdf/2504.03191

El nuevo artículo ilustra la similitud entre las metodologías de la compresión de imágenes impulsada por IA y las imágenes generadas por IA reales. Fuente: https://arxiv.org/pdf/2504.03191

Por lo tanto, ambos modelos pueden producir algunas características visuales subyacentes similares, desde un punto de vista forense.

Cuantización

Este cruce ocurre debido a la cuantización, común a ambas arquitecturas, y que se utiliza en el aprendizaje automático tanto como un método de conversión de datos continuos en puntos de datos discretos, y como una técnica de optimización que puede reducir significativamente el tamaño del archivo de un modelo entrenado (los entusiastas de la síntesis de imágenes de IA estarán familiarizados con la espera entre una versión oficial poco manejable y una versión cuantizada por la comunidad que puede ejecutarse en hardware local).

En este contexto, la cuantización se refiere al proceso de convertir los valores continuos en la representación latente de la imagen en pasos fijos y discretos. JPEG AI utiliza este proceso para reducir la cantidad de datos necesarios para almacenar o transmitir una imagen, simplificando la representación numérica interna.

Aunque la cuantización hace que la codificación sea más eficiente, también impone regularidades estructurales que pueden parecerse a los artefactos dejados por los modelos generativos, lo suficientemente sutiles como para evadir la percepción, pero disruptivos para las herramientas forenses.

En respuesta, los autores de un nuevo trabajo titulado Tres pistas forenses para imágenes JPEG AI proponen técnicas no neuronales e interpretables que detectan la compresión JPEG AI; determinan si una imagen ha sido recomprimida; y distinguen entre imágenes reales comprimidas y aquellas generadas enteramente por IA.

Método

Correlaciones de color

El artículo propone tres ‘pistas forenses’ personalizadas para imágenes JPEG AI: correlaciones de canal de color, introducidas durante los pasos de preprocesamiento de JPEG AI; distorsiones medibles en la calidad de la imagen a lo largo de compresiones repetidas que revelan eventos de recompresión; y patrones de cuantización en el espacio latente que ayudan a distinguir entre imágenes comprimidas por JPEG AI y aquellas generadas por modelos de IA.

En cuanto al enfoque basado en correlaciones de color, la tubería de preprocesamiento de JPEG AI introduce dependencias estadísticas entre los canales de color de la imagen, creando una firma que puede servir como una pista forense.

JPEG AI convierte imágenes RGB al espacio de color YUV y realiza una subsampling de croma 4:2:0, que implica reducir la crominancia antes de la compresión. Este proceso conduce a correlaciones sutiles entre los residuos de alta frecuencia de los canales rojo, verde y azul, correlaciones que no están presentes en imágenes no comprimidas y que difieren en fuerza de las producidas por la compresión JPEG tradicional o los generadores de imágenes sintéticas.

Una comparación de cómo la compresión JPEG AI altera las correlaciones de color en las imágenes, utilizando el canal rojo como ejemplo. El panel (a) compara imágenes no comprimidas con imágenes comprimidas con JPEG AI, mostrando que la compresión aumenta significativamente la correlación entre canales. El panel (b) aísla el efecto del preprocesamiento de JPEG AI, solo la conversión de color y la subsampling, demostrando que incluso este paso solo aumenta las correlaciones de manera notable. El panel (c) muestra que la compresión JPEG tradicional también aumenta las correlaciones ligeramente, pero no en el mismo grado. El panel (d) examina imágenes sintéticas, con Midjourney-V5 y Firefly mostrando aumentos de correlación moderados, mientras que otros permanecen más cerca de los niveles no comprimidos.

Una comparación de cómo la compresión JPEG AI altera las correlaciones de color en las imágenes..

Arriba podemos ver una comparación del artículo que ilustra cómo la compresión JPEG AI altera las correlaciones de color en las imágenes, utilizando el canal rojo como ejemplo.

El panel A compara imágenes no comprimidas con imágenes comprimidas con JPEG AI, mostrando que la compresión aumenta significativamente la correlación entre canales; el panel B aísla el efecto del preprocesamiento de JPEG AI, solo la conversión de color y la subsampling, demostrando que incluso este paso solo aumenta las correlaciones de manera notable; el panel C muestra que la compresión JPEG tradicional también aumenta las correlaciones ligeramente, pero no en el mismo grado; y el panel D examina imágenes sintéticas, con Midjourney-V5 y Adobe Firefly mostrando aumentos de correlación moderados, mientras que otros permanecen más cerca de los niveles no comprimidos.

Tasa de distorsión

La pista de tasa de distorsión identifica la recompresión JPEG AI al rastrear cómo la calidad de la imagen, medida por Relación Señal-Ruido Pico (PSNR), disminuye en un patrón predecible a lo largo de múltiples pasos de compresión.

La investigación sostiene que comprimir repetidamente una imagen con JPEG AI conduce a pérdidas progresivamente más pequeñas, pero aún medibles, en la calidad de la imagen, cuantificadas por PSNR, y que este deterioro gradual forma la base de una pista forense para detectar si una imagen ha sido recomprimida.

A diferencia de la compresión JPEG tradicional, donde los métodos anteriores rastreaban cambios en bloques de imagen específicos, JPEG AI requiere un enfoque diferente, debido a su arquitectura de compresión neuronal; por lo tanto, los autores proponen monitorear cómo evoluciona tanto la tasa de bits como el PSNR a lo largo de compresiones sucesivas. Cada ronda de compresión altera la imagen menos que la anterior, y este cambio disminuido (al trazarlo contra la tasa de bits) puede revelar si una imagen ha pasado por múltiples etapas de compresión:

Una ilustración de cómo la compresión repetida afecta la calidad de la imagen en diferentes códecs muestra que JPEG AI y un códec neuronal desarrollado en https://arxiv.org/pdf/1802.01436 ambos exhiben una disminución constante en PSNR con cada compresión adicional, incluso a tasas de bits más bajas. En contraste, la compresión JPEG tradicional mantiene una calidad relativamente estable en múltiples compresiones, a menos que la tasa de bits sea alta. Este patrón sirve como un ejemplo de cómo la recompresión deja una huella medible en códecs basados en IA, ofreciendo una señal forense potencial.

Una ilustración de cómo la compresión repetida afecta la calidad de la imagen en diferentes códecs, con resultados de JPEG AI y un códec neuronal desarrollado en https://arxiv.org/pdf/1802.01436; ambos exhiben una disminución constante en PSNR con cada compresión adicional, incluso a tasas de bits más bajas. En contraste, la compresión JPEG tradicional mantiene una calidad relativamente estable en múltiples compresiones, a menos que la tasa de bits sea alta.

En la imagen de arriba, vemos curvas de tasa de distorsión trazadas para JPEG AI; un segundo códec basado en IA; y la compresión JPEG tradicional, encontrando que JPEG AI y el códec neuronal muestran una disminución constante en PSNR en todas las tasas de bits, mientras que la compresión JPEG tradicional solo muestra un deterioro notable en tasas de bits más altas. Este comportamiento proporciona una señal cuantificable que se puede utilizar para marcar imágenes JPEG AI recomprimidas.

Al extraer cómo evoluciona la tasa de bits y la calidad de la imagen a lo largo de múltiples rondas de compresión, los autores construyeron de manera similar una firma que ayuda a marcar si una imagen ha sido recomprimida, brindando una pista forense práctica en el contexto de JPEG AI.

Cuantización

Como vimos anteriormente, uno de los problemas forenses más desafiantes planteado por JPEG AI es su similitud visual con imágenes sintéticas generadas por modelos de difusión. Ambos sistemas utilizan arquitecturas de codificador-decodificador que procesan imágenes en un espacio latente comprimido y a menudo dejan atrás artefactos de muestreo sutiles.

Estos rasgos compartidos pueden confundir a los detectores – incluso aquellos reentrenados en imágenes JPEG AI. Sin embargo, una diferencia estructural clave permanece: JPEG AI aplica la cuantización, un paso que redondea los valores latentes a niveles discretos para una compresión eficiente, mientras que los modelos generativos normalmente no lo hacen.

El nuevo artículo utiliza esta distinción para diseñar una pista forense que indirectamente prueba la presencia de cuantización. El método analiza cómo la representación latente de una imagen responde al redondeo, asumiendo que si una imagen ya ha sido cuantizada, su estructura latente exhibirá un patrón medible de alineación con valores redondeados.

Estos patrones, aunque invisibles para el ojo, producen diferencias estadísticas que pueden ayudar a separar imágenes reales comprimidas de las completamente sintéticas.

Un ejemplo de espectros de Fourier promedio revela que tanto las imágenes comprimidas con JPEG AI como las generadas por modelos de difusión como Midjourney-V5 y Stable Diffusion XL exhiben patrones de rejilla regulares en el dominio de frecuencia – artefactos comúnmente vinculados a la sobremuestreo. En contraste, las imágenes reales carecen de estos patrones. Esta superposición en la estructura espectral ayuda a explicar por qué las herramientas forenses a menudo confunden imágenes reales comprimidas con las sintéticas.

Un ejemplo de espectros de Fourier promedio revela que tanto las imágenes comprimidas con JPEG AI como las generadas por modelos de difusión como Midjourney-V5 y Stable Diffusion XL exhiben patrones de rejilla regulares en el dominio de frecuencia – artefactos comúnmente vinculados a la sobremuestreo. En contraste, las imágenes reales carecen de estos patrones. Esta superposición en la estructura espectral ayuda a explicar por qué las herramientas forenses a menudo confunden imágenes reales comprimidas con las sintéticas.

Es importante destacar que los autores muestran que esta pista funciona en diferentes modelos generativos y sigue siendo efectiva incluso cuando la compresión es lo suficientemente fuerte como para anular secciones enteras del espacio latente. En contraste, las imágenes sintéticas muestran respuestas mucho más débiles a esta prueba de redondeo, ofreciendo una forma práctica de distinguir entre ambas.

El resultado está destinado a ser una herramienta ligera e interpretable que apunta a la diferencia central entre la compresión y la generación, en lugar de confiar en artefactos superficiales frágiles.

Datos y pruebas

Compresión

Para evaluar si su pista de correlación de color podría detectar de manera confiable la compresión JPEG AI (es decir, un primer paso desde la fuente no comprimida), los autores probaronla en imágenes de alta calidad no comprimidas del conjunto de datos RAISE, comprimiéndolas a varias tasas de bits, utilizando la implementación de referencia de JPEG AI.

Entrenaron un bosque aleatorio en los patrones estadísticos de las correlaciones de los canales de color (particularmente cómo el ruido residual en cada canal se alineaba con los demás) y lo compararon con una Red Neuronal ResNet50 entrenada directamente en los píxeles de la imagen.

Precisión de detección de la compresión JPEG AI utilizando características de correlación de color, comparada en varias tasas de bits. El método es más efectivo a tasas de bits más bajas, donde los artefactos de compresión son más fuertes, y muestra una mejor generalización a niveles de compresión no vistos que el modelo ResNet50 de referencia.

Precisión de detección de la compresión JPEG AI utilizando características de correlación de color, comparada en varias tasas de bits. El método es más efectivo a tasas de bits más bajas, donde los artefactos de compresión son más fuertes, y muestra una mejor generalización a niveles de compresión no vistos que el modelo ResNet50 de referencia.

Mientras que ResNet50 logró una mayor precisión cuando los datos de prueba se ajustaban estrechamente a sus condiciones de entrenamiento, luchó por generalizar a través de diferentes niveles de compresión. El enfoque basado en correlaciones, aunque mucho más simple, resultó más consistente a lo largo de las tasas de bits, especialmente a tasas de compresión más bajas donde el preprocesamiento de JPEG AI tiene un efecto más fuerte.

Estos resultados sugieren que, incluso sin aprendizaje profundo, es posible detectar la compresión JPEG AI utilizando pistas estadísticas que permanecen interpretables y resistentes.

Recompresión

Para evaluar si la recompresión JPEG AI puede ser detectada de manera confiable, los investigadores probaron la pista de tasa de distorsión en un conjunto de imágenes comprimidas a diversas tasas de bits – algunas solo una vez y otras una segunda vez utilizando JPEG AI.

Este método involucró extraer un vector de características de 17 dimensiones para rastrear cómo evolucionaba la tasa de bits y el PSNR de la imagen a lo largo de tres pasos de compresión. Este conjunto de características capturó cuánta calidad se perdió en cada paso y cómo se comportaban las tasas latentes y hiperprior—métricas que los métodos basados en píxeles no pueden acceder fácilmente.

Los investigadores entrenaron un bosque aleatorio en estas características y compararon su rendimiento con un ResNet50 entrenado en parches de imagen:

Resultados para la precisión de clasificación de un bosque aleatorio entrenado en características de tasa de distorsión para detectar si una imagen JPEG AI ha sido recomprimida. El método funciona mejor cuando la compresión inicial es fuerte (es decir, a tasas de bits más bajas), y luego supera consistentemente a un ResNet50 basado en píxeles – especialmente en casos donde la segunda compresión es más suave que la primera.

Resultados para la precisión de clasificación de un bosque aleatorio entrenado en características de tasa de distorsión para detectar si una imagen JPEG AI ha sido recomprimida. El método funciona mejor cuando la compresión inicial es fuerte (es decir, a tasas de bits más bajas), y luego supera consistentemente a un ResNet50 basado en píxeles – especialmente en casos donde la segunda compresión es más suave que la primera.

El bosque aleatorio resultó notablemente efectivo cuando la compresión inicial era fuerte (es decir, a tasas de bits más bajas), revelando diferencias claras entre imágenes comprimidas una y dos veces. Al igual que con la pista anterior, la iteración ResNet50 luchó por generalizar, particularmente cuando se probó en niveles de compresión que no había visto durante el entrenamiento.

Las características de tasa de distorsión, por otro lado, permanecieron estables en una amplia gama de escenarios. Destacó que el enfoque se generalizó más allá de JPEG AI, sugiriendo que el método es aplicable a otros códecs basados en IA.

JPEG AI y imágenes sintéticas

Para la ronda final de pruebas, los autores probaron si sus características basadas en cuantización pueden distinguir entre imágenes comprimidas con JPEG AI y imágenes completamente sintéticas generadas por modelos como Midjourney, Stable Diffusion, DALL-E 2, Glide, y Adobe Firefly.

Para esto, los investigadores utilizaron un subconjunto del conjunto de datos Synthbuster, mezclando fotografías reales del conjunto de datos RAISE con imágenes generadas por una variedad de modelos de difusión y basados en GAN.

Ejemplos de imágenes sintéticas en Synthbuster, generadas utilizando prompts de texto inspirados en fotografías naturales del conjunto de datos RAISE-1k. Las imágenes fueron creadas con varios modelos de difusión, con prompts diseñados para producir contenido y texturas fotorealistas en lugar de representaciones estilísticas o artísticas, reflejando el enfoque del conjunto de datos en probar métodos para distinguir imágenes reales de generadas.

Ejemplos de imágenes sintéticas en Synthbuster, generadas utilizando prompts de texto inspirados en fotografías naturales del conjunto de datos RAISE-1k. Las imágenes fueron creadas con varios modelos de difusión, con prompts diseñados para producir contenido y texturas fotorealistas en lugar de representaciones estilísticas o artísticas. Fuente: https://ieeexplore.ieee.org/document/10334046

Las imágenes reales se comprimieron utilizando JPEG AI a varios niveles de tasa de bits, y la clasificación se planteó como una tarea de dos vías: o JPEG AI versus un generador específico, o una tasa de bits específica versus Stable Diffusion XL.

Las características de cuantización (correlaciones extraídas de representaciones latentes) se calcularon a partir de una región fija de 256×256 y se alimentaron a un clasificador de bosque aleatorio. Como referencia, se entrenó un ResNet50 en parches de píxeles de los mismos datos.

Precisión de clasificación de un bosque aleatorio que utiliza características de cuantización para separar imágenes comprimidas con JPEG AI de imágenes sintéticas.

Precisión de clasificación de un bosque aleatorio que utiliza características de cuantización para separar imágenes comprimidas con JPEG AI de imágenes sintéticas.

A lo largo de la mayoría de las condiciones, el enfoque basado en cuantización superó al ResNet50 de referencia, particularmente a tasas de bits más bajas donde los artefactos de compresión eran más fuertes.

Los autores afirman:

‘El ResNet50 de referencia funciona mejor para imágenes Glide con una precisión del 66.1%, pero de lo contrario generaliza peor que las características de cuantización. Las características de cuantización exhiben una buena generalización a lo largo de la fuerza de compresión y los tipos de generadores.

‘La importancia de los coeficientes que se cuantizan a cero se muestra en el rendimiento muy respetable de los [características truncadas], que en muchos casos realizan un desempeño comparable al clasificador ResNet50.

‘Sin embargo, las características de cuantización que utilizan el vector entero sin truncar todavía funcionan notablemente mejor. Estos resultados confirman que la cantidad de ceros después de la cuantización es una pista importante para diferenciar entre imágenes comprimidas por IA y generadas por IA.

‘Sin embargo, también muestra que otros factores contribuyen. La precisión del vector completo para detectar JPEG AI es para todas las tasas de bits por encima del 91.0%, y una compresión más fuerte conduce a precisiones más altas.’

Una proyección del espacio de características utilizando UMAP mostró una separación clara entre imágenes JPEG AI y sintéticas, con tasas de bits más bajas que aumentan la distancia entre las clases. Un outlier consistente fue Glide, cuyas imágenes se agruparon de manera diferente y tuvieron la menor precisión de detección de cualquier generador probado.

Visualización bidimensional de UMAP de imágenes comprimidas con JPEG AI y sintéticas basadas en características de cuantización. La trama de la izquierda muestra que las tasas de bits más bajas de JPEG AI crean una mayor separación de las imágenes sintéticas; la trama de la derecha muestra cómo las imágenes de diferentes generadores se agrupan de manera distinta dentro del espacio de características.

Visualización bidimensional de UMAP de imágenes comprimidas con JPEG AI y sintéticas, basadas en características de cuantización. La trama de la izquierda muestra que las tasas de bits más bajas de JPEG AI crean una mayor separación de las imágenes sintéticas; la trama de la derecha muestra cómo las imágenes de diferentes generadores se agrupan de manera distinta dentro del espacio de características.

Finalmente, los autores evaluaron cómo se mantuvieron las características bajo el procesamiento posterior típico, como la recompresión JPEG o el cambio de tamaño de la imagen. Aunque el rendimiento disminuyó con un procesamiento más pesado, la caída fue gradual, sugiriendo que el enfoque retiene algo de robustez incluso en condiciones degradadas.

Evaluación de la robustez de las características de cuantización bajo el procesamiento posterior, incluyendo la recompresión JPEG (JPG) y el cambio de tamaño de la imagen (RS).

Evaluación de la robustez de las características de cuantización bajo el procesamiento posterior, incluyendo la recompresión JPEG (JPG) y el cambio de tamaño de la imagen (RS).

Conclusión

No está garantizado que JPEG AI disfrute de una adopción generalizada. Por un lado, hay suficiente deuda infraestructural como para imponer fricción en cualquier nuevo códec; y incluso un códec ‘convencional’ con un buen pedigrí y un consenso amplio sobre su valor, como AV1, tiene dificultades para desplazar métodos establecidos desde hace mucho tiempo.

En cuanto al potencial choque del sistema con los generadores de IA, los artefactos de cuantización característicos que ayudan a los detectores de IA actuales pueden disminuir o eventualmente reemplazarse por trazas de un tipo diferente en sistemas posteriores (asumiendo que los generadores de IA siempre dejarán un residuo forense, lo cual no es seguro).

Esto significaría que las características de cuantización propias de JPEG AI, quizás junto con otras pistas identificadas por el nuevo artículo, pueden no chocar con el rastro forense de los nuevos sistemas generativos de IA más efectivos.

Si, sin embargo, JPEG AI continúa operando como un ‘lavado de IA’ de facto, difuminando significativamente la distinción entre imágenes reales y generadas, sería difícil hacer un caso convincente para su adopción.

 

Publicado por primera vez el martes, 8 de abril de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai