Ángulo de Anderson
Disney Research Ofrece una Mejora en la Compresión de Imágenes Basada en Inteligencia Artificial – Pero Puede Alucinar Detalles

La rama de Investigación de Disney está ofreciendo un nuevo método de compresión de imágenes, aprovechando el modelo de difusión estable V1.2 de código abierto para producir imágenes más realistas a tasas de bits más bajas que los métodos competidores.

El método de compresión de Disney en comparación con los enfoques anteriores. Los autores afirman una mejor recuperación de detalles, mientras ofrecen un modelo que no requiere cientos de miles de dólares de capacitación, y que opera más rápido que el método competidor más cercano. Fuente: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf
El nuevo enfoque (definido como un ‘códec’ a pesar de su mayor complejidad en comparación con los códecs tradicionales como JPEG y AV1) puede operar sobre cualquier Modelo de Difusión Latente (LDM). En pruebas cuantitativas, supera a los métodos anteriores en términos de precisión y detalle, y requiere significativamente menos capacitación y costo de cómputo.
La idea clave del nuevo trabajo es que el error de cuantificación (un proceso central en toda la compresión de imágenes) es similar al ruido (un proceso central en los modelos de difusión).
Por lo tanto, una imagen ‘tradicionalmente’ cuantificada se puede tratar como una versión ruidosa de la imagen original, y se puede utilizar en el proceso de desruido de un LDM en lugar de ruido aleatorio, con el fin de reconstruir la imagen a una tasa de bits objetivo.

Comparaciones adicionales del nuevo método de Disney (resaltado en verde), en contraste con los enfoques rivales.
Los autores sostienen:
‘[Nosotros] formulamos la eliminación del error de cuantificación como una tarea de desruido, utilizando la difusión para recuperar la información perdida en la imagen latente transmitida. Nuestro enfoque nos permite realizar menos del 10% del proceso de generación de difusión completo y no requiere cambios arquitectónicos en el modelo de difusión, lo que permite el uso de modelos de base como un fuerte prior sin ajuste adicional de la columna vertebral.
‘Nuestro códec propuesto supera a los métodos anteriores en métricas de realismo cuantitativo, y verificamos que nuestras reconstrucciones son cualitativamente preferidas por los usuarios finales, incluso cuando otros métodos utilizan el doble de la tasa de bits.’
Sin embargo, al igual que otros proyectos que buscan explotar las capacidades de compresión de los modelos de difusión, la salida puede alucinar detalles. Por el contrario, los métodos con pérdida como JPEG producirán áreas de detalle claramente distorsionadas o suavizadas, que pueden ser reconocidas como limitaciones de compresión por el espectador casual.
En cambio, el códec de Disney puede alterar detalles de contexto que no estaban presentes en la imagen de origen, debido a la naturaleza burda del Autoencoder Variacional (VAE) utilizado en los modelos típicos entrenados con datos de hiperscala.
‘Similar a otros enfoques generativos, nuestro método puede descartar ciertas características de la imagen mientras sintetiza información similar en el lado del receptor. En casos específicos, sin embargo, esto puede resultar en una reconstrucción inexacta, como doblar líneas rectas o deformar el límite de objetos pequeños.
‘Estos son problemas bien conocidos del modelo de base en el que nos basamos, que se pueden atribuir a la dimensión de características relativamente baja de su VAE.’
Mientras que esto tiene algunas implicaciones para las representaciones artísticas y la verosimilitud de las fotografías casuales, podría tener un impacto más crítico en casos donde los pequeños detalles constituyen información esencial, como evidencia para casos judiciales, datos para reconocimiento facial, escaneos para Reconocimiento Óptico de Caracteres (OCR) y una amplia variedad de otros posibles usos, en el evento de la popularización de un códec con esta capacidad.
En esta etapa naciente del progreso de la compresión de imágenes mejorada con inteligencia artificial, todos estos escenarios posibles están lejos en el futuro. Sin embargo, el almacenamiento de imágenes es un desafío global de hiperscala, que afecta cuestiones relacionadas con el almacenamiento de datos, la transmisión y el consumo de electricidad, entre otras preocupaciones. Por lo tanto, la compresión basada en inteligencia artificial podría ofrecer un intercambio tentador entre precisión y logística. La historia muestra que los mejores códecs no siempre ganan la base de usuarios más amplia, cuando cuestiones como la licencia y la captura de mercado por formatos propietarios son factores en la adopción.
Disney ha estado experimentando con el aprendizaje automático como un método de compresión durante mucho tiempo. En 2020, uno de los investigadores del nuevo artículo estaba involucrado en un proyecto basado en VAE para una mejor compresión de video.
El nuevo artículo de Disney se actualizó a principios de octubre. Hoy, la empresa lanzó un video en YouTube acompañante. El proyecto se titula Compresión de Imágenes con Pérdida con Modelos de Difusión de Base, y proviene de cuatro investigadores de ETH Zúrich (afiliados a los proyectos de inteligencia artificial de Disney) y Disney Research. Los investigadores también ofrecen un artículo suplementario.
Método
El nuevo método utiliza un VAE para codificar una imagen en su representación latente comprimida. En esta etapa, la imagen de entrada consiste en características derivadas – representaciones vectoriales de bajo nivel. La incrustación latente se cuantiza nuevamente en una corriente de bits y nuevamente en el espacio de píxeles.
Esta imagen cuantizada se utiliza como una plantilla para el ruido que normalmente siembra una imagen de difusión, con un número variable de pasos de desruido (donde a menudo hay un intercambio entre pasos de desruido aumentados y mayor precisión, frente a menor latencia y mayor eficiencia).

Esquema para el nuevo método de compresión de Disney.
Los parámetros de cuantificación y el número total de pasos de desruido se pueden controlar bajo el nuevo sistema, a través de la capacitación de una red neuronal que predice las variables relevantes relacionadas con estos aspectos de la codificación. Este proceso se llama cuantificación adaptativa, y el sistema de Disney utiliza el marco Entroformer como el modelo de entropía que impulsa el procedimiento.
Los autores afirman:
‘Intuitivamente, nuestro método aprende a descartar información (a través de la transformación de cuantificación) que se puede sintetizar durante el proceso de difusión. Dado que los errores introducidos durante la cuantificación son similares a agregar [ruido] y los modelos de difusión son funcionalmente modelos de desruido, se pueden utilizar para eliminar el ruido de cuantificación introducido durante la codificación.’
La difusión estable V2.1 es la columna vertebral de difusión para el sistema, elegida porque la totalidad del código y los pesos base son de código abierto. Sin embargo, los autores enfatizan que su esquema es aplicable a una mayor cantidad de modelos.
Fundamental para la economía del proceso es la predicción de pasos de tiempo, que evalúa el número óptimo de pasos de desruido – un equilibrio entre eficiencia y rendimiento.

Predicciones de pasos de tiempo, con el número óptimo de pasos de desruido indicado con borde rojo. Consulte el PDF de origen para una resolución precisa.
La cantidad de ruido en la incrustación latente debe considerarse al hacer una predicción para el mejor número de pasos de desruido.
Datos y Pruebas
El modelo se entrenó en el conjunto de datos Vimeo-90k. Las imágenes se recortaron aleatoriamente a 256x256px para cada época (es decir, cada ingesta completa del conjunto de datos refinado por la arquitectura de capacitación del modelo).
El modelo se optimizó para 300,000 pasos a una tasa de aprendizaje de 1e-4. Esto es lo más común entre los proyectos de visión por computadora, y también el valor más bajo y más fino generalmente practicable, como un compromiso entre la generalización amplia de los conceptos y rasgos del conjunto de datos, y una capacidad para la reproducción de detalles finos.
Los autores comentan sobre algunas de las consideraciones logísticas para un sistema económico y eficaz*:
‘Durante la capacitación, es prohibitivamente costoso retropropagar el gradiente a través de múltiples pasos del modelo de difusión mientras se ejecuta durante la muestra de DDIM. Por lo tanto, realizamos solo una iteración de muestra de DDIM y la utilizamos directamente como los datos completamente desruidos.’
Los conjuntos de datos utilizados para probar el sistema fueron Kodak; CLIC2022; y COCO 30k. El conjunto de datos se preprocesó según la metodología descrita en la oferta de Google de 2023 Compresión de Imágenes de Multi-Realismo con un Generador Condicional.
Las métricas utilizadas fueron Relación de Señal a Ruido de Pico (PSNR); Métricas de Similitud Perceptual Aprendida (LPIPS); Índice de Similitud Estructural Multiescala (MS-SSIM); y Distancia de Inception de Fréchet (FID).
Los marcos de trabajo rivales anteriores se dividieron entre sistemas más antiguos que utilizaban Redes Adversarias Generativas (GAN) y ofertas más recientes basadas en modelos de difusión. Los sistemas GAN probados fueron Compresión de Imágenes Generativa de Alta Fidelidad (HiFiC); y ILLM (que ofrece algunas mejoras sobre HiFiC).
Los sistemas basados en difusión fueron Compresión de Imágenes con Pérdida con Modelos de Difusión Condicional (CDC) y Compresión de Imágenes de Alta Fidelidad con Modelos Generativos de Puntuación (HFD).

Resultados cuantitativos contra los marcos de trabajo anteriores en varios conjuntos de datos.
Para los resultados cuantitativos (visualizados arriba), los investigadores afirman:
‘Nuestro método establece un nuevo estado de la técnica en la realidad de las imágenes reconstruidas, superando a todas las líneas de base en las curvas de FID-tasa de bits. En algunas métricas de distorsión (específicamente, LPIPS y MS-SSIM), superamos a todos los códecs basados en difusión mientras seguimos siendo competitivos con los códecs generativos de mayor rendimiento.
‘Como se esperaba, nuestro método y otros métodos generativos sufren cuando se miden en PSNR, ya que favorecemos las reconstrucciones perceptualmente agradables en lugar de la replicación exacta de detalles.’
Para el estudio de usuarios, se utilizó un método de elección forzada de dos alternativas (2AFC), en un contexto de torneo donde las imágenes favoritas pasarían a las rondas posteriores. El estudio utilizó el sistema de Elo de calificación originalmente desarrollado para torneos de ajedrez.
Por lo tanto, los participantes verían y seleccionarían la mejor de dos imágenes de 512x512px presentadas en los diferentes métodos generativos. Se realizó un experimento adicional en el que todas las comparaciones de imágenes del mismo usuario se evaluaron, a través de una simulación de Monte Carlo durante 10,000 iteraciones, con la puntuación media presentada en los resultados.

Calificaciones de Elo estimadas para el estudio de usuarios, con torneos de Elo para cada comparación (izquierda) y también para cada participante, con valores más altos mejor.
Aquí los autores comentan:
‘Como se puede ver en las calificaciones de Elo, nuestro método supera significativamente a todos los demás, incluso en comparación con CDC, que utiliza en promedio el doble de bits de nuestro método. Esto sigue siendo cierto independientemente de la estrategia del torneo de Elo utilizada.’
En el artículo original, así como en el PDF suplementario, los autores proporcionan comparaciones visuales adicionales, una de las cuales se muestra al principio de este artículo. Sin embargo, debido a la granularidad de la diferencia entre las muestras, se remite al lector al PDF de origen, para que estos resultados puedan ser juzgados justamente.
El artículo concluye señalando que su método propuesto opera dos veces más rápido que el rival CDC (3,49 vs 6,87 segundos, respectivamente). También observa que ILLM puede procesar una imagen en 0,27 segundos, pero que este sistema requiere una capacitación agotadora.
Conclusión
Los investigadores de ETH/Disney están claros, al concluir el artículo, sobre el potencial de su sistema para generar detalles falsos. Sin embargo, ninguno de los ejemplos ofrecidos en el material se detiene en este problema.
En justicia, este problema no se limita al nuevo enfoque de Disney, sino que es un efecto colateral inevitable de utilizar modelos de difusión – una arquitectura inventiva e interpretativa – para comprimir imágenes.
Resulta interesante que, hace solo cinco días, dos investigadores más de ETH Zúrich produjeran un artículo titulado Alucinaciones Condicionales para la Compresión de Imágenes, que examina la posibilidad de un ‘nivel óptimo de alucinación’ en los sistemas de compresión basados en inteligencia artificial.
Los autores allí hacen un caso para la deseabilidad de las alucinaciones donde el dominio es lo suficientemente genérico (y, argumentablemente, ‘inofensivo’) como:
‘Para contenido similar a texturas, como hierba, pecas y muros de piedra, generar píxeles que coincidan realistamente con una textura determinada es más importante que reconstruir valores de píxeles precisos; generar cualquier muestra de la distribución de una textura es generalmente suficiente.’
Así, este segundo artículo hace un caso para que la compresión sea óptimamente ‘creativa’ y representativa, en lugar de recrear lo más exactamente posible los rasgos y lineamientos centrales de la imagen original no comprimida.
Uno se pregunta qué pensaría la comunidad fotográfica y creativa sobre esta redefinición radical de ‘compresión’.
*Mi conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el miércoles 30 de octubre de 2024












