Ángulo de Anderson
Utilizando IA para simular grano de película

Hacer que América vuelva a ser granulosa de nuevo: una nueva herramienta de IA puede eliminar el grano de película de viejas grabaciones, comprimir el video a una fracción de su tamaño, y luego volver a poner el grano para que los espectadores no lo noten. Funciona con estándares de video existentes y reduce la banda ancha hasta un 90 por ciento, manteniendo el aspecto vintage.
Para muchos de nosotros que vemos películas o programas de televisión antiguos, el “crack” del grano de película es reconfortante; incluso cuando no lo registramos conscientemente, el grano nos dice que lo que estamos viendo fue hecho con productos químicos, no con código, y une la experiencia al mundo físico: a la elección de stock, exposición, procesos de laboratorio y eras pasadas:

El enfoque de Hollywood hacia el grano ha cambiado junto con los cambios en la cultura y los métodos de producción. Durante la década de 1960, las cámaras y prácticas fotográficas en evolución contribuyeron a la identidad visual distintiva de la década. Más tarde, los directores que trabajaban en digital reintrodujeron deliberadamente el grano. A mediados de la década de 1980, el director James Cameron seleccionó un stock Kodak particularmente grueso para Aliens (1986, en la parte inferior derecha de la imagen de arriba), probablemente para realzar la atmósfera y también para ayudar a ocultar los cables de los trabajos de efectos visuales prácticos en miniatura. Fuente: https://archive.is/3ZSjN (mi artículo más reciente sobre este tema)
La textura analógica proviene de una época en que producir medios costaba dinero real, el acceso era limitado, y había al menos una sensación de que solo los más capaces o decididos podían lograrlo, actuando como un atajo para la realidad y la credibilidad; y cuando las tecnologías de captura de alta resolución eliminaron el grano, la nostalgia.
Christopher Nolan nunca cambió. Mientras que la mayoría de la industria abrazó lo digital por su velocidad y flexibilidad, el aclamado director se mantuvo firme, insistiendo en la celulosa como disciplina y estética.
Denis Villeneuve, trabajando dentro de las canalizaciones digitales, todavía pasa su metraje a través de procesos fotoquímicos. Para las películas de Dune, filmadas digitalmente, el metraje se imprimió en stock de película y luego se escaneó de regreso a digital, puramente por atmósfera y efecto.
Grano falso
Los aficionados a la calidad de las películas y la televisión asocian el grano visible con alta resolución, donde la tasa de bits (la cantidad de datos que se introducen en cada cuadro) es tan alta que incluso los detalles más pequeños, como los granos de haluros, se conservan.
Sin embargo, si las redes de transmisión realmente hicieran que ese tipo de tasa de bits estuviera disponible, pondría una gran tensión en la capacidad de la red, y probablemente causaría buffering y stuttering. Por lo tanto, plataformas como Netflix crean versiones optimizadas AV1 de su contenido y utilizan las capacidades del códec AV1 para agregar grano a la película o episodio de una manera inteligente y oportuna, ahorrando un 30% de ancho de banda en el proceso.

AV1 está diseñado para incorporar grano de película artificial, como en estos ejemplos. Fuente: https://waveletbeam.com/index.php/av1-film-grain-synthesis
El “fetichismo del grano” es un equivalente digital relativamente raro a tendencias atávicas como el resurgimiento del vinilo, y es difícil decir si se utiliza por los servicios de transmisión para hacer que los videos altamente optimizados parezcan “video crudo” de alta calidad (para los espectadores que han asociado inconscientemente esas características); o para desviar la caída de la calidad percibida que los programas de televisión antiguos de 4:3 tomarían cuando los proveedores de transmisión los recortan a relaciones de aspecto panorámico; o simplemente para complacer el esteticismo “Nolan” retro en general.
Grano siloado
El problema es que el grano también es ruido. Los sistemas digitales odian el ruido, y los códecs de transmisión como AV1 lo eliminan para ahorrar ancho de banda, a menos que los ajustes de grano estén configurados explícitamente. De manera similar, los aumentos de escala de IA como la serie Topaz Gigapixel tratan el grano como un defecto que debe corregirse.
En el campo de la síntesis de imágenes basada en difusión, el grano es extremadamente desafiante de generar, ya que representa detalles extremos, y por lo tanto solo aparecería en modelos sobreamuestreados masivamente, porque toda la arquitectura del modelo de difusión latente (LDM) está diseñada para descomponer el ruido (como el grano) en imágenes claras, en lugar de tratar los granos como propiedades implícitas en los medios.
Por lo tanto, puede ser desafiante crear grano convincente utilizando aprendizaje automático. Y incluso si uno pudiera hacerlo, renderizarlo directamente en un video optimizado solo aumentaría el tamaño del archivo del video nuevamente.
Debido a esta última consideración logística, los códecs de video de última generación como Versatile Video Coding (VVC) ofrecen grano como una especie de “servicio de acompañamiento”.
VVC comprime el video limpio, desenoizado, y descarta el grano. En lugar de desperdiciar datos tratando de preservar patrones de grano de alta frecuencia aleatorios, analiza el grano por separado y codifica un pequeño conjunto de parámetros (por ejemplo, amplitud, frecuencia y modo de mezcla) que describen cómo regenerar grano similar durante la reproducción.
Estos parámetros se almacenan en un FGC-SEI (Suplemento de información de características de grano de película), que viaja junto con la corriente de bits principal. Después de la decodificación, un módulo de síntesis utiliza estas instrucciones para reaplicar grano sintético que imita el original.
Esto conserva el “aspecto” de emulsión de alta tasa de bits, rica en grano, mientras mantiene la tasa de bits real baja, ya que el codificador no se ve obligado a gastar recursos preservando ruido impredecible.
Además, al igual que con los archivos de subtítulos discretos, este contenido de “grano” falso es específico del video en cuestión; aplicar filtros de grano genéricos de manera descuidada en plataformas como Photoshop o After Effects, o en pipelines de procesamiento automatizado, no resultaría en grano “ajustado”, sino en una superposición no relacionada de ruido:

Izquierda: imagen original. Centro: grano de Camera Raw de Photoshop aplicado uniformemente en todos los canales. Derecha: el mismo filtro de grano aplicado individualmente a cada canal en secuencia. Imagen de fuente (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (a través de mi propio artículo anterior)
El filtro de grano de Photoshop agrega ruido aleatorio uniforme; pero el grano de película real proviene de cristales de haluros de diferentes tamaños. Aplicar el filtro a cada canal por separado (ver imagen de arriba) solo crea más caos, no realismo. El grano de película real refleja cómo la luz golpea capas de emulsiones en el momento de la exposición. Simular eso requeriría estimar cómo diferentes áreas de una imagen habrían activado cada capa de haluros, no solo dividir el efecto en capas RGB.
FGA-NN
En esta búsqueda especiosa llega un nuevo artículo de investigación de Francia – un breve pero interesante artículo que ofrece un método cuantitativa y cualitativamente superior para analizar y recrear grano:

Comparación entre grano de referencia y resultados de varios métodos de análisis y síntesis. Fuente: https://arxiv.org/pdf/2506.14350
El nuevo sistema, titulado FGA-NN, no se aparta del uso convencional de síntesis de grano basada en Gaussian a través del método VVC compatible estándar, Versatile Film Grain Synthesis (VFGS). Lo que cambia el sistema es el análisis, utilizando una red neuronal para estimar los parámetros de síntesis de manera más precisa
Por lo tanto, el grano final todavía se sintetiza utilizando el mismo modelo Gaussian convencional – pero la red neuronal alimenta mejor los metadatos a un generador basado en reglas estándar, obteniendo un modelo de última generación.
El nuevo artículo se titula FGA-NN: Red neuronal de análisis de grano de película, y proviene de tres investigadores de InterDigital (IDCC ) R&D, Cesson-Sévigné. Aunque el artículo no es largo, veamos algunos de los aspectos clave de los avances que ofrece el nuevo método.
Método
Para recapitular: el sistema FGA-NN toma un video con grano como entrada y extrae una descripción compacta del grano, saliendo parámetros en el formato FGC-SEI estandarizado utilizado por códecs modernos diversos. Estos parámetros se transmiten junto con el video, lo que permite al decodificador reconstruir el grano utilizando VFGS, en lugar de codificar el grano directamente.

Esquema para analizar y reaplicar grano de película en la distribución de video, utilizando FGA-NN para la extracción de parámetros y VFGS para la síntesis.
Para entrenar la red, los autores necesitaban pares de videos con grano y metadatos FGC-SEI correspondientes. Dado que la mayoría de los metrajes con grano carecen de este tipo de metadatos, los investigadores crearon su propio conjunto de datos generando parámetros FGC-SEI, aplicando grano sintético a videos limpios y utilizando estos como ejemplos de entrenamiento.
Los datos de entrenamiento para FGA-NN se crearon aplicando grano sintético a metrajes limpios de los conjuntos de datos BVI-DVC y DIV2K. Se generaron parámetros FGC-SEI aleatorizados y se utilizaron con la herramienta de síntesis VFGS, lo que permitió que cada video con grano se emparejara con metadatos conocidos.
El modelo basado en frecuencia compatible con los estándares de video actuales se utilizó, con rangos de parámetros restringidos para mantener la plausibilidad visual en canales luma y croma.
Los datos de entrenamiento para la nueva colección se crearon aplicando grano sintético a metrajes limpios de los conjuntos de datos BVI-DVC y DIV2K. Se generaron parámetros FGC-SEI aleatorizados y se utilizaron con la herramienta de síntesis Versatile Film Grain (VFGS), lo que permitió que cada video con grano se emparejara con metadatos conocidos.

Visión general de los rangos de parámetros FGC-SEI aleatorizados utilizados para generar grano sintético para el entrenamiento, aplicado a metrajes limpios de los conjuntos de datos BVI-DVC y DIV2K. Los parámetros se restringieron para asegurar resultados visuales plausibles en ambos canales luma y croma.
El modelo de filtrado de frecuencia, el único método de síntesis actualmente compatible en implementaciones de códecs como el VVC Test Model (VTM), se utilizó en todo momento. Los rangos de parámetros se restringieron para preservar la plausibilidad visual en canales luma y croma.
Efecto de red
FGA-NN cuenta con dos modelos coordinados, para luma y croma, respectivamente, cada uno diseñado para predecir los parámetros específicos necesarios para recrear grano de película realista.
Para cada imagen de entrada, el sistema estima un conjunto de intervalos de intensidad, los factores de escala vinculados a cada intervalo, las frecuencias de corte horizontal y vertical, y un ajuste de escala general conocido como factor Log2Scale. Para manejar esto, el modelo utiliza un extractor de características compartido que procesa la entrada con grano y se alimenta en cuatro ramas de salida separadas, cada una responsable de una tarea de predicción diferente:

Arquitectura de la versión luma de FGA-NN. Un backbone compartido extrae características de los cuadros de entrada con grano, seguido de cuatro ramas de salida personalizadas para tareas de predicción específicas: límites de intervalo, factores de escala, frecuencias de corte y ajuste global Log2Scale. La red croma utiliza la misma estructura con dimensiones de entrada y salida ajustadas.
Los límites de intervalo se predicen utilizando regresión, mientras que los factores de escala, las frecuencias de corte y el ajuste de escala global se tratan como problemas de clasificación.
La arquitectura se ajusta para reflejar la complejidad de cada tarea, con capas internas más grandes utilizadas para predicciones más detalladas; específicamente, el modelo croma refleja la estructura luma, pero se adapta a las características diferentes de los datos de color.
Entrenamiento y pruebas
FGA-NN se entrenó utilizando cuatro funciones de objetivo, cada una alineada con una de sus tareas de predicción. Para las salidas de clasificación se utilizó una pérdida de entropía cruzada categórica para reducir la brecha entre las etiquetas predichas y las de referencia.
Los límites de intervalo se normalizaron a un rango de 0 a 1 y se optimizaron utilizando una pérdida combinada: una pérdida L1 exponencialmente escalada (expL1) que penalizaba los errores más grandes con más fuerza, y una penalización de monotonía que desalentaba las tendencias descendentes. Todas las pérdidas se combinaron, con pesos altos asignados a los factores de corte y escala, mientras que los límites de intervalo y Log2Scale se ponderaron en 1 y 0,1.
El entrenamiento se llevó a cabo bajo el optimizador Adam, a una tasa de aprendizaje de 5e-4, a lo largo de 10.000 iteraciones, con un tamaño de lote de 64.
La única herramienta comparable adecuada para pruebas comparativas fue FGA-CONVENT, que también produce valores en el formato FGC-SEI, y se utiliza para el procesamiento de grano. Ambos sistemas se probaron en secuencias UHD del conjunto de evaluación subjetiva de JVET, utilizando metrajes que contenían grano de película real.

Líneas verticales discontinuas indican límites de intervalo de intensidad, mientras que el ajuste de ganancia Log2Scale se indica en la etiqueta del eje.
En la imagen de arriba, vemos cuadros idénticos recortados generados por VFGS utilizando parámetros de cada método, comparados con el original. Las estimaciones de luma respectivas también se trazan contra los valores de referencia establecidos manualmente utilizando VFGS, que aquí traza la intensidad de píxel en el eje X (0–255), los factores de escala en el eje Y azul (0–255), y las frecuencias de corte en el eje Y verde (2–14).
Los autores afirman:
‘Se puede observar que FGA-NN captura con precisión la tendencia general del patrón de grano de película y amplitud de la verdad, lo que da como resultado imágenes sintetizadas con grano de película perceptualmente similar al de las imágenes de referencia.’
‘Por otro lado, FGA-CONVENT predice un factor de escala más bajo, compensado por un factor Log2Scale más bajo como resultado de su diseño, y tiende a generar un patrón de grano de película más grueso que la referencia, lo que da como resultado una apariencia distintiva pero visualmente coherente.’
Señalan que la comparación directa con parámetros de grano de referencia es poco confiable, ya que la escala y Log2Scale pueden compensarse entre sí, y los errores menores a menudo tienen poco impacto visual.
Prueba de fe
La fidelidad del grano de película se benchmarkó en cuatro flujos de trabajo: FGA-NN con VFGS; FGA-CONVENT más VFGS; Style-FG; y 3R-INN. Las pruebas utilizaron tanto el conjunto de datos FGC-SEI como el FilmGrainStyle740k, comparando la salida con la verdad utilizando métricas de similitud perceptual aprendidas (LPIPS); JSD-NSS; y divergencia de Kullback-Leibler (KL).

Resultados de benchmark en el conjunto de datos FilmGrainStyle740k. Style-FG y 3R-INN superan a los demás debido a que fueron entrenados en este conjunto, con FGA-NN siguiendo de cerca. FGA-CONVENT tiene un rendimiento subóptimo, reflejando su dependencia del análisis de múltiples cuadros y regiones homogéneas – condiciones no cumplidas por las pequeñas entradas ricas en textura utilizadas en este caso.
De estos resultados, los autores afirman:
‘En el conjunto de pruebas FilmGrainStyle740k, Style-FG y 3R-INN logran los mejores resultados, ya que estos métodos fueron entrenados específicamente en este conjunto, con FGA-NN siguiendo de cerca. El rendimiento de FGA-CONVENT combinado con VFGS es subóptimo en ambos conjuntos de pruebas. ‘
‘Esto se debe únicamente al hecho de que el análisis depende de regiones homogéneas y explota la información de múltiples cuadros en un caso de análisis de grano de película real, mientras que en la evaluación actual el análisis se proporciona con una sola imagen de baja resolución (256×256 a un máximo de 768×512), que a menudo contiene una cantidad significativa de textura. ‘
‘Esto complica aún más el desafío para el método de análisis convencional, lo que hace imposible aplicar FGA-CONVENT a imágenes tan pequeñas.’
Finalmente, los autores señalan que, aunque los métodos basados en el aprendizaje como 3R-INN y Style-FG producen resultados visuales sólidos en conjuntos de datos curados, su alto costo computacional los hace inadecuados para la implementación en dispositivos de usuario final.

Comparación de cuadros de baja tasa de bits mejorados utilizando diferentes flujos de trabajo de análisis y síntesis (tercer a último columnas).
En comparación, el enfoque propuesto en el nuevo artículo empareja el módulo de análisis FGA-NN ligero con el método de síntesis VFGS eficiente en hardware, que los autores describen como una solución más viable y desplegable para reintroducir grano de película en video comprimido.
Señalan que los beneficios de FGA-NN son potencialmente considerables, a escala:
‘[Codificando] videos UHD con grano de película a tasas de bits medias a bajas utilizando nuestro flujo de trabajo de análisis y síntesis de grano de película permite ahorros de tasa de bits de hasta un 90% en comparación con la codificación de alta tasa de bits.’
Conclusión
La obsesión con el grano de película es una de las concepciones más extrañas y curiosas de la era postanalógica, y es interesante notar que lo que una vez se consideró una limitación del medio ahora se ha convertido en un símbolo de verosimilitud y autenticidad en sí mismo, incluso (quizás subconscientemente) para una nueva generación de espectadores nacidos después del declive efectivo de la emulsión.
Debería señalarse que ninguno de los métodos de recreación de grano de última generación, incluida esta última innovación, puede capturar exactamente el efecto real de la forma en que la luz afecta capas de haluros en un proceso fotoquímico real, en un rango de condiciones. Primero publicado el miércoles 18 de junio de 2025












