Взгляд Anderson
Использование ИИ для симуляции зерна пленки

Сделайте Америку зернистой снова: новый инструмент ИИ может удалить зерно пленки из старых кадров, сжать видео до доли его размера, а затем вернуть зерно, так что зрители не заметят. Он работает с существующими видеостандартами и снижает пропускную способность до 90 процентов, сохраняя при этом винтажный вид.
Для многих из нас, смотрящих фильмы или старые телешоу, “шум” зерна пленки успокаивает; даже когда мы не осознаем это сознательно, зерно говорит нам, что то, что мы смотрим, было сделано с помощью химических веществ, а не кода, и связывает опыт с физическим миром: с выбором пленки, экспозицией, лабораторными процессами и ушедшими эпохами:

Подход Голливуда к зерну изменился вместе с изменениями в культуре и методах производства. В 1960-х годах эволюционирующие камеры и фотографические практики внесли свой вклад в характерную визуальную идентичность десятилетия. Позже режиссеры, работающие в цифровом формате, намеренно возвращали зерно. В середине 1980-х годов режиссер Джеймс Кэмерон выбрал особенно грубую пленку Kodak для фильма “Чужие” (1986, нижний правый угол на изображении выше), вероятно, чтобы усилить атмосферу и помочь скрыть провода от практических спецэффектов. Источник: https://archive.is/3ZSjN (моя последняя статья на эту тему)
Аналоговая текстура исходит из времени, когда производство медиа стоило реальных денег, доступ был ограничен, и было хотя бы некоторое представление о том, что только самые способные или решительные могли добиться успеха, выступая в качестве сокращения для реализма и достоверности – и когда высокие технологии захвата устранили его, ностальгия.
Кристофер Нолан никогда не переходил. Хотя большая часть индустрии приняла цифровой формат за его скорость и гибкость, известный режиссер настаивал на использовании пленки как в качестве дисциплины и эстетики.
Дени Вильнёв, работающий в цифровых трубопроводах, все еще проходит свою пленку через фотоchemical процессы. Для фильмов Дюна, снятых в цифровом формате, пленка была напечатана на пленочную ленту, а затем сканирована обратно в цифровой формат, исключительно для атмосферы и эффекта.
Фальшивое зерно
Любители фильмов и телевидения ассоциируют видимое зерно с высоким разрешением, где битрейт (количество данных, передаваемых в каждом кадре) так высок, что даже самые мелкие детали, такие как гранулы галогенидов, сохраняются.
Однако, если потоковые сети действительно сделали бы такой битрейт доступным, это поставило бы под угрозу сеть и, вероятно, вызвало бы буферизацию и заикание. Поэтому платформы, такие как Netflix создают оптимизированные версии AV1 своего контента и используют возможности кодека AV1 для добавления зерна к фильму или эпизоду разумным и уместным образом, сэкономив 30% пропускной способности в процессе.

AV1 предназначен для включения искусственного зерна пленки, как в этих примерах. Источник: https://waveletbeam.com/index.php/av1-film-grain-synthesis
‘Зерновой фетишизм’ – это относительно редкий цифровой аналог атавистических тенденций, таких как возрождение винила, и трудно сказать, используется ли он стриминговыми сервисами, чтобы сделать высокооптимизированное видео похожим на очень дорогое ‘сырое видео’ (для тех зрителей, которые бессознательно ассоциировали эти характеристики), делая битрейт более высоким, чем он есть; или чтобы отвлечь от снижения качества, которое старые шоу 4:3 бы приняли, когда стриминговые сервисы обрезают их до широкоэкранного формата; или просто чтобы потакать ретро-‘Нолановскому эстетизму’ в целом.
Зерно в изоляции
Проблема заключается в том, что зерно также является шумом. Цифровые системы ненавидят шум, и стриминговые кодеки, такие как AV1, удаляют его, чтобы сэкономить пропускную способность, если настройки зерна не настроены явно. Аналогично инструменты ИИ для повышения разрешения, такие как серия Topaz Gigapixel, рассматривают зерно как дефект, который необходимо исправить.
В области синтеза изображений на основе диффузии зерно чрезвычайно сложно сгенерировать, поскольку оно представляет собой крайнюю деталь, и, следовательно, обычно появляется только в сильно переобученных моделях, поскольку вся архитектура модели диффузии (LDM) предназначена для разложения шума (такого как зерно) на четкие изображения, а не для рассмотрения гранул зерна как неявных свойств в медиа.
Поэтому создание убедительного зерна с помощью машинного обучения может быть сложной задачей. И даже если бы это было возможно, рендеринг его напрямую в оптимизированное видео просто увеличил бы размер файла видео.
Из-за этой логистической соображения современные видеокодеки, такие как Versatile Video Coding (VVC) предлагают зерно в качестве вида ‘дополнения’.
VVC сжимает чистое, очищенное видео и удаляет зерно. Вместо того, чтобы тратить данные на попытки сохранить случайные высокочастотные закономерности зерна, он анализирует зерно отдельно и кодирует небольшой набор параметров (например, амплитуду, частоту и режим смешивания), которые описывают, как регенерировать подобное зерно во время воспроизведения.
Эти параметры хранятся в FGC-SEI (Дополнительная информация о характеристиках зерна пленки) потоке, который передается вместе с основным бит-потоком. После декодирования модуль синтеза использует эти инструкции, чтобы нанести синтетическое зерно, имитирующее оригинал.
Это сохраняет ‘вид’ высокобитрейтового, богатого зерном эмульсии, сохраняя при этом низкий битрейт, поскольку кодировщик не вынужден тратить ресурсы на сохранение непредсказуемого шума.
Кроме того, как и отдельные файлы субтитров, этот фальшивый ‘зерновой’ контент специфичен для видео в вопросе; случайное применение универсальных фильтров зерна в платформах, таких как Photoshop или After Effects, или в автоматических процессах обработки, не приведет к ‘подогнанному’ зерну, а вместо этого к несвязанному наложению шума:

Слева: оригинальное изображение. Центр: фильтр зерна Camera Raw, примененный равномерно ко всем каналам. Справа: тот же фильтр зерна, примененный индивидуально к каждому каналу в последовательности. Источник изображения (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (из моей предыдущей статьи)
Фильтр ‘Зерно’ в Photoshop добавляет равномерный случайный шум; но настоящее зерно пленки происходит от галогенидных кристаллов разного размера. Применение фильтра к каждому каналу отдельно (см. изображение выше) просто создает больше хаоса, а не реализма. Настоящее зерно пленки отражает, как свет ударяет по слоям эмульсии в момент экспозиции. Симуляция этого потребует оценки того, как разные области изображения активировали бы каждый слой галогенидов, а не просто разделения эффекта на RGB-каналы.
FGA-NN
В это сомнительное преследование входит новая исследовательская работа из Франции – краткая, но интересная статья, которая предлагает количественно и качественно лучший метод анализа и воссоздания зерна:

Сравнение между реальным зерном и результатами различных методов анализа и синтеза. Источник: https://arxiv.org/pdf/2506.14350
Новая система, озаглавленная FGA-NN, не отклоняется от традиционного использования гауссовского синтеза зерна через стандартный метод VVC, Versatile Film Grain Synthesis (VFGS). Что меняет система, так это анализ, используя нейронную сеть для более точной оценки параметров синтеза
Следовательно, окончательное зерно все еще синтезируется с помощью той же гауссовской модели – но сеть подает лучшие метаданные в стандартный, правило-ориентированный генератор, получая модель уровня состояния.
Новая статья называется FGA-NN: Film Grain Analysis Neural Network, и исходит от трех исследователей из InterDigital (IDCC ) R&D, Cesson-Sévigné. Хотя статья не длинная, давайте рассмотрим некоторые ключевые аспекты достижений, которые предлагает новый метод.
Метод
Чтобы суммировать: система FGA-NN принимает зернистое видео в качестве входных данных и извлекает компактное описание зерна, выводя параметры в стандартизированном формате FGC-SEI, используемом различными современными кодеками. Эти параметры передаются вместе с видео, позволяя декодировщику восстановить зерно с помощью VFGS, а не кодировать зерно напрямую.

Схема анализа и повторного применения зерна пленки в распространении видео, используя FGA-NN для извлечения параметров и VFGS для синтеза.
Чтобы обучить сеть, авторы нуждались в парах зернистых видео и соответствующих метаданных FGC-SEI. Поскольку большинство зернистых кадров не имеют такого метаданных, исследователи создали свою собственную базу данных, генерируя параметры FGC-SEI, применяя синтетическое зерно к чистым видео и используя их в качестве примеров обучения.
Данные для обучения FGA-NN были созданы путем применения синтетического зерна к чистым кадрам из BVI-DVC и DIV2K баз данных. Случайные параметры FGC-SEI были сгенерированы и использованы с помощью инструмента синтеза VFGS, позволяя каждому зернистому видео быть сопоставленным с известными метаданными.
Частотная модель, поддерживаемая текущими видеостандартами, была использована, с диапазонами параметров, ограниченными для поддержания визуальной правдоподобности на луминансных и хроминансных каналах.
Данные для обучения новой коллекции были созданы путем применения синтетического зерна к чистым кадрам из BVI-DVC и DIV2K баз данных. Случайные параметры FGC-SEI были сгенерированы и использованы с помощью инструмента синтеза VFGS, позволяя каждому зернистому видео быть сопоставленным с известными метаданными.

Обзор диапазонов параметров FGC-SEI, используемых для генерации синтетического зерна для обучения, примененного к чистым кадрам из BVI-DVC и DIV2K баз данных. Параметры были ограничены для обеспечения визуально правдоподобных результатов на обоих луминансных и хроминансных каналах.
Модель частотного фильтра, единственный метод синтеза, в настоящее время поддерживаемый в реализациях кодеков, таких как VVC Test Model (VTM), был использован на протяжении всего процесса. Диапазоны параметров были ограничены для сохранения визуальной правдоподобности на обоих луминансных и хроминансных каналах.
Эффект сети
FGA-NN имеет две координированные модели, для луминансных и хроминансных каналов соответственно, каждая из которых предназначена для прогнозирования конкретных параметров, необходимых для воссоздания реалистичного зерна пленки.
Для каждого входного изображения система оценивает набор интервалов интенсивности, коэффициентов масштабирования, связанных с каждым интервалом, горизонтальных и вертикальных частот среза, и общую коррекцию масштаба, известную как Log2Scale. Чтобы обработать это, модель использует общий экстрактор функций, который обрабатывает зернистый вход и подает в четыре отдельных выходных ветви, каждая из которых отвечает за конкретную задачу прогнозирования:

Архитектура луминансной версии FGA-NN. Общий бэкбон извлекает функции из зернистых входных кадров, за которым следуют четыре выходные ветви, адаптированные для конкретных задач прогнозирования: границы интервалов, коэффициенты масштабирования, частоты среза и глобальный Log2Scale. Хроминансная сеть использует ту же структуру с измененными входными и выходными размерами.
Границы интервалов прогнозируются с помощью регрессии, в то время как коэффициенты масштабирования, частоты среза и глобальная настройка масштаба рассматриваются как задачи классификации.
Архитектура адаптирована к сложности каждой задачи, с более крупными внутренними слоями, используемыми для более тонких прогнозов; в частности, хроминансная модель отражает луминансную структуру, но адаптируется к различным характеристикам цветных данных.
Обучение и тестирование
FGA-NN был обучен с помощью четырех целевых функций, каждая из которых соответствует одной из его задач прогнозирования. Для выходных классификаций использовалась категориальная функция потерь перекрестной энтропии для уменьшения разрыва между прогнозируемыми метками и реальными значениями.
Границы интервалов были нормализованы до диапазона 0-1 и оптимизированы с помощью комбинированной функции потерь: экспоненциально масштабированной L1 функции потерь (expL1), которая штрафовала более крупные ошибки более сильно, и монотонной штрафной функции, которая препятствовала нисходящим тенденциям. Все четыре потери были объединены, с высокими весами, присвоенными частотам среза и коэффициентам масштабирования, в то время как границы интервалов и Log2Scale были взвешены как 1 и 0,1.
Обучение было проведено под оптимизатором Adam при скорости обучения 5e-4, в течение 10 000 итераций, с размером партии 64.
Единственный сравнимый инструмент, подходящий для сравнительных тестов, был FGA-CONVENT, который также производит значения в формате FGC-SEI и используется для обработки зерна. Обе системы были протестированы на последовательностях UHD из JVET субъективной оценочной базы, используя кадры с реальным зерном пленки.

Вертикальные пунктирные линии указывают границы интервалов интенсивности, в то время как коэффициент усиления Log2Scale указан в метке оси.
На изображении выше мы видим идентичные обрезанные кадры, сгенерированные VFGS с помощью параметров из каждого метода, сравненные с оригиналом. Их соответствующие оценки луминанса также построены против реальных значений, установленных вручную с помощью VFGS, которые здесь отображают интенсивность пикселя на оси X (0-255), коэффициенты масштабирования на синей оси Y (0-255) и частоты среза на зеленой оси Y (2-14).
Авторы заявляют:
‘Можно наблюдать, что FGA-NN точно захватывает общую тенденцию реального узора и амплитуды зерна пленки, в результате чего синтезированные изображения имеют перцептивно подобное зерно пленки, как и реальные.’
‘С другой стороны, FGA-CONVENT прогнозирует более низкий коэффициент масштабирования, компенсируемый соответствующим более низким коэффициентом Log2Scale в результате его конструкции, и склоняется к генерации более крупного узора зерна пленки, чем эталон, в результате чего получается отличный, но визуально последовательный вид.’
Они отмечают, что прямое сравнение с реальными параметрами зерна ненадежно, поскольку масштабирование и Log2Scale могут компенсировать друг друга, и небольшие ошибки часто имеют незначительное визуальное влияние.
Тест веры
Верность зерна пленки была протестирована на четырех рабочих процессах: FGA-NN с VFGS; FGA-CONVENT плюс VFGS; Style-FG; и 3R-INN. Тесты использовали как базы FGC-SEI, так и FilmGrainStyle740k, сравнивая выходные данные с реальными значениями с помощью изученных перцептивных метрик подобия (LPIPS); JSD-NSS; и Кульбака-Лейблера (KL) дивергенции.

Результаты тестирования на базе FilmGrainStyle740k. Style-FG и 3R-INN превосходят других, поскольку они были обучены на этой базе, с FGA-NN, следующим за ними. FGA-CONVENT отстает, отражая его зависимость от многофреймового анализа и однородных регионов – условий, не выполненных в данном случае.
Из этих результатов авторы заявляют:
‘На тестовой базе FilmGrainStyle740k Style-FG и 3R-INN достигают лучших результатов, поскольку эти методы были специально обучены на этой базе, с FGA-NN, следующим за ними. Производительность FGA-CONVENT, объединенного с VFGS, является субоптимальной на обоих тестовых наборах. ‘
‘Это исключительно связано с тем, что анализ полагается на однородные регионы и использует информацию из нескольких кадров в реальном случае анализа зерна пленки, тогда как в настоящем тестировании анализ предоставляется с одним низкокачественным изображением (256×256 до максимума 768×512), которое часто содержит значительную текстуру. ‘
‘Это еще больше осложняет задачу для традиционного метода анализа, что делает невозможным применение FGA-CONVENT к таким маленьким изображениям.’
Наконец, авторы отмечают, что хотя методы, основанные на обучении, такие как 3R-INN и Style-FG, производят сильные визуальные результаты на отобранных базах, их высокая вычислительная стоимость делает их непригодными для развертывания на устройствах конечных пользователей.

Сравнение кадров с низким битрейтом, улучшенных с помощью различных методов анализа и синтеза (третья до последней колонки).
Напротив, предложенный в новой статье подход объединяет легкий модуль анализа FGA-NN с эффективным методом синтеза VFGS, который авторы описывают как более жизнеспособное и развертываемое решение для повторного введения зерна пленки в сжатое видео.
Они заявляют далее, что преимущества FGA-NN потенциально значительны, в масштабе:
‘[Кодирование] видео UHD с зерном пленки на средних до низких битрейтах с помощью нашего рабочего процесса анализа и синтеза зерна пленки позволяет сэкономить до 90% битрейта по сравнению с кодированием высокого битрейта.’
Заключение
Одержимость зерном пленки – одна из самых странных и любопытных причуд постаналоговой эпохи, и интересно отметить, что то, что когда-то считалось ограничением среды, теперь стало символом правдоподобности и аутентичности само по себе, даже (возможно, бессознательно) для нового поколения зрителей, родившихся после фактического упадка эмульсии.
Следует отметить, что ни один из современных методов воссоздания зерна, включая эту последнюю инновацию, не может точно захватить истинный эффект того, как свет влияет на слои галогенидов в истинном фотоchemical процессе, в диапазоне условий.
Опубликовано впервые в среду, 18 июня 2025 года












