Взгляд Anderson
Введение AI-генерируемых изображений в свет с помощью HDR

Изображения и видео, созданные с помощью ИИ, могут быть впечатляющими, но они не соответствуют профессиональным стандартам – проблема, которую решает новый исследовательский проект.
В профессиональном аудиовизуальном сообществе одна из наиболее частых претензий к ИИ – это отсутствие профессиональных стандартов воспроизведения изображений и видео. Не в последнюю очередь это связано с возможностью работать с изображениями и видео высокого динамического диапазона (HDR).
Изображения HDR – это современный аналог фотографической техники 19-20 веков, называемой брекетингом, когда одна и та же фотография делается несколько раз с увеличением количества света, попадающего на фотопленку:

Выше, короткая брекетированная последовательность. Вставка ниже, высокий динамический диапазон, который можно экстраполировать из этих фотографий в одно изображение. Источник
В традиционной фотографии это приводило к нескольким фотографиям, которые с некоторым опытом и усилиями можно было составить в одну печать, которая бы выиграла от всех различных уровней детализации, доступных в диапазоне экспозиций. Но это не было тривиальной или легкой задачей.
В наше время автобрекетированная последовательность изображений может производить либо несколько изображений, либо объединяться в одно изображение HDR – по сути, множество экспозиций в одном изображении, которое приложения для редактирования изображений, поддерживающие HDR, такие как Photoshop, могут проходить и позволять фотографу оркестрировать в одно идеальное выходное изображение.
Если вы задумываетесь, почему вам следует заботиться об этом или как это влияет на вашу собственную фотографию, иллюстрация к этой статье призвана продемонстрировать это в знакомой форме:

Выше, слева мы видим типичный пример изображения sRGB (т.е. не-HDR). Просто осветляя (показано справа) его не показывает монстра в шкафу, потому что эта деталь была выброшена, когда фотограф и автоматические процессы камеры решили, что следует отдать приоритет в фотографии:
Ниже показано, как «выцветший» передний план должен был быть в момент экспозиции, чтобы зарегистрировать монстра в шкафу в не-HDR-фотографии, и как монстр погружается во тьму, когда экспозиция делается подходящей для хорошо освещенных передних объектов:

Ниже мы видим, какой деталь можно «спасти» из изображения HDR или последовательности изображений. В этом случае монстр «прятался» в самых низких визуальных регистрах последовательности HDR, на уровне, где остальной контент был бы «выбелен» в近-white (выше, слева). Указав, что широкий диапазон уровней яркости должен быть выражен выборочно в одном изображении, эти диссонансные элементы можно составить в одно рациональное изображение:

Не-HDR-изображение называется дисплей-ориентированным изображением, а изображение HDR с высоким гамутом называется сцено-ориентированным изображением.
Видео HDR также существует, и такая тональная универсальность и пластичность действительно дает кинематографистам некоторую свободу действий, чтобы спасти, оценить и интерпретировать кадры творчески и последовательно; неудивительно, что креативщики неохотно работают с «сплющенным» выходом sRGB, характерным для большинства генеративных моделей ИИ.
HDR в ИИ
Естественно, что исследовательская сцена заинтересована в том, чтобы ввести генеративные модели ИИ в эпоху HDR. Однако это не тривиальная задача, как из-за фундаментальной архитектуры диффузионных генеративных систем, так и потому, что хорошие данные HDR занимают много места на диске, что делает их неуклюжими коллекциями; в результате наборы данных, подходящие для этой задачи, редки.
Тем не менее, сотрудничество между университетом в Сингапуре и исследовательским отделом Adobe предлагает метод генерации последовательностей изображений HDR, в методологии, которая теоретически может быть применена как к видео, так и к статичным изображениям:

Из проекта нового исследования, примеры «брекетированного» текст-изображения вывода. Источник
Новая система генерирует несколько согласованных версий одного и того же изображения при разных уровнях яркости и учитывает, насколько ярким было сцену, а затем объединяет их в один результат, который сохраняет детали как в тени, так и в светлых участках, позволяя последующим редактированиям экспозиции или цвета вести себя более как корректировки реальной камеры, а не хрупкие корректировки полностью обработанного изображения.
Система использует разнообразные модели для этой задачи, включая варианты Qwen и Flux:

Примеры из нового исследования, показывающие, как система может генерировать несколько версий одного и того же сцены при разных экспозициях, сохраняя при этом неизменную структуру. Начиная с простой карты краев, модель производит согласованные изображения через очень темные и очень яркие настройки, независимо от того, описывает ли подсказка лунный свет, солнечный свет, закат или даже небольшой объект, такой как воздушный шар, с сохранением субъекта и композиции при изменении только освещения. Метод может изменять яркость в контролируемом, камероподобном виде, а не дрейфовать или изобретать новый контент при изменении экспозиции. Источник
Авторы заявляют:
«Генерация линейных изображений является сложной задачей, поскольку предварительно обученные VAE в диффузионных моделях испытывают трудности в сохранении как крайних бликов, так и теней из-за более высокого динамического диапазона и глубины цвета.
«Для этого мы представляем линейное изображение как последовательность экспозиционных брекетов, каждый из которых захватывает определённую часть динамического диапазона, и предлагаем архитектуру DiT на основе потокового соответствия для генерации экспозиционных брекетов, управляемых текстом.
«Мы также демонстрируем последующие применения, включая текст-управляемое линейное редактирование изображений и генерацию, управляемую структурой, через ControlNet».
Новая работа называется «Генерация линейных изображений путем синтеза экспозиционных брекетов», и исходит от четырех авторов из S-Lab в Наньянском технологическом университете, Adobe NextCam и исследовательского отдела Adobe. Кроме упомянутой страницы проекта и видео на YouTube, сопровождающего выпуск, также есть (в настоящее время скудный) репозиторий GitHub, и обещание выпуска набора данных.
Хотя авторы предоставляют многие примеры вывода системы на связанной странице проекта, зрителям понадобится монитор, поддерживающий HDR, чтобы действительно различить характеристики представленного вывода HDR. Тем не менее, пожалуйста, найдите обзор исследователей на YouTube, встроенный в конце этой статьи – но будьте осведомлены, что различия между показанными примерами могут быть неясны на не-HDR-мониторе.
Метод и данные
Авторы подчеркивают степень, в которой сбор данных является проблемой в этом конкретном преследовании:
«Сбор большого количества линейных изображений чрезвычайно сложен на практике. Кроме того, большинство публичных наборов данных HDR либо панорамны (так что они фокусируются почти исключительно на контенте крупномасштабных сцен), либо не предоставляют истинные линейные изображения, что делает их непригодными для наших целей.
«Поэтому мы в основном используем наборы данных сырых изображений в качестве основы для обучения».
Исследователи творчески использовали несколько доступных вариантов, используя набор данных RAISE в качестве фактических данных для обучения, и набор данных MIT-Adobe FiveK в качестве оценочных данных*.
Чтобы построить пригодные для использования данные HDR, исследователи прошли сырые файлы камеры через стандартизированный конвейер, чтобы удалить камероспецифические причуды, преобразовав изображения в последовательный, сцено-ориентированный линейный формат:

Схема рабочего процесса авторов: система начинается с шума, представляющего четыре уровня экспозиции одной и той же сцены, вместе с текстовой подсказкой и токеном яркости, и обрабатывает их через стэкованные блоки трансформеров, которые сохраняют различные экспозиции, корректируя освещение. Затем она предсказывает как набор изображений экспозиции, так и общую шкалу яркости, и последовательно декодирует и объединяет их в одно сцено-ориентированное изображение, сохраняя детали как в тени, так и в светлых участках.
Это включало в себя восстановление полного RGB из данных датчика, применение коррекции цвета, нормализацию белого баланса и кратковременный переход в воспринимаемое цветовое пространство для шумоподавления, прежде чем вернуться к чистому линейному сигналу. Фактический свет в сцене затем был восстановлен с помощью настроек экспозиции камеры, так что каждый пиксель отражал бы реальную яркость, а не готовую к отображению аппроксимацию.
Поскольку такие значения могут сильно варьироваться, данные затем стабилизировались путем масштабирования каждого изображения на основе его собственного распределения яркости, используя статистику среднего диапазона и светлых участков, чтобы избежать как выцветших изображений, так и переэкспонированных бликов, в конечном итоге получив нормализованное линейное изображение, которое сохраняло истинный диапазон света в сцене, оставаясь при этом достаточно стабильным для обучения.
Текстовые метки для изображений затем были созданы с помощью модели Qwen2.5-VL 7B, с подсказками, созданными для соответствия характеристикам модели Flux, которая будет использоваться во время генерации.
Каждое изображение было разделено на экспозиционные «срезы» и передано через общий VAE-кодировщик, преобразовав все экспозиции в общее латентное пространство, предназначенное для захвата полного диапазона яркости. Латентные переменные затем были уточнены из шума и декодированы обратно в изображения, позволяя последовательной реконструкции как в темных, так и в светлых областях, без сжатия их в одну «сплющенную» экспозицию.
LoRA-тонкая настройка была использована для адаптации предварительно обученной модели Flux к линейным данным изображений с минимальным количеством дополнительных параметров, помогая модели Single-Diffusion Transformers (single-DiT) оставаться стабильной, даже когда яркость варьировалась через экспозиционные брекеты.
Внимание к модуляции экспозиции (центральный столбец в схеме выше) было введено для совместной обработки всех брекетов, позволяя изменять яркость для каждой экспозиции, сохраняя при этом структуру и мелкие детали.
3D-Ротационное позиционное вложение (3D-R[o]PE) было использовано для кодирования как пространственного положения, так и идентичности экспозиции, так что модель могла различать, к какому брекету принадлежит каждый токен, сохраняя при этом пространственную согласованность, что позволяло чисто разделить изменение яркости от содержания сцены.

Обзор набора данных, использованного в исследовании, показывающий, как изображения распределены по типам контента и внутренним/внешним сценам, а также распределение значений яркости в обработанных данных. Гистограммы отображают яркость и шкалу радианса в логарифмическом пространстве, иллюстрируя, насколько сильно может варьироваться яркость реального мира, с более высокими значениями радианса, соответствующими физически более ярким сценам, и подчеркивая сильный динамический диапазон, с которым обучена модель.
3D-RoPE разделило где находится особенность и «от какой экспозиции она происходит» на отдельные сигналы, так что изменение яркости можно было регулировать независимо, не повреждая пространственные детали.
Тесты
Исследователи использовали Flux-dev в качестве генеративной основы, с обучением, происходящим на четырех NVIDIA A100 GPU, каждая с 80 ГБ видеопамяти. Размер партии был установлен на 4 (на GPU), за 10 000 итераций.
Тонкая настройка LoRA использовала ранг 64. Оптимизатор AdamW был использован при скорости обучения 2×102 (для аспекта модуляции экспозиции).
Авторы отмечают, что хотя есть две предыдущие работы, подобные по объему, ни одна из них не была очевидным претендентом на фазу тестирования. Работа Max Planck 2022 года GlowGAN ограничена генерацией конкретных категорий изображений, в то время как Bracket Diffusion 2025 года (опять же, возглавляемая Max Planck Institute) может генерировать только изображение HDR размером 256×256 пикселей и занимает несколько минут для этого:

Из оригинальной работы GlowGAN, типичные изображения с низким динамическим диапазоном (LDR) теряют детали в тенях и бликах, в то время как модель учится производить версии HDR, которые сохраняют детали на разных уровнях яркости и позволяют восстановить насыщенные области через обратное тоновое отображение. Источник
Следовательно, в отсутствие прямых базовых линий для генерации линейных изображений, авторы сравнили свой метод с адаптированными версиями сильных существующих моделей, а не специально разработанными альтернативами.
Одна серия экспериментов («T2I Fine-Tuning») тонко настраивала модель диффузионного текст-изображения Flux с помощью LoRA, обучая ее генерировать линейные изображения напрямую и оценивая, как модель T2I адаптируется к этому домену.
Второе сравнение («T2V fine-tuning») использовало модель текст-видео Wan 2.1, чей VAE сжимает несколько кадров в общее латентное представление; в этом варианте четыре экспозиционных брекета были закодированы в одно латентное представление, а затем декодированы обратно, проверяя, может ли видеоподобный конвейер моделировать изменение экспозиции.
Третья серия экспериментов («T2I Model Inflation») сравнивала с CameraCtrl и Generative Photography, которые расширяют модели диффузионных изображений временными модулями, чтобы производить многофреймовый вывод. Эти модели также были тонко настроены на тех же данных для последовательного сравнения.
Используемые метрики были Fréchet Inception Distance (FID); Аesthetic Score (AS); Naturalness Image Quality Evaluator (NIQUE); CLIP Sim score; и Luminance Similarity (LS):

Сравнение метода авторов с несколькими адаптированными базовыми линиями для генерации линейных, сцено-ориентированных изображений. Модели текст-изображения (Flux) и текст-видео (Wan 2.1) тонко настраиваются с помощью LoRA, чтобы проверить, как существующие генеративные системы справляются с этой обстановкой, в то время как CameraCtrl и Generative Photography расширяют модели диффузии изображений временными компонентами. Некоторые оценки отсутствуют, потому что определенные модели не могут надежно производить последовательные брекеты экспозиции, которые необходимы для восстановления полного динамического диапазона. На протяжении всех сообщаемых метрик новый метод достигает самых сильных результатов в целом, особенно по мерам, связанным с качеством изображения и точной реконструкцией яркости.
Относительно этих результатов авторы заявляют:
«Из-за широкого распределения линейных изображений прямая тонкая настройка модели T2I на линейных данных делает трудным баланс между деталями теней и бликов. Методы инфляции модели T2I страдают как от ограниченного динамического диапазона, так и от значительного ухудшения качества изображения даже после тонкой настройки.
«Для тонкой настройки T2V временное subsampling 4x Wan 2.1 переплетает 4 брекета экспозиции в одно латентное представление, что вызывает серьезное несоответствие распределения, которое не может быть решено только тонкой настройкой.
«Направляя сцено-ориентированные свойства с помощью экспозиционных брекетов, наш метод достигает превосходного визуального качества и динамического диапазона во всех базовых линиях».

Сравнение с тонко настроенными Flux и Wan 2.1, иллюстрирующее, как каждый метод справляется с изменениями экспозиции через одну и ту же сцену. Конкурирующие подходы склонны терять детали в очень темных или очень ярких областях, в то время как предложенный метод сохраняет последовательную структуру и восстанавливает полезные детали на протяжении всего диапазона экспозиций. Пожалуйста, обратитесь к исходной работе и сайту проекта для лучших примеров результатов.
Пожалуйста, обратитесь к разделу дополнительных экспериментов и дополнительных материалов исходной работы для дальнейших тестов.
Вывод
Для медиапрофессионалов, таких как те, кто работает в производстве фильмов и телевидения, тот же вывод, который захватил воображение (и, все чаще, гнев) мира, оставил их безразличными, поскольку все их конвейеры в значительной степени полагаются на захват HDR.
Следовательно, это своевременный проект, представляющий собой функцию, которую можно было бы надеяться, что она станет опциональным стандартом в новых рамках – хотя, безусловно, это, как минимум, удвоит время рендеринга; rõчно, также, задержку необходимо серьезно устранить, если контент ИИ HDR не должен быть отнесен к категории «в посте», а не «в камере».
* Обычно мы бы показали примеры, но поскольку читатель может не иметь монитора, поддерживающего HDR, мы опускаем их в этом случае.
Опубликовано впервые в воскресенье, 26 апреля 2026 года












