Погляд Anderson

Впровадження зображень, згенерованих штучним інтелектом, у світло з HDR

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

Зображення та відео, згенеровані штучним інтелектом, можуть бути вражаючими, але вони не відповідають професійним стандартам – проблема, яку намагається вирішити новий дослідницький проєкт.

 

У професійному аудіовізуальному співтоваристві одна з найпоширеніших об’єктивних зауважень щодо поширення штучного інтелекту полягає у відсутності професійних стандартів відтворення зображень і відео. Серед них найважливішими є можливість працювати з високодинамічними зображеннями і відео (HDR).

Зображення HDR є сучасним еквівалентом фотографічної практики 19-20 століть, коли одну й ту ж фотографію робили кілька разів з різним рівнем освітлення, щоб згодом скласти одну фотографію, що містить усі деталі.

Вгорі показана коротка послідовність зображень, зроблених з різним рівнем освітлення. Внизу показано високодинамічне зображення, яке можна отримати з цих фотографій. Джерело – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

Вгорі показана коротка послідовність зображень, зроблених з різним рівнем освітлення. Внизу показано високодинамічне зображення, яке можна отримати з цих фотографій. Джерело

У традиційній фотографії це призводило до появи декількох фотографій, які можна було об’єднати в одну фотографію з усіма деталями.

Сьогодні технологія автоматичної експозиційної компенсації дозволяє робити декілька зображень з різним рівнем освітлення або об’єднати їх в одне HDR-зображення, яке містить усі деталі.

Якщо ви запитуєтеся, чому це важливо, або як це впливає на вашу фотографію, ілюстрація до цієї статті демонструє це.

Вгорі зліва показано типове зображення sRGB (не HDR). Просте збільшення яскравості (праворуч) не показує деталей, оскільки вони були втрачені під час зйомки.

Внизу показано, як би виглядало зображення, якщо б воно було зроблено з високим рівнем освітлення, щоб показати деталі в тіні, але при цьому втратити деталі на світлих ділянках.

Внизу показано, які деталі можна відновити з HDR-зображення. Монстр у кімнаті був “прихований” у низьких візуальних реєстрах HDR-послідовності.

Зображення, яке не є HDR, називається “відображеним зображенням”, а високодинамічне зображення HDR називається “сценним зображенням”.

Відео HDR також існує і надає фільмам велику гнучкість у творчому використанні кадрів.

HDR у штучному інтелекті

Природно, що дослідницька спільнота зацікавлена у впровадженні штучного інтелекту в епоху HDR. Однак це не проста задача, оскільки архітектура генерації зображень на основі штучного інтелекту не підходить для цього, а добрі дані HDR займають багато місця на диску, тому їх бракує.

Однак співпраця між університетом Сінгапуру та дослідницькою лабораторією Adobe (ADBE ) пропонує метод генерації послідовностей зображень HDR, який можна застосувати як до статичних зображень, так і до відео.

Зображення з проєкту, що показують приклади текстово-зображених виходів. Джерело - https://github.com/ykdai/LinearGen

Зображення з проєкту, що показують приклади текстово-зображених виходів. Джерело

Нова система генерує декілька версій одного й того ж зображення з різним рівнем освітлення і вчиться, яким був справжній рівень освітлення сцени, а потім об’єднує ці зображення в одне, яке зберігає деталі в тіні та на світлих ділянках.

Система використовує різноманітні моделі, включаючи варіанти Qwen і Flux:

Приклади з нової статті, що показують, як система може генерувати декілька версій одного й того ж зображення з різним рівнем освітлення, зберігаючи структуру зображення. Починаючи з простої карти контурів, модель генерує послідовні зображення в різних умовах освітлення, зберігаючи стабільність композиції. Джерело - https://arxiv.org/pdf/2604.21008

Приклади з нової статті, що показують, як система може генерувати декілька версій одного й того ж зображення з різним рівнем освітлення, зберігаючи структуру зображення. Джерело

Автори зазначають:

‘Генерування лінійних зображень є складною задачею, оскільки попередньо навчені VAE в моделях дифузії штучного інтелекту мають труднощі з одночасним збереженням крайніх високих і низьких освітлень через вищу динамічну діапазон і глибину біт.’

‘Для цього ми представляємо лінійне зображення як послідовність експозиційних брекетів, кожний з яких захоплює певну частину динамічного діапазону, і пропонуємо архітектуру DiT-based flow-matching для генерації експозиційних брекетів, умовлених текстом.’

‘Ми далі демонструємо додатки, включаючи текстово-кероване лінійне редагування зображень і генерацію, умовлену структурою, через ControlNet.’

Нова робота називається Генерування лінійних зображень шляхом синтезу експозиційних брекетів і була здійснена чотирма авторами з S-Lab у Наньянському технологічному університеті, Adobe NextCam і Adobe Research. Окрім проєктної сторінки та відео на YouTube, існує також (наразі порожній) репозиторій GitHub, а також обіцянка випустити набір даних.

Хоча автори надають багато прикладів виходів системи на сторінці проєкту, глядачам буде потрібно монітор HDR, щоб повністю оцінити характеристики виходу HDR, представлені в цій статті. Тим не менш, знайдіть огляд дослідників на YouTube у кінці цієї статті – проте пам’ятайте, що різниці між показаними прикладами можуть не бути чіткими на моніторі, який не підтримує HDR.

Метод і дані

Автори підкреслюють, наскільки складною є збір даних для цієї задачі:

‘Отримання великої кількості лінійних зображень є надзвичайно складним у практиці. Крім того, більшість публічних наборів даних HDR або є панорамними (тобто фокусуються майже виключно на великомасштабному контенті сцени), або не надають справжніх лінійних зображень, що робить їх непридатними для наших цілей.’

‘Отже, ми в основному використовуємо набори даних RAW-зображень як основу для навчання.’

Дослідники використали наявні варіанти, використовуючи набір даних RAISE як фактичні дані для навчання, а набір даних MIT-Adobe FiveK як дані для оцінки*.

Щоб створити придатні дані HDR для навчання, дослідники пропустили файли камери RAW через стандартизований конвеєр, щоб позбутися камерних особливостей, перетворивши зображення на послідовний лінійний формат:

Схема робочого процесу авторів: система починається з шуму, що представляє чотири рівні експозиції однієї й тієї ж сцени, разом із текстовим промптом і токеном яскравості, і обробляє їх через стекові блоки трансформера, які зберігають різні експозиції, коригуючи освітлення. Потім система передбачає набір зображень експозиції та загальну шкалу яскравості, а потім декодує і об'єднує їх в одне сценічне зображення, зберігаючи деталі в тіні та на світлих ділянках.

Схема робочого процесу авторів: система починається з шуму, що представляє чотири рівні експозиції однієї й тієї ж сцени, разом із текстовим промптом і токеном яскравості, і обробляє їх через стекові блоки трансформера, які зберігають різні експозиції, коригуючи освітлення.

Це включало відновлення повного RGB з даних сенсора, застосування корекції кольору, нормалізацію білого балансу та короткочасний перехід у перцептуальний колірний простір для шумозгладжування, перш ніж повернутися до чистого лінійного сигналу. Фактичне освітлення сцени було відновлено за допомогою налаштувань експозиції камери, так що кожен піксель відбивав справжню яскравість, а не апроксимацію, готову до відображення.

Потім дані були стабілізовані шляхом масштабування кожного зображення на основі його власного розподілу яскравості, використовуючи статистику середнього діапазону та високих світностей, щоб уникнути як вибилих зображень, так і втрачених деталей, і в результаті отримати нормалізоване лінійне зображення, яке зберігає справжній діапазон світла в сцені, залишаючись досить стабільним для навчання.

Текстові мітки для зображень були створені за допомогою моделі Qwen2.5-VL 7B, а промпти були створені так, щоб відповідати характеристикам моделі Flux, яка буде використовуватися під час генерації.

Кожне зображення було розділено на експозиційні “зрізи” і пропущено через спільний VAE-кодувач, перетворивши всі експозиції в спільний латентний простір, призначений для захоплення повного діапазону яскравості. Латентні були потім уточнені з шуму та декодовані назад у зображення, що дозволило здійснити послідовну реконструкцію через темні та яскраві регіони, без колапсу їх у одну “сплющену” експозицію.

LoRA-файнтюнінг був використаний для адаптації попередньо навченої моделі Flux до лінійних даних з мінімальними додатковими параметрами, що допомогло моделі Single-Diffusion Transformers (single-DiT) залишатися стабільною, навіть коли яскравість змінювалася через експозиційні брекети.

Експозиційна модуляційна увага (центральний стовпчик у схемі вище) була введена для спільної обробки всіх брекетів, що дозволило коригувати яскравість за експозицією, зберігаючи структуру та деталі.

3D Ротарі Посіційний Ембеддінг (3D-R[o]PE) був використаний для кодування як просторової позиції, так і ідентичності експозиції, так що модель могла відрізняти, до якого брекету належить кожен токен, зберігаючи просторову консистентність, що дозволило здійснити чистий розріз між зміною яскравості та змістом сцени.

Огляд набору даних, використаного в дослідженні, що показує, як зображення розподілені по типах контенту та індор/аутдор-сценам, поряд з розподілом значень яскравості у оброблених даних. Гістограми відображають світність і шкалу радіанції в логарифмічному просторі, ілюструючи, наскільки широко може варіюватися яскравість у реальному світі, причому вищі значення радіанції відповідають фізично яскравішим сценам і підкреслюють сильний динамічний діапазон, з яким була навчена модель.

Огляд набору даних, використаного в дослідженні, що показує, як зображення розподілені по типах контенту та індор/аутдор-сценам, поряд з розподілом значень яскравості у оброблених даних.

3D-RoPE розділив де була функція і ‘з якого брекету вона походила’ у окремі сигнали, так що зміну яскравості можна було регулювати незалежно, не псуючи просторові деталі.

Тести

Дослідники використали Flux-dev як генеративну основу, з навчанням на чотирьох графічних процесорах NVIDIA A100, кожний з 80ГБ відеопам’яті. Батч-розмір був встановлений на 4 (на графічний процесор), за 10 000 ітерацій.

Файнтюнінг LoRA використовував ранг 64. Оптимізатор AdamW був використаний з темпом навчання 2×102 (для аспекту модуляції експозиції).

Автори зазначають, що хоча є дві попередні роботи, схожі за масштабом, жодна з них не була очевидним претендентом для фази тестування. Робота Max Planck 2022 року GlowGAN обмежена генерацією конкретних категорій зображень, тоді як робота 2025 року Bracket Diffusion (також під керівництвом Інституту Max Planck) може генерувати лише зображення HDR розміром 256×256 пікселів і займає кілька хвилин.

З оригінальної статті GlowGAN, типові зображення з низьким динамічним діапазоном втрачають деталі в тіні та на світлих ділянках, тоді як модель вчиться генерувати зображення HDR, які зберігають деталі через усі рівні яскравості та дозволяють відновлювати засвітлені регіони за допомогою інверсної тону-карти. Джерело - https://arxiv.org/pdf/2211.12352

З оригінальної статті GlowGAN, типові зображення з низьким динамічним діапазоном втрачають деталі в тіні та на світлих ділянках, тоді як модель вчиться генерувати зображення HDR, які зберігають деталі через усі рівні яскравості та дозволяють відновлювати засвітлені регіони за допомогою інверсної тону-карти. Джерело

Отже, у відсутності прямої базової лінії для генерації лінійних зображень автори порівняли свій метод з адаптованими версіями існуючих моделей, а не спеціально розробленими альтернативами.

Одна серія експериментів (‘T2I Fine-Tuning’) файнтюнила модель дифузії текст-ізображення Flux за допомогою LoRA, навчаючи її генерувати лінійні зображення безпосередньо, і оцінювала, як модель T2I адаптується до цього домену.

Друге порівняння (‘T2V fine-tuning’) використовувало модель текст-відео Wan 2.1, чий VAE стискає декілька кадрів у спільне латентне представлення; у цьому сетапі чотири експозиційні брекети були закодовані в одне латентне представлення, а потім декодовані назад, тестуючи, чи може відеоподібний конвеєр моделювати зміну експозиції.

Третя серія експериментів (‘T2I Model Inflation’) порівнювала проти CameraCtrl і Generative Photography, які розширюють моделі дифузії зображень за допомогою тимчасових модулів, щоб генерувати багатокадрові виходи. Ці також були файнтюнені на тих же даних для послідовного порівняння.

Метрики, які були використані, включають Fréchet Inception Distance (FID); Аестетичний бал (AS); Оцінювач якості зображення (NIQUE); CLIP Sim бал; і подібність яскравості (LS):

Порівняння методу авторів з декількома адаптованими базовими лініями для генерації лінійних, сценічних зображень. Моделі текст-ізображення (Flux) і текст-відео (Wan 2.1) файнтюніли з LoRA, щоб протестувати, як існуючі генеративні системи справляються з цією установкою, тоді як CameraCtrl і Generative Photography розширюють моделі дифузії з тимчасовими компонентами. Деякі результати відсутні, оскільки деякі моделі не можуть надійно генерувати послідовні експозиційні брекети, необхідні для відновлення повного динамічного діапазону. По всіх зареєстрованих метриках новий метод досягає найкращих результатів, особливо за показниками, пов'язаними з якістю зображення та точним відновленням яскравості.

Порівняння методу авторів з декількома адаптованими базовими лініями для генерації лінійних, сценічних зображень.

Відносно цих результатів автори зазначають:

‘Через широке розподілення лінійних зображень безпосереднє файнтюнінг T2I Моделі на лінійних даних робить її важкою для балансування деталей тіні та світлих ділянок. Методи T2I Model Inflation страждають від обмеженого динамічного діапазону та суттєвого погіршення якості зображення навіть після файнтюнінгу.’

‘Для T2V Файнтюнінгу 4-кратне тимчасове дownsampling у Wan 2.1 сплітає чотири експозиційні брекети в одне латентне представлення, спричиняючи серйозний розрив у розподілі, який не може бути вирішений лише файнтюнінгом.’

‘Прямим моделюванням сценічних властивостей за допомогою експозиційних брекетів наш метод досягає вищої візуальної якості та динамічного діапазону серед усіх базових ліній.’

Порівняння з LoRA-адаптованим Flux і Wan 2.1, що показує, як кожен метод справляється зі зміною експозиції через одну й ту ж саму сцену. Конкурентні підходи схильні втрачати деталі в дуже темних або дуже яскравих регіонах, тоді як запропонований метод зберігає послідовну структуру та відновлює придатні деталі через весь діапазон експозицій.

Порівняння з LoRA-адаптованим Flux і Wan 2.1, що показує, як кожен метод справляється зі зміною експозіції через одну й ту ж саму сцену.

Просимо звернутися до розширених експериментів і додаткових матеріалів статті для подальших тестів.

Висновок

Для медіапрофесіоналів, таких як ті, хто працює у сфері кіно- та телевиробництва, той же вихід, який захопив уяву (і, дедалі частіше, неоднозначність) світу, залишив їх незадоволеними, оскільки майже всі їхні конвеєри залежать якимось чином від захоплення HDR.

Отже, це своєчасний проєкт, який представляє собою можливість, яку можна сподіватися, що вона стане необов’язковим стандартом для нових конвеєрів – хоча, безумовно, це, як mínimo, подвоїть час рендерингу; ясно також, що затримку потрібно буде серйозно вирішити, якщо HDR-контент штучного інтелекту не повинен бути віднесений до категорії “після обробки”, а не “в камері”.

 

* Зазвичай ми показуємо приклади, але оскільки читачеві може не бути монітором HDR, ми їх тут опускаємо.

Перша публікація – неділя, 26 квітня 2026 року

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai