Kąt Andersona

Przynosząc AI-Generowane Obrazy Do Światła Z HDR

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

Obrazy i filmy AI mogą być imponujące, ale nie są na poziomie “profesjonalnym” – problem, który nowy projekt badawczy stara się rozwiązać.

 

W profesjonalnej społeczności audio-wizualnej, jednym z najczęstszych zastrzeżeń wobec wkroczenia AI jest brak profesjonalnych standardów reprodukcji obrazu i filmu. Nie mniej ważne jest możliwość pracy z obrazami i filmami o wysokiej rozdzielczości dynamicznej (HDR).

Obrazy HDR są nowoczesnym odpowiednikiem 19- i 20-wiecznej praktyki fotograficznej zwanej bracketingiem, gdzie to samo zdjęcie jest robione wielokrotnie z coraz to większą ilością światła, które dociera do emulsji filmowej:

Powyżej, krótki ciąg bracketowany. Wstawka poniżej, wysoka rozdzielczość dynamiczna, która może być wywnioskowana z tych zdjęć w jeden obraz. Źródło – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

Powyżej, krótki ciąg bracketowany. Wstawka poniżej, wysoka rozdzielczość dynamiczna, która może być wywnioskowana z tych zdjęć w jeden obraz. Źródło

W tradycyjnej fotografii, skutkowało to wieloma zdjęciami, które mogły, przy pewnej wprawie i wysiłku, zostać złożone w jeden wydruk, który korzystał z wszystkich różnych poziomów szczegółów dostępnych w całym zakresie ekspozycji. Ale nie było to trywialne ani łatwe.

W dzisiejszych czasach ‘auto-bracketowany’ ciąg zdjęć może albo produkować wiele zdjęć, albo być połączony w jeden obraz HDR – skutecznie wiele ekspozycji w jednym obrazie, który aplikacje do edycji obrazu HDR, takie jak Photoshop, mogą przetwarzać i umożliwiać fotografowi stworzenie jednego, idealnego obrazu wyjściowego.

Jeśli zastanawiasz się, dlaczego powinieneś się tym przejmować, lub jak to wpływa na Twoją własną fotografię, ilustracja do tego artykułu ma na celu zademonstrować to w sposób dla Ciebie zrozumiały:

Powyżej, po lewej stronie widzimy typowy przykład obrazu sRGB (tj. nie-HDR). Po prostu rozjaśnienie (pokazane po prawej) nie pokazuje potwora w szafie, ponieważ ten szczegół został odrzucony, gdy fotograf i automatyczne procesy kamery zdecydowały, co ma pierwszeństwo w zdjęciu:

Poniżej jest wskazanie (po lewej) tego, jak “wypłukany” musiałby być pierwszy plan podczas ekspozycji, aby zarejestrować potwora w szafie w zdjęciu nie-HDR, oraz (po prawej) jak potwór zostaje zanurzony w ciemności, gdy ekspozycja jest dostosowana do dobrze oświetlonych osób na pierwszym planie:

Poniżej widzimy rodzaj szczegółów, które mogą być “uratowane” z obrazu HDR lub ciągu zdjęć. W tym przypadku potwór “ukrywał się” w bardzo niskich rejestrach wizualnych ciągu HDR, na poziomie, na którym reszta treści byłaby “wypłukana” w kierunku białego (powyżej, po lewej). Poprzez określenie, że szeroki zakres poziomów jasności ma być wyrażony selektywnie w tym samym obrazie, te sprzeczne elementy mogą być złożone w jeden racjonalny obraz:

Obraz nie-HDR nazywany jest obrazem odniesionym do wyświetlacza, a obraz HDR o wysokiej gamie nazywany jest obrazem odniesionym do sceny.

Film HDR także istnieje, a ten rodzaj giętkości i elastyczności tonalnej daje filmowcom pewną swobodę w ratowaniu, gradacji i interpretowaniu ujęć w różnych kreatywnych i spójnych sposobach; niezbyt zaskakujące, zatem, że twórcy są niechętni do pracy z “spłaszczonym” wyjściem sRGB, typowym dla większości generatywnych ram AI.

HDR w AI

Naturalnie, scena badawcza jest zainteresowana wprowadzeniem ram generowanych przez AI do ery HDR. Jednak nie jest to trywialne zadanie, zarówno ze względu na podstawową architekturę systemów generatywnych opartych na dyfuzji, jak i dlatego, że dobre dane HDR zajmują dużo miejsca na dysku, co sprawia, że kolekcje są nieporęczne; w związku z tym, zestawy danych odpowiednie do tego zadania są rzadkie.

Mimo to, współpraca między uniwersytetem w Singapurze a Adobe Research oferuje metodę generowania sekwencji obrazów HDR, w metodzie, która teoretycznie może być również stosowana do filmów, a nie tylko do statycznych obrazów:

Z witryny projektu nowej pracy, przykłady 'bracketowanych' wyników obrazu na podstawie tekstu. Źródło - https://github.com/ykdai/LinearGen

Z witryny projektu nowej pracy, przykłady ‘bracketowanych’ wyników obrazu na podstawie tekstu. Źródło

Nowy system generuje wiele wersji tego samego obrazu przy różnych poziomach jasności i uczy się, jak jasna była scena, a następnie łączy je w jeden wynik, który zachowuje szczegóły w cieniach i światłach, umożliwiając późniejsze edycje ekspozycji lub koloru, które zachowują się jak dostosowania do prawdziwego ujęcia kamery, a nie delikatne poprawki do w pełni przetworzonego obrazu.

System wykorzystuje różnorodność różnych modeli do tego zadania, w tym warianty Qwen i Flux:

<img class="size-full wp-image-414262" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-15.jpg" alt="Przykłady z nowego artykułu, pokazujące, jak system może generować wiele wersji ekspozycji tego samego sceny, zachowując podstawową strukturę. Rozpoczynając od prostego mapy krawędzi, model produkuje spójne obrazy w bardzo ciemnych i bardzo jasnych ustawieniach, niezależnie od tego, czy podpowiedź opisuje światło księżycowe, słoneczne, zachód słońca, czy nawet mały obiekt, taki jak balon, z podmiotem i kompozycją, które pozostają stabilne, podczas gdy tylko oświetlenie się zmienia. Metoda może zmieniać jasność w kontrolowany, podobny do kamery sposób, a nie dryfuje lub wymyśla nową treść, gdy ekspozycja się zmienia. Źródło

Autorzy stwierdzają:

‘Generowanie liniowych obrazów jest trudne, ponieważ wstępnie wytrenowane VAE w modelach dyfuzji mają trudności z jednoczesnym zachowaniem ekstremalnych świateł i cieni ze względu na wyższą rozdzielczość dynamiczną i głębię bitową.

‘W tym celu reprezentujemy liniowy obraz jako sekwencję ekspozycji, każda z których przechwytuje określoną część zakresu dynamicznego, i proponujemy architekturę DiT-based flow-matching do generowania ekspozycji na podstawie tekstu.

‘Ponadto demonstrujemy zastosowania downstream, w tym edycję liniowego obrazu na podstawie tekstu i generację na podstawie struktury za pomocą ControlNet.’

Nowa praca tytułuje się Generowanie liniowych obrazów przez syntezę ekspozycji, i pochodzi od czterech autorów z S-Lab na Nanyang Technological University, Adobe NextCam i Adobe Research. Oprócz wspomnianej strony projektu i towarzyszącego filmu wideo, istnieje również (obecnie pusty) repozytorium GitHub, oraz obietnica wydania zbioru danych.

Chociaż autorzy dostarczają wiele przykładów wyników systemu na stronie projektu, widzowie będą musieli mieć monitor HDR, aby naprawdę odróżnić cechy prezentowanego wyjścia HDR. Niemniej, proszę znaleźć wideo przegląd badaczy na YouTube osadzony na końcu tego artykułu – ale bądźcie świadomi, że różnice między pokazanymi przykładami mogą nie być wyraźne na monitorze nie-HDR.

Metoda i Dane

Autorzy podkreślają zakres, w jakim gromadzenie danych jest wyzwaniem w tym konkretnym przedsięwzięciu:

‘Zbieranie dużej liczby liniowych obrazów jest niezwykle trudne w praktyce. Ponadto, większość publicznych zbiorów danych HDR albo jest panoramiczna (i koncentruje się prawie wyłącznie na zawartości sceny w dużym zakresie), albo nie dostarcza prawdziwych liniowych obrazów, co sprawia, że są one nieodpowiednie dla naszych celów.

‘Dlatego głównie wykorzystujemy zbiory danych obrazów RAW jako podstawę do szkolenia.’

Badacze wykorzystali dostępne opcje w kreatywny sposób, wykorzystując zbiór danych RAISE jako rzeczywiste dane szkoleniowe, oraz zbiór danych MIT-Adobe FiveK jako dane oceny*.

Aby zbudować przydatne dane szkoleniowe HDR, badacze przepuścili pliki kamery RAW przez standaryzowany potok, aby usunąć cechy specyficzne dla kamery, konwertując obrazy w spójny, liniowy format odniesiony do sceny:

System zaczyna od szumu reprezentującego cztery poziomy ekspozycji tej samej sceny, wraz z podpowiedzią tekstu i tokenem jasności, i przetwarza je przez zablokowane bloki transformatora, które utrzymują różne ekspozycje wyrównane, dostosowując do oświetlenia. Następnie przewiduje zarówno zestaw obrazów ekspozycji, jak i ogólną skalę jasności, a następnie dekoduje i łączy je w jeden obraz odniesiony do sceny, zachowując szczegóły w cieniach i światłach.

Schemat przepływu pracy autorów: system zaczyna od szumu reprezentującego cztery poziomy ekspozycji tej samej sceny, wraz z podpowiedzią tekstu i tokenem jasności. Następnie przetwarza je przez zablokowane bloki transformatora, które utrzymują różne ekspozycje wyrównane, dostosowując do oświetlenia.

To wymagało odtworzenia pełnego RGB z danych sensorycznych, zastosowania korekcji koloru, normalizacji balansu bieli, oraz krótkiego przejścia w przestrzeń koloru percepcyjnego do redukcji szumu, zanim powróci do czystego sygnału liniowego. Rzeczywiste światło w scenie zostało następnie odzyskane za pomocą ustawień ekspozycji kamery, tak aby każdy piksel odzwierciedlał rzeczywistą jasność, a nie gotową do wyświetlenia aproksymację.

Ponieważ takie wartości mogą się znacznie różnić, dane zostały następnie ustabilizowane przez skalowanie każdego obrazu na podstawie jego własnego rozkładu jasności, przy użyciu statystyk średniego zakresu i świateł, aby uniknąć zarówno wypłukanych obrazów, jak i przepalonych świateł, ostatecznie uzyskując znormalizowany liniowy obraz, który zachował prawdziwy zakres światła w scenie, pozostając wystarczająco stabilnym do szkolenia.

Etykiety tekstowe dla obrazów zostały następnie utworzone za pomocą modelu Qwen2.5-VL 7B, z podpowiedziami opracowanymi w celu dopasowania do cech modelu Flux, który miałby być użyty w czasie generacji.

Każdy obraz został podzielony na “plasterki” ekspozycji i przeszedł przez wspólny VAE encoder, konwertując wszystkie ekspozycje w wspólną przestrzeń latentną zaprojektowaną do przechwycenia pełnego zakresu jasności. Latentne zostały następnie wyrafinowane z szumu, a następnie odkodowane z powrotem w obrazy, umożliwiając spójną rekonstrukcję w ciemnych i jasnych regionach, bez ich upłynniania w jedną, “spłaszczoną” ekspozycję.

LoRA fine-tuning został użyty do adaptacji wstępnie wytrenowanego modelu Flux do liniowych danych obrazu z minimalnymi dodatkowymi parametrami, pomagając modelowi Single-Diffusion Transformers (single-DiT) pozostać stabilnym, nawet gdy jasność się zmieniała w ciągu ekspozycji.

Ekspozycja Modulacja Self-Attention (środkowa kolumna w ilustracji schematu powyżej) została wprowadzona w celu wspólnego przetwarzania wszystkich ekspozycji, umożliwiając dostosowanie luminancji dla każdej ekspozycji, podczas zachowania struktury i szczegółów wyrównanych.

3D Rotary Positional Embedding (3D-R[o]PE) zostało użyte do zakodowania zarówno położenia przestrzennego, jak i tożsamości ekspozycji, tak aby model mógł odróżnić, do której ekspozycji należy każdy token, przy zachowaniu spójności przestrzennej, umożliwiając czyste rozdzielenie zmiany jasności od zawartości sceny.

Przegląd zbioru danych użytego w badaniu, pokazujący, jak obrazy są rozłożone w różnych typach zawartości i scenach wewnętrznych i zewnętrznych, wraz z rozkładem wartości jasności w przetworzonych danych. Histogramy wykresu luminancji i skali promieniowania w przestrzeni logarytmicznej, ilustrując, jak szeroko może się wahać rzeczywista jasność, z wyższymi wartościami promieniowania odpowiadającymi fizycznie jaśniejszym scenom i podkreślając silny zakres dynamiczny, z którym model jest szkolony.

Przegląd zbioru danych użytego w badaniu, pokazujący, jak obrazy są rozłożone w różnych typach zawartości i scenach wewnętrznych i zewnętrznych, wraz z rozkładem wartości jasności w przetworzonych danych.

3D-RoPE rozdzielił gdzie znajdowała się cecha i ‘z której ekspozycji pochodzi’ w oddzielne sygnały, tak aby zmianę jasności można było dostosować niezależnie, bez uszkadzania szczegółów przestrzennych.

Testy

Badacze użyli Flux-dev jako ramy generatywnej, z szkoleniem odbywającym się na czterech procesorach NVIDIA A100, każdy z 80GB pamięci VRAM. Rozmiar partii został ustalony na 4 (na GPU), przez 10 000 iteracji.

LoRA fine-tuning użył rangę 64. Optymalizator AdamW został użyty z stawką uczenia 2×102 (dla aspektu modulacji ekspozycji).

Autorzy zauważają, że chociaż istnieją dwie poprzednie prace o podobnym zakresie, żadna z nich nie była oczywistym kandydatem do fazy testowej. Praca z 2022 roku pod przewodnictwem Max Planck GlowGAN jest ograniczona do generowania określonych kategorii obrazów, podczas gdy Bracket Diffusion (ponownie pod przewodnictwem Max Planck Institute) może generować tylko obraz HDR o rozdzielczości 256x256px i zajmuje kilka minut.

Z oryginalnego artykułu GlowGAN, typowe obrazy o niskiej rozdzielczości dynamicznej tracą szczegóły w cieniach i światłach, podczas gdy model uczy się produkować wersje HDR, które zachowują szczegóły w różnych poziomach jasności i umożliwiają odzyskanie nasycenia przez odwrotną mapę tonalną. Źródło - https://arxiv.org/pdf/2211.12352

Z oryginalnego artykułu GlowGAN, typowe obrazy o niskiej rozdzielczości dynamicznej tracą szczegóły w cieniach i światłach, podczas gdy model uczy się produkować wersje HDR, które zachowują szczegóły w różnych poziomach jasności i umożliwiają odzyskanie nasycenia przez odwrotną mapę tonalną. Źródło

Dlatego w braku bezpośrednich punktów odniesienia dla generowania liniowych obrazów, autorzy porównali swoją metodę z dostosowanymi wersjami silnych istniejących modeli, a nie specjalnie opracowanymi alternatywami.

Jedna seria eksperymentów (‘T2I Fine-Tuning’) dostosowywała model dyfuzji obrazu na podstawie tekstu Flux przy użyciu LoRA, szkoląc go do generowania liniowych obrazów bezpośrednio, oraz oceniając, jak model T2I o wysokiej wydajności adaptuje się do tego domeny.

Drugie porównanie (‘T2V fine-tuning’) użyło modelu Wan 2.1 do tekstu na wideo, którego VAE kompresuje wiele klatek w jedną latentną reprezentację; w tym ustawieniu, cztery ekspozycje zostały zakodowane w jedną reprezentację latentną, a następnie odkodowane z powrotem, testując, czy potok wideo może modelować zmianę ekspozycji.

Trzeci zestaw eksperymentów (‘T2I Model Inflation’) porównywał się z CameraCtrl i Generative Photography, które oba rozszerzają modele dyfuzji obrazu za pomocą modułów czasowych, aby produkować wyjścia wieloklatkowe. Te również zostały dostosowane do tych samych danych, w celu uzyskania spójnego porównania.

Metryki użyte to Fréchet Inception Distance (FID); Aesthetic Score (AS); Naturalness Image Quality Evaluator (NIQUE); CLIP Sim score; i Luminance Similarity (LS):

Porównanie metody autorów z kilkoma dostosowanymi punktami odniesienia do generowania liniowych, odniesionych do sceny obrazów. Modele T2I (Flux) i T2V (Wan 2.1) są dostosowywane za pomocą LoRA, aby przetestować, jak dobrze istniejące generatywne systemy radzą sobie w tym ustawieniu, podczas gdy CameraCtrl i Generative Photography rozszerzają modele dyfuzji o składniki czasowe. Niektóre wyniki są brakujące, ponieważ niektóre modele nie mogą wiernie produkować spójnych ekspozycji, które są wymagane do odzyskania pełnego zakresu dynamicznego. W całym zestawie metryk, nowa metoda osiąga najmocniejsze wyniki, szczególnie w miarach związanych z jakością obrazu i dokładnym odwzorowaniem jasności.

Porównanie metody autorów z kilkoma dostosowanymi punktami odniesienia do generowania liniowych, odniesionych do sceny obrazów.

W odniesieniu do tych wyników, autorzy stwierdzają:

‘Ze względu na szeroki rozkład liniowych obrazów, bezpośrednie dostosowanie modelu T2I do liniowych danych sprawia, że trudno jest zbalansować szczegóły cieni i świateł. Metody T2I Model Inflation cierpią na ograniczony zakres dynamiczny i znaczne pogorszenie jakości obrazu, nawet po dostosowaniu.

‘Dla T2V Fine-Tuning, 4-krotna redukcja czasowa Wan 2.1 łączy cztery ekspozycje w jedną latentną reprezentację, powodując znaczony niezgodność rozkładu, który nie może być rozwiązany przez sam dostosowanie.

‘Poprzez bezpośrednie modelowanie właściwości odniesionych do sceny za pomocą ekspozycji, nasza metoda osiąga lepszą jakość wizualną i zakres dynamiczny we wszystkich punktach odniesienia.’

Porównanie z LoRA-dostosowanym Flux i Wan 2.1, ilustrujące, jak każda metoda radzi sobie ze zmianą ekspozycji w tych samych scenach. Konkurencyjne podejścia mają tendencję do utraty szczegółów w bardzo ciemnych lub bardzo jasnych regionach, podczas gdy proponowana metoda utrzymuje spójną strukturę i odzyskuje użyteczne szczegóły w całym zakresie ekspozycji.

Porównanie z LoRA-dostosowanym Flux i Wan 2.1, ilustrujące, jak każda metoda radzi sobie ze zmianą ekspozycji w tych samych scenach.

Proszę odnieść się do sekcji dodatkowych eksperymentów i materiałów uzupełniających w oryginalnym artykule, aby uzyskać więcej testów.

Wnioski

Dla profesjonalistów medialnych, takich jak ci, którzy pracują w produkcji filmowej i telewizyjnej, ten sam wynik, który zawładnął wyobraźnią (i, coraz częściej, zirytowaniem) świata, pozostawił ich obojętnymi, ponieważ większość ich potoków zależy w jakiś sposób od ujęć HDR.

Dlatego jest to projekt w odpowiednim czasie, reprezentujący funkcjonalność, której można by oczekiwać, że stanie się opcjonalnym standardem w nowych ramach – chociaż jest pewne, że co najmniej podwoi czas renderowania; wyraźnie, również, opóźnienie musi być poważnie rozwiązane, jeśli treści HDR AI nie mają być zepchnięte do kategorii “w postprodukcji” zamiast “w kamerze”.

 

* Zazwyczaj pokazywalibyśmy przykłady, ale ponieważ czytelnik może nie mieć monitora HDR, pomijamy je w tym przypadku.

Pierwotnie opublikowane w niedzielę, 26 kwietnia 2026

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai