Kąt Andersona

Przynosząc AI-Generowane Obrazy Do Światła Z HDR

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

Obrazy i filmy AI mogą być imponujące, ale nie są na poziomie “profesjonalnym” – problem, ktÃģry nowy projekt badawczy stara się rozwiązać.

 

W profesjonalnej społeczności audio-wizualnej, jednym z najczęstszych zastrzeÅžeń wobec wkroczenia AI jest brak profesjonalnych standardÃģw reprodukcji obrazu i filmu. Nie mniej waÅžne jest moÅžliwość pracy z obrazami i filmami o wysokiej rozdzielczości dynamicznej (HDR).

Obrazy HDR są nowoczesnym odpowiednikiem 19- i 20-wiecznej praktyki fotograficznej zwanej bracketingiem, gdzie to samo zdjęcie jest robione wielokrotnie z coraz to większą ilością światła, ktÃģre dociera do emulsji filmowej:

PowyÅžej, krÃģtki ciąg bracketowany. Wstawka poniÅžej, wysoka rozdzielczość dynamiczna, ktÃģra moÅže być wywnioskowana z tych zdjęć w jeden obraz. ÅđrÃģdło – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

PowyÅžej, krÃģtki ciąg bracketowany. Wstawka poniÅžej, wysoka rozdzielczość dynamiczna, ktÃģra moÅže być wywnioskowana z tych zdjęć w jeden obraz. ÅđrÃģdło

W tradycyjnej fotografii, skutkowało to wieloma zdjęciami, ktÃģre mogły, przy pewnej wprawie i wysiłku, zostać złoÅžone w jeden wydruk, ktÃģry korzystał z wszystkich rÃģÅžnych poziomÃģw szczegÃģłÃģw dostępnych w całym zakresie ekspozycji. Ale nie było to trywialne ani łatwe.

W dzisiejszych czasach ‘auto-bracketowany’ ciąg zdjęć moÅže albo produkować wiele zdjęć, albo być połączony w jeden obraz HDR – skutecznie wiele ekspozycji w jednym obrazie, ktÃģry aplikacje do edycji obrazu HDR, takie jak Photoshop, mogą przetwarzać i umoÅžliwiać fotografowi stworzenie jednego, idealnego obrazu wyjściowego.

Jeśli zastanawiasz się, dlaczego powinieneś się tym przejmować, lub jak to wpływa na Twoją własną fotografię, ilustracja do tego artykułu ma na celu zademonstrować to w sposÃģb dla Ciebie zrozumiały:

PowyÅžej, po lewej stronie widzimy typowy przykład obrazu sRGB (tj. nie-HDR). Po prostu rozjaśnienie (pokazane po prawej) nie pokazuje potwora w szafie, poniewaÅž ten szczegÃģł został odrzucony, gdy fotograf i automatyczne procesy kamery zdecydowały, co ma pierwszeństwo w zdjęciu:

PoniÅžej jest wskazanie (po lewej) tego, jak “wypłukany” musiałby być pierwszy plan podczas ekspozycji, aby zarejestrować potwora w szafie w zdjęciu nie-HDR, oraz (po prawej) jak potwÃģr zostaje zanurzony w ciemności, gdy ekspozycja jest dostosowana do dobrze oświetlonych osÃģb na pierwszym planie:

PoniÅžej widzimy rodzaj szczegÃģłÃģw, ktÃģre mogą być “uratowane” z obrazu HDR lub ciągu zdjęć. W tym przypadku potwÃģr “ukrywał się” w bardzo niskich rejestrach wizualnych ciągu HDR, na poziomie, na ktÃģrym reszta treści byłaby “wypłukana” w kierunku białego (powyÅžej, po lewej). Poprzez określenie, Åže szeroki zakres poziomÃģw jasności ma być wyraÅžony selektywnie w tym samym obrazie, te sprzeczne elementy mogą być złoÅžone w jeden racjonalny obraz:

Obraz nie-HDR nazywany jest obrazem odniesionym do wyświetlacza, a obraz HDR o wysokiej gamie nazywany jest obrazem odniesionym do sceny.

Film HDR takÅže istnieje, a ten rodzaj giętkości i elastyczności tonalnej daje filmowcom pewną swobodę w ratowaniu, gradacji i interpretowaniu ujęć w rÃģÅžnych kreatywnych i spÃģjnych sposobach; niezbyt zaskakujące, zatem, Åže twÃģrcy są niechętni do pracy z “spłaszczonym” wyjściem sRGB, typowym dla większości generatywnych ram AI.

HDR w AI

Naturalnie, scena badawcza jest zainteresowana wprowadzeniem ram generowanych przez AI do ery HDR. Jednak nie jest to trywialne zadanie, zarÃģwno ze względu na podstawową architekturę systemÃģw generatywnych opartych na dyfuzji, jak i dlatego, Åže dobre dane HDR zajmują duÅžo miejsca na dysku, co sprawia, Åže kolekcje są nieporęczne; w związku z tym, zestawy danych odpowiednie do tego zadania są rzadkie.

Mimo to, wspÃģłpraca między uniwersytetem w Singapurze a Adobe Research oferuje metodę generowania sekwencji obrazÃģw HDR, w metodzie, ktÃģra teoretycznie moÅže być rÃģwnieÅž stosowana do filmÃģw, a nie tylko do statycznych obrazÃģw:

Z witryny projektu nowej pracy, przykłady 'bracketowanych' wynikÃģw obrazu na podstawie tekstu. ÅđrÃģdło - https://github.com/ykdai/LinearGen

Z witryny projektu nowej pracy, przykłady ‘bracketowanych’ wynikÃģw obrazu na podstawie tekstu. ÅđrÃģdło

Nowy system generuje wiele wersji tego samego obrazu przy rÃģÅžnych poziomach jasności i uczy się, jak jasna była scena, a następnie łączy je w jeden wynik, ktÃģry zachowuje szczegÃģły w cieniach i światłach, umoÅžliwiając pÃģÅšniejsze edycje ekspozycji lub koloru, ktÃģre zachowują się jak dostosowania do prawdziwego ujęcia kamery, a nie delikatne poprawki do w pełni przetworzonego obrazu.

System wykorzystuje rÃģÅžnorodność rÃģÅžnych modeli do tego zadania, w tym warianty Qwen i Flux:

<img class="size-full wp-image-414262" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-15.jpg" alt="Przykłady z nowego artykułu, pokazujące, jak system moÅže generować wiele wersji ekspozycji tego samego sceny, zachowując podstawową strukturę. Rozpoczynając od prostego mapy krawędzi, model produkuje spÃģjne obrazy w bardzo ciemnych i bardzo jasnych ustawieniach, niezaleÅžnie od tego, czy podpowiedÅš opisuje światło księŞycowe, słoneczne, zachÃģd słońca, czy nawet mały obiekt, taki jak balon, z podmiotem i kompozycją, ktÃģre pozostają stabilne, podczas gdy tylko oświetlenie się zmienia. Metoda moÅže zmieniać jasność w kontrolowany, podobny do kamery sposÃģb, a nie dryfuje lub wymyśla nową treść, gdy ekspozycja się zmienia. ÅđrÃģdło

Autorzy stwierdzają:

‘Generowanie liniowych obrazÃģw jest trudne, poniewaÅž wstępnie wytrenowane VAE w modelach dyfuzji mają trudności z jednoczesnym zachowaniem ekstremalnych świateł i cieni ze względu na wyÅžszą rozdzielczość dynamiczną i głębię bitową.

‘W tym celu reprezentujemy liniowy obraz jako sekwencję ekspozycji, kaÅžda z ktÃģrych przechwytuje określoną część zakresu dynamicznego, i proponujemy architekturę DiT-based flow-matching do generowania ekspozycji na podstawie tekstu.

‘Ponadto demonstrujemy zastosowania downstream, w tym edycję liniowego obrazu na podstawie tekstu i generację na podstawie struktury za pomocą ControlNet.’

Nowa praca tytułuje się Generowanie liniowych obrazÃģw przez syntezę ekspozycji, i pochodzi od czterech autorÃģw z S-Lab na Nanyang Technological University, Adobe NextCam i Adobe Research. OprÃģcz wspomnianej strony projektu i towarzyszącego filmu wideo, istnieje rÃģwnieÅž (obecnie pusty) repozytorium GitHub, oraz obietnica wydania zbioru danych.

ChociaÅž autorzy dostarczają wiele przykładÃģw wynikÃģw systemu na stronie projektu, widzowie będą musieli mieć monitor HDR, aby naprawdę odrÃģÅžnić cechy prezentowanego wyjścia HDR. Niemniej, proszę znaleŚć wideo przegląd badaczy na YouTube osadzony na końcu tego artykułu – ale bądÅšcie świadomi, Åže rÃģÅžnice między pokazanymi przykładami mogą nie być wyraÅšne na monitorze nie-HDR.

Metoda i Dane

Autorzy podkreślają zakres, w jakim gromadzenie danych jest wyzwaniem w tym konkretnym przedsięwzięciu:

‘Zbieranie duÅžej liczby liniowych obrazÃģw jest niezwykle trudne w praktyce. Ponadto, większość publicznych zbiorÃģw danych HDR albo jest panoramiczna (i koncentruje się prawie wyłącznie na zawartości sceny w duÅžym zakresie), albo nie dostarcza prawdziwych liniowych obrazÃģw, co sprawia, Åže są one nieodpowiednie dla naszych celÃģw.

‘Dlatego głÃģwnie wykorzystujemy zbiory danych obrazÃģw RAW jako podstawę do szkolenia.’

Badacze wykorzystali dostępne opcje w kreatywny sposÃģb, wykorzystując zbiÃģr danych RAISE jako rzeczywiste dane szkoleniowe, oraz zbiÃģr danych MIT-Adobe FiveK jako dane oceny*.

Aby zbudować przydatne dane szkoleniowe HDR, badacze przepuścili pliki kamery RAW przez standaryzowany potok, aby usunąć cechy specyficzne dla kamery, konwertując obrazy w spÃģjny, liniowy format odniesiony do sceny:

System zaczyna od szumu reprezentującego cztery poziomy ekspozycji tej samej sceny, wraz z podpowiedzią tekstu i tokenem jasności, i przetwarza je przez zablokowane bloki transformatora, ktÃģre utrzymują rÃģÅžne ekspozycje wyrÃģwnane, dostosowując do oświetlenia. Następnie przewiduje zarÃģwno zestaw obrazÃģw ekspozycji, jak i ogÃģlną skalę jasności, a następnie dekoduje i łączy je w jeden obraz odniesiony do sceny, zachowując szczegÃģły w cieniach i światłach.

Schemat przepływu pracy autorÃģw: system zaczyna od szumu reprezentującego cztery poziomy ekspozycji tej samej sceny, wraz z podpowiedzią tekstu i tokenem jasności. Następnie przetwarza je przez zablokowane bloki transformatora, ktÃģre utrzymują rÃģÅžne ekspozycje wyrÃģwnane, dostosowując do oświetlenia.

To wymagało odtworzenia pełnego RGB z danych sensorycznych, zastosowania korekcji koloru, normalizacji balansu bieli, oraz krÃģtkiego przejścia w przestrzeń koloru percepcyjnego do redukcji szumu, zanim powrÃģci do czystego sygnału liniowego. Rzeczywiste światło w scenie zostało następnie odzyskane za pomocą ustawień ekspozycji kamery, tak aby kaÅždy piksel odzwierciedlał rzeczywistą jasność, a nie gotową do wyświetlenia aproksymację.

PoniewaÅž takie wartości mogą się znacznie rÃģÅžnić, dane zostały następnie ustabilizowane przez skalowanie kaÅždego obrazu na podstawie jego własnego rozkładu jasności, przy uÅžyciu statystyk średniego zakresu i świateł, aby uniknąć zarÃģwno wypłukanych obrazÃģw, jak i przepalonych świateł, ostatecznie uzyskując znormalizowany liniowy obraz, ktÃģry zachował prawdziwy zakres światła w scenie, pozostając wystarczająco stabilnym do szkolenia.

Etykiety tekstowe dla obrazÃģw zostały następnie utworzone za pomocą modelu Qwen2.5-VL 7B, z podpowiedziami opracowanymi w celu dopasowania do cech modelu Flux, ktÃģry miałby być uÅžyty w czasie generacji.

KaÅždy obraz został podzielony na “plasterki” ekspozycji i przeszedł przez wspÃģlny VAE encoder, konwertując wszystkie ekspozycje w wspÃģlną przestrzeń latentną zaprojektowaną do przechwycenia pełnego zakresu jasności. Latentne zostały następnie wyrafinowane z szumu, a następnie odkodowane z powrotem w obrazy, umoÅžliwiając spÃģjną rekonstrukcję w ciemnych i jasnych regionach, bez ich upłynniania w jedną, “spłaszczoną” ekspozycję.

LoRA fine-tuning został uÅžyty do adaptacji wstępnie wytrenowanego modelu Flux do liniowych danych obrazu z minimalnymi dodatkowymi parametrami, pomagając modelowi Single-Diffusion Transformers (single-DiT) pozostać stabilnym, nawet gdy jasność się zmieniała w ciągu ekspozycji.

Ekspozycja Modulacja Self-Attention (środkowa kolumna w ilustracji schematu powyÅžej) została wprowadzona w celu wspÃģlnego przetwarzania wszystkich ekspozycji, umoÅžliwiając dostosowanie luminancji dla kaÅždej ekspozycji, podczas zachowania struktury i szczegÃģłÃģw wyrÃģwnanych.

3D Rotary Positional Embedding (3D-R[o]PE) zostało uÅžyte do zakodowania zarÃģwno połoÅženia przestrzennego, jak i toÅžsamości ekspozycji, tak aby model mÃģgł odrÃģÅžnić, do ktÃģrej ekspozycji naleÅžy kaÅždy token, przy zachowaniu spÃģjności przestrzennej, umoÅžliwiając czyste rozdzielenie zmiany jasności od zawartości sceny.

Przegląd zbioru danych uÅžytego w badaniu, pokazujący, jak obrazy są rozłoÅžone w rÃģÅžnych typach zawartości i scenach wewnętrznych i zewnętrznych, wraz z rozkładem wartości jasności w przetworzonych danych. Histogramy wykresu luminancji i skali promieniowania w przestrzeni logarytmicznej, ilustrując, jak szeroko moÅže się wahać rzeczywista jasność, z wyÅžszymi wartościami promieniowania odpowiadającymi fizycznie jaśniejszym scenom i podkreślając silny zakres dynamiczny, z ktÃģrym model jest szkolony.

Przegląd zbioru danych uÅžytego w badaniu, pokazujący, jak obrazy są rozłoÅžone w rÃģÅžnych typach zawartości i scenach wewnętrznych i zewnętrznych, wraz z rozkładem wartości jasności w przetworzonych danych.

3D-RoPE rozdzielił gdzie znajdowała się cecha i ‘z ktÃģrej ekspozycji pochodzi’ w oddzielne sygnały, tak aby zmianę jasności moÅžna było dostosować niezaleÅžnie, bez uszkadzania szczegÃģłÃģw przestrzennych.

Testy

Badacze uÅžyli Flux-dev jako ramy generatywnej, z szkoleniem odbywającym się na czterech procesorach NVIDIA A100, kaÅždy z 80GB pamięci VRAM. Rozmiar partii został ustalony na 4 (na GPU), przez 10 000 iteracji.

LoRA fine-tuning uÅžył rangę 64. Optymalizator AdamW został uÅžyty z stawką uczenia 2×102 (dla aspektu modulacji ekspozycji).

Autorzy zauwaÅžają, Åže chociaÅž istnieją dwie poprzednie prace o podobnym zakresie, Åžadna z nich nie była oczywistym kandydatem do fazy testowej. Praca z 2022 roku pod przewodnictwem Max Planck GlowGAN jest ograniczona do generowania określonych kategorii obrazÃģw, podczas gdy Bracket Diffusion (ponownie pod przewodnictwem Max Planck Institute) moÅže generować tylko obraz HDR o rozdzielczości 256x256px i zajmuje kilka minut.

Z oryginalnego artykułu GlowGAN, typowe obrazy o niskiej rozdzielczości dynamicznej tracą szczegÃģły w cieniach i światłach, podczas gdy model uczy się produkować wersje HDR, ktÃģre zachowują szczegÃģły w rÃģÅžnych poziomach jasności i umoÅžliwiają odzyskanie nasycenia przez odwrotną mapę tonalną. ÅđrÃģdło - https://arxiv.org/pdf/2211.12352

Z oryginalnego artykułu GlowGAN, typowe obrazy o niskiej rozdzielczości dynamicznej tracą szczegÃģły w cieniach i światłach, podczas gdy model uczy się produkować wersje HDR, ktÃģre zachowują szczegÃģły w rÃģÅžnych poziomach jasności i umoÅžliwiają odzyskanie nasycenia przez odwrotną mapę tonalną. ÅđrÃģdło

Dlatego w braku bezpośrednich punktÃģw odniesienia dla generowania liniowych obrazÃģw, autorzy porÃģwnali swoją metodę z dostosowanymi wersjami silnych istniejących modeli, a nie specjalnie opracowanymi alternatywami.

Jedna seria eksperymentÃģw (‘T2I Fine-Tuning’) dostosowywała model dyfuzji obrazu na podstawie tekstu Flux przy uÅžyciu LoRA, szkoląc go do generowania liniowych obrazÃģw bezpośrednio, oraz oceniając, jak model T2I o wysokiej wydajności adaptuje się do tego domeny.

Drugie porÃģwnanie (‘T2V fine-tuning’) uÅžyło modelu Wan 2.1 do tekstu na wideo, ktÃģrego VAE kompresuje wiele klatek w jedną latentną reprezentację; w tym ustawieniu, cztery ekspozycje zostały zakodowane w jedną reprezentację latentną, a następnie odkodowane z powrotem, testując, czy potok wideo moÅže modelować zmianę ekspozycji.

Trzeci zestaw eksperymentÃģw (‘T2I Model Inflation’) porÃģwnywał się z CameraCtrl i Generative Photography, ktÃģre oba rozszerzają modele dyfuzji obrazu za pomocą modułÃģw czasowych, aby produkować wyjścia wieloklatkowe. Te rÃģwnieÅž zostały dostosowane do tych samych danych, w celu uzyskania spÃģjnego porÃģwnania.

Metryki uÅžyte to FrÃĐchet Inception Distance (FID); Aesthetic Score (AS); Naturalness Image Quality Evaluator (NIQUE); CLIP Sim score; i Luminance Similarity (LS):

PorÃģwnanie metody autorÃģw z kilkoma dostosowanymi punktami odniesienia do generowania liniowych, odniesionych do sceny obrazÃģw. Modele T2I (Flux) i T2V (Wan 2.1) są dostosowywane za pomocą LoRA, aby przetestować, jak dobrze istniejące generatywne systemy radzą sobie w tym ustawieniu, podczas gdy CameraCtrl i Generative Photography rozszerzają modele dyfuzji o składniki czasowe. NiektÃģre wyniki są brakujące, poniewaÅž niektÃģre modele nie mogą wiernie produkować spÃģjnych ekspozycji, ktÃģre są wymagane do odzyskania pełnego zakresu dynamicznego. W całym zestawie metryk, nowa metoda osiąga najmocniejsze wyniki, szczegÃģlnie w miarach związanych z jakością obrazu i dokładnym odwzorowaniem jasności.

PorÃģwnanie metody autorÃģw z kilkoma dostosowanymi punktami odniesienia do generowania liniowych, odniesionych do sceny obrazÃģw.

W odniesieniu do tych wynikÃģw, autorzy stwierdzają:

‘Ze względu na szeroki rozkład liniowych obrazÃģw, bezpośrednie dostosowanie modelu T2I do liniowych danych sprawia, Åže trudno jest zbalansować szczegÃģły cieni i świateł. Metody T2I Model Inflation cierpią na ograniczony zakres dynamiczny i znaczne pogorszenie jakości obrazu, nawet po dostosowaniu.

‘Dla T2V Fine-Tuning, 4-krotna redukcja czasowa Wan 2.1 łączy cztery ekspozycje w jedną latentną reprezentację, powodując znaczony niezgodność rozkładu, ktÃģry nie moÅže być rozwiązany przez sam dostosowanie.

‘Poprzez bezpośrednie modelowanie właściwości odniesionych do sceny za pomocą ekspozycji, nasza metoda osiąga lepszą jakość wizualną i zakres dynamiczny we wszystkich punktach odniesienia.’

PorÃģwnanie z LoRA-dostosowanym Flux i Wan 2.1, ilustrujące, jak kaÅžda metoda radzi sobie ze zmianą ekspozycji w tych samych scenach. Konkurencyjne podejścia mają tendencję do utraty szczegÃģłÃģw w bardzo ciemnych lub bardzo jasnych regionach, podczas gdy proponowana metoda utrzymuje spÃģjną strukturę i odzyskuje uÅžyteczne szczegÃģły w całym zakresie ekspozycji.

PorÃģwnanie z LoRA-dostosowanym Flux i Wan 2.1, ilustrujące, jak kaÅžda metoda radzi sobie ze zmianą ekspozycji w tych samych scenach.

Proszę odnieść się do sekcji dodatkowych eksperymentÃģw i materiałÃģw uzupełniających w oryginalnym artykule, aby uzyskać więcej testÃģw.

Wnioski

Dla profesjonalistÃģw medialnych, takich jak ci, ktÃģrzy pracują w produkcji filmowej i telewizyjnej, ten sam wynik, ktÃģry zawładnął wyobraÅšnią (i, coraz częściej, zirytowaniem) świata, pozostawił ich obojętnymi, poniewaÅž większość ich potokÃģw zaleÅžy w jakiś sposÃģb od ujęć HDR.

Dlatego jest to projekt w odpowiednim czasie, reprezentujący funkcjonalność, ktÃģrej moÅžna by oczekiwać, Åže stanie się opcjonalnym standardem w nowych ramach – chociaÅž jest pewne, Åže co najmniej podwoi czas renderowania; wyraÅšnie, rÃģwnieÅž, opÃģÅšnienie musi być powaÅžnie rozwiązane, jeśli treści HDR AI nie mają być zepchnięte do kategorii “w postprodukcji” zamiast “w kamerze”.

 

* Zazwyczaj pokazywalibyśmy przykłady, ale poniewaÅž czytelnik moÅže nie mieć monitora HDR, pomijamy je w tym przypadku.

Pierwotnie opublikowane w niedzielę, 26 kwietnia 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]