Andersons vinkel

Å bringe AI-genererte bilder inn i lyset med HDR

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

AI-bilder og -video kan være imponerende, men de er ikke på ‘profesjonell’ standard – et problem som et nytt forskningsprosjekt søker å løse.

 

I den profesjonelle audiovisuelle samfunnet er en av de mest hyppige innvendingene mot AI-inntrengningen den nåværende mangelen på profesjonelle standarder for bilde- og videogjengivelse. Ikke minst av disse er evnen til å arbeide med High Dynamic Range (HDR)-bilder og -video.

HDR-bilder er den moderne ekvivalenten til en 19./20. århundres fotografisk praksis kalt bracketing, hvor samme bilde tas flere ganger med økende mengder lys som tillates å nå filmemulsjonen:

Ovenfor, en kort bracket-sekvens. Innsett nedenfor, den høye dynamiske rekkevidde som kan extrapoleres fra disse fotoene til et enkelt bilde. Kilde – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

Ovenfor, en kort bracket-sekvens. Innsett nedenfor, den høye dynamiske rekkevidde som kan extrapoleres fra disse fotoene til et enkelt bilde. Kilde

I tradisjonell fotografering resulterte dette i flere bilder som kunne, med noen ekspertise og innsats, komponeres til et enkelt trykk som kunne dra nytte av alle de forskjellige detaljnivåene som var tilgjengelige over eksponeringsrekkevidden. Men det var ikke en trivial eller enkel prosess.

Disse dagene kan en ‘auto-bracketed’ bilde sekvens enten produsere flere bilder eller kombineres til et enkelt HDR-bilde – effektivt en multiplisitet av eksponeringer i ett bilde, som HDR-egnede bildebehandlingsapplikasjoner som Photoshop kan iterere gjennom, og tillate fotografen å orkestrere til ett ideelt utgangsbilde.

Hvis du lurer på hvorfor du bør bry deg, eller hvordan denne type ting påvirker din egen fotografering, er illustrasjonen for denne artikkelen ment å demonstrere dette på en kjent måte:

Ovenfor, til venstre ser vi et typisk eksempel på et sRGB (dvs. ikke-HDR)-bilde. Bare å lyse opp (vist til høyre) det gjør ikke vise monstret i skapet, fordi denne detaljen ble kastet når fotografen og de automatiske prosessene i kameraet bestemte hva som skulle prioriteres i bildet:

Nedenfor er en indikasjon (venstre) på hvor ‘utbleket’ forgrunnen ville måtte være ved eksponeringstidspunktet for å registrere skap-monstret i et ikke-HDR-bilde, og (høyre) hvordan monstret blir dyttet inn i mørket når eksponeringen gjøres egnet for de godt opplyste forgrunnsobjektene i stedet:

Nedenfor ser vi den type detalj som kan ‘redde’ fra et HDR-bilde eller bilde-sekvens. I dette tilfelle var monstret ‘gjemt’ i de laveste visuelle registerene i HDR-sekvensen, i et nivå hvor resten av innholdet ville være ‘blåst ut’ i nær-hvit (ovenfor, venstre). Ved å spesifisere at en bred rekke lysnivåer skulle uttrykkes, selektivt, i samme bilde, kan disse dissonante elementene komponeres til ett rasjonelt bilde:

Et ikke-HDR-bilde er kjent som et display-referert bilde, og et høy-gamut HDR-bilde er kjent som et scene-referert bilde.

HDR-video er også en ting, og denne type tonal fleksibilitet og duktilitet gir filmprodusenter en del latitud til å redde, grade og tolke opptak på en rekke kreative og konsistente måter; ikke overraskende, derfor, at kreative er motvillige til å arbeide med den ‘flattet ut’ sRGB-utgangen som er typisk for de fleste generative AI-rammeverk.

HDR i AI

Naturligvis er forskningsscenen interessert i å bringe AI-genererte rammeverk inn i HDR-æraen. Men det er ikke en trivial oppgave, både på grunn av den grunnleggende arkitekturen til diffusjonsbaserte generative systemer, og fordi god HDR-data tar opp mye diskplass, noe som gjør det til en ugreielig samling; følgelig er datasett som er egnet for oppgaven sjeldne.

Likevel tilbyr et samarbeid mellom et universitet i Singapore og Adobe (ADBE ) Research en metode for å produsere HDR-bilde sekvenser, i en metode som teoretisk kan anvendes på video så vel som stillebilder:

Fra prosjektets nettside for det nye arbeidet, eksempler på 'bracketed' tekst-til-bilde-utgang. Kilde -  https://github.com/ykdai/LinearGen

Fra prosjektets nettside for det nye arbeidet, eksempler på ‘bracketed’ tekst-til-bilde-utgang. Kilde

Det nye systemet genererer flere alignerte versjoner av samme bilde på forskjellige lysnivåer og lærer hvordan lyssterkt scenen virkelig var, og kombinerer disse til ett enkelt resultat som beholder detalj i både skygge og høydepunkter, og tillater senere redigeringer av eksponering eller farge å oppføre seg mer som justeringer av en ekte kamerafangst, i stedet for ømfintlige justeringer av en fullt prosessert bilde.

Systemet utnytter en mangfold av forskjellige modeller for oppgaven, inkludert varianter av Qwen og Flux:

Eksempler fra den nye artikkelen, som viser hvordan systemet kan generere flere eksponeringsversjoner av samme scene samtidig som den holder den underliggende strukturen fast. Startende fra en enkel kantkart, produserer modellen konsistente bilder over svært mørke til svært lyse innstillinger, uansett om prompten beskriver månelys, sollys, solnedgang eller selv et lite objekt som en ballong, med subjekt og komposisjon som forblir stabile som bare lysforholdene endres. Metoden kan variere lysstyrke på en kontrollert, kamera-liknende måte, i stedet for å drive eller oppfinne nytt innhold når eksponering skifter.  Kilde  - https://arxiv.org/pdf/2604.21008

Eksempler fra den nye artikkelen, som viser hvordan systemet kan generere flere eksponeringsversjoner av samme scene samtidig som den holder den underliggende strukturen fast. Startende fra en enkel kantkart, produserer modellen konsistente bilder over svært mørke til svært lyse innstillinger, uansett om prompten beskriver månelys, sollys, solnedgang eller selv et lite objekt som en ballong, med subjekt og komposisjon som forblir stabile som bare lysforholdene endres. Metoden kan variere lysstyrke på en kontrollert, kamera-liknende måte, i stedet for å drive eller oppfinne nytt innhold når eksponering skifter.  Kilde

Forfatterne statte:

‘Generering av lineære bilder er utfordrende, siden forhånds-trente VAE i latent diffusjonsmodeller sliter med å bevare både ekstreme høydepunkter og skygge samtidig på grunn av den høyere dynamiske rekkevidden og bit-dybden.

‘Til dette formålet representerer vi et lineært bilde som en sekvens av eksponeringsbraketter, hver som fanger en bestemt del av den dynamiske rekkevidden, og foreslår en DiT-basert flow-matching-arkitektur for tekst-betinget eksponeringsbrakketgenerering.

‘Vi demonstrerer videre nedstrøms-applikasjoner, inkludert tekst-styrt lineært bilde-redigering og struktur-betinget generering via ControlNet.’

Det nye arbeidet har tittelen Lineært bildegenerering ved å syntetisere eksponeringsbraketter, og kommer fra fire forfattere over S-Lab ved Nanyang Technological University, Adobe NextCam og Adobe Research. Foruten den ovennevnte prosjektets nettside og YouTube-video som følger med utgivelsen, finnes det også et (for øyeblikket tomt) GitHub-repo, og et løfte om en datasett-utgivelse.

Selv om forfatterne leverer mange eksempler på utgang fra systemet på den tilknyttede prosjektets nettside, vil seerne måtte ha en HDR-egnet skjerm for å virkelig skille karakteristikkene til HDR-utgangen som presenteres. Likevel finner du forskernes YouTube-oversikt innbettet i slutten av denne artikkelen – men vær klar over at forskjellene mellom viste eksempler kanskje ikke er klare på en ikke-HDR-skjerm.

Metode og data

Forfatterne betoner omfanget av hvilken utfordring datainnsamlingen er i denne bestemte forfølgningen:

‘Innsamling av et stort antall lineære bilder er ekstremt utfordrende i praksis. I tillegg er de fleste offentlige HDR-datasett enten panoramiske (og fokuserer derfor nesten eksklusivt på stor-skala-sceninnhold) eller tilbyr ikke sanne lineære bilder, noe som gjør dem uegnet for våre formål.

‘Derfor bruker vi hovedsakelig RAW-bilde-datasett som basis for trening.’

Forskerne gjorde kreativ bruk av de få valgmulighetene, og utnyttet RAISE-datasettet som faktisk treningdata, og MIT-Adobe FiveK-datasettet som evalueringsdata*.

For å bygge brukbar HDR-treningdata, kjørte forskerne RAW-kamerafilene gjennom en standardisert pipeline for å fjerne kamera-spesifikke egenheter, og konverterte bildene til en konsistent, scene-henvisnings lineært format:

Systemets arbeidsflyt: systemet starter fra støy som representerer fire eksponeringsnivåer av samme scene, sammen med en tekst-prompt og en lysstyrke-token, og prosesserer dem gjennom stablede transformer-blokker som holder de forskjellige eksponeringene alignert mens de justerer for lys. Det predikerer deretter både settet av eksponeringsbilder, samt en total lysstyrke-skala, og dekoder og kombinerer dem til ett enkelt scene-henvisningsbilde, og beholder detalj i både skygge og høydepunkter.

Systemets arbeidsflyt: systemet starter fra støy som representerer fire eksponeringsnivåer av samme scene, sammen med en tekst-prompt og en lysstyrke-token, og prosesserer dem gjennom stablede transformer-blokker som holder de forskjellige eksponeringene alignert mens de justerer for lys. Det predikerer deretter både settet av eksponeringsbilder, samt en total lysstyrke-skala, og dekoder og kombinerer dem til ett enkelt scene-henvisningsbilde, og beholder detalj i både skygge og høydepunkter.

Dette innebar å rekonstruere fullt RGB fra sensor-data, åpne fargekorreksjon, normalisere hvitbalanse, og kortvarig flytte inn i en perceptuell farge-rom for støying før å returnere til en ren lineært signal.

Fordi slike verdier kan variere mye, ble dataene deretter stabilisert ved å skale hver bilde basert på sin egen lysfordelingsstatistikk, ved å bruke mid-område og høydepunktsstatistikk for å unngå både utblekede bilder og blåste høydepunkter, og til slutt å oppnå et normalisert lineært bilde som bevarte den sanne rekkevidden av lys i scenen, samtidig som det forble stabilt nok for trening.

Tekst-etiketter for bildene ble deretter laget med Qwen2.5-VL 7B-modellen, med promter som var laget for å matche egenskapene til Flux-modellen som ville bli brukt ved genereringstid.

Hvert bilde ble delt inn i eksponerings-‘skiver’ og passert gjennom en felles VAE-encoder, som konverterte alle eksponeringer til et felles latent-rom som var designet for å fange den fulle lysrekkevidden. De latente ble deretter finjustert fra støy, og dekodet tilbake til bilder, og tillot konsistent rekonstruksjon over mørke og lyse regioner, uten å kollapse dem til ett enkelt ‘flattet’ eksponeringsnivå.

LoRA-finetuning ble brukt til å tilpasse den forhånds-trente Flux-bakgrunnen til lineært-bilde-data med minimale ekstra-parametre, og hjalp Single-Diffusion Transformers (single-DiT)-modellen å forbli stabil, selv når lysstyrken varierte over eksponeringsbraketter.

Eksponerings-modulasjon-selv-oppmerksomhet (sentral kolonne i skjema-illustrasjon ovenfor) ble introdusert for å prosessere alle braketter sammen, og tillot lysstyrke å justeres per eksponering samtidig som den holdt struktur og fin detalj alignert.

3D-Rotary Positional Embedding (3D-R[o]PE) ble brukt til å kode både romlig posisjon og eksponerings-identitet, så modellen kunne skille hvilken brakett hver token tilhørte, samtidig som den bevarte romlig konsistens, og muliggjorde ren separasjon av lysstyrke-variabilitet fra scen-innhold.

En oversikt over datasettet som brukes i studien, som viser hvordan bildene er fordelt over innholdstyper og innendørs versus utendørs scener, sammen med spredningen av lysverdier i den prosesserte dataen. Histogrammene plott lysstyrke og strålings-skalaen i log-rom, og illustrerer hvordan bredt virkelig lysstyrke kan variere, med høyere strålings-verdier som korresponderer til fysisk lysere scener og høydepunkter den sterke dynamiske rekkevidden modellen er trent til å håndtere.

En oversikt over datasettet som brukes i studien, som viser hvordan bildene er fordelt over innholdstyper og innendørs versus utendørs scener, sammen med spredningen av lysverdier i den prosesserte dataen. Histogrammene plott lysstyrke og strålings-skalaen i log-rom, og illustrerer hvordan bredt virkelig lysstyrke kan variere, med høyere strålings-verdier som korresponderer til fysisk lysere scener og høydepunkter den sterke dynamiske rekkevidden modellen er trent til å håndtere.

3D-RoPE splittet ut hvor en funksjon var og ‘hvilken eksponering den kommer fra’ i separate signaler, så lysstyrke-variabilitet kunne justeres uavhengig, uten å korruptere romlig detalj.

Tester

Forskerne brukte Flux-dev som det generative rammeverket, med trening som skjedde på fire NVIDIA A100-GPU-er, hver med 80GB VRAM. Batch-størrelsen ble satt til 4 (per GPU), over 10 000 iterasjoner.

LoRA-finetuning brukte en rang på 64. AdamW-optimalisatoren ble brukt med en læringssrate på 2×102 (for eksponeringsmodulasjons-aspektet).

Forfatterne påpeker at mens det finnes to tidligere arbeider som er lignende i omfang, var ingen av dem et åpenbart kandidat for en testfase. Max Planck-ledede 2022-utgaven GlowGAN er begrenset til å generere bestemte bilde-kategorier, mens 2025-utgaven Bracket Diffusion (igjen ledet av Max Planck-instituttet) bare kan generere ett HDR-bilde på 256x256px, og tar flere minutter å gjøre det.

Fra den originale GlowGAN-artikkelen, typiske lav-dynamisk-rekke-bilder (LDR) mister detalj i skygge og høydepunkter, mens modellen lærer å produsere HDR-versjoner som beholder detalj over lysnivåer og muliggjør gjenoppretting av mettede områder gjennom invers tone-kartlegging. Kilde - https://arxiv.org/pdf/2211.12352

Fra den originale GlowGAN-artikkelen, typiske lav-dynamisk-rekke-bilder (LDR) mister detalj i skygge og høydepunkter, mens modellen lærer å produsere HDR-versjoner som beholder detalj over lysnivåer og muliggjør gjenoppretting av mettede områder gjennom invers tone-kartlegging. Kilde

Derfor, i fravær av direkte referanser for lineært-bilde-generering, sammenlignet forfatterne sin metode med tilpassede versjoner av sterke eksisterende modeller, i stedet for spesialbygde alternativer.

En rekke eksperimenter (‘T2I Fine-Tuning’) finjusterte tekst-til-bilde-diffusjonsmodellen Flux ved å bruke LoRA, og trente den til å generere lineære bilder direkte, og evaluerte hvordan en state-of-the-art T2I-modell tilpasset seg dette domenet.

En annen sammenligning (‘T2V fine-tuning’) brukte tekst-til-video-modellen Wan 2.1, hvis VAE komprimerer flere rammeverk til en felles latent; i denne oppsettet ble fire eksponerings-braketter kodet inn i en enkelt latent-representasjon, og deretter dekodet tilbake, og testet om en video-liknende pipeline kunne modellere eksponerings-variabilitet.

Den tredje rekken av eksperimenter (‘T2I Model Inflation’) sammenlignet mot CameraCtrl og Generative Photography, som begge utvider bilde-diffusjonsmodeller via temporale moduler, for å produsere multi-ramme-utgang. Disse ble også finjustert på samme data, for en konsistent sammenligning.

Målinger som ble brukt var Fréchet Inception Distance (FID); Estetisk Poeng (AS); Naturlig Bilde-kvalitets-evaluator (NIQUE); CLIP Sim-poeng; og Lysstyrke-Likhet (LS):

En sammenligning av forfatternes metode mot flere tilpassede baselinjer for å generere lineære, scene-henvisnings-bilder. Tekst-til-bilde (Flux) og tekst-til-video (Wan 2.1) modeller er finjustert med LoRA for å teste hvordan eksisterende generative systemer håndterer denne innstillingen, mens CameraCtrl og Generative Photography utvider diffusjonsmodeller med temporale komponenter. Noen poeng mangler, fordi visse modeller ikke kan pålitelig produsere konsistente eksponerings-braketter, som er nødvendige for å gjenopprette full dynamisk rekkevidde. Over de rapporterte målinger, oppnår den nye metoden de sterkeste samlede resultater, spesielt på målinger knyttet til bilde-kvalitet og nøyaktig lysstyrke-gjenoppretting.

En sammenligning av forfatternes metode mot flere tilpassede baselinjer for å generere lineære, scene-henvisnings-bilder. Tekst-til-bilde (Flux) og tekst-til-video (Wan 2.1) modeller er finjustert med LoRA for å teste hvordan eksisterende generative systemer håndterer denne innstillingen, mens CameraCtrl og Generative Photography utvider diffusjonsmodeller med temporale komponenter. Noen poeng mangler, fordi visse modeller ikke kan pålitelig produsere konsistente eksponerings-braketter, som er nødvendige for å gjenopprette full dynamisk rekkevidde. Over de rapporterte målinger, oppnår den nye metoden de sterkeste samlede resultater, spesielt på målinger knyttet til bilde-kvalitet og nøyaktig lysstyrke-gjenoppretting.

Med hensyn til disse resultater, påpeker forfatterne:

‘På grunn av den vide distribusjonen av lineære bilder, gjør direkte finjustering av T2I-modellen på lineær data det vanskelig å balansere skygge- og høydepunkts-detaljer. T2I-modell-inflasjonsmetoder lider av både begrenset dynamisk rekkevidde og betydelig bilde-kvalitets-forverring, selv etter finjustering.

‘For T2V-finetuning, Wan 2.1s 4× temporale ned-sampling sammenfletter de 4 eksponerings-braketter inn i en enkelt latent-representasjon, og forårsaker en alvorlig distribusjons-uforhold som ikke kan løses gjennom finjustering alene.

‘Ved å direkte modellere scene-henvisnings-egenskaper ved å bruke eksponerings-braketter, oppnår vår metode overlegen visuell kvalitet og dynamisk rekkevidde over alle baselinjer.’

En sammenligning med LoRA-tilpasset Flux og Wan 2.1, som viser hvordan hver metode håndterer eksponerings-endringer over samme scener. Konkurrerende tilnærminger tenderer til å miste detalj i svært mørke eller svært lyse regioner, mens den foreslåtte metoden beholder konsistent struktur og gjenoppretter brukbar detalj over hele rekkevidden av eksponeringer.

En sammenligning med LoRA-tilpasset Flux og Wan 2.1, som viser hvordan hver metode håndterer eksponerings-endringer over samme scener. Konkurrerende tilnærminger tenderer til å miste detalj i svært mørke eller svært lyse regioner, mens den foreslåtte metoden beholder konsistent struktur og gjenoppretter brukbar detalj over hele rekkevidden av eksponeringer. Vennligst se kilde-artikkelen og prosjektets nettside for bedre kvalitets-eksempler.

Vennligst se kilde-artikkelen og prosjektets nettside for ytterligere tester.

Konklusjon

For medieprofesjonelle, som de som arbeider i film- og TV-produksjon, har samme utgang som har fanget verden (og, økende, deres ire) har etterlatt dem likegyldige, siden alle deres rørledninger på ett eller annet vis avhenger av HDR-fangst.

Derfor er dette et aktuelt prosjekt, som representerer en fasilitet som en håper vil bli en valgfri standard over nye rammeverk – selv om det er sikkert å doble rendertider; tydelig, også, vil latency måtte håndteres alvorlig hvis HDR-AI-innhold ikke skal begrenses til ‘i post’ i stedet for i-kamera-kategorien.

 

* Vanligvis ville vi vise eksempler, men siden leseren kanskje ikke har en HDR-egnet skjerm, utelater vi disse i dette tilfelle.

Først publisert søndag, 26. april 2026

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai