Andersonの視点

AI生成画像をHDRで明るくする

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

AI画像やビデオは印象的ですが、プロフェッショナルな標準には達していません。新しい研究プロジェクトがこの問題に取り組んでいます。

 

プロフェッショナルなオーディオビジュアルコミュニティでは、AIの進出に対する最も頻繁な反対意見の1つは、プロフェッショナルな画像やビデオの再生のための標準の欠如です。特に、High Dynamic Range(HDR)画像やビデオの扱いが挙げられます。

HDR画像は、19世紀/20世紀の写真技術であるブラケット撮影の現代版です。ブラケット撮影では、同じ写真を複数回、異なる明るさで撮影し、それらを1つの画像に合成します。

上:ブラケット撮影のシーケンス。下:これらの写真から抽出できるHDR。ソース:Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

上:ブラケット撮影のシーケンス。下:これらの写真から抽出できるHDR。 ソース

伝統的な写真では、これらの写真を1つのプリントに合成するために、専門知識と労力が必要でした。しかし、現在では、自動ブラケット撮影が可能で、複数の画像や1つのHDR画像を生成できます。

これらの画像は、HDR対応の画像編集アプリケーションであるPhotoshopで編集できます。Photoshopは、複数の露出レベルを1つの画像に合成し、理想的な出力画像を生成できます。

読者がこれに関心を持つ理由や、自身の写真撮影にどのように影響するかを示すために、この記事のイラストを以下に示します。

上の左側は、典型的なsRGB(非HDR)画像です。ただし、明るさを上げると(右側)、クローゼットの中のモンスターは表示されません。なぜなら、写真を撮影したときに、カメラと自動処理が優先順位を付けたため、詳細が失われたからです。

以下は、前景を明るくするために、非HDR写真でクローゼットの中のモンスターを表示するために必要な露出レベルを示しています。ただし、前景が明るいと、モンスターは暗く表示されます。

以下は、HDR画像または画像シーケンスから抽出できる詳細を示しています。この場合、モンスターはHDRシーケンスの最も低い視覚レジスターに「隠れ」ていました。残りのコンテンツは「白飛び」になります。明るさの広い範囲を選択的に1つの画像に表現することで、これらの矛盾する要素を1つの論理的な画像に合成できます。

非HDR画像は、ディスプレイリファレンス画像と呼ばれます。一方、ハイガムUTのHDR画像は、シーンリファレンス画像と呼ばれます。

HDRビデオもあります。これにより、映画製作者は、創造的にフッテージを救済、グレーディング、解釈できます。したがって、クリエイティブな人々は、ほとんどのジェネレーティブAIフレームワークで見られる「平坦化された」sRGB出力で作業することを躊躇します。

AIにおけるHDR

自然に、研究者はAI生成フレームワークをHDR時代に導入しようとしています。しかし、これは、拡散ベースのジェネレーティブシステムの基本的なアーキテクチャと、HDRデータの大量なディスク容量の両方のため、容易なタスクではありません。したがって、適切なデータセットは希少です。

しかし、シンガポールの大学とAdobe Researchの共同研究により、HDR画像シーケンスを生成する方法が提案されています。この方法は、理論的にはビデオにも適用できます。

新しい研究のプロジェクトサイトから、テキストから画像への「ブラケット」出力の例。ソース - https://github.com/ykdai/LinearGen

新しい研究のプロジェクトサイトから、テキストから画像への「ブラケット」出力の例。 ソース

新しいシステムは、同じ画像の異なる明るさレベルで複数のバージョンを生成し、シーンの明るさを学習し、影とハイライトの両方で詳細を保持した単一の結果を生成します。

システムは、QwenFluxなどのさまざまなモデルを使用しています。

新しい論文からの例。シンプルなエッジマップから始めて、明るさのレベルが異なる同じシーンの複数の露出バージョンを生成し、構成と主題を維持したまま、明るさを制御された方法で変更します。ソース - https://arxiv.org/pdf/2604.21008

新しい論文からの例。シンプルなエッジマップから始めて、明るさのレベルが異なる同じシーンの複数の露出バージョンを生成し、構成と主題を維持したまま、明るさを制御された方法で変更します。 ソース

著者は以下のように述べています。

‘線形画像を生成することは難しい。事前トレーニングされたVAEは潜在的な拡散モデルで、極端なハイライトとシャドウを同時に保存するのに苦労する。’

‘この問題に対処するために、線形画像を露出ブラケットのシーケンスとして表現し、露出ブラケットの生成のためのDiTベースのフロー・マッチング・アーキテクチャを提案します。’

‘さらに、テキスト指示された線形画像編集やControlNetを介した構造条件付き生成などのダウンストリーム・アプリケーションを示します。’

新しい研究は、Linear Image Generation by Synthesizing Exposure Bracketsと題され、シンガポールのNanyang Technological University、Adobe NextCam、Adobe Researchの4人の著者によって行われました。プロジェクトサイトやYouTubeビデオのほか、現在はほとんど空ですが、GitHubリポジトリもあります。

著者はプロジェクトサイトにシステムの出力の多くの例を提供していますが、読者はHDR対応モニターが必要です。ただし、この記事の最後に研究者のYouTube概要を埋め込みますが、非HDRモニターでは違いが明確ではない場合があります。

方法とデータ

著者は、データの収集がこの研究の課題であることを強調しています。

‘線形画像の大量収集は、実践的に非常に困難です。さらに、ほとんどの公開されているHDRデータセットは、パノラマ(大規模なシーンのコンテンツに焦点を当てている)であるか、真の線形画像を提供していないため、当面的には不適切です。’

‘したがって、主にRAW画像データセットをトレーニングの基礎として使用します。’

研究者は、利用可能な選択肢を創造的に活用し、RAISEデータセットを実際のトレーニングデータとして、MIT-Adobe FiveKデータセットを評価データとして使用しました。

HDRトレーニングデータを構築するために、研究者はRAWカメラファイルを標準化されたパイプラインで処理し、カメラ固有の特性を除去し、画像を一貫した線形フォーマットに変換しました。

システムのワークフローのスキーマ。ノイズから開始し、4つの露出レベル、テキストプロンプト、明るさトークンを表現し、それらをスタックされたトランスフォーマーブロックで処理し、露出を調整しながら露出を揃え、最終的に1つのシーンリファレンス画像を生成します。

システムのワークフローのスキーマ。ノイズから開始し、4つの露出レベル、テキストプロンプト、明るさトークンを表現し、それらをスタックされたトランスフォーマーブロックで処理し、露出を調整しながら露出を揃え、最終的に1つのシーンリファレンス画像を生成します。

これには、RGBの完全な再構築、カラーコレクションの適用、ホワイトバランスの正規化、感覚色空間への一時的な移動によるノイズ除去、およびクリーンな線形信号への復帰が含まれます。シーンの実際の光は、カメラの露出設定を使用して回復され、各ピクセルが実際の明るさを反映するようにしました。

これらの値は広範囲にわたる可能性があるため、データは各画像の明るさ分布に基づいてスケーリングされ、ミッドレンジとハイライト統計を使用して、洗い流された画像と吹き飛んだハイライトの両方を避けて、シーンの実際の明るさ範囲を保存した正規化された線形画像が得られました。

画像のテキストラベルは、Qwen2.5-VL 7Bモデルを使用して作成され、プロンプトは、生成時に使用されるFluxモデルと一致するように作成されました。

各画像は露出「スライス」に分割され、共有のVAEエンコーダーを通過し、すべての露出を共通の潜在的な空間に変換し、完全な明るさ範囲を捉えるように設計されました。潜在的な空間はノイズから精製され、画像に戻され、暗い領域と明るい領域の両方で一貫した再構築を可能にしました。

LoRAファインチューニングを使用して、事前トレーニングされたFluxバックボーンを線形画像データに適応させ、最小限の追加パラメータでシングルディフュージョントランスフォーマー(シングルDiT)モデルを安定させました。

露出制御自己注意(上のスキーマの中央列)を導入して、すべてのブラケットを共同で処理し、明るさを露出ごとに調整しながら、構造と細部を揃えることができました。

3D回転位置埋め込み(3D-R[o]PE)を使用して、空間位置と露出IDの両方を符号化し、モデルが各トークンがどのブラケットに属するかを区別しながら、空間的一貫性を維持できるようにしました。

研究で使用されたデータセットの概要。画像のコンテンツタイプと屋内/屋外シーンの分布、および処理済みデータの明るさ値の分布を示しています。ヒストグラムは、輝度と放射度スケールを対数空間でプロットし、実世界の明るさの広い範囲と、モデルが扱う強い動的範囲を示しています。

研究で使用されたデータセットの概要。画像のコンテンツタイプと屋内/屋外シーンの分布、および処理済みデータの明るさ値の分布を示しています。ヒストグラムは、輝度と放射度スケールを対数空間でプロットし、実世界の明るさの広い範囲と、モデルが扱う強い動的範囲を示しています。

3D-RoPEは、どこに機能があるかと、どの露出から来ているかを別々の信号に分割し、明るさの変化を空間の詳細を損なうことなく独立して調整できるようにしました。

テスト

研究者は、Flux-devを生成フレームワークとして使用し、トレーニングは4つのNVIDIA A100 GPUで行われ、各GPUには80GBのVRAMがありました。バッチサイズは4(GPUごとに)で、10,000イテレーションでした。

LoRAファインチューニングでは、ランク64を使用しました。AdamWオプティマイザは、露出制御のための2×102の学習率で使用されました。

使用された指標は、Fréchet Inception Distance(FID);Aesthetic Score(AS);Naturalness Image Quality Evaluator(NIQUE);CLIP Sim score;およびLuminance Similarity(LS)でした。

提案手法と適応済みベースラインの比較。テキストから画像(Flux)とテキストからビデオ(Wan 2.1)モデルをLoRAでファインチューニングして、既存の生成システムがこの設定をどのように処理するかをテストします。CameraCtrlとGenerative Photographyは、拡散モデルを時系列モジュールで拡張しています。いくつかのスコアは欠けているため、モデルは一貫した露出ブラケットを信頼性高く生成できないためです。報告された指標全体で、新しい手法は、特に画像品質と明るさの再構築に関連する指標で、最も強い結果を達成しています。

提案手法と適応済みベースラインの比較。テキストから画像(Flux)とテキストからビデオ(Wan 2.1)モデルをLoRAでファインチューニングして、既存の生成システムがこの設定をどのように処理するかをテストします。CameraCtrlとGenerative Photographyは、拡散モデルを時系列モジュールで拡張しています。いくつかのスコアは欠けているため、モデルは一貫した露出ブラケットを信頼性高く生成できないためです。報告された指標全体で、新しい手法は、特に画像品質と明るさの再構築に関連する指標で、最も強い結果を達成しています。

著者は以下のように述べています。

‘線形画像の直接ファインチューニングは、T2Iモデルをシャドウとハイライトの詳細のバランスをとるようにするのが難しい。T2Iモデルインフレーション方法は、動的範囲が限られているだけでなく、ファインチューニング後でも画像品質が著しく低下する。 ‘

‘T2Vファインチューニングの場合、Wan 2.1の4倍の時間ダウンサンプリングにより、4つの露出ブラケットが1つの潜在的な表現に絡み合い、ファインチューニングのみでは解決できない重大な分布の不一致が生じます。 ‘

‘露出ブラケットを使用してシーンリファレンス特性を直接モデル化することで、私たちの方法は、すべてのベースラインで優れた視覚的な品質と動的範囲を達成します。 ‘

LoRA適応FluxとWan 2.1との比較。各方法が同じシーンの露出の変化をどのように処理するかを示しています。競合するアプローチは、非常に暗いまたは明るい領域で詳細を失う傾向がありますが、提案された方法は、露出の全範囲で構造と詳細を維持します。ソースペーパーの拡張実験と補足資料のセクションを参照してください。

LoRA適応FluxとWan 2.1との比較。各方法が同じシーンの露出の変化をどのように処理するかを示しています。競合するアプローチは、非常に暗いまたは明るい領域で詳細を失う傾向がありますが、提案された方法は、露出の全範囲で構造と詳細を維持します。ソースペーパーの拡張実験と補足資料のセクションを参照してください。

結論

メディアプロフェッショナル、たとえば映画やテレビ番組の制作で働く人々にとって、世界の想像力(そして、増加の一方である)を捉えた出力は、プロフェッショナルな標準を満たしていないため、印象に残りません。ほとんどのパイプラインは、HDRキャプチャに何らかの形で依存しているからです。

したがって、このプロジェクトは適切なタイミングで実施されており、新しいフレームワークでオプションの標準となる機能を表しています。ただし、レンダリング時間は確実に2倍になるでしょう。明らかに、HDR AIコンテンツが「ポストプロダクション」ではなく「カメラ内」カテゴリに留まらないように、待ち時間が重大な問題として扱われる必要があります。

 

* 通常、例を示しますが、読者がHDR対応モニターを持っていない可能性があるため、この場合は省略します。

2026年4月26日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai