Andersonの視点
AIを使用してフィルムグレインをシミュレートする

アメリカをグレインに戻せ:新しいAIツールは古い映像からフィルムグレインを除去し、ビデオを元のサイズの小さな部分に圧縮し、視聴者が気づかないようにグレインを再度適用します。既存のビデオ標準と互換性があり、帯域幅を最大90%削減しながら、ヴィンテージな外観を維持します。
私たちが映画や古いテレビ番組を観る多くの人にとって、フィルムグレインの「さざ波」は安心感を与えてくれます。私たちがそれを意識的に認識するかどうかに関係なく、グレインは私たちが化学薬品で作られたものを観ていることを伝え、体験を物理的世界に結び付け、フィルムの選択、露出、研究所の処理、過去の時代に結び付けます。
<img class="size-full wp-image-219345" src="https://www.unite.ai/wp-content/uploads/2025/06/grain-styles-in-hollywood.jpg" alt="ハリウッドのグレインへのアプローチは、文化と制作方法の変化とともに変化してきました。1960年代には、カメラストックと写真技術の進化が十代の独自の視覚的なアイデンティティに貢献しました。後で、デジタルで作業する監督たちは意図的にグレインを再導入しました。1980年代半ばには、監督のジェームズ・キャメロンは、エイリアン(1986年、上記の画像の右下)に特に粗いコダックのフィルムを選択しました。恐らくは雰囲気を高めるためであり、また実用的なVFXミニチュアワークのワイヤーを隠すのにも役立ちました。 ソース:https://archive.is/3ZSjN(私の最新の記事)
アナログテクスチャーは、メディアの制作が実際の金銭を費やし、 アクセスが制限され、少なくともある程度の実力を持ち、決心のある人だけが制作できる時代のものです。リアリズムと信頼性の代名詞であり、高解像度のキャプチャ技術によってそれが除去されると、郷愁となりました。
クリストファー・ノーランは<あなたはここで切り替えませんでした。業界の大多数がデジタルを採用した一方で、監督はセルロイドにこだわり、規律と美学の両方としてそれを主張しました。
デニス・ヴィルヌーヴはデジタルパイプラインの中で作業していますが、フィルムの処理を経由して映像を解析しています。デジタルで撮影されたデューンの映画では、映像をフィルムに焼き付け、そしてデジタルにスキャンしなおすだけです。雰囲気と効果のためだけにです。
偽のグレイン
フィルムやテレビの品質の愛好家は、グレインを高解像度と関連付けます。ここで、ビットレート(各フレームに押し込まれるデータの量)は非常に高く、最も小さな詳細、たとえばハライドグレインまでが保存されます。
しかし、ストリーミングネットワークが実際にそのようなビットレートを提供した場合、ネットワーク容量に大きな負担がかかり、バッファリングやストッタリングが発生する可能性があります。したがって、Netflixなどのプラットフォームは、コンテンツの最適化されたAV1バージョンを作成し、AV1コーデックの機能を使用して、フィルムまたはエピソードに知的で適切な方法でグレインを追加します。そうすることで、30%の帯域幅を節約できます。

AV1は人工的なフィルムグレインを組み込むように設計されています。 ソース:https://waveletbeam.com/index.php/av1-film-grain-synthesis
「グレインのフェティシズム」は、ヴィンテージの復活などのアナログ的なトレンドと同様に、比較的珍しいデジタルの同等物であり、ストリーミングプロバイダーが最適化されたビデオを「生」のビデオのように見せるために使用するか、4:3の古い番組がワイドスクリーンアスペクト比に切り抜かれたときに視覚的な品質の低下を軽減するために使用するか、または一般的に「ノーランの美学」を追求するために使用するかは、判断が難しいです。
グレインの囲い込み
問題は、グレインはノイズであるということです。デジタルシステムはノイズを嫌い、ストリーミングコーデックであるAV1は、グレイン設定が明示的に構成されていない限り、帯域幅を節約するためにそれを除去します。同様に、AIアップスケーラーであるTopaz Gigapixelシリーズは、グレインを修正するべき欠陥として扱います。
拡散ベースの画像合成の分野では、グレインは極めて生成が困難です。なぜなら、極めて詳細なものを表すからです。したがって、通常は大量に過剰適合したモデルでのみ現れます。なぜなら、潜在的な拡散モデル(LDM)アーキテクチャは、ノイズ(たとえばグレイン)を明確な画像に分解するように設計されているからです。メディアの特性としてグレインの斑点を扱うのではなく、ノイズを除去することです。
したがって、機械学習を使用してグレインを生成することは困難です。さらに、できたとしても、直接最適化されたビデオにレンダリングすると、ビデオのファイルサイズが再び膨張してしまうでしょう。
この後者の論理的配慮により、最先端のビデオコーデックであるVersatile Video Coding(VVC)は、グレインを「サイドカー」サービスとして提供します。
VVCは、グレインを除去したクリーンなデノイズされたビデオを圧縮し、グレインを廃棄します。ランダムな高周波グレインパターンを保存するためにデータを浪費するのではなく、グレインを別々に分析し、再生する方法を記述する一連のパラメータ(たとえば、振幅、周波数、ブレンドモード)をエンコードします。
これらのパラメータは、FGC-SEI(フィルムグレイン特性補足強化情報)ストリームに保存され、メインビットストリームと並行して配置されます。デコード後、合成モジュールはこれらの指示に従って、元のものと似たグレインを再適用します。
これにより、高ビットレート、グレイン豊富なエミュルションの「外観」が保存され、実際のビットレートは低く維持されます。エンコーダーは、予測不可能なノイズを保存するためにリソースを浪費する必要がないからです。
さらに、字幕ファイルと同様に、この偽の「グレイン」コンテンツは、ビデオに固有です。PhotoshopやAfter Effectsなどのプラットフォーム、または自動処理パイプラインで、雑然とした汎用グレインフィルタを適用することは、フィットしたグレインではなく、ノイズの無関係なオーバーレイにつながります。
<img class=" wp-image-219347" src="https://www.unite.ai/wp-content/uploads/2025/06/grain-comparison.jpg" alt="左:元の画像。中央:Photoshop Camera Rawグレインをすべてのチャンネルに均一に適用。右:同じグレインフィルタを個別に各チャンネルに適用。ソース画像(CC0):https://stocksnap.io/photo/woman-beach-FJCOO6JWDP(私の前の記事から)
Photoshopの「グレイン」フィルタは、ランダムなノイズを均一に追加します。しかし、実際のフィルムグレインは、さまざまなサイズのハライド結晶から来ます。フィルタを各チャンネルに個別に適用する(上の画像を参照)と、さらに混乱が生じ、リアリズムは生まれません。実際のフィルムグレインは、露光の瞬間に層状のエミュルションに光が当たる方法を反映します。シミュレートするには、各画像領域がどのようにハライド層を活性化したかを推定する必要があります。RGB層を単に分割するのではなく。
FGA-NN
この疑わしい追求の中に、フランスからの新しい研究論文が登場しました。簡潔ですが興味深い出会いであり、グレインを分析して再現するための量的にも質的にも優れた方法を提供しています。

さまざまな分析および合成方法の結果とグラウンドトゥルースグレインの比較。 ソース:https://arxiv.org/pdf/2506.14350
新しいシステム、FGA-NNは、従来のガウシアンベースのグレイン合成の使用から離れません。標準のVVC互換方法、Versatile Film Grain Synthesis(VFGS)を使用します。システムが変更するのは、分析です。より正確な合成パラメータを推定するために、ニューラルネットワークを使用します。
したがって、最終的なグレインは、依然として従来のガウシアンモデルを使用して合成されます。しかし、ネットワークは、規則ベースのジェネレーターにより良いメタデータを提供し、最先端のモデルを取得します。
新しい論文は、FGA-NN:フィルムグレイン分析ニューラルネットワークと題されています。InterDigital R&D、Cesson-Sévignéの3人の研究者によるものです。この論文は長くないですが、新しい方法が提供する進歩のいくつかの重要な側面を見てみましょう。
方法
要約すると、FGA-NNシステムはグレインのあるビデオを入力として受け取り、グレインのコンパクトな説明を抽出し、標準化されたFGC-SEI形式のパラメータを出力します。これらのパラメータは、ビデオとともに送信され、デコーダーがVFGSを使用してグレインを再構築できるようにします。直接グレインをエンコードするのではなく。

FGA-NNを使用したフィルムグレインの分析とビデオ配信への再適用のスキーマ。合成にはVFGSを使用します。
ネットワークを訓練するには、グレインのあるビデオと対応するFGC-SEIメタデータのペアが必要です。大多数のグレインのある映像にはこのようなメタデータがないため、研究者はFGC-SEIパラメータを生成し、クリーンなビデオに合成グレインを適用し、これらを訓練例として使用しました。
FGA-NNの訓練データは、BVI-DVCとDIV2Kのデータセットからクリーンな映像に合成グレインを適用することによって作成されました。ランダム化されたFGC-SEIパラメータは生成され、VFGSシンセシストoolとともに使用され、各グレインのあるビデオが既知のメタデータとペアになることができました。
現在のビデオ標準でサポートされている周波数ベースのモデルは使用され、パラメータ範囲は視覚的な妥当性を維持するためにルーマとクロマの両方のチャンネルで制限されました。
FGA-NNの新しいコレクションの訓練データは、BVI-DVCとDIV2Kのデータセットからクリーンな映像に合成グレインを適用することによって作成されました。ランダム化されたFGC-SEIパラメータは生成され、Versatile Film Grain Synthesis(VFGS)ツールとともに使用され、各グレインのあるビデオが既知のメタデータとペアになることができました。

BVI-DVCとDIV2Kのデータセットに適用されるランダム化されたFGC-SEIパラメータの範囲の概要。パラメータは、ルーマとクロマの両方のチャンネルで視覚的に妥当な結果を保つために制限されました。
現在のコーデック実装でサポートされている唯一の合成方法である周波数フィルタリングモデルが使用されました。パラメータ範囲は、視覚的な妥当性を維持するために、ルーマとクロマの両方のチャンネルで制限されました。
ネットワーク効果
FGA-NNには、ルーマとクロマの両方に特化した2つの調整されたモデルがあり、それぞれがリアリスティックなフィルムグレインを再現するために必要な特定のパラメータを予測するように設計されています。
各入力画像について、システムは一連の強度間隔、各間隔に結び付けられたスケーリング係数、水平および垂直のカットオフ周波数、およびLog2Scaleという全体的なスケーリング係数を推定します。共有された特徴抽出器を使用して、グレインのある入力から特徴を抽出し、4つの個別の出力ブランチにフィードして、各々が異なる予測タスクを担当します。

FGA-NNのルーマバージョンのアーキテクチャ。共有されたバックボーンがグレインのある入力フレームから特徴を抽出し、4つの出力ブランチに続き、それぞれが間隔の境界、スケーリング係数、カットオフ周波数、全体的なLog2Scaleの予測タスクに特化しています。クロマネットワークは、入力と出力の次元が調整された同じ構造を使用します。
間隔の境界は、回帰を使用して予測され、スケーリング係数、カットオフ周波数、および全体的なスケーリング設定は、分類問題として扱われます。
アーキテクチャは、各タスクの複雑さを反映して調整され、より微妙な予測には内部層が大きく使用されます。特に、クロマモデルはルーマ構造を反映していますが、色データの特性に適応しています。
訓練とテスト
FGA-NNは、4つの目的関数を使用して訓練されました。各々が、予測タスクの1つに合わせて設計されています。分類出力には、予測ラベルとグラウンドトゥルースの間のギャップを減らすために、交差エントロピー損失が使用されました。
間隔の境界は0から1の範囲に正規化され、指数関数的にスケーリングされたL1 損失(expL1)が使用され、より大きなエラーに対してより重いペナルティを課すとともに、単調性ペナルティが使用され、下向きの傾向を阻止しました。4つの損失は組み合わせられ、カットオフとスケーリング係数には高い重みが割り当てられ、間隔の境界とLog2Scaleにはそれぞれ1と0.1の重みが割り当てられました。
訓練は、Adamオプティマイザを使用して、学習率5e-4、バッチサイズ64で10,000イテレーションで実行されました。
比較可能なツールは、FGC-SEI形式の値を生成するFGA-CONVENTでした。これは、グレイン処理に使用されます。両方のシステムは、実際のフィルムグレインを含むUHDシーケンスでテストされ、JVET主観評価セットを使用しました。

各方法から得られたパラメータを使用してVFGSによって生成された、同じクロップされたフレーム。対応するルーマ推定値は、グラウンドトゥルース値(VFGSを使用して手動で設定)に対してプロットされています。
著者は以下のように述べています:
‘FGA-NNは、グラウンドトゥルースのフィルムグレインパターンと振幅の全体的な傾向を正確に捉え、グラウンドトゥルースのものと視覚的に似たフィルムグレインを持つシンセシス画像を生成します。 ‘
‘一方、FGA-CONVENTは、設計上、スケーリング係数が低く、Log2Scale係数が低いことが多く、グラウンドトゥルースよりも粗いフィルムグレインパターンを生成し、異なったが視覚的に一貫した外観になります。 ‘
グラウンドトゥルースのグレインパラメータとの直接的な比較は信頼できないと述べています。スケーリングとLog2Scaleは相互に補償でき、軽微なエラーは視覚的な影響が少ないことが多いと指摘しています。
信仰の試み
フィルムグレインの忠実度は、4つのワークフローでベンチマークされました:FGA-NN with VFGS、FGA-CONVENT plus VFGS、Style-FG、および3R-INN。テストには、FGC-SEIとFilmGrainStyle740kの両方のデータセットを使用し、Learned Perceptual Similarity Metrics(LPIPS)、JSD-NSS、およびKullback–Leibler(KL)ダイバージェンスを使用して、出力とグラウンドトゥルースを比較しました。

FilmGrainStyle740kデータセットのベンチマーク結果。Style-FGと3R-INNは、このセットで訓練されたため、最も優れた結果を達成し、FGA-NNはそれに続きます。FGA-CONVENTは、多フレーム分析と同質な領域への依存性のため、特にこのテストケースでは劣る結果を示します。
著者は以下のように述べています:
‘FilmGrainStyle740kテストセットでは、Style-FGと3R-INNが最も優れた結果を達成し、FGA-NNがそれに続きます。FGA-CONVENTは、多フレーム分析と同質な領域への依存性のため、特にこのテストケースでは劣る結果を示します。 ‘
‘これは、分析が同質な領域と複数フレームの情報を利用することに依存しているため、現在の評価では単一の低解像度画像(256×256から最大768×512)が提供され、しばしば大量のテクスチャを含むため、FGA-CONVENTをこのような小さな画像に適用することは不可能になるからです。 ‘
‘これは、従来の分析方法にさらに課題をもたらします。 ‘
最後に、著者は、Style-FGや3R-INNのような学習ベースの方法は、キュレーションされたデータセットで強力な視覚的な結果を生み出すが、計算コストが高いため、エンドユーザーデバイスでの展開には適していないと指摘しています。

さまざまな分析およびシンセシスワークフローを使用して低ビットレートフレームを強化した比較。
対照的に、新しい論文で提案されたアプローチは、軽量なFGA-NN分析モジュールとハードウェアに優しいVFGSシンセシス方法を組み合わせ、圧縮ビデオへのフィルムグレインの再導入に実用的な展開可能な解決策を提供します。
著者は、FGA-NNの利点は、規模で大きなものになる可能性があると述べています:
‘FGA-NNを使用したフィルムグレイン分析およびシンセシスワークフローを使用して、UHDビデオをフィルムグレインとともに中から低ビットレートでエンコードすると、高ビットレートエンコードと比較して最大90%のビットレート削減が可能になります。 ‘
結論
フィルムグレインへの執着は、ポストアナログ時代の最も奇妙で最も興味深い特徴の1つであり、アナログの限界が今では真実性と本物さのシンボルになっていることに注目するのは興味深いことです。
注目すべきは、最先端のグレイン再現方法、最新の革新を含め、光が写真化学プロセスのハライド層に作用する真の効果を正確に捉えることができないということです。さまざまな条件下でです。
2025年6月18日水曜日に最初に公開されました












