Andersonの視点
カメラが撮った写真をAIが変更する前の状態を復元する

カメラ内のAIが写真を自動的に変更する場合、生の写真の純粋さを保護する方法は何ですか?新しい研究では、別のAIプロセスを使用して、処理された画像から推定された生の無加工画像を復元する方法を提案しています。
AI画像の信憑性が過去1年ほどで高まっているため、多くのグループや個人が写真ジャーナリズムへの影響に対して反対しています。
同じ期間中に、コンテンツの出自と真実性のための連合(C2PA)は、画像にメタデータベースの出自情報を付加するための半暗号化標準を拡散しようとしました。これは、サポートされているカメラまたはデバイスで画像がキャプチャされる瞬間から、画像に付加情報を付加することを目的としています。

C2PAシステムの出自のスキーマ、メタデータがキャプチャ時に書き込まれると、日記のように追加できます。明るさやコントラストなどの通常の調整が可能ですが、重大な調整は記録され、C2PAシステムをサポートするメディアアウトレットでは、AIによって大幅に変更された画像が表示されます。 ソース
この標準の採用は、連合が希望したほど広く行われていません。現在、14台のカメラのみが、カメラ内での真実性情報のインプリントをサポートしています。
C2PAのアイデアは、写真に「パスポート」を付けることですが、写真が存在するようになった時点で、すでに遅いかもしれません。なぜなら、カメラメーカーは現在、カメラの画像信号処理器(ISP)内にAI処理を組み込んでいるからです。

2024年の論文「Advocating Pixel-Level Authentication of Camera-Captured Images」より、現代のカメラパイプラインがキャプチャ時にはどのようにしてホールユシナッテッドコンテンツを導入し、ピクセルレベルの認証メタデータによってそれを暴露するかを示す図。 (A)では、スマートフォンのセンサー画像がISPによって処理され、AIモジュールがデジタルズームまたは露出補正中に詳細を発明することができます。 (B)では、認証マスクがメタデータとして埋め込まれ、後にオーバーレイして非認証領域を明らかにし、ユーザーがオリジナルデータとAI変更されたピクセルを区別できるようにします。 ソース
実際、カメラのセンサからの生データに対するこのようなAI「干渉」は、最終的に画像信号処理の主なプロセスになる可能性があります。
このような後処理は、現在のトレンドであるカメラ内での写真の変更とは異なります。ここでは、電話アプリまたはカメラアプリが、写真をデバイスからダウンロードする前に、写真を思い出して編集できるようにします。
むしろ、処理はカメラの「ブラックボックス」ルーチンである画像信号処理器(ISP)内で行われ、通常、生のセンサーデータ(および「純粋な」カメラRAW形式はあまり「生」の状態ではない)を公開または利用できません。
したがって、写真を見られるようになるまでに、AI支援の強化such as 低光量強化、アップスケーリング、または月の置換などの処理を受ける可能性があります。
多くの場合、これにより、テキストなどの不正確な再構築が行われ、画像が証拠として使用できない場合があります。

新しい論文から – RAWセンサ画像がGenAI対応ISPによって最終的なsRGB出力に処理され、明るさが向上しますが、ホールユシナッテッド詳細が含まれる場合があります。ライセンスプレートの例では、デジタルズーム中に文字が誤って推測されます。実際のシーンは、AI強化出力やホールユシナッテーションの前の trung間認証画像とは異なります。提案されたアプローチにより、ホールユシナッテーションの前の画像を回復できます。 ソース
上記の例は、新しい研究論文から来ています。この論文では、別のAIプロセスを使用して、処理された画像から推定された生の無加工画像を復元する方法を提案しています。
著者は次のように述べています:
‘AIモデルがジェネレーティブまたは認識損失で訓練された場合、ISPで使用されると、コンテンツをホールユシナッテーションする可能性があり、画像の[意味]を変更する可能性があります。したがって、カメラから直接出力された画像には「偽」のコンテンツが含まれる場合があります。特に、AI-ISPモジュールの採用が増えているスマートフォンカメラではそうです。 ‘
‘カメラハードウェアでGenAIを使用することは、カメラ画像をどのように見るかという観点から新しいパラダイムシフトを表し、カメラキャプチャ画像の従来のフォレンジック観点に挑戦しています。 ‘
新しい研究では、非常に軽量なエンコーダーとMLPデコーダーを使用します。これらは画像内に含めることができ、重量ペナルティはわずか180kbです。目的は、元の画像コンテンツをリアルタイムで再抽出できるように、高速なエンコードシステムを開発することです。

新しい論文から – カメラISP内のGenAIベースのスーパーリゾリューションにより、顔の特徴が微妙に変更され、表情や目線の変化により、顔の特徴が変更される可能性があります。低光量強化も同様に画像コンテンツを変更し、視覚的な品質を向上させると同時に、解釈に影響を与える可能性があります。QRコードの例では、強化により画像がより魅力的になるが、コードは読み取れなくなります。方法により、ホールユシナッテーションの前の認証画像を回復できます。
代わりに、カメラメーカーはユーザーに真正の未加工のセンサーダンプへのアクセスを提供することができます。しかし、これは高性能機器に限定される可能性があります。モバイルおよび一般消費者向けのスペースでは、未加工の写真へのアクセスは「ニッチ」またはマイナーな追求と見なされる可能性があります。
消費者向けカメラは常に一定レベルの後処理を適用してきましたが、エッジAIの登場以前は、使用されるアルゴリズムは最小限の「解釈」しか行わず、現在のAI方法が行うような意味のある方法で写真のコンテンツを変更する可能性は低かったです。
方法
著者は、ペルターブレーションによるデザインに対処するために、現在のところ唯一のプロジェクトである2024年の論文「Advocating Pixel-Level Authentication of Camera-Captured Images」を使用しています。この論文では、AIによるカメラ内処理によって変更された領域を示す「二値認証マスク」を提案しています。

2024年の論文の「認証マスク」は、カメラのAI「スムージング」プロセスによって影響を受ける天空の領域を示しています。
しかし、このシステムでは、「真の」画像を回復する方法は提供されていませんでしたが、新しい研究ではこれを解決しています。
新しい研究の目的は、処理前にカメラのセンサーが捉えたものとできるだけ近い画像を回復できるようにすることです。

提案された方法の概要。 (A)では、ISP出力画像が凍結された事前訓練エンコーダーを通過し、その潜在的な特徴が空間座標と結合されてMLPに供給され、ホールユシナッテーションされていない画像を予測します。訓練は認証画像に対する損失によって導かれます。エンコーダーとMLPの重みは画像のメタデータとともに保存されます。 (B)では、メタデータからこれらの重みを回復し、エンコーダーとMLPとともにホールユシナッテーションされていない画像を再構築します。
キャプチャ時には、新しい方法では、処理された画像が凍結されたエンコーダーを通過し、コンパクトな潜在的な表現に変換されます。次に、関連する空間座標がこれらの特徴と結合されて、ピクセルごとに操作する軽量MLPに供給され、ホールユシナッテーションされていない画像コンテンツを予測します。ホールユシナッテーションされた要素を、認証ターゲットに対する再構築損失を通じて、効果的に減算します。
エンコーダーとデコーダーは、ペアの認証およびホールユシナッテーションされた画像で事前訓練され、次に各画像ごとに迅速にファインチューニングされます。その重みは画像自体のメタデータとして保存され、サイズのオーバーヘッドはわずかです。
表示時には、保存された重みが抽出され、同じエンコーダーとMLPを実行するために再利用され、カメラのセンサーが元々捉えたものとできるだけ近い画像を回復できるようにします。
データとテスト
著者は、ISPの2つの一般的な後処理タスク、スーパーリゾリューション(SR、ズームされた領域を含む)と低光量写真を使用して、新しい方法をテストしました。
テストの「自然画像」SRセクションでは、多くのテキストの例が含まれていました。なぜなら、ISPのSRルーチンはテキスト(たとえば、車のナンバープレートのテキスト)を変更することが知られているからです。テキストの歪みは独自の離散的な問題であるため、これはSRテストのサブセットとして扱われ、専用のデータが使用されました。
上記のエンコーダーは、テストされた2つのモダリティごとに訓練され、どのAI ISPモジュールがキャプチャ時に使用される可能性が高いかによって選択されました(たとえば、暗い条件では「低光量」モジュール)。
著者は、スーパーリゾリューションの訓練にDIV2Kデータセットを使用しました。これは、人気のあるRealESRGANネットワークによって推進されました。上記の2024年の研究と同様に、ISPの干渉に関するもので、ペアのデータが生成され、影響を受けないコンテンツとホールユシナッテーションされたコンテンツが含まれていました。
テキストSRセクションでは、著者は2023年のMARCONetテキストSRモデルを使用しました。

2023年のMARCONet論文からの、実世界の低解像度テキストと同等のアップスケールテキストの例。 ソース
この場合、研究者は非ホールユシナッテーションされた画像をMARCONetを通じて実行しました。2000枚の画像がプロジェクトの元のコードから生成され、200枚が検証に、さらに200枚がテストに割り当てられました。
低光量テストの場合、LOw-Light(LOL)データセット(2018年の中国論文から)が採用されました。

2018年の中国のLOLデータセットからの、同じ画像の異なる露出と明るさおよび劣化の例。 ソース
ライバルフレームワーク
方法を評価するために、3つの特定のベースラインと比較しました。まず、SIRENとNeRFがペアの認証およびホールユシナッテーションされた画像で事前訓練され、提案されたアプローチと同じ期間でファインチューニングされ、NeRFとの直接的な比較が提供されました。
2番目に、Instant-NGPからのhashgrid方法に基づく学習されたエンコードを使用するMLPが使用され、ハッシュテーブルエントリとMLPが共同で最適化されました。
埋め込みサイズとネットワーク容量は、ターゲットエンコーダーとMLPに一致させられ、実験は画像ごとの最適化からスクラッチ、事前訓練の後にファインチューニングまでをカバーしました。
3番目に、64MBのNAFNetモデルを使用した盲目の画像から画像への翻訳ベースラインが実装され、メタデータへのアクセスなしにピクセルからピクセルへの回帰システムとして訓練されました。
訓練では、AdamオプティマイザがPyTorch上で使用され、事前訓練とファインチューニングの両方で使用されました。エンコーダーとMLPは、50,000のエポックで、バッチサイズ32で訓練され、モダリティごとに事前訓練されたエンコーダーが使用されました(たとえば、SR、テキストSR、低光量)。
ファインチューニングは、NVIDIA V100 GPUで約3秒で行われました。著者は、オンプレミス最適化がターゲット環境およびシナリオであると述べていますが、すべてのフレームワークでこれを実装することは現実的ではなかったため、すべてのテストはデスクトップ環境で実行されました。

メタデータ支援MLPベースのベースライン、SIREN、NeRF、ハッシュグリッド方法、NAFNetを使用した盲回復とのパフォーマンス比較。結果は、DIV2K、MARCONet、LOLの3つのタスクでPSNR(デシベル)として報告され、提案された方法が各タスクで最高スコアを達成しています。
MLPベースのアプローチでは、入力表現によってパフォーマンスが大きく依存し、空間座標のみを使用したモデルは事前訓練で苦労し、ファインチューニング段階で改善できませんでした。色情報を追加すると、より強力な結果が得られました。
NAFNetを使用した盲回復は、DIV2Kで良好な結果を示したが、MARCONetとLOLでは、複数の妥当な再構築が存在し、モデルがこの曖昧さを解消するために必要な情報が不足していたため、壊れました。
この効果は、低光量強化で最も顕著でした。ここでは、元のシーンの明るさを、処理された画像のみから信頼性高く推測することができませんでした。
著者は次のように述べています:
‘MARCONetの合成データでは、さまざまなブラー強度の画像が同じホールユシナッテーション画像にマッピングされます。結果から、提案されたアプローチがすべてのデータセットで競合他社を上回っていることがわかります。’

上記の比較では、写真を撮影したときに、さまざまな方法がどれくらいの時間を費やして実行されるかを示しています。画像ごとにモデルをスクラッチから訓練することは強力な結果をもたらす可能性がありますが、実用的ではありません。
代わりに、著者の方法では、ほとんどの作業が事前に行われ、キャプチャ時には迅速な調整のみが行われ、制限時間内で(3、5、または10秒)優れた結果が得られます。

メタデータ支援MLPベースのベースライン、SIREN、NeRF、ハッシュグリッド方法、NAFNetを使用した盲回復とのパフォーマンス比較。結果は、DIV2K、MARCONet、LOLの3つのタスクでPSNR(デシベル)として報告され、提案された方法が各タスクで最高スコアを達成しています。ソース論文への参照先をご覧ください。
上記の質的結果は、DIV2Kから来ており、強化方法によって目立つホールユシナッテーションが導入されました。GANベースのスーパーリゾリューションモデルは目色を変更し、盲回復は元の画像を再構築するのに苦労しました。NeRFとハッシュグリッドは、窓やテキストなどの構造化された領域でアーティファクトを生成しましたが、提案された方法は認証画像に近いものを生成しました。

最後に、上の図では、明るさを視覚化するためにスケーリングされたLOLデータセットの結果を示しています。
盲回復では、不明な明るさスケールを解決できませんでしたが、提案された方法は、テクスチャをよりよく再構築し、変更された文字(「1」を「i」に戻すなど)を修正し、アーティファクトを追加しませんでした。
結論
「カメラは嘘を言わない」というのは、議論の余地のないことでも、かつて議論の余地のないことでもありませんでした。写真を撮ることと、それを撮影する方法、そしてそれを提示して文脈化する方法についてのすべての決定は、実際には政治的または社会的な決定です。
最も古い後処理方法であるドッジとバーン(長い間Photoshopツールに移行されています)は、高度に主観的な芸術的決定と好みの行為です。
しかし、これは「客観的な」画像キャプチャの目標を諦める理由にはなりません。消費者が、ある程度の困難を伴うとしても、撮影した写真の「生」のセンサーダンプにアクセスできること、または少なくとも、ISPの後処理を非AIアルゴリズムに制限できること、それが好ましい場合に、それが妥当であると思われます。
初版 2026年4月24日












