Andersonの視点
JPEG AIは実と合成の線を曖昧にする

今年の2月、JPEG AI国際標準が公開されました。これは、機械学習技術を使用して、知覚品質の低下なしに画像コーデックを小さくし、転送や保存が容易になるようにするための数年間の研究の結果です。

JPEG AIの公式公開ストリームからのPeak Signal-to-Noise Ratio(PSNR)とJPEG AIのML拡張アプローチの比較。 ソース:https://jpeg.org/jpegai/documentation.html
この発表があまり注目されなかった理由の1つは、コアPDFが無料アクセスポートル such as Arxivを介して利用できないことです。ただし、ArxivはすでにJPEG AIのさまざまな側面を調査したいくつかの研究を発表しています。たとえば、メソッドの特殊な圧縮アーティファクトや法医学への影響などです。

JPEG AIの前のドラフトの圧縮アーティファクトを比較した研究は、新しいメソッドがテキストをぼかす傾向があることを発見しました。 ソース:https://arxiv.org/pdf/2411.06810
JPEG AIは、シンセティック画像ジェネレーターのアーティファクトを模倣するように画像を変更するため、既存の法医学ツールは本物と偽の画像を区別するのに苦労します。

JPEG AI圧縮後の最新のアルゴリズムは、ローカリゼーションマップで本物のコンテンツと操作された領域を信頼性的に区別できなくなります。 ソース:https://arxiv.org/pdf/2412.03261
その理由の1つは、JPEG AIが、法医学ツールが検出しようとしている生成系と似たモデルアーキテクチャを使用していることです。

新しい論文は、AI駆動の画像圧縮と実際のAI生成画像の方法論の類似性を示しています。 ソース:https://arxiv.org/pdf/2504.03191
したがって、両方のモデルは、法医学的観点から見て、似た潜在的な視覚的特性を生み出す可能性があります。
量子化
この重複は、両方のアーキテクチャで共通する量子化のため発生します。これは、機械学習で連続データを離散データポイントに変換する方法として、また、トレーニング済みモデルのファイルサイズを大幅に削減できる最適化技術として使用されます(カジュアルな画像合成の愛好家は、公式モデルのリリースと、ローカルハードウェアで実行できるコミュニティ主導の量子化バージョンの間の待ち時間に慣れています)。
この文脈では、量子化とは、画像の潜在的な表現内の連続値を固定された離散ステップに変換するプロセスを指します。JPEG AIは、このプロセスを使用して、画像を保存または転送するために必要なデータ量を削減し、内部の数値表現を簡素化します。
量子化によりエンコーディングが効率化される一方で、生成モデルが残すアーティファクトに似た構造的規則性を課すため、法医学ツールを混乱させることになります。
これに対応するために、新しい研究では、JPEG AI画像を検出するための、解釈可能な非ニューラル手法を提案しています。画像が再圧縮されたかどうかを判断し、JPEG AIで圧縮された画像とAIモデルで生成された画像を区別します。
方法
色相関連性
論文では、JPEG AI画像用に3つの「法医学的手がかり」を提案しています。色チャネル間の相関、画像品質の測定可能な歪み、潜在的な量子化パターンです。
色相関連アプローチについては、JPEG AIの前処理パイプラインが画像の色チャネル間に統計的依存関係を導入し、これが法医学的手がかりとなることが示唆されています。
JPEG AIは、RGB画像をYUV色空間に変換し、4:2:0クロマサブサンプリングを実行します。これには、圧縮前に色差信号をダウンサンプリングすることが含まれます。このプロセスにより、赤、緑、青のチャネルの高周波残差間に微妙な相関が生じます。これらの相関は、圧縮されていない画像には存在せず、伝統的なJPEG圧縮またはシンセティック画像ジェネレータによって生成されるものとは異なります。

JPEG AI圧縮が画像の色相関連性に与える影響の比較。
上記の図は、論文から、JPEG AI圧縮が画像の色相関連性に与える影響を、赤チャネルを使用した例で示しています。
パネルAは、圧縮されていない画像とJPEG AI圧縮画像を比較し、圧縮によってチャネル間の相関が大幅に増加することを示しています。パネルBは、JPEG AIの前処理の影響を分離し、色変換とサブサンプリングのみで相関が著しく増加することを示しています。パネルCは、伝統的なJPEG圧縮も相関をわずかに増加させると示していますが、同じ程度ではありません。パネルDは、シンセティック画像を調査し、Midjourney-V5とAdobe Fireflyが相関の適度な増加を示し、他の画像は圧縮されていないレベルに近いことを示しています。
レート歪み
レート歪みの手がかりは、画像の品質、ピーク信号ノイズレシオ(PSNR)によって測定される、が繰り返し圧縮によって予測可能なパターンで低下することを追跡します。
研究では、JPEG AIで画像を繰り返し圧縮すると、PSNRによって量化される画像品質が徐々に低下することが示されています。この低下は、JPEG AI画像が再圧縮されたかどうかを検出するための法医学的手がかりを形成します。
伝統的なJPEGとは異なり、ここでは以前の方法が特定の画像ブロックの変更を追跡していたのに対し、JPEG AIのニューラルコーディングアーキテクチャでは、ビットレートとPSNRが繰り返し圧縮に伴ってどのように進化するかを追跡する必要があります。各圧縮ラウンドは、前のラウンドよりも画像をわずかに変更し、この減少する変更(ビットレートに対してプロットされた場合)は、画像が複数の圧縮ステージを経たかどうかを示します。

さまざまなコーデックで繰り返し圧縮が画像品質に与える影響の図。
上の図では、JPEG AIと別のAIベースのコーデックのレート歪み曲線を示し、両方のコーデックがすべてのビットレートでPSNRの安定した低下を示しているのに対し、伝統的なJPEGは高ビットレートで著しい低下を示すまで、比較的安定した品質を維持していることがわかります。この動作は、JPEG AI画像が再圧縮されたかどうかを示すために使用できる量化可能なシグナルを提供します。
ビットレートと画像品質が複数の圧縮ラウンドでどのように進化するかを抽出することで、著者は、画像が再圧縮されたかどうかを示すシグナルを構築しました。これは、JPEG AIの文脈では実用的な法医学的手がかりを提供します。
量子化
先ほど述べたように、JPEG AIが提起する法医学上の課題の1つは、シンセティック画像ジェネレーターによって生成された画像と視覚的に似ていることです。両方のシステムは、画像を圧縮された潜在的な空間に処理するエンコーダーとデコーダーのアーキテクチャを使用し、両方とも潜在的な空間でアップサンプリングのアーティファクトを残すことができます。
これらの共通の特性は、検出器を混乱させる可能性があります。JPEG AI画像に再訓練したものでもです。しかし、重要な構造的な違いがあります。JPEG AIは、効率的な圧縮のために、潜在的な値を離散レベルに丸めますが、生成モデルは通常そうしません。
新しい論文では、この違いを利用して、JPEG AI画像と完全にシンセティック画像を区別するための法医学的手がかりを設計しています。方法では、画像の潜在的な表現が丸めに対してどのように反応するかを分析し、画像がすでに量子化されていると仮定して、丸めされた値との整列を示す測定可能なパターンを示します。
これらのパターンは、目には見えないものの、圧縮された実画像と完全にシンセティック画像を区別するのに役立つ統計的差異を生み出します。

平均Fourierスペクトルは、JPEG AI圧縮画像とMidjourney-V5やStable Diffusion XLなどの拡散モデルで生成された画像が、周波数ドメインで正方形のグリッド状のパターンを示すことを示しています。
重要な点は、著者がこの手がかりがさまざまな生成モデルに対して機能し、圧縮が潜在的な空間のセクションをゼロにした場合でも効果があることを示していることです。対照的に、シンセティック画像は、この丸めテストに対してはるかに弱い反応を示します。これにより、両者の区別を付ける実用的な方法が提供されます。
結果は、圧縮と生成の根本的な違いを対象とする軽量で解釈可能なツールとして意図されており、脆弱な表面のアーティファクトに頼るのではなく、実現されています。
データとテスト
圧縮
著者は、色相関連手がかりがJPEG AI圧縮(つまり、未圧縮ソースからの最初のパス)を信頼性的に検出できるかどうかを評価するために、RAISEデータセットの高品質の未圧縮画像を使用しました。これらの画像をさまざまなビットレートでJPEG AIのリファレンス実装で圧縮しました。
著者は、色チャネル間の統計的パターン(特に各チャネルの残差ノイズが他のチャネルとどのように整列するか)に基づいて、ランダムフォレストを訓練しました。そして、これを、画像のピクセルに直接訓練されたResNet50ニューラルネットワークと比較しました。

色相関連特徴を使用したJPEG AI圧縮の検出精度。
ResNet50は、テストデータが訓練条件と密接に一致する場合に高い精度を達成しましたが、さまざまな圧縮レベルに対する一般化に苦労しました。対照的に、相関ベースのアプローチは、特に低圧縮レートで効果的であり、JPEG AIの前処理の影響が強い場合に、簡素化されたアプローチでありながらも一貫性のある結果を示しました。
これらの結果は、ディープラーニングを使用せずに、解釈可能で堅牢な法医学的手がかりを使用してJPEG AI圧縮を検出できることを示しています。
再圧縮
JPEG AIの再圧縮を信頼性的に検出できるかどうかを評価するために、研究者はさまざまなビットレートで圧縮された画像のセットをテストしました。画像の一部は1回だけ圧縮され、画像の一部は2回JPEG AIを使用して圧縮されました。
この方法では、画像のビットレートとPSNRが3回の圧縮でどのように進化するかを追跡する17次元の特徴ベクトルを抽出することが含まれます。この特徴セットは、各ステップでどれだけの品質が失われたか、また潜在的なレートとハイパープライヤーレートがどのように動作するかを捉えます。これらのメトリックは、伝統的なピクセルベースの方法では簡単にアクセスできないものです。
研究者はこれらの特徴に基づいてランダムフォレストを訓練し、そのパフォーマンスを画像パッチに訓練されたResNet50と比較しました。

レート歪み特徴を使用したJPEG AI画像の再圧縮の検出精度。
ランダムフォレストは、初期圧縮が強い(つまり、低ビットレート)場合に特に効果的であり、単圧縮と再圧縮の画像間に明確な違いを示しました。以前の手がかりと同様に、ResNet50のイテレーションは一般化に苦労しました。特に、訓練中に見られなかった圧縮レベルでテストされた場合にそうでした。
レート歪み特徴は、さまざまなシナリオで安定したままだったのに対し、ランダムフォレストは特に効果的でした。注目すべきは、このアプローチがJPEG AI以外のAIベースのコーデックにも一般化することです。
JPEG AIとシンセティック画像
最終的なテストラウンドでは、著者は、量子化ベースの特徴がJPEG AI圧縮画像と完全にシンセティック画像(Midjourney、Stable Diffusion、DALL-E 2、Glide、Adobe Fireflyなどのモデルで生成された画像)を区別できるかどうかをテストしました。
このために、研究者は、Synthbusterデータセットのサブセットを使用しました。これには、RAISEデータベースからの実画像と、さまざまな拡散モデルとGANベースのモデルで生成された画像が含まれていました。

Synthbusterのシンセティック画像の例。 ソース:https://ieeexplore.ieee.org/document/10334046
実画像は、さまざまなビットレートでJPEG AIを使用して圧縮され、分類は2つのタスクとして提示されました。1つはJPEG AIと特定のジェネレータを区別するタスクで、もう1つは特定のビットレートとStable Diffusion XLを区別するタスクでした。
量子化特徴(潜在的な表現からの相関)は、256×256の固定領域から計算され、ランダムフォレスト分類器に供給されました。ベースラインとして、同じデータのピクセルパッチに訓練されたResNet50が使用されました。

量子化特徴を使用したJPEG AI圧縮画像とシンセティック画像の区別の分類精度。
ほとんどの条件下で、量子化ベースのアプローチは、特に低ビットレートで圧縮アーティファクトが強い場合に、ResNet50ベースラインを上回りました。
著者は次のように述べています。
‘ベースラインのResNet50は、Glide画像で66.1%の精度を達成しますが、他の場合は一般化が悪くなります。量子化特徴は、圧縮の強さとジェネレータの種類に対して良い一般化を示しています。
‘量化されるゼロに量化される係数の重要性は、多くの場合でResNet50分類器と同等の性能を示す、切り捨てられた[特徴]の非常に優れた性能によって示されています。
‘しかし、非切り捨て、完全な整数[ベクトル]を使用する量子化特徴は、注目に値するほど優れています。結果は、ゼロ後の量子化の量が、AI圧縮画像とAI生成画像を区別するための重要な手がかりであることを確認しています。
‘しかしそれでも、他の要因も貢献していることを示しています。JPEG AIの検出の完全ベクトルの精度は、すべてのビットレートで91.0%を超えており、強い圧縮はより高い精度につながります。’
特徴空間のUMAPによる投影は、JPEG AIとシンセティック画像の間の明確な分離を示し、低ビットレートはクラス間の距離を増やしました。テストされたジェネレータの中で一貫した外れ値はGlideであり、画像は異なるクラスタを形成し、テストされたジェネレータの中で最も低い検出精度を示しました。

量子化特徴に基づくJPEG AI圧縮画像とシンセティック画像の2次元UMAP視覚化。
最後に、著者は、特徴が一般的な後処理(たとえば、JPEGの再圧縮またはダウンサンプリング)に対してどれだけ堅牢であるかを評価しました。パフォーマンスは処理の強度とともに低下しましたが、低下は漸進的であり、劣化した条件下でもアプローチが一定の堅牢性を維持していることを示しています。

後処理(JPEGの再圧縮(JPG)と画像のリサイズ(RS))に対する量子化特徴の堅牢性の評価。
結論
JPEG AIが広く採用されることは保証されていません。インフラストラクチャ上の既存の負債が、新しいコーデックの採用を妨げる可能性があるからです。また、AV1のような優れた血統と価値に対する広範な合意を持つ「従来の」コーデックでも、確立された方法を置き換えることは難しいことがあります。
AIジェネレータとの潜在的な衝突に関しては、現在のAI画像検出器に役立つ特徴的な量子化アーティファクトは、将来のシステムでは減少したり置き換えられたりする可能性があります(AIジェネレータが必ずしも法医学的残骸を残すとは限らないためです)。
これは、JPEG AIの独自の量子化特性、および新しい論文によって特定されたその他の手がかりが、最も効果的な新しい生成AIシステムの法医学的痕跡と衝突しない可能性があることを意味します。
ただし、JPEG AIが事実上の‘AIウォッシュ’として機能し続け、実画像と生成画像の区別を大幅にぼかす場合、採用を主張することは難しいでしょう。
2025年4月8日(火曜日)に初めて公開されました












