Andersonの視点

ディズニー・リサーチ、AIベースの画像圧縮を改善 – ただし、詳細を「妄想」する可能性も

mm
Unite.AI を Google の優先ソースに追加
Detail for the supplementary Disney paper – source: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Supplementary-1.pdf

ディズニーの研究部門は、新しい画像圧縮方法を提供しています。これは、オープンソースのStable Diffusion V1.2モデルを使用して、競合する方法よりも低ビットレートでよりリアルな画像を生成します。

ディズニー圧縮方法と以前のアプローチの比較。著者は詳細の回復の改善を主張しています。また、数十万ドル相当のトレーニングを必要とせず、また最も近い競合メソッドよりも高速に動作するモデルを提供しています。ソース:https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

ディズニー圧縮方法と以前のアプローチの比較。著者は詳細の回復の改善を主張しています。また、数十万ドル相当のトレーニングを必要とせず、また最も近い競合メソッドよりも高速に動作するモデルを提供しています。ソース:https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

新しいアプローチ(伝統的なコーデックよりも複雑度が高いにもかかわらず、「コーデック」と定義される)は、任意の潜在拡散モデル(LDM)上で動作できます。量的テストでは、精度と詳細性の点で以前の方法を上回り、トレーニングと計算コストを大幅に削減しました。

新しい研究の重要な洞察は、量化エラー(すべての画像圧縮での中央プロセス)がノイズ(拡散モデルの中央プロセス)に似ているということです。

したがって、従来の量化された画像は、ランダムなノイズの代わりに、ターゲットビットレートで画像を再構築するためにLDMのノイズ除去プロセスで使用できます。

新しいディズニー方法(緑で強調)の他のアプローチとの比較

新しいディズニー方法(緑で強調)の他のアプローチとの比較

著者は主張します:

‘私たちは、量化エラーの除去をノイズ除去タスクとして定式化し、拡散を使用して送信画像の潜在的な損失した情報を回復します。私たちのアプローチにより、完全な拡散生成プロセスの10%未満を実行でき、また拡散モデルのアーキテクチャへの変更は不要であり、バックボーンの追加的なファインチューニングも不要です。 ‘

‘私たちの提案したコーデックは、以前の方法よりも量的リアリズムメトリックで優れており、また私たちの再構築は、他の方法が2倍のビットレートを使用する場合でも、ユーザーによって質的にも好まれていることを確認しました。 ‘

しかし、拡散モデルを使用して圧縮能力を利用しようとする他のプロジェクトと同様に、出力は妄想する可能性があります。対照的に、JPEGなどのロスィ方法は、明らかに歪んだまたは過度にスムーズ化された詳細領域を生成します。これは、一般的なビューアーによって圧縮の限界として認識できます。

代わりに、ディズニーのコーデックは、元の画像に存在しなかったコンテキストからの詳細を変更する可能性があります。これは、典型的なモデルで使用されるバリアントオートエンコーダ(VAE)の粗い性質によるものです。

‘他の生成アプローチと同様に、私たちの方法は、特定の画像機能を破棄する可能性がありますが、受信側で類似の情報を合成します。特定のケースでは、しかし、これは不正確な再構築につながる可能性があります。たとえば、直線を曲げたり、小さな物体の境界を歪めたりします。 ‘

‘これらは、私たちが基盤としている基礎モデルの既知の問題であり、VAEの比較的低い特徴次元に帰属できます。 ‘

これは、芸術的な描写やカジュアルな写真のリアリズムに影響を与える可能性がありますが、証拠として使用される画像、顔認識のデータ、光学式認識(OCR)のスキャンなどの重要な情報を構成する小さな詳細を含む場合には、より深刻な影響を及ぼす可能性があります。

画像ストレージは、データストレージ、ストリーミング、電力消費など、さまざまな問題を抱えたグローバルな課題です。したがって、AIベースの圧縮は、精度とロジスティクスのトレードオフを提供する可能性があります。歴史は、最も優れたコーデックが常に最も広く使用されているわけではないことを示しています。ライセンスや市場の独占などの要因が採用に影響するからです。

ディズニーは長期にわたって機械学習を圧縮方法として使用してきました。2020年には、現在の論文の研究者の一人が、VAEベースのプロジェクトに携わり、ビデオ圧縮を改善しました。

新しいディズニーの論文は先月更新されました。今日、同社はYouTubeビデオを公開しました。プロジェクトは、Foundation Diffusion Modelsを使用したロスィ画像圧縮と題され、ディズニーリサーチとETHチューリッヒの4人の研究者によって行われました。研究者は、補足論文も提供しています。

方法

新しい方法では、VAEを使用して画像を圧縮された潜在的な表現にエンコードします。この段階では、入力画像は導出された特徴で構成されます。潜在的な埋め込みは量化され、ビットストリームに戻され、ピクセル空間に戻されます。

量化された画像は、通常拡散ベースの画像をシードするノイズのテンプレートとして使用されます。ノイズ除去ステップの数は変化することがあります(ノイズ除去ステップの増加と精度のトレードオフが存在します)。

新しいディズニー圧縮方法のスキーマ

新しいディズニー圧縮方法のスキーマ

量化パラメータとノイズ除去ステップの総数は、関連する変数を予測するニューラルネットワークをトレーニングすることで制御できます。拡散プロセス中にエントロピーをモデル化するエントロフォーマー フレームワークを使用して、適応量化プロセスを実行します。

著者は述べています:

‘私たちの方法は、拡散プロセス中に合成できる情報を破棄することを学習します。量化エラーはノイズに似ているため、拡散モデルはノイズ除去モデルとして使用できます。 ‘

Stable Diffusion V2.1は、バックボーンの完全なコードと基本的な重みが公開されているため、システムの拡散バックボーンとして使用されます。ただし、著者は、スキーマがより広い範囲のモデルに適用可能であることを強調しています。

プロセスの経済性の鍵は、タイムステップ予測です。これは、ノイズ除去ステップの最適な数を評価するトレードオフです。

タイムステップ予測、最適なノイズ除去ステップが赤い枠で示されています。ソースPDFの正確な解像度については、ソースPDFを参照してください。

タイムステップ予測、最適なノイズ除去ステップが赤い枠で示されています。ソースPDFの正確な解像度については、ソースPDFを参照してください。

潜在的な埋め込みのノイズの量を考慮する必要があります。

データとテスト

モデルは、Vimeo-90k データセットでトレーニングされました。画像は、各エポック(モデルアーキテクチャによってデータセットが処理されるたびに)に256x256pxにランダムにトリミングされました。

モデルは、300,000ステップで、学習率1e-4で最適化されました。これは、コンピュータビジョンプロジェクトで最も一般的であり、また最も低く一般的に実行可能な値です。データセットの概念と特徴の広い一般化と、詳細の再現能力のバランスをとるためです。

著者は、システムのいくつかの経済的な考慮についてコメントしています:

‘トレーニング中、拡散モデルを複数回実行することによる勾配のバックプロパゲーションは、DDIM サンプリング中に実行されるため、非常に高価です。したがって、私たちはDDIMサンプリングの1回のイテレーションのみを実行し、直接使用します。 ‘

テストに使用されたデータセットは、KodakCLIC2022COCO 30kでした。データセットは、2023年のGoogleの提案条件付きジェネレーターを使用したマルチリアリズム画像圧縮」に概説されている方法で事前に処理されました。

使用されたメトリックは、ピーク信号ノイズレシオ(PSNR)、学習された感覚相似性メトリック(LPIPS)、マルチスケール構造類似性指数(MS-SSIM)、フレシェインセプション距離(FID)でした。

テストされた以前のフレームワークは、古いシステムと最近の拡散モデルベースのシステムに分かれていました。テストされたGANシステムは、High-Fidelity Generative Image Compression(HiFiC)とILLM(HiFiCのいくつかの改善)でした。

拡散ベースのシステムは、条件付き拡散モデルを使用したロスィ画像圧縮(CDC)とスコアベース生成モデルを使用した高忠実度画像圧縮(HFD)でした。

さまざまなデータセットを使用した以前のフレームワークとの量的結果の比較

さまざまなデータセットを使用した以前のフレームワークとの量的結果の比較

量的結果(上の図)について、研究者は次のように述べています:

‘私たちの方法は、再構築された画像のリアリズムで新しい最先端を達成し、すべてのベースラインをFID-ビットレート曲線で上回ります。いくつかの歪みメトリック(特にLPIPSとMS-SSIM)では、すべての拡散ベースのコーデックを上回り、最高の生成コーデックと競合しています。 ‘

‘予想通り、私たちの方法と他の生成方法は、正確な詳細の複製よりも認知的に魅力的な再構築を優先するため、PSNRでは苦労しています。 ‘

ユーザー研究では、2つの代替的な強制選択(2AFC)方法が、トーナメント形式で使用されました。優先された画像は、次のラウンドに進みました。研究では、Elo レーティングシステムが使用されました。これは、元々チェス トーナメント用に開発されました。

したがって、参加者は、さまざまな生成方法の512x512pxの画像のペアを表示し、最も優れた画像を選択しました。さらに、同じユーザーからのすべての画像比較を評価するための追加の実験が行われました。これは、モンテカルロ シミュレーションを使用して、10,000回のイテレーションで行われ、中央値スコアが結果として提示されました。

ユーザー研究の推定Eloレーティング、各比較と各参加者に対するEloトーナメントを表示しています。値が高いほど優れています。

ユーザー研究の推定Eloレーティング、各比較と各参加者に対するEloトーナメントを表示しています。値が高いほど優れています。

ここで、著者は次のように述べています:

‘Eloスコアからわかるように、私たちの方法は、他のすべての方法を大幅に上回っています。私たちの方法は、CDCを上回ります。CDCは、平均して私たちの方法の2倍のビットを使用します。これは、使用されるEloトーナメント戦略に関係なく当てはまります。 ‘

元の論文および補足PDFでは、さらに視覚的な比較が提供されています。これは、この記事の先頭に表示されています。ただし、サンプルの差は微妙であるため、結果を公平に判断するために、ソースPDFを参照する必要があります。

論文では、提案された方法は、競合するCDCよりも2倍速く動作する(3.49秒対6.87秒)ことも注記されています。また、ILLMは0.27秒で画像を処理できるが、負担の多いトレーニングが必要であることも観察されています。

結論

ETH/ディズニーの研究者は、論文の結論で、システムが偽の詳細を生成する可能性について明確に述べています。ただし、提供されたサンプルは、この問題に焦点を当てていません。

公平を言えば、この問題は、画像を圧縮するために拡散モデルを使用することの結果です。創造的なアーキテクチャを使用するため、解釈の余地が生じます。

興味深いことに、ETHチューリッヒの別の2人の研究者は、5日前に「画像圧縮のための条件付き妄想」というタイトルの論文を発表しました。この論文では、AIベースの圧縮システムにおける「妄想」の最適レベルの可能性について検討しています。

著者は、次のように主張しています:

‘テクスチャのようなコンテンツ(グラス、そばかす、石の壁など)の場合、特定のテクスチャにリアルなピクセルを生成することは、正確なピクセル値を再構築するよりも重要です。テクスチャの分布からの任意のサンプルを生成することは、一般的に十分です。 ‘

したがって、この2番目の論文は、特に「無害」なドメインの場合、妄想が望ましいと主張しています。

画像圧縮の再定義は、写真と創造的なコミュニティにとってかなりラディカルなものになるかもしれません。

一方で、画像ストレージは、データストレージ、ストリーミング、電力消費など、さまざまな問題を抱えたグローバルな課題です。したがって、AIベースの圧縮は、精度とロジスティクスのトレードオフを提供する可能性があります。

*著者によるインライン引用のハイパーリンクへの変換

2024年10月30日(水)に初めて公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai