Andersonの視点

マシンラーニングのパフォーマンスを向上させるためのCNNベースの画像リサイズ

mm
Unite.AI を Google の優先ソースに追加

Google Researchは、画像ベースのコンピュータビジョントレーニングワークフローを改善するために、画像の前処理段階で画像を縮小する方法を改善する新しい方法を提案しました。

論文「Learning to Resize Images for Computer Vision Tasks」では、Hossein TalebiとPeyman Milanfarの研究者は、CNNを使用して新しいハイブリッド画像リサイズアーキテクチャを作成し、4つの人気のコンピュータビジョンデータセットで認識結果を著しく改善しました。

提案された認識とリサイズのためのジョイントフレームワーク。Source: https://arxiv.org/pdf/2103.09950.pdf

提案された認識とリサイズのためのジョイントフレームワーク。 Source: https://arxiv.org/pdf/2103.09950.pdf

論文では、現在の自動マシンラーニングパイプラインで使用されているリサイズ/リサンプリング方法は数十年前に古くなっており、基本的なバイリニア、バイキュービック、ニアレストネイバーリサイズ方法を使用していることが観察されています。

対照的に、提案された方法は、CNNを使用して画像データを拡張し、最終的にモデルアーキテクチャを通過するリサイズされた画像にその入力を組み込みます。

AIトレーニングにおける画像制約

画像を扱うモデルをトレーニングするには、前処理段階が必要です。この段階では、さまざまなサイズ、色空間、解像度の画像がシステム的にトリミングされ、リサイズされて、一貫した次元と安定した単一の形式に変換されます。

一般的に、これにはPNG形式を中心に、処理時間/リソース、ファイルサイズ、画像品質の間のトレードオフが確立されます。

ほとんどの場合、処理された画像の最終的な寸法は非常に小さくなります。以下は、最初のディープフェイクデータセットのいくつかが生成された80×80解像度の例です:

これは、最初のディープフェイクデータセットのいくつかが生成された80x80解像度です。

顔(およびその他の可能な主題)は、必要な正方形の比率に収まらないことが多いため、黒いバーを追加する必要があるか、無駄なスペースを許可する必要があり、実際の使用可能な画像データがさらに減少します:

ここでは、顔がより大きな画像領域から抽出されて、可能な限り経済的に切り取られています。ただし、右側の画像では、残りの領域の多くはトレーニングでは使用されないため、リサイズされたデータの画像品質の重要性が増します。

ここでは、顔がより大きな画像領域から抽出されて、可能な限り経済的に切り取られています。ただし、右側の画像では、残りの領域の多くはトレーニングでは使用されないため、リサイズされたデータの画像品質の重要性が増します。

最近のGPUの能力の向上により、NVIDIAカードに搭載されているビデオRAM(VRAM)の量が増加し、平均的な画像サイズも増加していますが、224×224ピクセルはまだ標準的なサイズです(例えば、ResNet-50データセットのサイズです)。

リサイズされていない224x244ピクセルの画像。

リサイズされていない224×244ピクセルの画像。

VRAMへのバッチの適合

画像がすべて同じサイズである必要がある理由は、勾配降下であるためです。勾配降下は、モデルが時間の経過とともに改善する方法です。

画像が小さくなる理由は、トレーニング中にバッチ単位でVRAMにロード(完全に展開)される必要があるためです。通常、バッチあたり6〜24枚の画像が含まれます。バッチあたりの画像が少なすぎると、グループ化する材料が不足し、トレーニング時間が長くなります。バッチあたりの画像が多すぎると、モデルが必要な特徴や詳細を取得できない可能性があります(以下参照)。

この「ライブロード」セクションは、潜在的な空間と呼ばれます。この空間では、特徴が繰り返し同じデータ(つまり同じ画像)から抽出され、モデルが収束するまで繰り返され、モデルが将来の類似のデータに対する変換を実行するために必要な一般化された知識をすべて取得します。

このプロセスは通常、数日かかりますが、24/7の高容量の計算を1か月以上継続することで、有用な一般化を達成することができます。VRAMのサイズの増加は、画像の解像度の増加によって処理能力に大きな影響が及ぶため、限界があります。

バッチサイズを増やすために大きなVRAM容量を使用することも、トレーニングの精度が低下する可能性があるため、混合的な祝福です。

したがって、トレーニングアーキテクチャが制約されているため、パイプラインの既存の制限内で改善が可能なすべてのものは、注目に値する成果です。

優れたダウンサイジングの利点

トレーニングデータセットに含まれる画像の最終的な品質は、トレーニングの結果に良い影響を与えることが証明されています。特に、オブジェクト認識タスクでそうです。2018年、Max Planck Institute for Intelligent Systemsの研究者は、リサンプリング方法の選択がトレーニングのパフォーマンスと結果に大きな影響を与えることを主張しました。

さらに、Googleの以前の研究(新しい論文の著者によって共同で執筆された)では、データセット画像の圧縮アーティファクトを制御することで、分類の精度が向上することが示されています。

Google Researchが提案したダウンサンプリングアルゴリズムのCNNアーキテクチャ。

Google Researchが提案したダウンサンプリングアルゴリズムのCNNアーキテクチャ。

新しいリサンプラーに組み込まれたCNNモデルは、バイリニアリサイズと「スキップ接続」機能を組み合わせて、トレーニングされたネットワークの出力をリサイズされた画像に組み込みます。

典型的なエンコーダ/デコーダアーキテクチャとは異なり、新しい提案は、フィードフォワードボトルネックとしてだけでなく、任意のターゲットサイズおよび/またはアスペクト比率のアップスケーリングの逆ボトルネックとしても機能できます。また、標準的なリサンプリング方法を、Lanczosなどの他の適切な従来の方法に置き換えることもできます。

高周波の詳細

新しい方法では、画像が「焼き込まれる」ように、トレーニングプロセスで最終的に認識される主要な特徴をソース画像に直接組み込みます。美的観点からすると、結果は非伝統的です:

4つのネットワーク(Inception V2、DenseNet-121、ResNet-50、MobileNet-V2)に適用された新しい方法の結果。Google Researchの画像ダウンサンプリング/リサイズ方法では、トレーニングプロセスで認識される主要な特徴を予測する明らかなピクセル集約が生成されます。

4つのネットワーク(Inception V2、DenseNet-121、ResNet-50、MobileNet-V2)に適用された新しい方法の結果。Google Researchの画像ダウンサンプリング/リサイズ方法では、トレーニングプロセスで認識される主要な特徴を予測する明らかなピクセル集約が生成されます。

研究者は、これらの初期の実験は画像認識タスクにのみ最適化されており、テストでは、CNNを使用した「学習済みリサイズ」がこれらのタスクでエラー率の改善を達成したことを示しています。研究者は、将来的に、この方法を他の画像ベースのコンピュータビジョンアプリケーションに適用することを意図しています。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai