Andersonの視点
ノイズ画像を使用したコンピュータビジョンモデルのトレーニング

MITコンピュータサイエンス&人工知能研究所(CSAIL)の研究者は、コンピュータビジョンデータセットにノイズ画像を使用してコンピュータビジョンモデルをトレーニングする実験を行い、予想に反して効果的な結果が得られたことを発見しました。

実験からの生成モデル、パフォーマンス別に並べ替え。 ソース:https://openreview.net/pdf?id=RQUl8gZnN7O
人気のコンピュータビジョンアーキテクチャに「視覚的なごみ」を与えるべきではありませんが、このようなパフォーマンスが得られることは予想外です。上記の画像の右端の黒い列は、4つの「実際の」データセットの精度スコア(Imagenet-100)を表しています。色々な色で表された「ノイズ」データセット(左側のインデックスを参照)はそれに匹敵することができませんが、ほとんどが精度の下限と上限(赤い破線)の中に収まっています。
この「精度」とは、必ずしも結果が顔、教会、ピザ、またはその他の特定のドメインの画像合成システムを作成するために興味がある場合に限ります。たとえば、生成対抗ネットワークやエンコーダ/デコーダフレームワークです。
多様性vs.自然主義
これらの結果は、過剰適合によるものではありません。Open Reviewでの著者とレビューアーの間で活発な議論がありますが、視覚的に多様なデータセット(「枯れ葉」、「フラクタル」、「手続き的ノイズ」など)をトレーニングデータセットに組み合わせると、実験で精度が向上することがわかりました。
これは、ある種の「過小適合」の新しいタイプを示唆しており、「多様性」が「自然主義」を上回るという、ある意味で革命的な概念です。

実験で使用されたさまざまなタイプのランダム画像データセットをインタラクティブに表示するプロジェクトページ。 ソース:https://mbaradad.github.io/learning_with_noise/
研究者によって得られた結果は、画像ベースのニューラルネットワークとそれらに投げ込まれる「現実世界」の画像との根本的な関係を疑問視し、巨大な画像データセットを取得、キュレーション、管理する必要性が最終的に不要になる可能性を示唆しています。著者は次のように述べています。
「現在のビジョンシステムは、巨大なデータセットでトレーニングされており、これらのデータセットにはコストがかかります。キュレーションは高価で、人間の偏見を引き継ぎ、プライバシーと使用権に関する懸念があります。コストを抑えるために、無ラベル画像などの安価なデータソースから学習することに興味が高まっています。」
「この論文では、実際の画像データセットを完全に排除し、手続き的ノイズプロセスから学習することを提案します。」
研究者は、現在の機械学習アーキテクチャが、予想よりも基本的な(または予想外の)何かを画像から推測している可能性があり、そして「無意味な」画像がこれらの知識をより安価に与える可能性があることを示唆しています。たとえば、トレーニング時にランダムな画像を生成するデータセット生成アーキテクチャを使用することで、手続き的ノイズプロセスから学習することで、より高いパフォーマンスが得られる可能性があります。
‘「私たちは、視覚システムをトレーニングするための合成データの2つの重要な特性を特定しました。1)自然主義、2)多様性。興味深いことに、最も自然なデータが常に最もよいものではないことがわかりました。自然主義は多様性のコストで得られることがあります。」
「自然なデータが役立つことは驚くことではありません。実際のデータの大規模なセットには価値があることを示唆しています。ただし、重要なのはデータが「実際の」ものであることではなく、「自然な」ものであることです。つまり、実際のデータの構造的特性を捉える必要があります。」
「これらの多くの特性は、単純なノイズモデルで捉えることができます。」

著者が使用したさまざまな「ランダム画像」データセットからの特徴視覚化。3番目と5番目(最終)の畳み込み層をカバーするAlexNet由来のエンコーダを使用。ここで使用されている方法は、2017年のGoogle AIの研究に従っています。
シドニーの第35回ニューラル情報処理システム会議(NeurIPS 2021)で発表された論文は、CSAILの6人の研究者による共同研究であり、「ノイズをみてみることによる学習」というタイトルが付けられています。
この研究は、NeurIPS 2021でのスポットライトセレクションに推薦され、ピアレビューアーから「科学的ブレークスルー」と評価され、研究分野を開拓する可能性があると評価されています。
論文では、著者は次のように結論しています。
「私たちは、過去の研究から得られた結果を使用して設計されたデータセットを使用して、視覚表現をトレーニングすることができることを示しました。私たちは、この論文が、構造化されたノイズを生成できる新しい生成モデルを開発する研究を刺激することを希望しています。さまざまな視覚タスクで使用される場合、さらに高いパフォーマンスが得られる可能性があります。」
「ImageNetの事前トレーニングで得られたパフォーマンスに匹敵することは可能でしょうか。特定のタスクに特化した大規模なトレーニングセットがなければ、事前トレーニングに標準的な実際のデータセットを使用するのが最善の方法ではない可能性があります。」












