Andersonの視点

オーバー解釈はオーバーフィットよりも大きな脅威かもしれない

mm
Unite.AI を Google の優先ソースに追加

あなたの親しい友達アリスが黄色のセーターを着るのが好きなら、あなたは平均的な人よりも多くの黄色のセーターを見ることになる。ある程度の時間が経過すると、別の女性が黄色のセーターを着ているのを見て、アリスという概念が頭に浮かぶ可能性がある。

あなたがアリスに少し似た女性が黄色のセーターを着ているのを見ると、アリスと間違えるかもしれない。

しかし、それはアリスではない。最終的に、あなたは「黄色のセーター」がアリスを特定するための有用な鍵ではないことを実現するだろう。なぜなら、アリスは夏には黄色のセーターを着ないし、冬にも常に着ないからだ。友情のある程度の時点で、あなたは「黄色のセーター」をアリスの可能な識別子としてダウングレードし始めるだろう。なぜなら、その経験は不十分で、ショートカットを維持するための認知エネルギーは頻繁に報われることがないからだ。

しかし、コンピュータビジョンに基づく認識システムの場合は、アリスがいる場所で黄色のセーターが見える可能性がある。

それはあなたのせいではない。アリスを識別するために最小限の情報からあなたに課せられたタスクがあり、ショートカットを維持するための認知エネルギーは不足していない。

不気味な洞察力

MITコンピュータサイエンス&人工知能研究所(CSAIL)とAmazon Web Servicesの最近の論文によると、この症候群は「過剰解釈」と呼ばれ、コンピュータビジョン(CV)研究分野で広く見られる。オーバーフィットを解決することで軽減することはできず、画像認識と変換の2つの最も影響力のあるデータセットであるCIFAR-10とImageNetで研究が行われている。さらに、簡単な解決策はない。

研究者は、入力トレーニング画像をその妥当な内容の5%に減らしたとき、人気のあるフレームワークが画像を正しく分類し続けたことを発見した。これらの画像は、ほとんどの場合、人間の観察者にとって視覚的な「無意味」である。

CIFAR-10の元のトレーニング画像を、元のピクセル内容の5%に減らし、90-99%の精度で、人気のあるコンピュータビジョンフレームワークによって正しく分類された。

CIFAR-10の元のトレーニング画像を、元のピクセル内容の5%に減らし、90-99%の精度で、人気のあるコンピュータビジョンフレームワークによって正しく分類された。 ソース:https://arxiv.org/pdf/2003.08907.pdf

一部のケースでは、分類フレームワークは、これらの簡略化された画像を元のトレーニングデータの完全なフレームよりも正しく分類することが容易であることがわかった。著者は「CNNはこれらのピクセルサブセットに対してより自信を持っている」と述べている。

これは、CIFAR-10やImageNetなどのベンチマークデータセットを使用するCVシステムで一般的な「チート」の可能性を示唆している。ベンチマークフレームワークとしてVGG16、ResNet20、ResNet18が使用されている。

過剰解釈は、CVベースの自動運転車システムに重大な影響を及ぼす。最近、テスラは、自動運転アルゴリズムのために、LiDARや他のレイベースのセンシングシステムよりも画像解釈を優先することを決定した。

「ショートカット学習」は、コンピュータビジョンで知られている課題であり、活発な研究分野であるが、2019年にドイツとカナダの研究によって問題が提示されたが、過剰解釈の「すっぽんした」ピクセルサブセットが「統計的に有効なデータ」であることを認識していない。

データを削減する

研究者が使用したデータ削減画像は、Sufficient Input Subsets(SIS)と呼ばれる。これは、コンピュータビジョンシステムが画像の元の主題(例:犬、船など)を識別できる最小限の「外部シャーシ」を持つ画像である。

上の行には、完全なImageNetバリデーション画像が表示され、下には、Inception V3モデルによって90%の信頼性で正しく分類されたSISサブセットが表示される。

上の行には、完全なImageNetバリデーション画像が表示され、下には、Inception V3モデルによって90%の信頼性で正しく分類されたSISサブセットが表示される。

上の画像の結果について、研究者は次のように述べている。

「SISピクセルは、実際のオブジェクトの外側に集中している。例えば、「ピザ」の画像では、SISはピザ自体ではなく、プレートの形や背景のテーブルに集中している。これは、モデルがテーブルの上にある円形のアイテムの画像で一般化が悪い可能性があることを示唆している。」

「「ジャイアントパンダ」の画像では、SISにはバンブーが含まれており、これはImageNetの写真コレクションでこのクラスに頻繁に登場する可能性がある。」

SIS画像はランダムにトリミングされていない。Batched Gradient BackselectプロセスによってInception V3とResNet50で作成された。これらの画像は、モデルが画像を正しく分類する能力と元のデータを削減する関係を考慮した削減ルーチンによって導出される。

ランダムなピクセル削減プロセスをテストしてSISの妥当性を確認した結果、結果は「はるかに情報量が少ない」となった。これは、SIS画像が人気のあるモデルやデータセットが予測を行うために必要な最小限のデータを表していることを示唆している。

どの画像を見ても、これらのモデルは人間の視覚的な判断力と同等のレベルで失敗するはずである。つまり、20%未満の精度になるはずである。

SIS画像を5%の元のピクセルに削減した場合、人間はほぼランダムな分類成功率しか達成できない。一方、研究で調査された人気のあるデータセットやフレームワークは90-99%の成功率を達成する。

SIS画像を5%の元のピクセルに削減した場合、人間はほぼランダムな分類成功率しか達成できない。一方、研究で調査された人気のあるデータセットやフレームワークは90-99%の成功率を達成する。

オーバーフィットを超えて

オーバーフィットは、機械学習モデルがデータセットに過度にトレーニングし、その特定のデータに対して予測を行う能力が高くなるが、新しいデータが導入されると予測能力が低下する(またはまったく効果がない)ことを指す。

研究者は、オーバーフィットに対処するための現在の学術的および産業的な関心は、オーバー解釈を同時に解決することはできないと述べている。なぜなら、コンピュータにとっては識別可能な画像を表す削減されたピクセルサブセットは、人間にとっては無意味なだらだらしたものであるが、実際には「真正な統計的信号」であるからである。

「過剰解釈はオーバーフィットと関連しているが、オーバーフィットはテスト精度の低下によって診断できる。過剰解釈は、特定のデータソースの特性(例:皮膚科医のルーラー)から生じる、基本的なデータセット分布の真正な統計的信号から生じる可能性がある。」

「したがって、過剰解釈は、統計的に妥当な基準によって決定が行われるため、診断が難しくなり、ベンチマークで優れたモデルを生み出す可能性がある。」

可能な解決策

著者は、複数のアーキテクチャが評価とトレーニングプロセスに貢献するモデルアンサンブルを使用することで、過剰解釈を軽減できる可能性があると示唆している。また、入力ドロップアウトを適用した結果、CIFAR-10のテスト精度がわずかに低下したが、未見データに対するモデルの精度が約6%向上したことも発見した。

著者は、関連性マップを使用して、画像のどの領域が特徴抽出に重要であるかを示す可能性があると述べているが、これは自動画像解析の目的を妨げ、人間の注釈が必要になるため、実用的ではないと述べている。また、関連性マップは、モデル操作に対する洞察の粗い推定器であると考えられている。

論文は次のように結論付けられている。

「非関連ピクセルサブセットが正しい分類に十分である場合、モデルはこれらのパターンだけに頼る可能性がある。この場合、モデルを忠実に説明する解釈可能性方法は、これらの無意味な理由を出力するが、人間の先入観に向けて理由を偏向する解釈可能性方法は、モデルが意図したとおりに動作しているようにユーザーを欺く結果を生み出す可能性がある。」

 

 

初めて発行されたのは2022年1月13日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai