Andersonの視点

画像ネットの歴史的精度の評価

mm
Unite.AI を Google の優先ソースに追加

Google ResearchとUC Berkeleyからの新しい研究は、コンピュータビジョン(CV)研究分野がImageNetデータセットとその多数の派生データセットに依存しているという長年の批判に追加しています。大量の手作業による評価の後、著者は、ImageNetの多ラベルサブセット評価で最高のモデルがするはずの間違いのおよそ50%は、実際には間違いではないという結論に達しました。

研究論文から:

‘私たちの分析は、ほぼ半数の間違いは間違いではなく、新しい有効な多ラベルを発見し、注意深いレビューなしで、これらのモデルのパフォーマンスを大幅に低く評価していることを示しています。 ‘

‘一方、現在の最高のモデルはまだ明らかに間違っている(40%)間違いを犯しています。’

データセットのラベルの誤り、特に非熟練したクラウドソーシングワーカーによるものが、分野をどのように歪めるかを明らかにするために、研究はImageNetの歴史を通じて画像/テキストのペアの評価に手間をかけたアプローチを取った。

上段には、ミス程度の例が示されています。最初の2つの例では、新しいモデルは単に予測ラベルを間違えています。3番目の例では、新しいモデルは以前存在しなかった多ラベル(画像の新しい分類に対処するラベル)を特定しています。上段の最後の画像では、モデルの予測は曖昧です。なぜなら、画像はハエと呼ばれるものですが、ハエではありません。ただし、平均的なハチは、ハエと同じディプテラ目に属しているため、この例外は、専門のアノテーターにとってもほぼ検出不可能です。下段には、4つのミスカテゴリがあり、例が示されています。 ソース:https://arxiv.org/pdf/2205.04596.pdf

上段には、ミス程度の例が示されています。最初の2つの例では、新しいモデルは単に予測ラベルを間違えています。3番目の例では、新しいモデルは以前存在しなかった多ラベル(画像の新しい分類に対処するラベル)を特定しています。上段の最後の画像では、モデルの予測は曖昧です。なぜなら、画像はハエと呼ばれるものですが、ハエではありません。ただし、平均的なハチは、ハエと同じディプテラ目に属しているため、この例外は、専門のアノテーターにとってもほぼ検出不可能です。下段には、4つのミスカテゴリがあり、例が示されています。 ソース:https://arxiv.org/pdf/2205.04596.pdf 上段には、ミス程度の例が示されています。最初の2つの例では、新しいモデルは単に予測ラベルを間違えています。3番目の例では、新しいモデルは以前存在しなかった多ラベル(画像の新しい分類に対処するラベル)を特定しています。上段の最後の画像では、モデルの予測は曖昧です。なぜなら、画像はハエと呼ばれるものですが、ハエではありません。ただし、平均的なハチは、ハエと同じディプテラ目に属しているため、この例外は、専門のアノテーターにとってもほぼ検出不可能です。下段には、4つのミスカテゴリがあり、例が示されています。 ソース:https://arxiv.org/pdf/2205.04596.pdf

研究者は、ImageNetデータセットの評価における歴史的なエラー記録を詳しくレビューするために、数人の専門的な評価者を雇用し、多くのエラー判定が実際にはエラーではないことを発見しました。これは、多くのプロジェクトがImageNetベンチマークで得た低いスコアを修正する可能性があります。

ImageNetがコンピュータビジョンの文化に根付くにつれて、研究者は、精度の向上は減少する収穫がもたらされると主張しています。新しいモデルは、既存のラベル精度を超え、新しい(追加の)ラベルを示唆する可能性がありますが、これらは非従来的であるため、実際には罰則を受ける可能性があります。

‘例えば、’著者は観察しています。 ‘我々は、モデルの予測がバゲットが焼かれていないバゲットであると予測する場合、それを罰するべきでしょうか?’

[caption id="attachment_181497" align="alignnone" width="429"]研究論文から、より新しいモデルは、写真のオブジェクトが実際にはバゲットであると示唆しています。 研究論文から、より新しいモデルは、写真のオブジェクトが実際にはバゲットであると示唆しています。

クラウドソーシングワーカーがそのようなオブジェクトを識別するという観点から、これは、多ラベル付けによってのみ解決できる、意味論的で、哲学的なジレンマです。上記の場合、オブジェクトは実際には両方、生地と、少なくとも、バゲットの始まりです。

研究でテストされたカスタムモデルで発生した重大なミス(上)と軽微なミス(下)。元のImageNetラベルは左側の最初の画像です。

研究でテストされたカスタムモデルで発生した重大なミス(上)と軽微なミス(下)。元のImageNetラベルは左側の最初の画像です。

2つの明らかな解決策は、ラベリングに更多のリソースを割り当てること(これは、ほとんどのコンピュータビジョン研究プロジェクトの予算の制約の中で課題です)と、著者が強調するように、定期的にデータセットとラベル評価サブセットを更新すること(これは、ベンチマークの「同等」の歴史的連続性を壊すことや、新しい研究論文に等価性に関する修正や免責事項を散りばめる可能性があることなど、他の障害にも直面しています)です。

状況を改善するためのステップとして、研究者は、ImageNet-Major(ImageNet-M)と呼ばれるImageNetの新しいサブデータセットを開発しました。これを「現在のトップモデルの明らかなミスの68の例で構成されるスライス」と説明し、「モデルはほぼ完全な精度を達成するはずですが、現在はそうではありません」と述べています。

研究論文は、When does dough become a bagel? Analyzing the remaining mistakes on ImageNetと題され、Google Researchの4人の著者とUC BerkeleyのSara Fridovich-Keilによって書かれました。

テクニカルデット

これらの発見は重要です。なぜなら、ImageNetで16年間で発見された(または誤って発見された)残りのエラーは、デプロイ可能なモデルと、エラーが多すぎて実際のデータで使用できないモデルの違いを表す可能性があるからです。いつものように、最後の1マイルが重要です。

コンピュータビジョンと画像合成研究分野は、ImageNetをベンチマークメトリックとして「自動的に」選択しました。これは、多くの理由がありますが、主な理由は、早期の採用者が多く、ハイボリュームで整ったデータセットが少なかった時代に、多くの研究イニシアチブが生まれたため、ImageNetに対するテストが広く適用可能な歴史的な「標準」になったからです。

方法

ImageNetの「残りのミス」を探すために、研究者は、89.5%の精度を達成できる標準のViTモデル(3億パラメータ)、Vit-3Bを使用しました。これは、JFT-3Bで事前トレーニングされ、ImageNet-1Kでファインチューニングされました。

研究者は、ImageNet2012_multilabelデータセットを使用し、ViT-3Bの初期の多ラベル精度(MLA)を96.3%と記録しました。このモデルは676個の明らかなミスを犯しました。これらのミス(およびGreedy Soupsモデルによって生成されたミス)を著者が調査しようとしたものです。

残りの676個のミスの評価のために、著者はクラウドワーカーを避け、ミスをスポットするのが平均的なアノテーターにとって難しいことを観察し、代わりに5人の専門的なレビューアのパネルを集め、各レビューアーが一目で予測クラス、予測スコア、グラウンドトゥルースラベル、画像自体を見られるように特別なツールを作成しました。

プロジェクトのために構築されたUI

プロジェクトのために構築されたUI

場合によっては、パネルの間で意見の相違を解決するために、さらに調査が必要でした。Google画像検索は、補助ツールとして使用されました。

‘たとえば、1つの興味深いが孤立していないケースでは、タクシーメーター(黄色の色以外に明らかなタクシーメーターの指標がない)が画像に存在するタクシーを予測していました。私たちは、背景にランドマークの橋を特定して都市をローカライズし、その都市のタクシーの画像検索で同じタクシーモデルとナンバープレートのデザインの画像が得られたため、予測が実際には正しいタクシーであると判断しました。’

調査の各段階でミスを初期的にレビューした後、著者は、4つの新しいタイプのミスを特定しました:微妙なエラー、予測クラスがグラウンドトゥルースラベルに似ている場合;微妙なエラー(OOVを含む)、モデルのクラスが正しいがImageNetに存在しない場合;スパリアス相関、予測ラベルが画像のコンテキストから読み取られる場合;非プロトタイプ、グラウンドトゥルースオブジェクトが予測ラベルに似ているが、クラスの典型的な例ではない場合。

特定のケースでは、グラウンドトゥルース自体が「真実」ではありませんでした:

‘ImageNetの元の676個のミスをレビューした後、298個は正しいか、不明か、または元のグラウンドトゥルースが間違っているか、問題があると判断しました。’

さまざまなデータセット、サブセット、検証セットを使用した、徹底的で複雑な実験の後、著者は、研究対象の2つのモデルが、従来の技術ではミスとされていたミスの半分について正しいと判断されたことを発見しました。

研究論文は次のように結論付けています:

‘この論文では、ViT-3BモデルとGreedy SoupsモデルがImageNetの多ラベル検証セットで犯す残りのミスを分析しました。 ‘

‘全体として、次のことを発見しました:1)大規模で高精度のモデルが他のモデルでは予測されていない新しい予測を行う場合、それはほぼ半分の時間で新しい正しい多ラベルになります;2)精度の高いモデルは、私たちのカテゴリとミスの重大性において明らかなパターンを示しません;3)現在のSOTAモデルは、人間が評価した多ラベルサブセットで、ベストの専門家人間のパフォーマンスに匹敵または上回っています;4)ノイズの多いトレーニングデータと未指定のクラスは、画像分類の改善の効果的な測定を制限する要因である可能性があります。’

 

2022年5月15日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai