Andersonの視点

画像合成分野は欠陥のあるメトリックを採用している、研究によると

mm
Unite.AI を Google の優先ソースに追加

2021年は、ディズニーのCGIとニューラルレンダリングの組み合わせによる「不気味の谷」を克服するなど、画像合成分野で新しいイノベーションと改善が相次いだ年となった。ディープフェイクや新しいアプローチなど、人間の個性を再現する技術も進化している。

しかし、ドイツの研究者は、合成画像のリアリズムを自動的に評価するために使用される標準が致命的に欠陥があると主張している。世界中の何百、何千という研究者がこの標準に頼っているが、実は間違った道を進んでいる可能性がある。

この標準、Fréchet Inception Distance (FID)が人間の評価基準に達していないことを示すために、研究者は独自のGANを開発し、FIDを最適化した。FIDは、画像合成ではなく、物体認識タスクに基づいて設計されたInception v3画像分類ネットワークの内部コードに基づいていることがわかった。また、FIDは人間の認識基準に達していないこともわかった。

FIDスコア(低いほどよい)による、さまざまなモデルで生成された画像。研究者は「これらのランキングに賛成しますか?」と問う。出典:https://openreview.net/pdf?id=mLG96UpmbYz

FIDスコア(低いほどよい)による、さまざまなモデルで生成された画像。研究者は「これらのランキングに賛成しますか?」と問う。出典:https://openreview.net/pdf?id=mLG96UpmbYz

この研究では、FIDの内部エンジンを他のエンジンに置き換えるなどの「明らかな」解決策も効果がないと示唆している。研究者は、新しい研究が「本物性」を評価するためのより良いメトリックを開発する必要があると主張している。

画像合成のスコアリングシステムの探求

この研究では、GANやエンコーダ/デコーダアーキテクチャなどの画像合成フレームワークの進歩が、結果を評価する方法の開発を上回っていることが指摘されている。人間の評価は、高価でスケーラブルではなく、また、実証可能な評価方法を提供しないため、代替メトリックが必要となっている。

そのため、Inception Score (IS)などのメトリックフレームワークが開発されている。ISは、2016年の論文「Improved Techniques for Training GANs」で紹介された。ISは、GANの発明者であるIan Goodfellowによって共同執筆された。

2018年に、ISスコアが広く適用可能なメトリックとしての信頼性が失われたため、FIDが画像合成コミュニティで広く採用されるようになった。ただし、FIDもGoogleのInception v3画像分類ネットワーク (IV3)に基づいている。

研究者は、FIDがIV3の偏見を継承しており、画像の品質を評価する際に信頼性が低いと主張している。

Fréchet Inception Distance

FIDは、GANモデルを訓練する際に使用されるデータセットと、生成された画像の特徴の分布を比較する。

たとえば、GANモデルを10,000枚のセレブの画像で訓練した場合、FIDは元の画像と生成された画像を比較する。FIDスコアが低いほど、GANモデルは「写実的な」画像に近づいていると判断される。

論文より、FFHQ64で訓練したGANの結果。FIDスコアは低い5.38であるが、人間にとっては不快な結果である。

論文より、FFHQ64で訓練したGANの結果。FIDスコアは低い5.38であるが、人間にとっては不快な結果である。

問題は、Inception v3が画像合成タスクに適していないことである。Inception V3は、ImageNetオブジェクト認識チャレンジで訓練されており、画像合成の目標とは異なる。

データと方法

研究者は、FFHQ64データセットでDCGANとSNGANの2つのGANアーキテクチャを訓練した。

3つのGAN訓練手法が採用された。1つ目は、標準的なディスクリミネータベースのネットワーク、2つ目はFIDを追加ディスクリミネータとして使用するネットワーク、3つ目はFIDのみを使用するネットワークである。

技術的には、FIDロスは訓練を安定させるべきであり、ディスクリミネータを完全に置き換えることもできる。ただし、結果は異なり、FIDを使用したモデルは「不適切な特徴」を生成する傾向があると研究者は指摘している。

SNGAN FID|Gで生成された顔の例。

SNGAN FID|Gで生成された顔の例。

研究者は、FIDは人間の認識基準に達していないと結論付けている。

簡単な代替案はない

研究者は、Inception V3を他のエンジンに置き換えても問題が解決しないことを発見した。

研究者は、ImageNet-Cと呼ばれるImageNetのサブセットで、画像合成フレームワークの出力画像の汚染や変化をベンチマークするために使用されるデータセットで、さまざまな分類ネットワークをテストした。ただし、結果は改善されなかった。

研究者は、Inception v3の偏見が他の分類ネットワークでも広く存在することを発見した。また、さまざまなネットワークは、汚染タイプ間で異なるランキングを生成することもわかった。

研究者は、人間の認識基準に基づいた公平なランキングを可能にするための「人間に整合した無偏見メトリック」の開発を希望している。

* 著者による強調。

2021年12月20日13:00 GMT+2に初めて公開。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai