Andersonの視点

合成顔の「劣化」が顔認識技術の向上に貢献する

mm
Unite.AI を Google の優先ソースに追加

ミシガン州立大学の研究者は、ディープフェイクの場から合成顔が一時的に離れて、顔認識システムの精度を高めるために良いことをする方法を見つけました。

新しく開発された制御可能な顔合成モジュール(CFSM)は、リアルな世界のビデオ監視映像のスタイルで顔の再生成が可能です。人気のあるオープンソースのセレブのデータセットに比べ、より低品質の画像を使用することで、認識精度に影響を与える要因である顔のぼかれ、低解像度、センサノイズなどの欠点や短所を反映させることができます。

CFSMは、頭のポーズ、表情、または他の通常のディープフェイクシステムの目的である他の特徴を本物のようにシミュレートすることを目的としていません。代わりに、ターゲット認識システムのスタイルで、スタイル転送を使用して、代替のビューの範囲を生成します。

システムは、ターゲットシステムのスタイルドメインを模倣し、出力に応じて解像度と「特異性」の範囲に応じて適応します。使用例には、コストの問題でアップグレードされない可能性のあるレガシーシステムが含まれます。これらのシステムは、新しい顔認識技術の世代に貢献することができません。なぜなら、出力の品質が低いためです。

システムをテストした研究者は、ノイズや低品質のデータを扱う画像認識システムで、注目に値する改善が見られたことを発見しました。

さらに、プロセスの有用な副産物として、ターゲットデータセットを特徴付けて比較することができ、さまざまなCCTVシステム用のカスタムデータセットの生成、ベンチマーク、比較が容易になります。

この方法は、既存のデータセットに適用でき、事実上のドメイン適応を実行し、顔認識システム用にそれらをより適切にします。

新しい論文「制御可能なガイド付き顔合成による制約のない顔認識」は、米国国家情報局長官事務所(ODNI、IARPA)から部分的に支援されており、ミシガン州立大学の4人の研究者によって執筆されています。

特集コンテンツ

低品質顔認識(LQFR)は、過去数年間で注目に値する研究分野になりました。市民や自治体の当局は、ビデオ監視システムを堅牢で長持ちするように構築したため、多くの「レガシー」監視ネットワークは、技術的負債の犠牲者となり、機械学習のデータソースとしての適応性が低下しています。

幸いなことに、拡散モデルやその他のノイズベースのモデルは、このタスクを解決するために特に適しています。最近の最も人気のある画像合成システムの多くは、パイプラインの一部として低解像度画像のアップスケーリングを実行します。これは、ニューラル圧縮技術(画像や動画をビットマップデータではなくニューラルデータとして保存する方法)にも不可欠です。

顔認識の課題は、最小限の「特徴」から最大の精度を得ることです。最小限の特徴とは、最も小さく、最も約束のない低解像度画像から抽出できるものです。この制約は、画像を通過できるVRAMのサイズの技術的制限があるため、モデルをトレーニングするときに存在します。

この意味で、「特徴」という用語は混乱を招きます。画像から抽出できる特徴は、教会の線条、山、または顔データセットの顔の特徴である、どのような画像でも取得できます。

コンピュータビジョンのアルゴリズムは現在、画像やビデオのアップスケーリングに優れています。さまざまな方法が提案されており、低解像度または劣化したレガシーの監視映像を「強化」して、法的目的で使用できるようにすることができます。

「地に足をつけた」セレブの必要性

顔認識(FR)アルゴリズムは、MS-Celeb-1MやWebFace260Mなどのデータセットでトレーニングされています。これらのデータセットは、研究コミュニティによってベンチマークとして使用されています。しかし、著者は、これらのデータセットでトレーニングされたFRアルゴリズムは、多くの古い監視システムの出力ドメインに適していないと主張しています。

論文には以下のように記載されています。
「現代のFRモデルは、リアルワールドの監視画像(制約なし)ではうまく機能しません。なぜなら、ウェブクロールされたセレブの顔のデータセットは、センサノイズ、低解像度、モーションブルア、タービュランス効果などの「野外」バリエーションが不足しているからです。」

テスト

研究者は、MSUの以前の研究をテンプレートとして使用し、MS-Celeb-1mとMS1M-V2を使用してシステムをテストしました。ターゲットデータセットは、香港中文大学のWiderFaceデータセットでした。

システムは、IJB-B、IJB-C、IJB-S、TinyFaceの4つの顔認識ベンチマークに対してテストされました。

CFSMは、約10%のMS-Celeb-1mのトレーニングデータ、約40万枚の画像でトレーニングされ、125,000イテレーション、バッチサイズ32、Adamオプティマイザ、学習率1e-4でトレーニングされました。

ターゲットの顔認識モデルは、ResNet-50の改変をバックボーンとして使用し、トレーニング中にArcFace損失関数を有効にしました。

結果は以下の通りです。

著者は以下のように述べています。
「ArcFaceモデルは、顔認識と検証タスクの両方でベースラインを上回り、新しいSoTAパフォーマンスを達成しています。」

システムは、さまざまな監視システムの特性からドメインを抽出して比較することもできます。

著者はさらに以下のように述べています。
「CFSMは、顔認識タスクの精度を高めるために、攻撃的手法を使用することができます。また、ラベルや予測子に依存しない方法で、スタイルベースを学習し、データセットの違いを理解することができます。」

「私たちは、制御可能なガイド付き顔合成モデルが、制約のない顔認識に大きな力を持ち、データセットの違いを理解することができると信じています。」

* 著者によるインライン引用のハイパーリンクへの私の変換。

最初に公開されたのは2022年8月1日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai