Andersonの視点
新しいディープフェイク方法が「顔のホスト」問題を解決する

ディープフェイク画像がビデオの信憑性を損なう可能性についてのメディアの過熱報道にもかかわらず、現在人気のあるすべての方法は、基本的に「顔のホスト」を探すことにある。つまり、ターゲットの顔と形状が似ている顔を探すことである。
元の映像に広い顔が写っているが、ターゲットの人物には細い顔である場合、結果は常に問題があった。なぜなら、元の顔を削り取って、削り取られた部分の背景を再構築する必要があるからである。DeepFaceLabやFaceSwapなどの現在のパッケージは、構成を逆にした場合(狭い>広い)に限り、限定的な結果を生み出すことができるが、このシナリオに対処するための信頼性のある方法は提供していない。
現在、テンセントと中国の厦門大学の共同研究により、新しいアプローチが開発された。このアプローチはHifiFaceと呼ばれ、この不足を補うことを目的としている。

アンハサウェイの2つのHifiFaceディープフェイク。ホストの顔の形状が不適合であるにもかかわらず、良好的に似ている。HifiFaceは、伝統的にディープフェイクで躓くメガネを着用したターゲットにも効果的に機能する。ソース:https://arxiv.org/pdf/2106.09965.pdf
ディープフェイク顔のリモデリング
以前のアプローチ、たとえば2019年の「Subject Agnostic Face Swapping and Reenactment」(FSGAN)は、3DMMフィッティング(3Dモーファブルモデル)や、顔のランドマーク認識や変換に基づく他の方法論に依存していた。ここで、顔を「上書き」するための顔の線条は、スワップの境界をほぼ決定する。

3DMMの顔のランドマーク検出。 ソース:https://github.com/Yinghao-Li/3DMM-fitting
競合する方法は、顔認識ネットワークから派生した機能を使用してきましたが、これらは主にテクスチャを再構築することに重点を置いており、顔のホストが完全に互換性のない場合(例:髪の毛、顎線、ほほ線の限界と形状)には、「マスクのような」効果を生み出す。
これらの問題に対処するために、中国の研究者は、人工知能学部のメディア分析および計算研究所に基づいて、ターゲットとソースの顔の3D再構築モデルを使用して、ターゲットとソースの顔の係数を推論するエンドツーエンドネットワークを開発しました。これは、形状情報として再結合され、顔認識ネットワークからのアイデンティティベクトル情報と連結されます。
この幾何学的データは、構造情報としてエンコーダー・デコーダーモデルに供給され、ターゲットの顔の表情や姿勢とともに結合され、正確な転送のための補助情報源として活用されます。
セマンティックフェイシャルフュージョン
さらに、HifiFaceには、セマンティックフェイシャルフュージョン(SFF)コンポーネントが含まれており、エンコーダーの低レベル機能を使用して、空間およびテクスチャ情報を保存することなく、ターゲット画像のアイデンティティを維持します。エンコーダーとデコーダーの機能は、学習済みの適応マスクに統合され、背景情報は学習済みの顔マスクを介して出力にブレンドされます。

HifiFaceの動作。 ソース:https://johann.wang/HifiFace/
この方法により、HifiFaceは、元の素材の顔の境界を硬い限界として使用するのではなく、拡張された顔のセマンティックセグメンテーションを使用して、顔の境界でより適応的な融合を実行できるようになります。
FSGAN、SimSwap、FaceShifterなどの以前の方法と比較して、HifiFaceは顔の形状の再構築において優れていることを実証しています。なぜなら、HifiFaceは「ゴースト」要素を近似するのではなく、顔の境界を明確に再構築するからです。
テスト
研究者は、VGGFace2とDeepGlint Asian-Celebデータセットを使用してシステムを実装しました。顔は5つの外側のランドマークを使用して整列され、256×256ピクセルにリサイズされました。さらに、512×512ピクセルの高解像度モデルを生成するために、ポートレート強化ネットワークも使用されました。モデルは、Adamを使用してトレーニングされました。
FaceShifterはアイデンティティをよく保存していますが、表情、色、オクルージョンなどの問題に対処することはHifiFaceほど効果的ではなく、ネットワーク構造もより複雑です。FSGANは、光源からターゲットへの転送で問題があります。
研究者は、FaceForensics++を使用して、競合する方法と比較して、10フレームずつのバッチで変換されたビデオをサンプリングし、HifiFaceが優れたID検索スコアを達成したことを発見しました。さまざまな要素、たとえば画像の品質をテストした結果、研究者はHifiFaceが他の方法を上回っていることを確認しました。
この研究は、元の素材を抽象化して、正確なアイデンティティを転送できるようにする、さらなる一歩です。現在のFOSSパッケージのいくつか、DeepFaceLabを含む、は完全な頭の置き換えのための初期の機能を備えていますが、これらはHifiFaceと同様に、髪の毛を考慮していないため、顔の「構築」よりも「削り取る」ことに効果的です。


















