Andersonの視点

ディープフェイクの感情の夜明け

mm
Unite.AI を Google の優先ソースに追加

研究者は、ビデオ内の顔に任意の新しい感情を課すための新しい機械学習技術を開発しました。これは、最近外国語の吹き替えに合わせてリップシンクを実現するための解決策として現れた既存の技術を利用しています。

この研究は、ボストンのノースイースタン大学とMITのメディアラボの間で共同で行われており、《Invertable Frowns:Video-to-Video Facial Emotion Translation》と題されます。研究者は、初期の結果の品質がさらに研究を通じて開発される必要があることを認めていますが、この技術は、Wav2Lip-Emotionと呼ばれ、ニューラルネットワーク技術を使用してフルビデオの表情を変更するという点で、初めての試みであると主張しています。

ベースコードは、GitHubで公開されていますが、モデルチェックポイントは後日オープンソースリポジトリに追加される予定です。

左側は、ソースビデオの「悲しい」フレーム。右側は「幸せな」フレーム。中央には、2つの新しいアプローチが表示されています。上段:顔の表情全体を置き換えるフルマスク。下段:伝統的なWav2Lip方法で、顔の下部のみを置き換える。ソース:https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

左側は、ソースビデオの「悲しい」フレーム。右側は「幸せな」フレーム。中央には、2つの新しいアプローチが表示されています。上段:顔の表情全体を置き換えるフルマスク。下段:伝統的なWav2Lip方法で、顔の下部のみを置き換える。 ソース:https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

単一ビデオをソースデータとして

理論的には、これらの操作は、DeepFaceLabやFaceSwapなどの従来のディープフェイクリポジトリを使用して実行できます。ただし、標準的なワークフローでは、別のアイデンティティ(たとえば、ターゲットを演じる俳優)を使用して、表情を転送し、パフォーマンス全体を別の個人のものにする必要があります。さらに、ディープフェイクの音声クローニング技術を使用して、イリュージョンを完成させる必要があります。

さらに、人気のあるフレームワークを使用して、単一のソースビデオ内のターゲットの表情を変更することは、顔のアラインメントベクトルを変更する必要がありますが、これは現在のアーキテクチャでは実行できないことです。

Wav2Lip-Emotionは、元のビデオオーディオダイアログのリップシンクを維持しながら、関連する表情を変換します。

Wav2Lip-Emotionは、元のビデオオーディオダイアログのリップシンクを維持しながら、関連する表情を変換します。

代わりに、Wav2Lip-Emotionは、ビデオの一部から感情関連の表情を「コピーして貼り付け」、他のポイントに置き換えることを目指しています。ソースデータの節約が意図されており、最終的には表情操作のための低労力方法を提供することを目的としています。

オフラインモデルは、後に開発され、話者の別のビデオにトレーニングされ、1つのビデオに「表情のパレット」を必要とせずに、表情操作が可能になります。

潜在的な目的

著者は、表情変更のためのいくつかの応用を示唆しています。例えば、PTSDや顔パーシーの症状を持つ人々の影響を補償するためのライブビデオフィルタなどです。論文では次のように述べられています。

『表情が抑制されている人やそうでない人はいずれも、社会的状況に合わせて表情を調整することで利益を得ることができます。たとえば、ビデオ会議中に大声で叫び合っているスピーカーがいても、不快な表情を除外してコミュニケーションの内容を取得したい場合があります。あるいは、映画監督が俳優の表情を強調または減らしたい場合があります。』

顔の表情は、意図の重要な指標であるため、言葉と矛盾する場合でも、表情を変更する能力は、ある程度、コミュニケーションが受け取られる方法を変更する能力も提供します。

過去の研究

機械学習による表情変更の研究は、2012年にAdobe、Facebook 、ラトガース大学の共同研究によって提案された、テンソルベースの3D幾何学的再構築アプローチを使用して表情を変更する方法が発表されたときに始まりました。このアプローチでは、ターゲットビデオの各フレームにCGIメッシュを重ねて変更を加えました。

2012年のAdobe/Facebookの研究では、伝統的なCGI駆動の変更をビデオに適用して表情を操作しました。表情を増強または抑制することができました。ソース:https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

2012年のAdobe/Facebookの研究では、伝統的なCGI駆動の変更をビデオに適用して表情を操作しました。表情を増強または抑制することができました。 ソース:https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

結果は期待できたものでしたが、この技術は負担が大きく、必要なリソースも多く、当時はCGIが先行していました。

新しい論文に最も近いのは、2020年にリリースされたMEADです。MEADは、60人の俳優が同じ文章を読みながら様々な表情を示す40時間のビデオデータセットと、発話頭ビデオを生成するモデルです。俳優は15カ国から集められ、国際的な特徴を備えており、プロジェクト(および派生プロジェクト)が一般化された表情合成を生成するのに役立つことを目的としています。

SenseTime Research、カーネギーメロン大学、中国の3つの大学の共同研究による2020年のMEAD。ソース:https://wywu.github.io/projects/MEAD/MEAD.html

SenseTime Research、カーネギーメロン大学、中国の3つの大学の共同研究による2020年のMEAD。 ソース:https://wywu.github.io/projects/MEAD/MEAD.html

2018年には、GANimation:Anatomically-aware Facial Animation from a Single Imageという論文が発表され、静止画像のみで表情を増強または変更するために、生成対抗ネットワークを使用しました。

静止画像の表情を変更するためのGANimation。ソース:https://arxiv.org/pdf/1807.09251.pdf

静止画像の表情を変更するためのGANimation。 ソース:https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

代わりに、新しいプロジェクトはWav2Lipに基づいています。Wav2Lipは、2020年に、リップシンクを新しいスピーチ(または歌)入力に合わせるための方法を提供することで注目を集めました(または歌)。

元のWav2Lipアーキテクチャは、BBCアーカイブスの会話文からなるコーパスでトレーニングされました。Wav2Lipを表情変更のタスクに適応させるために、研究者は上記のMEADデータセットでアーキテクチャを「ファインチューン」しました。

MEADには、60人の俳優が同じ文章を読みながら様々な表情を示す40時間のビデオが含まれています。俳優は15カ国から集められ、国際的な特徴を備えており、プロジェクト(および派生プロジェクト)が一般化された表情合成を生成するのに役立つことを目的としています。

研究時点で、MEADはデータセットの最初の部分のみをリリースしており、47人の個人が「怒り」、「嫌悪」、「恐怖」、「軽蔑」、「幸せ」、「悲しみ」、「驚き」などの表情を示しています。この新しいアプローチの初期段階では、研究者は「幸せ」と「悲しみ」の2つの感情の超positionまたは変更のみに焦点を当てました。これらは最も容易に認識できる感情だからです。

方法と結果

元のWav2Lipアーキテクチャは、顔の下部のみを置き換えますが、Wav2Lip-Emotionは、フルフェイス置き換えマスクと表情合成も実験しています。したがって、研究者は、評価方法を変更する必要がありました。これは、フルフェイス構成のために設計されていませんでした。

著者は、元のコードを改良して、元のオーディオ入力を維持し、リップシンクの一貫性を維持しました。

ジェネレータ要素には、アイデンティティエンコーダー、スピーチエンコーダー、顔デコーダーが含まれています。これは、以前の研究に従ったものです。スピーチ要素は、スタックされた2D畳み込みとしてエンコードされ、関連するフレームに連結されます。

生成要素に加えて、変更されたアーキテクチャには、リップシンクの品質、感情目的要素、対抗的にトレーニングされた視覚的品質要素を対象とする3つの主要なディスクリミネータ要素が含まれています。

フルフェイス再構築の場合、元のWav2Lipの仕事には先例がなかったため、モデルはスクラッチからトレーニングされました。下半面トレーニング(半面マスク)の場合、研究者は元のWav2Lipコードに含まれるチェックポイントから始めました。

自動評価に加えて、研究者は、半自動サービスプラットフォームから提供されたクラウドソーシングされた意見を使用しました。ワーカーは、超positionされた感情を認識することに関して、出力の評価を高く評価しましたが、画像の品質に関しては「中程度」の評価を報告しました。

著者は、生成されたビデオの品質をさらに改善するだけでなく、将来的にはより広範な感情の範囲を包含する可能性があることを示唆しています。また、この研究は、将来的にはラベル付けされた、または自動的に推論されたソースデータとデータセットに適用できる可能性があることを示唆しています。これにより、最終的には、ユーザーの気まぐれで感情を上げ下げしたり、元のソースビデオに対して対照的な感情に置き換えたりすることができる、真正なシステムが実現します。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai