Andersonの視点
ビデオ フッテージの感情を AI で変更する

ギリシャと英国からの研究者は、ビデオ フッテージの表情と感情を変更するための新しいディープラーニング アプローチを開発しました。これは、元のオーディオの唇の動きの忠実性を維持しながら、表情と感情を変更することができます。

この記事の最後に埋め込まれたビデオから、アル・パチーノの表情を NED で変更した短いクリップ。高レベルのセマンティック コンセプトに基づく個々の顔の表情とその関連する感情。右側の ‘Reference-Driven’ 方法は、ソース ビデオの解釈された感情をビデオ シーケンス全体に適用します。 ソース: https://www.youtube.com/watch?v=Li6W8pRDMJQ
この分野は、デープフェイクされた感情の成長分野に属し、オリジナルの話者のアイデンティティを維持しながら、表情やマイクロ表情を変更します。この AI 技術が成熟すると、映画やテレビ番組の制作で俳優の表情を微妙に変更する可能性が開けられます。また、新しい ‘感情変更’ ビデオ デープフェイクのカテゴリも開けられます。
顔の変更
公人の顔の表情、たとえば政治家の表情は、厳格に管理されています。2016 年には、ヒラリー クリントンの表情が メディアの厳しい注視を受け、選挙の潜在的な悪影響について論じられました。表情は、FBI の関心事でもあり、面接での重要な指標でもあります。したがって、遠い将来、ライブ ‘表情制御’ フィルタが開発されることは、Zoom で事前選考を受ける求職者にとって望ましい開発となるでしょう。
2005 年の英国での研究では、顔の外見が 投票の決定に影響を与えることが示されました。一方、2019 年のワシントン ポストの特集では、コンテキストのないビデオ クリップの共有が、現在、フェイク ニュースの支持者が実際に公人の行動、反応、または感情を変更することができる最も近いものです。
ニューラル表情操作への道
現在、顔の表情を操作する最先端の技術は、解離を解決する必要があるため、未熟です。高レベルの概念 (たとえば、悲しい、怒った、幸せ、笑った) を実際のビデオ コンテンツから分離する必要があるからです。伝統的なデープフェイク アーキテクチャはこの解離をうまく実現していますが、異なるアイデンティティ間で感情をミラーするには、2 つのトレーニング フェイス セットが各アイデンティティに対応する表情を含む必要があります。

デープフェイクをトレーニングするために使用される顔の画像の典型的な例。現在、特定の ID の表情を変更するには、デープフェイク ニューラル ネットワーク内で ID 特有の表情⇔表情のパスを作成する必要があります。2017 年のデープフェイク ソフトウェアには、’笑顔’ という概念に対する固有の、セマンティックな理解はありません。ただし、2 つの主体間の顔の幾何学的変化をマッピングおよびマッチングするだけです。
望ましいのは、主体 B (たとえば) がどのように笑うかを認識し、主体 A の笑顔の画像にマッピングする必要なく、単に ‘笑顔’ スイッチを作成することです。
新しい論文は、Neural Emotion Director: Speech-preserving semantic control of facial expressions in “in-the-wild” videos というタイトルで、アテネ国立工科大学の電気電子工学学校、ギリシャの研究技術財団 (FORTH) のコンピュータ科学研究所、イギリスのエクセター大学の工学、数学、物理科学部の研究者によって発表されました。
チームは、Neural Emotion Director (NED) というフレームワークを開発しました。これには、3D ベースの感情翻訳ネットワーク、3D-Based Emotion Manipulator が含まれています。
NED は、受け取った表情パラメータのシーケンスをターゲット ドメインに翻訳します。トレーニングには、各アイデンティティに対応する表情を持つデータセットは必要ありません。

この記事の最後に表示されるビデオでは、NED が YouTube データセットからのフッテージに明らかな感情状態を課す一連のテストが実行されます。
著者は、NED が、ランダムで予測不可能な状況での ‘俳優の指示’ を行う最初のビデオ ベースの方法であると主張しています。コードは、NED の プロジェクト ページで入手可能です。
方法とアーキテクチャ
システムは、’感情’ ラベルが付与された 2 つの大きなビデオ データセットでトレーニングされます。
出力は、伝統的な顔の画像合成技術を使用して、ビデオに望ましい感情をレンダリングするビデオ フェイス レンダラーによって可能になります。これには、顔のセグメンテーション、顔のランドマークの整列、ブレンドが含まれます。ただし、顔の領域のみが合成され、元のフッテージに重ねられます。
最初に、システムは入力フレームの 3D 顔の回復と顔のランドマークの整列を取得して、表情を識別します。次に、これらの回復された表情パラメータは、3D ベースの感情操作機に渡され、セマンティック ラベル (たとえば ‘幸せ’) または参照ファイルによって計算されたスタイル ベクトルが計算されます。
参照ファイルは、特定の認識された表情/感情を表すビデオで、ターゲット ビデオ全体に重ねられ、元の表情を置き換えます。
最終的に生成された 3D 顔の形状は、正規化された平均顔の座標 (NMFC) と目画像 (上の画像の赤い点) とともに、ニューラル レンダラーに渡され、最終的な操作を実行します。
結果
研究者は、方法の有効性を評価するために、ユーザーと削除研究を含む包括的な研究を実施しました。結果は、NED がこのサブセクターの現在の最先端技術を上回っていることを示しています。

論文の著者は、この研究の後の実装と同様のツールが、主にテレビと映画産業で有用であると考えています。著者は次のように述べています。
‘私たちの方法は、映画のポストプロダクションやビデオ ゲーム、写真現実的な感情のアバターなど、ニューラル レンダリング技術の有用なアプリケーションの新しい可能性の広がりを開けます。’
これは、この分野における初期の研究ですが、ビデオではなく静止画像で顔の再演を行う最初の研究の一つです。ビデオは、実質的に非常に高速に連続して再生される静止画像ですが、以前の感情転送の適用を効果的にしない時間的考慮があります。付随するビデオや論文の例では、著者は NED の出力と他の比較可能な最近の方法との視覚的な比較を示しています。
より詳細な比較や NED の多くの例は、以下の完全なビデオで見つけることができます。
2021 年 12 月 3 日 18:30 GMT+2 – 論文の著者からの要望により、’参照ファイル’ に関して修正が行われました。私はこれを静止写真 (実際はビデオ クリップ) と誤って記述していました。また、研究技術財団のコンピュータ科学研究所の名前を修正しました。
2021 年 12 月 3 日 20:50 GMT+2 – 上記の機関の名前について、論文の著者からの 2 回目の修正依頼がありました。















