Andersonの視点
GoogleのLipSync3Dは、改善された「Deepfaked」口の動きの同期化を提供する

Google AIの研究者とインド工科大学カラグプルの間の共同研究により、オーディオコンテンツから話す頭を合成するための新しいフレームワークが提供されました。このプロジェクトの目的は、オーディオから「話す頭」のビデオコンテンツを作成するための最適化された方法を開発することであり、口の動きを同期させるために、吹き替えまたは機械翻訳されたオーディオを使用し、さらにアバター、インタラクティブアプリケーション、リアルタイム環境での使用を目的としています。

ソース:https://www.youtube.com/watch?v=L1StbX9OznY
このプロセスでトレーニングされたマシンラーニングモデルは、LipSync3Dと呼ばれ、ターゲット顔のアイデンティティの単一のビデオのみを入力データとして必要とします。データの準備パイプラインでは、顔の幾何学的特性の抽出と照明や他の入力ビデオの側面の評価を分離し、より経済的で集中したトレーニングを可能にします。

LipSync3Dの2段階のワークフロー。上部では、ターゲットオーディオから動的にテクスチャ化された3D顔の生成;下部では、生成されたメッシュをターゲットビデオに挿入する処理。
実際、LipSync3Dの最も注目すべき貢献は、その照明正規化アルゴリズムであり、トレーニングと推論の照明を切り離すことができます。

幾何学的特性から照光データを切り離すことで、LipSync3Dはよりリアルな口の動きの出力を、困難な条件下でも生成できます。近年の他のアプローチでは、固定された照明条件に限定され、照光条件の違いに対する限界が明らかになります。
入力データフレームの前処理では、システムは、特定の照明条件下でビデオが撮影されたときの特性である、反射点を識別して除去する必要があります。これは、リライト処理に干渉するためです。

LipSync3Dは、単なるピクセル分析ではなく、顔の動きを評価し、特定の顔のランドマークを使用して、モバイルなCGIスタイルのメッシュと、伝統的なCGパイプラインでそれらを巻き付ける「展開された」テクスチャを生成します。

LipSync3Dのポーズ正規化。左側は入力フレームと検出された特性;中央は生成されたメッシュの評価の正規化された頂点;右側は、テクスチャ予測の基準となるテクスチャアトラス。ソース:https://arxiv.org/pdf/2106.04185.pdf
これに加えて、研究者は、LipSync3Dが以前の研究に対して3つの主な革新をもたらしたと主張しています:幾何学、照明、ポーズ、テクスチャを、正規化された空間で個別のデータストリームに分離すること;時間的に一貫したビデオ合成を生成する、容易にトレーニング可能な自己回帰的テクスチャ予測モデル;人間の評価と客観的な指標によって評価されたリアリズムの向上。

ビデオの顔画像のさまざまな側面を分離することで、ビデオ合成に対するより大きな制御が可能になります。
LipSync3Dは、音声から直接、音素やその他の音声の側面を分析して、口の周りの筋肉の姿勢に相当する口の幾何学的動きを導き出すことができます。

このプロセスでは、ジョイント予測パイプラインを使用し、推論された幾何学とテクスチャには、自己符号化セットアップで専用のエンコーダーがありますが、音声エンコーダーは、モデルに課せられる予定の音声と共有されます。
LipSync3Dの可変な動きの合成は、さらにスタイライズされたCGIアバターを動かすことを目的としています。これは、実世界の画像と同じ種類のメッシュとテクスチャ情報であることに注意してください。

スタイライズされた3Dアバターの口の動きは、ソーススピーカービデオによってリアルタイムで動かされます。このようなシナリオでは、最良の結果は、事前にパーソナライズされたトレーニングによって得られます。
研究者は、さらにリアルな感覚を持つアバターの使用も予測しています。
![]()
ビデオのサンプルトレーニング時間は、2〜5分のビデオの場合、3〜5時間です。パイプラインでは、TensorFlow、Python、C++、GeForce GTX 1080を使用し、バッチサイズは128フレーム、エポックは500〜1000回で、各エポックはビデオの完全な評価を表します。
口の動きのダイナミック再同期化に向けて
口の動きを新しいオーディオトラックに合わせて同期させる分野は、最近のコンピュータビジョン研究で多くの注目を集めてきました(以下参照)。これは、論争の的となっているディープフェイク技術の副産物でもあります。
2017年、ワシントン大学は、研究を発表し、オーディオからリップシンクを学習し、それを使用して当時の大統領オバマの口の動きを変更しました。2018年には、マックス・プランク・インフォマティクス研究所が主導する別の研究イニシアチブが、アイデンティティー>アイデンティティーのビデオ転送を可能にし、リップシンクはこのプロセスの副産物でした。2021年5月には、AIスタートアップのFlawlessAIが、プロプライエタリのリップシンク技術TrueSyncを発表し、主要な映画リリースの吹き替え技術の向上を可能にするものとして、広く受け入れられました。
また、ディープフェイクのオープンソースリポジトリの継続的な開発は、この分野における別の活発なユーザーによる研究分野を提供しています。











