Andersonの視点
AIを使用した実際のビデオへの会話の追加

新しいAIフレームワークは、リタイアリング不要で、1つのエンドツーエンドシステムで、ビデオ内の人物の言葉を書き換えたり、削除したり、追加したりできる。
3年前、インターネットは、週に学術ポータルで公開される20〜30のAIビデオ編集フレームワークのいずれかによって驚かされていたでしょう。ただし、この人気のある研究分野は現在、もう1つの「AIスロップ」の分野を構成するほど多くなっています。私は2〜3年前に比べて、このようなリリースを遙かに少ない数だけカバーしています。
ただし、この分野の現在のリリースの1つが私の目に止まりました。実際のビデオクリップに介入し、既存のビデオに新しいスピーチを挿入することができる統合システムです(フレームや顔から全体的な生成クリップを作成するのではなく、これはより一般的です)。
以下の例は、リリースのプロジェクトウェブサイトにある多数のサンプルビデオから編集したものです。まず、実際のソースクリップを見てから、その下に、クリップの中央に挿入されたAIスピーチ、音声合成、リップシンクを確認します。
クリックして再生します。ローカル編集とステッチング – FacEDiTによって提供されるいくつかのモダリティーの1つ。より高解像度の場合は、ソースウェブサイトを参照してください。ソース – https://facedit.github.io/
このアプローチは、新しい方法で開発された3つのうちの1つであり、最も著者(および私)が興味を持っているものです。基本的に、クリップは、真ん中のフレームの1つを新しいAI解釈の起点として使用し、続く(実際の)フレームを、生成された挿入クリップが一致するようにする目標として使用することで拡張されます。上記のクリップで、これらの「シード」と「ターゲット」フレームは、上部のビデオが一時停止している間に、下部のビデオが生成されたインフィルを提供することで表されます。
著者は、この顔と声の合成アプローチを、TVや映画の制作に大きな可能性を持つ、最初の完全に統合されたエンドツーエンド方法として位置付けている。
「映画製作者やメディアプロデューサーは、録音されたビデオの特定の部分を修正する必要があることがよくあります。たとえば、Titanic(1997)からのアイコニックなシーンで、ローズが「私はジャックを決して離さない」と言っている場合、監督は後に「私はジャックを決して忘れない」と言わせたいかもしれません。
「伝統的に、このような変更にはシーンの全体を再撮影する必要がありますが、これは費用がかかり、時間がかかります。話し手の顔の合成は、自動的に修正されたスピーチに合わせて顔の動きを変更することで、リタイアリングの必要性を排除する実用的な代替手段を提供します。」
AIによるこのような挿入は、文化的または業界の抵抗に直面する可能性がありますが、新しいタイプの人間主導のVFXシステムやツールスイートの機能性を構成する可能性もあります。いずれにせよ、現在の課題は技術的なものだけです。
新しいシステムは、既存のスピーチを変更することもできます。
クリックして再生します。既存のダイアログを変更するという、追加のダイアログを挿入するのではなく、例です。より高解像度の場合は、ソースウェブサイトを参照してください。
現状
現在、この種の合成機能を提供するエンドツーエンドシステムはありません。GoogleのVeoシリーズなどの生成的なAIプラットフォームはオーディオを生成でき、さまざまな他のフレームワークはディープフェイクオーディオを作成できますが、実際の映像に干渉するように新しいシステム – FacEDiT – が実行できるように、さまざまなアーキテクチャとトリックの複雑なパイプラインを作成する必要があります。
システムは、拡散トランスフォーマー(DiT)をフローマッチングと組み合わせて、周囲の(コンテキスト)動きとスピーチオーディオコンテンツに条件付けた顔の動きを作成します。システムは、LivePortrait(最近、Klingによって引き継がれました)を含む、顔の再構成を扱う既存のパッケージを活用しています。
この方法に加えて、著者は、最初にこれらの課題を単一の解決策に統合したため、FacEDiTBenchという新しいベンチマークと、特にこのタスクに適したいくつかの新しい評価メトリックを作成しました。
新しい研究は、FacEDiT:統一された話し手の顔編集と生成を介した顔の動きのインフィリングというタイトルで、韓国のポハン大学、KAIST、テキサス大学オースティン校の4人の研究者によって行われました。
方法
FacEDiTは、周囲の動きと音声オーディオに基づいて、俳優のオリジナルのパフォーマンスの欠けている部分を埋める方法を学習することで、顔の動きを再構成するようにトレーニングされています。以下のスキーマのように、このプロセスにより、モデルはトレーニング中にギャップフィラーとして機能し、声と一致する顔の動きを予測しながら、元のビデオと一致するようにします。

FacEDiTシステムの概要、顔の動きが自己教師ありインフィリングを介してトレーニングで学習され、推論時に編集されたスピーチによって導かれ、最終的に元の映像の外観を再利用しながら、ターゲットの動きのみを置き換えることでビデオにレンダリングされる。 ソース
推論時、同じアーキテクチャは、ビデオがマスクされている量によって異なる2つの出力をサポートします。部分編集では、フレーズのみが変更され、残りは変更されずに残り、全文生成では、新しい動きが完全にスクラッチから合成されます。
モデルは、フローマッチングを介してトレーニングされ、ビデオ編集を顔の動きの2つのバージョンの間のパスとして扱います。
編集された顔の見た目をスクラッチから推測するのではなく、フローマッチングは、ノイズのあるプレースホルダーと正しい動きの間を滑らかに移動する方法を学習します。そうするために、システムは、上記のスキーマで説明されているLivePortraitシステムのバージョンを使用して、各フレームから抽出されたコンパクトな数字のセットを使用して顔の動きを表します。
これらのモーションベクターは、アイデンティティを絡めずに、表情や頭のポーズを説明するように設計されており、スピーチの変更は、人物の全体的な外見に影響を与えることなく、ローカライズできます。
FacEDiTトレーニング
FacEDiTをトレーニングするために、各ビデオクリップは一連の顔の動きのスナップショットに分割され、各フレームは対応するオーディオチャンクとペアにされました。モーションデータのランダムな部分が隠され、モデルは、スピーチと周囲のマスクされていない動きを使用して、隠された動きがどのようになっているかを推測するように求められました。
マスクされたスパンとその位置は、トレーニングの例ごとに異なるため、モデルは徐々に、小さな内部編集と、全シーケンス生成のための長いギャップを扱う方法を学習します。
システムの拡散トランスフォーマーは、ノイズのある入力を時間の経過とともに改良することで、マスクされたモーションを回復することを学習します。スピーチとモーションをモデルにすべて一度にフィードするのではなく、オーディオは各処理ブロックを介してクロスアテンションを通じてスレッドされ、システムはリップの動きをオーディオスピーチにより正確に一致させるのに役立ちます。
編集の現実感を保つために、編集された領域の境界でフリッカーまたはモーションジャンプが発生しないように、編集された領域の境界で注意が隣接するフレームに向けられます。位置埋め込み(モデルに各フレームがシーケンス内でどこにあるかを通知する)により、モデルは自然な時間的流れとコンテキストを維持することもできます。
トレーニング中、システムは、スピーチと近くのマスクされていない動きに基づいて、顔の動きのマスクされたスパンを予測することを学習します。推論時には、このセットアップが再利用されますが、編集されたスピーチによってマスクが導かれます。
単語やフレーズが挿入、削除、または変更されると、システムは影響を受ける領域を特定し、マスクし、新しいオーディオに一致する動きを再生成します。全シーケンス生成は、全領域がマスクされ、スクラッチから合成される特殊なケースとして扱われます。
データとテスト
システムのバックボーンは、拡散トランスフォーマーに22層、16個のアテンションヘッド、1024と2024pxのフィードフォワードディメンションで構成されています。モーションと外観の特徴は、フリーズされたLivePortraitコンポーネントを使用して抽出され、スピーチはWavLMとVoiceCraftを使用してエンコードおよび変更されます。
専用の投影層は、786次元のスピーチ特徴をDiTの潜在的な空間にマッピングし、DiTと投影モジュールのみがスクラッチからトレーニングされます。
トレーニングは、AdamWオプティマイザーを使用して、ターゲット学習率1e-4で、2つのA6000 GPU(各48GBのVRAM)で、合計バッチサイズ8で、100万ステップで実行されました。
FacEDiTBench
FacEDiTBenchデータセットには、250の例が含まれており、各例には、元のスピーチと編集されたスピーチのビデオクリップと、両方のトランスクリプトが含まれています。ビデオは3つのソースから来ており、HDTFから100クリップ、Hallo3から100クリップ、CelebV-Dubから50クリップです。各クリップは、オーディオとビデオの両方が評価に十分なクオリティであることを確認するために、手動で確認されました。
GPT-4oは、各トランスクリプトを修正して、文法的に有効な編集を作成するために使用されました。これらの修正されたトランスクリプトと元のスピーチは、VoiceCraftに渡され、新しいオーディオを生成しました。各ステージで、トランスクリプトと生成されたスピーチは、品質に基づいて手動でレビューされました。
各サンプルは、編集の種類、変更のタイミング、変更されたスパンの長さでラベル付けされ、編集は挿入、削除、または置換として分類されました。変更された単語の数は、1〜3単語の短い編集、4〜6単語の中編集、7〜10単語の長い編集の範囲でした。
編集の品質を評価するために、3つのカスタムメトリックが定義されました。光学的連続性は、編集されたセグメントが周囲のビデオとどの程度よく合うかを測定するために、境界でのピクセルレベルの違いを比較します。 モーションの連続性は、編集されたフレームと編集されていないフレームの間の光学フロー変化を測定して、顔の動きの一貫性を評価します。 アイデンティティの保存は、ArcFace顔認識モデルを使用して、生成されたシーケンスからの顔の埋め込みを比較することで、編集後に主体の外見が一貫しているかどうかを推定します。
テスト
テストモデルは、約200時間のビデオコンテンツでトレーニングされました。これには、ブログ、映画、ハイレゾのYouTubeビデオなどが含まれていました。
話し手の顔の編集を評価するために、HDTFテストスプリットに加えて、FacEDiTBenchが使用されました。これは、このタスクのセットのベンチマークとして使用されるようになりました。
この機能をカプセル化できる直接比較可能なシステムがないため、著者は、少なくとも一部のターゲット機能を再現できるさまざまなフレームワークを選択し、基準として使用しました。具体的には、KeyFace、EchoMimic、EchoMimicV2、Hallo、Hallo2、Hallo3、V-Express、AniPortrait、およびSadTalkerです。
既存のメトリックも、生成と編集の品質を評価するために使用されました。リップシンクの精度は、SyncNetを介して評価され、オーディオとリップの動きの間の絶対誤差(LSE-D)と信頼度スコア(LSE-C)が報告されました。 Fréchet Video Distance(FVD)は、ビデオの全体的な現実感を量化し、学習された感覚相似性メトリック(LPIPS)は、生成されたフレームと元のフレームの間の感覚的な類似性を測定しました。
編集の場合、LPIPSを除くすべてのメトリックが、編集されたセグメントのみに適用されました。生成の場合、編集境界の連続性を除いて、全体のビデオが評価されました。
各モデルは、編集されたオーディオから一致するビデオセグメントを合成するように指示され、次にそれが元のクリップに差し込まれました(研究者は、この方法により、編集されたセクションと周囲の映像が接続される場所で目に見える不連続性が頻繁に発生することを指摘しています)。別のアプローチとして、編集されたオーディオから全体のビデオを再生成することもテストされましたが、これにより、編集されていない領域が上書きされ、元のパフォーマンスが保存されませんでした。

編集パフォーマンスのシステム間の比較。FacEDiTは、すべてのメトリックでベースラインを上回り、LSE-Dの低いリップシンクエラー、LSE-Cの高い同期信頼度、IDSIMの高いアイデンティティ保存、FVDの高い現実感、PcontinuityとMcontinuityの滑らかな編集境界を達成しました。
これらの結果について、著者は次のように述べています。
「私たちのモデルは、編集タスクで既存の方法を大幅に上回り、高い境界連続性と高いアイデンティティ保存を実現し、編集中に時間的および視覚的一貫性を維持する能力を実証しています。さらに、リップシンクの精度が高く、FVDが低いことは、生成されたビデオの現実性を反映しています。」
クリックして再生します。結果は、公開されたビデオからこの著者によって編集されました。より高解像度の場合は、ソースウェブサイトを参照してください。
さらに、編集と生成の両方の認識された品質を評価するために、人間の研究が実施されました。
各比較の場合、参加者は6つのビデオを表示され、全体的な品質に基づいてランク付けされ、リップシンクの精度、自然さ、ヘッドの動きのリアリティを考慮しました。編集トライアルの場合、参加者は編集されたセグメントと編集されていないセグメントの間の遷移のスムーズさも評価しました。

人間の評価者によって割り当てられた平均ランク。低い方が良い。編集と生成の両方で、参加者はビデオがどの程度自然で同期されているかを判断しました。編集の場合、編集されたスピーチと編集されていないスピーチの間の遷移のスムーズさも評価しました。
研究では、FacEDiTは編集の品質と遷移のなめらかさの両方で、明確なリードで一貫して最高ランクで評価され、生成設定でも強力なスコアを獲得し、その測定された利点が認知された出力に変換されることを示しています。
スペースの不足により、読者は追加の詳細について、ソースペーパーを参照するように指示します。実際、プロトタイプの研究提案は、テスト結果セクションを生成するのに苦労することがよくあります。なぜなら、そのコア提案自体が、後続の研究のための潜在的なベースラインになるからです。
結論
推論の場合でも、このようなシステムは、推論時に大きなコンピューティングリソースを必要とする可能性があり、ダウンストリームのユーザー(ここでは、VFXショップと想定)が作業を自社で行うことを困難にします。したがって、リアルなローカルリソースに適応できるアプローチは、クライアントの映像と一般的な知的財産を保護する法的義務のあるプロバイダーによって常に優先されます。
しかし、これは新しい提案を批判するものではなく、新しい提案は、量子化された重みやその他の最適化の下で完璧に動作する可能性があり、また、私がこの研究分野に戻ってくるのは久しぶりです。
初めて2022年12月17日に公開されました。同日20:10 EETに、最初の本文パラグラフに余白を追加するために編集されました。












