Andersonの視点
フルボディディープフェイク動画生成への道

待ちが必要な分野で、新しいシステムが登場し、ライブストリーミングの人間シミュレーションを実現するために、苛立たしいレンダリングの待ち時間を減らすことができました。
フルボディシミュレーションの最新技術は、2022年にフルボディディープフェイクが初めて登場して以来、大きく進歩しました。現在、Wan-AnimateやGrokなどのオープンソースシステムやクローズドソースシステムが、1枚または複数の画像を一貫した動画パフォーマンスに変換するという、すでに馴染みのある能力に慣れています。
再生するにはクリックしてください. WanAnimate-2.2の人物置換の例です。より高解像度の場合は、ソースを参照してください。 ソース
さらに、従来のオートエンコーダーベースのリアルタイム顔ディープフェイクフレームワークであるDeepFaceLiveは、Deep-Live-Camなどのより高度なフレームワークに取って代わられました。Deep-Live-Camは、LivePortraitのイテレーションをオーケストレーションし、レガシーのGANとInsightFaceモジュールを利用して、リアルタイムのディープフェイク動画を生成します。
再生するにはクリックしてください. Deep-Live-Camを使用したElon Muskのディープフェイク動画です。より高解像度の場合は、ソースを参照してください。 ソース
しかし、Deep-Live-Camのようなフレームワークは、解像度と機能性の点で制限があります。たとえば、特定の顔やアイデンティティを生成できますが、ライブストリーミングの全身シミュレーションには不適切です。
BRB…
現在のAI人間模倣システムのほとんどは、同様に制限されています。特に、最も優れた人間シミュレーション/模倣システムはオフラインで動作し、リアルタイムで動作するにはリソースが不足しています。
これらのシステムは、ダンスなどの全身動作をライブストリーミングするには不適切です。
最近の例として、オープンウェイトのWan2.2 Animateがあります。これは、趣味のコミュニティとプロのリセラーに人気がありましたが、生成と待機のシナリオです。
再生するにはクリックしてください. 2025年からのWan2.2 Animateの機能の例です。少しの忍耐強さが必要です。より高解像度の場合は、ソースを参照してください。 ソース
現在、優れた、多才な、または迅速なものを選択する必要があります。
LiveAnimate
中国から新しいシステムが登場し、Wan2.2 Animateをライブドリブンアニメーションフレームワークに変換し、現在、近似20fpsで動作し、さまざまなシナリオで印象的な結果を出しています。
再生するにはクリックしてください: プロジェクトサイトから、LiveAnimateはステージダンス、屋外の全身、クローズアップポートレートのシナリオで、全身、手、顔の動きを再現しています。 . より高解像度の場合は、ソースを参照してください。 ソース
新しいシステムは、ビデオを生成する方法を変更することで、ライブ対応バージョンを実現します。過去と未来のフレームを一緒に処理するのではなく、各新しいセグメントをアクションが展開されるにつれて生成します。さらに、長いセッション中にサブジェクトの外観を一貫性を持たせるために、選択された以前のポーズを保持します。
これは、古典的なCGIシステムがテクスチャマップを参照する方法と似ています。
LiveAnimateは、上半身の動き、たとえばインタビューシナリオのようなシナリオにも対応できます。
再生するにはクリックしてください. 静的なオフィスシーンでの繊細な頭と手の動き。
新しいペーパーは、LiveAnimateがライバルフレームワークと比較して、特定の状況でアイデンティティをわずかに優れて保持できることを認めています。ただし、これらのライバルはすべてオフラインシステムであり、LiveAnimateは明らかに新しい方向性を模索しています。
推論には2つのH100 NVIDIA GPUが必要で、合計160GBのVRAMが必要です。
ペーパーには次のように記載されています。
‘LiveAnimateは最初の30秒から最後の1分まで、ほぼ一定の認知質とアイデンティティを維持していますが、以前のシステムは大きく劣化しています。
‘これらの結果は、インタラクティブな全身アニメーションにおける質、待ち時間、期間の新しいオペレーティングポイントを確立します。 ‘
新しいペーパーは、LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Timeというタイトルで、中国香港大学、AlibabaのQwen Applications Business Group、Liblib AIの9人の著者によって発表されました。プロジェクトサイトもあり、コードは『間もなく』利用可能になります。
方法
LiveAnimateは、Wan2.2 Animateを連続して生成しやすくするように設計された2段階のトレーニングプロセスです。さらに、各新しいビデオブロックが生成されるにつれて、有用な以前のポーズを取得するメモリシステムを備えています。
LiveAnimateのパイプラインの概要。左側に2段階のトレーニングプロセス、右側にライブ生成が表示されています。ここでは、入力ポーズが保存された以前のポーズと照合され、最近のフレームと組み合わせて新しいビデオブロックを生成する3つのステップが表示されています。ソース – https://www.unite.ai/in-search-of-an-ai-that-can-follow-an-entire-movie/#:~:text=For%20these%20purposes%2C%20InsightFace%20is%20used%2C%20leveraging%20an%20ArcFace%20loss%2Dbased%20recognition%20head
元のWan2.2 Animateは、無限に拡張するビデオではなく、シーケンス全体を考慮するように設計されています。したがって、著者はトレーニングビデオを連続するブロックに分割し、各ブロックを以前のブロックをコンテキスト/グラウンドトゥルースとして使用して生成しました。これにより、モデルは最初に信頼できる以前の素材から続けることを学び、次に自身の出力から蓄積されたエラーに対処する必要があります。
忘れないで
このプロセス全体を通じて、元のリファレンス画像は「Ref Sink」という固定リマインダーを介して常に利用可能です。各ブロックが完了すると、「Clean KV Update」がブロックから取得した情報を、次のブロックの歴史的コンテキストに変換します(ただし、既存のエラーは修正されません)。
最初のトレーニング段階では、ブロックごとに50のノイズ除去ステップが必要で、ライブ操作は実用的ではありません。2段階目では、3つのステップにプロセスを凝縮し、モデルが自身の生成された履歴に公開されることになります。これは、展開が必要です。
LiveAnimateを展開するために使用される2つのトレーニング段階。最初の段階では、クリーンな以前のビデオブロックから学習し、2段階目では、3つのステップに生成を減らし、モデルが自身の不完全な出力にトレーニングされます。
これらの自己生成されたシーケンスをトレーニングすることは別の課題をもたらします。なぜなら、ビデオ全体の計算履歴を保持することは、プロハイブなコストがかかるからです。代わりに、1つの完全な実行が行われ、次にブロックごとにトレーニングのために再訪問されます。各ブロックは、全シーケンスを計算的に「ライブ」に保持することなく、更新を受けることができます。
やめないで
無限の生成のために、LiveAnimateは、どれを覚える価値があるかを決定する必要があります。すべてを保持することは、処理要件を爆発的に増大させることになりますが、最近のフレームのみを保持することも、有用な以前のビューを破棄することになります。
したがって、ポーズ取得シンク注意 (PR-Sink) がこの問題に対処します。これは、最初に生成されたブロックを「静的シンク」として保持し、置き換え可能な「動的シンク」として機能し、現在と2つの前のブロックを含むローリングウィンドウを保持します。リファレンス画像は、Ref Sinkを介して個別に利用可能です。固定のストレージサイズにより、ビデオの長さが増えてもコストが増加しません。
ブロックウォーズ
これらの古いポーズを選択するために、ViTPoseは、3つのフレームのボディと手の位置を、コンパクトな表現に減らします。メモリバンクには、このような5つの代表的なポーズが格納され、最初の20ブロックの間に多様なポーズを優先して、重複を避けています。
生成中、入力ポーズはこれらの代表的なポーズと比較され、最も近い一致が取得され、以前の同様の位置で人物がどのように見えたかについての以前の証拠が提供されます。ただし、直前に前のブロックは、すでにローリングウィンドウに存在するため、除外され、動的シンクは、さらに過去から情報を取得することができます。
最終的に、実行時は、2つのH100 GPUにわたる注意処理の分散、計算と通信の重なり合い、可能な限りキャッシュされた情報の再利用によって、速度が最適化されます。
データとテスト
LiveAnimateは、AVSpeechから40,000のトーキングビデオと、TikTok datasetおよびHumanVidから20,000の人間の動きビデオでトレーニングされました。トレーニングと推論は、480×480、384×672、および672×384ピクセルの解像度をサポートしています。
トレーニングは、Wan2.2-Animate-14Bベースチェックポイントから始まり、LoRAとランク128を使用して、最初の段階では8つのNVIDIA H100 GPUで10,000ステップ、2段階目では20,000ステップを実行しました。
ビデオは、3つの潜在的なフレーム(モデルの圧縮された内部表現)で生成され、12のRGBフレームに相当し、推論は2つのH100で実行されました。
評価では、LiveAnimateを既存のポーズ駆動型人間アニメーション方法と比較し、ショートシーケンスとロングシーケンスの両方で、共通の設定でリファレンス画像とドライビングポーズを使用しました。ロングフォームテストでは、3分間の生成で、質とアイデンティティが時間の経過とともに安定しているかどうかを調べました。
テストされたフレームワークには、EverAnimate、One-to-All、SCAIL††、UniAnimate-DiT、およびWan2.2-Animateが含まれました。
使用されたメトリックには、視覚的な質、アイデンティティの一貫性、分布の質、および時間的表現エラーが含まれました。 美的スコア (ASE) と 参照なし画像品質評価 (IQA) は、フレームレベルの視覚的な質を測定しました。 DINO、類似性 (DINO-S)、およびリファレンスアイデンティティとの外観の一貫性; Fréchet Inception Distance (FID)、分布の質; および VideoMAE機能距離 (V-MAE)、生成されたビデオが時間の経過とともに動きを保存する程度を測定しました。
3分間の連続生成における質とアイデンティティのテスト結果。LiveAnimateは、シーケンスが進むにつれて、5つのメトリックすべてで比較的安定しています。いくつかの競合方法は、時間の経過とともに大きな劣化を示しています。IQA、ASE、DINO-Sの場合、より高い値はよりよいです。FIDとV-MAEの場合、より低い値はよりよいです。
上記の初期結果グラフに示されているように、LiveAnimateは最初の30秒で、2.823の最高のASEと4.047のIQAを達成しました。著者は、これが3ステップの蒸留によって認知質が保存されていることを示唆しています。
さらに、LiveAnimateは3分間の連続生成中、視覚的な質とアイデンティティの一貫性のスコアがほぼ変化しませんでした。
一方、One-to-Allは時間の経過とともに大きく劣化し、視覚的な質とアイデンティティの一貫性が低下し、分布エラーが増加しました。ベースのWan2.2 Animateも、アイデンティティの一貫性のある程度の低下を示しました。
著者は次のように述べています。
‘これらの傾向は、ストリーミングアニメーションに長距離コンテキストを明示的に管理することの重要性を支持しています。 ‘
LiveAnimateのスケーリング効率も、GPUでテストされました。下のグラフに示されているように、1つのH100で12.41 FPS、2つのH100で19.63 FPS、4つのH100で22.13 FPSが達成されました。2つのH100が最適な構成であることがわかりました。
1、2、4つのH100 GPUでのスケーリング効率。480×480解像度での待ち時間、フレームレート、スピードアップ、効率が表示されています。2つのGPUでは19.63 FPSが達成され、さらに4つのGPUにスケールアップすると、22.13 FPSの僅かな増加に留まりました。
19.63 FPSで、各12フレームブロックは0.611秒で生成されました。比較として、競合システムでは、同じ3分間のシーケンスを生成するのに約2〜5時間かかりました。
定性的テストも、同様の違いを示しました。全身テストでは、One-to-Allで重大な劣化が観察され、UniAnimate-DiTとSCAILでフリッカーが生成され、Wan-AnimateとEverAnimateでは、後で色や背景のドリフトが明らかになりました。

3分間の連続生成中の全身アニメーションのテスト結果。20秒ごとにフレームがサンプリングされ、競合方法の長期的な劣化を強調する赤い注釈が付いています。ベースラインでは、シーケンスを生成するのに約2〜5時間かかりましたが、LiveAnimateでは約4分でした。より高解像度の場合は、ソースペーパーを参照してください。
LiveAnimateは、3分間のシーケンス全体で、サブジェクトの外観と周囲のシーンを維持しました。上半身のテストでは、EverAnimateとLiveAnimateの両方が同等の長期的な安定性を達成しました(ただし、リアルタイム生成はLiveAnimateのみでした)。
3分間の連続生成中の上半身アニメーションのテスト結果。20秒ごとにサンプリングされたフレームは、LiveAnimateがアイデンティティ、服、暗い背景を競合方法よりも一貫性のあるままに維持していることを示しています。
著者は結論として次のように述べています。
‘3分間のベンチマークでは、LiveAnimateは2つのH100 GPUで19.63 FPSで、ほぼ一定の認知質とアイデンティティを維持しています。メモリと待ち時間はストリームの長さに依存しません。一方、オフラインのベースラインは、視覚的に劣化したり、数時間の計算を必要とします。 ‘
‘これらの結果は、億スケールのビデオ拡散モデルを、ライブストリーミング、テレプレゼンス、バーチャルアバターなどのインタラクティブアプリケーションの範囲内に持ってきます。 ‘
結論
生成されたメモリとアイデンティティの問題に取り組む新しい生成フレームワークが登場したことは、励ましいことです。多くの生成フレームワークは、ユーザーが提供する固定画像を参照できますが、画像を「貼り付け」する必要はありません。
ただし、これは、単一のビデオクリップを生成する問題の一部のみを解決します。たとえば、人物が再びフレームに入ったときに、人物のアイデンティティ(服装や髪型を含む)を保持すること、または一時的に遮られ、そして再び見えるようになったときに、同じように見えることを保証することです。
これまでのところ、LoRAアプローチのみが、これらの問題に対して限られた進展を遂げてきましたが、限界があり、暫定的なものです。
ビデオ、そして実際には現在のAI革命全体のために、効果的な永続的なメモリの開発は、批判的な存在的な問題です。これは、AGIの出現または3回目のAIの冬の違いを定義することになるでしょう。
* 現在の考え方は、小規模な特化モデルは最終的にローカルで無料で実行される可能性がある一方で、高度なニーズは競合するGPUレンタル市場によってサポートされるというものです。これは、先駆的な企業が競争をEEEすることに失敗し、GPUコンピューティングが競争の激化に関係なく利用可能なままであると仮定しています。したがって、私は現在、過度なGPU要件を短所とは見なしておらず、代わりにアクセスがより民主化され、後の最適化によって初期のリソース要件が削減されることを希望しています。
† AIによって生成およびチェックされました。
†† 長時間のテストのために、SCAILとUniAnimate-DiTは、どちらも長時間の生成をネイティブにサポートしていないため、同じトレーニング不要のスライディングウィンドウ手順で拡張されました。EverAnimateとOne-to-Allは、独自の長時間ビデオ生成方法を使用して評価されました。
2026年8月13日木曜日に初めて公開されました












