Andersonの視点

人間駆動AIビデオの著しい進歩

mm
Unite.AI を Google の優先ソースに追加
Examples from the DreamActor project page.

注: この研究のプロジェクトページには、33のオートプレイするハイレゾビデオが含まれており、合計で半ギガバイトの容量があります。これにより、私のシステムが不安定になったため、直接リンクすることはできません。読者は、論文の要約またはPDFでURLを見つけることができます。

現在のビデオ合成研究の主な目的の1つは、単一の画像から完全なAI駆動のビデオパフォーマンスを生成することです。この週、Bytedance Intelligent Creationからの新しい論文は、表現豊かな顔の詳細と大規模なモーションを組み合わせたフルボディとセミボディのアニメーションを生成できる、現時点で最も包括的なシステムの1つを発表しました。また、アイデンティティの一貫性も向上しました。これは、先行する商用システムでもしばしば問題となる領域です。

以下の例では、俳優(上左)によって駆動されるパフォーマンスと、単一の画像(上右)から派生したパフォーマンスが見られます。これは、通常、大きな動きの作成や「隠された」領域(たとえば、衣類や顔の角度など、ソース写真に表示されていない部分)について「推測」することに関する問題がない、驚くほど柔軟で器用なレンダリングを提供します。

オーディオコンテンツ。再生するにはクリックしてください。パフォーマンスは2つのソースから生まれ、通常は専用の付随システムの保留であるリップシンクも含まれています。これは、ソースサイト(本記事の冒頭の注釈を参照)の縮小版です。

各クリップが進行するにつれてアイデンティティの永続性に関するある程度の残りの課題が見られるものの、これは、LoRAを使用せずに(ほぼ)アイデンティティを維持することができる最初のシステムです。

オーディオコンテンツ。再生するにはクリックしてください。DreamActorプロジェクトからのさらに例です。

新しいシステム、DreamActorは、3つのパートからなるハイブリッドコントロールシステムを使用し、顔の表情、頭の回転、コアスケルトンデザインに専用の注意を払います。したがって、AI駆動のパフォーマンスで、顔の表情やボディの動きのいずれかが犠牲になることはありません。これは、同様のシステムの中では稀な、あるいは未知の機能です。

以下に、これらの側面の1つ、頭の回転を実行中のものを示します。各サムネイルの右下にあるカラーボールは、頭の向きを顔の動きや表情とは独立して定義する仮想ジンバルを示しています。これは、俳優(下左)によって駆動されます。

クリックして再生する。このマルチカラーボールは、アバターの頭の回転軸を視覚化し、表情は別のモジュールによって駆動され、俳優のパフォーマンス(ここでは下左に表示)によって情報が提供されます。

プロジェクトの最も興味深い機能の1つは、オーディオから直接リップシンク動きを導出する能力です。これは、通常、専用の付随システムの保留です。これは、ドライビングアクタービデオなしで驚くほどうまく機能します。

研究者は、この分野のトップレベルの既存のシステム、Runway Act-OneLivePortraitと比較し、DreamActorがより優れた量的結果を達成したと報告しています。

研究者は、既存の最良のシステムと比較して、DreamActorが優れていると主張しています。

残念ながら、このシステムは公開される予定はなく、コミュニティがこの研究から得ることができる唯一の価値は、論文に概説されている方法論を再現することです(これは、同様にクローズドソースのGoogle Dreamboothの場合と同様です)。

論文には以下のように記載されています:

‘人間の画像アニメーションには、偽のビデオを作成するなどの社会的リスクがあります。提案されたテクノロジーは、人の偽のビデオを作成するために使用できますが、既存の検出ツール[DemambaDormant]はこれらの偽物を検出できます。

‘これらのリスクを軽減するために、明確な倫理規則と責任ある使用ガイドラインが必要です。私たちは、コアモデルのアクセスを厳密に制限して、悪用を防ぐために、コードへのアクセスを厳密に制限します。 ‘

当然ながら、倫理的な考慮は商業的な観点から見ると都合が良く、モデルへのアクセスをAPIのみに制限するための理由となり、モデルは収益化される可能性があります。ByteDanceは、2025年にOmniHumanをDreaminaのWebサイトで有料クレジットで提供することで、これをすでに実行しています。したがって、DreamActorは、もしかしたら、より優れた製品である可能性があるため、この結果が起こる可能性が高いです。残っているのは、論文で説明されている限り、この原則がオープンソースコミュニティにどれだけ役立つかを見守ることです。

新しい論文は、DreamActor-M1: Holistic、Expressive、Robust Human Image Animation with Hybrid Guidanceと題され、Bytedanceの6人の研究者によって書かれています。

方法

論文で提案されたDreamActorシステムは、参照画像とドライビングビデオから人間のアニメーションを生成することを目的としています。Diffusion Transformer(DiT)フレームワークを使用し、Diffusion Transformer(DiT)を潜在空間に適応させます(これは、2022年のランドマークリリースで言及されているStable Diffusionのいくつかのバージョンのようです)。

外部モジュールに依存せずに、参照条件付けを処理するのではなく、外観と動きの特徴をDiTのバックボーン内に直接統合し、空間と時間を横断して注意を通じて相互作用を可能にします。

新しいシステムのスキーマ:DreamActorは、姿勢、顔の動き、外観を個別の潜在変数にエンコードし、3D VAEによって生成されたノイズ化されたビデオ潜在変数と組み合わせます。これらのシグナルは、共有された重みを持つ分岐間で自己注意とクロス注意を使用するDiffusion Transformer内で結合されます。モデルは、デノイズされた出力とクリーンなビデオ潜在変数の比較によって監視されます。ソース:https://arxiv.org/pdf/2504.01724

新しいシステムのスキーマ:DreamActorは、姿勢、顔の動き、外観を個別の潜在変数にエンコードし、3D VAEによって生成されたノイズ化されたビデオ潜在変数と組み合わせます。これらのシグナルは、共有された重みを持つ分岐間で自己注意とクロス注意を使用するDiffusion Transformer内で結合されます。モデルは、デノイズされた出力とクリーンなビデオ潜在変数の比較によって監視されます。ソース:https://arxiv.org/pdf/2504.01724

これを行うには、モデルは、入力ビデオと参照画像の両方をエンコードするために、事前に学習された3D変分オートエンコーダーを使用します。これらの潜在変数は、パッチ化され、結合され、DiTにフィードされ、そこでそれらは共同で処理されます。

このアーキテクチャは、参照注入のために二次ネットワークを接続するという一般的な慣行から逸脱しています。これは、Animate AnyoneおよびAnimate Anyone 2プロジェクトのアプローチでした。

代わりに、DreamActorは、融合をメインモデル自体に構築し、設計を簡素化しながら、外観と動きのヒント間の情報の流れを強化します。モデルは、フローマッチングを使用して、標準の拡散オブジェクト(フローマッチングは、データとノイズの間の速度フィールドを直接予測することによって拡散モデルを訓練し、スコア推定をスキップします)ではなく訓練されます。

ハイブリッドモーションガイダンス

DreamActorの神経レンダリングを導くハイブリッドモーションガイダンス方法は、3Dボディスケルトンから導かれたポーズトークン、事前トレーニングされた顔エンコーダーによって抽出された暗黙的な顔の表現、およびソース画像からサンプリングされた参照外観トークンを組み合わせます。

これらの要素は、Diffusion Transformer内で異なる注意メカニズムを使用して統合され、システムが生成プロセス全体を通じて大域的なモーション、顔の表情、視覚的なアイデンティティを調整できるようにします。

最初のものについては、顔のランドマークに依存するのではなく、DreamActorは、表情の生成を導くために暗黙的な顔の表現を使用します。これにより、顔のダイナミクスに対する制御がより細かく、頭のポーズとアイデンティティが表情から切り離され、表現力が向上します。

これらの表現を生成するために、パイプラインは、ドライビングビデオの各フレームで顔領域を検出して切り出し、224×224にリサイズします。切り取られた顔は、PD-FGCデータセットで事前トレーニングされた顔の動きエンコーダーによって処理され、MLPレイヤーによって条件付けられます。

PD-FGC、DreamActorで使用されている、参照画像から話し手の頭を生成し、オーディオ(オーディオから)、頭のポーズ、目の動き、表情(別々のビデオから)を切り離してそれぞれ独立して操作できるようにします。ソース:https://arxiv.org/pdf/2211.14506

PD-FGC、DreamActorで使用されている、参照画像から話し手の頭を生成し、オーディオ(オーディオから)、頭のポーズ、目の動き、表情(別々のビデオから)を切り離してそれぞれ独立して操作できるようにします。ソース:https://arxiv.org/pdf/2211.14506

結果は、クロス注意レイヤーを介してDiffusion Transformerに注入される、顔の動きトークンのシーケンスです。

同じフレームワークは、オーディオ入力から直接顔の動きトークンをマッピングするためにトレーニングされた別のエンコーダーをサポートする、オーディオ駆動バリアントもサポートします。これにより、ドライビングビデオなしで同期された顔のアニメーション、包括してリップ動きを生成することができます。

オーディオコンテンツ。再生するにはクリックしてください。オーディオのみから導かれたリップシンク。静的な写真(右上)のみが入力キャラクターです。

2番目に、顔の表情とは独立して頭のポーズを制御するために、システムは3D頭部スフィア表現を導入します。これにより、顔のダイナミクスが頭の動きから切り離され、精度と柔軟性が向上し、アニメーション中にスタイライズされた頭の形状が保存されます。

頭部スフィアは、FaceVerseトラッキング方法を使用して、ドライビングビデオから3D顔のパラメータ(回転、カメラのポーズなど)を抽出することによって生成されます。

FaceVerseプロジェクトのスキーマ。ソース:https://www.liuyebin.com/faceverse/faceverse.html

FaceVerseプロジェクトのスキーマ。 ソース:https://www.liuyebin.com/faceverse/faceverse.html

これらのパラメータは、ドライビング頭と空間的に揃えられた2D画像平面に投影されたカラースフィアをレンダリングするために使用されます。スフィアのサイズは参照頭と一致し、その色は頭の向きを反映します。この抽象化により、3D頭の動きを学習する複雑さが軽減され、特にアニメーションで描かれたキャラクターのスタイライズされた頭の形状が保存されます。

頭の向きに影響を与えるコントロールスフィアの視覚化

頭の向きに影響を与えるコントロールスフィアの視覚化

最後に、フルボディの動きを導くために、システムは、適応的な骨の長さの正規化を使用する3Dボディスケルトンを使用します。ボディと手のパラメータは、4DHumansと手の動きに焦点を当てたHaMeRを使用して、SMPL-Xボディモデルで推定されます。

SMPL-Xは、画像の全身にパラメトリックメッシュを適用し、推定されたポーズと表情に合わせて、メッシュを体積ガイドとして使用したポーズ認識操作を可能にします。ソース:https://arxiv.org/pdf/1904.05866

SMPL-Xは、画像の全身にパラメトリックメッシュを適用し、推定されたポーズと表情に合わせて、メッシュを体積ガイドとして使用したポーズ認識操作を可能にします。ソース:https://arxiv.org/pdf/1904.05866

これらの出力から、重要な関節が選択され、2Dに投影され、線ベースのスケルトンマップに接続されます。Champなどの方法とは異なり、フルボディメッシュをレンダリングするのではなく、このアプローチでは、事前に定義された形状の先入観を課すのを避け、スケルトン構造のみに頼ることで、モデルはボディの形状と外観を参照画像から直接推論することを促します。これにより、さまざまなポーズや体型に対する汎用性が向上し、固定された体型への偏見が軽減されます。

トレーニング中、3Dボディスケルトンは頭部スフィアとともに結合され、ポーズエンコーダーを介して処理され、特徴が出力され、ノイズ化されたビデオ潜在変数と組み合わせて、Diffusion Transformerに使用されるノイズトークンが生成されます。

推論時、システムは、骨の長さの正規化によってスケルトンの違いを考慮します。事前トレーニングされた画像編集モデルSeedEditは、参照画像とドライビング画像の両方を標準的な正準形状に変換します。RTMPoseは、骨の比例を抽出し、それらを参照サブジェクトの解剖学に合わせてドライビングスケルトンを調整するために使用されます。

推論パイプラインの概要。疑似参照は、外観のヒントを豊富化するために生成できますが、ハイブリッドコントロールシグナル - 暗黙的な顔の動きと、頭のスフィアとボディスケルトンからの明示的なポーズ - は、ドライビングビデオから抽出され、DiTモデルにフィードされて、アニメーション出力が生成され、顔の動きがボディのポーズから切り離され、オーディオをドライバーとして使用できるようになります。

推論パイプラインの概要。疑似参照は、外観のヒントを豊富化するために生成できますが、ハイブリッドコントロールシグナル – 暗黙的な顔の動きと、頭のスフィアとボディスケルトンからの明示的なポーズ – は、ドライビングビデオから抽出され、DiTモデルにフィードされて、アニメーション出力が生成され、顔の動きがボディのポーズから切り離され、オーディオをドライバーとして使用できるようになります。

外観ガイダンス

外観の忠実性を高めるために、特に隠されたまたはまれに表示される領域では、システムは主な参照画像を、入力ビデオからサンプリングされた疑似参照画像で補足します。

クリックして再生する。システムは、隠された領域を正確に、かつ一貫してレンダリングする必要性を予測します。これは、CGIスタイルのビットマップテクスチャアプローチに近いものです。

これらの追加フレームは、RTMPoseを使用してポーズの多様性に基づいて選択され、CLIPベースの類似性を使用して、主題のアイデンティティと一致していることを確認します。

すべての参照フレーム(主なものと疑似参照の両方)は、同じ視覚エンコーダーによってエンコードされ、自己注意メカニズムを介して結合され、モデルは補足的な外観のヒントにアクセスできるようになります。このセットアップにより、プロファイルビューまたは肢のテクスチャなどの詳細のカバレッジが向上します。疑似参照は、トレーニング中は常に、推論中はオプションで使用されます。

トレーニング

DreamActorは、複雑さを段階的に導入し、安定性を向上させるために、3段階でトレーニングされました。

最初の段階では、顔の表現を除いて、3Dボディスケルトンと3D頭スフィアのみがコントロールシグナルとして使用されました。これにより、MMDiTから初期化された基本的なビデオ生成モデルが、人間のアニメーションに適応することができ、細かい制御に圧倒されることはありませんでした。

2番目の段階では、暗黙的な顔の表現が追加されましたが、他のすべてのパラメータは固定されました。この時点では、顔の動きエンコーダーと顔の注意レイヤーのみがトレーニングされ、モデルは表情の詳細を分離して学習することができました。

最終段階では、すべてのパラメータが解凍され、外観、ポーズ、顔のダイナミクス全体で共同最適化が行われました。

データとテスト

テスト段階では、モデルは事前にトレーニングされた画像からビデオのDiTチェックポイントから初期化され、3段階でトレーニングされます。最初の2段階はそれぞれ20,000ステップ、3段階目は30,000ステップです。

さまざまな長さや解像度での汎用性を高めるために、ビデオクリップは25〜121フレームの長さでランダムにサンプリングされ、960x640pxにリサイズされ、画面のアスペクト比が維持されました。

トレーニングは、8つの(中国向け)NVIDIA H20 GPUで実行されました。各GPUには96GBのVRAMがあり、AdamWオプティマイザを使用し、(許容可能なほど高い) 学習率5e−6で実行されました。

推論時、各ビデオセグメントには73フレームが含まれていました。セグメント間の一貫性を維持するために、前のセグメントの最終的な潜在変数は、次のセグメントの初期潜在変数として再利用され、タスクはシーケンシャル画像からビデオの生成として文脈化されました。

クラスフリーのガイダンスは、参照画像とモーションコントロールシグナルに対して2.5の重みで適用されました。

著者は、さまざまなドメイン(ダンス、スポーツ、映画、パブリックスピーキングなど)から500時間のビデオで構成されるトレーニングデータセットを構築しました。データセットは、人間のモーションと表情の広いスペクトルを捉えるように設計され、フルボディショットとハーフボディショットが均等に分布していました。

顔の合成の品質を向上させるために、Nersembleがデータ準備プロセスに組み込まれました。

DreamActor用にデータを増強するために使用されるNersembleの例。ソース:https://www.youtube.com/watch?v=a-OAWqBzldU

DreamActor用にデータを増強するために使用されるNersembleの例。ソース:https://www.youtube.com/watch?v=a-OAWqBzldU

評価のために、研究者は、さまざまなシナリオでの汎用性を評価するためのベンチマークとして、データセットを使用しました。

モデルのパフォーマンスは、従来の作業からの標準メトリクスを使用して評価されました。フレームレベルの品質のためのFréchet Inception Distance(FID)、Structural Similarity Index(SSIM)、Learned Perceptual Image Patch Similarity(LPIPS)、Peak Signal-to-Noise Ratio(PSNR)。また、Fréchet Video Distance(FVD)を使用して、時間的な一貫性と全体的なビデオの忠実度を評価しました。

著者は、ボディアニメーションとポートレイトアニメーションの両方のタスクで実験を実施しました。すべてのタスクで、単一の参照画像(ターゲット)が使用されました。

ボディアニメーションの場合、DreamActor-M1は、Animate AnyoneChampMimicMotionDisPoseと比較されました。

ライバルフレームワークとの量的比較。

ライバルフレームワークとの量的比較。

PDFには静的な画像による視覚的な比較が含まれていますが、プロジェクトサイトのビデオの1つは、違いをより明確に示している可能性があります。

オーディオコンテンツ。 クリックして再生する。ライバルフレームワーク間の視覚的な比較。ドライビングビデオは左上に表示されており、著者の結論であるDreamActorが最良の結果を生み出すことは妥当であると考えられます。

ポートレイトアニメーションテストの場合、モデルは、LivePortraitX-PortraitSkyReels-A1、およびAct-Oneと比較されました。

ポートレイトアニメーションの量的比較。

ポートレイトアニメーションの量的比較。

著者は、方法が量的に勝つと主張し、また質的にも優れていると主張しています。

オーディオコンテンツ。クリックして再生する。ポートレイトアニメーションの比較例。

上記のビデオで示されている3番目(そして最後)のクリップは、ライバルフレームワークのいくつかと比較して、リップシンクがあまりにも信憑性がなく、全体的な品質は非常に高いものの、ある程度不自然であると言えるかもしれません。

結論

Bytedanceは、人間駆動型AIビデオの重要な課題である、ソース画像に実際に表示されていないテクスチャを予測する必要性を認識しました。次の論理的なステップは、最初に生成されたクリップから参照アトラスを作成し、以降の異なる生成で外観を維持することです。これは、従来のCGI技術におけるテクスチャマッピングと実質的に同等ですが、リアリズムと妥当性の品質は、従来の方法では達成できないものです。

しかし、DreamActorの最も印象的な側面は、従来の顔に焦点を当てた人間の合成とボディに焦点を当てた人間の合成の間の伝統的なギャップを架け橋とする、3つのパートからなるガイダンスシステムです。

これらの原則のいくつかが、よりアクセスしやすいオファリングで活用できるかどうかは、時間が解決してくれるでしょう。DreamActorは、使用の制限や商用アーキテクチャで広範囲に実験することの非実用的性に大きく縛られている、シンセシスとしてのサービスを提供することになるようです。

 

* 著者によるハイパーリンクの代替; インライン引用

前述のように、このプロジェクトで使用されたStable Diffusionのバージョンは不明です。

2025年4月4日(金)に初めて公開されました

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]