AIモデルとプラットフォーム
マジックダンス:リアルな人間のダンス動画生成
コンピュータビジョンは、幅広いリアルタイムタスクにわたる潜在的な応用があるため、AI業界で最も話題の多い分野の1つです。近年、コンピュータビジョンフレームワークは急速に進化しており、最新のモデルはリアルタイムシナリオで顔の特徴、オブジェクトなどを分析できるようになりました。にもかかわらず、人間のモーション転送はコンピュータビジョンモデルにとって大きな課題です。このタスクには、ソース画像または動画からの顔や体のモーションをターゲット画像または動画に転送することが含まれます。人間のモーション転送は、画像や動画のスタイリング、メディアコンテンツの編集、デジタルヒューマンシンセシス、さらには感覚ベースのフレームワークのためのデータ生成に広く使用されています。
この記事では、マジックダンスについて焦点を当てます。マジックダンスは、人間のモーション転送を革命させることを目的とした拡散ベースのモデルです。マジックダンスフレームワークは、特に挑戦的な人間のダンス動画に2Dの人間の顔の表情とモーションを転送することを目的としています。その目的は、オリジナルのアイデンティティを維持しながら、特定のターゲットアイデンティティのための新しいポーズシーケンス駆動のダンス動画を生成することです。マジックダンスフレームワークは、人間のモーション分離と外見の要因を重点とする2段階のトレーニング戦略を採用しています。皮膚の色、顔の表情、服などです。マジックダンスフレームワークのアーキテクチャ、機能、他の最先端の人間のモーション転送フレームワークとの比較を探ってみましょう。
マジックダンス:リアルな人間のモーション転送
先ほど述べたように、人間のモーション転送は、ソース画像または動画からの人間のモーションと表情をターゲット画像または動画に転送する複雑さのため、最も複雑なコンピュータビジョンタスクの1つです。従来、コンピュータビジョンフレームワークは、GAN(Generative Adversarial Networks)を含むタスク固有の生成モデルを、顔の表情と体のポーズのターゲットデータセットでトレーニングすることで、人間のモーション転送を達成しました。生成モデルをトレーニングして使用することは、一部の場合では満足のいく結果をもたらしますが、通常、2つの大きな制限があります。
- 画像の歪みコンポーネントに大きく依存しているため、ソース画像で不可視な体の部位を補間するのに苦労することがあります。視点の変更や自己遮蔽のためです。
- 外部から提供された他の画像に一般化できないため、特に野外のリアルタイムシナリオでの応用が制限されます。

最新の拡散モデルは、さまざまな条件下での画像生成能力を実証しており、拡散モデルは現在、ビデオ生成や画像補間などの下流タスクで強力な視覚を提供することができます。Webスケールの画像データセットから学習することでです。能力のため、拡散モデルは人間のモーション転送タスクに最適な選択肢である可能性があります。拡散モデルは人間のモーション転送に実装できますが、生成されたコンテンツの品質、アイデンティティの保存、またはモデルの設計とトレーニング戦略の制限のための一時的な不一致の点で制限があります。また、拡散ベースのモデルは、GANフレームワークと比較して、汎化性の点で大きな利点を示しません。
拡散モデルとGANベースのフレームワークが人間のモーション転送タスクで直面する課題を克服するために、開発者はマジックダンスという新しいフレームワークを導入しました。マジックダンスフレームワークは、人間のモーション転送タスクで拡散フレームワークの潜在能力を利用することを目的としています。マジックダンスフレームワークは、前代未聞のアイデンティティ保存、優れた視覚品質、ドメインの汎化可能性を実現することを目指しています。マジックダンスフレームワークの核心的な概念は、問題を2つの段階に分割することです。外見制御とモーション制御です。画像拡散フレームワークが正確なモーション転送出力を提供するために必要な2つの機能です。

上記の図は、マジックダンスフレームワークの概要を示しています。マジックダンスフレームワークは、Stable Diffusionモデルを採用し、さらに2つのコンポーネント、外見制御モデルとポーズ制御ネットを導入しています。外見制御モデルは、参照画像からSDモデルに注意を通じて外見のガイダンスを提供します。ポーズ制御ネットは、条件付き画像または動画から拡散モデルに表情/ポーズのガイダンスを提供します。フレームワークはまた、サブモジュールを効果的に学習するために、マルチステージトレーニング戦略を採用しています。ポーズ制御と外見を分離するためにです。
要約すると、マジックダンスフレームワークは、
- 外見分離ポーズ制御と外見制御事前トレーニングを備えた新しい有効なフレームワークです。
- マジックダンスフレームワークは、ポーズ条件入力と参照画像または動画の制御下で、リアルな人間の顔の表情とモーションを生成することができます。
- マジックダンスフレームワークは、多源注意モジュールを導入することで、外見一貫性のある人間のコンテンツを生成します。Stable Diffusion UNetフレームワークに正確なガイダンスを提供します。
- マジックダンスフレームワークは、Stable Diffusionフレームワークの便利な拡張またはプラグインとしても使用できます。既存のモデル重みとの互換性を保つため、パラメーターの追加的なファインチューニングは不要です。
さらに、マジックダンスフレームワークは、外見とモーションの両方で優れた汎化能力を示しています。
- 外見の汎化:マジックダンスフレームワークは、多様な外見を生成する能力が優れています。
- モーションの汎化:マジックダンスフレームワークは、幅広いモーションを生成する能力もあります。
マジックダンス:目的とアーキテクチャ
与えられた参照画像(実際の人間またはスタイライズされた画像)に対して、マジックダンスフレームワークの主な目的は、入力とポーズ入力{P、F}に条件付けた出力画像または動画を生成することです。ここで、Pは人間のポーズスケルトンを表し、Fは顔のランドマークを表します。生成された出力画像または動画は、参照画像の外見とアイデンティティを保存しながら、背景コンテンツとポーズ入力で定義されたポーズと表情を保持する必要があります。
アーキテクチャ
トレーニング中に、マジックダンスフレームワークは、同じ参照ビデオからの参照画像とポーズ入力で、フレームの再構築タスクとしてトレーニングされます。テスト中にモーション転送を達成するために、ポーズ入力と参照画像は異なるソースから提供されます。
マジックダンスフレームワークの全体的なアーキテクチャは、4つのカテゴリに分けることができます。準備段階、外見制御事前トレーニング、外見分離ポーズ制御、モーションモジュールです。
準備段階
潜在的拡散モデル(Latent Diffusion Models、LDM)は、オートエンコーダーの使用により潜在空間内で動作するように特別に設計された拡散モデルの一種です。Stable Diffusionフレームワークは、ベクトル量子化変分オートエンコーダーと時間U-Netアーキテクチャーを使用するLDMの著名な例です。Stable Diffusionモデルは、テキスト入力を処理するためにCLIPベースのトランスフォーマーをテキストエンコーダーとして使用します。トレーニング段階では、モデルはテキスト条件と入力画像に露出され、画像を潜在的表現にエンコードし、ガウシアンメソッドによって導かれる事前定義された拡散ステップのシーケンスにそれを適用します。結果として得られるシーケンスは、ノイズのある潜在的表現を提供し、標準正規分布を提供します。Stable Diffusionフレームワークの主な学習目標は、ノイズのある潜在的表現を反復的に潜在的表現にデノイズすることです。
外見制御事前トレーニング
元のControlNetフレームワークの問題点の1つは、空間的に変化するモーションの中で一貫した外見を制御できないことです。入力画像のポーズに似た画像を生成しますが、全体的な外見は主にテキスト入力によって影響を受けます。この方法は機能しますが、外見情報の主なソースがテキスト入力ではなく参照画像である、モーション転送を伴うタスクには適していません。
マジックダンスフレームワークの外見制御事前トレーニングモジュールは、レイヤーごとに外見制御のガイダンスを提供するための補助ブランチとして設計されています。テキスト入力に頼るのではなく、参照画像からの外見属性を活用して、特に複雑なモーションダイナミクスを伴うシナリオで外見特性を正確に生成するフレームワークの能力を向上させることを目的としています。また、外見制御事前トレーニング中は、外見制御モデルのみがトレーニング可能です。
外見分離ポーズ制御
出力画像のポーズを制御するためのナイーブな解決策は、事前トレーニングされたControlNetモデルを事前トレーニングされた外見制御モデルと直接統合することです。ただし、統合により、フレームワークが外見独立のポーズ制御に苦労し、入力ポーズと生成されたポーズの不一致につながる可能性があります。この不一致を解決するために、マジックダンスフレームワークは、事前トレーニングされた外見制御モデルとともにポーズ制御ネットモデルをファインチューニングします。
モーションモジュール
外見分離ポーズ制御ネットと外見制御モデルが協力して、画像からモーションへの正確で効果的な転送を実現できますが、一時的な不一致につながる可能性があります。一時的な一貫性を確保するために、フレームワークは、主なStable Diffusion UNetアーキテクチャーに追加のモーションモジュールを統合します。
マジックダンス:事前トレーニングとデータセット
事前トレーニングのために、マジックダンスフレームワークは、10〜15秒の長さのさまざまなダンス動画を含むTikTokデータセットを使用します。このデータセットの多くのビデオには顔と上半身が含まれています。マジックダンスフレームワークは、各ビデオを30 FPSで抽出して個々のフレームにOpenPoseを適用し、ポーズスケルトン、手のポーズ、顔のランドマークを推定します。
事前トレーニングのために、外見制御モデルはバッチサイズ64で8つのNVIDIA A100 GPUで10,000ステップ、画像サイズ512×512で事前トレーニングされ、次にポーズ制御モデルと外見制御モデルがバッチサイズ16で20,000ステップで共同でファインチューニングされます。トレーニング中に、マジックダンスフレームワークは、同じ高さで同じ位置に画像をランダムにサンプリングして、それらをターゲットと参照として使用します。評価中に、モデルは画像を中央に切り抜きます。
マジックダンス:結果
マジックダンスフレームワークの実験結果は、次の画像に示されています。マジックダンスフレームワークは、人間のモーション転送のすべてのメトリックで、DiscoやDreamPoseなどの既存のフレームワークを上回っています。「*」が名前の前に付いているフレームワークは、ターゲット画像を直接入力として使用し、他のフレームワークよりも多くの情報を含みます。

マジックダンスフレームワークは、Face-Cosスコア0.426を達成し、Discoフレームワークよりも156.62%、DreamPoseフレームワークよりも約400%改善しています。結果は、マジックダンスフレームワークがアイデンティティ情報を保存する能力が強力であること、および既存の最先端方法を上回るパフォーマンスの向上を示しています。
次の図は、マジックダンス、Disco、TPSフレームワーク間の人間のビデオ生成の品質を比較しています。結果は、GT、Disco、TPSフレームワークが一貫性のない人間のポーズアイデンティティと顔の表情を示していることがわかります。

さらに、次の画像は、TikTokデータセットでの顔の表情と人間のポーズの転送の視覚化を示しています。マジックダンスフレームワークは、さまざまな顔のランドマークとポーズスケルトン入力で、リアルな表情とモーションを生成し、参照入力画像からのアイデンティティ情報を正確に保存しています。

注目すべきは、マジックダンスフレームワークが、外見の制御可能性が優れており、ターゲットドメインでの追加のファインチューニングなしに、見られないポーズやスタイルの外部参照画像に優れた汎化能力を示していることです。結果は次の画像に示されています。

次の画像は、マジックダンスフレームワークの顔の表情転送とゼロショット人間のモーションの視覚化能力を示しています。マジックダンスフレームワークは、野外の人間のモーションに完全に汎化することがわかります。

マジックダンス:制限
OpenPoseは、マジックダンスフレームワークの重要なコンポーネントです。ポーズ制御に影響を与え、生成された画像の品質と一時的な一貫性に大きな影響を与えるからです。ただし、マジックダンスフレームワークは、特に画像内のオブジェクトが部分的に可視であるか、または急速に動いている場合、顔のランドマークとポーズスケルトンを正確に検出するのにまだ多少の課題があります。これらの問題は、生成された画像にアーティファクトをもたらす可能性があります。
結論
この記事では、マジックダンスについて説明しました。マジックダンスは、人間のモーション転送を革命させることを目的とした拡散ベースのモデルです。マジックダンスフレームワークは、特に挑戦的な人間のダンス動画に2Dの人間の顔の表情とモーションを転送することを目的としています。その目的は、オリジナルのアイデンティティを維持しながら、特定のターゲットアイデンティティのための新しいポーズシーケンス駆動のダンス動画を生成することです。マジックダンスフレームワークは、人間のモーション分離と外見の要因を重点とする2段階のトレーニング戦略を採用しています。皮膚の色、顔の表情、服などです。
マジックダンスは、リアルな人間のビデオ生成を促進するための新しいアプローチであり、顔とモーションの表情転送を組み込み、さらにファインチューニングを必要とせずに野外での一貫したアニメーション生成を可能にします。既存の方法を大幅に上回るものです。さらに、マジックダンスフレームワークは、複雑なモーションシーケンスと多様な人間のアイデンティティに対して優れた汎化能力を示し、AI支援のモーション転送とビデオ生成の分野でトップランナーとしての地位を確立しています。












