Andersonの視点

新しいシステム:Stable Diffusionビデオキャラクターの時間的一貫性

mm
Unite.AI を Google の優先ソースに追加
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

アリババグループからの新しいイニシアチブは、Stable Diffusionベースの基礎モデルからフルボディの人間アバターを生成するための、私が見た中で最も優れた方法の1つを提供しています。

「MIMO」(MIMicking with Object Interactions)と呼ばれるこのシステムは、CGIベースの人間モデルやAnimateDiffなどの人気のあるテクノロジーとモジュールを使用して、ビデオ内の時間的一貫性のあるキャラクターレプレイスメントを可能にします。

ここでは、単一の画像ソースから補間されたキャラクターと、事前に定義されたモーションによって駆動されるキャラクターを示します。

[ビデオをクリックして再生]

単一の画像ソースから、3つの異なるキャラクターが3Dポーズシーケンス(左端)によって駆動されるMIMOシステム。 プロジェクトのウェブサイトと、この記事の末尾に埋め込まれたYouTubeビデオで、さらに多くの例と高解像度の画像を見てください。 ソース:https://menyifang.github.io/projects/MIMO/index.html

生成されたキャラクターは、ビデオのフレームや他の方法からもソース化できるため、実世界の映像に統合できます。

MIMOシステムは、キャラクター、シーン、オクルージョン(マットング)の3つの離散的なエンコーディングを生成する新しいシステムを提供します。これらのエンコーディングは、推論時に統合されます。

[ビデオをクリックして再生]

MIMOは、元のキャラクターを写実的なキャラクターまたはスタイリッシュなキャラクターに置き換えることができます。プロジェクトのウェブサイトと、この記事の末尾に埋め込まれたYouTubeビデオで、さらに多くの例と高解像度の画像を見てください。

このシステムは、Stable Diffusion V1.5モデルを使用して、カスタムデータセットでトレーニングされています。このデータセットは、実世界のビデオとシミュレートされたビデオで構成されています。

拡散ベースのビデオの大きな問題は、時間的一貫性です。ここでは、ビデオのコンテンツがフリッカリングまたは予期せぬ方法で「進化」します。

MIMOシステムは、単一の画像を一貫性のあるガイダンスとして使用し、SMPLモデルのCGIモデルによって調整および制約できます。

ソース参照が一貫性があり、基礎モデルが適切な代表的なモーションの例で強化されているため、このシステムの時間的一貫性のある出力の能力は、一般的な拡散ベースのアバターよりも優れています。

[ビデオをクリックして再生]

MIMOキャラクターのさらに多くの例。プロジェクトのウェブサイトと、この記事の末尾に埋め込まれたYouTubeビデオで、さらに多くの例と高解像度の画像を見てください。

単一の画像を使用して、効果的なニューラル表現を生成することは、単独で、またはテキストプロンプトと組み合わせて、マルチモーダルな方法で行われることが多くなっています。たとえば、LivePortraitの顔転写システムは、単一の顔画像からも、高度に妥当なディープフェイクの顔を生成できます。

研究者は、MIMOシステムで使用される原理を、他の新しいタイプの生成システムやフレームワークに拡張できる可能性があると考えています。

新しい論文は、MIMO:空間分解モデリングを使用した制御可能なキャラクタービデオ合成と呼ばれています。アリババグループのインテリジェントコンピューティング研究所の4人の研究者によって書かれています。この研究には、プロジェクトページYouTubeビデオがあります。これは、この記事の末尾にも埋め込まれています。

方法

MIMOは、上記の3つの空間コンポーネントの自動的で無監視の分離を実現するエンドツーエンドアーキテクチャです。

MIMOの概念スキーマ。ソース:https://arxiv.org/pdf/2409.16160

MIMOの概念スキーマ。 ソース:https://arxiv.org/pdf/2409.16160

ソースビデオのオブジェクトは、Depth Anythingというモノキュラーデプスエスティメーターを使用して、2Dから3Dに変換されます。フレーム内の人間の要素は、Tune-A-Videoプロジェクトから適応された方法で抽出されます。

これらの特徴は、Facebook ResearchのSegment Anything 2アーキテクチャを使用して、ビデオベースの体積要素に変換されます。

シーンレイヤーは、他の2つのレイヤーで検出されたオブジェクトを削除することによって取得され、自動的にロトスコープスタイルのマスクを提供します。

モーションについては、人間の要素の抽出された潜在コードのセットが、デフォルトの人間のCGIベースのSMPLモデルにアンカーされます。SMPLモデルの動きは、レンダリングされる人間のコンテンツのコンテキストを提供します。

人間のコンテンツの2D特徴マップは、可微分ラスタライザーによって取得されます。これは、2020年のイニシアチブから派生しています。SMPLから得られた3DデータとNVIDIAの方法で得られた2Dデータを組み合わせることで、人間の「ニューラルパーソン」を表す潜在コードは、コンテキストに固有の対応関係を持っています。

ここで、SMPLを使用するアーキテクチャで一般的に必要な共通参照を確立する必要があります。つまり、カノニカルポーズです。これは、ダ・ヴィンチの‘ヴィトゥヴィアンミュージアム’と同様で、ゼロポーズテンプレートを表し、コンテンツを受け入れて変形できます。

これらの変形、または「規範からの偏差」は、人間の動きを表し、SMPLモデルは、抽出された人間のアイデンティティを表す潜在コードを保持し、ポーズとテクスチャの点で正確にアバターを表します。

SMPLフィギュアのカノニカルポーズの例。ソース:https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

SMPLフィギュアのカノニカルポーズの例。 ソース:https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

エンタングルメント」(トレーニングデータがトレーニングされた限界や関連性を超えて拡張されたときに、どの程度柔軟性があるか)について、著者は次のように述べています。

‘時間的一貫性のある動画フレームから人間の表現を完全に分離するには、モノキュラービデオから動的人間の表現を学び、ポーズ空間からカノニカル空間に変換することが理想的です。 ‘

‘効率性を考慮して、事前にトレーニングされた人間のリポーズモデルを使用して、ポーズされた人間の画像を標準のAポーズのカノニカル結果に直接変換します。 合成されたカノニカル外観画像は、IDエンコーダーに供給され、IDコードを取得します。 ‘

‘この簡単な設計により、アイデンティティとモーションの属性を完全に分離できます。 Animate Anyoneに従って、IDエンコーダーには、CLIP画像エンコーダーと、グローバルおよびローカル機能のためにリファレンスネットアーキテクチャが含まれます。 ‘

シーンとオクルージョンの側面については、バリアントオートエンコーダー(VAE – この場合は2013年の公開から派生)を共有して固定し、シーンとオクルージョンの要素を潜在的な空間に埋め込みます。矛盾は、インペイント方法で処理されます。2023年のProPainterプロジェクトからです。

これらの分解された属性は、U-Netバックボーンに基づいて、Stable Diffusion V1.5アーキテクチャに供給されます。完全なシーンコードは、ホストシステムのネイティブ潜在的なノイズと連結されます。人間のコンポーネントは、セルフアテンションとクロスアテンションレイヤーを介して統合されます。

次に、ノイズ除去された結果は、VAEデコーダーを介して出力されます。

データとテスト

トレーニングのために、研究者はHUD-7Kという人間のビデオデータセットを作成しました。これには、5,000の実際のキャラクタービデオと、En3Dシステムによって生成された2,000のシミュレートされたアニメーションが含まれていました。実際のビデオには、MIMOのアーキテクチャのフィギュア抽出手順の非セマンティックな性質により、注釈が必要ではありませんでした。シミュレートされたデータは完全に注釈付けされていました。

モデルは、8つのNVIDIA A100 GPU(論文では40GBまたは80GB VRAMモデルであるかどうかは指定されていません)で、50回のイテレーション、24のビデオフレーム、バッチサイズ4でトレーニングされ、収束まで続けられました。

システムのモーションモジュールは、AnimateDiffの重みでトレーニングされました。トレーニングプロセス中、VAEエンコーダ/デコーダとCLIP画像エンコーダの重みは凍結されました(これは、大規模言語モデルの完全なファインチューニングとは対照的です)。これは、基礎モデルに大きな影響を与えることになります。

MIMOは、類似のシステムと比較されていませんが、研究者は、AMASSMixamoから得られた、トレーニングデータセット外の難しいモーションシーケンスでテストしました。これらのモーションには、登攀、遊び、ダンスが含まれていました。

また、システムは、野外の人間のビデオでテストされました。どちらの場合も、論文は「さまざまな視点からの未知の3Dモーションに対する高いロバスト性」を報告しています。

論文には、システムの有効性を示す静的な画像結果が複数ありますが、MIMOの真のパフォーマンスは、プロジェクトページと、この記事の末尾に埋め込まれたYouTubeビデオで提供される広範なビデオ結果で最もよく評価できます。

著者は次のように結論付けています。

‘実験結果は、我々の方法が、キャラクター、モーション、シーンの制御だけでなく、任意のキャラクターへのスケーラビリティ、novel 3Dモーションへの汎用性、インタラクティブシーンへの適用可能性も実現できることを示しています。 ‘

‘我々はまた、我々の解決策が、固有の3D性質と、2Dビデオを階層的な空間コンポーネントに自動的にエンコードすることを考慮することで、将来的に3Dアウェアビデオシンセシスの研究にインスピレーションを与えることができることを信じています。 ‘

‘さらに、我々のフレームワークは、キャラクタービデオを生成するだけでなく、制御可能なビデオシンセシスタスクに潜在的に適応できる可能性があると考えています。 ‘

結論

Stable Diffusionに基づくアバターシステムが、時間的一貫性を示す能力を持っていることを見るのは、嬉しいことです。特に、Gaussian Avatarsが、この研究分野で優位性を獲得しているように見えているからです。

結果として得られたスタイリッシュなアバターは効果的であり、MIMOが生成できる写実的なレベルは、現在、Gaussian Splattingが可能なレベルに達していませんが、時間的一貫性のある人間を、意味ベースの潜在拡散ネットワーク(LDM)で生成することの利点は、相当なものです。

 

* 著者のインライン引用をハイパーリンクに変換し、必要に応じて外部の解説的なハイパーリンクを追加したもの。

初めて公開:2024年9月25日(水曜日)

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]