Andersonの視点

視界外、心外:解決AIビデオ最大の問題

mm
Unite.AI を Google の優先ソースに追加
Detail from the first page of the 2026年3月 paper 'Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models'. Source - https://arxiv.org/pdf/2603.25716

最も優れたAIビデオ生成システムでも、慢性の記憶喪失という課題があります。中国からの新しい研究がこの問題に取り組んでいます。

 

最も優れたAIビデオ生成システムでも、慢性の記憶喪失という課題があります。カメラが注目しているものから離れてから戻ってくると、元のものは見つけることができません。キャラクターは消え、外見や動きが変わり、背景も変化します。

これは、拡散ベースの生成システムが限られたローリングウィンドウを持っているためです。また、システムは常に現在見えるものに注目しています。真のソリプシズムの実践では、フレーム外のものは存在しません。生成AIにとって、見えていないものはメモリから削除されます。

これは、従来のCGIでは問題ではありません。CGIでは、サブジェクトをいつでも正確に再現できます。しかし、AIアプローチでは、同等の「フラットリファレンス」ファイルや関連ファイルがないため、同じことが難しいです。

従来のCGIメッシュとビットマップテクスチャは、レンダリングに一貫した外見を提供するためにいつでも描くことができます。AIアプローチでは、これは達成するのが難しいです。

従来のCGIメッシュとビットマップテクスチャは、レンダリングに一貫した外見を提供するためにいつでも描くことができます。AIアプローチでは、これは達成するのが難しいです。

CGIのコンポーネント要素、たとえばメッシュとテクスチャ(上の画像参照)や動きファイルなどの動的動作は、ディスク上に個別に存在し、いつでも描くことができます。

AIビデオ生成には、同等の「フラットリポジトリ」がありません。最も近いものはLoRAです。これは、消費者機器でトレーニングできる特別なファイルで、独自のキャラクターや衣装をビデオに「強制」的に挿入できます。

クリックして再生。 AIビデオのソリプシズム問題は、LoRAを使用することである程度軽減できますが、結果は圧倒的な場合があります。

これは理想的な解決策ではありません。LoRAは特定の基礎モデル(Wan2+やHunyuan Videoなど)に結び付けられており、基礎モデルが変更されるたびに再作成する必要があります。また、LoRAは基礎モデルの重みを歪める傾向があり、トレーニングされたLoRAのアイデンティティがシーン内のすべてのキャラクターに課せられることがあります。さらに、このようなファインチューニング方法は、悪いデータセットに非常に敏感です。

正確なアンコール

中国からの新しい学術・産業共同研究が、3年以上にわたるこの問題についての私の注目を集めた最初の重要な解決策を提供しています。この方法は、オフスクリーンのキャラクターとその直接の環境を、モデルの潜在的な空間でアクティブに保ち、カメラが戻ってきたときに一貫した外見を実現するために、ハイブリッドメモリを使用します。

クリックして再生。 プロジェクトサイトからの、AI生成(WAN)キャラクターがフレームから出入りする2つの例。 ソース

これは、異なるショット間でキャラクターの一貫性を実現することとは異なります。RunwayのGen 4リリースでは、1年前にこれが達成されたと主張されていましたが、現在も研究文献で継続的な取り組みです。

ここで解決されたのは、オフスクリーンのキャラクターの以前の外見、動き、環境の視覚的一貫した再出現です。

クリックして再生。 新しいイニシアチブのプロジェクトサイトにある他の2つの主要な例。

この原理は、都市探索、POVドライブ、またはその他の非キャラクターレンダリングのドメインにも同様に適用できます。

また、この新しいアプローチは、Runway Gen4やその他のクローズドソースプラットフォームが解決したと主張している問題、つまり異なるショット間でキャラクターを再作成する問題を解決または対処していません。代わりに、これまでに成功していなかったことを実現します。つまり、キャラクターと環境を、常に視覚的に表示する必要なく、メモリに保持します。

新しい研究には、Unreal Engineを介して生成された専用のデータセットと、ソリプシズム問題用のカスタムメトリクス、およびWAN上に構築されたカスタム生成フレームワークが含まれます。利用可能な数少ない類似システムとのテストでは、著者は最先端の結果を主張しています。

‘メモリメカニズムは、世界モデルを進歩させるための重要なフロンティアとして浮上しています。メモリ容量は、生成されたコンテンツの空間的および時間的一貫性を決定します。

‘特に、視点の変化や長期的な外挿の際に歴史的背景を保持するための認知的アンカーとして機能します。

‘強力なメモリなしでは、シミュレートされた世界はすぐに断片的な、混沌としたフレームに崩壊します。’

論文は、Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Modelsというタイトルで、Huazhong University of Science and TechnologyとKuaishou TechnologyのKling Teamの7人の研究者によって発表されました。

方法

新しい研究の中心は、ハイブリッドメモリです。これにより、「視野外の推論」が可能になり、キャラクターとそのコンテキストを保持しながら、ビューワーが「見ない」(またはキャラクターがフレームから出る)ことができます。このシナリオでは、フレームワークは、空間時間の切り離しを実行する必要があります。ここで、ビューワーが見える生成と、オフスクリーンのキャラクターの存在の両方に同時に焦点を当てます。

カメラの入出力モーションの例。ここでは、カメラの動きがキャラクターをフレームから出しますが、さまざまなサンプルでは、キャラクター自体が一時的にフレームから出ることも観察できます。ソース - https://www.unite.ai/how-to-train-and-use-hunyuan-video-lora-models/

カメラの入出力モーションの例。ここでは、カメラの動きがキャラクターをフレームから出しますが、さまざまなサンプルでは、キャラクター自体が一時的にフレームから出ることも観察できます。ソース – https://www.unite.ai/towards-loras-that-can-survive-model-version-upgrades/

著者は、拡散潜在的な埋め込みでは、必要な特徴を抽出して使用する必要があり、他の特徴やプロパティと深く絡み合っていることを指摘しています。したがって、HM-Worldデータセットを特別に作成し、ハイブリッドメモリのトレーニングに使用しました。

論文からの、HM-Worldデータセットの4つのカテゴリのサンプル。

論文からの、HM-Worldデータセットの4つのカテゴリのサンプル。

コレクションは、サブジェクトの軌跡カメラの軌跡シーンサブジェクトの4つの次元で構成されています。

HM-Worldの合成データには、17のシーンと49のサブジェクト(さまざまな外見の人や複数の種類の動物)が含まれています。Unreal Engineを介して、各シーンにこれらの組み合わせがプロシージャルに配置され、各シーンには独自のモーションアニメーションがあり、ランダムに選択された軌跡に設定されます。

著者は、データセットに28種類のカメラ軌跡が含まれていることを示しています。各軌跡には複数の開始点があります。

最終的なコレクションは、59,225のビデオクリップで構成されており、MiniCPM-Vマルチモーダル大規模言語モデル(MLLM)でアノテーションされています。

研究者は、以前のデータセット、WorldScoreContext-As-MemoryMulti-Cam Video360° Motionと比較して、コレクションの統計的利点を強調しています。

既存のデータセットとHM-Worldデータセットの比較。

既存のデータセットとHM-Worldデータセットの比較。

道の少ない旅

複数の過去のフレームと既知のカメラパスが与えられた場合、ビューワーの視点が変化するにつれて、将来のビューを予測するタスクは、独立して移動するサブジェクトがフレームから出入りすることを考慮しながら、背景を安定させます。これには、移動するサブジェクトの外見と動作を、見えない間でも保持するための内部的な一貫したレコードをモデルが保持する必要があります。

著者のHybrid Dynamic Retrieval Attention(HyDRA)方法は、動的サブジェクトを静的シーン表現から切り離す専用のメモリパスを導入することでこれを解決します。ここで、サブジェクトは時間の経過とともに維持され、再出現時に一貫した外見と動作で再出現します。

HyDRAモデルの概念スキーマ。

HyDRAモデルの概念スキーマ。

HyDRAは、Wan2.1-T2V-1.3B上に構築されており、拡散パイプラインの中心部分はほぼそのままですが、動的リトリーバルアテンションを組み込んだ修正されたトランスフォーマーブロックが導入されています。これにより、モデルは、固定またはローカルコンテキストに依存するのではなく、過去のフレームから動作と外見のヒントを選択的に呼び出すことができます。

このプロセスでは、標準の拡散損失の代わりに、Flow Matchingトレーニングオブジェクトが使用されます。

シーンをカメラモーションと一致させるために、カメラ軌跡は明示的な条件付けシグナルとして注入され、各フレームのポーズは回転と変換で定義され、視点が時間の経過とともにどのように進化するかを捉えるコンパクトな表現に変換されます。

Klingの以前のReCamMasterイニシアチブに従って、結果はカメラエンコーダによって解析され、マルチレイヤーパーセプトロンとして実装され、拡散トランスフォーマーの特徴にブロードキャストおよび追加され、モデルがカメラが移動するときに一貫したオブジェクト配置を維持できるようにします。

トークン化

生の拡散潜在的な埋め込みは、サブジェクトの動き、外見、背景を1つの絡み合った表現にまとめ、ここから直接抽出を試みると、無関係なコンテキストを導入したり、移動するサブジェクトが「背景に凍りつく」ことになります。

HyDRAは、空間と時間を同時に処理する3D畳み込みベースのメモリトークナイザーを使用してこれを解決します。完全な潜在的な履歴を転送するのではなく、それらを、サブジェクトの外見と動きを保存するコンパクトな、動きを認識したメモリトークンに圧縮します。

HyDRAの概要。左側で、メモリトークナイザーは過去のフレームを、動きを認識したメモリトークンに変換します。右側で、動的リトリーバルアテンションは、現在のクエリをこれらのトークンに対して評価し、最も関連するトークンを取得し、それらを使用して生成されたフレームで一貫した外見と動きを回復します。

HyDRAの概要。左側で、メモリトークナイザーは過去のフレームを、動きを認識したメモリトークンに変換します。右側で、動的リトリーバルアテンションは、現在のクエリをこれらのトークンに対して評価し、最も関連するトークンを取得し、それらを使用して生成されたフレームで一貫した外見と動きを回復します。

これらのトークンは、ノイズを除去しながら長距離のダイナミクスを保持する構造化されたハイブリッドメモリを形成します。動的リトリーバルアテンションモジュールに渡されると、これらのトークンは、モデルがオフスクリーンのサブジェクトを選択的に呼び出すことを可能にし、再出現時に一貫した外見、動き、コンテキストで再出現できるようにします。

動的リトリーバルアテンション

HyDRAの二重メモリメカニズムは、フレームワーク内で別個の補足的な役割を果たします。

メモリトークン化により、過去の潜在的な表現を動きを認識したトークンに圧縮し、動的サブジェクトを静的シーンコンテンツから切り離すことができます。これにより、トークンは完全なフレーム履歴ではなく、恒久的なメモリバンクを形成します。

動的リトリーバルアテンションは、生成中にこのバンク上で動作し、現在のクエリを保存されたトークンに対して評価し、進化するフレームに最も関連するトークンを選択的に呼び出します。これにより、オフスクリーンのサブジェクトは潜在的な進化を続け(例:見えないときでも歩き続ける)、見えるようになると一貫した外見と動きで再出現します。

データとテスト

テストでは、WanベースのHyDRAシステムは、77のコンテキストフレームをエンコードおよびダウンサンプリングし、3Dバリアショナルオートエンコーダ(VAE)で解析しました。メモリトークナイザーは、カーネルサイズ2x4x4で3D畳み込みを使用しました。

モデルは、HW-Worldで10,000イテレーション、32(未指定)GPU、バッチサイズ32でトレーニングされました。

テストでは、通常のPSNR、SSIM、LPIPSのほか、VBenchスイートからのサブジェクトの一貫性背景の一貫性も使用され、フレームレベルのコヒーレンスを評価しました。

さらに、著者は、YOLO V11のバウンディングボックスを使用して、動的サブジェクトの一貫性(DSC)というカスタムメトリックを提案しました。ここで、移動するサブジェクトを含むクロップされた領域が抽出され、セマンティック特徴が抽出され、類似性が計算されました。

HyDRAは、Diffusion Forcing Transformer(DFoT)とContext-As-Memoryと比較され、カメラエンコーダが付いたWan2.1-T2V-1.3Bモデルがベースラインとして使用されました。すべてのモデルはHW-Worldでトレーニングされ、WorldPlayも二次的なテストコレクションとして使用されました。

初期の定量的な比較では、HyDRAはすべてのベースラインを上回り、PSNRを18.696から20.357、SSIMを0.517から0.606まで引き上げました。また、最も高いコンテキストとグラウンドトゥルースのDiceスコア、0.827と0.849を達成し、サブジェクトと背景の一貫性はそれぞれ0.926と0.932でした。

以前のアプローチとの初期の定量的な比較結果。

以前のアプローチとの初期の定量的な比較結果。

DFoTは17.693のPSNRを達成し、Context-as-Memoryは18.921を達成しました。メモリトークン化と動的リトリーバルアテンションの組み合わせによる利点が報告されています。

HyDRAと最新の最先端アプローチとの定量的な比較。

HyDRAと最新の最先端アプローチとの定量的な比較。


機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai