AIモデルとプラットフォーム
長編ビデオ生成のためのナレーションの一貫性を実現するためのレシピ

最近、Hunyuan Video生成AIモデルの公開により、大規模な多モーダルビジョン言語モデルが将来にわたって完全な映画を作成できる可能性についての議論が激化しています。
しかし、私たちが以前にも指摘したように、これは現在非常に遠い将来の話題です。理由の1つは、ほとんどのAIビデオ生成器の注目期間が非常に短く、短い単一のショットの中でさえも一貫性を維持するのに苦労していることです。
別の理由は、ビデオコンテンツへの一貫した参照(たとえば、探索可能な環境は、ランダムに変更されるべきではありません)が、拡散モデルでは、LoRA(低ランク適応)などのカスタマイズ技術によってのみ実現できることです。これは、基礎モデルのオフザシェルフ機能を制限します。
したがって、長編ビデオ生成の進化は、新しいナレーション的一貫性へのアプローチが開発されるまで停滞することになります。
ナレーション的一貫性のレシピ
この点を考慮して、アメリカと中国の新しい共同研究では、将来のナレーション的一貫性システムの可能なテンプレートとして、料理の指示ビデオの使用を提案しています。
再生するにはクリックしてください。 VideoAuteurプロジェクトは、料理プロセスの部分の分析を体系化して、細かくキャプション付けされた新しいデータセットと、料理ビデオの生成のためのオーケストレーション方法を生成します。より高品質の映像については、ソースサイトを参照してください。 ソース:https://videoauteur.github.io/
VideoAuteurという名前のこの研究では、キーフレームとキャプションを組み合わせた状態を使用して、指示的な料理ビデオを生成するための2段階のパイプラインを提案しています。これにより、実際にはサブスクライブされているスペースで、最先端の成果が達成されています。
VideoAuteurのプロジェクトページには、同じテクニックを使用した、より注目度の高いビデオも含まれています。たとえば、(存在しない)マーベル/DCのクロスオーバー作品の予告編:
再生するにはクリックしてください。
ページには、同様のスタイルのプロモーションビデオもあります。存在しないNetflixの動物シリーズとテスラの車の広告です。
VideoAuteurを開発するために、著者はさまざまな損失関数や新しいアプローチを実験しました。レシピの作成方法を開発するために、また、CookGen、料理ドメインに焦点を当てた最大のデータセットを作成しました。これには、平均9.5秒の長さの200,000本のビデオクリップが含まれています。
(TSLA )平均768.3ワードのビデオあたり、CookGenはその種の最も広く注釈付けされたデータセットです。さまざまなビジョン/言語モデルが使用され、他のアプローチとともに、説明ができるだけ詳細で、関連性があり、正確であることを保証しました。
料理ビデオは、構造化されたナラティブと明確な指示を持っているため、注釈と評価が容易なため、選択されました。ポルノグラフィックビデオ(おそらくこの特定のスペースに近い将来に入ることになる)を除いて、視覚的にもナラティブ的にも「定式化」された他のジャンルは難しいです。
著者は次のように述べています:
‘私たちの提案した2段階の自己回帰パイプラインは、長いナラティブディレクターと視覚的に条件付けられたビデオ生成を含み、生成された長いナラティブビデオの意味的一貫性と視覚的忠実性の向上を示しています。 ‘
‘私たちのデータセットの実験を通じて、ビデオシーケンス全体で空間的および時間的な一貫性の向上を観察しています。 ‘
‘私たちの研究が長いナラティブビデオ生成のさらなる研究を促進することを希望しています。 ‘
新しい研究は、VideoAuteur: 長いナラティブビデオ生成に向けてというタイトルで、Johns Hopkins University、ByteDance、ByteDance Seedの8人の著者から来ています。
データセットのキュレーション
CookGenを開発するために、著者は、YouCookとHowTo100Mコレクションの資料を使用しました。著者は、CookGenの規模を、生成ビデオのナラティブ開発に焦点を当てた以前のデータセットと比較しています。たとえば、Flintstonesデータセット、Pororoカートゥーンデータセット、StoryGen、TencentのStoryStream、およびVISTです。

CookGenは、実世界のナラティブ、特に手順的な活動(料理)に焦点を当てており、他の画像ベースのコミックデータセットよりも明確で簡単に注釈付けできるストーリーを提供しています。最大の既存のデータセットであるStoryStreamを超えて、150倍のフレームと5倍の密度のテキスト記述があります。
研究者は、LLaVA-NeXTの方法論を使用して、LLaVA-NeXTをベースとして、キャプションモデルをファインチューンしました。HowTo100MのASR疑似ラベルは、ビデオごとに「アクション」として使用され、さらに大規模言語モデル(LLM)によって精製されました。
たとえば、ChatGPT-4oは、キャプションデータセットを生成するために使用され、主題-オブジェクトの相互作用(たとえば、器具や食材を扱う手)、オブジェクトの属性、時間的ダイナミクスに焦点を当てました。
ASRスクリプトは不正確で「ノイズ」が含まれている可能性があるため、IoU(交差係数)を使用して、キャプションがアドレスしているビデオのセクションにどれだけ近いかを測定するメトリックとして使用しました。著者は、これがナラティブ的一貫性の作成に不可欠であったと述べています。
カーソルクリップは、Fréchet Video Distance(FVD)を使用して評価され、実世界の例と生成された例の差を、キーフレームの有無にかかわらず、測定しました。

さらに、クリップは、LLaVA-Houndの定義に従って、GPT-4oと6人の人間のアノテーターによって評価されました。「妄想」(モデルが虚構のコンテンツを発明する能力)についてです。
研究者は、キャプションの品質を、Qwen2-VL-72Bコレクションと比較し、わずかに改善されたスコアを取得しました。

方法
VideoAuteurの生成フェーズは、長いナラティブディレクター(LND)と視覚的に条件付けられたビデオ生成モデル(VCVGM)に分割されています。
LNDは、ナラティブの流れを特徴付ける視覚的な埋め込みまたはキーフレームのシーケンスを生成します。VCVGMは、これらの選択に基づいてビデオクリップを生成します。

著者は、交互の画像テキストディレクターと言語中心のキーフレームディレクターの異なる利点について広範囲に議論し、前者がより効果的なアプローチであると結論付けています。
交互の画像テキストディレクターは、テキストトークンと視覚的な埋め込みを交互に使用してシーケンスを生成し、自己回帰モデルを使用して、テキストと画像の両方のコンテキストに基づいて次のトークンを予測します。これにより、視覚とテキストの間の密接な整合が保証されます。
一方、言語中心のキーフレームディレクターは、キャプションのみに基づいて、視覚的な埋め込みを生成プロセスに組み込まずに、テキスト条件付き拡散モデルを使用してキーフレームを合成します。
研究者は、言語中心の方法が視覚的に魅力的なキーフレームを生成するが、フレーム間の一貫性が欠けていることを発見しました。一方、交互の方法は、現実性と視覚的一貫性の点で高いスコアを達成します。また、この方法は、トレーニングを通じてリアルな視覚的なスタイルを学習することができ、時には繰り返しやノイズのある要素が含まれることがあると主張しています。
通常、安定した拡散とFluxをワークフローに組み込む研究の流れに支配されている中で、著者は、7Bパラメータの多モーダルLLMファウンデーションモデルであるTencentのSEED-Xを、生成パイプラインに使用しました(ただし、このモデルは、Stability.aiのSDXLのStable Diffusionリリースをアーキテクチャの一部に利用しています)。
著者は次のように述べています:
‘従来のImage-to-Video(I2V)パイプラインとは異なり、画像を開始フレームとして使用するのではなく、[回帰視覚潜在変数]をシーケンス全体で連続的な条件として利用します。 ‘
‘さらに、視覚的な埋め込みが完全でない可能性がある回帰エラーにより、生成されたビデオのロバスト性と品質を、視覚的な埋め込みのノイズを処理できるようにモデルを適応させることで向上させます。 ‘
典型的な視覚的に条件付けられた生成パイプラインは、初期のキーフレームをモデルガイダンスの開始点として使用することが多いですが、VideoAuteurは、このパラダイムを、意味的に一貫した潜在的な空間でマルチパートの視覚的な状態を生成することによって拡張しています。開始フレームのみに基づいてさらに生成を行うことによる潜在的な偏りを回避しています。

テスト
SeedStoryの方法に従って、研究者は、SEED-Xを使用して、ナラティブデータセットにLoRAファインチューニングを適用し、結果を「Soraのようなモデル」として説明しました。これは、大規模なビデオ/テキストのペアに事前トレーニングされたモデルで、視覚的およびテキストのプロンプトと条件を受け入れることができます。
32,000のナラティブビデオがモデル開発に使用され、1,000が検証サンプルとして設定されました。ビデオは短辺448ピクセルに切り抜かれ、次に448x448pxに中央切り抜かれました。
トレーニングでは、ナラティブ生成は主にYouCook2の検証セットで評価されました。Howto100Mセットは、データ品質の評価と画像からビデオへの生成に使用されました。
視覚的な条件付けロスについては、DiTの拡散ロスと、2024年の研究に基づいて、Stable Diffusionを使用しました。
交互のアプローチが優れていると主張することを証明するために、著者は、VideoAuteurを、EMU-2、SEED-X、FLUX.1-schnell(FLUX.1-s)などの、テキスト入力のみに依存する方法と比較しました。

著者は次のように述べています:
‘言語中心のアプローチは、キーフレームの視覚的な魅力がありますが、フレーム間の一貫性が欠けているため、相互情報が限られていることによる欠点があります。対照的に、交互の生成方法は、言語と整合された視覚的な潜在変数を利用して、トレーニングを通じて現実的な視覚的なスタイルを達成します。 ‘
‘しかし、自己回帰モデルは、1回のパスで正確な埋め込みを生成するのに苦労するため、時々繰り返しまたはノイズのある要素を生成します。 ‘
人間の評価も、著者の交互のアプローチのパフォーマンスの向上についての主張をさらに裏付けています。交互の方法は、調査で最高のスコアを達成しています。

しかし、言語中心のアプローチは、美的スコアで最高のスコアを達成しています。著者は、しかし、これが長いナラティブビデオの生成における主な問題ではないと主張しています。
再生するにはクリックしてください。 VideoAuteurによって生成されたピザビデオのセグメント。
結論
長編ビデオ生成におけるナラティブの一貫性という課題に関して最も人気のある研究分野は、単一の画像に関係しています。DreamStory、StoryDiffusion、TheaterGen、NVIDIAのConsiStoryなどのプロジェクトが含まれます。
ある意味では、VideoAuteurもこの「静的」カテゴリに分類されます。なぜなら、クリップセクションを生成するためのシード画像を使用しているからです。しかし、ビデオとセマンティックコンテンツの交互のプロセスは、実用的パイプラインに一歩近づいています。
最初に公開:2025年1月16日木曜日












