Andersonの視点
フラックスフローによるジェネレーティブビデオの改善

今週、Arxivに投稿された新しい論文では、Hunyuan VideoやWan 2.1などのAIビデオジェネレーターを採用しているユーザーが直面している問題、つまり「時間的歪み」の問題に焦点を当てています。この問題では、生成プロセスが突然速度を上げたり、重要な瞬間を省略したり、または生成されたビデオの重要な瞬間を混乱させたりします。
クリックして再生。新しい論文で強調されている一部の時間的グリッチ。右側には、FluxFlowアプローチの改善効果が示されています。 ソース: https://haroldchen19.github.io/FluxFlow/
上記のビデオは、論文のプロジェクトサイト(注意: プロジェクトサイトには一部問題がある)から例テストビデオの抜粋を特集しています。著者らの方法(ビデオの右側に示されている)によって修正される、増加の一部の問題を確認できます。
最初の例では、CogVideoXによって生成された「2人の子供がボールで遊ぶ」というシーンを示しています。上記のコンパイルビデオの左側と下の特定の例では、ネイティブ生成が急速に重要なマイクロ動きをスキップし、子供の活動を「カートゥーン」のペースに速めます。一方、同じデータセットと方法で、FluxFlowと呼ばれる新しい前処理技術を使用すると、より良い結果が得られます。
クリックして再生。
2番目の例(NOVA-0.6Bを使用)では、猫の動きがトレーニング段階で何らかの方法で破損または大幅にアンダーサンプリングされ、生成システムが「麻痺」し、対象を動かすことができないことがわかります。
クリックして再生。
この症状、つまり動きや対象が「詰まる」ことは、HVとWanの最も頻繁に報告されるバグの1つです。
これらの問題の一部は、ソースデータセットのビデオキャプションの問題に関連しています。これについては、今週取り上げましたが、これらの問題の原因はユーザーのエラー、機関のミス、資金の制限ではなく、研究の焦点が時間的一貫性や一貫性などのより緊急な課題を優先していることにあると明らかにしました。
今週、ビデオキャプションの影響について取り上げたように、一部のスポーツは重要な瞬間を抽出するのに特に難しいため、重要なイベント(例:ダンク)がトレーニング時に必要な注意を得られないことがあります。
クリックして再生。
上記の例では、生成システムが次の動きに移行する方法を知らないため、不合理にポーズを切り替え、プレイヤーの姿勢や幾何学を変更します。
これらは、トレーニングで失われた大きな動きですが、同様に脆弱なのは、バタフライの羽の羽ばたきなどの非常に小さくて重要な動きです。
クリックして再生。
スラムダンクとは異なり、羽の羽ばたきは「まれ」なものではなく、持続的で単調なイベントです。ただし、その一貫性は、動きが非常に速いため、時間的に確立するのが非常に難しいため、サンプリングプロセスで失われます。
これらは特に新しい問題ではありませんが、強力なジェネレーティブビデオモデルがエンスージアストにローカルインストールと無料生成のために利用できるようになった今、より多くの注目を集めています。
RedditやDiscordのコミュニティは、これらの問題を最初に「ユーザー関連」として扱いました。これは、システムが非常に新しく最小限に文書化されているため、妥当な前提です。したがって、さまざまな専門家は、これらのグリッチのいくつかに対するさまざまな(そして常に効果的な)対策を提案しました。たとえば、Hunyuan Video(HV)やWan 2.1のさまざまなタイプのComfyUIワークフローのコンポーネントの設定を変更することです。
一部の場合、HVとWanは急速な動きを生成するのではなく、「遅い」動きを生成します。RedditやChatGPT(主にRedditを利用)からの提案には、生成に使用するフレームの数を変更したり、フレームレートを大幅に下げたりすることが含まれます。
これはすべて絶望的なことです。現実は、これらの問題の正確な原因や正確な解決策がまだわかっていないことです。設定をトレーニングの周りで苦しむこと(特に出力の品質が低下する場合、たとえばfpsレートが低すぎる場合)は、短期的な解決策にすぎず、研究シーンがこれらの新しい問題にすでに取り組んでいることを見て安心できます。
したがって、今週のビデオキャプションの影響についての取り組みに加えて、新しい論文についての時間的正則化と、現在のジェネレーティブビデオシーンにどのような改善が可能かを見てみましょう。
中心的なアイデアは非常にシンプルで、しかし、それでも効果的です。論文は少しパディングされていますが、必要な8ページに達するために必要です。必要に応じてパディングを省略します。

VideoCrafterフレームワークのネイティブ生成における魚は静的ですが、FluxFlow変更されたバージョンは必要な変更を捉えています。 ソース: https://arxiv.org/pdf/2503.15417
新しい研究は、Temporal Regularization Makes Your Video Generator Strongerというタイトルで、Everlyn AI、香港科技大学(HKUST)、フロリダ中央大学(UCF)、香港大学(HKU)の8人の研究者から来ています。
(執筆時点で、論文の付随するプロジェクトサイトには一部の問題があります)
FluxFlow
FluxFlowと呼ばれる著者らの新しい前処理スキーマの中心的なアイデアは、トレーニングデータに露出されるソースデータの時間フレームの順序のブロックとブロックのグループをシャッフルすることで、広く普及している「フリッカリング」と「時間的不一致」の問題を克服することです。

FluxFlowの中心的なアイデアは、データの増強の一種として、ブロックとブロックのグループを非時間的で予期しない位置に移動することです。
論文では次のように説明しています:
「これらの問題は、基本的な制限から生じる。大量のデータセットを利用するにもかかわらず、現在のモデルは、多様で妥当な時間的ダイナミクスを学ぶのではなく、トレーニングデータの簡素化された時間的パターン(例:固定の歩行方向や繰り返しのフレーム遷移)に依存することが多い。」
「この問題は、トレーニング中に明示的な時間的増強が不足していることによってさらに悪化し、モデルは時間的相関(例:「フレーム#5は#4に続く必要がある」)に過度に適合するのではなく、多様な動きのシナリオにわたって一般化する。」
ほとんどのビデオ生成モデルは、著者によると、まだ画像合成から多くを借用しており、時間軸をほとんど無視して空間的忠実性に焦点を当てています。クロッピング、フリッピング、カラージャスティなどのテクニックは、静止画像の品質を改善するのに役立ちましたが、動画に適用すると、時間的遷移の妥当性を確保するには十分ではありません。
結果として、テクスチャのフリッカリング、フレーム間の不快なカット、繰り返しまたは単純な動きパターンなどの問題が生じます。
クリックして再生
論文では、次のように主張しています。
一部のモデル(Stable Video DiffusionやLlamaGenなど)は、より複雑なアーキテクチャーや工学的制約でこれらの問題に対処していますが、これらは計算コストと柔軟性の面でコストがかかります。
時間的データ増強はすでにビデオの理解タスク(FineCliperやSeFAR、SVFormerなどのフレームワークで)に役立つことが証明されていますが、生成的な文脈ではこれらの戦術がほとんど適用されていないことは驚くことです。
破壊的な動作
研究者は、トレーニング中に時間的順序の単純で構造化された破壊が、モデルが現実的で多様な動きに一般化するのに役立つと主張しています:
「トレーニングデータの順序を混乱させることで、ジェネレーターは妥当な軌跡を回復することを学び、時間的エントロピーを正則化します。FLUXFLOWは、時間的増強の差を埋め、時間的に妥当なビデオ生成を提供するプラグイン式の強化ソリューションを提供します。」
「既存の方法とは異なり、FLUXFLOWはアーキテクチャーの変更やポストプロセッシングに頼るのではなく、トレーニング中に制御された時間的摂動を導入します。」
クリックして再生
フレームレベルの摂動は、シーケンス内に細かい破壊を導入します。この種の破壊は、マスキング増強と似ており、ここではデータのセクションがランダムにブロックされ、システムがデータポイントに過度に適合するのを防ぎ、より良い一般化を促進します。
テスト
中心的なアイデアは非常にシンプルなので、完全な論文にはなりませんが、テストセクションがあります。
著者は、時間的品質の改善、空間的忠実性の維持、外部生成における時間的品質の維持、重要なハイパーパラメータへの感度に関する4つのクエリをテストしました。
研究者は、U-NetベースのVideoCrafter2、DiTベースのCogVideoX-2B、ARベースのNOVA-0.6Bの3つの生成アーキテクチャーにFluxFlowを適用しました。
公平な比較のために、著者はFluxFlowを追加のトレーニング段階として、OpenVidHD-0.4Mデータセットで1エポックにわたってアーキテクチャーのベースモデルを微調整しました。
モデルは、UCF-101とVBenchの2つの人気ベンチマークに対して評価されました。
UCFの場合、Fréchet Video Distance(FVD)とInception Score(IS)メトリクスが使用されました。VBenchの場合、研究者は時間的品質、フレームごとの品質、全体的な品質に焦点を当てました。

FluxFlow-Frameの初期評価。"+ Original"はFLUXFLOWなしでトレーニングしたことを示し、"+ Num × 1"は異なるFluxFlow-Frame構成を示しています。ベスト結果は影付き、2番目のベスト結果は各モデルで下線付きです。
著者はこれらの結果について次のように述べています:
「FLUXFLOW-FRAMEとFLUXFLOW-BLOCKは、FVD、Subject、Flicker、Motion、Dynamicなどのメトリクス(表1、2参照)と、下の画像の定性的結果で示されるように、時間的品質を大幅に改善します。」
「たとえば、VC2の漂流車の動き、NOVAの猫が尾を追う動き、CVXのサーファーが波に乗る動きは、FLUXFLOWで大幅に改善されます。重要なのは、これらの時間的改善は、水の飛沫、煙の軌跡、波のテクスチャなどの空間的詳細や空間的および全体的な忠実性のメトリクスによって示されるように、空間的忠実性を犠牲にすることなく達成されることです。」
以下は、著者が言及している定性的結果の抜粋です(完全な結果とより高解像度の画像については、元の論文を参照してください):

定性的結果の抜粋。
論文では、フレームレベルの摂動とブロックレベルの摂動の両方が時間的品質を向上させるが、フレームレベルの方法が一般に優れていると示唆しています。これは、ブロックレベルの摂動がブロック内に空間的および時間的パターンが密接に結合しているため、ブロックレベルの摂動が効果を低下させるノイズを導入する可能性があるためです。
結論
今週、Bytedance-Tsinghuaのキャプションコラボレーションとともに、この論文は、新しいジェネレーティブビデオモデルの明らかな欠陥が、ユーザーのエラー、機関のミス、資金の制限によるものではなく、時間的の一貫性や一貫性などのより緊急な課題を優先した研究の焦点によるものであることを明らかにしました。
最近までは、無料でダウンロード可能なジェネレーティブビデオシステムからの結果が非常に悪かったため、エンスージアストコミュニティからこれらの問題に対処するための大きな努力は生まれませんでした(これらの問題は基本的で、軽微なものではなかったため)。
今や、純粋にAIによって生成された写実的なビデオ出力の時代が近づいてきていることは明らかです。研究コミュニティとカジュアルコミュニティの両方が、これらの残りの問題を解決するためにより深く、より生産的に取り組んでいます。幸いなことに、これらの問題は解決不可能なものではありません。
* Wanのネイティブフレームレートは16fpsと低く、自分の問題に対する反応として、フォーラムではフレームレートを12fpsまで下げ、FlowFramesまたはその他のAIベースの再フローイングシステムを使用して、フレーム数が非常に少ない場合のギャップを補間することを提案しています。
最初に公開されたのは2025年3月21日です












