Andersonの視点

1fpsを超える動画キャプションの課題

mm
Unite.AI を Google の優先ソースに追加
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

機械学習システムが動画内のイベントを認識する能力は、AIベースの動画生成の未来にとって非常に重要です。動画データセットには、ユーザーの要求に従ってモデルを生成し、過度にホールシネーションしないようにするために、正確なキャプションが必要です。

GoogleのVidReCapプロジェクトからのキャプションスキーマの例。ソース:https://sites.google.com/view/vidrecap

GoogleのVidReCapプロジェクトからのキャプションスキーマの例。ソース:https://sites.google.com/view/vidrecap

必要な動画のスケールを手動でキャプションすることは、考えられないことです。AIシステムを自動キャプション化することは可能ですが、グラウンドトゥルースとして、多様性とカバレッジのために、多くの人間が生成した例がまだ必要です。

さらに重要なのは、ほとんどの現在のAIベースの動画キャプションモデルは、1fpsで動作しており、多くのシナリオで変化を検出するのに十分な密度のキャプチャレートではありません。感情認識システムのための突然のマイクロ表情の変化、バスケットボールなどのハイスピードスポーツの急なイベント、急な動き、ドラマティックな映画での急なカット(PySceneDetectなどのシステムがそれらを検出できないか、使用されていない場合)など、注目のウィンドウが明らかにより集中している必要がある他のシナリオなどです。

クリックして再生。 世界で最も遅いスポーツの1つであるスヌーカーの世界選手権で、アレックス・ヒギンズがレイ・リアドンに勝利した1982年のラピッド・アクション。 ソース:https://www.youtube.com/watch?v=_1PuqKno_Ok

ロジックを破壊して急ぐ

この低レートは、さまざまなロジスティック上の理由により標準です。1つは、動画キャプション化は、システムが順序付きの1フレームずつ調査しているか、またはさまざまな方法でフレームのシーケンスを意味的にまとめて解釈可能なキャプションシーケンスを生成しているかに関係なく、リソースの消費が激しい活動だからです。

1fpsが現在の標準であるもう1つの理由は、動画は一般的に急なイベントでいっぱいではなく、300フレームの静的なスヌーカーテーブルに、チャンピオンシップを勝ち取るためにポットされたブラックボールの1秒を同じ注意を払うことは冗余であるということです(上記の例を参照)。

スポーツ動画の重要な瞬間を特定するための二次的なヒント、たとえばバスケットボールゲームでのラピッドスラムダンクに対する継続的なクラウドの反応を使用することは可能です。ただし、たとえばプレイヤーの怪我などの他の理由でこれらのヒントが発生する可能性があるため、これらに依存することはできません。これは、動画データセットが不完全にラベル付けされている場合、生成された動画モデルがホールシネーションまたは命令の誤解を引き起こす可能性がある、という事実の1つの例です(たとえば、クラウドの激動がスラムダンクに特有のものではない場合、モデルはスラムダンクを生成するように要求されたときにプレイヤーの怪我を表示する可能性があります)。

これは、多くの面で「予算」の問題であり、他の面では手順上の問題です。現在のフレームワークは、スパースなキーフレームが動画の主な情報を効果的に捉えることができるという原則で動作していますが、これは、ジャンルや動画の主題の他の側面を確立することには効果的ですが、多くのシナリオでは不十分です。

F-16

中国から新しい論文が解決策を提供しています。最初のマルチモーダル大規模言語モデル(MLLM、または単にLLM)であるF-16は、1fpsではなく、16fpsで動画を分析できます。

テストでは、著者は、新しいシステムであるF-16が、GPT-4oやGoogleのGemini-1.5 Proなどの独自の最先端モデルを上回ると主張しています。F-16と同等の結果を達成した他のモデルもありましたが、これらのモデルははるかに大規模で扱いにくかったです。

F-16は、かなり厳しいハードウェアでトレーニングされました(後述します)。ただし、トレーニングよりも推論は一般にはるかに要求が少ないため、コード(近い将来リリース予定)は、おそらく中級から高級の家庭用GPUで実行できるはずです。

ホビーシーン(そしてほとんどの場合、プロのVFXシーン)の活力を維持するために必要なのは、この種の動画キャプションモデルが、コンシューマー向けに最適化されたシステムで動作できることです。そうすれば、全ての生成された動画シーンがAPIベースの商用システムに移行したり、消費者がローカルのフレームワークを商用オンラインGPUサービスに接続することを余儀なくされたりすることはありません。

スケーリングを超えて

著者は、このアプローチがデータセットをスケーリングアップする実用的代替手段であると観察しています。さらに、データを問題に投げつけることよりも、この種のアプローチが好ましい場合があることも推測できます。なぜなら、新しいシステムは、イベントをより詳細な方法で区別するからです。

彼らは次のように述べています:

‘低フレームレートのサンプリングにより、特に急速に変化するシーン、複雑な詳細、または高速モーションのある動画では、重要な視覚情報の損失が発生する可能性があります。さらに、キーフレームが見逃され、モデルがキーフレーム情報に依存するラベルでトレーニングされている場合、モデルは予想されるコンテンツとその予測を合わせるのに苦労する可能性があり、ホールシネーションや性能の低下につながる可能性があります…’

‘… F-16は、同等のサイズのモデルの中で一般的な動画QAで最先端のパフォーマンスを達成し、高フレームレート動画理解では明確な優位性を示し、GPT-4oなどの商用モデルを上回ります。この研究は、マルチモーダルLLM研究における高フレームレート動画理解の進歩の新しい道を開いています。’

論文は、LLMの動画理解の向上: 16フレーム/秒と題されており、清華大学とByteDanceの8人の著者によって書かれています。

方法

連続するフレームにはしばしば冗長な情報が含まれているため、F-16は高フレームレートアライナーを適用して、キーモーションの詳細を圧縮およびエンコードしながら視覚的意味を保持します。各フレームは、事前にトレーニングされた画像エンコーダーによって処理され、機能表現が抽出された後、アライナーに渡されます。これは、ガウシアンエラーライン性単位(GELUs)に基づいています。

F-16のアーキテクチャは、16 FPSで動画を処理し、従来の低フレームレートモデルよりも多くのフレームを捉え、視覚的意味を保持しながらモーション動態を効率的にエンコードする高フレームレートアライナーを備えています。ソース:https://arxiv.org/pdf/2503.13956

F-16のアーキテクチャは、16 FPSで動画を処理し、従来の低フレームレートモデルよりも多くのフレームを捉え、視覚的意味を保持しながらモーション動態を効率的にエンコードする高フレームレートアライナーを備えています。ソース:https://arxiv.org/pdf/2503.13956

フレーム数の増加を効率的に処理するために、F-16はフレームを小さな処理ウィンドウにグループ化し、視覚的な特徴を3層の多層パーセプトロン(MLP)を使用して結合し、最も関連性の高いモーションの詳細のみを保持し、不要な重複を削減しながら、動作の時間的流れを保持します。空間マックスプーリングレイヤーはさらにトークン数を圧縮し、計算コストを制限内に保ちます。

処理された動画トークンは、Qwen2-7B LLMにフィードされ、抽出された視覚特徴とユーザープロンプトに基づいてテキスト応答を生成します。

このような方法で動画入力を構造化することで、F-16は、著者によると、動的なシーンでのより正確なイベント認識を可能にし、引き続き効率性を維持します。

簡単なバージョン

F-16は、事前にトレーニングされた画像LLM、LLaVA-OneVisionを拡張して、動画を処理するために視覚入力パイプラインを変換します。標準的な画像LLMは個々のフレームを処理しますが、F-16の高フレームレートアライナーは、モデルがより効率的に処理できる形式に複数のフレームを書き直します。これにより、システムが冗長な情報で圧倒されるのを避けながら、正確な動画理解に必要な重要なモーションキューやヒントが保持されます。

画像ベースの基盤との互換性を確保するために、F-16は、サブマトリックスにアライナーを再構成することで、事前にトレーニングされたパラメーターを再利用します。このアプローチにより、シーケンシャル動画入力に適応しながら、シングルフレームモデルからの知識を統合できます。

アライナーは、最も情報の多い特徴を保持しながら、フレームシーケンスをLLMに最適化された形式に圧縮し、不要な詳細を破棄します。アーキテクチャの設計により、システムは高フレームレート動画を処理しながら、計算要求を制御下に保つことができ、著者は、これがスケーリングが動画キャプション化の唯一の解決策ではないことを示す証拠であると主張しています。

ペースの変化

16fpsで動画を処理するとモーション理解が向上しますが、計算コストが増加します。特に推論中に、F-16は、可変フレームレートデコーディング方法を導入し、フレームレートを動的に調整できるようにします。

F-16で利用可能なシングルフレームと高フレームレートアライナー。

F-16で利用可能なシングルフレームと高フレームレートアライナー。

この柔軟性により、モデルは、高精度が不要なときは効率的に低FPSで動作し、計算オーバーヘッドを削減できます。

テスト時、低フレームレートが選択された場合、F-16は、入力フレームを繰り返して、期待される次元に合わせることで、事前にトレーニングされたアライナーパラメーターを再利用します。これにより、モデルはアーキテクチャを変更せずに動画を効果的に処理できます。

単純なダウンサンプリング(たとえば、単にフレームを削除する)と比較して、このアプローチは、重要なモーションの詳細を失うリスクを回避しながら、学習したモーションの表現を保持します。一般的な動画理解の場合、低FPS設定は推論を高速化できますが、パフォーマンスに大きな損失はありません。一方、高速モーション分析は、16fpsのフル機能を利用できます。

データとテスト

Qwen2-7Bに基づいて構築されたF-16は、SigLIPを画像エンコーダーとして使用して、LLaVA-OneVisionを拡張します。動画フレームは16fpsでサンプリングされ、各動画から最大1,760フレームを取得できます。より長い動画クリップの場合、フレームは均一に(つまり、より疎に)サンプリングされました。

トレーニングのために、F-16は、LLaVA-Videoと同じ一般的な動画データセットを使用しました。これには、LLaVA-Video-178KNExT-QAActivityNet-QA、およびPerceptionTestが含まれます。

F-16は、さらに、FineGymDiving48、およびSoccerNetのハイスピードスポーツデータセットでファインチューニングされました。著者はまた、2024年11月13日から11月25日までの間にプレイされた276のNBAゲームのコレクションをキュレーションし、ボールの動きとプレイヤーのアクション、およびショットが成功したかどうか(高フレームレート処理を必要とするタスク)に焦点を当てました。

モデルは、NSVAテストセットを使用して評価され、F1スコアで測定されました。

体操とダイビングのモデルは、イベント認識の精度に基づいて評価され、サッカーとバスケットボールのモデルはパスの追跡とシュートの結果を追跡しました。

モデルは、エポック1回でトレーニングされ、128NVIDIA H100 GPU(標準の80GBのVRAMを使用)を使用しました。学習率は、トレーニング中2×10⁻⁵でした。 さらに、LoRAは、5エポックで64GPUを使用してスポーツデータでファインチューニングされました。ここでは、LLMのみがトレーニングされ、画像エンコーダーはフリーズされました。

最初のラウンドで一般的な動画理解のためにテストされた対抗フレームワークには、GPT-4o、Gemini-1.5-Pro、Qwen2-VL-7B、VideoLLaMA2-7BVideoChat2-HD-7B、LLaVA-OV-7BMiniCPM-V2.6-8BLLaVA-Video-7B、およびNVILA-7Bが含まれていました。

モデルは、Video-MMEVideoVistaTemporalBenchMotionBench、Next-QA、MLVU、およびLongVideoBenchで評価されました。

さまざまなベンチマークでの動画QA結果の比較。F-16は、Video-MME、NQA、TPB、MBで7Bモデルの中で最先端のパフォーマンスを達成し、GPT-4oやGemini-1.5-Proなどの独自モデルと並んでいます。

さまざまなベンチマークでの動画QA結果の比較。F-16は、Video-MME、NQA、TPB、MBで7Bモデルの中で最先端のパフォーマンスを達成し、GPT-4oやGemini-1.5-Proなどの独自モデルと並んでいます。

これらの結果について、著者は次のように述べています:

‘Video-MME Short、Medium、NeXT-QAデータセット(それぞれ短い動画理解を目的として設計されている)では、私のモデルは、前の7B SOTAモデルよりも、精度で3.2%、1.0%、0.9%上回り、短い動画での強いパフォーマンスを示しています。 ‘

‘長い動画理解を評価するベンチマーク(たとえば、Video-MME Long、LongVideoBench、MLVU)では、挑戦は大きいです。処理ウィンドウ内のフレームは、より大きな変動を示すため、モダリティアライナーが有効に時系列変化をエンコードすることが困難になります。 ‘

‘これにより、F-16は[LLaVA-Video-7B]よりも多少パフォーマンスが低下します。[LLaVA-Video-7B]は同じ動画データセットでトレーニングされています。 ‘

F-16の高フレームレート処理により、著者はさらに、TemporalBenchでは13.5%、MotionBenchでは2.5%の改善が見られ、既存の7Bモデルと比較して、GPT-4oやGemini-1.5-Proなどの商用モデルと同等のレベルでパフォーマンスを発揮したと述べています。

ハイスピードスポーツ動画理解

F-16は、FineGym、Diving48、SoccerNet、およびNBAデータセットでテストされ、ハイスピードスポーツアクションを理解する能力が評価されました。

10,000の手動で注釈付けされたNBAクリップを使用して、トレーニングはボールの動きとプレイヤーのアクション、およびショットが成功したかどうか(高フレームレート処理を必要とするタスク)に焦点を当てました。NSVAテストセットを使用して、F1スコアで評価されました。

ハイスピードスポーツ動画分析の結果。高フレームレートアライナーを備えたF-16は、すべてのスポーツタスクで低フレームレートカウンターパートと比較して優れています。GPT-4oとGemini-1.5-Proも、NBAとSoccerNet QAで評価されました。ここでは、ドメイントレーニングの知識は不要でした。

ハイスピードスポーツ動画分析の結果。高フレームレートアライナーを備えたF-16は、すべてのスポーツタスクで低フレームレートカウンターパートと比較して優れています。GPT-4oとGemini-1.5-Proも、NBAとSoccerNet QAで評価されました。ここでは、ドメイントレーニングの知識は不要でした。

FineGymでは、F-16は、体操アクションの認識において、前の7B SOTAモデルよりも13.8%上回り、微妙なモーション理解が向上したことを示しています。

Diving48では、複雑な動きのシーケンス(たとえば、テイクオフサマーソルトツイストフライトの段階)を識別する必要があり、F-16はこれらの遷移を認識する精度が高かったです。

SoccerNetでは、モデルは10秒間のクリップを分析し、ボールのパスを識別し、結果は既存の7Bモデルを上回り、小さな急な動きを追跡する能力が向上したことを示しています。

NBAデータセットでは、F-16は、ショットの結果を決定する能力が、GPT-4oやGemini-1.5-Proなどの大きな独自モデルと同等の精度に達したことを示しています。これは、高フレームレートが動的なモーションを処理する能力を向上させていることをさらに示唆しています。

可変フレームレート

F-16は、さまざまなフレームレートでテストされ、適応性が評価されました。代わりに、再トレーニングではなく、入力フレームを繰り返してアライナーの入力構造と一致させました。このアプローチは、単純にフレームを削除することよりも、パフォーマンスをより多く保持しました。

結果は、FPSの低下がモーション認識に多少の影響を与えていたにもかかわらず、F-16は低フレームレートモデルを上回り、16fps以下でも強力な結果を維持したことを示しています。

左側は、Video-MME Longセットの300の動画で、さまざまなテストFPSとシーケンスの長さで、F-16のさまざまなモジュールの時間消費を示しています。右側は、モデルがトレーニングおよびテストされたFPSと、Video-MMEのパフォーマンスの比較を示しています。実線は、モデルが同じFPSでトレーニングおよびテストされた場合を表し、破線は、モデルが16 FPSでトレーニングされ、低FPSでテストされた場合を表します。

左側は、Video-MME Longセットの300の動画で、さまざまなテストFPSとシーケンスの長さで、F-16のさまざまなモジュールの時間消費を示しています。右側は、モデルがトレーニングおよびテストされたFPSと、Video-MMEのパフォーマンスの比較を示しています。実線は、モデルが同じFPSでトレーニングおよびテストされた場合を表し、破線は、モデルが16 FPSでトレーニングされ、低FPSでテストされた場合を表します。

F-16の高フレームレート処理により、計算要求が増加しましたが、アライナーはこれらのコストを管理するのに役立ちました。モデルは、低FPSモデルよりも1つの動画につきより多くのFLOPSを必要としましたが、トークンあたりの精度も向上しました。これは、アライナーのフレーム選択とトークン圧縮戦略が追加の計算を相殺するのに役立ったことを示しています。

結論

この特定の研究分野の重要性と課題、特に今年が生成された動画のブレイクスルー年となることを考えると、これを過大評価することはできません。生成された動画の質と、データセットの作成とキャプション付けの課題が明らかになるからです。

また、動画内の内部詳細の正確な説明を得る課題は、VRAM、時間、またはディスク容量を問題に投げつけることだけでは解決できないことも強調する必要があります。イベントを動画から分離/抽出する方法、つまり、たとえばゴルフやスヌーカーのビデオクリップの長くて退屈なトラックから、は、現在の最先端ソリューションを支配している意味論的アプローチとメカニズムを再検討することから利益を得る可能性があります。なぜなら、これらの制限のいくつかは、リソースが貧弱な時代に確立されたものだからです。

(また、2025年の基準では16fpsが非常に低いフレームレートであるにもかかわらず、注目すべきは、これが、Wan 2.1生成動画モデルのトレーニングスピードであり、最も問題のない動作スピードでもあるということです。研究シーンは、ここでの「標準のエントロピー」に注意を払う必要があります。時には、古い制約が将来の標準を永続させる可能性があるからです。)

 

2025年3月19日(水曜日)に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai