Andersonの視点

AI生成映像用ビデオコーデック

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

AIの全てを食べ尽くす時代が終わりに近づくにつれ、AIによるビデオ生成の新しい経済的なアプローチが、トークンと時間の両面で著しい節約を約束しています。

 

AIの推論の実際のコストは、新しい節度のノートを現在のAI革命の急速なペースに持ち込み、機械学習のコストの合理化への関心が高まっています。ローカルLLMの台頭やプライベートAIの一般的な台頭に加えて、VRAMを大量に消費し、リソースを大量に消費する機械学習ルーチンも最適化される必要があります。

ビデオ生成は、まさにこの点で最大の加害者です。もしもあなたが曾て映画を再圧縮したり、ビデオ編集ソフトから出力したことがあれば、そのタスクがハードウェアに与える負担を知っているはずです – RAMとCPUサイクルを消費し、機械を他の使用からブロックすることが多いです。圧縮アルゴリズムの影響をホストコンピュータに与えないようにするための措置が取られない限りです。

したがって、AIビデオの隆盛が世界中のデータセンターでこの「力狂い」の手順を再現していることを想像するだけで十分です。そのような規模の運用では、最小の利益も即座に集計されます。

フレーム内

このことを念頭に置いて、上海の新しい研究(JD.comと共同)は、レンダリングプロセス(巨大な生のフレームを小さいビデオファイルサイズに圧縮するプロセス)ではなく、実際のAIビデオ生成プロセス自体に向けて設計されたビデオコーデックを提案しています。

通常のビデオコーデックは、毎フレームを完全な画像として保存するのではなく、完全な画像の数を減らし、Iフレームと呼ばれる完全な画像を生成し、残りのフレームはIフレームからの変更を保存します。

例えば、ビデオの中で人が少し動いた場合、コーデックはフレーム全体を書き直すのではなく、フレームの変更を記録します。これらはPフレームと呼ばれ、Iフレームから派生し、Bフレームは将来のフレームからの情報も予測できます:

ビデオコーデックの解剖学:上段はI、P、Bとラベル付けされたフレームの時間軸を示し、Iフレームは完全に保存されたフルカラーで、PフレームとBフレームは再構成を示すために薄く表示され、矢印はフレームが前後のフレームを使用するかどうかを示す;下段は完全に保存されたフレーム(Iフレーム、左)、前フレームから構築されたフレーム(Pフレーム、2番目左)、前後のフレームから構築されたフレーム(Bフレーム、右)を示す。

ビデオコーデックの解剖学:上段はI、P、Bとラベル付けされたフレームの時間軸を示し、Iフレームは完全に保存されたフルカラーで、PフレームとBフレームは再構成を示すために薄く表示され、矢印はフレームが前後のフレームを使用するかどうかを示す;下段は完全に保存されたフレーム(Iフレーム、左)、前フレームから構築されたフレーム(Pフレーム、2番目左)、前後のフレームから構築されたフレーム(Bフレーム、右)を示す。

この近くの情報の再利用は、ビデオファイルが小さくなる理由です。ビデオファイルのほとんどのフレームは、新しい画像としてではなく、前のフレームの変更を記述する命令として機能します。したがって、Iフレームは「フルファット」な未圧縮画像(または最小限に圧縮された画像)を構成し、Iフレーム間のフレームはIフレーム(およびそれ自身)との差異のみを構成します。

もしも毎フレームが完全な未圧縮画像である場合、映画には圧縮がないことになります。映画をこの方法で保存すると、2時間の映画には1テラバイト以上のディスク容量が必要になります。しかしこれが、AIが映画を作る方法です – 毎フレームに等しいリソースとトークンを割り当て、ビデオを生成する方法を計算するときに。

規模の経済

新しい研究「AdaCodec:予測視覚コーディングを使用したビデオMLLM」は、Iフレーム(参照フレーム)にのみフルビジュアルトークンを使用し、すべての間隔フレームを「コンパクトPトークン」としてレンダリングします。これは、従来の圧縮に使用される伝統的なビデオコーデックからのパラダイムです。

内部圧縮が完了した後、genAIビデオは通常の方法で圧縮できます。理論的には、すべての節約はサーバーサイドで行われます:

AdaCodecの概要。左:動画は予測が難しい瞬間には完全なIフレームを予約し、間隔フレームはコンパクトなモーションと残差情報で表現される。右:結果システムは11のベンチマークでQwen3-VL-8Bと同等かそれ以上のパフォーマンスを発揮し、トークン予算全体で長ビデオ精度を維持し、レスポンスタイムラテンシを削減しながらビデオトークンを大幅に削減します。

AdaCodecの概要。左:動画は予測が難しい瞬間には完全なIフレームを予約し、間隔フレームはコンパクトなモーションと残差情報で表現される。右:結果システムは11のベンチマークでQwen3-VL-8Bと同等かそれ以上のパフォーマンスを発揮し、トークン予算全体で長ビデオ精度を維持し、レスポンスタイムラテンシを削減しながらビデオトークンを大幅に削減します。

テストの結果によると、AdaCodecは、11のベンチマークでQwen3-VL-8Bモデルと同等かそれ以上のパフォーマンスを発揮し、同等の処理を使用しながらビデオトークンを約86%削減しました。

著者は以下のように述べています:

「私たちは、予測コーディングからインスピレーションを得ています。ここでは、生のシグナルではなく、予測からのエラーを伝達します。この原則は生物学的根拠があります。視覚システムは、期待される入力と観測された入力の間のミスマッチ、つまり予測エラーを符号化することが考えられています、その入力自体ではなく。」

「現代のビデオコーデックは、同じ残差コーディングのアイデアをエンジニアリングで使用しています。参照フレームには完全なコンテンツが含まれており、予測フレームには参照フレームに対するモーションと残差シグナルが含まれています。」

「これらのシステムには異なる目的がありますが、同じ条件構造を共有しています。近くのサンプルが冗長な場合、チャネルは予測が説明できないものを伝達する必要があります。」

「標準コーデックは、ビットストリームと人間が見ることができる再構成を最適化するように設計されていますが、LLMが消費する視覚トークンを最適化するように設計されていません。したがって、私たちはこのメカニズムをビデオ理解のためのMLLMインターフェースとして再設計しました。」

上海交通大学、上海イノベーション研究所、JD.comの11人の研究者によるこの新しい研究には、ソースコードの公開が約束されています。

方法

前述のように、毎フレームを完全な新しい画像として扱うのではなく、システムは1つのフレームと次のフレームの間に何が変わったかを探します。下の画像の左側では、現在のフレームの小さな領域が、前のフレームの最も似ている領域と照合されています:

AdaCodecのスキーマの概要

AdaCodecのスキーマの概要

2つのロケーションの間の距離はモーションベクターになり、残りの視覚的な違いは残差になります。これらのコンパクトな説明は、完全な画像を保存する必要を代替します。

右側では、結果の情報がAIモデルに入力されています。重要な参照フレームはまだ完全な画像として処理されますが、間隔フレームははるかに小さいモーションと残差トークンで表されます。モデルはビデオを解析するのに十分な情報を保持しながら、著しく少ない視覚データを処理することができます。

どのフレームを完全に保存するかを決定するのは、1つの面白い課題です。従来のビデオコーデックは、参照フレームを規則的な間隔で配置しますが、AdaCodecは、最も重要な瞬間を特定しようとします。

例えば、2人の人がアパートで静かに会話しているシーンを考えてみましょう。突然、SWATチームが窓から突入してきます。すぐに、カメラの視点と編集カットの数が増加し、規則的な参照フレーム間隔では提供できないほど多くのデータが必要になります:

フレームのシーケンス:空の部屋、2人の会話、窓から入るグループ、2人の人が連れ出される、そして再び空の部屋。下の間隔フレームのストリップは、同じイベントをより長い時間軸で示し、青で強調表示されたフレームが選択されています。下に「シーンの強度」というラベルが付いた水平スケールがあり、下の「不十分な参照フレーム」というラベルが付いた色付きのブロックの行があります。

これが、可変ビットレート圧縮方法の背後にある論理です。これらの方法は、ソースビデオを「忙しい」期間を分析し、必要な場所に更多のデータを割り当てますが、時間とリソースのコストは小さくありません。

AdaCodecでは、フレームが近くのフレームから予測できる場合、システムはコンパクトなモーションと残差トークンを使用し続けます。シーンが大きく変化した場合(SWATの例やそれ以下のもの)、完全な参照フレームが挿入されます。これにより、利用可能な処理予算のより多くを重要な視覚情報に費やすことができます。

データとテスト

テストでは、研究者はQwen3-VL-8Bをベースモデルとして使用し、AdaCodecを11のベンチマークで評価しました。これらのベンチマークは、ビデオ理解の3つの分野をカバーしています:長いビデオのパフォーマンスは、MLVULongVideoBenchLVBenchで評価されました。さらに、時間的理解は、TempCompassMotionBenchTOMATOで評価されました。また、一般的なビデオ理解は、Video-MMEMVBenchNExT-QAPerceptionTestEgoSchemaで評価されました。

テストされたオープンソースモデルには、InternVL3.5-8BKeye-VL-1.5-8BGLM-4.1V-9BMiniCPM-V-4.5-8BEagle2.5-8BPLM-8BLLaVA-Video-7BVideoChat-Flash-7BMolmo2-8BMolmo2-O-7Bがありました。

テーブルに表示されるGPT-5、Gemini、Claudeのバリエーションは、比較ベースラインとしてのみ表示されます。CoPE-VideoLM-7BReMoRa-7Bは、コーデックにインスパイアされた圧縮を介して視覚トークンの使用を削減する以前のビデオ言語モデルであり、AdaCodecに最も近い直接の競合相手です:

長いビデオ理解、時間的推論、一般的なビデオ理解を網羅する11のベンチマークの主要な結果。高いスコアは、より良いパフォーマンスを示します。LVB = LongVideoBench; V-MME = Video-MME。ボールドで下線の値は、オープンソースモデルの中で最高と2番目のスコアを示します。クローズドソースモデルのスコアは、利用可能な場合は公式レポートから取得され、不足している結果はMolmo2から取得され、または著者によって評価されました。

長いビデオ理解、時間的推論、一般的なビデオ理解を網羅する11のベンチマークの主要な結果。高いスコアは、より良いパフォーマンスを示します。LVB = LongVideoBench; V-MME = Video-MME。ボールドで下線の値は、オープンソースモデルの中で最高と2番目のスコアを示します。クローズドソースモデルのスコアは、利用可能な場合は公式レポートから取得され、不足している結果はMolmo2から取得され、または著者によって評価されました。

公平な比較を確実にするために、AdaCodecと標準のQwen3-VL-8Bシステムの両方に同じ数の視覚トークンが割り当てられ、結果は圧縮アプローチの有効性を反映するようにしました。

最も激しい設定では、AdaCodecは視覚トークンの使用を約86%削減しながら、長いビデオ、時間的、一般的なビデオ理解タスクでベースラインシステムと同等かそれ以上のパフォーマンスを発揮しました。

節約されたトークンを処理するより多くのビデオフレームに再投資すると、すべての長いビデオベンチマークとすべての時間的ベンチマークでパフォーマンスが向上し、LongVideoBenchで+5.4ポイント、TOMATOで+4.3ポイントの改善が見られました。また、研究で最も強力なオープンソース結果のいくつかも生成されました。

結論

このようなプロジェクトは通常、ハイパースケールプロバイダーを対象としていますが、これは、ローカル化された、合理化されたAIデプロイの「新しい公共的厳粛さ」の一部として、趣味家や中小企業にも関心を持たれるでしょう。

例えば、r/stablediffusionのようなコミュニティでは、これは非常に古いニュースです。毎回、大きなオープンソースリリースが到着すると、GGUF、量子化された重みなど、ハイパーオプティマイズされたバージョンに苛烈にされ、低エンドのグラフィックカードで動作するようになります。

「パフォーマンスステージ」と呼ばれる、この3回目のAIブームが本当に終わったとしたら、企業はAIの実際のコストに嫌悪感を抱くことになり、AdaCodecのような取り組みは、来る「大規模最適化」の一部となるかもしれません。

 

これは、ビデオをユーザーに優しい形式/ファイルサイズにレンダリングすることと同じではありません。むしろ、推論時にAIモデル内で発生するフレームの内部生成と収集に取り組んでいます。

* 著者のインライン引用を、ある程度の範囲内でハイパーリンクに変換しました。

2026年6月4日初版

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]