Andersonの視点
AIは本を読むことを映画を見ることを好む

動画解析のために作られたAIモデルでさえ、実際の映像を見て説明させるのは驚くほど難しい。モデルは動画像よりも文章に関心を示す。
短い動画をChatGPTや同種の視覚言語モデルにアップロードしたことがあれば、動画そのものを解析できないことに驚いたかもしれない。ChatGPT-4o以降はJPEGやPNGなどの個別フレームを分析できるが、利用者が自分でフレームを抽出し、画像として渡すことを前提としている。
OpenAIのGPTシリーズでは、動画から一連のフレームを手作業で抽出してChatGPTに与え、動画用のAIナレーションを生成させることは可能だ。

抽出した複数フレームを解析し、動画解説を生成するOpenAIチュートリアルの画像とコード。 出典
しかし、上の例のように大きな処理から関数を呼び出すか、FFMPEGや無料・有料の動画編集ソフトを使って動画をフレームへ変換する作業は利用者に委ねられる。
ChatGPTのような大規模サービスで動画解析が制限される理由の多くは資源消費にある。主要コーデックを各AIインスタンスに用意し、ディスクとCPUを大量に使う抽出処理へ計算資源を割くことは小さな負担ではない。数億人が毎日使えばなおさらだ。
時間的な分析は単一フレームとまったく違う意味を示すこともある。明るい気分で家に入った人物が遺体を発見する場面は、一枚の画像だけでは理解できない。短い動画であっても時間全体の文脈を把握するのは高コストで、専門的な研究分野でもある。オプティカルフローは映像を展開し、静的文書のように調べて処理できるようにする代表的な枠組みだ。

緑のベクトルで移動方向と強度を示し、フレーム間の動きを追跡する。こうした表現はVLMに時間的連続性を与え、VFX工程の構造的なガイドにもなる。 出典
要約だけで済ませる
Google NotebookLMや最近のChatGPTは、動画を説明する埋め込みテキストなどの関連メタデータを読めるため、動画ファイルのアップロード自体は拒まない。そうした情報がない映像を解釈しようとする場合もある。
筆者はイタリア映画『The Hand of God』(2021年)の無作為な6秒の場面を、ファイル名にもメタデータにも有用な文字情報がない状態でNotebookLMへアップロードした。NotebookLMは映像と無関係な内容を詳しく幻覚し、筋の通らない5分間の討論ポッドキャストまで生成した。

イタリア映画の日常的な6秒の場面をNotebookLMが大きく誤解した。 出典:Google NotebookLM
NotebookLMもChatGPTもYouTube動画を入力として受け付けるが、解釈可能なテキスト注釈または字幕が必要で、映像に焼き込まれた字幕だけでは足りない。画面と音を実際に見聞きして意味を解釈する重い処理は、アップロード後に必要な資源を割り当てられた時点で行われる。これは著作権保護や今後の本人保護制度のため、YouTubeにも必要な処理である。
本当の動画解釈は高価で負荷が大きい。そして新しい研究によれば、そのために特別に訓練されたモデルさえ、動画を見るより文字を読むことを選びがちだ。
長すぎて見ない
英国ブリストル大学の新論文A Video Is Not Worth a Thousand Wordsは、動画質問応答(VQA)を行うよう設計された最先端の視覚言語モデル(VLM)も、可能なら文字情報を優先すると結論づけた。
動画と質問文、複数の選択肢を同時に与えると、モデルは画面上の出来事より文章のパターンに基づいて答えることが多かった。質問そのものを取り除いても同程度の成績を示す例さえあった。
多くのモデルにとって最も重要なのは回答候補のパターンを見つけることだった。選択肢を増やして課題を難しくしたときに初めて、AIは映像へ強く注意を向けた。
研究者は文脈長の異なる6種類のVLMを4つのデータセットでさまざまな条件下に置き、映像よりテキストへ依存する傾向を確認した。

竹を編む人物の映像で、モデルはフレームより質問と回答文へはるかに大きな重みを与える。青は選択した答えを支持する要素、赤は反対に働く要素で、推論が動画より文言を中心にしていることが分かる。 出典
論文には実行コードとデータを収めたGitHubリポジトリも付属する。
手法
各入力が判断へどれだけ寄与するかを調べるため、研究者はゲーム理論のシャープレイ値を用いた。本来は連合に参加した各プレイヤーへ報酬を公平に配る手法で、個別の影響に応じて貢献度を割り当てる。
ここでのプレイヤーは動画フレーム、またはVQA課題の注釈・字幕・キャプションなどの文字要素で、報酬はモデルの最終回答である。各要素を加除したときの変化を体系的に調べれば、選択した答えにその要素がどれほど重要だったか分かる。
研究では動画とテキストを別々に扱えるようシャープレイ値を混合モダリティへ拡張し、モデル出力への影響を測った。これにより映像内容を本当に解釈したのか、文章の手掛かりを近道にしたのかを区別した。
指標
各モダリティの寄与を比べるため二つの指標を定めた。モダリティ寄与度は利用可能なシャープレイ値を合計し、動画・質問・回答それぞれの割合を全体に対する百分率で表す。
特徴別寄与度は、動画のように他より特徴数が多いモダリティを補正する。特徴ごとの平均シャープレイ値を求め、その平均を比較してどのモダリティが支配的かを判断する。
データと試験
原理が広く一般化できるか確かめるため、文脈長、公開時期、構成の異なる6モデルを選んだ。FrozenBiLM、InternVideo、VideoLLaMA2、VideoLLaMA3、Qwen2を使うLLaVa-Video、同じくQwen2を使うLongVAである。
データセットも多様だ。EgoSchemaは関連動画を最後まで見なければ解けないVQA、HD-EPICは非常に長い映像も含む台所中心のデータセット、MVBenchは複数データセットから選んだ集合、LVBenchは長時間動画への質問である。各質問形式から10件ずつ、計60問を構成した。
寄与度は、多くのモデルが文字より映像を使っていないことを明確に示し、フレーム単位では差がさらに大きかった。動画全体の寄与がある程度あっても個別特徴の影響は小さい場合が多く、全体として映像を使っていても各フレームにはほとんど注意を払っていないことを示す。主な例外はVideoLLaMA3で、特にLVBenchの長い系列で視覚依存が強かった。

モダリティ寄与度(MC)と特徴別寄与度(PFC)。動画(V)、質問(Q)、回答(A)の相対的な重みを示す。ほとんどの条件で言語が明確に優勢で、特にフレームごとの影響では動画が後景に退く。
文字情報の中では、強いモデルほど回答より質問を重視する傾向があった。質問が長く自然で、回答が短く形式的なEgoSchemaで顕著だった。MVBenchでは二択構造が回答トークンの重要性を大きく見せるため、やや逆になった。それでも全モデル、全データセットで視覚は一貫して軽視され、言語が大半を担った。
長文脈モデルでは動画の寄与が大幅に低下し、フレームごとのシャープレイ値は文字特徴よりはるかに小さい。動画全体はなお重要だが、個々のフレームの値はゼロ付近に集まり、文字ほど明確に注意を導けていない。
さらに動画や文字の一部を意図的に隠すマスキング試験を行った。特定入力を除いて性能が急落すれば重要であり、同程度ならあまり使われていない。反復的なアブレーション試験に相当する。

4つのVQAベンチマークで動画、質問、回答を隠した際の基準性能からの変化。赤は精度低下、緑は上昇。動画なしでも高得点を保つモデルが多い一方、文字の回答を除くと低下が大きく、質問を隠す影響は概して小さい。
客観式の回答文を隠すと多くの場合で精度が最も低下し、無作為に近づいた。質問を隠す影響は小さく、モデルが質問を過小評価するという先の結果を裏付ける。質問を除いて精度が上がる場合もあり、質問を正しく評価せず、回答を映像や文字の手掛かりへ合わせていた可能性がある。動画なしでも妥当な精度を保つモデルは、現在の構成で動画特徴の寄与が限られることを改めて示した。
研究者は次に、誤答の選択肢を追加して動画へ依存させられるか試した。他の質問から再利用した簡単な誤答では文章パターンを合わせやすくなり成績が上がったが、無関係な答を10個以上入れると動画と質問への依存が増えた。

誤答を追加した際の動画、質問、回答の特徴別寄与度と精度。妨害選択肢が増えると文字の優位が弱まり、視覚と質問特徴の相対的影響が高まる。
VideoLLaMA3では動画を隠すと精度がEgoSchemaで40%、LVBenchで15%下がった。回答数を増やすだけでも、文字の近道から本物のマルチモーダル推論へモデルを移せることを示す。
入力全体で帰属がどう分布するかも調査した。次のヒートマップでは各行が一つのVQA項目、各列が一つの特徴で、左に動画特徴、その後に文字が並ぶ。

4データセットのシャープレイ値ヒートマップ。左の動画特徴より右の文字領域がはるかに強く、モデルが映像より言語へ大きく依存している。
右側の質問・回答の帰属ではシャープレイ値が大きい。動画フレームが終わり文字特徴が始まる境界が鮮明で、動画の寄与は質問と回答よりはるかに小さい。動画が使われても寄与は多くのフレームに薄く、不規則に分散した。
次のEgoSchema例では、シャープレイ値で最重要の16フレームを選び、青を正の影響、赤を負の影響としている。

影響の大きい16フレームと全テキスト入力の帰属。モデルの推論を支配する文字に比べ動画の寄与は小さい。青と赤は選択答への正負の影響を示す。
ほぼすべてのフレームは質問と回答の語より影響が弱い。視覚的手掛かりはまばらで一貫しない一方、「椅子」「柵」といった名詞が文脈に応じてモデルを正答へ、または逆方向へ導いた。
結論
動画編集や分析を経験した人なら、その処理がどれほど資源を使うか知っている。毎日数百万件のAI要求を扱う企業が、即席の動画編集と解釈を気軽に提供できない理由も理解できる。
ほぼすべてのAI APIは、利用者の要求を可能な限り少ない資源で満たそうとする。そのため可能なら利用者のデータやRAG検索に既に含まれるメタデータを使い、どうしても必要な場合もPDF、文書、単一画像のように扱いやすい形式から抽出する。
アップロード動画をCLIPや最新YOLO、または各フレームと時間関係まで理解できる大量電力・長時間型VLMへ毎回通すことは、通常の選択肢には入らない。
ただし今回の現象を、資源節約を狙う製品設計だけで説明することはできない。著者は最先端のマルチモーダル学習でもテキストが支配的だと指摘する。「視覚言語」が未発達なのか、マルチモーダル文脈で重要性や情報量が低いのか、少なくとも現時点では理解が足りない可能性がある。
* NotebookLMが生成した内容は完全な創作か、Googleにまったく索引されていないものらしい。この出力を誘発し得た訓練データ由来の検索結果は見つからなかった。
2025年10月31日金曜日初出。14時20分に書式を修正。












