Andersonの視点

AIは本を読むことを映画を見ることを好む

mm
Unite.AI を Google の優先ソースに追加
AI-generated image of an industrial robot seated in an armchair and reading a book, while ignoring a movie playing on TV. ChatGPT-o4, Nano-Banana; Firefly.

AIモデルが実際の動画コンテンツを視聴してコメントすることは、驚くほど難しいことです。彼らは書かれた言葉に興味があります。

 

ChatGPTや同様の人気のあるビジョン/言語モデルに小さなビデオクリップをアップロードしたことがある場合、実際のビデオを解析できないことに驚かれるかもしれません。ChatGPT-4o+などのモデルは、JPEGやPNGなどの画像としての個々のフレームを分析することができますが、ユーザーがフレームを抽出して画像としてアップロードすることを好みます(これは彼らがコメントする準備ができています)。

OpenAI GPTシリーズの場合、ビデオクリップから完全なフレームの走行を抽出し、ChatGPTにフィードすることができます。たとえば、ビデオのAI生成ナレーショントラックを生成する場合です:

OpenAIのチュートリアルからの画像とコード。ビデオクリップの複数の抽出フレームを解析して、ビデオのAI生成コメンタリーを開発する目的です。[ ソース ] https://cookbook.openai.com/examples/gpt_with_vision_for_video_understanding

OpenAIのチュートリアルからの画像とコード。ビデオクリップの複数の抽出フレームを解析して、ビデオのAI生成コメンタリーを開発する目的です。[ ソース ] ソース

しかし、ビデオからフレームへの変換はユーザーに依存します。FFMPEGまたはさまざまな無料または有料のビデオ編集ソリューションを使用して、フレームを抽出することができます。

ビデオ分析の制限は、ChatGPTのような大規模製品のリソース使用に依存しているかもしれません。1つのAIインスタンスに最も人気のあるビデオコーデックの選択肢を提供し、ディスクとCPUを使用するビデオ抽出プロセスにコンピューティングリソースを割り当てることは、数百万のユーザーが毎日これらの機能を使用し始めた場合に考慮すべき事項ではありません。

さらに、時間分析は、単一のフレームよりも非常に異なる絵を描くことができます(例えば、誰かが幸せな気分で家に入り、死体を見つける)。したがって、短いビデオクリップの全体的な時間的「チェックサム」を考慮することは、リソースを大量に使用するタスクであり、研究文献の専門分野でもあります。たとえば、Optical Flowなどのフレームワークの開発が進行中です。これは、ビデオを「展開」して、静的なドキュメントとして扱うことができます。

オプティカルフローダイアグラムは、ビデオシーケンスのフレーム間でモーションを追跡する方法を示しています。緑のベクトルは、移動の方向と強度を示しています。これらのマッピングは、VLMに必要な時間的連続性を提供し、VFXワークフローでも構造的なガイドとして機能できます。[ ソース ] https://www.unite.ai/wp-content/uploads/2025/10/optical-flow.jpg

オプティカルフローダイアグラムは、ビデオシーケンスのフレーム間でモーションを追跡する方法を示しています。緑のベクトルは、移動の方向と強度を示しています。これらのマッピングは、VLMに必要な時間的連続性を提供し、VFXワークフローでも構造的なガイドとして機能できます。[ ソース ] ソース

クリフノーツに頼る

しかし、GoogleのNotebook LMや最近のChatGPTエントリなどのモデルは、関連するメタデータ(例えば、ビデオをある程度コンテキスト化する埋め込みテキストコンテンツ)を読むことができるため、ビデオファイルのアップロードを禁止しません。時々、メタデータのないビデオを解釈しようとします。

次の例では、NotebookLMに、メタデータやファイル名に有用なテキストが含まれない6秒のランダムクリップを、イタリア映画「神の手」(2021)からアップロードしました。

すると、NotebookLMは、ビデオに関連のない素晴らしい素材を想像力豊かに「発明」し、無意味で無関係な5分間の対面型ポッドキャストを含めました:

イタリア映画の6秒間の日常的な瞬間を、NotebookLMが激しく誤解しています。ソース:Google NotebookLM

イタリア映画の6秒間の日常的な瞬間を、NotebookLMが激しく誤解しています。ソース:Google NotebookLM

NotebookLMは、ChatGPTと同様に、テキストレイヤーアノテーションと/orサブタイトル(画像に焼き込まれたサブタイトルではなく)が含まれている場合にのみ、YouTubeビデオを入力として受け付けます。

このようにして、実際のビデオコンテンツを視聴して解釈し、意味を理解する(これは、著作権保護措置のためにYouTubeの法的必須事項です)という難しい作業は、ユーザーのアップロード後に、可能な限り遅く行われます。クリップが処理リソースを割り当てられることができます。

実際のビデオの解釈は、高価で疲れる作業です。さらに、ビデオを解釈するように特に設計されたモデルでも、テキストを読むことを実際にビデオを視聴するよりも好みます。

TL;DW

これは、イギリスのブリストル大学から出た新しい論文「ビデオは1000語に値しない」によって裏付けられています。2人の著者は、現在の最先端のビジョン言語モデル(VLM)が、ビデオを分析するように設計されているにもかかわらず、テキストベースの情報を使用することを好みます。

著者は、ビデオとテキストの質問と答えの両方が与えられた場合、モデルはテキストパターンに基づいて選択を行い、ビデオコンテンツよりもテキストを使用することを発見しました。質問が完全に削除された場合でも、モデルはしばしば同じレベルのパフォーマンスを維持しました。

著者は、6つのVLMモデルを4つのデータセットでテストし、テキストがビデオよりも優先されることを発見しました。モデルは、質問と答えのテキストに基づいて選択を行い、ビデオコンテンツはほとんど使用されませんでした。

ビデオ分析モデルが何を見て何を読んでいるかを示す例。モデルは、ビデオフレームよりも、質問と答えのテキストに多くの重要性を与えています。青いハイライトは、選択した答えを支持する要素を示し、赤いハイライトは、反対の方向に引っ張る要素を示しています。

ビデオ分析モデルが何を見て何を読んでいるかを示す例。モデルは、ビデオフレームよりも、質問と答えのテキストに多くの重要性を与えています。青いハイライトは、選択した答えを支持する要素を示し、赤いハイライトは、反対の方向に引っ張る要素を示しています。

方法

この研究では、ゲーム理論から生まれたShapley値という方法を使用して、各入力(ビデオ、テキストなど)がモデルの決定にどれだけ貢献しているかを調べました。

Shapley値は、各「プレイヤー」(ビデオフレームまたはテキストコンポーネント)に、その個々の影響に基づいて「報酬」を割り当てます。次に、各入力の「報酬」を合計して、モデルの決定にどれだけ貢献したかを判断します。

この方法を使用して、著者は、ビデオとテキストの両方が与えられたときに、モデルがどのように決定を下すかを調べました。結果は、モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されなかったことを示しました。

指標

この研究では、2つの指標を使用して、各モダリティ(ビデオ、テキストなど)がモデルの決定にどれだけ貢献したかを評価しました。

最初の指標は、モダリティ貢献度(Modality Contribution)です。これは、各モダリティがモデルの決定にどれだけ貢献したかを示すものです。2番目の指標は、特徴ごとの貢献度(Per-Feature Contribution)です。これは、各モダリティの特徴がモデルの決定にどれだけ貢献したかを示すものです。

結果は、モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されなかったことを示しました。

データとテスト

この研究では、6つのVLMモデルを4つのデータセットでテストしました。結果は、モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されなかったことを示しました。

著者は、モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されなかったことを発見しました。さらに、モデルは質問と答えのテキストに基づいて選択を行い、ビデオコンテンツはほとんど使用されませんでした。

結果は、モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されなかったことを示しました。さらに、モデルは質問と答えのテキストに基づいて選択を行い、ビデオコンテンツはほとんど使用されませんでした。

この研究は、ビデオ分析モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されないことを示しています。

結論

ビデオ分析は、高価で疲れる作業です。さらに、ビデオを解釈するように特に設計されたモデルでも、テキストを読むことを実際にビデオを視聴するよりも好みます。

この研究は、ビデオ分析モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されないことを示しています。さらに、モデルは質問と答えのテキストに基づいて選択を行い、ビデオコンテンツはほとんど使用されませんでした。

この研究は、ビデオ分析モデルがビデオよりもテキストを使用することを好み、ビデオコンテンツはほとんど使用されないことを示しています。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai