Взгляд Anderson
ИИ предпочитает читать книгу, а не смотреть фильм

Оказывается, очень сложно заставить модели ИИ смотреть и комментировать фактическое видеоконтент, даже если они предназначены для этой задачи. Они больше интересуются письменным словом.
Если вы когда-либо пытались загрузить небольшой видеоклип в ChatGPT или в подобную популярную модель зрения/языка, вы могли быть удивлены, обнаружив, что они не могут фактически проанализировать видео. Хотя модели, такие как ChatGPT-4o+, способны анализировать отдельные кадры – в виде изображений, таких как JPEG и PNG – они предпочитают, чтобы пользователь извлекал свои собственные кадры и загружал их в виде изображений (которые они готовы комментировать).
В случае серии OpenAI GPT можно, довольно утомительно, извлечь полный набор кадров из видеоклипа и подать их в ChatGPT, для целей, например, генерации трека повествования, созданного ИИ, для видео:
![Изображения и код из учебника OpenAI по парсингу нескольких извлеченных кадров для разработки комментария, созданного ИИ, для видеоклипа. [Источник] https://cookbook.openai.com/examples/gpt_with_vision_for_video_understanding](https://www.unite.ai/wp-content/uploads/2025/10/openai-gpt-frame-parsing.jpg)
Изображения и код из учебника OpenAI по парсингу нескольких извлеченных кадров для разработки комментария, созданного ИИ, для видеоклипа. Источник
Но пользователю приходится самому делать конвертацию из видео в кадры, либо путем вызова функций в более крупной программе, как в приведенном выше примере, либо путем извлечения кадров с помощью FFMPEG или различных бесплатных и платных решений для редактирования видео.
В некоторой степени, возможно, даже в большой степени, ограничения на анализ видео в крупномасштабных продуктах, таких как ChatGPT, зависят от использования ресурсов: просто оснащение одной модели ИИ выбором наиболее популярных видеокодеков и выделение вычислительных ресурсов для процесса извлечения, который является диск-интенсивным и CPU-затратным, не является незначительным фактором, если сотни миллионов пользователей решат начать использовать эти возможности каждый день.
Кроме того, временной анализ может нарисовать совершенно другую картину, чем один кадр (представьте, что кто-то входит в дом в хорошем настроении и затем обнаруживает тело); поэтому рассмотрение всей временной “контрольной суммы” даже короткого видеоклипа является требовательной и ресурсоемкой задачей – а также специализированной областью исследовательской литературы, например, с помощью разработки таких рамок, как Optical Flow – которая по сути “разворачивает” длину видео, чтобы оно могло быть рассмотрено и обработано как статический документ:

Диаграммы оптического потока подчеркивают, как движение отслеживается через кадры в видеопоследовательности, с зелеными векторами, показывающими направление и интенсивность движения. Эти сопоставления обеспечивают временную непрерывность, необходимую для VLM, и также могут служить структурными руководствами в рабочих процессах VFX. Источник
Удовлетворение кратким изложением
Однако, поскольку модели, такие как Notebook LM от Google и более поздние модели ChatGPT, способны читать связанные метаданные (т.е. встроенный текстовый контент, который контекстуализирует видео каким-то образом), они не запрещают загрузку видеофайлов; и иногда они даже пытаются интерпретировать видео, которое не содержит таких данных.
В следующем случае я загрузил 6-секундный случайный клип из итальянского фильма Рука Бога (2021) в NotebookLM, обеспечив, чтобы клип не содержал никакого полезного текста, ни в метаданных, ни в имени файла.
NotebookLM затем подробно представил материал, совершенно не связанный с видео*, вместе с бессмысленным и не связанным пятиминутным подкастом:

Обычный момент в 6-секундном клипе из итальянского фильма является совершенно неправильно интерпретированным NotebookLM. Источник: Google NotebookLM
Хотя Notebook, как и ChatGPT, принимает видео YouTube в качестве входных данных, она будет делать это только в том случае, если видео имеет интерпретируемый текстовый слой аннотаций и/или субтитров (не растеризованные субтитры, которые встроены в видео).
Таким образом, тяжелая работа фактического просмотра содержимого видео и выполнения семантической интерпретации (юридическая необходимость для YouTube из-за его защитных мер от копирования и его будущей системы обнаружения личности), выполняется после загрузки пользователя, когда клип может быть выделен необходимым процессорным ресурсам.
Фактическая интерпретация видео – это дорогостоящая и изнурительная задача, и, как выясняется, даже модели, которые специально обучены для выполнения этой задачи, предпочитают читать текст, а не фактически смотреть видео.
TL;DW
Это, согласно новой статье из Университета Бристоля в Великобритании, озаглавленной Видео не стоит тысячи слов, в которой два автора приходят к выводу, что текущие модели зрения/языка (VLM) – модели, специально предназначенные для анализа видео более усердным образом и для участия в анализе вопросов видео (VQA) – также отдают предпочтение текстовой информации, когда только могут.
Когда им предоставлялись движущиеся изображения и письменные вопросы и варианты ответов, авторы статьи обнаружили, что модели обычно основывали свои выборы на закономерностях в тексте, а не на том, что происходит на экране – во многих случаях выполняя задачу так же хорошо, даже когда вопрос был удален полностью.
В том, что кажется привычной формой обхода или жульничества, то, что имело значение для большинства моделей, было возможность обнаружить закономерности в возможных ответах; только когда задача была сделана более сложной путем добавления большего количества вариантов ответов, ИИ начали обращать больше внимания на видео.
Авторы провели тесты VQA в различных условиях для шести моделей VLM разной длины контекста, на четырех подходящих наборах данных; и обнаружили, что результаты указывают на зависимость моделей от текста над видеоконтентом.

Пример из исследования, показывающий, как модель видеоанализа взвешивает то, что она видит, и то, что она читает. Клип показывает человека, плетущего бамбук, но модель придает гораздо больше значения написанному вопросу и тексту ответа, чем самому видео. Синие выделения указывают на элементы, поддерживающие выбранный ответ, в то время как красные выделения указывают на элементы, которые тянут его в противоположном направлении, иллюстрируя, как рассуждение модели основано на тексте, а не на движущихся изображениях. Источник
Метод
Чтобы понять, как каждый входной сигнал способствует решению модели, новая работа использует метод из теории игр, называемый Shapley Values. Первоначально разработанный для справедливого раздела выплаты между игроками в коалиции, Shapley Values присваивают кредит каждому “игроку” на основе его индивидуального воздействия.
По сути, игроки в этом сценарии являются либо кадрами видео, либо текстовыми компонентами (аннотациями, субтитрами, подписями и т. д.) задачи VQA; и “выплата” – это окончательный ответ модели. Систематически тестируя, что происходит, когда каждый компонент добавляется или удаляется, метод раскрывает, насколько важен этот элемент для получения выбранного ответа.
В случае нового проекта Shapley Values были адаптированы для обработки смешанных модальностей, с видео- и текстовыми компонентами, рассматриваемыми отдельно, и их различным влиянием на выходные данные моделей измеренным, раскрывая, действительно ли видеоконтент интерпретируется или используются текстовые подсказки в качестве обходных путей.
Метрики
Были определены две простые метрики для сравнения того, насколько каждый модус (т. е. видео, вопрос или ответ) способствует решению модели: Вклад модуса измеряет, сколько всего объяснения пришло от каждого типа входных данных; здесь все доступные значения Shapley суммируются, и доля, принадлежащая каждому модусу, рассчитывается как процент от общего.
Во-вторых, Вклад на особенность исправляет тот факт, что некоторые модусы, такие как видео, содержат гораздо больше особенностей, чем другие. Вместо этого рассчитывается среднее значение Shapley для каждой особенности, и эти средние значения сравниваются, чтобы определить, какой модус имеет доминирующее влияние.
Данные и тесты
Авторы протестировали подход на шести моделях VLM с различными характеристиками, разработанными для обеспечения того, чтобы принципы тестов были широко применимы и обобщаемы. Следовательно, модели были выбраны для различных длин контекста, различных возрастов (т. е. как долго с момента выпуска фреймворка) и различных конфигураций архитектуры.
Участниками стали FrozenBiLM; InternVideo; VideoLLaMA2; VideoLLaMA3; LLaVa-Video (который использует Qwen2); и LongVA (также использующий Qwen2).
С той же целью разнообразия четыре целевых набора данных были выбраны: EgoSchema, набор данных VQA, разработанный для того, чтобы быть невозможным для завершения без полного просмотра связанных видео; HD-EPIC, набор данных, ориентированный на кухню, в котором представлены некоторые необычно длинные видео; MVBench, отобранный набор вкладов из других наборов данных; и LVBench, который задает вопросы VQA для очень длинных видео.
Из них авторы разработали 60 вопросов – по 10 из каждого типа вопросов.
Метрики вклада показали, что большинство моделей полагались меньше на видео, чем на текст, особенно при оценке кадр за кадром. Даже в тех случаях, когда видео показало разумный вклад, его влияние на особенность часто было минимальным, что предполагает, что хотя модель могла использовать видеоконтент в совокупности, она обращала мало внимания на отдельные кадры. VideoLLaMA3 был основным исключением, с более сильной визуальной зависимостью, особенно на более длинных последовательностях в LVBench:

Оценки вклада модуса (MC) и вклада на особенность (PFC) по моделям и наборам данных, показывающие относительный вес видео (V), вопроса (Q) и ответа (A) входных данных. Более холодные цвета указывают на более сильный вклад; более теплые цвета указывают на более слабый или незначительный вклад. Во всех настройках язык явно доминирует, а видео часто отодвигается на второй план – особенно в влиянии на кадр.
Что касается текста, вопрос, как правило, имел больше значения, чем ответ, особенно в более сильных моделях. Это было наиболее очевидно в наборах данных, таких как EgoSchema, где вопросы были длиннее и более натуральными, а ответы были короткими и иногда схематичными. MVBench несколько изменил это, поскольку его бинарная структура ответов увеличила кажущуюся важность токенов ответов.
Во всех моделях и наборах данных, однако, зрение постоянно отодвигалось на второй план, а язык выполнял большую часть работы.
Статья гласит:
‘[Для] моделей с длинным контекстом видео показывает значительно уменьшенный вклад, что означает, что значения Shapley на кадр намного меньше, чем их текстовые аналоги.
‘Видео как целый модус, конечно, все еще очень актуально, но это доказательство того, что значения Shapley его отдельных кадров более центрированы вокруг нуля, и что внимание модели к ним намного менее направлено, чем к тексту.’
Чтобы протестировать, как каждый входной сигнал способствует точности модели, исследователи провели дополнительные тесты с помощью маскирования – намеренного сокрытия одного или нескольких частей входных данных и наблюдения за тем, насколько меняется точность модели в результате.
Если производительность резко падает при удалении определенного входного сигнала, этот входной сигнал, вероятно, важен; если модель работает примерно одинаково, это предполагает, что отсутствующая часть не была сильно задействована. В этом смысле тесты маскирования являются своего рода итеративным исследованием удаления.

Влияние производительности на маскирование видео, вопроса или ответа входных данных по четырем тестам VQA. Оценки показывают изменение от базовой модели без маскирования. Красный цвет указывает на более низкую точность, зеленый – на более высокую. Модели часто сохраняли высокие оценки без видео, но потеряли больше, когда ответ (текст) был удален. Вопрос можно было маскировать с минимальным эффектом.
Результаты (показанные выше) указывают на то, что ответы (текстовые ответы в данных с несколькими вариантами) имеют наибольший вес во всех отношениях. Маскирование ответа обычно вызывало самое большое снижение точности, часто снижая модели до почти случайной производительности.
Однако маскирование вопроса обычно имело гораздо меньший эффект, что подтверждает предыдущий вывод о том, что модели часто недооценивают вопрос.
В некоторых случаях точность даже улучшалась при удалении вопроса, что предполагает, что модели иногда просто сопоставляли ответы с визуальными или текстовыми подсказками, а не правильно оценивали вопрос.
Модели также различались в своей зависимости от видео: некоторые сохраняли разумную точность без него, что еще больше подтверждает ограниченный вклад видео-особенностей во многих текущих настройках.
Авторы затем протестировали, могут ли модели быть вынуждены полагаться на видео, добавив дополнительные неправильные ответы к вариантам ответов.
Когда отвлекающие факторы были легкими и повторялись из других вопросов, производительность улучшилась, поскольку модели сопоставляли текстовые закономерности без значительного рассуждения. Но с десятью или более несвязанными ответами они начали больше полагаться на видео и вопрос:

Вклад на особенность и точность для видео, вопроса и ответа входных данных, когда добавляются дополнительные неправильные ответы к каждому тесту VQA, показывая, что увеличение количества отвлекающих факторов снижает доминирование текста и повышает относительное влияние визуальных и вопросных особенностей.
Для VideoLLaMA3 маскирование видео снизило точность на 40% на EgoSchema и на 15% на LVBench, что указывает на то, что простое увеличение количества ответов может сместить модели от текстовых обходных путей к真正ему многомодальному рассуждению.
Исследователи также изучили, как атрибуция распределяется по входным данным, и ниже мы видим тепловые карты значений Shapley для каждого входного сигнала модели:

Тепловые карты значений Shapley для четырех наборов данных, где каждая строка представляет одну пару VQA, а каждый столбец – одну особенность. Видео-особенности появляются слева, за которыми следует текст. Гораздо более сильные значения в текстовых регионах (красный цвет) подтверждают, что модели сильно полагаются на язык, а не на видео.
Комментируя результаты выше, авторы заявляют:
‘Величина значений Shapley намного больше в правой части каждой тепловой карты, представляющей атрибуцию вопроса и ответа. Эта резкая граница – это место, где видеокадры заканчиваются, а текстовые особенности начинаются, демонстрируя, что вклад модуса видео намного меньше, чем вклад вопроса/ответа. ‘
Вкратце, во всех наборах данных значения намного сильнее в текстовом конце спектра, что явно указывает на то, что модели сильно полагаются на язык, а не на визуальные подсказки. Даже когда видео используется, вклад распределен тонко по многим кадрам, часто без какой-либо последовательной закономерности.
Ниже мы видим аннотированный пример из EgoSchema. 16 наиболее “важных” кадров были выбраны с помощью значений Shapley и окрашены в соответствии с их влиянием, с синим цветом, указывающим на положительный вклад, и красным – на отрицательный:

Атрибуции Shapley для одного примера EgoSchema, показывающие 16 наиболее влиятельных кадров и все текстовые входные данные. Видео-вклад минимальен по сравнению с текстом, который доминирует в рассуждениях модели. Синий и красный цвета указывают на положительное и отрицательное влияние на выбранный ответ.
Результатом является то, что почти каждый кадр имеет только слабое влияние по сравнению со словами в вопросе и ответе. Визуальные подсказки скудны и непоследовательны, в то время как существительные, такие как “стул” и “забор”, направляют модель к правильному выбору – или от него, в зависимости от контекста.
Вывод
Кто-либо, кто когда-либо занимался редактированием видео или анализом видео, уже знает, насколько ресурсоемкими являются эти процессы, и понимает, почему компании, обрабатывающие миллионы запросов ИИ в день, не могут позволить себе разрешать пользователям выполнять ад hoc редактирование и интерпретацию видео.
Одна вещь, которую следует помнить в этом отношении, заключается в том, что почти каждый интерфейс API ИИ, который вы когда-либо попытаетесь использовать (за исключением, возможно, совершенно нового и недолговечного демо в поддержку новой научной работы), стремится выполнить желания пользователей на минимально возможном уровне использования ресурсов.
Это означает полагаться на существующие метаданные из пользовательских данных или RAG-запросы, если это возможно; и извлекать (если абсолютно необходимо) метаданные для более парсируемых форматов, таких как PDF, документы и отдельные изображения.
То, что не является вариантом, – это запуск вашего загруженного видео через CLIP или последний YOLO-релиз, или через любую ресурсоемкую и длительную VLM, которая может фактически определить, что находится в кадрах, и понять, что происходит в видео, учитывая временность.
Однако это не означает, что явления, которые документируются в текущей статье, обязательно следуют из скупых архитектурных подходов. Авторы отмечают, что текст доминирует в современных многомодальных парадигмах обучения в любом случае, что указывает на то, что “язык зрения” менее развит, менее важен или информативен в многомодальном контексте или (по крайней мере, на данный момент) менее хорошо понят.
* Интересно, что материал, который NotebookLM сгенерировал, кажется либо полностью оригинальным, либо совершенно неиндексированным Google, поскольку я не смог найти никаких результатов, которые могли бы проникнуть в обучающие данные и спровоцировать этот вывод.
Опубликовано в первый раз в пятницу, 31 октября 2025 года; отредактировано 14:20 для форматирования












