Взгляд Anderson
Вызов видеоописания при скорости более 1 кадра в секунду

Способность систем машинного обучения распознавать события, происходящие внутри видео, имеет решающее значение для будущего видеогенерации на основе ИИ, не в последнюю очередь потому, что видеоданные требуют точных описаний для создания моделей, соответствующих запросу пользователя и не чрезмерно галлюцинирующих.

Пример схемы описания видео из проекта VidReCap от Google. Источник: https://sites.google.com/view/vidrecap
Ручное описание видео в необходимом для эффективных обучающих наборов данных масштабе является невыполнимой задачей. Хотя возможно обучить системы ИИ для автоматического описания видео, все же необходимы многие примеры, созданные человеком, в качестве эталонных данных для разнообразия и покрытия.
Более того,几乎 каждая текущая модель видеоописания на основе ИИ работает со скоростью 1 кадр в секунду, что не является достаточно плотной скоростью захвата для различения изменений во многих сценариях: внезапных микро-выражений для систем распознавания эмоций; быстрых событий в высокоскоростных видах спорта, таких как баскетбол; резких движений; быстрых смен кадров в драматических фильмах, где системы, такие как PySceneDetect, могут не распознать их (или не используются); и во многих других сценариях, где окно внимания должно быть более интенсивным.
Нажмите, чтобы воспроизвести. Быстрое, но жизненно важное действие в одном из самых медленных видов спорта, когда Алекс Хиггинс выигрывает чемпионат мира против Рэя Риардона в 1982 году. Источник: https://www.youtube.com/watch?v=_1PuqKno_Ok
Двигаться быстро и ломать логические связи
Эта низкая скорость является стандартом по различным логистическим причинам. Во-первых, видеоописание является ресурсоемкой деятельностью, будь то система, изучающая один кадр за раз, или использующая различные методы для семантического согласования последовательности кадров в интерпретируемую последовательность описаний. В любом случае окно контекста неизбежно ограничено аппаратными ограничениями.
Другой причиной того, что 1 кадр в секунду является текущим стандартом, является то, что видео обычно не наполнены быстрыми событиями; поэтому избыточным является уделять 300 кадрам статичного стола для снукера то же внимание, что и секунде, когда забитый черный шар выигрывает чемпионат (см. пример выше).
Возможно использовать более широкие вторичные подсказки для определения ключевых моментов в видео спорта, такие как устойчивая реакция толпы на быстрый слэм-данк в баскетбольной игре. Однако такие подсказки могут возникать по другим причинам (например, неожиданные травмы игроков), и на них нельзя полагаться. Это один из примеров того, как неправильно помеченный видеодатасет может привести к генеративной видеомодели, которая галлюцинирует или неправильно интерпретирует инструкции, т.е. потому что модель может показать травму игрока, когда ее просят сгенерировать слэм-данк (потому что ‘вторичная подсказка’ волнения толпы не была исключительной для одного конкретного типа события).
Это в многих отношениях ‘бюджетная’ проблема, и в других отношениях это процедурная проблема. Рамки до сих пор работали на принципе, что разреженные ключевые кадры могут эффективно захватить важную информацию, но это более эффективно для установления жанра и других аспектов предмета видео, поскольку доказательства в этом случае сохраняются в течение нескольких кадров.
F-16
Новая статья из Китая предлагает решение в виде первой многомодальной большой языковой модели (MLLM или просто LLM), которая может анализировать видео со скоростью 16 кадров в секунду вместо стандартной скорости 1 кадр в секунду, избегая при этом основных недостатков увеличения скорости анализа.
В испытаниях авторы утверждают, что новая система, озаглавленная F-16, превосходит проприетарные модели последнего поколения, такие как GPT-4o и Google’s Gemini-1.5 pro. Хотя другие текущие модели смогли сравниться или превзойти результаты F-16 в испытаниях, конкурирующие модели были намного больше и неуклюже.
Хотя F-16 была обучена на некоторых серьезных аппаратных средствах (как мы рассмотрим далее), вывод обычно намного менее требователен, чем обучение. Следовательно, мы можем надеяться, что код (обещанный для выпуска в ближайшем будущем) сможет работать на средних или высокоуровневых домашних видеокартах.
Что необходимо для жизнеспособности сцены хобби (и это включает в себя профессиональную сцену VFX, большую часть времени), так это видеомодель описания, подобная этой, которая может работать, возможно, квантованная, на потребительских системах, чтобы вся генеративная видеосцена не перешла на API-основанные коммерческие системы или не заставила потребителей подключать локальные рамки к коммерческим онлайн-сервисам GPU.
За пределами масштабирования
Авторы отмечают, что этот подход является практической альтернативой масштабированию наборов данных. Можно также сделать вывод, что если бы вы собирались бросить больше данных на проблему, этот подход все равно был бы предпочтительным, поскольку новая система различает события более детальным образом.
Они заявляют:
‘Низкая скорость кадров может привести к потере критической визуальной информации, особенно в видео с быстро меняющимися сценами, сложными деталями или быстрым движением. Кроме того, если ключевые кадры пропущены, но модель обучена на метках, которые полагаются на информацию ключевых кадров, она может испытывать трудности с выравниванием своих прогнозов с ожидаемым содержанием, что потенциально может привести к галлюцинациям и ухудшению производительности…
‘… F-16 достигает лучшей производительности в общем видео-вопросе среди моделей подобного размера и демонстрирует явное преимущество в понимании видео с высокой скоростью кадров, превосходя проприетарные модели, такие как GPT-4o. Эта работа открывает новые направления для продвижения понимания видео с высокой скоростью кадров в исследованиях многомодальных LLM.’
Новая статья озаглавлена Улучшение понимания видео LLM с 16 кадрами в секунду и исходит от восьми авторов из Университета Цинхуа и ByteDance.
Метод
Поскольку последовательные кадры часто содержат избыточную информацию, F-16 применяет высокоскоростной выравниватель для сжатия и кодирования ключевых деталей движения, сохраняя при этом визуальные семантики. Каждый кадр сначала обрабатывается предварительно обученным кодировщиком изображений, извлекающим представления функций перед тем, как быть переданным в выравниватель на основе линейных единиц ошибки Гаусса (GELU).

Архитектура F-16 обрабатывает видео со скоростью 16 кадров в секунду, захватывая больше кадров, чем традиционные модели с низкой скоростью кадров, и ее высокоскоростной выравниватель сохраняет визуальные семантики, эффективно кодируя динамику движения без добавления лишних визуальных токенов. Источник: https://arxiv.org/pdf/2503.13956
Для эффективной обработки увеличенного количества кадров F-16 группирует кадры в небольшие окна обработки, объединяя визуальные функции с помощью трехслойного перцептрона (MLP), что помогает сохранить только наиболее актуальные детали движения, уменьшая при этом ненужное дублирование, сохраняя при этом временной поток действий. Слой пространственного макс-пулинга дополнительно сжимает количество токенов, сохраняя вычислительные затраты в пределах.
Обработанные видеотокены затем передаются в Qwen2-7B LLM, которая генерирует текстовые ответы на основе извлеченных визуальных функций и заданного пользователем запроса.
Создавая входные видеоданные таким образом, F-16 позволяет, как утверждают авторы, более точное распознавание событий в динамических сценах, сохраняя при этом эффективность.
Краткая версия
F-16 расширяет предварительно обученную модель LLM изображений, LLaVA-OneVision, для обработки видео, преобразуя свою визуальную входную трубу. Хотя стандартные модели LLM изображений обрабатывают отдельные кадры, высокоскоростной выравниватель F-16 переформатирует несколько кадров в форму, которую модель может более эффективно обработать; это избегает перегрузки системы избыточной информацией, сохраняя при этом ключевые сигналы движения, необходимые для точного понимания видео.
Для обеспечения совместимости с основой, основанной на изображениях, F-16 повторно использует предварительно обученные параметры, перестраивая свой выравниватель в подматрицы. Этот подход позволяет ей интегрировать знания из моделей отдельных кадров, адаптируясь к последовательному входу видео.
Выравниватель сначала сжимает последовательности кадров в формат, оптимизированный для LLM, сохраняя при этом наиболее информативные функции и отбрасывая ненужные детали. Проектирование архитектуры позволяет системе обрабатывать видео с высокой скоростью кадров, сохраняя при этом вычислительные требования под контролем, что, по мнению авторов, является доказательством того, что масштабирование не является единственным (или лучшим) способом продвижения видеоописания.
Вариация темпа
Поскольку обработка видео со скоростью 16 кадров в секунду улучшает понимание движения, но увеличивает вычислительные затраты, особенно во время вывода, F-16 вводит декодирование с переменной скоростью кадров, позволяя ей регулировать скорость кадров динамически без повторного обучения.

Одиночный кадр и высокоскоростной выравниватель, доступные для F-16.
Эта гибкость позволяет модели работать эффективно на более низких скоростях кадров, когда высокая точность не требуется, и снижает вычислительные затраты.
Во время тестирования, когда выбрана более низкая скорость кадров, F-16 повторно использует ранее обученные параметры выравнителя, повторяя входные кадры для соответствия ожидаемым размерам. Это гарантирует, что модель может по-прежнему обрабатывать видео эффективно без изменения своей архитектуры.
В отличие от наивного дownsampling (т.е. просто удаления кадров), который рискует потерять критические детали движения, этот метод сохраняет обученные представления движения выравнителя, сохраняя точность даже на уменьшенных скоростях кадров. Для общего понимания видео более низкая скорость кадров может ускорить вывод без значительной потери производительности, в то время как анализ высокоскоростного движения все еще может использовать полную возможность 16 кадров в секунду.
Данные и испытания
Созданная на основе Qwen2-7B, FP-16 расширяет LLaVA-OneVision, используя SigLIP в качестве кодировщика изображений. С видеокадрами, отобранными со скоростью 16 кадров в секунду, можно получить до 1 760 кадров из каждого видео. Для более длинных видеоклипов кадры были равномерно (т.е. более редко) отобраны.
Для обучения F-16 использовала те же общие видеодатасеты, что и LLaVA-Video, включая LLaVA-Video-178K, NExT-QA, ActivityNet-QA и PerceptionTest.
F-16 также была дообучена на высокоскоростных спортивных датасетах FineGym, Diving48 и SoccerNet. Авторы также курировали коллекцию из 276 игр НБА, сыгранных между 13 и 25 ноября 2024 года, фокусируясь на том, был ли бросок успешным (задача, требующая высокоскоростной обработки).
Модель была оценена с помощью тестового набора NSVA, а производительность измерялась с помощью F1-оценки.
Модели гимнастики и прыжков в воду оценивались по точности распознавания событий, в то время как модели футбола и баскетбола отслеживали передачи и исходы бросков.
Модель была обучена в течение 1 эпохи с использованием 128 NVIDIA H100 GPU (и при стандартных 80 ГБ видеопамяти на GPU это потребовало использования 10,24 терабайт видеопамяти; даже по современным стандартам это самый высокопроизводительный кластер GPU, с которым я лично столкнулся, следя за литературой компьютерного зрения). Скорость обучения 2×10⁻⁵ использовалась во время обучения.
Кроме того, LoRA была дообучена на спортивных данных, используя адаптеры LoRA с 64 GPU в течение 5 эпох. Здесь только LLM была обучена, оставив кодировщик изображений замороженным.
Конкурирующие рамки, протестированные в первом раунде для ‘общего понимания видео’, были GPT-4o; Gemini-1.5-Pro; Qwen2-VL-7B; VideoLLaMA2-7B; VideoChat2-HD-7B; LLaVA-OV-7B; MiniCPM-V2.6-8B; LLaVA-Video-7B; и NVILA-7B;
Модели были оценены на Video-MME; VideoVista; TemporalBench; MotionBench; Next-QA; MLVU; и LongVideoBench.

Сравнение результатов видео-вопросов среди моделей, показывающее ограничения скорости кадров и производительность на нескольких тестах. F-16 достигает лучшей производительности среди 7B-моделей на Video-MME, NQA, TPB и MB, соперничая с проприетарными моделями, такими как GPT-4o и Gemini-1.5-Pro.
Из этих результатов авторы заявляют:
‘На наборах данных Video-MME Short, Medium и NeXT-QA — каждый из которых предназначен для понимания коротких видео — наша модель превосходит предыдущую 7B-модель лучшей производительности на 3,2%, 1,0% и 0,9% по точности, подчеркивая ее сильную производительность на коротких видео.
‘Для тестов, оценивающих понимание длинных видео, таких как Video-MME Long, LongVideoBench и MLVU, задача более сложна из-за более редкого отбора кадров, что вызывает более значительные вариации внутри окна обработки.
‘Это увеличивает сложность для модального выравнителя эффективно кодировать временные изменения внутри ограниченного представления токенов. В результате F-16 испытывает небольшое снижение производительности по сравнению с [LLaVA-Video-7B], которая обучена на том же видеодатасете.’
Высокоскоростная обработка F-16, продолжают авторы, также привела к улучшению на 13,5% на TemporalBench и на 2,5% на MotionBench по сравнению с существующими 7B-моделями и показала производительность на уровне с проприетарными моделями, такими как GPT-4o и Gemini-1.5-Pro.
Понимание высокоскоростных спортивных видео
F-16 была протестирована на FineGym, Diving48, SoccerNet и NBA-датасетах для оценки ее способности понимать высокоскоростные спортивные действия.
Используя 10 000 вручную аннотированных NBA-клипов, обучение фокусировалось на движении мяча и действиях игроков и на том, могут ли модели правильно определить, был ли бросок успешным, используя тестовый набор NSVA, оцененный по F1-оценке.

Результаты анализа высокоскоростных спортивных видео. F-16 с высокоскоростным выравнивателем показала лучшие результаты, чем ее аналог с низкой скоростью кадров, во всех спортивных задачах. GPT-4o и Gemini-1.5-Pro также были оценены на NBA и SoccerNet QA, где не требовалось знание области.
На FineGym, который измеряет распознавание действий в гимнастике, F-16 показала результат на 13,8% лучше, чем предыдущая 7B-модель лучшей производительности, демонстрируя улучшенное понимание тонкого движения.
Diving48 требовала определения сложных последовательностей движений, таких как фазы взлета, сальто, скручивания и полета, и F-16 показала более высокую точность в распознавании этих переходов.
Для SoccerNet модель анализировала 10-секундные клипы, определяя передачи мяча, и результаты показали улучшение по сравнению с существующими 7B-моделями, указывая на то, что более высокая частота кадров способствует отслеживанию небольших и быстрых движений.
В NBA-датасете способность F-16 определять исходы бросков приблизилась к точности более крупных проприетарных моделей, таких как GPT-4o и Gemini-1.5-Pro, что еще больше свидетельствует о том, что более высокая частота кадров улучшает ее способность обрабатывать динамическое движение.
Переменная скорость кадров
F-16 была протестирована на разных скоростях кадров для измерения ее адаптивности. Вместо повторного обучения она обрабатывала более низкие скорости кадров, повторяя кадры для соответствия структуре входа выравнителя. Этот подход сохранил больше производительности, чем простое удаление кадров (которое склонно вызывать потерю точности).
Результаты показывают, что, хотя снижение скорости кадров оказало некоторое влияние на распознавание движения, F-16 все еще превосходила модели с низкой скоростью кадров и показала сильные результаты даже ниже 16 кадров в секунду.

Слева, время, затраченное на разные модули F-16 во время вывода, измеренное на 300 видео из набора Video-MME Long с разными тестовыми скоростями кадров и длиной последовательности. Справа, сравнение производительности Video-MME для моделей, обученных и протестированных на разных скоростях кадров. Сплошная линия представляет модели, обученные и протестированные на той же скорости кадров, в то время как пунктирная линия показывает производительность, когда модель, обученная на 16 кадрах в секунду, протестирована на более низкой скорости кадров.
Высокоскоростная обработка F-16 увеличила вычислительные требования, хотя ее выравниватель помогла управлять этими затратами, сжимая избыточные визуальные токены.
Модель требовала больше операций, чем модели с более низкими скоростями кадров, но также достигла лучшей точности на токен, что предполагает, что ее стратегии выбора кадров и сжатия токенов помогли компенсировать дополнительные вычисления.
Заключение
Трудно переоценить либо важность, либо сложность этого конкретного направления исследований — особенно в этом году, который обещает стать прорывным годом для генеративного видео, подчеркивающим недостатки видеодатасетов и качества описаний резко.
Также следует подчеркнуть, что проблемы, связанные с получением точных описаний внутренних деталей видео, не могут быть решены исключительно за счет бросания VRAM, времени или дискового пространства на проблему. Метод, с помощью которого события изолируются/извлекаются из иначе длинных и скучных отрывков видео (как, например, видеоклипы гольфа или снукера), будет выиграть от переосмысления семантических подходов и механизмов, в настоящее время доминирующих в решениях последнего поколения — потому что некоторые из этих ограничений были установлены в более ресурсо-ограниченные времена.
(Между прочим, даже если 16 кадров в секунду кажется очень низкой скоростью кадров для 2025 года, интересно отметить, что это также родная скорость обучения видеоклипов, используемых в популярной модели генеративного видео Wan 2.1, и скорость, с которой она поэтому работает с наименьшими проблемами. Надеюсь, исследовательская сцена будет следить за возможной ‘энтропией стандартов’ здесь; иногда устаревшие ограничения могут увековечить будущие стандарты)
Опубликовано в среду, 19 марта 2025 года












