Модели и платформы ИИ
Приготовление повествовательной последовательности для генерации длинных видео

Недавний публичный выпуск модели генеративного ИИ Hunyuan Video усилил продолжающиеся обсуждения о потенциале крупных многомодальных моделей зрения и языка для создания целых фильмов.
Однако, как мы ранее отметили, это очень отдаленная перспектива на данный момент, по нескольким причинам. Одна из них – очень короткое окно внимания большинства генераторов видео ИИ, которые испытывают трудности в поддержании последовательности даже в коротком отдельном кадре, не говоря уже о серии кадров.
Другая заключается в том, что последовательные ссылки на видеоконтент (такие как исследуемые среды, которые не должны меняться случайно, если вы повторно проходите через них) могут быть достигнуты в моделях диффузии только с помощью методов настройки, таких как низкоранговая адаптация (LoRA), что ограничивает возможности базовых моделей.
Следовательно, эволюция генеративного видео, кажется, готова застопориться, если не будут разработаны новые подходы к повествовательной последовательности.
Рецепт последовательности
С учетом этого нового сотрудничества между США и Китаем предложил использовать инструкционные видеоролики по приготовлению пищи в качестве возможного шаблона для будущих систем повествовательной последовательности.
Нажмите, чтобы воспроизвести. Проект VideoAuteur систематизирует анализ частей процесса приготовления, чтобы произвести новый датасет с тонкими подписями и метод оркестровки для генерации видеороликов по приготовлению пищи. Обратитесь к источнику для лучшего разрешения. Источник: https://videoauteur.github.io/
Названный VideoAuteur, работа предлагает двухэтапный конвейер для генерации инструктивных видеороликов по приготовлению пищи, используя согласованные состояния, объединяющие ключевые кадры и подписи, достигая лучших результатов в – признанных – подписанных пространствах.
Страница проекта VideoAuteur также включает несколько более привлекательных видеороликов, которые используют тот же метод, такой как предложенный трейлер для (несуществующего) кроссовера Marvel/DC:
Нажмите, чтобы воспроизвести. Два супергероя из альтернативных вселенных сталкиваются в фальшивом трейлере от VideoAuteur. Обратитесь к источнику для лучшего разрешения.
На странице также представлены аналогичные промо-видео для несуществующего сериала Netflix об животных и рекламного ролика Tesla (TSLA ).
При разработке VideoAuteur авторы экспериментировали с различными функциями потерь и другими новыми подходами. Чтобы разработать рецепт генерации инструкций, они также курировали CookGen, самый большой датасет, ориентированный на область приготовления пищи, представляющий 200 000 видеоклипов со средней продолжительностью 9,5 секунд.
В среднем 768,3 слова на видео CookGen – это комфортно самый обширно аннотированный датасет своего рода. Различные модели зрения/языка были использованы, среди других подходов, чтобы обеспечить, что описания были такими подробными, актуальными и точными, как это возможно.
Видеоролики по приготовлению пищи были выбраны, потому что инструкции по приготовлению пищи имеют структурированное и недвусмысленное повествование, что делает аннотацию и оценку более легкой задачей. Кроме порнографических видеороликов (которые, вероятно, войдут в это пространство раньше, чем позже), трудно придумать любой другой жанр, который был бы так визуально и повествовательно “формульным”.
Авторы заявляют:
‘Наш предложенный двухэтапный автoregressive конвейер, который включает в себя длинного повествовательного директора и визуально-условную генерацию видео, демонстрирует перспективные улучшения в семантической последовательности и визуальной верности в сгенерированных длинных повествовательных видео.
Через эксперименты на нашем датасете мы наблюдаем улучшения в пространственной и временной ко-герентности через видеопоследовательности.
‘Мы надеемся, что наша работа может облегчить дальнейшие исследования в области генерации длинных повествовательных видео.’
Новая работа названа VideoAuteur: Towards Long Narrative Video Generation, и исходит от восьми авторов из Университета Джонса Хопкинса, ByteDance и ByteDance Seed.
Курирование датасета
Чтобы разработать CookGen, который питает двухэтапную генеративную систему для производства видеороликов ИИ по приготовлению пищи, авторы использовали материал из коллекций YouCook и HowTo100M. Авторы сравнивают масштаб CookGen с предыдущими датасетами, ориентированными на повествовательное развитие в генеративном видео, такими как Flintstones dataset, Pororo карикатурный датасет, StoryGen, StoryStream Tencent и VIST.

Сравнение изображений и длины текста между CookGen и ближайшими наиболее населенными аналогичными датасетами. Источник: https://arxiv.org/pdf/2501.06173
CookGen фокусируется на реальных повествованиях, особенно на процедурных действиях, таких как приготовление пищи, предлагая более ясные и легче аннотируемые истории по сравнению с датасетами на основе комиксов. Он превышает самый большой существующий датасет, StoryStream, с 150-кратным количеством кадров и 5-кратной плотностью текстовых описаний.
Исследователи настроили модель подписи с использованием методологии LLaVA-NeXT в качестве базы. Псевдо-метки автоматического распознавания речи (ASR), полученные для HowTo100M, были использованы в качестве “действий” для каждого видео, а затем уточнены дальнейшим использованием больших языковых моделей (LLM).
Например, ChatGPT-4o был использован для создания датасета подписей и был попросен сосредоточиться на взаимодействиях между субъектами и объектами (таких как руки, обрабатывающие кухонные принадлежности и пищу), атрибутах объектов и временных динамиках.
Поскольку сценарии ASR, вероятно, содержат неточности и являются общими “шумными”, Пересечение-над-Объединением (IoU) было использовано в качестве метрики для измерения того, насколько близко подписи соответствовали части видео, которую они адресовали. Авторы отмечают, что это было крайне важно для создания повествовательной последовательности.
Отобранные клипы были оценены с использованием Fréchet Video Distance (FVD), который измеряет расхождение между реальными примерами (реальным миром) и сгенерированными примерами, как с ключевыми кадрами, так и без них, что привело к результату:

Использование FVD для оценки расстояния между видео, сгенерированными с новыми подписями, как с ключевыми кадрами, так и без них.
Дополнительно клипы были оценены как GPT-4o, так и шестью человеческими аннотаторами, следующими LLaVA-Hound‘s определению “галлюцинации” (т. е. способности модели изобретать вымышленный контент).
Исследователи сравнили качество подписей с Qwen2-VL-72B коллекцией, получив немного улучшенный результат.

Сравнение оценок FVD и оценок человека между Qwen2-VL-72B и коллекцией авторов.
Метод
Генеративная фаза VideoAuteur разделена между Длинным повествовательным директором (LND) и визуально-условной моделью генерации видео (VCVGM).
LND генерирует последовательность визуальных вложений или ключевых кадров, которые характеризуют повествовательный поток, подобно “эссенциальным моментам”. VCVGM генерирует видеоклипы на основе этих выборов.

Схема конвейера обработки VideoAuteur. Длинный повествовательный директор делает подходящие выборы, чтобы передать Seed-X-управляемому генеративному модулю.
Авторы обширно обсуждают различные достоинства переплетенного директора изображения-текста и языково-ориентированного директора ключевых кадров и заключают, что первый является более эффективным подходом.
Переплетенный директор изображения-текста генерирует последовательность, переплетая токены текста и визуальные вложения, используя автoregressive модель для прогнозирования следующего токена на основе объединенного контекста как текста, так и изображений. Это обеспечивает плотную связь между визуальными и текстовыми элементами.
Напротив, языково-ориентированный директор ключевых кадров синтезирует ключевые кадры, используя тексто-условную модель диффузии, основанную только на подписях, без включения визуальных вложений в процесс генерации.
Исследователи обнаружили, что, хотя языково-ориентированный метод генерирует визуально привлекательные ключевые кадры, он лишен последовательности между кадрами, утверждая, что переплетенный метод достигает более высоких оценок в реализме и визуальной последовательности. Они также обнаружили, что этот метод лучше учитывает реалистичный визуальный стиль через обучение, хотя иногда с некоторыми повторяющимися или шумными элементами.
Необычно, в исследовательской ветви, доминирующей в области Stable Diffusion и Flux, авторы использовали 7-миллиардный многомодальный LLM-фонд модель SEED-X Tencent для своего генеративного конвейера (хотя эта модель использует Stability.ai’s SDXL выпуск Stable Diffusion для ограниченной части своей архитектуры).
Авторы заявляют:
‘В отличие от классического конвейера Image-to-Video (I2V), который использует изображение в качестве начального кадра, наш подход использует [регрессированные визуальные латенты] в качестве непрерывных условий на протяжении всей [последовательности].
‘Кроме того, мы улучшаем устойчивость и качество сгенерированных видео, адаптируя модель для обработки шумных визуальных вложений, поскольку регрессированные визуальные латенты могут быть не идеальными из-за ошибок регрессии.’
Хотя типичные визуально-условные генеративные конвейеры этого типа часто используют начальные ключевые кадры в качестве начальной точки для руководства модели, VideoAuteur расширяет этот парадигму, генерируя многочастные визуальные состояния в семантически когерентном латентном пространстве, избегая потенциального предвзятости, основанной на использовании только “начальных кадров” для дальнейшей генерации.

Схема использования визуальных состояний вложений в качестве более лучшего метода условирования.
Тесты
В соответствии с методами SeedStory, исследователи используют SEED-X для применения настройки LoRA на их повествовательном датасете, загадочно описывая результат как “Sora-подобную модель”, предварительно обученную на больших масштабных видео/текстовых связях и способную принимать как визуальные, так и текстовые подсказки и условия.
32 000 повествовательных видео были использованы для разработки модели, с 1000 отложенными в качестве образцов проверки. Видео были обрезаны до 448 пикселей на короткой стороне, а затем обрезаны до 448x448px.
Для обучения генерация повествования оценивалась в основном на валидационном наборе YouCook2. Набор Howto100M был использован для оценки качества данных и также для генерации изображения в видео.
Для визуального условного потерь авторы использовали диффузионные потери из DiT и 2024 работы, основанной вокруг Stable Diffusion.
Чтобы доказать свою точку зрения о том, что переплетение является лучшим подходом, авторы противопоставили VideoAuteur нескольким методам, которые полагаются исключительно на текстовый ввод: EMU-2, SEED-X, SDXL и FLUX.1-schnell (FLUX.1-s).

Учитывая глобальную подсказку, ‘Пошаговое руководство по приготовлению мапо тофу’, переплетенный директор генерирует действия, подписи и вложения изображений последовательно, чтобы рассказать процесс. Первые два ряда показывают ключевые кадры, декодированные из пространств латентности EMU-2 и SEED-X. Эти изображения реалистичны и последовательны, но менее отполированы, чем те, которые из продвинутых моделей, таких как SDXL и FLUX.
Авторы заявляют:
‘Языково-ориентированный подход, использующий модели текст-изображение, производит визуально привлекательные ключевые кадры, но страдает от отсутствия последовательности между кадрами из-за ограниченного взаимного информационного содержания. Напротив, метод переплетенного генерации использует языково-выровненные визуальные латенты, достигая реалистичного визуального стиля через обучение.
‘Однако он иногда генерирует изображения с повторяющимися или шумными элементами, поскольку автoregressive модель борется за создание точных вложений в один проход.’
Оценка человека подтверждает еще больше утверждение авторов о лучшей производительности переплетенного подхода, с переплетенными методами, достигающими высших оценок в опросе.

Сравнения подходов из проведенного исследования.
Однако мы отмечаем, что языково-ориентированные подходы достигают лучших эстетических оценок. Авторы утверждают, однако, что это не является центральной проблемой в генерации длинных повествовательных видео.
Нажмите, чтобы воспроизвести. Сегменты, сгенерированные для видео по приготовлению пиццы, с помощью VideoAuteur.
Вывод
Самый популярный исследовательский поток, касающийся этой проблемы, т. е. повествовательной последовательности в генерации длинных видео, связан с отдельными изображениями. Проекты этого типа включают DreamStory, StoryDiffusion, TheaterGen и ConsiStory NVIDIA.
В某ком смысле VideoAuteur также попадает в эту ‘статическую’ категорию, поскольку он использует семенные изображения, из которых генерируются секции клипов. Однако переплетение видео и семантического контента приближает процесс к практической трубопроводной линии.
Опубликовано впервые в четверг, 16 января 2025 года












