Моделі та платформи ШІ
Приготування рецепту для наративної послідовності у генерації довгих відео

Нещодавнє публічне випускання моделі генерації відео Hunyuan інтенсифікувало триваючі дискусії про потенціал великих багатомодальних моделей бачення-мови створити повністю фільми.
Однак, як ми спостерігали, це дуже віддалена перспектива на даний момент, через кілька причин. Одна з них – дуже коротке вікно уваги більшості генераторів відео штучного інтелекту, які борються за підтримання послідовності навіть у короткому окремому кадрі, не кажучи вже про серію кадрів.
Інша причина полягає в тому, що послідовні посилання на відеоконтент (наприклад, досліджувані середовища, які не повинні змінюватися випадково, якщо ви повторно проходите через них) можуть бути досягнуті тільки в моделях дифузії за допомогою технік налаштування, таких як низькорангове адаптування (LoRA), що обмежує можливості базових моделей.
Отже, еволюція генерації відео, здається, зупиниться, якщо не будуть розроблені нові підходи до наративної послідовності.
Рецепт для послідовності
З цим на увазі, нове співробітництво між США і Китаєм запропонувало використання інструктивних відеороликів з приготуванням як можливого шаблону для майбутніх систем наративної послідовності.
Натисніть, щоб відіграти. Система VideoAuteur систематизує аналіз частин процесів приготування, щоб створити новий датасет із ретельними підписами та методом генерації відеороликів з приготуванням. Дивіться джерельний сайт для кращої роздільності. Джерело: https://videoauteur.github.io/
Названа VideoAuteur, ця робота пропонує двостадійний процес генерації інструктивних відеороликів з приготуванням, використовуючи узгоджені стани, що поєднують ключові кадри та підписи, досягнувши найкращих результатів у цій галузі.
Сторінка проекту VideoAuteur також містить кілька більш привабливих відеороликів, які використовують ту ж техніку, наприклад, запропонований трейлер для фільму про зустріч двох супергероїв з різних всесвітів:
Натисніть, щоб відіграти. Два супергерої з різних всесвітів зустрічаються у фальшивому трейлері від VideoAuteur. Дивіться джерельний сайт для кращої роздільності.
На сторінці також розміщені подібні промо-відеоролики для неіснуючого серіалу Netflix про тварин та рекламного ролика Tesla (TSLA ).
Під час розробки VideoAuteur автори експериментували з різними функціями втрат та іншими новими підходами. Для створення рецепту генерації інструктивних відеороликів вони також створили CookGen, найбільший датасет, зосереджений на області приготування, що містить 200 000 відеокліпів із середньою тривалістю 9,5 секунд.
У середньому 768,3 слова на відео, CookGen є найрозширенішим анотованим датасетом свого типу. Були використані різні моделі бачення-мови, серед інших підходів, щоб забезпечити, що описи були якнайбільш詳細ними, актуальними та точними.
Відеоролики з приготуванням були обрані, оскільки інструктивні відеоролики з приготування мають структуровану та недвозначну нарративну лінію, що робить анотацію та оцінку легшою задачею. Окрім порнографічних відеороликів (ймовірно, вони скоро з’являться в цьому конкретному просторі), важко уявити будь-який інший жанр, який був би так візуально та нарративно “формульним”.
Автори заявляють:
‘Наш запропонований двостадійний автoregresивний процес, який включає довгий нарративний директор та візуально-умовлену генерацію відео, демонструє перспективні покращення у семантичній послідовності та візуальній вірогідності у згенерованих довгих нарративних відео.
Через експерименти на нашому датасеті, ми спостерігаємо покращення у просторовій та часовій узгодженості через відеосеквенції.
‘Ми сподіваємося, що наша робота зможе сприяти подальшим дослідженням у генерації довгих нарративних відео.’
Нова робота називається VideoAuteur: До генерації довгих нарративних відео і походить від восьми авторів з Johns Hopkins University, ByteDance та ByteDance Seed.
Кураторство датасету
Для розробки CookGen, який живить двостадійну систему генерації відеороликів з приготуванням, автори використали матеріал з колекцій YouCook та HowTo100M.
Автори порівнюють масштаб CookGen з попередніми датасетами, зосередженими на нарративному розвитку у генерації відео, такими як датасет Flintstones, мультфільм Pororo, StoryGen, StoryStream від Tencent та VIST.

Порівняння зображень та довжини тексту між CookGen та найближчими подібними датасетами. Джерело: https://arxiv.org/pdf/2501.06173
CookGen зосереджується на реальних нарративах, особливо на процедурних діях, таких як приготування, що пропонує ясніші та легші для анотації історії порівняно з датасетами на основі коміксів.
Дослідники налаштували модель підписів, використовуючи методологію LLaVA-NeXT як базу.
Для прикладу, ChatGPT-4o був використаний для створення датасету підписів та був запитаний на фокусування на взаємодії суб’єкта-об’єкта (наприклад, руки, що обробляють посуд та їжу), атрибутах об’єкта та часових динаміках.
Поскольку скрипти автоматичного розпізнавання мови (ASR) можуть містити неточності та бути загалом “шумними”, було використано IoU як метрику для вимірювання того, наскільки підписи відповідали секції відео, яку вони адресували.
Автори зазначають, що це було важливим для створення наративної послідовності.
Відібрані кліпи були оцінені за допомогою Fréchet Video Distance (FVD), який вимірює розбіжність між реальними прикладами та згенерованими прикладами, як з ключовими кадрами, так і без них, досягнувши продуктивного результату:

Використання FVD для оцінки відстані між відео, згенерованими з новими підписами, як з використанням ключових кадрів, так і без них.
Додатково, кліпи були оцінені як GPT-4o, так і шістьма людськими аннотаторами, слідуючи визначенню “галюцинації” (тобто, здатності моделі винайти вигаданий контент).
Дослідники порівняли якість підписів з колекцією Qwen2-VL-72B, отримавши трохи покращений результат.

Порівняння оцінок FVD та оцінок людини між Qwen2-VL-72B та колекцією авторів.
Метод
Генеративна фаза VideoAuteur розділена між довгим нарративним директором (LND) та візуально-умовленою моделлю генерації відео (VCVGM).
LND генерує послідовність візуальних вкладень або ключових кадрів, які характеризують нарративний потік, подібно до “есенціальних висвітлень”. VCVGM генерує відеокліпи на основі цих виборів.

Схема процесу обробки VideoAuteur. Довгий нарративний директор робить відповідні вибори для подачі генеративному модулю, що працює на основі Seed-X.
Автори обговорюють різні переваги інтерлейованого режисера зображень-тексту та режисера ключових кадрів, що базується на мові, і роблять висновок, що перший підхід є більш ефективним.
Інтерлейований режисер зображень-тексту генерує послідовність, чергуючи токени тексту та візуальні вкладення, використовуючи автoregresивну модель для передбачення наступного токена на основі об’єднаного контексту тексту та зображень.
Натомість, режисер ключових кадрів, що базується на мові, синтезує ключові кадри, використовуючи текстово-умовлену модель дифузії, що базується лише на підписах, без включення візуальних вкладень у процес генерації.
Дослідники виявили, що хоча мовно-орієнтований метод генерує візуально привабливі ключові кадри, він не має послідовності між кадрами, стверджуючи, що інтерлейований метод досягає вищого рівня реалізму та візуальної послідовності.
Автори заявляють:
‘На відміну від класичної моделі “зображення-відео” (I2V), яка використовує зображення як початковий кадр, наш підхід використовує регресовані візуальні латенти як безперервні умови на всьому відрізку послідовності.
Крім того, ми покращуємо стійкість та якість згенерованих відео, адаптуючи модель до обробки шумових візуальних вкладень, оскільки регресовані візуальні латенти можуть бути не досконалими через помилки регресії.’
Тести
У відповідності з методами SeedStory, дослідники використовують SEED-X для застосування налаштування LoRA на їхньому нарративному датасеті, описуючи результат як “модель типу Sora”, попередньо навчену на великомасштабних відео-текстових парах, і здатну приймати як візуальні, так і текстові підказки та умови.
32 000 нарративних відео були використані для розробки моделі, із 1000, що залишилися як валідні зразки.
Для навчання генерація нарративу була оцінена головним чином на валідному датасеті YouCook2.
Для візуальної умовної втрати автори використали втрату дифузії з DiT та роботи 2024 року, заснованої на Stable Diffusion.
Щоб довести свою тезу про те, що інтерлейований підхід є кращим, автори протиставили VideoAuteur кільком методам, що використовують лише текстові вхідні дані: EMU-2, SEED-X, SDXL та FLUX.1-s.

Для глобальної підказки “Крок за кроком рецепт приготування мапо-тофу” інтерлейований режисер генерує дії, підписи та вкладення зображень послідовно, щоб оповідати процес. Перші два рядки показують ключові кадри, декодовані з латентних просторів EMU-2 та SEED-X. Ці зображення реалістичні та послідовні, але менше полішовані, ніж ті, що отримані з просунутих моделей, таких як SDXL та FLUX.
Автори заявляють:
‘Мовно-орієнтований підхід, що використовує текстово-зображенні моделі, генерує візуально привабливі ключові кадри, але страждає від відсутності послідовності між кадрами через обмежену взаємну інформацію. Натомість, інтерлейований метод генерування використовує візуальні латенти, узгоджені з мовою, досягнувши реалістичного візуального стилю через навчання.
Однак, він іноді генерує зображення з повторюваними або шумними елементами, оскільки автoregresивна модель бореться за створення точних вкладень за один прохід.’
Людська оцінка далі підтверджує твердження авторів про покращену продуктивність інтерлейованого підходу, з інтерлейованими методами, що досягають найвищих оцінок у опитуванні.

Порівняння підходів з людського дослідження, проведеного для статті.
Однак, ми відзначаємо, що мовно-орієнтовані підходи досягають найкращих естетичних оцінок. Автори стверджують, однак, що це не є центральною проблемою у генерації довгих нарративних відео.
Натисніть, щоб відіграти. Сегменти, згенеровані для відео про будівництво піци, створені VideoAuteur.
Висновок
Найпопулярніший напрямок досліджень щодо цієї проблеми, тобто наративної послідовності у генерації довгих відео, стосується окремих зображень. Проекти цього типу включають DreamStory, StoryDiffusion, TheaterGen та ConsiStory від NVIDIA.
У певному сенсі, VideoAuteur також належить до цієї “статичної” категорії, оскільки він використовує початкові зображення, з яких генеруються секції кліпів. Однак, інтерлейування відео та семантичного контенту наближає процес до практичної труби.
Перша публікація: четвер, 16 січня 2025












