Взгляд Anderson

Лучшее генеративное видео с помощью FluxFlow путем перемешивания кадров во время обучения

mm
Добавьте Unite.AI в избранные источники в Google
Adobe Firefly, various prompts and edits.

В этой неделе на Arxiv вышла новая статья, в которой рассматривается проблема, с которой столкнулись все, кто использует генераторы видео Hunyuan Video или Wan 2.1: временные аберрации, когда процесс генерации видео внезапно ускоряется, объединяет, пропускает или искажает важные моменты в сгенерированном видео:

Нажмите, чтобы воспроизвести. Некоторые из временных глюков, которые становятся знакомыми пользователям новых генеративных систем видео, выделены в новой статье. Справа показан смягчающий эффект нового подхода FluxFlow. Источник: https://haroldchen19.github.io/FluxFlow/

Видео выше содержит отрывки из примеров тестовых видео на сайте проекта для статьи. Мы можем увидеть несколько все более знакомых проблем, которые устраняются авторами метода (изображено справа в видео), который по сути является методом предобработки данных, применимым к любой архитектуре генеративного видео.

В первом примере, в котором показаны “два ребенка, играющие с мячом”, сгенерированные CogVideoX, мы видим (слева в компиляционном видео выше и в конкретном примере ниже), что родная генерация быстро прыгает через несколько важных микродвижений, ускоряя активность детей до “мультяшного” темпа. Напротив, тот же набор данных и метод дают лучшие результаты с новой техникой предобработки, называемой FluxFlow (справа от изображения в видео ниже):

Нажмите, чтобы воспроизвести.

Во втором примере (с использованием NOVA-0.6B) мы видим, что центральное движение, включающее кошку, было каким-то образом повреждено или недостаточно отобрано на этапе обучения, до такой степени, что генеративная система становится “парализованной” и не может заставить объект двигаться:

Нажмите, чтобы воспроизвести.

Этот синдром, когда движение или объект застревают, является одним из наиболее часто встречающихся проблем в HV и Wan, в различных группах синтеза изображений и видео.

Некоторые из этих проблем связаны с проблемами подписи видео в исходном наборе данных, которые мы рассмотрели на этой неделе; но авторы новой работы сосредоточили свои усилия на временных качествах обучающих данных, и представили убедительный аргумент о том, что решение проблем с этой точки зрения может дать полезные результаты.

Как упоминалось в предыдущей статье о подписи видео, определенные виды спорта особенно трудны для выделения ключевых моментов, что означает, что критические события (например, слэм-данк) не получают необходимого внимания на этапе обучения:

Нажмите, чтобы воспроизвести.

В вышеприведенном примере генеративная система не знает, как перейти к следующему этапу движения, и нерационально переходит от одной позы к другой, изменяя отношение и геометрию игрока в процессе.

Это большие движения, которые были потеряны во время обучения – но равно уязвимы и гораздо меньшие, но важные движения, такие как хлопанье крыльев бабочки:

Нажмите, чтобы воспроизвести.

В отличие от слэм-данка, хлопанье крыльев не является “редким”, а скорее постоянным и монотонным событием. Однако его последовательность теряется в процессе выборки, поскольку движение так быстро, что очень трудно установить временно.

Эти проблемы не являются особенно новыми, но они получают больше внимания сейчас, когда мощные генеративные модели видео доступны энтузиастам для локальной установки и бесплатной генерации.

Сообщества на Reddit и Discord изначально рассматривали эти проблемы как “связанные с пользователем”. Это понятное предположение, поскольку системы в вопросе очень новые и минимально документированы. Поэтому различные эксперты предложили разные (и не всегда эффективные) средства для некоторых из глюков, задокументированных здесь, таких как изменение настроек в различных компонентах различных типов ComfyUI-потоков для Hunyuan Video (HV) и Wan 2.1.

В некоторых случаях, вместо того, чтобы производить быстрое движение, как HV, так и Wan могут производить медленное движение. Предложения от Reddit и ChatGPT (который в основном использует Reddit) включают изменение количества кадров в запрошенной генерации или радикальное снижение частоты кадров*.

Это все отчаянные меры; возникающая правда заключается в том, что мы еще не знаем точной причины или точного средства для этих проблем; rõчно, что мучение настройками генерации для обхода их (особенно когда это ухудшает качество вывода, например, с слишком низкой частотой кадров) является только временным решением, и хорошо видеть, что исследовательская сцена решает возникающие проблемы так быстро.

Итак, кроме этой недели взгляда на то, как подпись влияет на обучение, давайте посмотрим на новую статью о временной регуляризации и на какие улучшения она может предложить текущей генеративной видеосцене.

Центральная идея довольно проста и незначительна, и не хуже от этого; тем не менее, статья немного заполнена, чтобы достичь предписанных восьми страниц, и мы пропустим это заполнение, когда это необходимо.

Рыба в родной генерации фреймворка VideoCrafter статична, в то время как версия, измененная с помощью FluxFlow, захватывает необходимые изменения. Источник: https://arxiv.org/pdf/2503.15417

Рыба в родной генерации фреймворка VideoCrafter статична, в то время как версия, измененная с помощью FluxFlow, захватывает необходимые изменения. Источник: https://arxiv.org/pdf/2503.15417

Новая работа называется Временная регуляризация делает ваш генератор видео сильнее, и исходит от восьми исследователей из Everlyn AI, Гонконгского университета науки и технологий (HKUST), Университета Центральной Флориды (UCF) и Университета Гонконга (HKU).

(на момент написания, есть некоторые проблемы с сопровождающим сайтом проекта)

FluxFlow

Центральная идея за FluxFlow, новой схемой предобучения, заключается в том, чтобы преодолеть широко распространенные проблемы мерцания и временной несогласованности путем перемешивания блоков и групп блоков в временных кадрах во время процесса обучения:

Центральная идея за FluxFlow заключается в том, чтобы переместить блоки и группы блоков в неожиданные и нетemporальные позиции, как forma данных.

Центральная идея за FluxFlow заключается в том, чтобы переместить блоки и группы блоков в неожиданные и нетemporальные позиции, как forma данных.

Статья объясняет:

‘[Артефакты] возникают из-за фундаментального ограничения: несмотря на использование крупномасштабных наборов данных, текущие модели часто полагаются на упрощенные временные закономерности в обучающих данных (например, фиксированные направления ходьбы или повторяющиеся переходы кадров), а не учатся разнообразным и правдоподобным временным динамикам.

‘Эта проблема еще больше усугубляется отсутствием явной временной аугментации во время обучения, оставляя модели склонными к переобучению на посторонние временные корреляции (например, “кадр #5 должен следовать за #4”) вместо обобщения на различные сценарии движения.’

Большинство моделей генерации видео, объясняют авторы, все еще слишком сильно заимствуют из синтеза изображений, фокусируясь на пространственной верности, а не на временной оси. Хотя такие методы, как обрезка, переворачивание и изменение цвета, помогли улучшить качество статических изображений, они не являются достаточными решениями, когда применяются к видео, где иллюзия движения зависит от последовательных переходов между кадрами.

Результатом являются проблемы, такие как мерцающие текстуры, резкие переходы между кадрами и повторяющиеся или слишком простые закономерности движения.

Нажмите, чтобы воспроизвести.

Статья утверждает, что хотя некоторые модели – включая Stable Video Diffusion и LlamaGen – компенсируют все более сложными архитектурами или инженерными ограничениями, это происходит за счет вычислительных ресурсов и гибкости.

Поскольку временная аугментация данных уже доказала свою полезность в задачах понимания видео (в фреймворках, таких как FineCliper, SeFAR и SVFormer) удивительно, утверждают авторы, что этот тактика редко применяется в генеративном контексте.

Дисруптивное поведение

Исследователи утверждают, что простые, структурированные нарушения временного порядка во время обучения помогают моделям лучше обобщать на реалистичные, разнообразные движения:

‘Обучаясь на расстроенных последовательностях, генератор учится восстанавливать правдоподобные траектории, эффективно регуляризируя временную энтропию. FLUXFLOW мостит разрыв между дискриминативной и генеративной временной аугментацией, предлагая решение для улучшения временной последовательности видео, сохраняя общее качество.’

‘В отличие от существующих методов, которые вводят архитектурные изменения или полагаются на постобработку, FLUXFLOW работает напрямую на уровне данных, вводя контролируемые временные нарушения во время обучения.’

Нажмите, чтобы воспроизвести.

Нарушения на уровне кадров, утверждают авторы, вводят тонкие нарушения внутри последовательности. Этот тип нарушения не отличается от маскированной аугментации, где разделы данных случайным образом блокируются, чтобы предотвратить систему переобучение на данных точках и поощрять лучшую обобщаемость.

Тесты

Хотя центральная идея здесь не требует полной статьи, из-за своей простоты, тем не менее, есть раздел тестов, который мы можем рассмотреть.

Авторы протестировали четыре запроса, связанных с улучшением временного качества, сохраняя пространственную верность; способностью учиться движению/оптическому потоку; сохранением временного качества в экстремальной генерации; и чувствительностью к ключевым гиперпараметрам.

Исследователи применили FluxFlow к трем архитектурам генерации: U-Net-основанной, в виде VideoCrafter2; DiT-основанной, в виде CogVideoX-2B; и AR-основанной, в виде NOVA-0.6B.

Для справедливого сравнения они дообучили базовые модели архитектур с FluxFlow как дополнительной фазой обучения, в течение одного эпохи, на OpenVidHD-0.4M наборе данных.

Модели были оценены по двум популярным бенчмаркам: UCF-101; и VBench.

Для UCF использовались метрики Fréchet Video Distance (FVD) и Inception Score (IS). Для VBench исследователи сосредоточились на временном качестве, кадровом качестве и общем качестве.

Количественная первоначальная оценка FluxFlow-Frame.

Количественная первоначальная оценка FluxFlow-Frame. "+ Original" указывает на обучение без FLUXFLOW, в то время как "+ Num × 1" показывает разные конфигурации FluxFlow-Frame. Лучшие результаты выделены; вторые лучшие подчеркнуты для каждой модели.

Комментируя эти результаты, авторы утверждают:

‘И FLUXFLOW-FRAME, и FLUXFLOW-BLOCK значительно улучшают временное качество, как свидетельствуют метрики в табл. 1, 2 (т.е. FVD, Subject, Flicker, Motion и Dynamic) и качественные результаты в [изображении ниже].

‘Например, движение дрейфующей машины в VC2, кошки, гоняющейся за хвостом в NOVA, и серфера, катающегося на волне в CVX, становятся заметно более жидкими с FLUXFLOW. Важно, что эти временные улучшения достигаются без жертвования пространственной верностью, как свидетельствуют резкие детали водяных брызг, дымовых следов и текстур волн, а также пространственная и общая верность метрик.’

Ниже мы видим выбор из качественных результатов, на которые ссылаются авторы (пожалуйста, посмотрите на исходную статью для полных результатов и лучшего разрешения):

Выбор из качественных результатов.

Выбор из качественных результатов.

Статья предполагает, что хотя и методы на уровне кадров, и методы на уровне блоков улучшают временное качество, методы на уровне кадров имеют тенденцию работать лучше. Это связано с их более тонкой гранулярностью, которая позволяет более точно регулировать временные параметры. Методы на уровне блоков, с другой стороны, могут ввести шум из-за тесно связанных пространственных и временных закономерностей внутри блоков, снижая их эффективность.

Вывод

Эта статья, вместе с сотрудничеством Bytedance-Tsinghua по подписи видео, вышедшим на этой неделе, сделала ясным для меня, что кажущиеся недостатками в новых генеративных моделях видео могут не быть результатом ошибок пользователей, институциональных промахов или ограничений финансирования, а скорее результатом исследовательского фокуса, который понятно отдал приоритет более срочным проблемам, таким как временная когерентность и последовательность, над этими меньшими проблемами.

До недавнего времени результаты, полученные из свободно доступных и загружаемых генеративных систем видео, были настолько компрометированы, что не возникло значительного усилия со стороны энтузиастов, чтобы решить эти проблемы (не в последнюю очередь потому, что проблемы были фундаментальными и не были тривиально разрешимыми).

Теперь, когда мы так близко к предсказанному возрасту чисто генеративного фотореалистичного видео, rõчно, что и исследовательская, и энтузиастская общины проявляют более глубокий и продуктивный интерес к решению оставшихся проблем; с удачей, эти проблемы не являются неразрешимыми препятствиями.

 

* Родная частота кадров Wan составляет всего 16 кадров в секунду, и в ответ на свои собственные проблемы я замечаю, что форумы предложили снижение частоты кадров до 12 кадров в секунду, а затем использование FlowFrames или других систем рефлоуинга на основе ИИ для интерполяции пробелов между такими скудными кадрами.

Опубликовано впервые в пятницу, 21 марта 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]