Взгляд Anderson

Генерация лучшего видео ИИ из двух изображений

mm
Добавьте Unite.AI в избранные источники в Google
Images from the accompanying YouTube video for the paper 'Framer: Interactive Frame Interpolation'. Source: https://www.youtube.com/watch?v=4MPGKgn7jRc

Интерполяция кадров видео (VFI) – это открытая проблема в области генеративного видео. Задача состоит в том, чтобы сгенерировать промежуточные кадры между двумя существующими кадрами в видеопоследовательности.

Нажмите, чтобы воспроизвести. Фреймворк FILM, разработанный совместно с Google и Университетом Вашингтона, предложил эффективный метод интерполяции кадров, который остается популярным среди хоббиистов и профессионалов. Слева мы видим два отдельных и различных кадра, наложенных друг на друга; в середине – “конечный кадр”; и справа – окончательная синтез между кадрами. Источники: https://film-net.github.io/ и https://arxiv.org/pdf/2202.04901

В широком смысле, этот метод восходит к более чем столетию назад и использовался в традиционной анимации с тех пор. В этом контексте мастер-кадры генерировались главным художником-аниматором, а задача “твининга” промежуточных кадров выполнялась другими сотрудниками как более рутинная задача.

До появления генеративного ИИ интерполяция кадров использовалась в проектах, таких как Real-Time Intermediate Flow Estimation (RIFE), Depth-Aware Video Frame Interpolation (DAIN) и фреймворк Google Frame Interpolation for Large Motion (FILM – см. выше) для увеличения частоты кадров существующего видео или создания искусственных эффектов замедленного движения. Это достигается путем разделения существующих кадров клипа и генерации оценочных промежуточных кадров.

VFI также используется при разработке лучших видеокодеков и, более generally, в системах, основанных на оптическом потоке (включая генеративные системы), которые используют предварительные знания о будущих ключевых кадрах для оптимизации и формирования интерстициального контента, предшествующего им.

Конечные кадры в генеративных видеосистемах

Современные генеративные системы, такие как Luma и Kling, позволяют пользователям указать начальный и конечный кадр и могут выполнять эту задачу, анализируя ключевые точки в двух изображениях и оценивая траекторию между двумя изображениями.

Как мы видим в примерах ниже, предоставление “закрывающего” ключевого кадра лучше позволяет генеративной видеосистеме (в данном случае Kling) сохранять такие аспекты, как идентичность, даже если результаты не идеальны (особенно при больших движениях).

Нажмите, чтобы воспроизвести. Kling – одна из растущего числа генераторов видео, включая Runway и Luma, которые позволяют пользователю указать конечный кадр. В большинстве случаев минимальное движение приведет к наиболее реалистичным и наименее ошибочным результатам. Источник: https://www.youtube.com/watch?v=8oylqODAaH8

В вышеприведенном примере идентичность человека последовательна между двумя заданными пользователем ключевыми кадрами, что приводит к относительно последовательной генерации видео.

Когда предоставляется только начальный кадр, окно внимания генеративной системы обычно не достаточно велико, чтобы “вспомнить”, как выглядел человек в начале видео. Скорее, идентичность, скорее всего, изменится немного с каждым кадром, пока не будет потеряна вся подобие. В примере ниже был загружен начальный образ, и движение человека руководствовалось текстовым промптом:

Нажмите, чтобы воспроизвести. Без конечного кадра Kling имеет только небольшую группу непосредственно предыдущих кадров, чтобы руководить генерацией следующих кадров. В случаях, когда требуется значительное движение, это приводит к сильному ухудшению идентичности.

Мы видим, что сходство актера не устойчиво к инструкциям, поскольку генеративная система не знает, как он будет выглядеть, если он будет улыбаться, и он не улыбается в семенном изображении (единственном доступном справочнике).

Большинство вирусных генеративных клипов тщательно отбираются, чтобы преуменьшить эти недостатки. Однако прогресс временно последовательных генеративных видеосистем может зависеть от новых разработок в исследовательском секторе в отношении интерполяции кадров, поскольку единственной возможной альтернативой является зависимость от традиционного CGI в качестве управляющего, “руководящего” видео (и даже в этом случае последовательность текстуры и освещения в настоящее время трудно достижима).

Кроме того, медленно-итеративный характер получения нового кадра из небольшой группы недавних кадров делает это очень трудным достичь больших и смелых движений. Это связано с тем, что объект, движущийся быстро через кадр, может перейти из одной стороны в другую в течение одного кадра, в отличие от более постепенных движений, на которых система, скорее всего, была обучена.

Аналогично, значительное и смелое изменение позы может привести не только к сдвигу идентичности, но и к ярким несоответствиям:

Нажмите, чтобы воспроизвести. В этом примере из Luma запрошенное движение, кажется, не хорошо представлено в обучающих данных.

Framer

Это приводит нас к интересной недавней статье из Китая, которая утверждает, что достигла нового состояния искусства в аутентичной интерполяции кадров – и которая является первой в своем роде, предлагающей взаимодействие на основе перетаскивания для пользователя.

Framer позволяет пользователю направлять движение с помощью интуитивного интерфейса на основе перетаскивания, хотя он также имеет режим “автоматического” режима. Источник: https://www.youtube.com/watch?v=4MPGKgn7jRc

Приложения, основанные на перетаскивании, стали частыми в литературе в последнее время, поскольку исследовательский сектор борется за предоставление инструментариев для генеративных систем, которые не основаны на достаточно грубых результатах, полученных с помощью текстовых промптов.

Новая система, озаглавленная Framer, может не только следовать за пользователем, управляемым перетаскиванием, но также имеет более традиционный режим “автопилота”. Кроме традиционного твининга, система способна производить симуляции тайм-лапса, а также морфинг и новые виды входного изображения.

Промежуточные кадры, сгенерированные для симуляции тайм-лапса в Framer. Источник: https://arxiv.org/pdf/2410.18978

Промежуточные кадры, сгенерированные для симуляции тайм-лапса в Framer. Источник: https://arxiv.org/pdf/2410.18978

Что касается производства новых видов, Framer немного пересекается с территорией нейронных радиационных полей (NeRF) – хотя требует только двух изображений, тогда как NeRF обычно требует шести или более изображений.

В тестах Framer, основанный на модели генеративного видео Stable Video Diffusion от Stability.ai, смог превзойти приближенные подходы соперников в пользовательском исследовании.

На момент написания статьи код должен быть выпущен на GitHub. Видеопримеры (из которых приведены выше изображения) доступны на сайте проекта, и исследователи также выпустили видео на YouTube.

Новая статья называется Framer: Interactive Frame Interpolation, и исходит от девяти исследователей из Университета Чжэцзяна и группы Alibaba.

Метод

Framer использует интерполяцию на основе ключевых точек в любом из своих двух режимов, при котором входное изображение оценивается для базовой топологии, и “движимые” точки назначаются при необходимости. По сути, эти точки эквивалентны ориентирам лица в системах, основанных на идентификации, но обобщаются на любую поверхность.

Исследователи настроили Stable Video Diffusion (SVD) на наборе данных OpenVid-1M, добавив дополнительную возможность синтеза последнего кадра. Это облегчает механизм управления траекторией (в правом верхнем углу схемы ниже), который может оценить путь к конечному кадру (или от него).

Схема для Framer.

Схема для Framer.

Что касается добавления условия последнего кадра, авторы заявляют:

‘Чтобы сохранить визуальный приоритет предварительно обученной SVD как можно больше, мы следуем парадигме условности SVD и вводим условия конечного кадра в латентном пространстве и семантическом пространстве соответственно.

‘Конкретно, мы соединяем VAE-кодированную латентную функцию первого кадра [кадра] с шумной латентной функцией первого кадра, как это было сделано в SVD. Кроме того, мы соединяем латентную функцию последнего кадра, zn, с шумной латентной функцией конечного кадра, учитывая, что условия и соответствующие шумные латенты пространственно выровнены.

‘Кроме того, мы извлекаем вложение изображения CLIP первого и последнего кадров отдельно и соединяем их для инъекции функции перекрестного внимания.’

Для функциональности на основе перетаскивания модуль траектории использует фреймворк CoTracker, возглавляемый Meta Ai, который оценивает множество возможных путей вперед. Эти пути затем сокращаются до 1-10 возможных траекторий.

Полученные координаты точек затем преобразуются с помощью методологии, вдохновленной архитектурами DragNUWA и DragAnything. Это дает гауссовское тепловое карту, которая индивидуализирует целевые области для движения.

Затем данные передаются в механизмы условности ControlNet, системы соответствия, первоначально разработанной для Stable Diffusion, и с тех пор адаптированной для других архитектур.

Для режима “автопилота” первоначальное совпадение функций осуществляется с помощью SIFT, который интерпретирует траекторию, которую можно передать в механизм автоматического обновления, вдохновленный DragGAN и DragDiffusion.

Схема для оценки траектории точки в Framer.

Схема для оценки траектории точки в Framer.

Данные и тесты

Для дообучения Framer были заморожены пространственные внимание и остаточные блоки, и только временные внимание и остаточные блоки были затронуты.

Модель была обучена в течение 10 000 итераций под AdamW, с скоростью обучения 1e-4 и размером партии 16. Обучение проходило на 16 GPU NVIDIA A100.

Поскольку предыдущие подходы к этой проблеме не предлагают редактирование на основе перетаскивания, исследователи решили сравнить режим “автопилота” Framer с стандартной функциональностью более старых предложений.

Тестируемые фреймворки для категории текущих систем генерации видео на основе диффузии были LDMVFI; Dynamic Crafter; и SVDKFI. Для “традиционных” видеосистем соперничающими фреймворками были AMT; RIFE; FLAVR; и упомянутый выше FILM.

Кроме пользовательского исследования, тесты проводились на наборах данных DAVIS и UCF101.

Качественные тесты можно оценить только объективными возможностями исследовательской команды и пользовательскими исследованиями. Однако статья отмечает, что традиционные количественные метрики в основном не подходят для данного предложения:

‘[Метрики восстановления] такие как PSNR, SSIM и LPIPS не могут точно уловить качество интерполированных кадров, поскольку они наказывают другие правдоподобные результаты интерполяции, которые не выровнены с исходным видео по пикселям.

‘Хотя метрики генерации, такие как FID, предлагают некоторое улучшение, они все еще не оправдывают ожиданий, поскольку не учитывают временную последовательность и оценивают кадры в изоляции.’

Несмотря на это, исследователи провели качественные тесты с помощью нескольких популярных метрик:

Количественные результаты для Framer по сравнению с соперничающими системами.

Количественные результаты для Framer по сравнению с соперничающими системами.

Авторы отмечают, что, несмотря на то, что шансы были против них, Framer все же достигает лучшего балла FVD среди протестированных методов.

Ниже приведены образцы результатов статьи для качественного сравнения:

Качественное сравнение с предыдущими подходами.

Качественное сравнение с предыдущими подходами. Пожалуйста, обратитесь к статье для лучшего разрешения, а также видеорезультатов на https://www.youtube.com/watch?v=4MPGKgn7jRc.

Авторы комментируют:

‘[Наш] метод производит значительно более четкие текстуры и естественное движение по сравнению с существующими методами интерполяции. Он работает особенно хорошо в сценариях с существенными различиями между входными кадрами, где традиционные методы часто не могут интерполировать контент точно.

‘По сравнению с другими методами, основанными на диффузии, такими как LDMVFI и SVDKFI, Framer демонстрирует лучшую адаптивность к сложным случаям и предлагает лучший контроль.’

Для пользовательского исследования исследователи собрали 20 участников, которые оценили 100 случайно упорядоченных видеорезультатов из различных методов, протестированных. Таким образом, было получено 1000 оценок, оценивающих наиболее “реалистичные” предложения:

Результаты пользовательского исследования.

Результаты пользовательского исследования.

Как можно видеть из графика выше, пользователи подавляющим большинством голосов предпочли результаты Framer.

Сопровождающее видео проекта на YouTube видео очерчивает некоторые потенциальные другие применения Framer, включая морфинг и карикатурное промежуточное анимирование – где вся концепция началась.

Вывод

Трудно переоценить, насколько важна эта задача в настоящее время для генерации видео на основе ИИ. На данный момент старые решения, такие как FILM и (не-ИИ) EbSynth, использовались как любительскими, так и профессиональными сообществами для твининга между кадрами; но эти решения имеют значительные ограничения.

Из-за неискреннего подбора официальных примеров видео для новых фреймворков T2V существует широкое общественное заблуждение, что системы машинного обучения могут точно вывести геометрию в движении без помощи механизмов управления, таких как 3D-модели (3DMM) или другие вспомогательные подходы, такие как LoRAs.

Чтобы быть честным, твининг сам по себе, даже если бы он мог быть идеально выполнен, составляет только “хак” или обман над этой проблемой. Тем не менее, поскольку часто легче произвести два хорошо выровненных кадра, чем обеспечить управление с помощью текстовых промптов или текущего диапазона альтернатив, хорошо видеть итеративный прогресс в ИИ-основанной версии этого старого метода.

Опубликовано впервые во вторник, 29 октября 2024 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai