Модели и платформы ИИ
Пересечение «промежутка» в генеративном видео

Новые исследования из Китая предлагают улучшенный метод интерполяции пробела между двумя временно-удаленными кадрами видео – одной из самых важных задач в текущей гонке за реализм в генеративном видео ИИ, а также для сжатия видеокодека.
В примере видео ниже мы видим в левом столбце «стартовый» (вверху слева) и «конечный» (внизу слева) кадр. Задача, которую должны выполнить конкурирующие системы, состоит в том, чтобы угадать, как объект на двух изображениях перейдет из кадра А в кадр Б. В анимации этот процесс называется твинингом, и восходит к эпохе немого кино.
Нажмите, чтобы воспроизвести. В первом, левом столбце, мы видим предложенные стартовый и конечный кадры. В среднем столбце и в верхней части третьего (правого) столбца мы видим три предыдущих подхода к этой задаче. Внизу справа мы видим, что новый метод дает гораздо более убедительный результат при предоставлении промежуточных кадров. Источник: https://fcvg-inbetween.github.io/
Новый метод, предложенный китайскими исследователями, называется Frame-wise Conditions-driven Video Generation (FCVG), и его результаты можно увидеть в нижней части видео выше, обеспечивая плавный и логичный переход от одного статического кадра к другому.
Напротив, мы видим, что один из наиболее известных каркасов для интерполяции видео, проект Google Frame Interpolation for Large Motion (FILM), испытывает трудности, как и многие другие подобные проекты, с интерпретацией больших и смелых движений.
Два других соперничающих каркаса, визуализированных в видео, Time Reversal Fusion (TRF) и Generative Inbetweening (GI), дают менее искаженную интерпретацию, но создают френетические и даже комические танцевальные движения, ни один из которых не уважает неявную логику двух предоставленных кадров.
Нажмите, чтобы воспроизвести. Два несовершенных решения проблемы твининга. Слева, FILM рассматривает два кадра как простые морф-цели. Справа, TRF знает, что некоторая форма танца должна быть вставлена, но придумывает непрактичное решение, демонстрирующее анатомические аномалии.
Вверху слева мы можем более внимательно рассмотреть, как FILM подходит к этой задаче. Хотя FILM был разработан для обработки больших движений, в отличие от предыдущих подходов, основанных на оптическом потоке, он все еще не имеет семантического понимания того, что должно происходить между двумя ключевыми кадрами, и просто выполняет морфинг между кадрами в стиле 1980/90-х годов. FILM не имеет семантической архитектуры, такой как Latent Diffusion Model, как Stable Diffusion, чтобы помочь создать подходящий мост между кадрами.
Справа, в видео выше, мы видим усилия TRF, где Stable Video Diffusion (SVD) используется для более интеллектуального «угадывания» того, как танцевальное движение, соответствующее двум пользовательским кадрам, может быть – но оно сделало смелую и неправдоподобную аппроксимацию.
FCVG, видимый ниже, делает более достоверную работу по угадыванию движения и содержания между двумя кадрами:
Нажмите, чтобы воспроизвести. FCVG улучшает предыдущие подходы, но еще далек от совершенства.
Есть еще артефакты, такие как нежелательное морфирование рук и идентичности лица, но эта версия поверхностно наиболее правдоподобна – и любое улучшение текущего состояния дел должно быть рассмотрено в контексте огромной трудности, которую представляет собой эта задача; и великого препятствия, которое эта задача представляет для будущего видео, сгенерированного ИИ.
Почему интерполяция имеет значение
Как мы уже указали ранее, способность правдоподобно заполнить видеоконтент между двумя пользовательскими кадрами является одним из лучших способов поддержания временной последовательности в генеративном видео, поскольку два реальных и последовательных изображения одного и того же человека будут естественно содержать последовательные элементы, такие как одежда, волосы и окружающая среда.
Когда используется только один стартовый кадр, ограниченное окно внимания генеративной системы, которое часто учитывает только соседние кадры, будет склоняться к постепенному «эволюционированию» аспектов предмета, пока (например) человек не станет другим человеком (или женщиной), или окажется, что у него есть «морфированная» одежда – среди многих других отвлекающих факторов, которые обычно генерируются в открытом исходном коде T2V-системах, и в большинстве платных решений, таких как Kling:
Нажмите, чтобы воспроизвести. Feeding the new paper’s two (real) source frames into Kling, with the prompt ‘A man dancing on a roof’, did not result in an ideal solution. Though Kling 1.6 was available at the time of creation, V1.5 is the latest to support user-input start and end frames. Источник: https://klingai.com/
Решена ли проблема уже?
Напротив, некоторые коммерческие, закрытые и проприетарные системы, кажется, лучше справляются с этой задачей – в частности, RunwayML, который смог создать очень правдоподобную интерполяцию двух исходных кадров:
Нажмите, чтобы воспроизвести. Интерполяция RunwayML на основе диффузии очень эффективна. Источник: https://app.runwayml.com/
Повторив упражнение, RunwayML произвел второй, равно достоверный результат:
Нажмите, чтобы воспроизвести. Второй запуск последовательности RunwayML.
Одной из проблем является то, что мы не можем узнать ничего о проблемах, участвующих в этом процессе, и не можем продвинуть открытое состояние искусства, из-за проприетарной системы. Мы не можем знать, было ли это лучшее представление достигнуто благодаря уникальным архитектурным подходам, данным (или методам курирования данных, таким как фильтрация и аннотация), или любой комбинации этих и других возможных инноваций.
Во-вторых, небольшие компании, такие как визуальные эффекты, не могут в долгосрочной перспективе полагаться на B2B API-управляемые сервисы, которые потенциально могут подорвать их логистическое планирование с помощью единого повышения цены – особенно если одна служба придет доминировать на рынке и, следовательно, будет более склонна повышать цены.
Когда права неверны
Гораздо более важно, если хорошо работающая коммерческая модель обучена на нелицензионных данных, как, кажется, является случаем с RunwayML, любая компания, использующая такие услуги, может рисковать получить юридическую ответственность.
Поскольку законы (и некоторые судебные дела) длятся дольше, чем президенты, и поскольку важный рынок США является одним из самых судебных в мире, текущая тенденция к большему законодательному контролю за обучающими данными ИИ, кажется, вероятно, выживет «легкий подход» следующего президентского срока Дональда Трампа.
Следовательно, сектор компьютерного зрения будет вынужден решить эту проблему трудным путем, чтобы любые возникающие решения могли просуществовать в долгосрочной перспективе.
FCVG
Новый метод из Китая представлен в статье, озаглавленной Генеративное интерполяционное видео через кадровую условную видео-генерацию, и исходит из пяти исследователей из Харбинского технологического института и Тяньцзиньского университета.
FCVG решает проблему неоднозначности в задаче интерполяции, используя кадровые условия, вместе с каркасом, который определяет границы в пользовательских стартовых и конечных кадрах, что помогает процессу поддерживать более последовательный отслеживание переходов между отдельными кадрами, а также общего эффекта.
Кадровое условие включает в себя разбиение создания промежуточных кадров на подзадачи, вместо того, чтобы пытаться заполнить очень большую семантическую пустоту между двумя кадрами (и чем длиннее запрошенный видеовыход, тем больше семантическое расстояние).
На графике ниже, из статьи, авторы сравнивают вышеупомянутый метод времени-переворота (TRF) с их методом. TRF создает два пути видео-генерации, используя предварительно обученную модель изображение-видео (SVD). Один из них – «прямой» путь, обусловленный стартовым кадром, а другой – «обратный» путь, обусловленный конечным кадром. Оба пути начинаются с одного и того же случайного шума. Это проиллюстрировано в левой части изображения ниже:

Сравнение предыдущих подходов к FCVG. Источник: https://arxiv.org/pdf/2412.11755
Авторы утверждают, что FCVG является улучшением над методами времени-переворота, потому что он уменьшает неоднозначность в видео-генерации, давая каждому кадру свое явное условие, что приводит к более стабильному и последовательному выходу.
Методы времени-переворота, такие как TRF, по мнению статьи, могут привести к неоднозначности, потому что прямые и обратные пути генерации могут расходиться, вызывая несоответствия или несоответствия. FCVG решает эту проблему, используя кадровые условия, полученные из совпадающих линий между стартовым и конечным кадрами (внизу справа на изображении выше), которые направляют процесс генерации.
Нажмите, чтобы воспроизвести. Еще одно сравнение со страницы проекта FCVG.
Время-переворот позволяет использовать предварительно обученные модели видео-генерации для интерполяции, но имеет некоторые недостатки. Движение, сгенерированное моделями I2V, является разнообразным, а не стабильным. Хотя это полезно для чистых задач изображение-видео (I2V), оно создает неоднозначность и приводит к несоответствующим или не последовательным видео-путям.
Время-переворот также требует трудоемкого настройки гиперпараметров, таких как частота кадров для каждого сгенерированного видео. Кроме того, некоторые из методов, используемых в времени-перевороте для уменьшения неоднозначности, значительно замедляют вывод, увеличивая время обработки.
Метод
Авторы отмечают, что если первая из этих проблем (разнообразие против стабильности) может быть решена, все остальные последующие проблемы, вероятно, будут решены сами собой. Это было попытано в предыдущих предложениях, таких как вышеупомянутый GI, и также ViBiDSampler.
Статья гласит:
‘Тем не менее, существует значительная стохастичность между этими путями, что ограничивает эффективность этих методов при обработке сценариев, включающих большие движения, такие как быстрые изменения человеческих поз.
‘Следовательно, мы предлагаем явное условие для каждого кадра, что существенно смягчает неоднозначность пути интерполяции.’
Мы можем увидеть основные концепции FCVG в действии в схеме ниже. FCVG генерирует последовательность видеокадров, которые начинаются и заканчиваются последовательно с двумя входными кадрами. Это обеспечивает, что кадры являются временно стабильными, предоставляя кадровые условия для процесса видео-генерации.

Схема вывода FCVG.
В этом переосмыслении подхода времени-переворота метод объединяет информацию из обоих прямых и обратных направлений, смешивая их, чтобы создать плавные переходы. Через итеративный процесс модель постепенно уточняет шумовые входные данные, пока не будет сгенерирован окончательный набор промежуточных кадров.
Следующий этап включает в себя использование предварительно обученной модели GlueStick для создания соответствий между двумя рассчитанными стартовыми и конечными кадрами, с возможным использованием скелетных поз для руководства моделью через модель Stable Video Diffusion.

GlueStick получает линии из интерпретированных форм. Эти линии предоставляют совпадающие якоря между стартовым и конечным кадрами в FCVG*.
Авторы отмечают:
‘Мы эмпирически обнаружили, что линейная интерполяция достаточна для большинства случаев, чтобы гарантировать временную стабильность в промежуточных видео, и наш метод позволяет пользователям указывать нелинейные пути интерполяции для генерации желаемых видео.’

Рабочий процесс для установления прямых и обратных кадровых условий. Мы можем увидеть совпадающие цвета, которые сохраняют содержание последовательным, пока анимация развивается.
Чтобы ввести полученные кадровые условия в SVD, FCVG использует метод, разработанный для инициативы ControlNeXt 2024 года. В этом процессе контрольные условия изначально кодируются несколькими блоками ResNet, а затем происходит нормализация между ветвями условий и SVD рабочего процесса.
Небольшой набор видео используется для тонкой настройки модели SVD, при этом большинство параметров модели заморожено.
‘Упомянутые ограничения были в значительной степени решены в FCVG: (i) явно указав условие для каждого кадра, неоднозначность между прямыми и обратными путями существенно смягчается; (ii) введено только одно настраиваемое параметр, при этом гиперпараметры в SVD по умолчанию дают благоприятные результаты в большинстве сценариев; (iii) простая средняя фузия, без повторного введения шума, достаточна в FCVG, и шаги вывода можно существенно уменьшить на 50% по сравнению с [GI].’

Общая схема для введения кадровых условий в Stable Video Diffusion для FCVG.
Данные и тесты
Чтобы протестировать систему, исследователи курировали набор данных, включающий различные сцены, включая наружные среды, человеческие позы и внутренние локации, включая движения, такие как движение камеры, танцевальные действия и выражения лица, среди других. 524 клипа были выбраны из наборов данных DAVIS и RealEstate10k. Этот набор был дополнен видео с высокой частотой кадров, полученными из Pexels. Курированный набор был разделен в соотношении 4:1 между тонкой настройкой и тестированием.
Используемые метрики включали Learned Perceptual Similarity Metrics (LPIPS); Fréchet Inception Distance (FID); Fréchet Video Distance (FVD); VBench; и Fréchet Video Motion Distance.
Авторы отмечают, что ни одна из этих метрик не хорошо приспособлена для оценки временной стабильности, и ссылаются нас на видео на странице проекта FCVG.
Помимо использования GlueStick для совпадения линий, DWPose был использован для оценки человеческих поз.
Тонкая настройка прошла за 70 000 итераций под оптимизатором AdamW на GPU NVIDIA A800, с скоростью обучения 1×10-6, при этом кадры были обрезаны до фрагментов 512×320.
Соперничающие предыдущие каркасы, протестированные в работе, включали FILM, GI, TRF и DynamiCrafter.
Для количественной оценки промежутки кадров, которые были преодолены, варьировались от 12 до 23.

Количественные результаты против предыдущих каркасов.
Относительно этих результатов статья отмечает:
‘Наш метод достигает лучшей производительности среди четырех генеративных подходов по всем метрикам. Что касается сравнения LPIPS с FILM, наш FCVG немного хуже, в то время как демонстрирует лучшую производительность по другим метрикам. Учитывая отсутствие временной информации в LPIPS, возможно, более уместно будет отдать приоритет другим метрикам и визуальному наблюдению.
‘Более того, сравнивая результаты при разных промежутках кадров, FILM может работать хорошо, когда промежуток небольшой, в то время как генеративные методы более подходят для больших промежутков. Среди этих генеративных методов наш FCVG демонстрирует значительное превосходство благодаря своим явным кадровым условиям.’
Для качественного тестирования авторы произвели видео, видимые на странице проекта (некоторые встроены в эту статью), и статические и анимированные† результаты в PDF-статье,

Примеры статических результатов из статьи. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения и будьте осведомлены, что PDF содержит анимации, которые можно воспроизвести в приложениях, поддерживающих эту функцию.
Авторы комментируют:
‘Хотя FILM производит плавные результаты интерполяции для небольших движений, он испытывает трудности с большими масштабными движениями из-за внутренних ограничений оптического потока, что приводит к заметным артефактам, таким как движение фона и рук (в первом случае).
‘Генеративные модели, такие как TRF и GI, страдают от неоднозначностей в путях слияния, что приводит к нестабильному промежуточному движению, особенно заметному в сложных сценах, включающих движение человека и объекта.
‘Напротив, наш метод последовательно дает удовлетворительные результаты в различных сценариях.’ Даже когда значительное перекрытие присутствует (во втором случае и шестом случае), наш метод все еще может захватить разумное движение. Кроме того, наш подход демонстрирует устойчивость к сложным человеческим действиям (в последнем случае).’
Авторы также обнаружили, что FCVG необычно хорошо обобщается на видео в стиле анимации:
Нажмите, чтобы воспроизвести. FCVG производит очень правдоподобные результаты для анимации в стиле мультфильма.
Вывод
FCVG представляет собой, по крайней мере, инкрементальное улучшение для текущего состояния искусства в интерполяции кадров в непроприетарном контексте. Авторы сделали код для работы доступным на GitHub, хотя связанный с ним набор данных не был выпущен на момент написания.
Если проприетарные коммерческие решения превосходят открытое программное обеспечение благодаря использованию веб-скрейпинга, нелицензионных данных, то, кажется, нет будущего в таком подходе, по крайней мере, для коммерческого использования; риски просто слишком велики.
Следовательно, даже если сцена открытого программного обеспечения отстает от впечатляющей демонстрации текущих лидеров рынка, это, возможно, черепаха, которая обгонит зайца на финише.
* Источник: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf
† Требуется Acrobat Reader, Okular или любой другой читатель PDF, который может воспроизводить встроенные анимации PDF.
Опубликовано в первый раз в пятницу, 20 декабря 2024 года












