Взгляд Anderson
Путь к лучшему редактированию видео на основе ИИ

Сектор исследований синтеза видео/изображений регулярно производит архитектуры редактирования видео, и за последние девять месяцев такие выпуски стали еще более частыми. Однако большинство из них представляют собой только инкрементальные улучшения состояния искусства, поскольку основные проблемы значительны.
Однако новое сотрудничество между Китаем и Японией на этой неделе дало несколько примеров, которые заслуживают более близкого изучения подхода, даже если это не обязательно является новаторской работой.
В видеоклипе ниже (с сайта проекта, который, будьте предупреждены, может нагрузить ваш браузер) мы видим, что хотя возможности глубокого подделывания системы отсутствуют в текущей конфигурации, система хорошо выполняет задачу изменения идентичности молодой женщины на картинке на основе видеомаски (внизу слева):
Нажмите, чтобы воспроизвести. На основе семантической сегментации маски, визуализированной в нижнем левом углу, исходная (в верхнем левом углу) женщина преобразуется в заметно другую личность, хотя этот процесс не достигает обмена идентичностью, указанной в подсказке. Источник: https://yxbian23.github.io/project/video-painter/ (Обратите внимание, что на момент написания эта автоматически воспроизводящаяся и видеозаполненная страница склонна вызывать сбой моего браузера). Пожалуйста, обратитесь к исходным видео, если вы можете получить к ним доступ, для лучшего разрешения и детализации или проверьте примеры на странице проекта в обзорном видео на https://www.youtube.com/watch?v=HYzNfsD3A0s
Такой тип редактирования на основе маски хорошо установлен в статических латентных диффузионных моделях, используя инструменты như ControlNet. Однако поддержание согласованности фона в видео намного более сложно, даже когда маскированные области предоставляют модели творческую гибкость, как показано ниже:
Нажмите, чтобы воспроизвести. Изменение вида, с новым методом VideoPainter. Пожалуйста, обратитесь к исходным видео, если вы можете получить к ним доступ, для лучшего разрешения и детализации или проверьте примеры на странице проекта в обзорном видео на https://www.youtube.com/watch?v=HYzNfsD3A0s
Авторы новой работы рассматривают свой метод в отношении архитектуры BrushNet от Tencent, а также ControlNet, обе из которых представляют собой двузначную архитектуру, способную изолировать генерацию фона и переднего плана.
Однако применение этого метода напрямую к подходу Diffusion Transformers (DiT), предложенному OpenAI’s Sora, представляет определенные проблемы, как отмечают авторы.
‘[Прямое] применение [архитектуры BrushNet и ControlNet] к видео DiT представляет несколько проблем: [Во-первых, учитывая] видео DiT имеет прочную генеративную основу и большой размер модели, повторение полной/полу-гигантской структуры видео DiT в качестве контекстного кодировщика было бы ненужным и вычислительно запрещенным.
‘[Во-вторых, в отличие от] чисто свертывающей контрольной ветви BrushNet, токены в маскированных областях DiT несут информацию о фоне из-за глобального внимания, что усложняет различие между маскированными и немаскированными областями в структуре DiT.
‘[Наконец,] ControlNet не имеет впрыска функций во все слои, что препятствует плотному контролю фона для задач инпейтинга.’
Следовательно, исследователи разработали подход в виде двузначной рамки, озаглавленной VideoPainter.
VideoPainter предлагает двузначную рамку для инпейтинга видео, которая улучшает предварительно обученные DiT с помощью легкого контекстного кодировщика. Этот кодировщик составляет всего 6% параметров структуры, что, по мнению авторов, делает подход более эффективным, чем традиционные методы.
Модель предлагает три ключевых инновации: упрощенный двухслойный контекстный кодировщик для эффективного руководства фона; система интеграции функций, выбирающей маску, которая разделяет маскированные и немаскированные токены; и техника ресэмплирования идентификатора области инпейтинга, которая поддерживает согласованность идентичности на протяжении длинных видеопоследовательностей.
Замораживая как предварительно обученный DiT, так и контекстный кодировщик, и вводя ID-адаптер, VideoPainter обеспечивает, что токены области инпейтинга из предыдущих клипов сохраняются на протяжении всего видео, уменьшая мерцание и несоответствия.
Рамка также предназначена для совместимости в стиле “подключи и воспользуйся”, позволяя пользователям интегрировать ее без проблем в существующие рабочие процессы генерации и редактирования видео.
Для поддержки работы, которая использует CogVideo-5B-I2V в качестве своего генеративного движка, авторы отобрали то, что они утверждают, является крупнейшим набором данных для инпейтинга видео на сегодняшний день. озаглавленный VPData, коллекция состоит из более 390 000 клипов, общая продолжительность видео составляет более 886 часов. Они также разработали связанную рамку бенчмаркинга, озаглавленную VPBench.
Нажмите, чтобы воспроизвести. Из примеров на сайте проекта мы видим возможности сегментации, обеспечиваемые коллекцией VPData и набором тестов VPBench. Пожалуйста, обратитесь к исходным видео, если вы можете получить к ним доступ, для лучшего разрешения и детализации или проверьте примеры на странице проекта в обзорном видео на https://huggingface.co/spaces/THUDM/CogVideoX-5B-Space
Новая работа озаглавлена VideoPainter: Инпейтинг и редактирование видео любой длины с помощью контекстного управления в стиле “подключи и воспользуйся”, и исходит от семи авторов из Tencent ARC Lab, Китайского университета Гонконга, Университета Токио и Университета Макао.
Помимо упомянутого сайта проекта, авторы также выпустили более доступный обзор на YouTube, а также страницу на Hugging Face.
Метод
Конвейер сбора данных для VPData состоит из сбора, аннотации, разделения, выбора и подписи:
Схема конвейера сбора данных. Источник: https://huggingface.co/TencentARC/VideoPainter
Используемые источники для этой компиляции были взяты из Videvo и Pexels, с первоначальным объемом около 450 000 видео.
Множество библиотек и методов составили этап предварительной обработки: фреймворк Recognize Anything использовался для открытия видеотегирования, задача которого заключалась в определении основных объектов; Grounding Dino использовался для обнаружения ограничивающих рамок вокруг определенных объектов; и фреймворк Segment Anything Model 2 (SAM 2) использовался для уточнения этих грубых выборов в высококачественные маски сегментации.
Для управления переходами сцены и обеспечения согласованности в инпейтинге видео VideoPainter использует PySceneDetect для определения и сегментации клипов на естественных точках разрыва, избегая разрывных сдвигов, часто вызванных отслеживанием одного и того же объекта с нескольких углов. Клипы были разделены на 10-секундные интервалы, а все, что было короче шести секунд, было выброшено.
Для выбора данных были применены три критерия фильтрации: эстетическое качество, оцененное с помощью Laion-Aesthetic Score Predictor; сила движения, измеренная с помощью оптического потока с помощью RAFT; и безопасность контента, подтвержденная с помощью Safety Checker от Stable Diffusion.
Одним из основных ограничений существующих наборов данных для сегментации видео является отсутствие подробных текстовых аннотаций, которые необходимы для руководства генеративными моделями:
[caption id="attachment_213690" align="alignnone" width="710"]Следовательно, процесс курирования данных VideoPainter включает ведущие модели видения-языка, включая CogVLM2 и Chat GPT-4o для генерации подписей на основе ключевых кадров и подробных описаний маскированных областей.
VideoPainter улучшает предварительно обученные DiT, вводя пользовательский легкий контекстный кодировщик, который отделяет извлечение контекста фона от генерации переднего плана, видимого в верхнем правом углу иллюстративной схемы ниже:

Концептуальная схема VideoPainter. Контекстный кодировщик VideoPainter обрабатывает шумные латенты, маскированные видео-латенты и маски через VAE, интегрируя только токены фона в предварительно обученный DiT, чтобы избежать двусмысленности. Адаптер ID Resample обеспечивает согласованность идентичности, конкатенируя токены маскированных областей во время обучения и ресэмплируя их из предыдущих клипов во время вывода.
Вместо того, чтобы обременять структуру повторной обработкой, этот кодировщик работает на упрощенном входе: комбинации шумного латента, маскированного видео-латента (извлеченного через вариационный автоэнкодер, или VAE) и маски, уменьшенной до размера.
Шумный латент обеспечивает контекст генерации, а маскированный видео-латент соответствует существующему распределению DiT, стремясь улучшить совместимость.
Вместо дублирования больших секций модели, что, по мнению авторов, произошло в предыдущих работах, VideoPainter интегрирует только первые два слоя DiT. Эти извлеченные функции повторно вводятся в замороженный DiT в структурированном, групповом порядке – функции ранних слоев информируют первую половину модели, а более поздние функции уточняют вторую половину.
Кроме того, механизм, выбирающий токены, обеспечивает, что только функции, связанные с фоном, повторно интегрируются, предотвращая путаницу между маскированными и немаскированными областями. Этот подход, по мнению авторов, позволяет VideoPainter поддерживать высокую точность сохранения фона, одновременно улучшая эффективность инпейтинга переднего плана.
Авторы отмечают, что предлагаемый ими метод поддерживает различные методы стилизации, включая самый популярный, Low Rank Adaptation (LoRA).
Данные и тесты
VideoPainter был обучен с помощью модели CogVideo-5B-I2V, а также ее эквивалента текст-видео. Отобранная коллекция VPData использовалась в размере 480x720px, при скорости обучения 1×10-5.
Адаптер ID Resample был обучен в течение 2000 шагов, а контекстный кодировщик – в течение 80 000 шагов, оба с помощью оптимизатора AdamW. Обучение проводилось в два этапа с использованием 64 NVIDIA V100 GPU (хотя в статье не указано, имели ли они 16 ГБ или 32 ГБ видеопамяти).
Для бенчмаркинга использовался Davis для случайных масок, а также собственный VPBench для масок на основе сегментации.
Набор данных VPBench включает объекты, животных, людей, пейзажи и различные задачи и охватывает четыре действия: добавить, удалить, изменить и поменять. Коллекция включает 45 видео по 6 секунд и 9 видео, продолжительность которых в среднем составляет 30 секунд.
Было использовано восемь метрик. Для сохранения маскированных областей авторы использовали Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); Structural Similarity Index (SSIM); и Mean Absolute Error (MAE).
Для выравнивания текста исследователи использовали CLIP Similarity как для оценки семантического расстояния между подписью клипа и его фактическим воспринимаемым содержанием, так и для оценки точности маскированных областей.
Для оценки общего качества выходных видео использовалось Fréchet Video Distance (FVD).
Для количественного сравнения инпейтинга видео авторы противопоставили свою систему предыдущим подходам ProPainter, COCOCO и Cog-Inp (CogVideoX). Тест состоял в инпейтинге первого кадра клипа с помощью моделей инпейтинга изображений, а затем использовании модели изображение-видео (I2V) для распространения результатов в латентную операцию смешивания, в соответствии с методом, предложенным в статье 2023 года из Израиля.
Поскольку сайт проекта не полностью функционален на момент написания, а обзорный видеоролик проекта может не включать все примеры, втиснутые в сайт проекта, довольно сложно найти видео-примеры, которые очень конкретно соответствуют результатам, изложенным в статье. Поэтому мы покажем частичные статические результаты, представленные в статье, и закроем статью некоторыми дополнительными видео-примерами, которые мы смогли извлечь из сайта проекта.
Количественное сравнение VideoPainter и ProPainter, COCOCO и Cog-Inp на VPBench (маски на основе сегментации) и Davis (случайные маски). Метрики охватывают сохранение маскированных областей, выравнивание текста и качество видео. Красный = лучший, синий = второй лучший.
Из этих качественных результатов авторы комментируют:
‘В сегментации VPBench ProPainter и COCOCO демонстрируют худшую производительность по большинству метрик, в основном из-за неспособности инпейтинга полностью маскированных объектов и трудности архитектуры с одним хребтом в балансировании сохранения фона и генерации переднего плана.’
‘В бенчмарке случайных масок Davis ProPainter показывает улучшение, используя частичную информацию о фоне. Однако VideoPainter достигает оптимальной производительности на сегментации (стандартной и длинной длины) и случайных масках благодаря своей двузначной архитектуре, которая эффективно декуплирует сохранение фона и генерацию переднего плана.’
Авторы затем представляют статические примеры качественных тестов, из которых мы представляем выбор ниже. Во всех случаях мы направляем читателя на сайт проекта и видео на YouTube для лучшего разрешения.
Сравнение с методами инпейтинга в предыдущих фреймворках.
Нажмите, чтобы воспроизвести. Примеры, сконкатенированные нами из видео “результатов” на сайте проекта.
В отношении этого качественного раунда для инпейтинга видео авторы комментируют:
‘VideoPainter последовательно демонстрирует исключительные результаты в согласованности видео, качестве и выравнивании с текстовой подписью. Заметно, что ProPainter не может сгенерировать полностью маскированные объекты, поскольку он зависит только от пропагации пикселей фона, а не от генерации. ‘
‘Хотя COCOCO демонстрирует базовую функциональность, он не может поддерживать согласованную идентичность в инпейтинговых областях (несоответствующие виды судов и внезапные изменения местности) из-за своей архитектуры с одним хребтом, пытающейся сбалансировать сохранение фона и генерацию переднего плана. ‘
‘Cog-Inp достигает базовых результатов инпейтинга; однако его операция смешивания не может обнаружить границы масок, что приводит к значительным артефактам. ‘
‘Более того, VideoPainter может генерировать согласованные видео, превышающие одну минуту, сохраняя при этом согласованность идентичности через наш ID ресэмплинг.’
Исследователи также протестировали способность VideoPainter дополнять подписи и получать улучшенные результаты этим методом, противопоставив систему UniEdit, DiTCtrl и ReVideo.
Результаты редактирования видео против трех предыдущих подходов.
Авторы комментируют:
‘Для стандартных и длинных видео в VPBench VideoPainter достигает превосходной производительности, даже превосходя конечный подход ReVideo. Этот успех можно отнести к его двузначной архитектуре, которая обеспечивает отличное сохранение фона и генерацию переднего плана, сохраняя при этом высокую точность в неотредактированных областях, а также обеспечивая, что отредактированные области тесно соответствуют инструкциям по редактированию, дополненным инпейтингом области ID ресэмплинга, который поддерживает согласованность идентичности в длинных видео.’
Хотя статья представляет статические качественные примеры для этой метрики, они не очень информативны, и мы направляем читателя на разнообразные примеры, разбросанные по различным видео, опубликованным для этого проекта.
Наконец, было проведено исследование с участием людей, в котором тридцать пользователей были приглашены оценить 50 случайно выбранных генераций из VPBench и подмножества редактирования. Примеры подчеркивали сохранение фона, выравнивание с подсказкой и общее качество видео.
Результаты исследования с участием людей для VideoPainter.
Авторы утверждают:
‘VideoPainter значительно превосходит существующие базовые модели, достигая более высоких показателей предпочтения по всем критериям оценки в обоих задачах.’
Они признают, однако, что качество генераций VideoPainter зависит от базовой модели, которая может испытывать трудности с сложным движением и физикой; и они отмечают, что оно также работает плохо с низкокачественными масками или несоответствующими подписями.
Заключение
VideoPainter, кажется, является ценным дополнением к литературе. Типично для недавних решений, однако, оно имеет значительные требования к вычислениям. Кроме того, многие примеры, выбранные для представления на сайте проекта, очень далеки от лучших примеров; было бы интересно увидеть, как эта рамка будет противостоять будущим участникам и более широкому кругу предыдущих подходов.
* Стоит отметить, что ‘редактирование видео’ в этом смысле не означает ‘сборку различных клипов в последовательность’, что является традиционным значением этого термина; а скорее прямое изменение или некоторое изменение внутреннего содержания существующих видеоклипов с помощью методов машинного обучения
Опубликовано в понедельник, 10 марта 2025 года. Обновлено в субботу, 25 июля 2026 года, чтобы заменить видео.












