Погляд Anderson

Дорога до кращого відеомонтажу на основі штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Сектор досліджень відео/зображення регулярно виводить архітектури відеомонтажу, і за останні дев’ять місяців виходи такого типу стали ще частішими. Однак більшість з них представляють лише інкрементальні вдосконалення стану мистецтва, оскільки основні виклики суттєві.

Однак нове співробітництво між Китаєм і Японією на цій тижні дало приклади, які заслуговують на ближче вивчення підходу, навіть якщо це не обов’язково є видатною роботою.

У відеокліпі нижче (з сайту проекту, який, попередження, може завантажити ваш браузер) ми бачимо, що хоча можливості deepfaking системи відсутні в поточній конфігурації, система робить хорошу роботу з правдоподібним і суттєвим зміненням особи молодої жінки на фотографії, заснованому на відеомасці (у нижньому лівому куті):

Натисніть, щоб відтворити. На основі семантичної сегментації маски, візуалізованої у нижньому лівому куті, оригінальна (верхня ліва) жінка перетворюється на досить іншу особу, хоча цей процес не досягає заміни особи, вказаної в підказці. Джерело: https://yxbian23.github.io/project/video-painter/ (буďte обережні, оскільки на момент написання цієї статті сайт з автозапуском і відео мав тенденцію завантажувати мій браузер). Будь ласка, зверніться до джерельних відео, якщо ви можете до них доступитися, для кращої роздільності та деталізації, або перегляньте приклади на сторінці проекту на YouTube за посиланням https://www.youtube.com/watch?v=HYzNfsD3A0s

Такий тип редагування на основі маски добре встановлений у статичних моделях latenної дифузії, які використовують інструменти типу ControlNet. Однак підтримання узгодженості фону у відео значно складніше, навіть якщо масовані області надають моделі творчу гнучкість, як показано нижче:

Натисніть, щоб відтворити. Зміна виду, з новим методом VideoPainter. Будь ласка, зверніться до джерельних відео, якщо ви можете до них доступитися, для кращої роздільності та деталізації, або перегляньте приклади на сторінці проекту на YouTube за посиланням https://github.com/lllyasviel/ControlNet

Автори нової роботи розглядають свій метод у відношенні як до власної архітектури Tencent BrushNet (яку ми розглядали минулого року), так і до ControlNet, які обидва представляють двогранну архітектуру, здатну ізолювати передній план і фон генерації.

Однак застосування цього методу безпосередньо до продуктивного підходу Diffusion Transformers (DiT), запропонованого OpenAI, викликає особливі труднощі, як зазначають автори:

‘[Пряме] застосування [архітектури BrushNet і ControlNet] до відео DiT викликає кілька труднощів: [по-перше, враховуючи] Відео DiT має потужну генераційну основу та великий розмір моделі, повторення повної або половинної структури відео DiT як контекстного кодувальника було б зайвим і обчислювально недоцільним.

‘[По-друге, на відміну від] Чисто конволюційної контрольної гілки BrushNet, токени в масованих регіонах DiT містять фонову інформацію через глобальну увагу, що ускладнює розрізнення між масованими та не масованими регіонами в основі DiT.

‘[Нарешті,] ControlNet не має ін’єкції функцій через усі шари, що перешкоджає щільному контролю фону для завдань інпейнтингу.’

Отже дослідники розробили підхід типу “підключи і працюй” у вигляді двогранної структури під назвою VideoPainter.

VideoPainter пропонує двогранну структуру відеоінпейнтингу, яка покращує попередньо навчені DiT за допомогою легкого контекстного кодувальника. Цей кодувальник займає лише 6% параметрів основної структури, що, на думку авторів, робить підхід більш ефективним, ніж традиційні методи.

Модель пропонує три ключові інновації: оптимізований двошаровий контекстний кодувальник для ефективного керівництва фоном; система інтеграції функцій, яка селективно вибірково масовані та не масовані токени; і техніка ресемплінгу ідентифікатора регіону інпейнтингу, яка підтримує узгодженість ідентифікатора протягом довгих відеосеквенцій.

Заморожуючи як попередньо навчений DiT, так і контекстний кодувальник, і вводячи ID-адаптер, VideoPainter забезпечує, що токени регіону інпейнтингу з попередніх кліпів зберігаються протягом всього відео, зменшуючи мерехтіння та несумісності.

Фреймворк також розроблений для підключення та сумісності, що дозволяє користувачам безшовно інтегрувати його в існуючі відеогенераційні та редагувальні робочі процеси.

Для підтримки роботи, яка використовує CogVideo-5B-I2V як свій генеративний двигун, автори створили, як вони стверджують, найбільшу на сьогодні базу даних відеоінпейнтингу. Під назвою VPData, колекція складається з понад 390 000 кліпів, загальною тривалістю понад 886 годин. Вони також розробили пов’язану з цим бенчмарк-фреймворк під назвою VPBench.

Натисніть, щоб відтворити. З прикладів сайту проекту ми бачимо можливості сегментації, забезпечені колекцією VPData та тестовим набором VPBench. Будь ласка, зверніться до джерельних відео, якщо ви можете до них доступитися, для кращої роздільності та деталізації, або перегляньте приклади на сторінці проекту на YouTube за посиланням https://www.youtube.com/watch?v=HYzNfsD3A0s

Нова робота називається VideoPainter: Відеоінпейнтинг та редагування довільної довжини з підключенням та контролем контексту і походить від семи авторів з Tencent ARC Lab, Китайського університету Гонконгу, Токійського університету та Університету Макао.

Крім вищезгаданого сайту проекту, автори також випустили більш доступне відео-огляд на YouTube, а також сторінку на Hugging Face.

Метод

Пipeline збору даних для VPData складається з збору, анотації, розділення, вибору та підписування:

Схема pipeline збору даних. Джерело: https://arxiv.org/pdf/1706.04983.pdf

Схема pipeline збору даних. Джерело: https://huggingface.co/spaces/THUDM/CogVideoX-5B-Space

Джерельні колекції, використані для цієї компіляції, походять з Videvo та Pexels, з початковим обсягом близько 450 000 відео.

Багатьма внесками бібліотек і методів була стадія попередньої обробки: фреймворк Recognize Anything використовувався для відкритого відеотегування, призначеного для ідентифікації основних об’єктів; Grounding Dino використовувався для виявлення обмежувальних рамок навколо визначених об’єктів; і фреймворк Segment Anything Model 2 (SAM 2) використовувався для уточнення цих грубих вибірок у високоякісні сегментаційні маски.

Для управління перехідами сцен і забезпечення узгодженості у відеоінпейнтингу VideoPainter використовує PySceneDetect для ідентифікації та сегментації кліпів у природних точках розриву, уникання порушень, часто спричинених відстежуванням одного й того ж об’єкта з декількох кутів. Кліпи були розділені на 10-секундні інтервали, а все, що було коротше шести секунд, було відкинуто.

Для вибору даних застосовувалися три критерії фільтрації: естетична якість, оцінена за допомогою Laion-Aesthetic Score Predictor; сила руху, виміряна за допомогою оптичного потоку з використанням RAFT; і безпека вмісту, перевірена за допомогою Safety Checker Stable Diffusion.

Одна з основних обмежень існуючих наборів даних відеосегментації полягає в відсутності детальних текстових анотацій, які є важливими для керування генеративними моделями:

[caption id="attachment_213690" align="alignnone" width="710"]Дослідники підкреслюють відсутність відеокапціонування в порівнянних колекціях. Дослідники підкреслюють відсутність відеокапціонування в порівнянних колекціях.

Отже процес кураторства VideoPainter включає в себе провідні моделі бачення-мови, включаючи CogVLM2 та Chat GPT-4o, для генерації ключових кадрів-капціонів та детальних описів масованих регіонів.

VideoPainter покращує попередньо навчені DiT, вводячи легкий контекстний кодувальник, який розділяє витяг фону від генерації переднього плану, як видно у верхньому правому куті ілюстративної схеми нижче:

Концептуальна схема VideoPainter. Контекстний кодувальник VideoPainter обробляє шумові латентні, масштабовані маски та масовані відеолатентні через VAE, інтегруючи лише фонові токени в попередньо навчений DiT, щоб уникнути двозначності. Адаптер ID-ресемплінгу забезпечує узгодженість ідентифікатора, конкатенууючи токени масованих регіонів під час навчання та ресемплюючи їх з попередніх кліпів під час інференсу.

Концептуальна схема VideoPainter. Контекстний кодувальник VideoPainter обробляє шумові латентні, масштабовані маски та масовані відеолатентні через VAE, інтегруючи лише фонові токени в попередньо навчений DiT, щоб уникнути двозначності. Адаптер ID-ресемплінгу забезпечує узгодженість ідентифікатора, конкатенуючи токени масованих регіонів під час навчання та ресемплюючи їх з попередніх кліпів під час інференсу.

Відповідно кодувальник працює на оптимізованому вході: комбінації шумових латентних, масштабованих масок та масованих відеолатентних (вилучених за допомогою варіаційного автоенкодера, або VAE).

Шумові латентні забезпечують контекст генерації, а масовані відеолатентні узгоджуються з існуючою розподілом DiT, спрямовані на покращення сумісності.

Відповідно замість дублікування великих секцій моделі, кодувальник інтегрує лише перші два шари DiT. Ці витягнуті функції знову вводяться в заморожений DiT у структурованому, груповому порядку – ранні функції інформують першу половину моделі, тоді як пізніші функції уточнюють другу половину.

Крім того, механізм селективного токену забезпечує, що лише фоново-релевантні функції знову інтегруються, запобігаючи плутані між масованими та не масованими регіонами. Цей підхід, на думку авторів, дозволяє VideoPainter підтримувати високу вірність збереження фону, одночасно покращуючи ефективність інпейнтингу переднього плану.

Автори зазначають, що їхній метод підтримує різні стилізаційні методи, включаючи найпопулярніший, Low Rank Adaptation (LoRA).

Дані та тести

VideoPainter був навчений за допомогою моделі CogVideo-5B-I2V, разом з її текст-відео-еквівалентом. Кураторська колекція VPData використовувалася у розмірі 480x720px, з швидкістю навчання 1×10-5.

Адаптер ID-ресемплінгу був навчений протягом 2000 кроків, а контекстний кодувальник – протягом 80 000 кроків, обидва з використанням оптимізатора AdamW. Навчання проходило у два етапи з використанням 64 NVIDIA V100 GPU (хоча у статті не вказано, чи мали вони 16 ГБ або 32 ГБ відеопам’яті).

Для бенчмаркінгу використовувався Davis для випадкових масок, а власний VPBench авторів – для сегментаційних масок.

Набір даних VPBench містить об’єкти, тварин, людей, пейзажі та різні завдання, і охоплює чотири дії: додати, видалити, змінити та замінити. Колекція складається з 45 відео тривалістю 6 секунд кожне, і дев’ять відео середньою тривалістю 30 секунд.

Для процесу було використано вісім метрик. Для збереження масованих регіонів автори використовували Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); Structural Similarity Index (SSIM); і Mean Absolute Error (MAE).

Для текстової узгодженості дослідники використовували CLIP Similarity як для оцінки семантичної відстані між підказкою кліпа та його фактичним сприйняттям, так і для оцінки точності масованих регіонів.

Для оцінки загальної якості вихідних відео використовувався Fréchet Video Distance (FVD).

Для кількісного порівняння відеоінпейнтингу автори поставили свою систему проти попередніх підходів ProPainter, COCOCO та Cog-Inp (CogVideoX). Тест складався з інпейнтингу першого кадру кліпа за допомогою моделей інпейнтингу зображень, а потім використання зображення-у-відео (I2V) бекбону для пропагування результатів у латентну операцію змішування, згідно з методом, запропонованим у статті 2023 року з Ізраїлю.

Оскільки сайт проекту не зовсім функціональний на момент написання, а відео на YouTube може не містити всі приклади, закладені в сайт проекту, досить складно знайти відео приклади, які дуже конкретно відповідають результатам, описаним у статті. Тому ми покажемо часткові статичні результати, представлені в статті, і завершимо статтю додатковими відео прикладами, які ми вдалося витягнути з сайту проекту.

Кількісне порівняння VideoPainter проти ProPainter, COCOCO та Cog-Inp на VPBench (сегментаційні маски) та Davis (випадкові маски). Метрики охоплюють збереження масованих регіонів, текстову узгодженість та якість відео. Червоний = найкращий, Синій = другий найкращий.

Кількісне порівняння VideoPainter проти ProPainter, COCOCO та Cog-Inp на VPBench (сегментаційні маски) та Davis (випадкові маски). Метрики охоплюють збереження масованих регіонів, текстову узгодженість та якість відео. Червоний = найкращий, Синій = другий найкращий.

З цих якісних результатів автори коментують:

‘У сегментаційному VPBench ProPainter та COCOCO демонструють найгіршу продуктивність за більшість метрик, головним чином через нездатність інпейнтингу повністю масованих об’єктів та труднощі архітектури з одним беком у балансуванні збереження фону та генерації переднього плану відповідно.

‘У бенчмарку випадкових масок Davis ProPainter показує покращення, використовуючи часткову інформацію про фон. Однак VideoPainter досягає оптимальної продуктивності як у сегментації (стандартної та довгої довжини), так і у випадкових масках завдяки своїй двогранній архітектурі, яка ефективно роз’єднує збереження фону та генерацію переднього плану.’

Автори потім представляють статичні приклади якісних тестів, з яких ми представимо вибір нижче. У всіх випадках ми посилаємо читача на сайт проекту та відео на YouTube для кращої роздільності.

Порівняння з інпейнтинговими методами попередніх фреймворків.

Порівняння з інпейнтинговими методами попередніх фреймворків.

 

Натисніть, щоб відтворити. Приклади, сконкатеновані нами з відео “результатів” на сайті проекту.

Щодо цього якісного раунду для відеоінпейнтингу автори коментують:

‘VideoPainter постійно демонструє виняткові результати у відеоузгодженості, якості та узгодженості з текстовою підказкою. Зокрема, ProPainter не може генерувати повністю масовані об’єкти, оскільки він залежить лише від пропагації фонових пікселів, а не від генерації.

‘Хоча COCOCO демонструє базову функціональність, він не може підтримувати узгодженість ідентифікатора в інпейнтингових регіонах (несумісні появи суден та раптові зміни ландшафту) через свою архітектуру з одним беком, яка намагається балансувати збереження фону та генерацію переднього плану.

‘Cog-Inp досягає базових результатів інпейнтингу; однак його операція змішування не може виявити межі масок, що призводить до суттєвих артефактів.

‘Крім того, VideoPainter може генерувати узгоджене відео, що перевищує одну хвилину, зберігаючи узгодженість ідентифікатора через свій ID-ресемплінг.’

Дослідники також протестували здатність VideoPainter покращувати підказки та отримувати покращені результати за допомогою цього методу, поставивши систему проти UniEdit, DiTCtrl та ReVideo.

Результати відеоредагування проти трьох попередніх підходів.

Результати відеоредагування проти трьох попередніх підходів.

Автори коментують:

‘Для стандартних та довгих відео у VPBench VideoPainter досягає вищої продуктивності, навіть перевершуючи кінцевий ReVideo. Цей успіх можна віднести до його двогранної архітектури, яка забезпечує відмінне збереження фону та генерацію переднього плану, підтримуючи високу вірність у нередагованих регіонах, одночасно забезпечуючи, щоб редаговані регіони були близькими до інструкцій редагування, доповнені інпейнтинговим ID-ресемплінгом, який підтримує узгодженість ідентифікатора у довгих відео.’

Хоча стаття містить статичні приклади для цієї метрики, вони не дуже освітлюють, і ми посилаємо читача на різні приклади, поширені по відео проекту.

Нарешті, було проведено дослідження з людьми, у якому тридцять учасників були попросені оцінити 50 випадково вибраних генерацій з VPBench та підмножини редагування. Приклади підкреслювали збереження фону, узгодженість з підказкою та загальну якість відео.

Результати дослідження з людьми для VideoPainter.

Результати дослідження з людьми для VideoPainter.

Автори заявляють:

‘VideoPainter значно перевершив існуючі базові лінії, досягнувши вищої частки переваги за всією оцінкою в обох завданнях.’

Вони визнають, однак, що якість генерацій VideoPainter залежить від базової моделі, яка може боротися з складним рухом та фізикою; і вони відзначають, що вона також працює погано з низькоякісними масками чи неправильно підігнаними підказками.

Висновок

VideoPainter здається гідним доповненням до літератури. Типово для недавніх рішень, однак, він має суттєві обчислювальні вимоги. Крім того, багато прикладів, вибраних для презентації на сайті проекту, значно поступаються найкращим прикладам; тому було б цікаво побачити цей фреймворк у змаганні з майбутніми учасниками та ширшим спектром попередніх підходів.

 

* Варто зазначити, що “відеоредагування” в цьому сенсі не означає “збирання різних кліпів у послідовність”, яке є традиційним значенням цього терміну; а радше безпосередню зміну або певий спосіб модифікації внутрішнього вмісту існуючих відеокліпів за допомогою технік машинного навчання

Перша публікація понеділка, 10 березня 2025 року. Оновлено суботу, 25 липня 2026 року, щоб замінити відео.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai