Моделі та платформи ШІ

Переповнення пробілу в генеративному відео

mm
Додайте Unite.AI до бажаних джерел у Google
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

Нові дослідження з Китаю пропонують покращений метод інтерполяції пробілу між двома відеокадрами, що знаходяться на великій тимчасовій відстані – одним з найважливіших викликів у поточній гонці за реалізмом у генеративному відео з допомогою штучного інтелекту, а також для стиснення відеокодека.

У прикладному відео нижче ми бачимо в лівому стовпці “початковий” (зверху ліворуч) і “кінцевий” (знизу ліворуч) кадри. Завдання, яке повинні виконати конкуруючі системи, – вгадати, як об’єкт на двох зображеннях перейде з кадру А в кадр Б. У анімації цей процес називається твінінгом, і сходить до епохи німого кіно.

Натисніть, щоб відтворити. У першому, лівому стовпці, ми бачимо запропоновані початковий і кінцевий кадри. У середньому стовпці, і в верхній частині третього (правого) стовпця, ми бачимо три попередні підходи до цього завдання. У нижньому правому куті ми бачимо, що новий метод дає набагато більш переконливий результат у забезпеченні проміжних кадрів. Джерело: https://fcvg-inbetween.github.io/

Новий метод, запропонований китайськими дослідниками, називається Фрейм-візе умовно-кероване відео-генерування (FCVG), і його результати можна побачити у нижньому правому куті відео вище, забезпечуючи гладкий і логічний перехід від одного нерухомого кадру до іншого.

Наприклад, одна з найвідоміших рамок для інтерполяції відео, проект Frame Interpolation for Large Motion (FILM) компанії Google, бореться, як і багато інших подібних розробок, з інтерпретацією великих і сміливих рухів.

Інші два конкуруючі框и, візуалізовані у відео, Часова інверсія (TRF) і Генеративне проміжне (GI), забезпечують менш перекошену інтерпретацію, але створили френетичні і навіть комічні танцювальні рухи, жоден з яких не поважає явної логіки двох наданих кадрів.

Натисніть, щоб відтворити. Два неідеальних рішення проблеми твінінгу. Зліва, FILM обробляє два кадри як прості морфологічні цілі. Праворуч, TRF знає, що якусь форму танцю потрібно вставити, але виходить із недопустимим рішенням, яке демонструє анатомічні аномалії.

У верхньому лівому куті ми можемо ближче розглянути, як FILM підходить до цього завдання. Хоча FILM був розроблений для обробки великих рухів, на відміну від попередніх підходів, заснованих на оптичному потоці, він все ще не має семантичного розуміння того, що повинно відбуватися між двома наданими ключовими кадрами, і просто виконує морфінг між кадрами у стилі 1980/90-х років. FILM не має семантичної архітектури, такої як латентна дифузійна модель, наприклад, стабільна дифузія, щоб допомогти створити відповідний міст між кадрами.

Праворуч у відео вище ми бачимо спробу TRF, де стабільна відео-дифузія (SVD) використовується для більш інтелектуального “вгадування”, як танцювальний рух, відповідний двом наданим кадрам, міг би бути – але це зробило сміливу і недопустиму апроксимацію.

FCVG, показаний нижче, робить більш переконливу роботу з вгадуванням руху і вмісту між двома кадрами:

Натисніть, щоб відтворити. FCVG покращує попередні підходи, але все ще далекий від досконалості.

Є ще артефакти, такі як нежаданий морфінг рук і обличчя, але ця версія є поверхнево найбільш переконливою – і будь-яке покращення стану мистецтва повинно бути розглянуто проти величезної складності завдання; і великого перешкоди, який цей виклик представляє для майбутнього відео, згенерованого штучним інтелектом.

Чому інтерполяція має значення

Як ми вже зазначали раніше, можливість плідно заповнювати відео-контент між двома наданими кадрами – один з найкращих способів підтримувати часову послідовність у генеративному відео, оскільки два реальних і послідовних зображення однієї і тієї ж особи природно містять послідовні елементи, такі як одяг, волосся і середовище.

Коли використовується тільки один початковий кадр, обмежений вікно уваги генеративної системи, яке часто бере до уваги тільки сусідні кадри, буде схильний поступово “еволюціонувати” аспекти предмета, поки (наприклад) людина не стане іншою людиною (або жінкою), або виявиться, що у неї є “морфінг” одяг – серед багатьох інших розсіянь, які зазвичай генеруються у відкритих системах T2V, і в більшості платних рішень, таких як Kling:

Натисніть, щоб відтворити. Feeding the new paper’s two (real) source frames into Kling, with the prompt ‘A man dancing on a roof’, did not result in an ideal solution. Though Kling 1.6 was available at the time of creation, V1.5 is the latest to support user-input start and end frames. Джерело: https://klingai.com/

Чи вже вирішена проблема?

Натомість деякі комерційні, закриті та пропрієтарні системи здаються кращими у вирішенні цієї проблеми – особливо RunwayML, який зміг створити дуже переконливу інтерполяцію двох наданих кадрів:

Натисніть, щоб відтворити. RunwayML’s diffusion-based interpolation is very effective. Джерело: https://app.runwayml.com/

Повторивши спробу, RunwayML створив другий, рівнозначний результат:

Натисніть, щоб відтворити. The second run of the RunwayML sequence.

Одна проблема тут полягає в тому, що ми нічого не можемо дізнатися про виклики, пов’язані з цим, ні просунути відкритий стан мистецтва, з пропрієтарної системи. Ми не можемо знати, чи це краще відтворення було досягнуто завдяки унікальним архітектурним підходам, даним (або методам кураторства даних, таких як фільтрація та анотація), або будь-якої комбінації цих та інших можливих інновацій у дослідженні.

Другою проблемою є те, що менші компанії, такі як компанії візуальних ефектів, не можуть у довгостроковій перспективі залежати від B2B API-драйвених послуг, які потенційно можуть підірвати їхнє логістичне планування за допомогою одного підвищення ціни – особливо якщо одна служба прийде до домінування на ринку і, отже, буде більш схильна підвищувати ціни.

Коли права неправильні

Набагато важливіше, якщо добре виконуюча комерційна модель навчена на незаконних даних, як здається, це справедливо для RunwayML, будь-яка компанія, яка використовує такі послуги, ризикує мати юридичну відповідальність.

Відтак закони (і деякі судові рішення) тривають довше, ніж президенти, і оскільки критичний ринок США є одним з найбільш судових у світі, поточна тенденція до більшої законодавчої нагляду за навчальними даними штучного інтелекту, здається, буде продовжуватися легкий дотик наступного президентського терміну Дональда Трампа.

Отже, сектор досліджень комп’ютерного зору буде змушений вирішувати цю проблему важким шляхом, щоб будь-які майбутні рішення могли тривати у довгостроковій перспективі.

FCVG

Новий метод з Китаю представлений у документі під назвою Генеративне проміжне через фрейм-візе умовно-кероване відео-генерування, і походить від п’яти дослідників з Харбінського технологічного інституту та Тяньцзінського університету.

FCVG вирішує проблему неоднозначності у завдання інтерполяції шляхом використання фрейм-візе умов, разом із рамкою, яка виокремлює край у наданих початкових і кінцевих кадрах, що допомагає процесу зберігати більш послідовний слід переходів між окремими кадрами, а також загального ефекту.

Фрейм-візе умовування включає розбиття створення проміжних кадрів на підзадачі, а не спробу заповнити дуже великий семантичний вакуум між двома кадрами (і чим довше запрошений відеовихід, тим більша семантична відстань).

На графіці нижче, з документа, автори порівнюють вищезгаданий метод часу-обертання (TRF) з їхнім. TRF створює два відео-генеративні шляхи, використовуючи попередньо навчену модель зображення-відео (SVD). Один із них – “вперед” шлях, умовний на початковому кадрі, а інший – “назад” шлях, умовний на кінцевому кадрі. Обидва шляхи починаються з одного і того ж випадкового шуму. Це проілюстровано ліворуч від зображення нижче:

Порівняння попередніх підходів до FCVG. Джерело: https://arxiv.org/pdf/2412.11755

Порівняння попередніх підходів до FCVG. Джерело: https://arxiv.org/pdf/2412.11755

Автори стверджують, що FCVG є покращенням над методами часу-обертання, оскільки він зменшує неоднозначність у відео-генеруванні, надаючи кожному кадру свій явний стан, що призводить до більш стабільного і послідовного виходу.

Методи часу-обертання, такі як TRF, стверджує документ, можуть привести до неоднозначності, оскільки шляхи генерації вперед і назад можуть розходитися, що призводить до неправильного вирівнювання або несумісності. FCVG вирішує цю проблему, використовуючи фрейм-візе умови, отримані з відповідних ліній між початковим і кінцевим кадрами (праворуч внизу на зображенні вище), які керують процесом генерації.

Натисніть, щоб відтворити. Інше порівняння з проекту FCVG.

Час-обертання дозволяє використовувати попередньо навчені відео-генеративні моделі для інтерполяції, але має деякі недоліки. Рух, згенерований моделями зображення-відео, є різноманітним, а не стабільним. Хоча це корисно для чистих завдань зображення-відео, це створює неоднозначність і призводить до неправильного вирівнювання або несумісних шляхів відео.

Час-обертання також вимагає трудомісткого налаштування гіперпараметрів, таких як частота кадрів для кожного згенерованого відео. Крім того, деякі технік, використаних у часу-обертанні для зменшення неоднозначності, значно сповільнюють процес інференсу, збільшуючи час обробки.

Метод

Автори спостерігають, що якщо першу з цих проблем (різноманітність проти стабільності) можна вирішити, всі інші подальші проблеми, ймовірно, вирішаться самі собою. Це було спробовано у попередніх розробках, таких як вищезгаданий GI, і також ViBiDSampler.

Документ стверджує:

‘Все ж таки [існує] значна стохастичність між цими шляхами, що обмежує ефективність цих методів у xửленні сценаріїв, що включають великі рухи, такі як швидкі зміни людських поз.

‘Отже [ми] пропонуємо надати явний стан для кожного кадру, який суттєво полегшує неоднозначність шляху інтерполяції.’

Ми можемо побачити основні концепції FCVG у дії у схемі нижче. FCVG генерує послідовність відео-кадрів, які починаються і закінчуються послідовно з двох вхідних кадрів. Це забезпечує, що кадри є тимчасово стабільними, надаючи кадрові умови для процесу відео-генерування.

Схема для інференсу FCVG.

Схема для інференсу FCVG.

У цьому переосмисленні підходу часу-обертання метод поєднує інформацію з обох напрямків, змішуючи їх, щоб створити гладкі переходи. Через ітеративний процес модель поступово уточнює шумові входи, поки не буде створена остаточна сукупність проміжних кадрів.

Наступний етап включає використання попередньо навченої моделі GlueStick для створення відповідностей між двома розрахованими початковим і кінцевим кадрами, з можливим використанням скелетних поз для керування моделлю через модель стабільної відео-дифузії.

GlueStick виводить лінії з інтерпретованих форм. Ці лінії забезпечують відповідні анкери між початковим і кінцевим кадрами в FCVG*.

GlueStick виводить лінії з інтерпретованих форм. Ці лінії забезпечують відповідні анкери між початковим і кінцевим кадрами в FCVG*.

Автори відзначають:

‘Ми емпірично виявили, що лінійна інтерполяція достатня для більшості випадків, щоб гарантувати тимчасову стабільність у проміжному відео, і наш метод дозволяє користувачам вказувати нелінійні шляхи інтерполяції для генерації бажаних [відео].’

Робочий процес встановлення вперед і назад фрейм-візе умов. Ми бачимо відповідні кольори, які зберігають вміст послідовним під час розвитку анімації.

Робочий процес встановлення вперед і назад фрейм-візе умов. Ми бачимо відповідні кольори, які зберігають вміст послідовним під час розвитку анімації.

Щоб ввести отримані фрейм-візе умови в SVD, FCVG використовує метод, розроблений для ініціативи ControlNeXt 2024 року. У цьому процесі контрольні умови спочатку кодуються декількома блоками ResNet, а потім відбувається нормалізація між гілками умов і SVD у робочому процесі.

Маленька сукупність відео використовується для тонкого налаштування моделі SVD, при цьому більшість параметрів моделі заморожені.

‘[Вищезгадані обмеження] були в основному вирішені в FCVG: (i) явно вказуючи умову для кожного кадру, неоднозначність між вперед і назад шляхами суттєво полегшується; (ii) тільки один налаштований [параметр вводиться], а гіперпараметри в SVD залишаються за замовчуванням, що дає сприятливі результати у більшості сценаріїв; (iii) проста середня фузія, без повторного введення шуму, достатня в FCVG, і кроки інференсу можна суттєво зменшити на 50% порівняно з [GI].’

Широка схема введення фрейм-візе умов у стабільну відео-дифузію для FCVG.

Широка схема введення фрейм-візе умов у стабільну відео-дифузію для FCVG.

Дані та тести

Для тестування системи дослідники підготували сукупність даних, що включає різноманітні сцени, включаючи зовнішні середовища, людські пози та внутрішні місця, включаючи рухи, такі як рух камери, танцювальні дії та вирази обличчя, серед інших. 524 кліпи були вибрані з наборів даних DAVIS і RealEstate10k. Ця колекція була доповнена відео з високою частотою кадрів, отриманими з Pexels. Підготовлена сукупність була розділена у співвідношенні 4:1 між тонким налаштуванням і тестуванням.

Використані метрики: Learned Perceptual Similarity Metrics (LPIPS); Fréchet Inception Distance (FID); Fréchet Video Distance (FVD); VBench; і Fréchet Video Motion Distance.

Автори відзначають, що жодна з цих метрик не добре підходить для оцінки тимчасової стабільності, і посилаються на відео на сторінці проекту FCVG.

Крім використання GlueStick для підтримки ліній, DWPose був використаний для оцінки людських поз.

Тонке налаштування відбулося за 70 000 ітерацій під оптимізатором AdamW на GPU NVIDIA A800, з швидкістю навчання 1×10-6, з кадрами, обрізаними до патчів 512×320.

Конкурентні попередні рамки, які були протестовані, включали FILM, GI, TRF і DynamiCrafter.

Для кількісної оцінки проміжки кадрів, які були розглянуті, варіювалися від 12 до 23.

Кількісні результати проти попередніх рамок.

Кількісні результати проти попередніх рамок.

Відносно цих результатів документ відзначає:

‘[Наш] метод досягає найкращої продуктивності серед чотирьох генеративних підходів по всіх метриках. Що стосується порівняння LPIPS з FILM, наш FCVG є трохи гіршим, а в інших метриках показує кращу продуктивність. Враховуючи відсутність тимчасової інформації в LPIPS, можливо, більш підходить надавати пріоритет іншим метрикам і візуальному спостереженню.

‘Крім того, порівнюючи результати під різними проміжками кадрів, FILM може працювати добре, коли проміжок малий, а генеративні методи більш підходять для великих проміжків. Серед цих генеративних методів наш FCVG демонструє суттєву перевагу завдяки своїм явним фрейм-візе умовам.’

Для якісної оцінки автори створили відео, розміщені на сторінці проекту (декілька з яких вкладені в цю статтю), і статичні та анімовані результати у PDF-документі,

Зразкові статичні результати з документа. Будь ласка, зверніться до джерельного PDF для кращої роздільності, і будьте обізнані, що PDF містить анімації, які можна відтворити в додатках, що підтримують цю функцію.

Зразкові статичні результати з документа. Будь ласка, зверніться до джерельного PDF для кращої роздільності, і будьте обізнані, що PDF містить анімації, які можна відтворити в додатках, що підтримують цю функцію.

Автори коментують:

‘Хоча FILM виробляє гладкі результати інтерполяції для малих рухів, він бореться з великими рухами через внутрішні обмеження оптичного потоку, що призводить до помітних артефактів, таких як рух фонту і рук (у першому випадку).

‘Генеративні моделі, такі як TRF і GI, страждають від неоднозначностей у шляхах фузії, що призводить до нестабільного проміжного руху, особливо очевидного у складних сценах, що включають рух людини і об’єктів.

‘Натомість наш метод послідовно забезпечує задовільні результати у різних сценаріях.’Даже коли присутня значна окуляція (у другому випадку та шостому випадку), наш метод все ж може захопити розумний рух. Крім того, наш підхід демонструє стабільність для складних людських дій (у останньому випадку).’

Автори також виявили, що FCVG генералізується незвично добре до анімаційних відео:

Натисніть, щоб відтворити. FCVG забезпечує дуже переконливі результати для анімаційних відео у стилі мультфільмів.

Висновок

FCVG представляє хоча б інкрементальне покращення стану мистецтва у фрейм-інтерполяції у некомерційному контексті. Автори зробили код роботи доступним на GitHub, хоча пов’язану з цим сукупність даних не була випущена на момент написання.

Якщо пропрієтарні комерційні рішення перевершують відкриті зусилля за допомогою веб-скрепінгових, незаконних даних, здається, немає майбутнього в такому підході,至少 для комерційного використання; ризики просто занадто великі.

Отже, навіть якщо відкрита сцена відстає від вражаючої демонстрації поточних лідерів ринку, це, можливо, черепаха, яка обігнає зайця до фінішної лінії.

 

* Джерело: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf

Вимагає Acrobat Reader, Okular або будь-якого іншого читача PDF, який може відтворювати вкладені анімації PDF.

 

Опубліковано вперше у п’ятницю, 20 грудня 2024 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai