Погляд Anderson

Кращий генеративний AI-відео шляхом перемішування кадрів під час навчання

mm
Додайте Unite.AI до бажаних джерел у Google
Adobe Firefly, various prompts and edits.

Нова робота, опублікована цього тижня на Arxiv, розглядає проблему, з якою будь-хто, хто采用 Hunyuan Video або Wan 2.1 AI-відеогенератори, вже зіштовхнувся: темпоральні порушення, де генеративний процес схильний раптово прискорюватися, змішувати, опускати або інакше псувати важливі моменти в згенерованому відео:

Натисніть, щоб відтворити. Деякі темпоральні глюки, які стають знайомими користувачам нових генераційних відеосистем, виділені в новій роботі. Праворуч – поліпшуючий ефект нового підходу FluxFlow. Джерело: https://haroldchen19.github.io/FluxFlow/

Відео вище містить уривки з прикладних тестових відео на (обережно: досить хаотичному) сайті проекту для роботи. Ми бачимо кілька дедалі знайоміших проблем, які усуваються методом авторів (зображений праворуч у відео), який є по суті технікою попередньої обробки даних, яку можна застосувати до будь-якої генераційної відеоархітектури.

У першому прикладі, що демонструє двох дітей, які грають з м’ячем, згенерованим CogVideoX, ми бачимо (ліворуч у відео зібранні вище і в конкретному прикладі нижче), що рідна генерація швидко переходить через кілька важливих мікро-рухів, прискорюючи діяльність дітей до “мультяшного” рівня. Натомість, той же набір даних і метод дають кращі результати з новою технікою попередньої обробки, яку назвали FluxFlow (праворуч від зображення у відео нижче):

Натисніть, щоб відтворити.

У другому прикладі (з використанням NOVA-0.6B) ми бачимо, що центральний рух, що включає кота, був якимсь чином зіпсований або недостатньо вибірково взятий на етапі навчання, до того ступеня, що генераційна система стає “паралізованою” і не може змусити об’єкт рухатися:

Натисніть, щоб відтворити.

Цей синдром, коли рух або об’єкт “залишається”, є одним з найбільш часто зустрічаються проблем Hunyuan Video і Wan, у різних групах синтезу зображень і відео.

Деякі з цих проблем пов’язані з проблемами відеокапціонування в джерельному наборі даних, про які ми розглянули цього тижня; але автори нової роботи зосередили свої зусилля на темпоральних якостях тренувальних даних, і роблять переконливу аргументацію, що вирішення проблем з цієї точки зору може дати корисні результати.

Як згадувалося в попередній статті про відеокапціонування, певні спортивні заходи особливо важко відокремити в ключові моменти, що означає, що критичні події (наприклад, слем-данк) не отримують необхідної уваги на етапі навчання:

Натисніть, щоб відтворити.

У вищезгаданому прикладі генераційна система не знає, як перейти до наступної стадії руху, і переходить нелогічно з однієї пози в іншу, змінюючи ставлення і геометрію гравця в процесі.

Це великі рухи, які були втрачені під час навчання – але однаково вразливі і набагато менші, але важливі рухи, такі якмахання крил метелика:

Натисніть, щоб відтворити.

На відміну від слем-данка, махання крил не є “рідкісним”, а spíše постійним і одноманітним подією. Однак, його послідовність втрачена в процесі вибірки, оскільки рух настільки швидкий, що дуже важко встановити темпорально.

Ці проблеми не є особливо новими, але вони зараз отримують більше уваги, оскільки потужні генераційні відеомоделі доступні для ентузіастів для локальної установки і безкоштовної генерації.

Спільноти на Reddit і Discord спочатку розглядали ці проблеми як “пов’язані з користувачем”. Це зрозумісна припущення, оскільки системи, про які йдеться, дуже нові і мінімально документовані. Тому різні експерти запропонували різні (і не завжди ефективні) засоби для деяких з глюків, описаних тут, таких як зміна налаштувань у різних компонентів різноманітних типів ComfyUI-робочих процесів для Hunyuan Video (HV) і Wan 2.1.

У деяких випадках, замість швидкого руху, обидва HV і Wan можуть виробляти повільний рух. Запропоновані рішення з Reddit і ChatGPT (які в основному використовують Reddit) включають зміну кількості кадрів у запитаній генерації або радикальне зниження частоти кадрів*.

Це все віддеснюжне; виникаюча істина полягає в тому, що ми ще не знаємо точної причини або точного засобу для цих проблем; ясно, що мучення налаштуваннями генерації для обходу їх (особливо коли це погіршує якість виводу, наприклад, з занадто низькою частотою кадрів) є лише тимчасовим рішенням, і добре бачити, що дослідницька сцена звертається до цих проблем так швидко.

Отже, окрім цього тижня погляду на те, як капціонування впливає на навчання, давайте розглянемо нову роботу про темпоральну регуляризацію і які покращення вона може запропонувати поточній генераційній відеосцені.

Центральна ідея досить проста і незначна, і жодним чином не гірша за це; проте робота дещо розтягнута, щоб досягти визначених восьми сторінок, і ми пропустимо цю розтягнутість за необхідності.

Риба у рідній генерації VideoCrafter-фреймворка статична, тоді як FluxFlow-версія захоплює необхідні зміни. Джерело: https://arxiv.org/pdf/2503.15417

Риба у рідній генерації VideoCrafter-фреймворка статична, тоді як FluxFlow-версія захоплює необхідні зміни. Джерело: https://arxiv.org/pdf/2503.15417

Нова робота називається Темпоральна регуляризація робить ваш відеогенератор сильнішим, і прийшла від восьми дослідників з Everlyn AI, Гонконзького університету науки і технологій (HKUST), Університету Центральної Флориди (UCF) і Університету Гонконгу (HKU).

(на момент написання, існують деякі проблеми з супровідним сайтом проекту)

FluxFlow

Центральна ідея за FluxFlow, новою схемою попередньої обробки авторів, полягає в тому, щоб подолати поширені проблеми мерцання і темпоральної неконсистентності шляхом перемішування блоків і груп блоків у темпоральному порядку кадрів під час процесу навчання:

Центральна ідея FluxFlow полягає в тому, щоб перемістити блоки і групи блоків у несподівані і нетемпоральні позиції, як форма даних-аугментації.

Центральна ідея FluxFlow полягає в тому, щоб перемістити блоки і групи блоків у несподівані і нетемпоральні позиції, як форма даних-аугментації.

Робота пояснює:

‘[Артефакти] походять від фундаментальної обмеженості: попри використання великомасштабних наборів даних, поточні моделі часто покладаються на спрощені темпоральні закономірності у тренувальних даних (наприклад, фіксовані напрямки ходьби або повторювані переходи кадрів) а не вивченням різноманітних і правдоподібних темпоральних динамік.

‘Ця проблема ще більше загострюється відсутністю явної темпоральної аугментації під час навчання, залишаючи моделі схильними до переобучення на випадкові темпоральні кореляції (наприклад, “кадр #5 повинен слідувати за #4”) а не узагальнення по різноманітним руховим сценаріям.’

Більшість відеогенеративних моделей, пояснюють автори, все ще запозичують занадто багато з синтезу зображень, зосереджуючись на просторовій вірності, а не на темпоральному осі. Хоча техніки, такі як обрізання, переворот і зміна кольору, допомогли покращити якість статичних зображень, вони не є достатніми рішеннями, коли застосовуються до відео, де ілюзія руху залежить від послідовних переходів між кадрами.

Результатом є проблеми, такі як мерцання текстур, різкі переходи між кадрами і повторювані або过 прості рухові закономірності.

Натисніть, щоб відтворити.

Робота стверджує, що хоча деякі моделі – включаючи Stable Video Diffusion і LlamaGen – компенсують все більш складними архітектурами або інженерними обмеженнями, ці заходи здійснюються за рахунок обчислювальних ресурсів і гнучкості.

Поскольку темпоральна дані-аугментація вже довела свою корисність у відео розумінні завданнях (у рамках таких як FineCliper, SeFAR і SVFormer) дивно, що цей тактик рідко застосовується у генераційному контексті.

Нав’язливе Поведінка

Дослідники стверджують, що прості, структуровані порушення темпорального порядку під час навчання допомагають моделям узагальнювати краще до реалістичних, різноманітних рухів:

‘Навчання на розладних послідовностях, генератор вивчає відновлення правдоподібних траєкторій, ефективно регуляризуючи темпоральну ентропію. FLUXFLOW містить розрив між дискримінативною і генераційною темпоральною аугментацією, пропонуючи плаг-енд-плей рішення для темпорально правдоподібної відеогенерації, покращуючи загальну якість.

‘На відміну від існуючих методів, які вводять архітектурні зміни або покладаються на пост-процесинг, FLUXFLOW діє прямо на рівні даних, вводячи контрольовані темпоральні порушення під час навчання.’

Натисніть, щоб відтворити.

Кадрові порушення, стверджують автори, вводять тонкі порушення всередині послідовності. Це порушення не відрізняється від маскування-аугментації, де частини даних випадково блокуються, щоб запобігти системі переобученню на даних точках, і сприяти кращому узагальнюванню.

Тести

Хоча центральна ідея тут не виходить на повноцінну роботу, через свою простоту, проте є розділ тестів, який ми можемо розглянути.

Автори протестували чотири запити, пов’язані з покращенням темпоральної якості при збереженні просторової вірності; здатністю вивчати рух/оптичний потік динаміки; збереженням темпоральної якості в екстремальних умовах генерації; і чутливістю до ключових гіперпараметрів.

Дослідники застосували FluxFlow до трьох генераційних архітектур: U-Net-основаної, у вигляді VideoCrafter2; DiT-основаної, у вигляді CogVideoX-2B; і AR-основаної, у вигляді NOVA-0.6B.

Для справедливого порівняння, вони донастроїли базові моделі архітектур з FluxFlow як додатковим етапом навчання, протягом одного епохи, на OpenVidHD-0.4M наборі даних.

Моделі були оцінені проти двох популярних бенчмарків: UCF-101; і VBench.

Для UCF, було використано метрики Fréchet Video Distance (FVD) і Inception Score (IS). Для VBench, дослідники зосередилися на темпоральній якості, кадровій якості і загальній якості.

Кількісна первинна оцінка FluxFlow-Frame.

Кількісна первинна оцінка FluxFlow-Frame. “+ Original” вказує на навчання без FLUXFLOW, тоді як “+ Num × 1” показує різні конфігурації FluxFlow-Frame. Найкращі результати виділені; другі за якістю результати підкреслені для кожної моделі.

Коментуючи ці результати, автори стверджують:

‘Обидва FLUXFLOW-FRAME і FLUXFLOW-BLOCK суттєво покращують темпоральну якість, як свідчать метрики у табл. 1, 2 (тобто FVD, Subject, Flicker, Motion, and Dynamic) і якісні результати у [зображенні нижче].

‘Наприклад, рух дрифтує машини у VC2, кота, який гоняється за хвостом у NOVA, і серфера, який катиться на хвилі у CVX, стають помітно більш плавними з FLUXFLOW. Насамперед, ці темпоральні покращення досягаються без жертвування просторовою вірністю, як свідчать різкі деталі водних сплесків, димових слідів і хвильових текстур, разом із просторовою і загальною вірністю метрик.’

Нижче ми бачимо вибірки з якісних результатів, на які посилаються автори (див. оригінальну роботу для повних результатів і кращої роздільності):

Вибірки з якісних результатів.

Вибірки з якісних результатів.

Робота пропонує, що хоча обидва кадрові і блокові порушення покращують темпоральну якість, кадрові методи мають тенденцію працювати краще. Це пояснюється їхньою тонкою гранулярністю, яка дозволяє здійснювати більш точні темпоральні корекції. Блокові порушення, навпаки, можуть вводити шум через тісно пов’язані просторові і темпоральні закономірності всередині блоків, зменшуючи їх ефективність.

Висновок

Ця робота, разом з роботою Bytedance-Tsinghua про капціонування, яка була опублікована цього тижня, зробила для мене ясним, що очевидні недоліки в нових генераційних відеомоделях можуть не бути результатом помилок користувача, інституційних помилок або обмежень фінансування, а радше результатом дослідницького фокусу, який зрозуміло ưu tiênував більш нагальні проблеми, такі як темпоральна узгодженість і послідовність, над цими менш важливими проблемами.

До недавнього часу результати з вільно доступних і завантажуваних генераційних відеосистем були настільки компрометовані, що жодного великого зусилля не виникло з боку ентузіастів для вирішення цих проблем (не в останню чергу тому, що ці проблеми були фундаментальними і не мали тривіального рішення).

Тепер, коли ми так близько до передбачуваної епохи повністю AI-генерованих фотореалістичних відеовиводів, ясно, що як дослідницька, так і неформальна спільноти беруть активнішу участь у вирішенні залишених проблем; з удачею, ці проблеми не є нерозв’язними.

 

* Рідна частота кадрів Wan становить лише 16 кадрів в секунду, і у відповідь на мої власні проблеми, я звернув увагу на те, що форуми пропонують зниження частоти кадрів до 12 кадрів в секунду, а потім використання FlowFrames або інших AI-основаних систем рефлову для інтерполяції розривів між такими рідкісними кадрами.

Перша публікація – п’ятниця, 21 березня 2025

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]