Моделі та платформи ШІ
DynamiCrafter: Анімація відкритих зображень з використанням відео-дифузійних моделей
Комп’ютерне бачення – одна з найбільш цікавих і вивчених галузей у спільноті штучного інтелекту сьогодні, і尽管 швидкого вдосконалення моделей комп’ютерного бачення, довготривала проблема, яка все ще турбує розробників, – це анімація зображень. Навіть сьогодні, фреймворки анімації зображень борються з перетворенням статичних зображень у відповідні відео-еквіваленти, які демонструють природну динаміку, зберігаючи при цьому початковий вигляд зображень. Традиційно, фреймворки анімації зображень фокусуються в основному на анімації природних сцен з домен-специфічними рухами, такими як рух волосся людини або тіла, або стохастичними динаміками, такими як рідини та хмари. Хоча цей підхід працює до певної міри, він обмежує придатність цих фреймворків анімації для більш загальних візуальних contenів.
Крім того, традиційні підходи до анімації зображень зосереджуються в основному на синтезі коливальних і стохастичних рухів, або на налаштуванні для конкретних категорій об’єктів. Однак помітною вадою цього підходу є сильні припущення, які накладаються на ці методи, що в кінцевому підсумку обмежує їхню придатність, особливо в загальних сценаріях, таких як анімація відкритих зображень. За останні кілька років, T2V або текст-відео моделі продемонстрували видатний успіх у генерації яскравих і різноманітних відео за допомогою текстових підказок, і це демонстрація T2V моделей є тим, що формує основу для фреймворку DynamiCrafter.
Фреймворк DynamiCrafter є спробою подолати поточні обмеження моделей анімації зображень і розширити їхню придатність для загальних сценаріїв, що включають відкриті зображення. Фреймворк DynamiCrafter намагається синтезувати динамічний контент для відкритих зображень, перетворюючи їх у анімовані відео. Ключова ідея за DynamiCrafter полягає у включенні зображення як керівництва у генеративний процес у спробі використовувати рухову先ість вже існуючих текст-відео дифузійних моделей. Для даного зображення, модель DynamiCrafter спочатку реалізує запит-трансформер, який проєктує зображення у текст-алінований багатий контекстний простір, що дозволяє відео-моделі споживати контент зображення у сумісному вигляді. Однак, модель DynamiCrafter все ще бореться з збереженням деяких візуальних деталей у результаті відео, проблему, яку модель DynamiCrafter подолає, надавши повне зображення до дифузійної моделі шляхом конкатенації зображення з початковим шумом, тим самим доповнюючи модель більш точною інформацією про зображення.
Ця стаття має на меті висвітлити фреймворк DynamiCrafter у глибину, і ми досліджуємо механізм, методологію, архітектуру фреймворку разом з його порівнянням з сучасними фреймворками генерації зображень і відео. Тому давайте почнемо.
DynamiCrafter: Анімація відкритих зображень
Анімація статичного зображення часто пропонує привабливий візуальний досвід для аудиторії, оскільки воно здається оживляє статичне зображення. За роки існування численні фреймворки досліджували різні методи анімації статичних зображень. Початкові фреймворки анімації реалізовували підходи, засновані на фізичній симуляції, які фокусувалися на симуляції руху конкретних об’єктів. Однак через незалежне моделювання кожної категорії об’єктів, ці підходи були ні ефективними, ні мали загальність. Для реплікації більш реалістичних рухів з’явилися методики, засновані на посиланнях, які передавали рух або інформацію про зовнішній вигляд від посилальних сигналів, таких як відео, до процесу синтезу. Хоча методики, засновані на посиланнях, демонстрували кращі результати з кращою тимчасовою узгодженістю порівняно з підходами, заснованими на симуляції, вони потребували додаткового керівництва, яке обмежувало їхнє практичне застосування.
У останні роки більшість фреймворків анімації зосереджуються в основному на анімації природних сцен з стохастичними, домен-специфічними або коливальними рухами. Хоча підхід, реалізований цими фреймворками, працює до певної міри, результати, які ці фреймворки генерують, не є задовільними, з значним потенціалом для покращення. Видатні результати, досягнуті моделями Text to Video генерації у останні роки, надихнули розробників фреймворку DynamiCrafter на використання потужних генеративних можливостей моделей Text to Video для анімації зображень.
Ключова основа фреймворку DynamiCrafter полягає у включенні умовного зображення у спробі керувати процесом генерації відео Text to Video дифузійних моделей. Однак кінцева мета анімації зображень все ще залишається неважливою, оскільки анімація зображень вимагає збереження деталей, а також розуміння візуальних контекстів, необхідних для створення динаміки. Однак багатоцільові відео-дифузійні моделі, такі як VideoComposer, намагалися забезпечити генерацію відео з візуальним керівництвом від зображення. Однак ці підходи не підходять для анімації зображень, оскільки вони або призводять до раптових тимчасових змін, або мають низьку візуальну узгодженість з вхідним зображенням через їхні менш повні механізми ін’єкції зображення. Для подолання цієї перешкоди фреймворк DynamiCrafter пропонує двопотоковий підхід ін’єкції, що складається з візуального керівництва деталей і текст-алінованого контекстного представлення. Двопотоковий підхід ін’єкції дозволяє фреймворку DynamiCrafter забезпечити, щоб відео-дифузійна модель синтезувала контент, збережений деталі, у взаємодоповнюючий спосіб.

Для даного зображення фреймворк DynamiCrafter спочатку проєктує зображення у текст-алінований контекстний простір, використовуючи спеціально розробену мережу навчання контексту. Конкретніше, контекстний простір складається з навчальної трансформер-запиту, щоб进一步 просунути його адаптацію до дифузійних моделей, і попередньо натренованого CLIP-енкодера зображення, щоб витягнути текст-аліновані особливості зображення. Модель потім використовує багатий контекстний простір за допомогою міжуважних шарів, і модель використовує замикаючу фузію, щоб поєднати ці текстові особливості з міжуважними шарами. Однак цей підхід змінює вивчені контекстні представлення з текст-алінованими візуальними деталями, що дозволяє семантичне розуміння контексту зображення, дозволяючи розумну і яскраву динаміку бути синтезованою. Крім того, у спробі доповнити додаткові візуальні деталі, фреймворк конкатенує повне зображення з початковим шумом до дифузійної моделі. Як результат, двопотоковий підхід ін’єкції, реалізований фреймворком DynamiCrafter, гарантує візуальну узгодженість, а також правдоподібний динамічний контент для вхідного зображення.
Далі, дифузійні моделі або DM продемонстрували видатну продуктивність і генеративну могутність у генерації зображень з тексту. Для реплікації успіху моделей T2I у генерації відео, пропонуються відео-дифузійні моделі, які використовують просторово-часову факторизовану U-Нову архітектуру у піксельному просторі для моделювання низькорозрядних відео. Перенесення знань моделей T2I у моделі T2V допоможе зменшити витрати на навчання. Хоча відео-дифузійні моделі мають можливість генерувати високоякісні відео, вони приймають лише текстові підказки як єдине семантичне керівництво, яке може не відображати справжніх намірів користувача або може бути нечітким. Однак результати більшості відео-дифузійних моделей рідко відповідають вхідному зображенню і страждають від нереалістичних тимчасових змін. Підхід DynamiCrafter побудований на текст-умовних відео-дифузійних моделях, які використовують їхню багатую динамічну先ість для анімації відкритих зображень. Він робить це, включивши спеціальні конструкції для кращого семантичного розуміння і узгодженості з вхідним зображенням.
DynamiCrafter: Метод і архітектура
Для даного статичного зображення фреймворк DynamiCrafter намагається анімувати зображення у відео, тобто виробити короткий відеокліп. Відеокліп успадковує візуальний контент від зображення і демонструє природну динаміку. Однак існує можливість, що зображення може з’явитися у довільному місці результатної послідовності кадрів. З’явлення зображення у довільному місці є особливим видом виклику, спостережуваного у завданнях генерації відео з умовами високої візуальної узгодженості. Фреймворк DynamiCrafter подолає цей виклик, використовуючи генеративні先ості попередньо натренованих відео-дифузійних моделей.
Динаміка зображень з відео-дифузійної先ості
Зазвичай, відкриті текст-відео дифузійні моделі відомі тим, що демонструють динамічний візуальний контент, умовний на текстові описи. Для анімації статичного зображення з використанням текст-відео генеративних先остей, фреймворки повинні спочатку ін’єктувати візуальну інформацію у процес генерації відео у повному вигляді. Крім того, для динамічної синтезу, модель T2V повинна споживати зображення для розуміння контексту, а також повинна бути здатна зберегти візуальні деталі у згенерованих відео.

Текст-аліноване контекстне представлення
Для керівництва генерацією відео з контекстом зображення фреймворк DynamiCrafter намагається проєктувати зображення у алінований вкладений простір, що дозволяє відео-моделі використовувати інформацію про зображення у сумісному вигляді. Після цього фреймворк DynamiCrafter використовує кодувач зображення, щоб витягнути особливості зображення з вхідного зображення, оскільки текстові вкладення генеруються за допомогою попередньо натренованого CLIP-текстового кодувача. Хоча глобальні семантичні токени з CLIP-кодувача зображення узгоджуються з підказками зображення, вони в основному представляють візуальний контент на семантичному рівні, тим самим не захоплюючи повний масштаб зображення. Фреймворк DynamiCrafter реалізує повні візуальні токени з останнього шару кодувача CLIP, щоб витягнути більш повну інформацію, оскільки ці візуальні токени демонструють високу вірність у завдань генерації зображень з умовами. Крім того, фреймворк використовує контекстні і текстові вкладення, щоб взаємодіяти з проміжними особливостями U-Net за допомогою двопотокових міжуважних шарів. Конструкція цього компоненту дозволяє моделі споживати умови зображення у залежності від шару. Крім того, оскільки проміжні шари архітектури U-Net асоціюються більше з положенням або формою об’єктів, очікується, що особливості зображення будуть впливати на зовнішній вигляд відео переважно, особливо оскільки два кінцевих шари більш пов’язані з зовнішнім виглядом.
Візуальне керівництво деталей
Фреймворк DynamiCrafter використовує багатое інформативне контекстне представлення, яке дозволяє відео-дифузійній моделі у своїй архітектурі генерувати відео, які нагадують вхідне зображення близько. Однак, як демонструється на наступному зображенні, згенерований контент може демонструвати деякі розбіжності через обмежену здатність попередньо натренованого кодувача CLIP зберегти інформацію про зображення повністю, оскільки він був розроблений для узгодженості мови і візуальних особливостей.

Для покращення візуальної узгодженості фреймворк DynamiCrafter пропонує надати відео-дифузійній моделі додаткові візуальні деталі, витягнуті з вхідного зображення. Для цього модель DynamiCrafter конкатенує умовне зображення з початковим шумом кожного кадру і надає їх до денойзингового компоненту U-Net як керівництво.
Парадигма навчання
Фреймворк DynamiCrafter інтегрує умовне зображення через два взаємодоповнюючі потоки, які відіграють значну роль у керівництві деталей і контролі контексту. Для цього фреймворк DynamiCrafter використовує триступеневий процес навчання
- На першому етапі модель тренує мережу контекстного представлення зображення.
- На другому етапі модель адаптує мережу контекстного представлення зображення до моделі Text to Video.
- На третьому і останньому етапі модель дофінує мережу контекстного представлення зображення спільно з компонентом візуального керівництва деталей.
Для адаптації інформації про зображення для сумісності з моделлю Text-to-Video (T2V) фреймворк DynamiCrafter пропонує розробку мережі контекстного представлення, P, розробленої для захоплення текст-алінованих візуальних деталей з даного зображення. Визнаючи, що P потребує багатьох кроків оптимізації для зbieження, підхід фреймворку включає початкове навчання його за допомогою простішої моделі Text-to-Image (T2I). Ця стратегія дозволяє мережі контекстного представлення зосередитися на навчанні про контекст зображення перед інтеграцією його з моделлю T2V через спільне навчання з P і просторовими шарами, а не тимчасовими шарами, моделі T2V.
Для забезпечення сумісності з T2V фреймворк DynamiCrafter з’єднує вхідне зображення з шумом кожного кадру, після чого дофінує як P, так і просторові шари моделі Visual Discrimination. Цей метод обирається для збереження цілісності тимчасових інсайтів моделі T2V без негативних ефектів від щільної ін’єкції зображення, яка могла б компрометувати продуктивність і відхилитися від нашої основної мети. Крім того, фреймворк використовує стратегію випадкового вибору відеокадру як умову зображення для досягнення двох цілей: (i) для уникнення розвитку мережею передбачуваного шаблону, який безпосередньо асоціює з’єднане зображення з конкретним розташуванням кадру, і (ii) для заохочення більш гнучкого контекстного представлення, запобігаючи наданню надто жорсткої інформації для будь-якого конкретного кадру.
DynamiCrafter: Експерименти і результати
Фреймворк DynamiCrafter спочатку тренує мережу контекстного представлення і шари міжуважного контексту на моделі Stable Diffusion. Фреймворк потім замінює компонент Stable Diffusion на VideoCrafter і дофінує мережу контекстного представлення і просторові шари для адаптації з конкатенацією зображення. На етапі висновку фреймворк приймає зразок DDIM з багатокритеріальною класифікацією безумовного керівництва. Крім того, для оцінки тимчасової узгодженості і якості згенерованих відео у тимчасовому і просторовому доменах, фреймворк повідомляє про відстань FVD або Frechet Video Distance, а також відстань KVD або Kernel Video Distance, і оцінює нульову продуктивність усіх методів на бенчмарках MSR-VTT і UCF-101. Для дослідження перцептивної узгодженості між згенерованими результатами і вхідним зображенням фреймворк вводить PIC або Перцептивну узгодженість вхідних даних, і приймає метрику перцептивної відстані DreamSim як функцію відстані.
Наступне зображення демонструє візуальне порівняння згенерованих анімованих contenів з різними стилями і контентом.

Як можна побачити, серед усіх різних методів, фреймворк DynamiCrafter добре узгоджується з умовою вхідного зображення і генерує тимчасово узгоджені відео. Наступна таблиця містить статистику з 用户ського дослідження з 49 учасниками рейтингу переваги для Тимчасової узгодженості (T.C), Якості руху (M.C) разом з вибором рейтингу для візуальної узгодженості з вхідним зображенням (I.C). Як можна побачити, фреймворк DynamiCrafter能够 перевершити існуючі методи на значну міру.

Наступне зображення демонструє результати, досягнуті за допомогою двопотокового методу ін’єкції і парадигми навчання.

Фінальні думки
У цій статті ми говорили про DynamiCrafter, спробу подолати поточні обмеження моделей анімації зображень і розширити їхню придатність для загальних сценаріїв, що включають відкриті зображення. Фреймворк DynamiCrafter намагається синтезувати динамічний контент для відкритих зображень, перетворюючи їх у анімовані відео. Ключова ідея за DynamiCrafter полягає у включенні зображення як керівництва у генеративний процес у спробі використовувати рухову先ість вже існуючих текст-відео дифузійних моделей. Для даного зображення модель DynamiCrafter спочатку реалізує запит-трансформер, який проєктує зображення у текст-алінований багатий контекстний простір, що дозволяє відео-моделі споживати контент зображення у сумісному вигляді. Однак модель DynamiCrafter все ще бореться з збереженням деяких візуальних деталей у результаті відео, проблему, яку модель DynamiCrafter подолає, надавши повне зображення до дифузійної моделі шляхом конкатенації зображення з початковим шумом, тим самим доповнюючи модель більш точною інформацією про зображення.












