Генератори відео

Чому генеративні відеосистеми не можуть створити повнометражні фільми?

mm
Додайте Unite.AI до бажаних джерел у Google
'a gorgeous illustration of a robot operating a professional movie camera' - ChatGPT Plus, Sept 2024

Поява та розвиток генеративного відео штучного інтелекту спонукав багатьох спостерігачів передбачити, що машинне навчання стане причиною загибелі кінематографічної індустрії, як ми її знаємо – замість цього, окремі творці зможуть створювати голлівудські блокбастери вдома, як на місцевих, так і на хмарних системах з процесорами GPU.

Чи це можливе? Чи це неминуче, як багато хто вважає?

Той факт, що окремі особи зможуть створити фільми у форматі, який ми знаємо, з послідовними персонажами, нарративною цілісністю та повною фотореалістичністю, цілком можливий – і, можливо, навіть неминучий.

Водночас існують кілька фундаментальних причин, чому це не станеться з відеосистемами, заснованими на латентних дифузійних моделях.

Цей останній факт важливий, оскільки на даний момент ця категорія включає кожну популярну систему текст-відео (T2) та зображення-відео (I2V), доступну на ринку, включаючи Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (та, наскільки ми можемо встановити, майбутню відеофункціональність Adobe Firefly); серед багатьох інших.

Тут ми розглядаємо перспективу справжніх авторських повнометражних генеративних фільмів, створених окремими особами, з послідовними персонажами, кінематографією та візуальними ефектами не нижче сучасного рівня Голлівуду.

Давайте розглянемо деякі з найбільших практичних перешкод до завдань, пов’язаних з цим.

1: Ви не можете отримати точний наступний кадр

Наративна несумісність є найбільшою з цих перешкод. Факт полягає в тому, що жодна з目前 доступних відеогенеративних систем не може створити справді точний “наступний кадр”*.

Це відбувається через те, що денойзинг-дифузійна модель в основі цих систем залежить від випадкового шуму, а ця основна принцип не підходить для переінтерпретації точно одного й того ж контенту двічі (тобто, з різних кутів або шляхом розвитку попереднього кадру в наступний кадр, який підтримує сумісність з попереднім кадром).

Коли використовуються текстові промпти, окремо або разом з завантаженими “посівними” зображеннями (мультимодальний вхід), токени, отримані з промпту, викличуть семантично-відповідний контент з навченої латентної області моделі.

Водночас, ще більше ускладнено через фактор “випадкового шуму”, він ніколи не робить цього однаково двічі.

Це означає, що особи у відео будуть схильні змінюватися, а об’єкти та середовища не будуть відповідати початковому кадру.

Це пояснює, чому вірусні кліпи, що зображують надзвичайні візуальні ефекти та голлівудський рівень виходу, схильні бути або окремими кадрами, або “демонстраційним монтажем” можливостей системи, де кожен кадр містить різних персонажів та середовища.

Виписки з генеративного монтажу штучного інтелекту від Marco van Hylckama Vlieg – джерело: https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/

Імплікація в цих колекціях ад хок відеогенеративних поколінь (які можуть бути нечесними у випадку комерційних систем) полягає в тому, що основна система може створювати безперервні та послідовні нарративи.

Аналогія, яку тут використовується, – це трейлер фільму, який містить лише одну-дві хвилини кадрів з фільму, але дає аудиторії підстави вважати, що весь фільм існує.

Єдина система, яка зараз пропонує нарративну послідовність у дифузійній моделі, – це ті, які виробляють статичні зображення. До них належать ConsiStory від NVIDIA та різні проекти в науковій літературі, такі як TheaterGen, DreamStory та StoryDiffusion.

Два приклади 'статичної' нарративної послідовності, з недавніх моделей:: Джерела:: https://research.nvidia.com/labs/par/consistory/ та https://arxiv.org/pdf/2405.01434

Два приклади ‘статичної’ нарративної послідовності, з недавніх моделей:: Джерела:: https://research.nvidia.com/labs/par/consistory/ та https://arxiv.org/pdf/2405.01434

У теорії можна використовувати кращу версію таких систем (жодна з вищезазначених не є справді послідовною) для створення серії зображень-відео, які можна об’єднати в послідовність.

На даний час цей підхід не дає плідних результатів щодо отримання послідовних кадрів; і, до того ж, ми вже відійшли від авторської мрії, додавши ще один шар складності.

Ми також можемо використовувати Low Rank Adaptation (LoRA) моделі, спеціально навчені на персонажах, речах чи середовищах, для підтримання кращої послідовності між кадрами.

Водночас, якщо персонаж хоче з’явитися в новому костюмі, зазвичай потрібно створити зовсім нову LoRA, яка втілює персонажа в цьому костюмі (хоча підконцепції, такі як “червона сукня”, можна навчити в окремі LoRAs, разом з відповідними зображеннями, вони не завжди легко працюють).

Це додає значну складність, навіть до відкритої сцени в фільмі, де людина виходить з ліжка, одягається, зеває, дивиться у вікно спальні та йде до ванної, щоб почистити зуби.

Така сцена, що містить близько 4-8 кадрів, може бути знята за одну ранкову зустріч за допомогою традиційних кінематографічних процедур; на даний час у генеративному штучному інтелекті це потенційно представляє тижні роботи, кілька навчених LoRAs (або інших допоміжних систем) та значну кількість постобробки

Альтернативно можна використовувати відео-відео, де звичайні або CGI-футаж перетворюється через текстові промпти в альтернативні інтерпретації. Наприклад, Runway пропонує таку систему.

CGI (ліворуч) з Blender, інтерпретований у текстовому експерименті відео-відео Runway від Mathieu Visnjevec – Джерело: https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/

Є дві проблеми тут: вам вже потрібно створити основний футаж, тому ви вже робите фільм двічі, навіть якщо ви використовуєте синтетичну систему, таку як UnReal’s MetaHuman.

Якщо ви створюєте CGI-моделі (як у кліпі вище) та використовуєте їх у відео-образі перетворення, їхня послідовність між кадрами не може бути надійною.

Це відбувається через те, що відеодифузійні моделі не бачать “великої картини” – вони створюють новий кадр на основі попереднього кадру/кадрів та в деяких випадках розглядають найближчий майбутній кадр; але, порівнюючи цей процес з шаховою грою, вони не можуть думати “на десять ходів вперед” та не можуть пам’ятати десять ходів назад.

Другою проблемою є те, що дифузійна модель все одно буде боротися з підтриманням послідовного вигляду між кадрами, навіть якщо ви включите кілька LoRAs для персонажа, середовища та стилю освітлення, з причин, згаданих на початку цього розділу.

2: Ви не можете легко редагувати кадр

Якщо ви зображуєте персонажа, який йде вулицею за допомогою традиційних методів CGI, і ви вирішуєте змінити якийсь аспект кадру, ви можете调整 модель та відтворити її знову.

Якщо це реальна зйомка, ви просто скидаєте та знімаєте знову, з відповідними змінами.

Водночас, якщо ви створюєте генеративний кадр штучного інтелекту, який вам подобається, але ви хочете змінити один аспект його, ви можете зробити це лише за допомогою болісних методів постобробки, розроблених за останні 30-40 років: CGI, ротоскопіювання, моделювання та матування – всі ці методи є трудомісткими та дорогими, часоємними процедурами.

Після перекладу всіх пунктів та розділів, переклад завершено.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai