Взгляд Anderson

Почему генеративные видеосистемы не могут создать полноценные фильмы?

mm
Добавьте Unite.AI в избранные источники в Google
'a gorgeous illustration of a robot operating a professional movie camera' - ChatGPT Plus, Sept 2024

Появление и развитие генеративного видео на основе ИИ привело многих наблюдателей к предсказанию, что машинное обучение станет причиной гибели киноиндустрии в ее нынешнем виде – вместо этого, отдельные создатели смогут производить голливудские блокбастеры на дому, либо на локальных, либо на облачных системах с поддержкой GPU.

Возможно ли это? Даже если это возможно, является ли это близким, как многие полагают?

Тот факт, что отдельные лица в конечном итоге смогут создавать фильмы в том виде, в котором мы их знаем, с последовательными персонажами, непрерывной историей и полной фотorealностью, вполне возможен – и, возможно, даже неизбежен.

Однако есть несколько фундаментальных причин, почему это вряд ли произойдет с видеосистемами на основе латентных диффузионных моделей.

Этот последний факт важен, поскольку на данный момент эта категория включает каждую популярную систему текст-в-видео (T2) и изображение-в-видео (I2V), доступную на рынке, включая Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (и, насколько мы можем судить, будущую видеофункциональность Adobe Firefly); среди многих других.

Здесь мы рассматриваем перспективу создания полноценных, полнометражных произведений генеративного ИИ, созданных отдельными людьми, с последовательными персонажами, операторской работой и визуальными эффектами, по крайней мере, на уровне современного состояния дел в Голливуде.

Давайте рассмотрим некоторые из наиболее значительных практических препятствий на пути к решению этих задач.

1: Вы не можете получить точный последующий кадр

Несоответствие в повествовании является самым большим из этих препятствий. Факт заключается в том, что ни одна из доступных на данный момент систем генерации видео не может создать действительно точный “последующий” кадр*.

Это связано с тем, что деноизинговая диффузионная модель в основе этих систем полагается на случайный шум, и эта основная principio не поддается переинтерпретации точно одного и того же контента дважды (т.е. с разных углов или путем развития предыдущего кадра в последующий кадр, который сохраняет последовательность с предыдущим кадром).

Когда используются текстовые подсказки, отдельно или вместе с загруженными “семенными” изображениями (мультимодальный ввод), токены, полученные из подсказки, будут вызывать семантически-адекватный контент из обученной латентной области модели.

Однако, еще больше осложненный фактором “случайного шума”, он никогда не сделает это одинаково дважды.

Это означает, что личности людей в видео будут склонны меняться, и объекты и среды не будут соответствовать начальному кадру.

Это причина, по которой вирусные клипы, демонстрирующие необычные визуальные эффекты и голливудский уровень вывода, склонны быть либо отдельными кадрами, либо “монтажом демонстрации” возможностей системы, где каждый кадр представляет разных персонажей и среды.

Фрагменты из генеративного монтажа ИИ от Marco van Hylckama Vlieg – источник: https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/

Импликация в этих коллекциях ад хок видеогенераций (которые могут быть неискренними в случае коммерческих систем) заключается в том, что основная система может создавать связные и последовательные повествования.

Аналогия, которая здесь используется, – это трейлер фильма, который представляет только одну или две минуты кадров из фильма, но дает зрителям основание полагать, что весь фильм существует.

Единственные системы, которые в настоящее время предлагают повествовательную последовательность в диффузионной модели, – это те, которые производят статические изображения. Эти включают ConsiStory от NVIDIA и различные проекты в научной литературе, такие как TheaterGen, DreamStory и StoryDiffusion.

Два примера 'статической' повествовательной последовательности, из недавних моделей:: Источники:: https://research.nvidia.com/labs/par/consistory/ и https://arxiv.org/pdf/2405.01434

Два примера ‘статической’ повествовательной последовательности, из недавних моделей:: Источники:: https://research.nvidia.com/labs/par/consistory/ и https://arxiv.org/pdf/2405.01434

В теории, можно использовать лучшую версию таких систем (ни одна из вышеуказанных не является真正 последовательной), чтобы создать серию изображений-в-видео, которые можно соединить в последовательность.

На текущем уровне развития эта подход не производит правдоподобных последующих кадров; и, в любом случае, мы уже отошли от авторского мечты, добавив слой сложности.

Мы также можем использовать Low Rank Adaptation (LoRA) модели, специально обученные на персонажах, объектах или средах, чтобы поддерживать лучшую последовательность между кадрами.

Однако, если персонаж хочет появиться в новом костюме, обычно необходимо обучить совершенно новую LoRA, которая воплощает персонажа в этом наряде (хотя подконцепции, такие как “красное платье”, могут быть обучены в отдельные LoRAs, вместе с соответствующими изображениями, они не всегда легко работают).

Это добавляет значительную сложность, даже в открывающей сцене фильма, где человек выходит из постели, надевает халат, зевает, смотрит в окно спальни и идет в ванную, чтобы почистить зубы.

Такая сцена, содержащая примерно 4-8 кадров, может быть снята за один утренний час с помощью традиционных методов кинопроизводства; на текущем уровне развития генеративного ИИ это потенциально представляет собой недели работы, множество обученных LoRAs (или других вспомогательных систем) и значительное количество постобработки.

Альтернативно, можно использовать видео-в-видео, где обычные или CGI-кадры преобразуются через текстовые подсказки в альтернативные интерпретации. Runway предлагает такую систему, например.

CGI (слева) из Blender, интерпретированная в текстовом эксперименте видео-в-видео Runway от Mathieu Visnjevec – Источник: https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/

Здесь есть две проблемы: вы уже должны создать основной кадр, поэтому вы уже делаете фильм дважды, даже если вы используете синтетическую систему, такую как UnReal’s MetaHuman.

Если вы создаете CGI-модели (как в клипе выше) и используете их в преобразовании видео-в-изображение, их последовательность между кадрами не может быть надежной.

Это связано с тем, что видеодиффузионные модели не видят “большой картину” – они создают новый кадр на основе предыдущего кадра, и в некоторых случаях учитывают ближайший будущий кадр; но, чтобы сравнить этот процесс с шахматной игрой, они не могут “думать за десять ходов вперед” и не могут вспомнить десять ходов назад.

Во-вторых, диффузионная модель все равно будет бороться за поддержание последовательного вида между кадрами, даже если вы включите несколько LoRAs для персонажа, среды и стиля освещения, по причинам, упомянутым в начале этого раздела.

2: Вы не можете легко отредактировать кадр

Если вы изображаете персонажа, идущего по улице, используя старые методы CGI, и вы решаете изменить какой-либо аспект кадра, вы можете отрегулировать модель и отрендерить ее снова.

Если это съемка в реальной жизни, вы просто сбрасываете и снимаете снова, с соответствующими изменениями.

Однако, если вы производите ген-ИИ видеокадр, который вам нравится, но вы хотите изменить один аспект его, вы можете сделать это только с помощью болезненных методов постобработки, разработанных за последние 30-40 лет: CGI, ротоскопирование, моделирование и матирование – все трудоемкие и дорогие, затратные по времени процедуры.

Способ, которым работают диффузионные модели, просто изменение одного аспекта текстовой подсказки (даже в мультимодальной подсказке, где вы предоставляете полное исходное семенное изображение) изменит множество аспектов сгенерированного вывода, что приведет к игре “кто первый” в подсказках.

3: Вы не можете полагаться на законы физики

Традиционные методы CGI предлагают различные алгоритмические физические модели, которые могут симулировать такие вещи, как динамика жидкостей, движение газов, обратная кинематика (точная модель человеческого движения), динамика ткани, взрывы и различные другие реальные явления.

Однако, диффузионные методы, как мы видели, имеют короткую память и ограниченный диапазон приорных движений (примеры таких действий, включенные в обучающий набор данных) для использования.

В ранней версии страницы OpenAI, посвященной известной системе Sora, компания признала, что Sora имеет ограничения в этом отношении (хотя этот текст был с тех пор удален):

‘[Sora] может испытывать трудности с симуляцией физики сложной сцены и может не понять конкретные случаи причинно-следственных связей (например, печенье может не показать след после того, как персонаж его откусит).

‘Модель также может запутаться в пространственных деталях, включенных в подсказку, таких как различие между левым и правым, или испытывать трудности с точными описаниями событий, разворачивающихся во времени, как конкретные траектории камеры.’

Практическое использование различных API-основанных генеративных видеосистем показывает аналогичные ограничения в изображении точной физики. Однако, определенные общие физические явления, такие как взрывы, кажутся лучше представленными в их обучающих наборах данных.

Некоторые приорные движения, либо обученные в генеративную модель, либо полученные из источника видео, занимают некоторое время (например, человек, выполняющий сложный и неповторяющийся танцевальный номер в сложном костюме) и, еще раз, мифическая “окно внимания” диффузионной модели, скорее всего, преобразует контент (идентификатор лица, детали костюма и т. д.) к моменту, когда движение будет завершено. Однако, LoRAs могут смягчить это, до некоторой степени.

Исправление в посте

Существуют другие недостатки чистой “одиночной” генерации видео ИИ, такие как трудности в изображении быстрых движений и общая, более насущная проблема получения временной последовательности в выходном видео.

Кроме того, создание конкретных лицевых выступлений практически является делом случая в генеративном видео, как и синхронизация губ для диалога.

В обоих случаях использование вспомогательных систем, таких как LivePortrait и AnimateDiff, становится очень популярным в сообществе VFX, поскольку это позволяет перенести, по крайней мере, широкие лицевые выражения и синхронизацию губ на существующий сгенерированный вывод.

Пример переноса выражения (управляющее видео в левом нижнем углу) на целевое видео с помощью LivePortrait. Видео от Generative Z TunisiaGenerative. Посмотрите полную версию в лучшем качестве на https://www.linkedin.com/posts/genz-tunisia_digitalcreation-liveportrait-aianimation-activity-7240776811737972736-uxiB/?

Далее, множество сложных решений, включающих инструменты, такие как Stable Diffusion GUI ComfyUI и профессиональное приложение для композитинга и манипуляции Nuke, а также манипуляция латентным пространством, позволяют практикам VFX ИИ получить больший контроль над лицевыми выражениями и расположением.

Хотя он называет процесс лицевой анимации в ComfyUI “пыткой”, профессионал VFX Francisco Contreras разработал такую процедуру, которая позволяет наложить фонемы губ и другие аспекты лицевого/головного изображения.

Stable Diffusion, с помощью рабочего процесса ComfyUI, управляемого Nuke, позволил VFX-профессионалу Francisco Contreras получить необычный контроль над лицевыми аспектами. Для полного видео в лучшем разрешении перейдите по ссылке https://www.linkedin.com/feed/update/urn:li:activity:7243056650012495872/

Заключение

Ни один из этих факторов не обещает перспективы создания отдельным пользователем связных и фотореалистичных блокбастерских полнометражных фильмов с реалистичным диалогом, синхронизацией губ, выступлениями, средами и последовательностью.

Кроме того, препятствия, описанные здесь, по крайней мере, в отношении диффузионных генеративных видеомоделей, не обязательно разрешимы “в любой момент” сейчас, несмотря на комментарии на форумах и внимание средств массовой информации, которые утверждают обратное. Ограничения, описанные здесь, кажутся внутренними для архитектуры.

В исследованиях синтеза ИИ, как и в любых научных исследованиях, блестящие идеи периодически поражают нас своим потенциалом, только чтобы дальнейшие исследования открыли их фундаментальные ограничения.

В области генерации/синтеза это уже произошло с генеративными противостоящими сетями (GANs) и нейронными радиационными полями (NeRF), которые в конечном итоге оказались очень трудными для инструментализации в производительные коммерческие системы, несмотря на годы академических исследований в этом направлении. Эти технологии теперь появляются чаще всего как вспомогательные компоненты в альтернативных архитектурах.

Как и киностудии могут надеяться, что обучение на лицензированных каталогах фильмов может устранить художников-раскадровщиков и команды VFX, ИИ на самом деле добавляет роли в рабочую силу в настоящее время.

Следует ли ожидать, что диффузионные видеосистемы действительно могут быть преобразованы в повествовательно-согласованные и фотореалистичные генераторы фильмов, или же все это просто еще одно алхимическое преследование, должно стать очевидным в течение следующих 12 месяцев.

Возможно, нам нужен совершенно новый подход; или, возможно, Gaussian Splatting (GSplat), который был разработан в начале 1990-х годов и недавно приобрел популярность в области синтеза изображений, представляет собой потенциальную альтернативу генерации видео на основе диффузии.

Поскольку GSplat потребовалось 34 года, чтобы стать заметным, возможно также, что старые претенденты, такие как NeRF и GANs – и даже латентные диффузионные модели – еще не имели своего дня.

 

* Хотя функция AI Storyboard от Kaiber предлагает такую функциональность, результаты, которые я видел, не являются производственными.

Мартин Андерсон – бывший руководитель научно-исследовательского контента в metaphysic.ai. Опубликовано в понедельник, 23 сентября 2024 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai