Модели и платформы ИИ
CameraCtrl: Включение управления камерой для генерации видео из текста
Недавние разработки в области моделей диффузии существенно продвинули генерацию видео, управляемую текстом, в последние годы и революционизировали рабочие процессы проектирования контента. Управляемость играет значительную роль в практических приложениях генерации видео, поскольку позволяет пользователям настраивать сгенерированные результаты в соответствии с их потребностями и требованиями. С высокой управляемостью модель может повысить реализм, качество и удобство использования сгенерированных видео, а при использовании текстовых и изображений в качестве входных данных модели часто не хватает точного контроля над движением и содержанием. Чтобы преодолеть это ограничение, некоторые модели предлагают использовать сигналы управления, такие как скелет позы, оптический поток и другие мульти-модальные сигналы, для обеспечения более точного контроля над генерацией видео. Другим ограничением, с которым сталкиваются существующие модели, является отсутствие точного контроля над камерой при генерации видео, поскольку возможность управления камерой крайне важна, поскольку она не только повышает реализм сгенерированных видео, но и позволяет настраивать точки зрения, что повышает вовлеченность пользователей, необходимую в разработке игр, дополненной и виртуальной реальности. Кроме того, умелое управление движением камеры позволяет создателям подчеркивать отношения между персонажами, подчеркивать эмоции и направлять внимание целевой аудитории, что крайне важно в кино- и рекламной индустрии.
Чтобы преодолеть эти ограничения, модель CameraCtrl представляет собой новую идею, которая попытается обеспечить точный контроль камеры для моделей генерации видео из текста. После параметризации траектории камеры с точностью модель обучает модуль камеры, который можно подключить к модели генерации видео из текста, не изменяя другие компоненты. Кроме того, модель CameraCtrl проводит всестороннее исследование влияния различных наборов данных и предлагает, что видео с подобными внешними характеристиками и разнообразным распределением камеры могут повысить общую управляемость и способность к обобщению модели. Эксперименты, проведенные для анализа производительности модели CameraCtrl на реальных задачах, указывают на эффективность модели в достижении точного и адаптивного контроля камеры, открывая путь к созданию настраиваемой и динамической генерации видео из позы камеры и текстовых входных данных.
Эта статья направлена на подробное описание модели CameraCtrl, и мы исследуем механизм, методологию, архитектуру модели, а также ее сравнение с современными моделями. Итак, начнем.
CameraCtrl: Управление камерой для генерации видео из текста
Недавние достижения в области моделей диффузии существенно продвинули генерацию видео, управляемую текстом, в последние годы и революционизировали рабочие процессы проектирования контента. Управляемость играет значительную роль в практических приложениях генерации видео, поскольку позволяет пользователям настраивать сгенерированные результаты в соответствии с их потребностями и требованиями. С высокой управляемостью модель может повысить реализм, качество и удобство использования сгенерированных видео, а при использовании текстовых и изображений в качестве входных данных модели часто не хватает точного контроля над движением и содержанием. Чтобы преодолеть это ограничение, некоторые модели предлагают использовать сигналы управления, такие как скелет позы, оптический поток и другие мульти-модальные сигналы, для обеспечения более точного контроля над генерацией видео. Другим ограничением, с которым сталкиваются существующие модели, является отсутствие точного контроля над камерой при генерации видео, поскольку возможность управления камерой крайне важна, поскольку она не только повышает реализм сгенерированных видео, но и позволяет настраивать точки зрения, что повышает вовлеченность пользователей, необходимую в разработке игр, дополненной и виртуальной реальности. Кроме того, умелое управление движением камеры позволяет создателям подчеркивать отношения между персонажами, подчеркивать эмоции и направлять внимание целевой аудитории, что крайне важно в кино- и рекламной индустрии.
Чтобы преодолеть эти ограничения, модель CameraCtrl представляет собой новую идею, которая попытается обеспечить точный контроль камеры для моделей генерации видео из текста. После параметризации траектории камеры с точностью модель обучает модуль камеры, который можно подключить к модели генерации видео из текста, не изменяя другие компоненты. Кроме того, модель CameraCtrl проводит всестороннее исследование влияния различных наборов данных и предлагает, что видео с подобными внешними характеристиками и разнообразным распределением камеры могут повысить общую управляемость и способность к обобщению модели. Эксперименты, проведенные для анализа производительности модели CameraCtrl на реальных задачах, указывают на эффективность модели в достижении точного и адаптивного контроля камеры, открывая путь к созданию настраиваемой и динамической генерации видео из позы камеры и текстовых входных данных.

Модель AnimateDiff использует эффективный подход к тонкой настройке LoRA для получения весов модели для различных типов съемок. Модель Direct-a-video предлагает использовать модуль камеры для управления положением камеры во время генерации видео, но она ограничена только тремя параметрами камеры, что ограничивает возможность управления камерой до базовых типов. С другой стороны, модели, такие как MotionCtrl, проектируют контроллер движения, который принимает более трех входных параметров и может производить видео с более сложными позами камеры. Однако необходимость тонкой настройки части сгенерированных видео ограничивает способность модели к обобщению. Кроме того, некоторые модели включают дополнительные структурные сигналы управления, такие как карты глубины, в процесс для повышения управляемости как для генерации изображений, так и для генерации текста. Обычно модель подает эти сигналы управления в дополнительный кодировщик, а затем вводит сигналы в генератор с помощью различных операций.
CameraCtrl: Архитектура модели
Прежде чем мы сможем рассмотреть архитектуру и парадигму обучения для кодировщика камеры, важно понять различные представления камеры. Обычно поза камеры относится к внутренним и внешним параметрам, и одним из простых вариантов, чтобы позволить генератору видео условиться на позу камеры, является подача сырых значений параметров камеры в генератор. Однако реализация такого подхода может не повысить точный контроль камеры по нескольким причинам. Во-первых, хотя матрица вращения ограничена ортогональностью, вектор перевода обычно не ограничен по величине, что приводит к несоответствию в процессе обучения, которое может повлиять на последовательность контроля. Во-вторых, использование сырых параметров камеры напрямую может затруднить для модели связать эти значения с пикселями изображения, что приводит к снижению контроля над визуальными деталями. Чтобы избежать этих ограничений, модель CameraCtrl выбирает вложения Plucker в качестве представления позы камеры, поскольку вложения Plucker имеют геометрические представления каждой точки видеокадра и могут обеспечить более подробное описание информации о позе камеры.
Управляемость камеры в генераторах видео
Когда модель параметризирует траекторию камеры в последовательность вложений Plucker, т.е. пространственные карты, модель имеет возможность использовать модель кодировщика для извлечения функций камеры, а затем объединить функции камеры с генератором видео. Аналогично адаптеру текст-изображение, модель CameraCtrl вводит кодировщик камеры, специально разработанный для видео. Кодировщик камеры включает модель внимания во времени после каждого блока свертки, что позволяет ему захватить временные отношения поз камеры на протяжении видеоклипа. Как показано на следующем изображении, кодировщик камеры принимает только вложения Plucker в качестве входных данных и выдает много-масштабные функции. После получения много-масштабных функций камеры модель CameraCtrl стремится интегрировать эти функции в архитектуру U-Net модели генерации видео из текста без проблем, и определяет слои, которые следует использовать для эффективного введения информации камеры. Кроме того, поскольку большинство существующих моделей используют архитектуру, подобную U-Net, содержащую как временные, так и пространственные слои внимания, модель CameraCtrl вводит представления камеры в блок внимания во времени, решение, подтвержденное способностью временных слоев внимания захватить временные отношения, соответствующие внутренней причинно-следственной и последовательной природе траектории камеры с пространственными слоями внимания, изображающими отдельные кадры.

Обучение распределениям камеры
Обучение компонента кодировщика камеры в модели CameraCtrl на генераторе видео требует большого количества хорошо помеченных и аннотированных видео, с возможностью модели получить траекторию камеры с помощью подхода “структура из движения” или SfM. Модель CameraCtrl пытается выбрать набор данных с внешними характеристиками, соответствующими данным обучения базовой модели генерации видео из текста, и иметь распределение позы камеры как можно шире. Примеры в наборе данных, сгенерированные с помощью виртуальных движков, демонстрируют разнообразное распределение камеры, поскольку разработчики имеют возможность контролировать параметры камеры во время фазы рендеринга, хотя это и страдает от разрыва в распределении по сравнению с наборами данных, содержащими реальные примеры. Когда работа ведется с наборами данных, содержащими реальные примеры, распределение камеры обычно узкое, и в таких случаях модель должна найти баланс между разнообразием среди различных траекторий камеры и сложностью отдельных траекторий камеры. Сложность отдельной траектории камеры гарантирует, что модель учится контролировать сложные траектории во время процесса обучения, в то время как разнообразие среди различных траекторий камеры гарантирует, что модель не переобучается на определенные фиксированные закономерности. Кроме того, для мониторинга процесса обучения кодировщика камеры модель CameraCtrl предлагает метрику выравнивания камеры для измерения качества контроля камеры путем количественной оценки ошибки между траекторией камеры сгенерированных примеров и входными условиями камеры.
CameraCtrl: Эксперименты и результаты
Модель CameraCtrl реализует модель AnimateDiff в качестве базовой модели генерации видео из текста, и одной из основных причин этого является то, что стратегия обучения модели AnimateDiff позволяет ее модулю движения интегрироваться с базовыми моделями текст-изображение или текст-изображение LoRA для обеспечения генерации видео в различных жанрах и областях. Модель использует оптимизатор Adam для обучения модели с постоянной скоростью обучения 1e-4. Кроме того, для того чтобы модель не влияла на возможности генерации видео исходной модели генерации видео из текста отрицательно, модель CameraCtrl использует метрику FID или расстояние Фриче-Инсепшн для оценки качества внешнего вида видео и сравнивает качество сгенерированного видео до и после включения модуля камеры.
Для оценки своей производительности модель CameraCtrl сравнивается с двумя существующими моделями управления камерой: MotionCtrl и AnimateDiff. Однако, поскольку модель AnimateDiff поддерживает только восемь базовых траекторий камеры, сравнение между CameraCtrl и AnimateDiff ограничено тремя базовыми траекториями. С другой стороны, для сравнения с MotionCtrl модель выбирает более тысячи случайных траекторий камеры из существующего набора данных, в дополнение к базовым траекториям камеры, генерирует видео с помощью этих траекторий и оценивает их с помощью метрик TransErr и RotErr.

Как можно наблюдать, модель CameraCtrl превосходит модель AnimateDiff на базовой траектории и демонстрирует лучшие результаты при сравнении с моделью MotionCtrl на метрике сложной траектории.
Кроме того, следующее изображение демонстрирует влияние архитектуры кодировщика камеры на общее качество сгенерированных примеров. Строки a до d представляют результаты, сгенерированные с кодировщиком камеры, реализованным в архитектуре: ControlNet, ControlNet с временным вниманием, T2I Adaptor и T2I адаптер с временным вниманием соответственно.

На следующем изображении первые два места демонстрируют видео, сгенерированное с помощью комбинации кодировщика RGB из модели SparseCtrl и метода, используемого в модели CameraCtrl.

Заключительные мысли
В этой статье мы говорили о модели CameraCtrl, новой идее, которая попытается обеспечить точный контроль камеры для моделей генерации видео из текста. После параметризации траектории камеры с точностью модель обучает модуль камеры, который можно подключить к модели генерации видео из текста, не изменяя другие компоненты. Кроме того, модель CameraCtrl проводит всестороннее исследование влияния различных наборов данных и предлагает, что видео с подобными внешними характеристиками и разнообразным распределением камеры могут повысить общую управляемость и способность к обобщению модели. Эксперименты, проведенные для анализа производительности модели CameraCtrl на реальных задачах, указывают на эффективность модели в достижении точного и адаптивного контроля камеры, открывая путь к созданию настраиваемой и динамической генерации видео из позы камеры и текстовых входных данных.












