Взгляд Anderson
В сторону полного контроля в генерации видео с помощью ИИ

Модели видеоосновы, такие как Hunyuan и Wan 2.1, хотя и мощные, не предлагают пользователям такого же уровня детального контроля, который требуется в производстве фильмов и телевидения (особенно в производстве визуальных эффектов).
В профессиональных студиях визуальных эффектов открытые модели, такие как эти, а также более ранние модели, основанные на изображениях (а не на видео), такие как Stable Diffusion, Kandinsky и Flux, обычно используются вместе с рядом инструментов, которые адаптируют их сырые выходные данные для удовлетворения конкретных творческих потребностей. Когда режиссёр говорит: “Это выглядит хорошо, но можно ли сделать это немного [n]?”, вы не можете ответить, сказав, что модель не достаточно точна, чтобы справиться с такими запросами.
Вместо этого команда ИИ-VFX будет использовать ряд традиционных CGI и композиционных техник, в сочетании с настраиваемыми процедурами и рабочими процессами, разработанными за время, чтобы попытаться расширить возможности синтеза видео немного дальше.
Итак, по аналогии, модель видеоосновы похожа на модель веб-браузера, такой как Chrome; она делает многое сразу, но если вы хотите, чтобы она адаптировалась к вашим потребностям, а не наоборот, вам понадобятся некоторые плагины.
Контрольные фрики
В мире диффузионной синтеза изображений наиболее важной такой третьей стороной является ControlNet.
ControlNet – это техника добавления структурированного контроля к диффузионным генеративным моделям, позволяющая пользователям направлять генерацию изображений или видео с помощью дополнительных входных данных, таких как карты краёв, карты глубины или информация о позе.

Различные методы ControlNet позволяют выполнять генерацию изображений на основе глубины (верхний ряд), семантическую сегментацию (нижний левый) и генерацию изображений человека и животных на основе позы (нижний левый).
Вместо того, чтобы полагаться исключительно на текстовые подсказки, ControlNet вводит отдельные нейронные сети, или адаптеры, которые обрабатывают эти сигналы условий, сохраняя при этом способности генерации базовой модели.
Это позволяет получить тонко настроенные выходные данные, которые более точно соответствуют спецификациям пользователя, что делает его особенно полезным в приложениях, где требуется точный контроль состава, структуры или движения.

С помощью направляющей позы можно получить различные точные типы выходных данных с помощью ControlNet. Источник: https://arxiv.org/pdf/2302.05543
Однако, фреймворки на основе адаптеров этого типа работают внешне на наборе нейронных процессов, которые очень внутренне-ориентированы. Эти подходы имеют несколько недостатков.
Во-первых, адаптеры обучаются независимо, что приводит к конфликтам ветвей при комбинации нескольких адаптеров, что может привести к ухудшению качества генерации.
Во-вторых, они вводят избыточность параметров, требуя дополнительных вычислений и памяти для каждого адаптера, что делает масштабирование неэффективным.
В-третьих, несмотря на их гибкость, адаптеры часто производят субоптимальные результаты по сравнению с моделями, которые полностью настроены для генерации с несколькими условиями. Эти проблемы делают методы на основе адаптеров менее эффективными для задач, требующих бесшовной интеграции нескольких сигналов контроля.
Идеально, возможности ControlNet были бы обучены нативно в модели, в модульном виде, который мог бы вместить поздние и многоожидаемые очевидные инновации, такие как одновременная генерация видео и аудио или родные возможности синхронизации губ (для внешнего аудио).
На данный момент каждая дополнительная функция представляет собой либо задачу постобработки, либо не родную процедуру, которая должна ориентироваться в тесно связанных и чувствительных весах любой основной модели, на которой она работает.
FullDiT
В эту патовую ситуацию приходит новое предложение из Китая, которое предполагает систему, в которой меры, аналогичные ControlNet, прямо встраиваются в генеративную видеомодель на этапе обучения, а не откладываются как после мысли.

Из новой статьи: подход FullDiT может включать наложение идентичности, глубину и движение камеры в родную генерацию и может вызвать любую комбинацию этих одновременно. Источник: https://arxiv.org/pdf/2503.19907
Новый подход, озаглавленный FullDiT, объединяет такие многозадачные условия, как перенос идентичности, построение глубины и движение камеры, в интегрированную часть обученной генеративной видеомодели, для которой авторы создали прототип обученной модели и сопровождающие видеоклипы на сайте проекта.
В примере ниже мы видим генерации, которые включают движение камеры, информацию об идентичности и текстовую информацию (т.е. направляющие текстовые подсказки пользователя):
Нажмите, чтобы воспроизвести. Примеры наложения стилей ControlNet с помощью только родной обученной основной модели. Источник: https://fulldit.github.io/
Следует отметить, что авторы не предлагают свою экспериментальную обученную модель как функциональную модель видеоосновы, а скорее как доказательство концепции для родных моделей текст-видео (T2V) и изображение-видео (I2V), которые предлагают пользователям больше контроля, чем просто подсказка изображения или текстовая подсказка.
Поскольку таких моделей пока нет, исследователи создали новую оценку под названием FullBench для оценки многозадачных видео, и утверждают, что достигли лучших результатов в тестах, подобных предыдущим подходам. Однако, поскольку FullBench была разработана самими авторами, её объективность не проверена, и набор данных из 1 400 случаев может быть слишком ограниченным для более широких выводов.
Возможно, наиболее интересным аспектом архитектуры, представленной в статье, является её потенциал включать новые типы контроля. Авторы заявляют:
‘В этой работе мы исследуем только условия контроля камеры, идентичности и глубины. Мы не исследовали другие условия и модальности, такие как аудио, речь, облако точек, рамки объектов, оптический поток и т. д. Хотя дизайн FullDiT может без проблем интегрировать другие модальности с минимальными изменениями архитектуры, вопрос о том, как быстро и эффективно адаптировать существующие модели к новым условиям и модальностям, всё ещё является важным вопросом, который требует дальнейшего исследования.’
Хотя исследователи представляют FullDiT как шаг вперёд в многозадачной генерации видео, следует учитывать, что эта новая работа строится на существующих архитектурах, а не вводит фундаментально новую парадигму.
Тем не менее, FullDiT в настоящее время стоитalone (насколько мне известно) как видеомодель основы с встроенными возможностями ControlNet – и хорошо, что предложенная архитектура может вместить поздние инновации тоже.
Нажмите, чтобы воспроизвести. Примеры управления движением камеры с сайта проекта.
Новая статья озаглавлена FullDiT: Многозадачная видеогenerative основная модель с полным вниманием, и исходит от девяти исследователей из Kuaishou Technology и Гонконгского университета. Сайт проекта находится здесь, а новая оценка доступна на Hugging Face.
Метод
Авторы утверждают, что объединённый механизм внимания FullDiT обеспечивает более сильное обучение представлений на пересечении модальностей, захватывая как пространственные, так и временные отношения между условиями:

Согласно новой статье, FullDiT интегрирует несколько входных условий через полное само-внимание, преобразуя их в объединённую последовательность. В отличие от этого, модели на основе адаптеров (самые левые) используют отдельные модули для каждого входа, что приводит к избыточности, конфликтам и более слабой производительности.
В отличие от настроек на основе адаптеров, которые обрабатывают каждый входной поток отдельно, эта общая структура внимания избегает конфликтов ветвей и снижает избыточность параметров. Они также утверждают, что архитектура может масштабироваться до новых типов входных данных без значительных изменений в конструкции – и что схема модели показывает признаки обобщения на комбинации условий, не виденных во время обучения, таких как связывание движения камеры с идентичностью персонажа.
Нажмите, чтобы воспроизвести. Примеры генерации идентичности с сайта проекта.
В архитектуре FullDiT все входные условия – такие как текст, движение камеры, идентичность и глубина – сначала преобразуются в объединённый формат токенов. Эти токены затем объединяются в одну длинную последовательность, которая обрабатывается через стек трансформерных слоёв с использованием полного само-внимания. Этот подход следует предыдущим работам, таким как Open-Sora Plan и Movie Gen.
Этот дизайн позволяет модели изучать временные и пространственные отношения совместно во всех условиях. Каждый трансформерный блок работает над всей последовательностью, обеспечивая динамические взаимодействия между модальностями без использования отдельных модулей для каждого входа – и, как мы отметили, архитектура разработана для того, чтобы быть расширяемой, что делает её намного проще включать дополнительные сигналы контроля в будущем, без значительных структурных изменений.
Сила трёх
FullDiT преобразует каждый сигнал контроля в стандартизированный формат токенов, чтобы все условия могли быть обработаны вместе в объединённом внимании. Для движения камеры модель кодирует последовательность внешних параметров – таких как положение и ориентация – для каждого кадра. Эти параметры имеют временные метки и проектируются в векторы вложения, отражающие временную природу сигнала.
Информация об идентичности обрабатывается иначе, поскольку она является внутренне пространственной, а не временной. Модель использует карты идентичности, которые указывают, какие персонажи присутствуют в каких частях каждого кадра. Эти карты делятся на платы, с каждой платой, проецируемой в вложение, которое захватывает пространственные сигналы идентичности, позволяя модели ассоциировать конкретные регионы кадра с конкретными сущностями.
Глубина является пространственно-временным сигналом, и модель обрабатывает его, разделяя видео глубины на 3D-платы, охватывающие как пространство, так и время. Эти платы затем встраиваются в способ, который сохраняет их структуру на протяжении кадров.
Как только они встроены, все эти токены условий (камера, идентичность и глубина) объединяются в одну длинную последовательность, позволяя FullDiT обрабатывать их вместе с использованием полного само-внимания. Это общее представление позволяет модели изучать взаимодействия между модальностями и во времени без использования изолированных потоков обработки.
Данные и тесты
Подход к обучению FullDiT полагался на выборочно аннотированные наборы данных, адаптированные к каждому типу условий, а не требовал, чтобы все условия были присутствуют одновременно.
Для текстовых условий инициатива следует структурированному подходу к подписыванию, изложенному в проекте MiraData.

Сбор и аннотация видео из проекта MiraData. Источник: https://arxiv.org/pdf/2407.06358
Для движения камеры основным источником данных был набор RealEstate10K из-за его высококачественных аннотаций параметров камеры.
Однако авторы отметили, что обучение исключительно на статических наборах данных камеры, таких как RealEstate10K, склонялось к уменьшению динамических объектов и движений человека в сгенерированных видео. Чтобы противодействовать этому, они провели дополнительную настройку с использованием внутренних наборов данных, которые включали более динамичные движения камеры.
Аннотации идентичности были сгенерированы с помощью конвейера, разработанного для проекта ConceptMaster, который позволял эффективно фильтровать и извлекать тонкую информацию об идентичности.

Фреймворк ConceptMaster разработан для решения проблем с декуплингом идентичности, сохраняя при этом верность концепции в настраиваемых видео. Источник: https://arxiv.org/pdf/2501.04698
Аннотации глубины были получены из набора Panda-70M с использованием Depth Anything.
Оптимизация через упорядочение данных
Авторы также реализовали прогрессивный график обучения, вводя более сложные условия раньше в обучении, чтобы обеспечить, что модель получила прочные представления до того, как были добавлены более простые задачи. Порядок обучения шёл от текста к камере, затем идентичности, и, наконец, глубине, с более простыми задачами, обычно вводимыми позже и с меньшим количеством примеров.
Авторы подчёркивают ценность упорядочения рабочей нагрузки таким образом:
‘Во время фазы предварительного обучения мы отметили, что более сложные задачи требуют продленного времени обучения и должны быть введены раньше в процессе обучения. Эти сложные задачи включают сложные распределения данных, которые существенно отличаются от выходного видео, требуя от модели иметь достаточную способность точно захватить и представить их. ‘
‘Напротив, введение более простых задач слишком рано может привести модель к тому, чтобы она сначала научится им, поскольку они обеспечивают более немедленную обратную связь оптимизации, что препятствует сходимости более сложных задач.’

Иллюстрация порядка обучения данных, принятого исследователями, с красным, указывающим на больший объём данных.
После начального предварительного обучения окончательная стадия настройки进一步 усовершенствовала модель, чтобы улучшить визуальное качество и динамику движения. После этого обучение следовало тому же, что и стандартный диффузионный фреймворк*:
Шум добавлялся к видео-латентам, и модель училась предсказывать и удалять его, используя встроенные токены условий в качестве руководства.
Чтобы эффективно оценить FullDiT и обеспечить справедливое сравнение с существующими методами, и в отсутствие наличия любой другой подходящей оценки, авторы ввели FullBench, кураторскую оценку, состоящую из 1 400 отдельных тестовых случаев.

Экземпляр обозревателя данных для новой оценки FullBench. Источник: https://huggingface.co/datasets/KwaiVGI/FullBench
Каждая точка данных обеспечивала аннотации истинных значений для различных сигналов условий, включая движение камеры, идентичность и глубину.
Метрики
Авторы оценили FullDiT, используя десять метрик, охватывающих пять основных аспектов производительности: выравнивание текста, контроль камеры, сходство идентичности, точность глубины и общее качество видео.
Выравнивание текста измерялось с помощью CLIP-похожести, в то время как контроль камеры оценивался через ошибку вращения (RotErr), ошибку перевода (TransErr) и согласованность движения камеры (CamMC), следующим подходу CamI2V (в проекте CameraCtrl).
Сходство идентичности оценивалось с помощью DINO-I и CLIP-I, и точность контроля глубины количественно оценивалась с помощью средней абсолютной ошибки (MAE).
Качество видео оценивалось тремя метриками из MiraData: сходством CLIP на уровне кадров для плавности; расстоянием оптического потока для динамики; и оценками LAION-Aesthetic для визуальной привлекательности.
Обучение
Авторы обучили FullDiT, используя внутреннюю (не раскрытую) модель диффузии текст-видео, содержащую примерно один миллиард параметров. Они намеренно выбрали скромный размер параметров, чтобы сохранить справедливость в сравнениях с предыдущими методами и обеспечить воспроизводимость.
Поскольку обучающие видео различались по длине и разрешению, авторы стандартизировали каждый батч, изменяя и дополняя видео до общего разрешения, выборочно пробуя 77 кадров в каждой последовательности, и используя применённое внимание и маски потерь, чтобы оптимизировать эффективность обучения.
Оптимизатор Adam использовался при скорости обучения 1×10−5 на кластере из 64 GPU NVIDIA H800, общим объёмом 5 120 ГБ видеопамяти (рассмотрите, что в энтузиастских синтетических сообществах 24 ГБ на RTX 3090 всё ещё считается роскошным стандартом).
Модель была обучена примерно за 32 000 шагов, включая до трёх идентичностей на видео, вместе с 20 кадрами условий камеры и 21 кадром условий глубины, оба из которых были равномерно отобраны из общего количества 77 кадров.
Для вывода модель генерировала видео с разрешением 384×672 пикселя (приблизительно пять секунд при 15 кадрах в секунду) с 50 шагами вывода диффузии и масштабом руководства классификатора в пять.
Предыдущие методы
Для оценки камеры-видео авторы сравнили FullDiT с MotionCtrl, CameraCtrl и CamI2V, все модели были обучены с использованием набора данных RealEstate10K, чтобы обеспечить последовательность и справедливость.
В генерации, обусловленной идентичностью, поскольку не было доступно сравнимых открытых моделей с несколькими идентичностями, модель была оценена против 1-миллиардного параметра модели ConceptMaster, используя те же обучающие данные и архитектуру.
Для задач глубина-видео сравнения были проведены с Ctrl-Adapter и ControlVideo.

Количественные результаты для однозадачной генерации видео. FullDiT был сравнен с MotionCtrl, CameraCtrl и CamI2V для генерации камера-видео; ConceptMaster (1-миллиардный параметр) для генерации идентичность-видео; и Ctrl-Adapter и ControlVideo для генерации глубина-видео. Все модели были оценены с использованием их настроек по умолчанию. Для последовательности 16 кадров были равномерно отобраны из каждого метода, соответствующие длине выхода предыдущих моделей.
Результаты показывают, что FullDiT, несмотря на то, что он обрабатывает несколько сигналов условий одновременно, достиг лучших результатов в метриках, связанных с текстом, движением камеры, идентичностью и глубиной.
В общих метриках качества система в целом превзошла другие методы, хотя её плавность была немного ниже, чем у ConceptMaster. Здесь авторы комментируют:
‘Плавность FullDiT немного ниже, чем у ConceptMaster, поскольку расчет плавности основан на сходстве CLIP между соседними кадрами. Поскольку FullDiT демонстрирует значительно большую динамику по сравнению с ConceptMaster, метрика плавности затронута большими вариациями между соседними кадрами. ‘
‘Для оценки эстетики, поскольку модель оценки отдает предпочтение изображениям в стиле живописи, а ControlVideo обычно генерирует видео в этом стиле, он достигает высокого балла в эстетике.’
Что касается качественного сравнения, возможно, лучше обратиться к образцам видео на сайте проекта FullDiT, поскольку примеры PDF неизбежно статичны (и также слишком велики, чтобы полностью воспроизвести здесь).

Первая часть воспроизведенных качественных результатов в PDF. Пожалуйста, обратитесь к исходной статье для дополнительных примеров, которые слишком обширны, чтобы полностью воспроизвести здесь.
Авторы комментируют:
‘FullDiT демонстрирует лучшее сохранение идентичности и генерирует видео с лучшей динамикой и визуальным качеством по сравнению с [ConceptMaster]. Поскольку ConceptMaster и FullDiT обучены на одной и той же базовой модели, это подчеркивает эффективность внедрения условий с полным вниманием. ‘
‘… Результаты демонстрируют лучший контроль и качество генерации FullDiT по сравнению с существующими методами глубина-видео и камера-видео.’

Часть примеров выходных данных FullDiT с несколькими сигналами. Пожалуйста, обратитесь к исходной статье и сайту проекта для дополнительных примеров.
Вывод
Хотя FullDiT – это интересное начинание в более полнофункциональном виде видеомодели основы, можно задаться вопросом, оправдан ли спрос на инструментарии ControlNet-стиля, чтобы реализовать такие функции в крупном масштабе, по крайней мере для проектов с открытым исходным кодом, которые будут бороться за получение огромного количества мощностей обработки GPU без коммерческой поддержки.
Основной проблемой является то, что использование систем, таких как Глубина и Поза, обычно требует знакомства с относительно сложными интерфейсами пользователя, такими как ComfyUI. Поэтому кажется, что функциональная модель с открытым исходным кодом такого типа с наибольшей вероятностью будет разработана группой небольших компаний по визуальным эффектам, которые не имеют денег (или воли, учитывая, что такие системы быстро становятся устаревшими из-за обновлений моделей) для курирования и обучения такой модели за закрытыми дверями.
С другой стороны, системы API-управляемого ‘аренды ИИ’ могут быть хорошо мотивированы разработать более простые и удобные интерпретационные методы для моделей, в которые были напрямую обучены вспомогательные системы контроля.
Нажмите, чтобы воспроизвести. Контроль Глубина+Текст, наложенный на генерацию видео с помощью FullDiT.
* Авторы не указывают известную базовую модель (например, SDXL и т. д.)
Опубликовано впервые в четверг, 27 марта 2025 года












