Взгляд Anderson

ИИ Видео Совершенствует Селфи с Котом

mm
Добавьте Unite.AI в избранные источники в Google
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

Генераторы видео на основе ИИ часто дают результаты, которые близки, но не совсем соответствуют тому, что хотел текстовый запрос. Но новое высокоуровневое решение делает всю разницу.

 

Генеративные видеосистемы часто испытывают трудности в создании видеороликов, которые действительно творческие или необычные, и часто не оправдывают ожиданий пользователей от текстовых запросов.

Одной из причин этого является переплетение – тот факт, что модели зрения/языка должны идти на компромисс в отношении продолжительности обучения на исходных данных. Если обучение слишком короткое, то концепции гибкие, но не полностью сформированные – если слишком длинное, то концепции точные, но уже не достаточно гибкие, чтобы включать их в новые комбинации.

Вы можете получить представление о видео, встроенном ниже. Слева находится тот компромисс, который многие системы ИИ доставляют в ответ на требовательный запрос (запрос находится в верхней части видео во всех четырех примерах), который запрашивает некоторое сочетание элементов, которое слишком фантастично, чтобы быть реальным примером обучения. Справа находится выход ИИ, который лучше соответствует запросу:

Нажмите, чтобы воспроизвести (без аудио). Справа мы видим ‘факторизированный’ WAN 2.2, который действительно соответствует запросам, в сравнении с неясными интерпретациями ‘обычного’ Wan 2.2., слева. Пожалуйста, обратитесь к исходным видеофайлам для лучшего разрешения и многих более примеров, хотя отредактированные версии, показанные здесь, не существуют на сайте проекта и были собраны для этой статьи. Источник

Хорошо, хотя мы должны извиниться за хлопающую утку с человеческими руками (!), rõчно, что примеры справа соответствуют исходному текстовому запросу гораздо лучше, чем те, что слева.

Интересно, что обе архитектуры, представленные здесь, по сути являются одной и той же архитектурой – популярной и очень способной Wan 2.2, китайским релизом, который приобрел значительную популярность в сообществах открытого исходного кода и хоббиистов в этом году.

Разница заключается в том, что вторая генеративная труба факторизирована, что в данном случае означает, что большая языковая модель (LLM) была использована для переинтерпретации первого (семенного) кадра видео, чтобы оно было гораздо легче для системы доставить то, что запрашивает пользователь.

Эта ‘визуальная привязка’ включает в себя инъекцию изображения, созданного из этой LLM-усовершенствованной подсказки в генеративную трубу в качестве ‘стартового кадра’, и использование LoRA интерпретивной модели для помощи в интеграции ‘вторгающегося’ кадра в процесс создания видео.

Результаты, в плане верности запроса, довольно замечательны, особенно для решения, которое кажется довольно элегантным:

Нажмите, чтобы воспроизвести (без аудио). Дальнейшие примеры ‘факторизированных’ видеогенераций, которые действительно соответствуют сценарию. Пожалуйста, обратитесь к исходным видеофайлам для лучшего разрешения и многих более примеров, хотя отредактированные версии, показанные здесь, не существуют на сайте проекта и были собраны для этой статьи.

Это решение приходит в форме новой статьи Факторизированная Генерация Видео: Разделение Построения Сцены и Временной Синтеза в Моделях Диффузии Текст-Видео, и ее видеозаполненного сопровождающего сайта проекта.

Хотя многие текущие системы пытаются повысить точность запроса, используя языковые модели для переписывания неясных или недоопределенных текстов, новая работа утверждает, что эта стратегия все равно приводит к неудаче, когда внутреннее представление сцены модели является ошибочным.

Даже с подробным переписанным запросом, модели текст-видео часто неправильно составляют ключевые элементы или генерируют несовместимые начальные состояния, которые нарушают логику анимации. Пока первый кадр не отражает то, что описывает запрос, результирующее видео не может восстановиться, независимо от того, насколько хороша модель движения.

Статья гласит*:

‘[Текст-видео] модели часто производят распределенно смещенные кадры, но все равно достигают [оценочных баллов] сравнимых с I2V-моделями, указывая на то, что их моделирование движения остается разумно естественным, даже когда верность сцены относительно низкая.

‘[Изображение-видео] модели демонстрируют дополнительное поведение, сильные [оценочные баллы] от точных начальных сцен и более слабую временную когерентность, в то время как I2V+текст балансирует оба аспекта.

‘Этот контраст предполагает структурное несоответствие в текущих T2V-моделях: привязка сцены и временная синтез пользуются разными индуктивными предубеждениями, но существующие архитектуры пытаются выучить оба одновременно в одной модели.’

Диагностическое сравнение режимов генерации показало, что модели без явной привязки сцены хорошо справились с движением, но часто компрометировали макет сцены, в то время как подходы, основанные на изображении, показали обратный шаблон:

Сравнение режимов генерации видео на двух наборах данных, показывающее, что I2V+текст достигает лучшего качества кадра (FID) и временной когерентности (FVD), подчеркивая выгоду от разделения построения сцены и движения.

Сравнение режимов генерации видео на двух наборах данных, показывающее, что I2V+текст достигает лучшего качества кадра (FID) и временной когерентности (FVD), подчеркивая выгоду от разделения построения сцены и движения. Источник

Эти результаты указывают на структурную ошибку, при которой текущие модели пытаются выучить как макет сцены, так и анимацию одновременно, хотя эти две задачи требуют разных видов индуктивного предубеждения и лучше обрабатываются отдельно.

Возможно, наиболее интересно то, что этот ‘трюк’ может быть применен к локальным установкам моделей, таких как Wan 2.1 и 2.2, и подобных моделей диффузии видео, таких как Hunyuan Video. Анекдотически, сравнивая качество выхода хоббиистов с коммерческими порталами генерации, такими как Kling и Runway, большинство крупных поставщиков API улучшают открытое программное обеспечение, такое как WAN, с помощью LoRAs, и, кажется, с помощью трюков, подобных тем, что показаны в новой статье. Следовательно, этот подход может представлять собой возможность для FOSS-контингента.

Тесты, проведенные для метода, показывают, что этот простой и модульный подход предлагает новый уровень качества на бенчмарке T2V-CompBench, значительно улучшая все протестированные модели. Авторы отмечают в заключении, что хотя их система радикально улучшает верность, она не решает (и не предназначена для решения) дрейф идентичности, который в настоящее время является бичом исследований генеративного ИИ.

Новая статья исходит от четырех исследователей из Ecole Polytechnique Fédérale de Lausanne (EPFL) в Швейцарии.

Метод и Данные

Центральная пропозиция нового метода заключается в том, что модели диффузии текст-видео (T2V) необходимо ‘привязать’ к начальному кадрам, которые действительно соответствуют желаемому текстовому запросу.

Чтобы обеспечить уважение модели к начальному кадру, новый метод нарушает стандартный процесс диффузии путем инъекции чистого латентного от привязки изображения на нулевой временной шаг, заменяя один из обычных шумовых входов. Этот незнакомый вход сначала сбивает модель с толку, но с минимальным LoRA тонким настройкой она учится относиться к инъектированному кадру как к фиксированной визуальной привязке, а не как к части шумовой траектории:

Двухэтапный метод для привязки генерации текст-видео с визуальной привязкой: слева, модель тонко настраивается с помощью легкого LoRA для того, чтобы относиться к инъектированному чистому латентному как к фиксированному ограничению сцены. Справа, запрос делится на подпись первого кадра, которая используется для генерации привязки изображения, руководящего видео.

Двухэтапный метод для привязки генерации текст-видео с визуальной привязкой: слева, модель тонко настраивается с помощью легкого LoRA для того, чтобы относиться к инъектированному чистому латентному как к фиксированному ограничению сцены. Справа, запрос делится на подпись первого кадра, которая используется для генерации привязки изображения, руководящего видео.

При выводе метод переписывает запрос, чтобы описать только первый кадр, используя LLM для извлечения правдоподобного начального состояния сцены, сосредоточенного на макете и внешнем виде.

Этот переписанный запрос передается генератору изображений для создания кандидата на привязку кадра (который может быть необязательно уточнен пользователем). Выбранный кадр кодируется в латент и инъектируется в процесс диффузии путем замены первого временного шага, позволяя модели генерировать остальную часть видео при сохранении привязки к начальному состоянию сцены – процесс, который работает без необходимости изменений в базовой архитектуре.

Процесс был протестирован путем создания LoRAs для Wan2.2-14B, Wan2.1-1B и CogVideo1.5-5B. Обучение LoRA проводилось на ранге 256, на 5000 случайно отобранных клипов из коллекции UltraVideo.

Обучение длилось 6000 шагов и потребовало 48 часов GPU для Wan-1B и CogVideo-5B, и 96 часов GPU для Wan-14B. Авторы отмечают, что Wan-5B изначально поддерживает текстовое и текстово-изображенное условие (которые в данном случае наложены на более старые кадры), и поэтому не требовало никакой тонкой настройки.

Тесты

В экспериментах, проведенных для процесса, каждый текстовый запрос изначально уточнялся с помощью Qwen2.5-7B-Instruct, который использовал результат для создания подробной ‘семенной’ подписи, содержащей описание всей сцены. Это затем передавалось QwenImage, который был задачей генерировать ‘магический кадр’ для интерпозиции в процесс диффузии.

Бенчмарки, использованные для оценки системы, включали упомянутый выше T2V-CompBench, для тестирования композиционного понимания путем оценки того, насколько хорошо модели сохраняют объекты, атрибуты и действия в рамках связной сцены; и VBench 2.0, для оценки более широкого рассуждения и последовательности по 18 метрикам, сгруппированным в креативность, здравый смысл, контролируемость, человеческая достоверность и физика:

По всем семи категориям оценки T2V-CompBench факторизированный метод T2V превосходит как стандартный, так и увеличенный базовый T2V, с выигрышами до 53,25%. Наиболее высокие варианты часто соответствуют или превышают проприетарный PixVerse-V3 бенчмарк.

По всем семи категориям оценки T2V-CompBench факторизированный метод T2V превосходит как стандартный, так и увеличенный базовый T2V, с выигрышами до 53,25%. Наиболее высокие варианты часто соответствуют или превышают проприетарный PixVerse-V3 бенчмарк.

Что касается этого начального раунда тестов, авторы заявляют*:

‘[Для] всех моделей добавление привязки изображения последовательно улучшает композиционные выступления. Все более мелкие факторизированные модели (CogVideo 5B, Wan 5B и Wan 1B) превосходят более крупную модель T2V Wan 14B.

Наша факторизированная модель Wan 5B также превосходит коммерческий PixVerse-V3 бенчмарк, который является лучшим зарегистрированным моделью на бенчмарке. Это демонстрирует, что визуальная привязка существенно улучшает понимание сцены и действия, даже в моделях меньшей емкости.

‘В каждой модели семейства факторизированная версия превосходит исходную модель. Заметно, что наша легкая привязка LoRA на WAN 14B достигает производительности, сравнимой с ее предварительно обученной версией I2V 14B (0,661 против 0,666), несмотря на то, что не требует полного повторного обучения.’

Далее последовал раунд VBench2.0:

Факторизированный подход T2V последовательно улучшает производительность VBench 2.0 по композиции, здравому смыслу, контролируемости и физике, с некоторыми выигрышами, превышающими 60% – хотя человеческая достоверность остается ниже проприетарного Veo 3 бенчмарка.

Факторизированный подход T2V последовательно улучшает производительность VBench 2.0 по композиции, здравому смыслу, контролируемости и физике, с некоторыми выигрышами, превышающими 60% – хотя человеческая достоверность остается ниже проприетарного Veo 3 бенчмарка.

По всем архитектурам факторизированный подход увеличивает баллы в каждой категории VBench, кроме человеческой достоверности, которая немного снизилась даже с увеличением запроса. WAN 5B превосходит более крупную WAN 14B, подкрепляя предыдущие результаты T2V-CompBench, которые визуальная привязка вносит больший вклад, чем масштаб.

Хотя выигрыши на VBench были последовательными, они были меньше, чем те, которые были видны на T2V-CompBench, и авторы приписывают это более строгому бинарному режиму оценки VBench.

Для качественных тестов статья поставляет статические изображения, но мы отсылаем читателя к составным видеороликам, встроенным в эту статью, для более ясного представления, с оговоркой, что исходные видеофайлы более многочисленны и разнообразны, а также обладают большим разрешением и детализацией. Найти их можно здесь. Что касается качественных результатов, статья гласит:

‘Привязанные видео последовательно демонстрируют более точную композицию сцены, более сильную привязку объекта-атрибута и более четкое временное развитие.’

Факторизированный метод остался стабильным даже тогда, когда количество шагов диффузии было сокращено с 50 до 15, показав почти никакой потери производительности на T2V-CompBench. Напротив, как текстовые, так и увеличенные базовые модели ухудшились резко при тех же условиях.

Хотя сокращение шагов могло бы теоретически утроить скорость, полная труба генерации стала только в 2,1 раза быстрее на практике, из-за фиксированных затрат от генерации привязки изображения. Тем не менее, результаты показали, что привязка не только улучшает качество выборки, но и помогает стабилизировать процесс диффузии, поддерживая более быструю и эффективную генерацию без потери точности.

Сайт проекта предоставляет примеры увеличенных и новых методов генерации, из которых мы предлагаем несколько (с меньшим разрешением) отредактированных примеров здесь:

Нажмите, чтобы воспроизвести (без аудио). Источники, увеличенные в начале, против подхода авторов.

Авторы заключают:

‘Наши результаты предполагают, что улучшенная привязка, а не только увеличение емкости, может быть одинаково важной. Недавние достижения в диффузии T2V сильно полагались на увеличение размера модели и обучающих данных, но даже крупные модели часто испытывают трудности в выводе связной начальной сцены из текста alone.

‘Это контрастирует с диффузией изображений, где масштабирование относительно простое; в моделях видео каждое архитектурное улучшение должно работать над дополнительным временным измерением, что делает масштабирование существенно более ресурсоемким.

‘Наши результаты показывают, что улучшенная привязка может дополнить масштаб, решая другую проблему: установление правильной сцены, прежде чем начнется синтез движения.

‘Факторизируя генерацию видео на композицию сцены и временную модель, мы смягчаем несколько распространенных режимов неудач без необходимости существенно более крупных моделей. Мы рассматриваем это как дополнительный принцип проектирования, который может направлять будущие архитектуры к более надежной и структурированной синтезе видео.’

Заключение

Хотя проблемы переплетения очень реальны и могут потребовать специальных решений (таких как улучшенная курирование и оценка перед обучением), было интересно наблюдать, как факторизация ‘распутала’ несколько упрямых и ‘застрявших’ концепций запроса в гораздо более точные представления – всего лишь с умеренным слоем LoRA-условий и вмешательством значительно улучшенного стартового/семенного изображения.

Пропасть в ресурсах между локальной инференцией хоббиистов и коммерческими решениями может быть не такой огромной, как предполагалось, поскольку почти все поставщики стремятся рационализировать свои значительные затраты на GPU для потребителей.

Анекдотически, очень большое количество текущих поставщиков генеративных видеороликов, кажется, используют брендированные и, в целом, ‘усовершенствованные’ версии китайских моделей с открытым исходным кодом. Основная ‘пропасть’ этих ‘посредников’ систем, кажется, заключается в том, что они потратились на обучение LoRAs или – с большими затратами и немного большей выгодой – провели полную тонкую настройку весов моделе醆.

Проникновение в такие знания может помочь закрыть эту пропасть дальше, в контексте сцены выпуска, где китайцы, кажется, решительно настроены (не обязательно по альтруистическим или идеалистическим причинам) демократизировать генеративный ИИ, в то время как западные деловые интересы, возможно, предпочли бы, чтобы увеличение размера модели и регулирование в конечном итоге изолировали хорошие модели за API и несколькими слоями контент-фильтров.

 

* Акценты авторов, а не мои.

Статья не указывает, какой GPU был выбран или сколько из них было использовано.

†† Хотя путь LoRA более вероятен, как с точки зрения экономической легкости использования, так и потому, что полные веса, а не квантованные веса, не всегда доступны.

Опубликовано впервые в пятницу, 19 декабря 2025 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]