Взгляд Anderson

В сторону постоянной генерации глубоких подделок видео в полном объеме

mm
Добавьте Unite.AI в избранные источники в Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

В области, где требуется терпение, новая система продвигает нас немного ближе к прямой трансляции человеческой симуляции без раздражающих раундов рендеринга.

 

Состояние искусства в полноценной симуляции человека продвинулось далеко с тех пор, как впервые появилась возможность полноценных глубоких подделок в 2022 году. Теперь мы привыкли к впечатляющей и часто противоречивой способности открытых систем, таких как Wan-Animate, и закрытых систем, таких как Grok, преобразовывать один или несколько изображений в последовательное и часто трансформирующее видео-выступление:

Нажмите, чтобы воспроизвести, если необходимо. Примеры замены человека с помощью WanAnimate-2.2. Пожалуйста, обратитесь к источнику для лучшего разрешения.  Источник 

Кроме того, старая автоэнкодерная основа для прямой трансляции глубоких подделок лица DeepFaceLive уже была превзойдена более совершенными основами, такими как Deep-Live-Cam, которые используют оркестровку LivePortrait итераций, а также наследственные GAN и InsightFace модули, чтобы создать эффективного реального времени преемника (брошенного) проекта DFLive:

Нажмите, чтобы воспроизвести: Илон Маск в глубокой подделке в прямом видео-сессии с помощью Deep-Live-Cam. Пожалуйста, обратитесь к источнику для лучшего разрешения. Источник 

Однако, хотя основы, такие как Deep-Live-Cam, могут работать бесконечно и создавать глубокие подделки бесконечно, и хотя они лучше справляются с трудными углами лица чем раньше, результаты все равно ограничены в плане разрешения и возможностей: вы можете получить конкретное лицо/идентичность, и оно может делать много вещей, таких как убедительные выражения лица и синхронизация губ – но это по сути одноразовая вещь.

BRB…

Большинство текущих систем имитации человека с помощью ИИ также ограничены и/или “специализированы”. Одним из таких ограничений является то, что лучшие системы симуляции/имитации человека являются оффлайн – то есть они слишком требовательны к ресурсам, чтобы работать в реальном времени, и вместо этого должны уйти, рассчитать решение и представить результат пользователю позже.

Очевидно, что такие системы не подходят для прямой трансляции ИИ, такой как трансформация всего диапазона движений тела, например танца, в прямом эфире.

Примером этого в последние годы является открытая система Wan2.2. Animate, которая стала хитом среди хоббиистов и профессионалов – но опять же, это сценарий “сгенерируй и подожди”:

Нажмите, чтобы воспроизвести. Из 2025 года, примеры впечатляющих возможностей Wan2.2-Animate – если вы можете немного подождать. Пожалуйста, обратитесь к источнику для лучшего разрешения. Источник 

Итак, как оно стоит сейчас, вы можете иметь его отлично, иметь его универсально или иметь его сейчас – выберите два.

LiveAnimate

В эту патовую ситуацию приходит новое предложение из Китая, которое эффективно превращает Wan2.2 Animate в живую анимационную основу, работающую, в настоящее время, на уважительном уровне gần-20 кадров в секунду, с впечатляющими результатами в различных сценариях:

Нажмите, чтобы воспроизвести: Из проекта, LiveAnimate передает управляющие позы через танец на сцене, полное тело на открытом воздухе и крупный план портрета, воспроизводя движение всего тела, рук и лица. Пожалуйста, обратитесь к источнику для лучшего разрешения. Источник 

Новая работа расширяет исходную систему в живую версию, изменив как генерируется видео: вместо обработки прошлых и будущих кадров вместе, LiveAnimate генерирует каждый новый сегмент, пока действие разворачивается, используя только несколько шагов, сохраняя выбранные ранее позы, чтобы сохранить постоянный вид субъекта в течение долгих сессий.

По сути, система сохраняет ранее кадры как метод постоянной памяти, чтобы опираться на них, пока видео развивается, так что идентичность остается постоянной – не совсем не похожим на то, как старые системы CGI ссылаются на текстурные карты.

Хотя в процессе обработки используется LoRA, LiveAnimate не является просто еще одной системой LoRA – его потоковая генерация, система памяти/кэша, трехшаговое вывод и оптимизация GPU представляют собой дополнительные механизмы, помимо различных других технологий (некоторые удивительно старые) в его репертуаре.

Новая система может справиться не только с полным телом, но и с движениями верхней части тела, такими как в интервью:

Нажмите, чтобы воспроизвести. ‘Нежное движение головы и рук над статичной офисной сценой’.

Чтобы быть справедливым в отношении его ограничений, новая статья признает, что две из соперничающих основ были способны сохранить идентичность немного лучше в определенных конкретных обстоятельствах; тем не менее, ни одна из соперниц не является онлайн-системой, а авторы новой работы явно толкают границы в правдоподобном и оптимистичном направлении.

Кроме того, возможно, стоит отметить, что вывод требует двух GPU H100 NVIDIA, всего 160 ГБ видеопамяти*.

Статья гласит:

‘LiveAnimate поддерживает почти постоянное воспринимаемое качество и идентичность с первого 30 секунд до последнего [минуты], в то время как предыдущие системы ухудшаются существенно или требуют часов офлайн-вычислений для того же раскатывания.

‘Эти результаты устанавливают новую точку операции в качестве качества, задержки и продолжительности для интерактивной полноценной анимации.’

Новая статья называется LiveAnimate: Стабильная долгосрочная потоковая анимация человека в реальном времени и приходит от девяти авторов из Китайского университета Гонконга, Qwen Applications Business Group of Alibaba и Liblib AI. Сайт проекта, полный видео, представленных в этой статье, также доступен, а код ‘скоро появится’, и веса… кто знает?

Метод

LiveAnimate представляет собой двухэтапный процесс обучения, предназначенный для того, чтобы Wan2.2-Animate генерировал непрерывно и быстро, за которым следует система памяти, которая извлекает полезные ранее позы, пока каждый новый блок видео производится:

Обзор конвейера LiveAnimate, показывающий его двухэтапный процесс обучения слева и живую генерацию справа, где входящие позы сопоставляются с сохраненными ранее позами и объединяются с недавними кадрами, чтобы сгенерировать каждый новый блок видео за три шага. Источник - https://arxiv.org/pdf/2608.11745

Обзор конвейера LiveAnimate, показывающий его двухэтапный процесс обучения слева и живую генерацию справа, где входящие позы сопоставляются с сохраненными ранее позами и объединяются с недавними кадрами, чтобы сгенерировать каждый новый блок видео за три шага. Источник 

Исходный Wan2.2-Animate предназначен для рассмотрения целой последовательности, а не генерации бесконечно расширяющегося видео. Следовательно, чтобы адаптировать его, авторы разделили видео обучения на последовательные блоки, каждый из которых генерируется с использованием ранее блоков в качестве контекста/эталона. Это изначально учит модель продолжать с надежного предыдущего материала, прежде чем иметь дело с ошибками, накопленными из своего собственного вывода.

Не забудь меня

На протяжении всего этого процесса исходное изображение-эталон сохраняется постоянно доступным через ‘Ref Sink’, предоставляя фиксированное напоминание об идентичности и внешности человека. Как только блок завершен, ‘Clean KV Update’ преобразует информацию, полученную из него, в исторический контекст для последующих блоков (хотя это не ремонтирует существующие ошибки).

Этот первый этап обучения все еще требует 50 шагов денойзинга на блок, что делает живую операцию непрактичной. Второй этап поэтому упрощает процесс до трех шагов, представляя модель ее собственной сгенерированной истории, поскольку развертывание требует, чтобы каждая новая секция зависела от несовершенного ранее вывода:

Два этапа обучения†, используемые для подготовки LiveAnimate к развертыванию, сначала обучаясь от чистых предыдущих блоков видео – затем уменьшая генерацию до трех шагов, обучаясь на собственной несовершенной модели вывода.

Два этапа обучения†, используемые для подготовки LiveAnimate к развертыванию, сначала обучаясь от чистых предыдущих блоков видео – затем уменьшая генерацию до трех шагов, обучаясь на собственной несовершенной модели вывода.

Обучение против этих самосгенерированных последовательностей представляет еще одну проблему, поскольку сохранение всей вычислительной истории видео было бы чрезвычайно дорого. Вместо этого делается один полный пробный запуск, затем пересматривается, один блок за раз, для обучения. Каждый блок может поэтому получить обновление без сохранения всей последовательности вычислительной ‘жизни’.

В сочетании с LoRA-адаптацией это позволяет 14-миллиардному модели быть дистиллированной на одном узле, содержащем восемь 80-ГБ GPU H100 (отмечая, что этот кластер предназначен для обучения, а не для вывода).

Не останавливайся сейчас

Для бесконечной генерации LiveAnimate также должен решить, что стоит запомнить. Сохранение всего сделало бы требования к обработке неконтролируемо; но сохранение только недавних кадров также могло бы выбросить полезные ранее виды.

Следовательно Pose-Retrieval Sink Attention (PR-Sink) решает эту проблему, сохраняя первый сгенерированный блок как постоянный ‘Static Sink’ – ранее поза, работающая как заменяющий ‘Dynamic Sink’, и скользящее окно, содержащее текущий и два предыдущих блока. Изображение-эталон остается отдельно доступным через Ref Sink, в то время как фиксированные размеры хранилища предотвращают рост затрат по мере увеличения длины видео.

Войны блоков

Чтобы выбрать более старые позы для этой ограниченной памяти, ViTPose уменьшает положения тела и рук через три кадра в компактное представление. Хранилище памяти содержит пять таких представительных поз и заполняется в течение первых 20 блоков, отдавая предпочтение разнообразным позам над почти дубликатами.

Во время генерации входящая поза сравнивается с этими представителями, и извлекается ближайшее совпадение, предоставляя ранее доказательство того, как человек выглядел в подобном положении. Однако непосредственно предыдущий блок исключается, поскольку он уже существует в скользящем окне, оставляя Dynamic Sink свободным для извлечения информации из более раннего времени.

Наконец, сам runtime оптимизирован для скорости путем распределения обработки внимания на два GPU H100, перекрывая связь с вычислениями и повторно используя закэшированную информацию, где это возможно.

Данные и тесты

LiveAnimate был обучен на 40 000 видео с AVSpeech и 20 000 видео с движением человека из TikTok dataset и HumanVid, с обучением и выводом, поддерживающими разрешения 480×480; 384×672; и 672×384 пикселей.

Обучение началось с базовой точки Wan2.2-Animate-14B, используя LoRA с рангом 128, и проводилось на восьми GPU H100 NVIDIA в течение 10 000 шагов на первом этапе и 20 000 на втором.

Видео генерировалось в блоках из трех латентных кадров (внутреннее компрессированное представление модели), соответствующих 12 RGB-кадрам, в то время как вывод выполнялся на двух H100.

Оценка сравнивала LiveAnimate с существующими методами анимации человека, управляемыми позой, как на коротких, так и на длинных последовательностях, используя изображения-эталон и управляющие позы в согласованных условиях. Длинные тесты расширили генерацию до трех минут, чтобы изучить, остаются ли качество и идентичность стабильными во времени.

Тестируемые основы включали EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; и Wan2.2-Animate.

Используемые метрики охватывали визуальное качество, согласованность идентичности, качество распределения и ошибку временного представления. Аэстетический балл (ASE) и оценка качества изображения без эталона (IQA) измеряли кадровое визуальное качество; DINO, сходство (DINO-S), и согласованность внешности с идентичностью эталона; Fréchet Inception Distance (FID), качество распределения; и расстояние видео-MAE (V-MAE), насколько хорошо сгенерированное видео сохраняет движение во времени:

Результаты тестов, касающихся качества и идентичности в течение трех минут непрерывной генерации, с LiveAnimate, остающимся сравнительно стабильным во всех пяти метриках, когда последовательность прогрессирует. Несколько конкурирующих методов показывают большее ухудшение во времени. Более высокие показатели лучше для IQA, ASE и DINO-S, с более низкими показателями лучше для FID и V-MAE.

Результаты тестов, касающихся качества и идентичности в течение трех минут непрерывной генерации, с LiveAnimate, остающимся сравнительно стабильным во всех пяти метриках, когда последовательность прогрессирует. Несколько конкурирующих методов показывают большее ухудшение во времени. Более высокие показатели лучше для IQA, ASE и DINO-S, с более низкими показателями лучше для FID и V-MAE.

Как показано на начальном графике результатов выше, LiveAnimate достиг наивысшего начального ASE 2,823 и IQA 4,047, в течение первых 30 секунд. Авторы утверждают, что это указывает на то, что трехшаговая дистилляция сохраняет воспринимаемое качество, несмотря на уменьшенный вывод бюджета.

Более значимо, LiveAnimate показал мало ухудшения во время трех минут непрерывной генерации, с показателями визуального качества и согласованности идентичности, оставаясь почти неизменными.

Напротив, One-to-All ухудшился существенно во времени, с более низким визуальным качеством и согласованностью идентичности и более высоким ошибкой распределения; и базовый Wan2.2-Animate также показал некоторую потерю согласованности идентичности.

Авторы утверждают:

‘Эти тенденции подтверждают наш центральный аргумент, что явное управление долгосрочным контекстом важно для потоковой анимации.’

Эффективность масштабирования LiveAnimate также была протестирована на GPU. Как показано ниже, 12,41 кадр в секунду был достигнут с одним H100; 19,63 кадра в секунду с двумя; и 22,13 кадра в секунду с четырьмя, с все более ограниченными выигрышами, ограниченными накладными расходами на связь. Два H100 были поэтому выбраны в качестве предпочтительной конфигурации:

Эффективность масштабирования на одном, двух и четырех GPU H100 при разрешении 480×480, показывающая задержку, кадровую частоту, ускорение и эффективность. Два GPU достигли 19,63 кадра в секунду, в то время как дальнейшее масштабирование до четырех произвело только скромное увеличение до 22,13 кадра в секунду.

Эффективность масштабирования на одном, двух и четырех GPU H100 при разрешении 480×480, показывающая задержку, кадровую частоту, ускорение и эффективность. Два GPU достигли 19,63 кадра в секунду, в то время как дальнейшее масштабирование до четырех произвело только скромное увеличение до 22,13 кадра в секунду.

При 19,63 кадре в секунду каждый 12-кадровый блок генерировался за 0,611 секунды. Для сравнения, примерно 2–5 часов были необходимы конкурирующим системам, чтобы сгенерировать ту же трехминутную последовательность.

Качественные тесты показали аналогичные различия: в полноценном тесте, показанном ниже, было обнаружено тяжелое ухудшение в One-to-All; мерцание было произведено UniAnimate-DiT и SCAIL; и позже цвет или фон дрейф стал очевидным с Wan-Animate и EverAnimate.

Результаты тестов, сравнивающие полноценную анимацию в течение трех минут. Кадры были отобраны каждые 20 секунд, с красными аннотациями, подчеркивающими долгосрочное ухудшение в конкурирующих методах. Базовые линии потребовали примерно 2–5 часов, чтобы сгенерировать последовательность, по сравнению с примерно четырьмя минутами для LiveAnimate.

Результаты тестов, сравнивающие полноценную анимацию в течение трех минут. Кадры были отобраны каждые 20 секунд, с красными аннотациями, подчеркивающими долгосрочное ухудшение в конкурирующих методах. Базовые линии потребовали примерно 2–5 часов, чтобы сгенерировать последовательность, по сравнению с примерно четырьмя минутами для LiveAnimate. Пожалуйста, обратитесь к источнику статьи для лучшего разрешения.

LiveAnimate сохранил внешность субъекта и окружающую сцену на протяжении всей трехминутной последовательности. В менее требовательном верхнем теле тесте, показанном ниже, была достигнута аналогичная долгосрочная стабильность EverAnimate и LiveAnimate (хотя реальное время генерации было обеспечено только LiveAnimate):

Результаты тестов, сравнивающие верхнюю часть тела анимации в течение трех минут. Кадры, отобранные каждые 20 секунд, показывают LiveAnimate, сохраняющий идентичность, одежду и темный фон более последовательно, чем конкурирующие методы.

Результаты тестов, сравнивающие верхнюю часть тела анимации в течение трех минут. Кадры, отобранные каждые 20 секунд, показывают LiveAnimate, сохраняющий идентичность, одежду и темный фон более последовательно, чем конкурирующие методы.

Авторы заключают:

‘На трехминутном бенчмарке LiveAnimate поддерживает почти постоянное воспринимаемое качество и идентичность на 19,63 кадре в секунду на двух GPU H100, с памятью и задержкой, независимыми от продолжительности потока, в то время как офлайн-базовые линии ухудшаются заметно или требуют часов вычислений.

‘Эти результаты приближают миллиардномасштабные видео-диффузионные модели к интерактивным приложениям, таким как прямая трансляция, телеприсутствие и виртуальные аватары.’

Вывод

Это обнадеживает видеть, что движущаяся генерация основы принимает новый подход к постоянным проблемам памяти и идентичности, которые мучают генеративное видео. Существует уже много генеративных основ, которые могут ссылаться на фиксированные изображения, предоставленные пользователем, без необходимости ‘вставлять’ изображение-эталон в контент изображение-в-видео.

Однако это решает только некоторые проблемы генерации одного видеоклипа, такие как сохранение идентичности (включая одежду и прическу) человека, который вновь входит в кадр или становится暂енно не видимым, и затем виден снова. На сегодняшний день только тяжелая и временная LoRA-подход сделала некоторые успехи в этих вопросах, хотя и ограниченные и временные.

Для видео, и, в самом деле, для всей текущей ИИ-революции, разработка эффективной постоянной памяти является критической, существенной проблемой – той, которая, скорее всего, определит разницу между появлением ИИ и третьей ИИ-зимой.

 

*  Это все еще ‘готча’? Текущая мысль заключается в том, что более мелкие специализированные модели в конечном итоге будут работать локально, бесплатно, в то время как более высокие потребности будут обслуживаться конкурентным и, надеюсь, балканизированным рынком аренды GPU. Это предполагает, что фронтовые компании не смогут EEE конкуренцию, и что существенная вычислительная мощность GPU останется доступной независимо. На этой основе я больше не считаю чрезмерные требования к GPU недостатком, но надеюсь, что доступ станет все более демократичным, и что последующие оптимизации уменьшат первоначальные требования к ресурсам.

Сгенерировано ИИ и проверено мной.

†† Для тестирования длинных видео SCAIL и UniAnimate-DiT были расширены с тем же обучающим без оконного процедурой, поскольку ни одна из них не поддерживает генерацию длинной формы изначально. EverAnimate и One-to-All были оценены с использованием своих собственных методов генерации длинных видео.

 

Опубликовано впервые в четверг, 13 августа 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai