Погляд Anderson

До безперервної генерації повного тіла глибоких фейків відео

mm
Додайте Unite.AI до бажаних джерел у Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

У сфері, де потрібна терпіння, нова система підштовхує нас трохи ближче до живої трансляції людської симуляції без розчаруючих раундів рендерингу.

 

Стан мистецтва у повному тілі людської симуляції пройшов довгий шлях від моменту, коли вперше з’явилася можливість повного тіла глибоких фейків у 2022 році. Тепер ми вже звикли до потужної та часто суперечливої здатності відкритих систем, таких як Wan-Animate, та закритих систем, таких як Grok, перетворювати одну або багатьох зображень у послідовну та часто трансформуючу відео-виступу:

Натисніть, щоб відтворити, якщо необхідно. Приклади заміни особи за допомогою WanAnimate-2.2. Будь ласка, зверніться до джерела для кращої роздільності.  Джерело 

Крім того, старша автоенкодер-підтримувана система живих глибоких фейків обличчя DeepFaceLive вже була перевершена більш складними рамками, такими як Deep-Live-Cam, які використовують оркестрацію LivePortrait-ітерацій, а також спадкові GAN та InsightFace-модулів, щоб створити ефективного реального часу спадкоємця (тепер покинутої) проєкту DFLive:

Натисніть, щоб відтворити: Ілон Маск глибоко фейковий в живій відеосесії через Deep-Live-Cam. Будь ласка, зверніться до джерела для кращої роздільності. Джерело 

Однак, хоча рамки, такі як Deep-Live-Cam, можуть працювати нескінченно і фейкувати нескінченно, і хоча вони кращі у генерації складних кутів обличчя ніж раніше, результати все ж обмежені за роздільністю та можливостями: ви можете отримати певну особу/ідентичність, і вона може робити багато речей, таких як переконливі вирази обличчя та синхронізація губ – але це по суті один трюк.

BRB…

Більшість поточної генерації систем людської симуляції/імітації також обмежені та/або “спеціалізовані”. Одна з повторюваних обмежень полягає в тому, що найкращі системи людської симуляції/імітації офлайн – тобто вони надто ресурсоємні, щоб працювати в реальному часі, і замість цього повинні піти, розрахувати рішення та представити результат користувачеві пізніше.

Очевидно, що такі системи непридатні для живої трансформації AI, chẳng hạn як перетворення всього діапазону руху тіла, наприклад танцю, у прямому ефірі.

Прикладом цього в останні роки є відкрита система Wan2.2. Animate, яка стала хітом серед хобі-спільноти та професійних реселерів – але ще раз, це сценарій “генерувати та чекати”:

Натисніть, щоб відтворити. З 2025 року, приклади вражаючих можливостей Wan2.2-Animate – якщо ви можете чекати трохи. Будь ласка, зверніться до джерела для кращої роздільності. Джерело 

Таким чином, зараз ви можете вибрати дві речі: або добре, або універсально, або зараз – виберіть дві.

LiveAnimate

У цю мексиканську патову ситуацію приходить нова пропозиція з Китаю, яка ефективно перетворює Wan2.2 Animate у живу анімаційну рамку, що працює наразі на поважній майже-20 кадрах за секунду, з вражаючими результатами у різних сценаріях:

Натисніть, щоб відтворити: З сайту проєкту, LiveAnimate передає пози через танці на сцені, повні тіла на відкритому повітрі та портрети в близькій перспективі, відтворюючи рух всього тіла, рук та обличчя. Будь ласка, зверніться до джерела для кращої роздільності. Джерело 

Нова робота розширює оригінальну систему у живу версію, змінюючи як відео генерується: замість обробки минулих та майбутніх кадрів разом, LiveAnimate генерує кожен новий сегмент, коли дія розгортається, використовуючи лише кілька кроків, зберігаючи вибрані попередні пози, щоб підтримувати постійний вигляд суб’єкта протягом довгих сесій.

Ефективно, система зберігає попередні кадри як метод постійної пам’яті, на яку можна посилатися під час розвитку відео, так що ідентичність залишається постійною – не зовсім схоже на те, як старі CGI-системи посилаються на текстурні карти.

Хоча LoRA залучена на етапі обробки, LiveAnimate не просто ще одна система LoRA – її генерація у потоці, система пам’яті/кешу, трикрокова інференція та оптимізації GPU представляють додаткові механізми, окрім різних інших технологій (дехто з них досить старий) у її репертуарі.

Нова система може справитися не тільки з повними тілами сценаріїв, таких як ті, що показані вище, але також з рухами верхньої частини тіла, такими як у сценаріях інтерв’ю:

Натисніть, щоб відтворити. ‘Ніжні рухи голови та рук над статичним офісним фоном’.

Щоб бути чесним щодо своїх обмежень, нова робота визнає, що дві з протилежних рамок, протестованих проти LiveAnimate, були здатні зберегти ідентичність трохи краще в певних конкретних обставинах; тим не менш, жодна з суперників не є онлайн-системою, а автори нової роботи явно рухаються у плідному та оптимістичному напрямку.

Крім того, можливо, варто відзначити, що інференція вимагає двох GPU H100 NVIDIA, всього 160 ГБ відеопам’яті*.

У роботі зазначено:

‘LiveAnimate підтримує майже постійну перцептивну якість та ідентичність з перших 30 секунд до останньої [хвилини], тоді як попередні системи суттєво погіршуються або вимагають годин офлайн-обчислень для того самого розгортання.

‘Ці результати встановлюють нову точку операції щодо якості, затримки та тривалості для інтерактивної повної тіла анімації.’

Нова робота названа LiveAnimate: Стабільна довготривала стрімінг-анімація людини в реальному часі, і походять від дев’яти авторів з Китайського університету Гонконгу, Qwen Applications Business Group of Alibaba та Liblib AI. Сайт проєкту, наповнений відео, також представлений в цій статті, є доступним, тоді як код є ‘наступним’, а ваги… хто знає?

Метод

LiveAnimate складається з двостадійного процесу навчання, призначеного для того, щоб зробити Wan2.2-Animate генерувати безперервно та швидко, після чого слідує система пам’яті, яка відновлює корисні попередні пози під час генерації кожного нового блоку відео:

Огляд потоку LiveAnimate, який показує двостадійний процес навчання зліва та генерацію у прямому ефірі справа, де вхідні пози порівнюються з збереженими попередніми позами та поєднуються з недавніми кадрами для генерації кожного нового блоку відео за три кроки. Джерело - https://arxiv.org/pdf/2608.11745

Огляд потоку LiveAnimate, який показує двостадійний процес навчання зліва та генерацію у прямому ефірі справа, де вхідні пози порівнюються з збереженими попередніми позами та поєднуються з недавніми кадрами для генерації кожного нового блоку відео за три кроки. Джерело 

Оригінальний Wan2.2-Animate призначений для розгляду цілої послідовності, а не для генерації нескінченно продовжуваного відео. Тому, щоб адаптувати його, автори розділили відео на послідовні блоки, кожний з яких генерувався за допомогою попередніх блоків як контекст/еталон. Це спочатку вчить модель продовжувати з надійного попереднього матеріалу, перш ніж мати справу з помилками, накопиченими з його власного виходу.

Забудь мене не

Під час цього процесу оригінальне зображення посилання зберігається постійно через “Джерело-синк”, забезпечуючи постійне нагадування про ідентичність та зовнішній вигляд особи. Як тільки блок завершено, “Чистий KV оновлення” перетворює інформацію, отриману з нього, у історичний контекст для наступних блоків (хоча це не ремонтує існуючі помилки).

Цей перший етап навчання все ще вимагає 50 шагів денойзингу на блок, що робить живу операцію непрактичною. Другий етап тому скорочує процес до трьох кроків, під час якого модель піддається дії своєї власної згенерованої історії, оскільки розгортання вимагає, щоб кожен новий сегмент залежав від недосконалого попереднього виходу:

Два етапи навчання†, використані для підготовки LiveAnimate до розгортання, спочатку навчання з чистих попередніх відеоблоків – потім скорочення генерації до трьох кроків, під час яких модель піддається дії своєї власної недосконалої історії

Два етапи навчання†, використані для підготовки LiveAnimate до розгортання, спочатку навчання з чистих попередніх відеоблоків – потім скорочення генерації до трьох кроків, під час яких модель піддається дії своєї власної недосконалої історії

Навчання проти цих самозгенерованих послідовностей представляє ще одну проблему, оскільки збереження всієї обчислювальної історії відео було б надто дорого. Замість цього робиться один повний пробний запуск, потім переглядається один блок за раз для навчання. Кожен блок може отримати оновлення без збереження всієї послідовності обчислювально “живою”.

У поєднанні з LoRA-адаптацією це дозволяє 14-мільярдному параметровому моделю бути дистильованим на одному вузлі, що містить вісім 80-ГБ GPU H100 (зазначаючи, що цей кластер призначений для навчання, а не для інференції у часі виконання).

Не зупиняйся зараз

Для нескінченної генерації LiveAnimate також повинна вирішити, що варто запам’ятати. Збереження усього зробило б вимоги до обробки неконтрольованими; але збереження лише недавніх кадрів також могло б викинути корисні попередні погляди.

Тому Pose-Retrieval Sink Attention (PR-Sink) звертається до цього, зберігаючи перший згенерований блок як постійний “Статичний Синк” – відповідний попередній поза, що діє як заміняємий “Динамічний Синк”, і прокрутіть вікно, що містить поточний і два попередні блоки. Посилання зображення залишається окремо доступним через Джерело-синк, тоді як фіксовані розміри зберігання запобігають зростанню витрат при збільшенні тривалості відео.

Блокові війни

Для вибору старих поз для цієї обмеженої пам’яті ViTPose скорочує позиції тіла та рук через три кадри в компактне представлення. Пам’ять-банк містить п’ять таких представницьких поз, і поповнюється протягом перших 20 блоків, віддаючи перевагу різним позам над майже-дублікатами.

Під час генерації вхідна поза порівнюється з цими представниками та відновлює найближчий матч, забезпечуючи попередні докази того, як людина виглядала в подібній позиції. Однак безпосередньо попередній блок виключений, оскільки він вже існує у прокруті вікна, залишаючи Динамічний Синк вільним для відновлення інформації з більш раннього періоду.

Нарешті, час виконання оптимізовано для швидкості шляхом розподілу обробки уваги по двох GPU H100, перекриття спілкування з обчисленнями та повторного використання закешованої інформації, якщо це можливо.

Дані та тести

LiveAnimate була навчена на 40 000 розмовних відео з AVSpeech та 20 000 відео людського руху з TikTok dataset і HumanVid, з навчанням та інференцією, що підтримують роздільності 480×480; 384×672; та 672×384 пікселів.

Навчання почалося з базової точки Wan2.2-Animate-14B, використовуючи LoRA з рангом 128, і проходило на восьми GPU H100 протягом 10 000 кроків на першому етапі та 20 000 на другому.

Відео генерувалося у блоках по три латентних кадри (внутрішнє стиснене представлення моделі), що відповідає 12 кадрам RGB, тоді як інференція проводилася на двох H100.

Оцінка порівнювала LiveAnimate з існуючими методами анімації людини, керованої позою, як у коротких, так і у довгих послідовностях, використовуючи посилання зображення та пози під час збереження налаштувань. Довготривалі тести розширили генерацію до трьох хвилин, щоб перевірити, чи залишаються якість та ідентичність стабільними з часом.

Фреймворки, протестовані проти цього, були EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; та Wan2.2-Animate.

Метрики, використані для покриття, охоплювали візуальну якість, консистентність ідентичності, розподілу якість та похибку тимчасового представлення. Аестетічний бал (ASE) та оцінка якості зображення без посилання (IQA) вимірювали кадрову візуальну якість; DINO, схожість (DINO-S), та консистентність появи з посиланням на ідентичність; Fréchet Inception Distance (FID), розподілу якість; та Відстань функції VideoMAE (V-MAE), як добре згенероване відео зберігає рух з часом:

Результати тестів, пов'язані з якістю та ідентичністю протягом трьох хвилин безперервної генерації, з LiveAnimate, яка залишається порівняно стабільною по всіх п'яти метриках, коли послідовність прогресує. Деякі конкуруючі методи демонструють більшу деградацію з часом. Вищі показники кращі для IQA, ASE та DINO-S, з нижчими показниками краще для FID та V-MAE.

Результати тестів, пов’язані з якістю та ідентичністю протягом трьох хвилин безперервної генерації, з LiveAnimate, яка залишається порівняно стабільною по всіх п’яти метриках, коли послідовність прогресує. Деякі конкуруючі методи демонструють більшу деградацію з часом. Вищі показники кращі для IQA, ASE та DINO-S, з нижчими показниками краще для FID та V-MAE.

Як показано на початковому графіку вище, LiveAnimate досягла найвищого початкового балу ASE 2,823 та IQA 4,047 за перші 30 секунд. Автори стверджують, що це вказує на те, що трикрокова дистиляція зберігає перцептивну якість, незважаючи на скорочений бюджет інференції.

Більш значущим є те, що LiveAnimate показала мало погіршення протягом трьох хвилин безперервної генерації, з балами візуальної якості та консистентності ідентичності, які залишаються майже незмінними.

Навпаки, One-to-All погіршилася суттєво з часом, з нижчою візуальною якістю та консистентністю ідентичності та вищим розподілу похибкою; і базова Wan2.2-Animate також показала деяку втрату консистентності ідентичності.

Автори заявляють:

‘Ці тенденції підтверджують наш центральний тезис про те, що явне управління довгочасним контекстом важливо для стрімінг-анімації.’

Ефективність масштабування LiveAnimate також була протестована на GPU. Як показано нижче, 12,41 кадрів за секунду було досягнуто з одним H100; 19,63 кадрів за секунду з двома; і 22,13 кадрів за секунду з чотирма, при цьому прибутки все більше обмежувалися комунікаційною затримкою. Два H100 були вибрані як бажана конфігурація:

Ефективність масштабування на одному, двох і чотирьох GPU H100 при роздільності 480×480, показуючи затримку, кадрову частоту, прискорення та ефективність. Два GPU досягли 19,63 кадрів за секунду, тоді як подальше масштабування до чотирьох призвело лише до скромного збільшення до 22,13 кадрів за секунду.

Ефективність масштабування на одному, двох і чотирьох GPU H100 при роздільності 480×480, показуючи затримку, кадрову частоту, прискорення та ефективність. Два GPU досягли 19,63 кадрів за секунду, тоді як подальше масштабування до чотирьох призвело лише до скромного збільшення до 22,13 кадрів за секунду.

При 19,63 кадрах за секунду кожен 12-кадровий блок генерувався за 0,611 секунди. Для порівняння, приблизно 2–5 годин були потрібні конкуруючим системам для генерації тієї ж трихвилинної послідовності.

Кваліфікаційні тести показали схожі відмінності: у повному тіловому тесті, показаному нижче, була спостережена сильна деградація в One-to-All; мерехтіння було вироблено UniAnimate-DiT та SCAIL; і пізніше кольоровий чи фоновый дрейф став очевидним у Wan-Animate та EverAnimate.

Результати тестів, порівняння повної тіла анімації протягом трьох хвилин. Кадри вибрані кожні 20 секунд, з червоними анотаціями, що виділяють довгострокову деградацію в конкуруючих методах. Базові лінії вимагали приблизно 2–5 годин для генерації послідовності, порівняно з приблизно чотирма хвилинами для LiveAnimate.

Результати тестів, порівняння повної тіла анімації протягом трьох хвилин. Кадри вибрані кожні 20 секунд, з червоними анотаціями, що виділяють довгострокову деградацію в конкуруючих методах. Базові лінії вимагали приблизно 2–5 годин для генерації послідовності, порівняно з приблизно чотирма хвилинами для LiveAnimate. Будь ласка, зверніться до джерела статті для кращої роздільності.

LiveAnimate підтримувала зовнішній вигляд суб’єкта та навколишню сцену протягом усієї трихвилинної послідовності. У менш вимогливому верхньому тіловому тесті, показаному нижче, порівнянна довгострокова стабільність була досягнута EverAnimate та LiveAnimate (хоча генерація у реальному часі була забезпечена лише LiveAnimate):

Результати тестів, порівняння верхньої тіла анімації протягом трьох хвилин. Кадри вибрані кожні 20 секунд, показуючи LiveAnimate, яка підтримує ідентичність, одяг та темний фон більш послідовно, ніж конкуруючі методи.

Результати тестів, порівняння верхньої тіла анімації протягом трьох хвилин. Кадри вибрані кожні 20 секунд, показуючи LiveAnimate, яка підтримує ідентичність, одяг та темний фон більш послідовно, ніж конкуруючі методи.

Автори роблять висновок:

‘На трьоххвилинному бенчмарку LiveAnimate підтримує майже постійну перцептивну якість та ідентичність на 19,63 кадрах за секунду на двох GPU H100, з пам’яттю та затримкою незалежними від тривалості стріму, тоді як офлайн-базові лінії погіршуються помітно або вимагають годин обчислень.

‘Ці результати приносять моделі відео-дифузії масштабу мільярдів у межах досяжності інтерактивних застосунків, таких як живі трансляції, телеприсутність та віртуальні аватари.’

Висновок

Це обнадійливо бачити, як живо-генеруюча рамка підходить до постійних проблем пам’яті та ідентичності, які турбують генеруюче відео. Є вже багато генеруючих рамок, які можуть посилатися на фіксовані зображення, надані користувачем, без потреби “вставляти” посилання зображення у змістовне зображення-у-відео.

Однак це вирішує лише деякі проблеми генерації одного відеокліпу, наприклад, збереження ідентичності (включаючи одяг та стилі волосся) людини, яка знову повертається у кадр, або тимчасово перекрита, а потім знову помітна. На сьогодні лише тимчасовий підхід LoRA зробив деякий прогрес у цих питаннях, хоча обмежений і тимчасовий.

Для відео, а насправді для всього поточного AI-революції, розвиток ефективної постійної пам’яті є критичним, існуванням питання – одне, що, ймовірно, визначить різницю між появою AGI або третьою AI-зимою.

 

*  Це ще “готча”? Поточне мислення полягає в тому, що менші спеціалізовані моделі можуть в кінцевому підсумку працювати локально, безкоштовно, тоді як вищі потреби обслуговуються конкурентним та, сподіваємося, балканізованим ринком оренди GPU. Це припускає, що фронтові компанії не зможуть EEE конкуренцію, і що суттєва обчислювальна потужність GPU залишається доступною незалежно від цього. На цій основі я вже не вважаю явні вимоги до GPU недоліком, але сподіваюся, що доступ стане дедалі більш демократичним, а пізніші оптимізації зменшать первинні вимоги до ресурсів.

AI-генерований і перевірений мною.

†† Для довготривалого тестування SCAIL і UniAnimate-DiT були розширені тим же безобчислювальним процедурою ковзного вікна, оскільки жодна з них не підтримує довготривалу генерацію.

 

Опубліковано вперше четвер, 13 серпня 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai