Погляд Anderson

HunyuanCustom Привносить Однообразні Відео Діпфейки, З Аудіо І Синхронізацією Губ

mm
Додайте Unite.AI до бажаних джерел у Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Ця стаття обговорює новий реліз багатомодальної моделі відео Hunyuan під назвою ‘HunyuanCustom’. Новий документ має широкий охват, поєднаний з кількома проблемами в багатьох прикладах відео на сторінці проекту*, що обмежує нас більш загальним охопленням, ніж зазвичай, і обмежує можливість повторного використання великої кількості відеоматеріалів, що супроводжують цей реліз (оскільки багато відео потребують значної редакції та обробки для поліпшення читабельності макету).

Будь ласка, зверніть увагу, що документ посилається на систему генерації на основі API під назвою Kling як ‘Keling’. Для ясності, я посилаюсь на ‘Kling’ протягом усього тексту.

 

Tencent перебуває в процесі випуску нової версії своєї моделі відео Hunyuan, під назвою HunyuanCustom. Новий реліз, як здається, здатний зробити моделі LoRA Hunyuan зайвими, дозволяючи користувачеві створювати відео на основі одного зображення:

Натисніть, щоб відтворити. Примітка: ‘Чоловік слухає музику і готує равлики в кухні’. Новий метод порівнюється з методами з закритим і відкритим кодом, включаючи Kling, який є значним суперником в цьому просторі. Джерело: https://hunyuancustom.github.io/ (попередження: CPU/пам’яті-інтенсивний сайт!)

У лівому стовпчику відео вище, ми бачимо одне джерельне зображення, надане HunyuanCustom, за яким слідує інтерпретація системи промпта у другому стовпчику, поряд з ним. Решта стовпчиків показують результати з різних пропрієтарних і відкритих систем: Kling; Vidu; Pika; Hailuo; і Wan-based SkyReels-A2.

У відео нижче, ми бачимо рендер трьох сценаріїв, важливих для цього релізу: відповідно, особа + об’єкт; одна персонаж; і віртуальна спроба (особа + одяг):

Натисніть, щоб відтворити. Три приклади, відредаговані з матеріалів на сайті Hunyuan Video.

Ми можемо помітити кілька речей з цих прикладів, переважно пов’язаних з тим, що система використовує одне джерельне зображення, замість кількох зображень однієї й тієї ж особи.

У першому кліпі чоловік фактично все ще дивиться в камеру. Він нахиляє голову вниз і вбік не більше ніж на 20-25 градусів обертання, але при нахилі понад це система повинна була б почати здогадуватися, яким він виглядає в профіль. Це складно, ймовірно, неможливо точно визначити з одного переднього зображення.

У другому прикладі ми бачимо, що дівчинка усміхається у відтвореному відео, як і на одному статичному джерельному зображенні. Знову ж таки, з цим одним зображенням як посиланням, HunyuanCustom повинна була б зробити відносно необізнану здогадку про те, яким виглядає її “відпочиваюче обличчя”. Крім того, її обличчя не відхиляється від камери більше, ніж у попередньому прикладі (‘чоловік, який їсть чипси’).

У останньому прикладі ми бачимо, що оскільки джерельний матеріал – жінка і одяг, у який вона запрошується – не є повними зображеннями, рендер обрізав сценарій, щоб він пасував – що насправді є досить хорошим рішенням проблеми з даними!

Відмінність полягає в тому, що хоча нова система може обробляти кілька зображень (наприклад, особа + чипси або особа + одяг), вона, як здається, не дозволяє кількох кутів або альтернативних видів одної особи, так що різні вирази або незвичайні кути могли б бути прийняті. У цій мірі система може мати труднощі з заміною зростаючої екосистеми моделей LoRA, які з’явилися навколо HunyuanVideo після його випуску в грудні, оскільки ці моделі можуть допомогти HunyuanVideo створювати послідовні персонажі з будь-якого кута і з будь-яким виразом обличчя, представленим у навчальному наборі даних (20-60 зображень є типовим).

Підключено до звуку

Для аудіо HunyuanCustom використовує систему LatentSync (відомо, що її складно налаштувати і досягти хорошої якості результатів) для отримання рухів губ, які відповідають аудіо і тексту, наданих користувачем:

Функція аудіо. Натисніть, щоб відтворити. Різні приклади синхронізації губ з додаткового сайту HunyuanCustom, відредаговані разом.

На момент написання цього тексту немає англомовних прикладів, але вони здаються досить хорошими – тим більше, якщо метод їх створення легко встановлюється і доступний.

Редагування існуючого відео

Нова система пропонує дуже вражаючі результати для редагування відео-від-відео (V2V, або Vid2Vid), коли сегмент існуючого (реального) відео відмічається і інтелектуально замінюється об’єктом, заданим у одному зображенні. Нижче наведено приклад з додаткового сайту:

Натисніть, щоб відтворити. Тільки центральний об’єкт націлений, але те, що залишається навколо нього, також змінюється під час проходу HunyuanCustom vid2vid.

Як ми бачимо, і як це стандартно в сценарії vid2vid, ціле відео змінюється в якійсь мірі під час процесу, хоча найбільш змінене в цільовому регіоні, тобто в іграшці. Принаймні, можна було б розробити конвеєри для створення таких перетворень підхідом “сміттєвого матting”, який залишає більшу частину вмісту відео ідентичною до оригіналу. Це те, що робить Adobe Firefly під капотом, і робить це досить добре – але це недооцінений процес у сфері FOSS-генерації.

Той факт, що більшість альтернативних прикладів, наданих, робить кращу роботу з цими інтеграціями, ми можемо побачити в зібраному компіляції нижче:

Натисніть, щоб відтворити. Різні приклади інтерполяції вмісту за допомогою vid2vid в HunyuanCustom, демонструють помітну повагу до нецільового матеріалу.

Новий початок?

Ця ініціатива є розвитком проекту відео Hunyuan, а не жорстким поворотом від цього напрямку розвитку. Покращення проекту вводяться як окремі архітектурні вставки, а не повні структурні зміни, спрямовані на те, щоб дозволити моделі зберігати ідентичність кадрів без використання специфічних для суб’єкта тонкої настройки, як у випадку з LoRA або текстовим зворотом.

Чітко кажучи, тому, HunyuanCustom не тренується з нуля, а є тонкою настройкою базової моделі відео Hunyuan за грудень 2024 року.

Ті, хто розробили моделі LoRA HunyuanVideo, можуть задуматися, чи будуть вони працювати з цією новою версією, або чи їм доведеться винайти колесо LoRA знову, якщо вони хочуть більшої можливості налаштування, ніж є в цій новій версії.

У загальному, сильно настроєна версія гіпермасштабної моделі змінює ваги моделі досить сильно, щоб моделі LoRA, створені для попередньої моделі, не працювали належним чином, або взагалі, з новою уточненою моделлю.

Іноді, однак, популярність тонкої настройки може викликати питання про її походження: один приклад тонкої настройки, яка стала ефективним форком, з власною екосистемою і послідовниками, є настройка Pony Diffusion моделі Stable Diffusion XL (SDXL). Pony зараз має 592 000+ завантажень на змінюваному домені CivitAI, з великою кількістю моделей LoRA, які використовували Pony (а не SDXL) як базову модель, і які вимагають Pony під час інференції.

Випуск

Сторінка проекту для нової статті (яка називається HunyuanCustom: Багатомодальна архітектура для налаштованої генерації відео) містить посилання на сайт GitHub, який, на момент написання цього тексту, тільки що став функціональним, і, як здається, містить весь код і необхідні ваги для локальної реалізації, разом з запланованим графіком (де єдина важлива річ, яка ще не відбулася, – інтеграція ComfyUI).

На момент написання цього тексту присутність проекту на Hugging Face все ще повертає 404. Однак є версія на основі API, де можна демонструвати систему, якщо ви можете надати код WeChat.

Я рідко бачив такий елегантний і широкий використовування такого великого різноманіття проектів в одному зібранні, як це видно в HunyuanCustom – і, мабуть, деякі ліцензії б потребували б повного випуску.

Два моделі оголошені на сторінці GitHub: 720px1280px версія, яка вимагає 8 ГБ пікової пам’яті GPU, і 512px896px версія, яка вимагає 60 ГБ пікової пам’яті GPU.

Репозиторій зазначає ‘Мінімальна пам’ять GPU, необхідна для 720px1280px129f, становить 24 ГБ, але дуже повільно… Ми рекомендуємо використовувати GPU з 80 ГБ пам’яті для кращої якості генерації’ – і повторює, що система була протестована лише на Linux.

Раніша модель відео Hunyuan, після офіційного випуску, була квантована до розмірів, де вона може працювати на менше 24 ГБ VRAM, і здається розумним припустити, що нова модель також буде адаптована в більш споживчі форми спільнотою, і що вона швидко буде адаптована для використання на системах Windows.

Через обмеження часу і величезну кількість інформації, що супроводжує цей реліз, ми можемо лише взглянути на цей реліз ширше, ніж глибоко. Тим не менш, давайте трохи відкриємо капот HunyuanCustom.

Огляд статті

Конвейер даних для HunyuanCustom, як здається, відповідає рамкам GDPR, включає в себе як синтезовані, так і відкриті набори відеоданих, включаючи OpenHumanVid, з восьми основними категоріями, представленими: люди, тварини, рослини, ландшафти, транспортні засоби, об’єкти, архітектура і аніме.

З випуску статті, огляд різноманітних пакетів, що складають конвейер даних HunyuanCustom. Джерело: https://arxiv.org/pdf/2505.04512

З випуску статті, огляд різноманітних пакетів, що складають конвейер даних HunyuanCustom. Джерело: https://arxiv.org/pdf/2505.04512

Первинна фільтрація починається з PySceneDetect, який розбиває відео на окремі кліпи. TextBPN-Plus-Plus потім використовується для видалення відео, що містять надмірний текст на екрані, субтитри, водяні знаки або логотипи.

Для вирішення проблем з несумісністю роздільної здатності та тривалості кліпи стандартизуються до п’яти секунд тривалості і змінюються в розмірі до 512 або 720 пікселів на короткому боці. Аестетична фільтрація обробляється за допомогою Koala-36M, з власним порогом 0,06, застосованим для набору даних, кураторами статті.

Процес виділення суб’єкта поєднує Qwen7B велику мовну модель (LLM),.framework розпізнавання об’єктів YOLO11X і популярну архітектуру InsightFace, для ідентифікації та верифікації людських ідентичностей.

Для не людських суб’єктів QwenVL і Grounded SAM 2 використовуються для виділення відповідних обмежувальних рамок, які відкидаються, якщо вони занадто малі.

Приклади семантичної сегментації з Grounded SAM 2, використовуваної в проекті Hunyuan Control. Джерело: https://github.com/IDEA-Research/Grounded-SAM-2

Приклади семантичної сегментації з Grounded SAM 2, використовуваної в проекті Hunyuan Control. Джерело: https://github.com/IDEA-Research/Grounded-SAM-2

Виділення декількох суб’єктів використовує Florence2 для анотації обмежувальних рамок, і Grounded SAM 2 для сегментації, після чого слідує кластеризація і тимчасова сегментація тренувальних кадрів.

Оброблені кліпи далі розширюються за допомогою анотації, використовуючи власну структуровану систему маркування, розроблену командою Hunyuan, і яка забезпечує шаровану метадані, таку як описи та підказки руху камери.

Маскування стратегії, включаючи перетворення в обмежувальні рамки, були застосовані під час тренування для зниження переобучення і забезпечення того, що модель адаптується до різних форм об’єктів.

Аудіодані синхронізувалися за допомогою вищезгаданої LatentSync, і кліпи відкидалися, якщо оцінки синхронізації падали нижче мінімального порогу.

Блінд-оцінка якості зображення HyperIQA була використана для виключення відео, які оцінювалися нижче 40 (за власним масштабом HyperIQA). Дійсні аудіодоріжки потім оброблялися за допомогою Whisper, щоб витягнути функції для подальших завдань.

Автори включили мовну модель-асистента LLaVA під час фази анотації, і підкреслюють центральну позицію цієї рамки в HunyuanCustom. LLaVA використовується для генерації підписів зображень і допомоги в вирівнюванні візуального вмісту з текстовими промптами, підтримуючи будівництво послідовного сигналу тренування через модальності:

Фреймворк HunyuanCustom підтримує генерацію відео, послідовну за ідентичністю, умовну на текст, зображення, аудіо та відео-вхід.

Фреймворк HunyuanCustom підтримує генерацію відео, послідовну за ідентичністю, умовну на текст, зображення, аудіо та відео-вхід.

Відповідно до можливостей вирівнювання мови та зору LLaVA, конвейер отримує додатковий шар семантичної послідовності між візуальними елементами та їх текстовими описами – особливо цінним у багatosуб’єктних або складних сценаріях.

Кастомне відео

Для генерації відео на основі джерельного зображення і промпта два модулі, центровані навколо LLaVA, були створені, спочатку адаптуючи структуру вхідних даних HunyuanVideo так, щоб вона могла приймати зображення разом з текстом.

Це включало форматування промпта таким чином, щоб він вкладав зображення безпосередньо або позначав його коротким описом ідентичності. Токен-сепаратор використовувався для зупинки вкладення зображення від перевантаження вмісту промпта.

Оскільки візуальний кодувальник LLaVA схильний стискати або відкидати тонкі просторові деталі під час вирівнювання зображення та текстових функцій (особливо при перекладі одного джерельного зображення в загальне семантичне вкладення), був включений модуль посилення ідентичності. Оскільки майже всі відео-латентні моделі дифузії мають певні труднощі з підтриманням ідентичності без LoRA, навіть у кліпі тривалістю п’ять секунд, продуктивність цього модулю при громадському тестуванні може виявитися суттєвою.

У будь-якому випадку, джерельне зображення потім змінюється в розмірі та кодується за допомогою причинного 3D-VAE з оригінальної моделі відео Hunyuan, і його латент вставляється в відео-латентний по тимчасовій осі, з застосованим просторовим зсувом для запобігання прямому відтворенню зображення на виході, при цьому спрямовуючи генерацію.

Модель була тренована за допомогою Flow Matching, з вибіркою шумових зразків з логит-нормального розподілу – і мережа була тренована для відновлення правильного відео з цих шумових латентних.

LLaVA і відео-генератор були обидва донастроєні разом, щоб зображення та промпт могли спрямовувати вихід більш плавно і зберігати ідентичність суб’єкта.

Для багatosуб’єктних промптів кожна пара зображення-текст вкладалася окремо і призначалася окремій тимчасовій позиції, дозволяючи ідентичностям бути розрізняються, і підтримуючи генерацію сцен, що включають багатьох взаємодіючих суб’єктів.

Звук і бачення

HunyuanCustom умовно генерує аудіо/мову за допомогою як користувальницького аудіо-входу, так і текстового промпта, дозволяючи персонажам говорити в сценах, які відображають описану обстановку.

Для підтримки цього, модуль Identity-disentangled AudioNet вводить аудіо-функції без порушення сигналів ідентичності, вкладених з джерельного зображення та промпта. Ці функції вирівнюються з стисненою відео-хронологією, розділяються на сегменти рівня кадрів і вводяться за допомогою просторового крос-аттенційного механізму, який зберігає кожен кадр ізольованим, зберігаючи послідовність суб’єкта і уникання тимчасових інтерференцій.

Другий тимчасовий модуль введення забезпечує більш точний контроль над часом і рухом, працюючи в тандемі з AudioNet, відображаючи аудіо-функції на конкретні регіони латентної послідовності, і використовуючи багатошаровий перцептрон (MLP), щоб перетворити їх у токен-чутливі зрушення руху. Це дозволяє жестам і руху обличчя слідувати ритму і акценту мовленого входу з більшою точністю.

HunyuanCustom дозволяє суб’єктам в існуючих відео редагуватися безпосередньо, заміняючи або вставляючи людей чи об’єкти в сцену без необхідності перебудовувати весь кліп з нуля. Це робить його корисним для завдань, які включають зміну зовнішнього вигляду або руху цілевим чином.

Натисніть, щоб відтворити. Ще один приклад з додаткового сайту.

Для ефективної заміни суб’єкта в існуючих відео нова система уникає ресурсоємного підходу недавніх методів, таких як популярний VACE, або тих, які зливають цілі відео-секвенції разом, віддаючи перевагу стисненню джерельного відео за допомогою попередньо натренованого причинного 3D-VAE – вирівнювання його з внутрішніми відео-латентами конвеєра генерації, і потім додаючи їх разом. Це зберігає процес відносно легким, при цьому дозволяючи зовнішньому відео-вмісту спрямовувати вихід.

Маленька нейронна мережа обробляє вирівнювання між чистим вхідним відео і шумними латентами, використовуваними в генерації. Система тестирує два способи введення цієї інформації: зливання двох наборів функцій перед їх стисненням знову; і додавання функцій кадр за кадром. Другий метод працює краще, виявляє автори, і уникнув втрати якості, зберігаючи обчислювальне навантаження незмінним.

Дані та тести

У тестах використовувалися наступні метрики: модуль послідовності ідентичності в ArcFace, який витягує вкладення обличчя з джерельного зображення та кожного кадру згенерованого відео, і потім обчислює середню косинусну подібність між ними; подібність суб’єкта, через надсилання сегментів YOLO11x до Dino 2 для порівняння; CLIP-B, вирівнювання тексту-відео, яке вимірює подібність між промптом і згенерованим відео; CLIP-B знову, для розрахунку подібності між кожним кадром і як сусідніми кадрами, так і першим кадром, а також тимчасову послідовність; і динамічний ступінь, як визначено в VBench.

Як зазначалося раніше, базовими конкурентами з закритим кодом були Hailuo; Vidu 2.0; Kling (1.6); і Pika. Конкурентами з відкритим кодом були VACE і SkyReels-A2.

Оцінка продуктивності моделі, порівняння HunyuanCustom з провідними методами налаштованої відео-генерації по ідентичності, подібності суб'єкта, вирівнюванню тексту-відео, тимчасовій послідовності та інтенсивності руху. Оптимальні та субоптимальні результати показані жирним шрифтом і підкреслені відповідно.

Оцінка продуктивності моделі, порівняння HunyuanCustom з провідними методами налаштованої відео-генерації по ідентичності, подібності суб’єкта, вирівнюванню тексту-відео, тимчасовій послідовності та інтенсивності руху. Оптимальні та субоптимальні результати показані жирним шрифтом і підкреслені відповідно.

З цих результатів автори заявляють:

‘Наша [HunyuanCustom] досягає найкращої послідовності ідентичності та послідовності суб’єкта. Вона також досягає порівняних результатів у слідуванні промпту та тимчасовій послідовності. [Hailuo] має найкращий результат CLIP, оскільки вона добре слідує текстовим інструкціям з ідентичністю, жертвуючи послідовністю не людських суб’єктів (найгірший DINO-Sim). За динамічним ступенем [Vidu] і [VACE] виконують погано, що може бути пов’язано з малим розміром моделі.’

Хоча сайт проекту насичений порівняльними відео (розміщення яких, здається, було розроблено для естетики сайту, а не для легкого порівняння), варто відзначити, що дуже мало проектів у сфері відео-синтезу мають сміливість порівнювати себе з Kling, комерційним відео-дифузійним API, який завжди перебуває на вершині або біля вершини таблиць лідерів; Tencent, здається, зробила успіхи проти цього інкумбента досить вражаючим чином.
 

* Проблема полягає в тому, що деякі відео настільки широкі, короткі та високої роздільної здатності, що вони не відтворюються в стандартних відео-плеєрах, таких як VLC або Windows Media Player, показуючи чорні екрани.

Перша публікація четверга, 8 травня 2025

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai