Погляд Anderson
Зростання Hunyuan Відео Deepfakes

Через особливості деякого матеріалу, обговореного тут, ця стаття міститиме менше посилань та ілюстрацій, ніж зазвичай.
Щось вартісне зараз відбувається в спільноті синтезу AI, хоча його значення може зайняти деякий час, щоб стати зрозумілим. Хобісти тренують генеративні відео-моделі AI для відтворення подібності людей, використовуючи відео-орієнтовані LoRAs на відкритій платформі Hunyuan Video.*
Натисніть, щоб відтворити. Різноманітні результати від Hunyuan-базованих налаштувань LoRA вільно доступні в спільноті Civit. За допомогою тренування моделей низькорангової адаптації (LoRAs), питання з темпоральної стабільності, які турбували генерацію відео AI протягом двох років, значно знижуються. Джерела: civit.ai
У відео вище, подібності актрис Наталі Портман, Крістіни Гендрікс і Скарлетт Йоганссон, разом з лідером технологій Ілоном Маском, були треновані в відносно невеликі файли для системи генеративного відео Hunyuan, яку можна встановити без фільтрів контенту (таких як фільтри NSFW) на комп’ютері користувача.
Творець LoRA Крістіни Гендрікс, показаної вище, заявляє, що для розробки моделі були потрібні лише 16 зображень з телешоу Mad Men (це всього лише 307 МБ завантаження); численні повідомлення з спільноти Stable Diffusion на Reddit і Discord підтверджують, що LoRAs такого типу не потребують великої кількості навчальних даних або тривалих часів навчання в більшості випадків.
Натисніть, щоб відтворити. Арнольд Шварценеггер оживає в Hunyuan відео LoRA, яку можна завантажити на Civit. Дивіться https://www.youtube.com/watch?v=1D7B9g9rY68 для подальших прикладів Арні від ентузіаста AI Боба Дойла.
Hunyuan LoRAs можна тренувати як на статичних зображеннях, так і на відео, хоча тренування на відео вимагає більших апаратних ресурсів і збільшеного часу навчання.
Модель Hunyuan Video має 13 мільярдів параметрів, що перевищує 12 мільярдів параметрів Sora, і значно перевищує менш здатну Hunyuan-DiT модель, випущену в відкритий доступ влітку 2024 року, яка має лише 1,5 мільярда параметрів.
Як це було два з половиною роки тому зі Stable Diffusion і LoRA (дивіться приклади Stable Diffusion 1.5 ‘рідних’ знаменитостей тут), базова модель має значно обмежене розуміння особистостей знаменитостей порівняно з рівнем відтворення, який можна отримати за допомогою ‘ін’єкції ідентифікатора’ реалізації LoRA.
Ефективно, налаштована, орієнтована на особистість LoRA отримує ‘безкоштовну поїздку’ на значні можливості синтезу базової моделі Hunyuan, пропонуючи помітно більш ефективний синтез людини, ніж можна отримати або шляхом генерації зображень будь-якої особи (знаменитості чи ні), або шляхом додавання руху до статичних зображень за допомогою систем, таких як фетований LivePortrait.
Всі LoRAs, показані тут, можна завантажити безкоштовно з популярної спільноти Civit, тоді як більша кількість старих саморобних ‘статичних зображень’ LoRAs також потенційно можуть створити ‘посівні’ зображення для процесу створення відео (тобто зображення у відео, очікувана публікація для Hunyuan Video, хоча обхідні шляхи можливі наразі).
Натисніть, щоб відтворити. Вище, зразки з ‘статичного’ Flux LoRA; нижче, приклади з Hunyuan відео LoRA, що містить музиканта Тейлор Свіфт. Обидві ці LoRAs вільно доступні в спільноті Civit.
Як я пишу, сайт Civit пропонує 128 результатів пошуку за запитом ‘Hunyuan’*. Практично всі вони якимось чином пов’язані з NSFW-моделями; 22 зображують знаменитостей; 18 призначені для генерації порнографічного контенту; і лише сім з них зображують чоловіків, а не жінок.
Що нового?
Через еволюцію терміну deepfake і обмежене публічне розуміння (дуже серйозних) обмежень систем синтезу відео AI на сьогодні, значення Hunyuan LoRA не легко зрозуміти для людини, яка випадково слідить за спільнотою генерації AI. Давайте розглянемо деякі з ключових відмінностей між Hunyuan LoRAs і попередніми підходами до генерації відео AI на основі ідентифікатора.
1: Безперешкодна локальна інсталяція
Найважливішим аспектом Hunyuan Video є те, що його можна завантажити локально, і що це надає дуже потужну і безцензурну систему генерації відео AI в руки звичайного користувача, а також спільноти VFX (в межах ліцензій, які дозволяють у географічних регіонах).
Останній раз це трапилося влітку 2022 року з відкритим випуском моделі Stable Diffusion. На той час OpenAI’s DALL-E2 володів уявленням громадськості, хоча DALLE-2 був платною службою з помітними обмеженнями (які зростали з часом).
Коли Stable Diffusion став доступним, і низькорангову адаптацію потім зробили можливою генерацію зображень ідентифікатора будь-якої особи (знаменитості чи ні), величезний фокус розробників і споживачів інтересу допоміг Stable Diffusion перевершити популярність DALLE-2; хоча остання була більш здатною системою з коробки, її цензурні процедури були вважалися тягарем багатьма її користувачами, і налаштування було неможливим.
Аргументовано, той самий сценарій зараз застосовується між Sora і Hunyuan – або, точніше, між Sora-рівневими пропрієтарними системами генерації відео, і відкритими джерельними суперниками, з яких Hunyuan є першим – але, ймовірно, не останнім (тут розгляньте, що Flux в кінцевому підсумку здобуде значну перевагу над Stable Diffusion).
Користувачі, які бажають створити Hunyuan LoRA-вихід, але яким бракує потужного обладнання, можуть, як завжди, передавати аспект GPU навчання до онлайн-сервісів таких як RunPod. Це не те саме, що створення відео AI на платформах, таких як Kaiber або Kling, оскільки немає семантичного чи зображення-орієнтованого фільтру (цензури) у оренді онлайн-GPU для підтримки локальної робочої течії.
2: Ні потреби у ‘хост’-відео та високому зусиллі
Коли deepfakes вперше з’явилися на початку 2017 року, анонімно опублікований код розвинувся у популярні форки DeepFaceLab і FaceSwap (а також систему DeepFaceLive для генерації deepfakes в реальному часі).
Цей метод вимагав ретельного кураторства тисяч зображень обличчя кожної ідентифікатора, який мав бути замінений; менше зусиль, вкладених у цей етап, означало, що модель буде менш ефективною. Крім того, часи навчання варіювалися від 2 до 14 днів, залежно від наявного обладнання, що створювало тиск навіть на потужні системи у довгостроковій перспективі.
Коли модель була нарешті готова, вона могла тільки накладати обличчя на існуюче відео, і зазвичай потребувала ‘цільової’ (тобто справжньої) ідентифікатора, який був близький до накладеного ідентифікатора.
Нещодавно ROOP, LivePortrait і численні подібні фреймворки забезпечили подібну функціональність з меншим зусиллям і часто з кращими результатами – але без можливості генерації точних повністю тілесних deepfakes – або будь-якого іншого елемента, окрім обличчя.

Приклади ROOP Unleashed і LivePortrait (вставка нижче ліворуч), з потоку контенту Боба Дойла на YouTube. Джерела: https://www.youtube.com/watch?v=i39xeYPBAAM і https://www.youtube.com/watch?v=QGatEItg2Ns
На відміну від цього, Hunyuan LoRAs (та подібні системи, які будуть неминуче слідувати) дозволяють створювати цілі світи, включаючи повністю тілесну симуляцію ідентифікатора LoRA, тренованого користувачем.
3: Масивно покращена темпоральна консистентність
Темпоральна консистентність була Святим Граалем для відео-дифузії протягом декількох років. Використання LoRA разом з підхожими промптами надає генерації відео Hunyuan постійну ідентифікаторну посилання. Теоретично (це ще ранні дні), можна було б тренувати кілька LoRAs певної ідентифікатора, кожна з яких носить певний одяг.
Під цією ознакою одяг також менш схильний ‘мутувати’ протягом відео-герації (оскільки генеративна система базується на дуже обмеженому вікні попередніх кадрів).
(Альтернативно, як і в системах зображень LoRA, можна просто застосувати кілька LoRAs, таких як ідентифікатор + костюм LoRAs, до однієї відео-герації)
4: Доступ до ‘Людського експерименту’
Як я недавно спостерігав, пропрієтарний сектор генерації AI зараз здається настільки обережним щодо потенційної критики щодо можливостей людської синтезу своїх проектів, що справжні люди рідко з’являються на сторінках проектів для великих оголошень та випусків. Натомість пов’язана публіцистика все частіше показує ‘милі’ та інші ‘не загрозливі’ об’єкти у синтезованих результатах.
З появою Hunyuan LoRAs спільнота вперше отримала можливість розширити межі синтезу людського відео на основі LDM у високосприятливій (а не маргінальній) системі і повністю дослідити предмет, який найбільше цікавить більшість з нас – людей.
Вплив
Оскільки пошук ‘Hunyuan’ у спільноті Civit здебільшого показує LoRAs знаменитостей і ‘хардкорні’ LoRAs, центральним наслідком появи Hunyuan LoRAs є те, що вони будуть використані для створення відео AI-порнографії (або іншого наклепницького контенту) реальних людей – знаменитостей і невідомих однаково.
Для цілей відповідності хобісти, які створюють Hunyuan LoRAs і які експериментують з ними на різних серверах Discord, ретельно забороняють приклади реальних людей від публікації. Реальність полягає в тому, що навіть зображення-орієнтовані deepfakes зараз сильно озброєні; і перспектива додавання真正их відео до суміші може нарешті виправдати підвищені страхи, які були періодично присутні в ЗМІ протягом останніх семи років, і які спонукали нові регулювання.
Похідна сила
Як завжди, порно залишається похідною силою для технологій. Незалежно від нашої думки про таке використання, ця неухильна сила імпульсу спонукає до просування стану технологій, який може в кінцевому підсумку принести користь більш широкому прийняттю.
У цьому випадку можливо, що ціна буде вищою, ніж зазвичай, оскільки відкриття гіперреалістичної відео-креації має очевидні наслідки для кримінального, політичного та етичного неправильного використання.
Одна група Reddit (яку я не назву тут) присвячена генерації відео-контенту NSFW AI, має відкритий сервер Discord, де користувачі вдосконалюють ComfyUI-потоки для генерації відео-порнографії на основі Hunyuan. Щодня користувачі публікують приклади кліпів NSFW – багато з яких можна розумно назвати ‘екстремальними’, або хоча б таких, що напружують обмеження, зазначені в правилах форуму.
Ця спільнота також підтримує суттєву і розвинену репозиторій GitHub, що містить інструменти, які можуть завантажувати і обробляти відео-порнографію, щоб забезпечити навчальні дані для нових моделей.
Оскільки найпопулярніший тренер LoRA, Kohya-ss, зараз підтримує тренування Hunyuan LoRA, бар’єри для входу у безмежне тренування відео знижуються щодня, разом з апаратними вимогами для тренування і генерації відео Hunyuan.
Критичний аспект присвячених тренувальних схем для порнографічного AI (а не ідентифікаторних моделей, таких як знаменитості) полягає в тому, що стандартна базова модель, така як Hunyuan, не тренується конкретно на виході NSFW, і може тому виконувати роботу погано, коли її просять генерувати контент NSFW, або не може розрізняти вивчені поняття і асоціації у виконуваному або переконливому порядку.
Розробляючи тонко налаштовані моделі NSFW і LoRAs, буде все більше можливим проєктувати треновані ідентифікатори у присвячений ‘порно’-відео-домен; після всього, це лише відео-версія чогось, що вже відбулося для статичних зображень протягом останніх двох з половиною років.
VFX
Величезне підвищення темпоральної консистентності, яке пропонують Hunyuan Video LoRAs, є очевидним благом для індустрії візуальних ефектів AI, яка сильно спирається на адаптацію відкритого програмного забезпечення.
Хоча підхід Hunyuan Video LoRA генерує весь кадр і середовище, компанії VFX, ймовірно, вже почали експериментувати з ізоляцією тимчасово-консистентних людських облич, які можна отримати цим методом, щоб накладати або інтегрувати обличчя у реальне джерельне відео.
Як і спільнота хобі, компанії VFX повинні чекати виходу компонентів image-to-video і video-to-video для Hunyuan Video, який є потенційно найбільш корисним містком між LoRA-орієнтованим, ідентифікаторним ‘deepfake’-контентом; або ж імпровізувати і використовувати інтервал для дослідження зовнішніх можливостей фреймворка і потенційних адаптацій, а також власних пропрієтарних форків Hunyuan Video.
Хоча умови ліцензії для Hunyuan Video технічно дозволяють зображувати реальних людей, якщо є дозвіл, вони забороняють його використання в ЄС, Великій Британії та Південній Кореї. На принципі ‘що відбувається в Вегасі, залишається в Вегасі’, це не обов’язково означає, що Hunyuan Video не буде використаний у цих регіонах; однак перспектива зовнішніх аудитів даних для забезпечення зростаючих регулювань щодо генерації AI може зробити таке використання ризикованим.
Інша потенційно двозначна область умов ліцензії свідчить:
‘Якщо на дату випуску версії Tencent Hunyuan кількість активних користувачів усіх продуктів або послуг, доступних від або для Ліцензіата, становить понад 100 мільйонів активних користувачів у попередньому календарному місяці, Ви повинні запросити ліцензію у Tencent, яку Tencent може надати Вам за своїм розсудом, і Ви не авторизовані здійснювати жодних прав згідно з цією Угодою, якщо тільки Tencent інакше явно не надає Вам таких прав.’
Ця клаузула явно спрямована на безліч компаній, які, ймовірно, будуть ‘посередниками’ Hunyuan Video для відносно техно-неосвіченої частини користувачів, і які будуть вимушені включити Tencent у дію вище певного ліміту користувачів.
Чи може широке формулювання також покривати опосередковане використання (тобто через надання Hunyuan-відео-візуальних ефектів у популярних фільмах і телешоу) потребує уточнення.
Висновок
Оскільки відео deepfakes існують вже довгий час, було б легко недооцінити значення Hunyuan Video LoRA як підходу до синтезу ідентифікатора і deepfaking; і припустити, що поточні зусилля, які проявляються у спільноті Civit і на пов’язаних Discord і subreddit, представляють лише невеликий поштовх до真正ої контролюємої людської відео-синтезу.
Більш імовірно, що поточні зусилля представляють лише частину потенціалу Hunyuan Video для створення повністю переконливих повністю тілесних і повністю середовищних deepfakes; як тільки компонент image-to-video буде випущений (очікується цього місяця), значно більш детальний рівень генеративної сили стане доступним як для хобі, так і для професійної спільноти.
Коли Stability.ai випустила Stable Diffusion у 2022 році, багато спостерігачів не могли визначити, чому компанія просто віддає таку цінну і потужну генеративну систему. З Hunyuan Video прибуткова мотивація закладена безпосередньо у ліцензію – хоча, можливо, буде складно для Tencent визначити, коли компанія спрацює схему розподілу прибутку.
У будь-якому випадку результат однаковий, як і у 2022 році: присвячені спільноти розробників сформувалися негайно і з інтенсивним фанатизмом навколо випуску. Деякі з шляхів, які ці зусилля приймуть протягом наступних 12 місяців, напевно, спонукають до появи нових заголовків.
* До 136 на момент публікації.
Перша публікація у вівторок, 7 січня 2025 року












