Andersonův úhel

Vzestup Hunyuan Video Deepfakes

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

Z důvodu povahy některých materiálů diskutovaných zde bude tento článek obsahovat méně odkazů a ilustrací než obvykle.

Na scéně komunity syntézy AI něco pozoruhodného právě probíhá, i když jeho význam může trvat nějakou dobu, než se stane jasným. Hobbyisté trénují generativní modely AI videa, aby reprodukovaly podobu lidí, pomocí video-založených LoRAs na nedávno uvolněné open source Hunyuan Video framework.*

Kliknutím se přehraje. Různé výsledky z Hunyuan-based LoRA customizations volně dostupné v komunitě Civit. Trénováním low-rank adaptation modelů (LoRAs) jsou problémy s temporální stabilitou, které sužovaly generaci AI videa po dva roky, výrazně sníženy. Zdroje: civit.ai

V výše uvedeném videu byly podobizny hereček Natalie Portman, Christina Hendricks a Scarlett Johansson, spolu s lídrem technologií Elonem Muskem, trénovány do relativně malých souborů pro generativní video systém Hunyuan, který lze nainstalovat bez obsahu filtrů (jako NSFW filtry) na počítači uživatele.

Tvůrce LoRA Christina Hendricks uvedl, že k vývoji modelu (který je pouhým 307mb stažení) byly potřebné pouze 16 obrázků z televizního seriálu Mad Men; flere příspěvky ze komunity Stable Diffusion na Redditu a Discordu potvrzují, že LoRAs tohoto druhu obvykle nevyžadují velké množství trénovacích dat nebo dlouhou dobu trénování.

Kliknutím se přehraje. Arnold Schwarzenegger je oživen v Hunyuan video LoRA, který lze stáhnout na Civit. Viz https://www.youtube.com/watch?v=1D7B9g9rY68 pro další Arnie příklady, od AI nadšence Boba Doyla.

Hunyuan LoRAs lze trénovat buď na statických obrazech nebo na videích, i když trénování na videích vyžaduje větší hardwarové zdroje a delší dobu trénování.

Model Hunyuan Video má 13 miliard parametrů, což přesahuje 12 miliard parametrů Sory a výrazně přesahuje méně schopný model Hunyuan-DiT, který byl uvolněn jako open source v létě 2024 a má pouze 1,5 miliardy parametrů.

Jako tomu bylo před dvěma a půl lety se Stable Diffusion a LoRA (viz příklady ‘rodných’ celebrit Stable Diffusion 1.5 zde), základní model v otázce má mnohem omezenější pochopení celebritních osobností ve srovnání s úrovní věrnosti, která může být získána prostřednictvím ‘ID-injected’ LoRA implementací.

Účinně, přizpůsobený, osobnostně zaměřený LoRA dostává ‘volnou jízdu’ na významných syntetických schopnostech základního modelu Hunyuan, nabízejícího pozoruhodně účinnější lidskou syntézu než lze získat buď pomocí modelů z roku 2017 autoencoder deepfakes nebo pokusem o přidání pohybu do statických obrazů pomocí systémů, jako je LivePortrait.

Všechny LoRAs zobrazené zde lze stáhnout zdarma z komunity Civit, zatímco větší počet starších statických LoRAs může také potenciálně vytvořit ‘semenové’ obrazy pro proces vytváření videa (tj. image-to-video, který je plánován na Hunyuan Video, i když pracovní postupy jsou možné prozatím).

Kliknutím se přehraje. Nahoře, vzorky z ‘statického’ Flux LoRA; dole, příklady z Hunyuan video LoRA s hudebníkem Taylor Swift. Tyto LoRAs jsou volně dostupné v komunitě Civit.

Jak píšu, web Civit nabízí 128 výsledků vyhledávání pro ‘Hunyuan’*. Téměř všechny z nich jsou nějakým způsobem NSFW modely; 22 zobrazují celebrity; 18 jsou navrženy pro usnadnění generování hardcore pornografie; a pouze sedm z nich zobrazuje muže místo žen.

Co je nového?

Vzhledem k vývoji pojmu deepfake a omezenému veřejnému pochopení (velmi závažných) omezení AI lidské video syntézy rámců do současnosti, význam Hunyuan LoRA není snadné pochopit pro osobu, která se pouze příležitostně zajímá o generativní AI scéně. Zkusme si projít některé z klíčových rozdílů mezi Hunyuan LoRAs a předchozími přístupy k identitě-založené AI video generaci.

1: Bez omezení lokální instalace

Nejvýznamnějším aspektem Hunyuan Video je fakt, že lze stáhnout lokálně a že dává velmi silný a nesenzurovaný AI video generativní systém do rukou běžného uživatele, stejně jako komunity VFX (do té míry, do které licence umožňují napříč geografickými regiony).

Posledně se to stalo u uvolnění open source modelu Stability.ai Stable Diffusion v létě 2022. V té době OpenAI’s DALL-E2 získal veřejnou imaginaci, i když DALLE-2 byl placenou službou s významnými omezeními (která rostla s časem).

Když se Stable Diffusion stal dostupným, a Low-Rank Adaptation poté umožnil generovat obrázky identity jakéhokoliv osoby (celebrity nebo ne), obrovský zájem vývojářů a spotřebitelů pomohl Stable Diffusion překonat popularitu DALLE-2; i když druhý byl schopnější systém out-of-the-box, jeho cenzurní rutiny byly považovány za zatěžující mnoha jeho uživateli, a přizpůsobení nebylo možné.

Možná stejná situace nyní platí mezi Sora a Hunyuan – nebo, přesněji, mezi Sora-grade proprietárními generativními video systémy a open source rivaly, z nichž Hunyuan je první – ale pravděpodobně ne poslední (zde zvažte, že Flux by nakonec získal významný náskok na Stable Diffusion).

Uživatelé, kteří chtějí vytvořit Hunyuan LoRA výstup, ale kteří postrádají účinné vybavení, mohou, jako vždy, offloadovat GPU aspekt trénování na online compute služby jako RunPod. To není totéž jako vytváření AI videí na platformách, jako jsou Kaiber nebo Kling, protože zde není žádný semantický nebo image-založený filtr (cenzura).

2: Žádná potřeba ‘host’ videí a vysoké úsilí

Když deepfakes vyšly na scénu na konci roku 2017, anonymně zveřejněný kód by se vyvinul do hlavních forků DeepFaceLab a FaceSwap (stejně jako DeepFaceLive real-time deepfaking systém).

Tato metoda vyžadovala pečlivé kurátorství tisíců face obrázků každé identity, která měla být vyměněna; méně úsilí vložené do této fáze, tím méně efektivní byl model. Kromě toho se trénovací časy lišily mezi 2-14 dny, v závislosti na dostupném hardwaru, což stresovalo i schopné systémy v dlouhodobém horizontu.

Když byl model konečně připraven, mohl pouze vložit tváře do existujících videí a obvykle potřeboval ‘cílovou’ (tj. reálnou) identitu, která byla blízká vzhledu superimponované identity.

V poslední době ROOP, LivePortrait a podobné rámce poskytly podobnou funkčnost s mnohem menším úsilím a často s lepších výsledky – ale bez kapacity generovat přesné full-body deepfakes – nebo jakýkoli jiný prvek kromě tváří.

Příklady ROOP Unleashed a LivePortrait (vloženo dolní levá), z Bob Doylova obsahu na YouTube. Zdroje: https://www.youtube.com/watch?v=i39xeYPBAAM a https://www.youtube.com/watch?v=QGatEItg2Ns

Příklady ROOP Unleashed a LivePortrait (vloženo dolní levá), z Bob Doylova obsahu na YouTube. Zdroje: https://www.youtube.com/watch?v=i39xeYPBAAM a https://www.youtube.com/watch?v=QGatEItg2Ns

Na rozdíl od toho Hunyuan LoRAs (a podobné systémy, které nevyhnutelně budou následovat) umožňují bez omezení vytvářet celé světy, včetně full-body simulace uživatelsky trénovaného LoRA identity.

3: Hromadně zlepšená temporální konzistence

Temporální konzistence byla Svatým grálem difuzního videa po několik let. Použití LoRA, spolu s vhodnými prompty, dává Hunyuan video generaci konstantní identitu referenci, ke které se drží. Teoreticky (těchto dnů je ještě málo) by bylo možné trénovat několik LoRAs konkrétní identity, každá nosící specifické oblečení.

Pod těmito auspiciemi je oblečení také méně pravděpodobné, že ‘mutuje’ během videa (protože generativní systém založí další snímek na velmi omezeném okně předchozích snímků).

(Alternativně, stejně jako u image-založených LoRA systémů, lze jednoduše aplikovat několik LoRAs, jako identity + kostým LoRAs, na jednu video generaci)

4: Přístup k ‘Lidskému experimentu’

Jako jsem nedávno poznamenal, proprietární a FAANG-level generativní AI sektor nyní vypadá, že je tak opatrný vůči potenciální kritice týkající se lidské syntézy schopností svých projektů, že skutečné lidé zřídka появují se v projektových stránkách pro hlavní oznámení a vydání. Místo toho se související publicity literatura stále více tenduje zobrazovat ‘roztomilé’ a jinak ‘neohrožující’ předměty v syntetizovaných výsledcích.

S příchodem Hunyuan LoRAs má komunita poprvé příležitost tlačit hranice LDM-založené lidské video syntézy v vysoce schopném (a nikoli okrajovém) systému a plně prozkoumat předmět, který nejvíce zajímá většinu z nás – lidi.

Implikace

Jelikož vyhledávání ‘Hunyuan’ v komunitě Civit většinou zobrazuje celebrity LoRAs a ‘hardcore’ LoRAs, centrální implikace vzniku Hunyuan LoRAs je, že budou použity k vytváření AI pornografických (nebo jinak hanlivých) videí skutečných lidí – celebrit a neznámých lidí.

Pro compliance účely jsou hobbyisté, kteří vytvářejí Hunyuan LoRAs a experimentují s nimi na různých Discord serverech, opatrní, aby zamezili příkladům skutečných lidí z being zveřejněných. Realita je taková, že i image-založené deepfakes jsou nyní silně zbraněné; a perspektiva přidání skutečně realistických videí do mixu může konečně ospravedlnit zvýšené obavy, které byly recidivující v médiích po posledních sedmi letech, a které vedly k novým regulacím.

Pohon

Jako vždy porn zůstává hlavním motorem pro technologický pokrok. Bez ohledu na náš názor na takovouto utilizaci, tento neúnavný motor impulzu pohání pokroky ve stavu umění, které mohou nakonec prospět více mainstreamové adopci.

V tomto případě je možné, že cena bude vyšší než obvykle, protože open-sourcing hyper-realistické video tvorby má zřejmé implikace pro kriminální, politickou a etickou zneužití.

Jedna subreddit skupina (kterou zde nebudu jmenovat) věnovaná AI generaci NSFW videa má přidružený, otevřený Discord server, kde uživatelé zdokonalují ComfyUI pracovní postupy pro Hunyuan-založenou video pornografii. Denně uživatelé zveřejňují příklady NSFW klipů – mnohé z nich lze rozumně označit za ‘extrémní’, nebo alespoň zatěžující omezení uvedená ve fórových pravidlech.

Tato komunita také udržuje podstatný a vyvinutý GitHub repozitář, který obsahuje nástroje, které lze použít ke stažení a zpracování pornografických videí, aby se poskytla trénovací data pro nové modely.

Pokud nejpopulárnější LoRA trenér, Kohya-ss, nyní podporuje Hunyuan LoRA trénování, bariéry vstupu pro neomezenou generativní video trénink se snižují denně, spolu s hardwarovými požadavky pro Hunyuan trénování a video generaci.

Klíčovým aspektem specializovaných trénovacích schémat pro pornografii-založenou AI (na rozdíl od identita-založených modelů, jako jsou celebrity) je, že standardní základový model jako Hunyuan není specificky trénován na NSFW výstup, a může proto buď vykonávat špatně, když je požádán o generování NSFW obsahu, nebo selhat disentangle naučené koncepty a asociace v performační nebo přesvědčivé podobě.

Rozvíjením fine-tuned NSFW základních modelů a LoRAs bude možné stále více projektovat trénované identity do specializovaného ‘porn’ video domény; koneckonců, toto je pouze video verze něčeho, co již nastalo pro statické obrázky za posledních dva a půl roku.

VFX

Velký nárůst temporální konzistence, který Hunyuan Video LoRAs nabízí, je zřejmým přínosem pro AI vizuální efekty průmysl, který silně spoléhá na adaptaci open source software.

Although a Hunyuan Video LoRA approach generates an entire frame and environment, VFX companies have almost certainly begun to experiment with isolating the temporally-consistent human faces that can be obtained by this method, in order to superimpose or integrate faces into real-world source footage.

Like the hobbyist community, VFX companies must wait for Hunyuan Video’s image-to-video and video-to-video functionality, which is potentially the most useful bridge between LoRA-driven, ID-based ‘deepfake’ content; or else improvise, and use the interval to probe the outer capabilities of the framework and of potential adaptations, and even proprietary in-house forks of Hunyuan Video.

Though the license terms for Hunyuan Video technically allow the depiction of real individuals so long as permission is given, they prohibit its use in the EU, United Kingdom, and in South Korea. On the ‘stays in Vegas’ principle, this does not necessarily mean that Hunyuan Video will not be used in these regions; however, the prospect of external data audits, to enforce a growing regulations around generative AI, could make such illicit usage risky.

One other potentially ambiguous area of the license terms states:

‘If, on the Tencent Hunyuan version release date, the monthly active users of all products or services made available by or for Licensee is greater than 100 million monthly active users in the preceding calendar month, You must request a license from Tencent, which Tencent may grant to You in its sole discretion, and You are not authorized to exercise any of the rights under this Agreement unless or until Tencent otherwise expressly grants You such rights.’

This clause is clearly aimed at the multitude of companies that are likely to ‘middleman’ Hunyuan Video for a relatively tech-illiterate body of users, and who will be required to cut Tencent into the action, above a certain ceiling of users.

Whether or not the broad phrasing could also cover indirect usage (i.e., via the provision of Hunyuan-enabled visual effects output in popular movies and TV) may need clarification.

Závěr

Since deepfake video has existed for a long time, it would be easy to underestimate the significance of Hunyuan Video LoRA as an approach to identity synthesis, and deepfaking; and to assume that the developments currently manifesting at the Civit community, and at related Discords and subreddits, represent a mere incremental nudge towards truly controllable human video synthesis.

More likely is that the current efforts represent only a fraction of Hunyuan Video’s potential to create completely convincing full-body and full-environment deepfakes; once the image-to-video component is released (rumored to be occurring this month), a far more granular level of generative power will become available to both the hobbyist and professional communities.

When Stability.ai released Stable Diffusion in 2022, many observers could not determine why the company would just give away what was, at the time, such a valuable and powerful generative system. With Hunyuan Video, the profit motive is built directly into the license – albeit that it may prove difficult for Tencent to determine when a company triggers the profit-sharing scheme.

In any case, the result is the same as it was in 2022: dedicated development communities have formed immediately and with intense fervor around the release. Some of the roads that these efforts will take in the next 12 months are surely set to prompt new headlines.

 

* Až 136 do doby zveřejnění.

První zveřejnění úterý, 7. ledna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai