Angolo di Anderson
L’ascesa di Hunyuan Video Deepfakes

A causa della natura di alcuni dei materiali discussi qui, questo articolo conterrà meno collegamenti di riferimento e illustrazioni del solito.
Qualcosa di notevole sta attualmente accadendo nella comunità di sintesi AI, anche se il suo significato potrebbe richiedere un po’ di tempo per diventare chiaro. Gli appassionati stanno allenando modelli di video generativi AI per riprodurre le somiglianze di persone, utilizzando video-based LoRAs sul framework Hunyuan Video open source di recente rilascio da Tencent.*
Fare clic per riprodurre. Risultati diversi dalle personalizzazioni Hunyuan-based LoRA disponibili gratuitamente nella comunità Civit. Allenando modelli di adattamento a basso rango (LoRAs), le problematiche relative alla stabilità temporale, che hanno infastidito la generazione di video AI per due anni, sono notevolmente ridotte. Fonti: civit.ai
Nel video mostrato sopra, le somiglianze delle attrici Natalie Portman, Christina Hendricks e Scarlett Johansson, insieme al leader tecnologico Elon Musk, sono state addestrate in file aggiuntivi relativamente piccoli per il sistema di video generativo Hunyuan, che può essere installato senza filtri di contenuto (come filtri NSFW) sul computer dell’utente.
Il creatore della LoRA di Christina Hendricks mostrata sopra afferma che sono stati necessari solo 16 immagini dalla serie TV Mad Men per sviluppare il modello (che è un download di soli 307mb); numerose pubblicazioni dalla comunità Stable Diffusion su Reddit e Discord confermano che le LoRAs di questo tipo non richiedono grandi quantità di dati di allenamento o tempi di allenamento lunghi, nella maggior parte dei casi.
Clic per riprodurre. Arnold Schwarzenegger viene portato in vita in una LoRA video Hunyuan che può essere scaricata su Civit. Vedi https://www.youtube.com/watch?v=1D7B9g9rY68 per ulteriori esempi di Arnie, dell’entusiasta AI Bob Doyle.
Le LoRAs Hunyuan possono essere addestrate su immagini statiche o video, anche se l’addestramento su video richiede risorse hardware maggiori e un tempo di addestramento aumentato.
Il modello di video Hunyuan presenta 13 miliardi di parametri, superando i 12 miliardi di parametri di Sora e superando notevolmente il modello Hunyuan-DiT meno capace, rilasciato come open source nell’estate del 2024, che ha solo 1,5 miliardi di parametri.
Come era il caso due anni e mezzo fa con Stable Diffusion e LoRA (vedi esempi di celebrità ‘native’ di Stable Diffusion 1.5 qui), il modello di base in questione ha una comprensione molto limitata delle personalità delle celebrità, rispetto al livello di fedeltà che può essere ottenuto attraverso implementazioni di LoRA ‘iniettate di ID’.
In effetti, una LoRA personalizzata e focalizzata sulla personalità ottiene un ‘passaggio gratuito’ sulle significative capacità di sintesi del modello di base Hunyuan, offrendo una sintesi umana notevolmente più efficace di quanto possa essere ottenuta sia dai autoencoder deepfakes dell’era 2017, sia tentando di aggiungere movimento a immagini statiche attraverso sistemi come il LivePortrait celebrato.
Tutte le LoRAs rappresentate qui possono essere scaricate gratuitamente dalla comunità Civit, mentre il numero più abbondante di LoRAs personalizzate ‘statiche’ più vecchie può anche potenzialmente creare ‘semi’ di immagini per il processo di creazione di video (cioè immagine-video, una versione pendente per Hunyuan Video, anche se sono possibili soluzioni alternative, per il momento).
Fare clic per riprodurre. Sopra, campioni da una LoRA ‘statica’ Flux; sotto, esempi da una LoRA video Hunyuan con la musicista Taylor Swift. Entrambe queste LoRAs sono disponibili gratuitamente nella comunità Civit.
Mentre scrivo, il sito web Civit offre 128 risultati di ricerca per ‘Hunyuan’*. Quasi tutti questi sono in qualche modo modelli NSFW; 22 rappresentano celebrità; 18 sono progettati per facilitare la generazione di pornografia hard; e solo sette di essi rappresentano uomini piuttosto che donne.
Cosa c’è di nuovo?
A causa della natura in evoluzione del termine deepfake, e della limitata comprensione pubblica delle (molto severe) limitazioni dei framework di sintesi video AI umana fino ad oggi, il significato della LoRA Hunyuan non è facile da capire per una persona che segue casualmente la scena dell’AI generativa. Rivisitiamo alcune delle principali differenze tra le LoRAs Hunyuan e gli approcci precedenti alla generazione di video AI basata sull’identità.
1: Installazione locale senza limiti
L’aspetto più importante del video Hunyuan è il fatto che può essere scaricato localmente e che mette un sistema di generazione di video AI molto potente e senza censura nelle mani dell’utente casuale, così come della comunità VFX (nella misura in cui le licenze lo consentano attraverso regioni geografiche).
L’ultima volta che questo è successo è stato con l’uscita del modello Stable Diffusion di Stability.ai come open source nell’estate del 2022. In quel momento, OpenAI’s DALL-E2 aveva catturato l’immaginazione pubblica, anche se DALLE-2 era un servizio a pagamento con notevoli restrizioni (che sono cresciute nel tempo).
Quando Stable Diffusion è diventato disponibile, e Low-Rank Adaptation ha reso possibile generare immagini dell’identità di qualsiasi persona (celebrità o no), il grande locus di interesse dei sviluppatori e dei consumatori ha aiutato Stable Diffusion a eclissare la popolarità di DALLE-2; anche se quest’ultimo era un sistema più capace out-of-the-box, le sue routine di censura erano viste come onerose da molti dei suoi utenti, e la personalizzazione non era possibile.
Arguably, la stessa sceneggiatura si applica ora tra Sora e Hunyuan – o, più precisamente, tra sistemi generativi video proprietari di livello Sora e rivali open source, dei quali Hunyuan è il primo – ma probabilmente non l’ultimo (qui, considera che Flux avrebbe eventualmente guadagnato terreno su Stable Diffusion).
Gli utenti che desiderano creare output LoRA Hunyuan, ma che mancano di attrezzature efficacemente potenti, possono, come sempre, scaricare l’aspetto GPU dell’addestramento a servizi di calcolo online come RunPod. Ciò non è lo stesso che creare video AI su piattaforme come Kaiber o Kling, poiché non è coinvolta alcuna filtrazione semantica o basata su immagini (censura) nell’affittare un GPU online per supportare un flusso di lavoro altrimenti locale.
2: Nessun bisogno di video ‘host’ e alto sforzo
Quando i deepfakes sono apparsi sulla scena alla fine del 2017, il codice pubblicato in forma anonima si sarebbe evoluto nei fork mainstream DeepFaceLab e FaceSwap (nonché il sistema di deepfaking in tempo reale DeepFaceLive).
Questo metodo richiedeva la cura meticolosa di migliaia di immagini di facce di ogni identità da scambiare; meno sforzo è stato messo in questa fase, meno efficace sarebbe stato il modello. Inoltre, i tempi di addestramento variavano tra 2-14 giorni, a seconda dell’hardware disponibile, stressando anche sistemi capaci nel lungo termine.
Quando il modello era finalmente pronto, poteva solo imporre facce in video esistenti e di solito aveva bisogno di un ‘bersaglio’ (cioè un’identità reale) che fosse vicino in apparenza all’identità sovrapposta.
Di recente, ROOP, LivePortrait e numerosi framework simili hanno fornito funzionalità simili con molto meno sforzo e spesso con risultati superiori – ma senza alcuna capacità di generare deepfakes a corpo intero precisi – o qualsiasi elemento diverso dalle facce.

Esempi di ROOP Unleashed e LivePortrait (inset in basso a sinistra), dal flusso di contenuti di Bob Doyle su YouTube. Fonti: https://www.youtube.com/watch?v=i39xeYPBAAM e https://www.youtube.com/watch?v=QGatEItg2Ns
In contrasto, le LoRAs Hunyuan (e i sistemi simili che inevitabilmente seguiranno) consentono la creazione senza limiti di interi mondi, compresa la simulazione a corpo intero dell’identità LoRA addestrata dall’utente.
3: Coerenza temporale notevolmente migliorata
La coerenza temporale è stata l’obiettivo principale della diffusione video per diversi anni. L’uso di una LoRA, insieme a prompt appropriati, dà alla generazione di video Hunyuan un riferimento costante di identità a cui attenersi. In teoria (questi sono i primi giorni), si potrebbe addestrare più LoRAs di una particolare identità, ognuna con abbigliamento specifico.
Sotto queste condizioni, l’abbigliamento è anche meno probabile che ‘muti’ nel corso di una generazione di video (poiché il sistema generativo si basa sul frame successivo su una finestra molto limitata di frame precedenti).
(In alternativa, come per i sistemi di LoRA basati su immagini, si può semplicemente applicare più LoRAs, come identità + LoRAs di costume, a una singola generazione di video)
4: Accesso all’esperimento ‘umano’
Come ho recentemente osservato, il settore generativo AI proprietario e di livello FAANG sembra essere così preoccupato per la possibile critica relativa alle capacità di sintesi umana dei suoi progetti, che le persone reali appaiono raramente nelle pagine dei progetti per importanti annunci e rilasci. Al loro posto, la letteratura pubblicitaria relativa tende a mostrare soggetti ‘carini’ e ‘non minacciosi’ in risultati sintetizzati.
Con l’avvento delle LoRAs Hunyuan, per la prima volta, la comunità ha l’opportunità di spingere i limiti della sintesi video umana basata su LDM in un sistema molto capace (piuttosto che marginale) e di esplorare appieno l’argomento che interessa la maggior parte di noi – le persone.
Implicazioni
Dal momento che una ricerca per ‘Hunyuan’ nella comunità Civit mostra principalmente LoRAs di celebrità e ‘hardcore’, l’implicazione centrale dell’avvento delle LoRAs Hunyuan è che saranno utilizzate per creare video pornografici AI (o diffamatori) di persone reali – celebrità e sconosciuti allo stesso modo.
Per scopi di conformità, gli appassionati che creano LoRAs Hunyuan e che sperimentano con esse su server Discord diversi sono prudenti nel proibire esempi di persone reali dall’essere pubblicati. La realtà è che anche i deepfakes basati su immagini sono ora severamente strumentalizzati; e la prospettiva di aggiungere video realistici veramente realistici al mix potrebbe finalmente giustificare le paure aumentate che sono state ricorrenti nei media negli ultimi sette anni, e che hanno promosso nuove regolamentazioni.
La forza trainante
Come sempre, la pornografia rimane la forza trainante per la tecnologia. Qualunque sia la nostra opinione su tale utilizzo, questo motore di impulso incessante guida gli avanzamenti nello stato dell’arte che possono alla fine beneficiare un’adozione più mainstream.
In questo caso, è possibile che il prezzo sarà più alto del solito, poiché l’open-sourcing della creazione di video iperrealistici ha implicazioni ovvie per l’uso criminale, politico ed etico.
Un gruppo Reddit (che non menzionerò qui) dedicato alla generazione di video NSFW AI ha un server Discord aperto associato, dove gli utenti stanno perfezionando workflows ComfyUI per la generazione di video pornografici basati su Hunyuan. Gli utenti pubblicano quotidianamente esempi di clip NSFW – molti dei quali possono essere ragionevolmente definiti ‘estremi’, o almeno che mettono a dura prova le restrizioni dichiarate nelle regole del forum.
Questa comunità mantiene anche un repository GitHub sostanziale e ben sviluppato che presenta strumenti che possono scaricare e elaborare video pornografici, per fornire dati di addestramento per nuovi modelli.
Dal momento che il trainer LoRA più popolare, Kohya-ss, supporta ora l’addestramento LoRA Hunyuan, le barriere all’ingresso per l’addestramento di video generativo senza limiti stanno diminuendo quotidianamente, insieme ai requisiti hardware per l’addestramento e la generazione di video Hunyuan.
L’aspetto cruciale degli schemi di addestramento dedicati per l’AI pornografica (piuttosto che modelli ‘basati sull’identità’, come le celebrità) è che un modello di base standard come Hunyuan non è specificamente addestrato su output NSFW, e potrebbe quindi avere prestazioni scarse quando richiesto di generare contenuti NSFW, o fallire nel disentanglement di concetti e associazioni apprese in modo convincente.
Sviluppando modelli di base NSFW e LoRAs fine-tuned, sarà sempre più possibile proiettare identità addestrate in un dominio di video ‘pornografico’ dedicato; dopotutto, questo è solo la versione video di qualcosa che è già accaduto per le immagini fisse negli ultimi due anni e mezzo.
VFX
Il notevole aumento della coerenza temporale che le LoRAs video Hunyuan offrono è un ovvio vantaggio per l’industria dei visual effects AI, che si basa molto sull’adattamento del software open source.
Anche se un approccio LoRA video Hunyuan genera un intero frame e ambiente, le società VFX hanno quasi certamente iniziato a sperimentare l’isolamento delle facce umane temporalmente coerenti che possono essere ottenute con questo metodo, al fine di sovrapporre o integrare facce in footage reale di origine.
Allo stesso modo della comunità degli appassionati, le società VFX devono aspettare la funzionalità di immagine-video e video-video di Hunyuan Video, che è potenzialmente il ponte più utile tra contenuti ‘deepfake’ basati su LoRA e ID; o improvvisare e utilizzare l’intervallo per sondare le capacità esterne del framework e delle sue possibili adattamenti, e persino fork proprietari in-house di Hunyuan Video.
Sebbene i termini della licenza per Hunyuan Video consentano tecnicamente la rappresentazione di individui reali a condizione che venga data l’autorizzazione, essi proibiscono il suo utilizzo nell’UE, nel Regno Unito e in Corea del Sud. Sul principio ‘rimane a Las Vegas’, ciò non significa necessariamente che Hunyuan Video non sarà utilizzato in queste regioni; tuttavia, la prospettiva di audit di dati esterni per far rispettare le regolamentazioni in aumento sull’AI generativa potrebbe rendere un tale utilizzo illecito rischioso.
Un’altra area potenzialmente ambigua dei termini della licenza afferma:
‘Se, alla data di rilascio della versione di Tencent Hunyuan, gli utenti attivi mensili di tutti i prodotti o servizi resi disponibili da o per il Licenziatario sono maggiori di 100 milioni di utenti attivi mensili nel mese di calendario precedente, Lei deve richiedere una licenza a Tencent, che Tencent può concedere a Sua esclusiva discrezione, e Lei non è autorizzato a esercitare alcuno dei diritti previsti da questo Accordo, a meno che e fino a quando Tencent non Le conceda tali diritti.’
Questa clausola è chiaramente rivolta alla moltitudine di società che probabilmente ‘intermedierebbero’ Hunyuan Video per un corpo di utenti relativamente tecnologicamente analfabeti, e che saranno tenute a far partecipare Tencent all’azione, al di sopra di un certo soffitto di utenti.
Se la formulazione ampia potrebbe anche coprire l’uso indiretto (ad esempio, tramite la fornitura di output di effetti visivi abilitati da Hunyuan in film e programmi TV popolari) potrebbe aver bisogno di chiarimenti.
Conclusione
Dal momento che i video deepfake esistono da molto tempo, sarebbe facile sottovalutare il significato della LoRA video Hunyuan come approccio alla sintesi dell’identità e al deepfaking; e supporre che gli sforzi attualmente in atto nella comunità Civit e nei relativi Discord e subreddit rappresentino solo un piccolo passo verso la sintesi video umana veramente controllabile.
È più probabile che gli sforzi attuali rappresentino solo una frazione del potenziale di Hunyuan Video per creare deepfakes a corpo intero e a ambiente intero completamente convincenti; una volta che il componente di immagine-video sarà rilasciato (si dice che ciò avverrà questo mese), un livello di generazione molto più granulare sarà disponibile per entrambe le comunità di appassionati e professionisti.
Quando Stability.ai ha rilasciato Stable Diffusion nel 2022, molti osservatori non potevano capire perché la società stesse regalando qualcosa di così prezioso e potente; con Hunyuan Video, il motivo del profitto è costruito direttamente nella licenza – anche se potrebbe rivelarsi difficile per Tencent determinare quando una società attiva lo schema di condivisione dei profitti.
In ogni caso, il risultato è lo stesso di quanto accaduto nel 2022: comunità di sviluppo dedicate si sono formate immediatamente e con fervore intenso intorno al rilascio. Alcuni dei percorsi che questi sforzi intraprenderanno nei prossimi 12 mesi sono sicuramente destinati a generare nuovi titoli.
* Fino a 136 al momento della pubblicazione.
Pubblicato per la prima volta martedì 7 gennaio 2025












