Andersons hoek
De Opkomst van Hunyuan Video Deepfakes

Vanwege de aard van sommige van de hier besproken materialen, zal dit artikel minder referentielinks en illustraties bevatten dan gewoonlijk.
Iets opmerkelijks gebeurt momenteel in de AI-synthesegemeenschap, hoewel de betekenis hiervan mogelijk enige tijd nodig heeft om duidelijk te worden. Hobbyisten trainen generatieve AI-videomodellen om de gelijkenis van mensen te reproduceren met behulp van video-gebaseerde LoRAs op het onlangs door Tencent uitgebrachte open-source Hunyuan Video-framework.*
Click to play. Uiteenlopende resultaten van Hunyuan-gebaseerde LoRA-aanpassingen vrij beschikbaar op de Civit-gemeenschap. Door het trainen van low-rank adaptatiemodellen (LoRAs) worden problemen met temporele stabiliteit, die AI-videogeneratie al twee jaar hebben geplaagd, aanzienlijk verminderd. Bronnen: civit.ai
In de bovenstaande video zijn de gelijkenissen van actrices Natalie Portman, Christina Hendricks en Scarlett Johansson, samen met tech-leider Elon Musk, getraind in relatief kleine add-on-bestanden voor het Hunyuan-generatieve videosysteem, dat zonder contentfilters (zoals NSFW-filters) op een gebruikerscomputer kan worden geïnstalleerd.
De maker van de Christina Hendricks LoRA hierboven verklaart dat slechts 16 afbeeldingen uit de Mad Men-televisieserie nodig waren om het model te ontwikkelen (dat een download van slechts 307mb is); meerdere berichten van de Stable Diffusion-gemeenschap op Reddit en Discord bevestigen dat LoRAs van dit type geen hoge hoeveelheden trainingsgegevens of -tijden nodig hebben in de meeste gevallen.
Click to play. Arnold Schwarzenegger wordt tot leven gewekt in een Hunyuan-video LoRA die kan worden gedownload op Civit. Zie https://www.youtube.com/watch?v=1D7B9g9rY68 voor verdere Arnie-voorbeelden van AI-enthousiast Bob Doyle.
Hunyuan LoRAs kunnen worden getraind op zowel statische afbeeldingen als video’s, hoewel het trainen op video’s meer hardwarebronnen en verhoogde traintijd vereist.
Het Hunyuan Video-model heeft 13 miljard parameters, wat meer is dan de 12 miljard parameters van Sora, en veruit meer dan het minder capabele Hunyuan-DiT-model dat in de zomer van 2024 als open source is uitgebracht, dat slechts 1,5 miljard parameters heeft.
Net als twee en een half jaar geleden met Stable Diffusion en LoRA (zie voorbeelden van Stable Diffusion 1.5’s ‘native’ celebrities hier), heeft het basismodel in kwestie een veel beperktere kennis van beroemdheden, in vergelijking met het niveau van geloofwaardigheid dat kan worden behaald met ‘ID-geïnjecteerde’ LoRA-implementaties.
Effectief krijgt een aangepaste, op persoonlijkheid gerichte LoRA een ‘vrije rit’ op de aanzienlijke synthese-mogelijkheden van het basis-Hunyuan-model, waardoor een opvallend effectievere menselijke synthese wordt geboden dan kan worden behaald met 2017-era autoencoder deepfakes of door beweging toe te voegen aan statische afbeeldingen via systemen zoals de gefête LivePortrait.
Alle LoRAs die hier worden weergegeven, kunnen gratis worden gedownload van de zeer populaire Civit-gemeenschap, terwijl de meer talrijke oudere aangepaste ‘statische afbeelding’ LoRAs ook potentieel ‘zaad’-afbeeldingen kunnen creëren voor het videocreatieproces (d.w.z. afbeelding-naar-video, een aanstaande release voor Hunyuan Video, hoewel workarounds mogelijk zijn, voorlopig).
Click to play. Boven, voorbeelden van een ‘statische’ Flux LoRA; onder, voorbeelden van een Hunyuan-video LoRA met muzikant Taylor Swift. Beide LoRAs zijn gratis beschikbaar op de Civit-gemeenschap.
Als ik schrijf, biedt de Civit-website 128 zoekresultaten voor ‘Hunyuan’*. Bijna allemaal zijn dit op de een of andere manier NSFW-modellen; 22 zijn beroemdheden; 18 zijn ontworpen om de generatie van hardcore-pornografie te faciliteren; en slechts zeven daarvan zijn mannen in plaats van vrouwen.
Wat is er nieuw?
Vanwege de evoluerende aard van de term deepfake en de beperkte openbare kennis van de (zeer ernstige) beperkingen van AI-menselijke videosyntheseframeworks tot nu toe, is de betekenis van de Hunyuan LoRA niet gemakkelijk te begrijpen voor iemand die de generatieve AI-scene oppervlakkig volgt. Laten we enkele van de belangrijkste verschillen tussen Hunyuan LoRAs en eerdere benaderingen van identiteit-gebaseerde AI-videogeneratie bekijken.
1: Onbeperkte lokale installatie
Het meest belangrijke aspect van Hunyuan Video is het feit dat het lokaal kan worden gedownload en dat het een zeer krachtig en onbeperkt AI-videogeneratiesysteem in handen geeft van de gebruiker, evenals de VFX-gemeenschap (voor zover licenties dit toelaten over geografische regio’s).
De laatste keer dat dit gebeurde, was bij de release van de Stable Diffusion-model van Stability.ai in de zomer van 2022. Toen had OpenAI’s DALL-E2 de publieke verbeelding gevangen, hoewel DALLE-2 een betaalde dienst was met opvallende beperkingen (die in de loop van de tijd zijn toegenomen).
Toen Stable Diffusion beschikbaar kwam en Low-Rank Adaptation het mogelijk maakte om afbeeldingen van de identiteit van elke persoon (beroemdheid of niet) te genereren, hielp de enorme hoeveelheid ontwikkelaars- en consumenteninteresse Stable Diffusion om de populariteit van DALLE-2 te overtreffen; hoewel laatstgenoemde een capabeler systeem was uit de doos, werden de censuur-routines als omslachtig beschouwd door veel van zijn gebruikers en was aanpassing niet mogelijk.
Men kan argumenteren dat hetzelfde scenario nu van toepassing is tussen Sora en Hunyuan – of, meer nauwkeurig, tussen Sora-grade propriëtaire generatieve videosystemen en open source-rivalen, waarvan Hunyuan de eerste is – maar waarschijnlijk niet de laatste (hierbij moet men bedenken dat Flux uiteindelijk aanzienlijk terrein zou winnen op Stable Diffusion).
Gebruikers die Hunyuan LoRA-uitvoer willen maken, maar niet over voldoende apparatuur beschikken, kunnen, zoals altijd, het GPU-aspect van de training uitbesteden aan online compute-diensten zoals RunPod. Dit is niet hetzelfde als het maken van AI-videos op platforms zoals Kaiber of Kling, aangezien hierbij geen semantische of beeldgebaseerde filtering (censuur) is betrokken bij het huren van een online GPU om een lokaal werkproces te ondersteunen.
2: Geen behoefte aan ‘host’-video’s en hoge inspanning
Toen deepfakes eind 2017 op het toneel verschenen, zou de anoniem gepubliceerde code evolueren in de mainstream-forks DeepFaceLab en FaceSwap (evenals het DeepFaceLive real-time deepfaking-systeem).
Dit vereiste de zorgvuldige curatie van duizenden gezichtsafbeeldingen van elke identiteit die moest worden uitgewisseld; hoe minder inspanning hierin werd gestoken, hoe minder effectief het model zou zijn. Bovendien varieerden de traintijden tussen 2-14 dagen, afhankelijk van de beschikbare hardware, waardoor zelfs capabele systemen op lange termijn werden belast.
Toen het model eindelijk klaar was, kon het alleen gezichten in bestaande video’s implanteren en had het meestal een ‘doelwit’ (d.w.z. een echte) identiteit nodig die qua uiterlijk overeenkwam met de geïmplanteerde identiteit.
Onlangs hebben ROOP, LivePortrait en talloze soortgelijke frameworks soortgelijke functionaliteit geboden met veel minder inspanning en vaak met superieure resultaten – maar zonder de mogelijkheid om nauwkeurige full-body deepfakes te genereren – of enig ander element dan gezichten.

Voorbeelden van ROOP Unleashed en LivePortrait (inset onderaan links), van Bob Doyle’s content stream op YouTube. Bronnen: https://www.youtube.com/watch?v=i39xeYPBAAM en https://www.youtube.com/watch?v=QGatEItg2Ns
In tegenstelling tot Hunyuan LoRAs (en soortgelijke systemen die onvermijdelijk zullen volgen) is het mogelijk om complete werelden te creëren, inclusief full-body simulatie van de door de gebruiker getrainde LoRA-identiteit.
3: Aanzienlijk verbeterde temporele consistentie
Temporele consistentie is de Heilige Graal van diffusievideo geweest voor verschillende jaren nu. Het gebruik van een LoRA, samen met passende prompts, geeft een Hunyuan-videogeneratie een constante identiteitsreferentie om zich aan te houden. In theorie (dit zijn vroege dagen) zou men meerdere LoRAs van een bepaalde identiteit kunnen trainen, elk met specifieke kleding.
Onder die auspiciën is de kleding ook minder waarschijnlijk om ‘te muteren’ gedurende de loop van een videogeneratie (aangezien het generatieve systeem de volgende frame baseert op een zeer beperkt venster van eerdere frames).
(Alternatief, zoals bij afbeelding-gebaseerde LoRA-systemen, kan men eenvoudig meerdere LoRAs toepassen, zoals identiteit + kostuum LoRAs, op een enkele videogeneratie)
4: Toegang tot de ‘menselijke experiment’
Zoals ik onlangs opmerkte, lijkt de propriëtaire en FAANG-niveau generatieve AI-sector nu zo bang te zijn voor potentiële kritiek met betrekking tot de menselijke synthese-mogelijkheden van hun projecten, dat echte mensen zelden verschijnen in projectpagina’s voor grote aankondigingen en releases. In plaats daarvan wordt in de gerelateerde publiciteitsliteratuur steeds vaker ‘schattige’ en anderszins ‘niet-bedreigende’ onderwerpen getoond in gesynthetiseerde resultaten.
Met de komst van Hunyuan LoRAs heeft de gemeenschap voor het eerst de kans om de grenzen van LDM-gebaseerde menselijke videosynthese te verkennen in een zeer capabel (in plaats van marginaal) systeem en om volledig te onderzoeken het onderwerp dat de meeste van ons het meest interesseert – mensen.
Implicaties
Aangezien een zoekopdracht naar ‘Hunyuan’ in de Civit-gemeenschap meestal celebrity LoRAs en ‘hardcore’ LoRAs laat zien, is de centrale implicatie van de komst van Hunyuan LoRAs dat ze zullen worden gebruikt om AI-pornografische (of anderszins smaadrijke) video’s van echte mensen te maken – zowel beroemdheden als onbekenden.
Voor compliance-doeleinden zijn de hobbyisten die Hunyuan LoRAs maken en die experimenteren met ze op diverse Discord-servers, zorgvuldig om voorbeelden van echte mensen te weren. De realiteit is dat zelfs afbeelding-gebaseerde deepfakes nu zwaar zijn bewapend; en het vooruitzicht van het toevoegen van echt realistische video’s aan de mix kan eindelijk de verhoogde angsten rechtvaardigen die de afgelopen zeven jaar in de media zijn geuit en die hebben geleid tot nieuwe regelgeving.
De drijvende kracht
Zoals altijd blijft porno de drijvende kracht voor technologie. Wat onze mening over een dergelijk gebruik ook is, deze onverbiddelijke motor van impuls drijft vooruitgang in de staat van de techniek die uiteindelijk kan profiteren van meer mainstream-adoptie.
In dit geval is het mogelijk dat de prijs hoger zal zijn dan gebruikelijk, aangezien het open-source maken van hyperrealistische videocreatie duidelijke implicaties heeft voor criminele, politieke en ethische misbruik.
Een Reddit-groep (die ik hier niet zal noemen) gewijd aan AI-generatie van NSFW-video-inhoud heeft een geassocieerde open Discord-server waar gebruikers ComfyUI-workflows voor Hunyuan-gebaseerde video-pornogeneratie verfijnen. Dagelijks plaatsen gebruikers voorbeelden van NSFW-clips – veel daarvan kunnen redelijkerwijs ‘extreem’ worden genoemd, of ten minste de restricties in de forumregels onder spanning zetten.
Deze gemeenschap onderhoudt ook een aanzienlijke en goed ontwikkelde GitHub-repository met tools die pornografische video’s kunnen downloaden en verwerken om trainingsgegevens voor nieuwe modellen te bieden.
Because de meest populaire LoRA-trainer, Kohya-ss, nu ondersteuning biedt voor Hunyuan LoRA-training, dalen de toegangsbarrières voor onbeperkte generatieve videotraining dagelijks, evenals de hardwarevereisten voor Hunyuan-training en videogeneratie.
Het cruciale aspect van toegewijde trainingsregimes voor porno-gebaseerde AI (in plaats van identiteit-gebaseerde modellen, zoals beroemdheden) is dat een standaardbasismodel zoals Hunyuan niet specifiek is getraind op NSFW-uitvoer en mogelijk slecht presteert wanneer het wordt gevraagd om NSFW-inhoud te genereren, of faalt om geleerde concepten en associaties te ontwarren in een prestatief of overtuigend manier.
Door het ontwikkelen van fijngestemde NSFW-basismodellen en LoRAs, zal het steeds mogelijk worden om getrainde identiteiten te projecteren in een toegewijd ‘porno’-videodomein; tenslotte is dit alleen de video-versie van iets dat al is gebeurd voor statische afbeeldingen in de afgelopen twee en een half jaar.
VFX
De enorme toename in temporele consistentie die Hunyuan Video LoRAs biedt, is een voor de hand liggende zegen voor de AI-visual effects-industrie, die zeer zwaar leunt op het aanpassen van open source-software.
Hoewel een Hunyuan Video LoRA-aanpak een hele frame en omgeving genereert, hebben VFX-bedrijven waarschijnlijk al experimenten gedaan met het isoleren van de temporeel-consistente menselijke gezichten die met deze methode kunnen worden verkregen, om deze in te voegen of te integreren in bronmateriaal uit de echte wereld.
Net als de hobbyistengemeenschap, moeten VFX-bedrijven wachten op de image-to-video- en video-to-video-functionaliteit van Hunyuan Video, die potentieel de meest bruikbare brug is tussen LoRA-gedreven, ID-gebaseerde ‘deepfake’-inhoud; ofwel improviseren en de tijd gebruiken om de buitenste mogelijkheden van het framework en van potentiële aanpassingen, en zelfs propriëtaire in-house forks van Hunyuan Video, te onderzoeken.
Hoewel de licentievoorwaarden voor Hunyuan Video technisch gezien toestaan dat er afbeeldingen van echte personen worden getoond, mits toestemming is verleend, verbieden ze het gebruik ervan in de EU, het Verenigd Koninkrijk en Zuid-Korea. Op het ‘blijft in Vegas’-principe hoeft dit niet noodzakelijkerwijs te betekenen dat Hunyuan Video niet in deze regio’s zal worden gebruikt; echter kan het vooruitzicht van externe gegevensaudits om de groeiende regelgeving rond generatieve AI af te dwingen, een dergelijk ongeoorloofd gebruik riskant maken.
Een ander potentieel dubieus gebied in de licentievoorwaarden luidt:
‘Als, op de releasedatum van de Tencent Hunyuan-versie, de maandelijkse actieve gebruikers van alle producten of diensten die door of voor de licentiehouder beschikbaar zijn gesteld, meer dan 100 miljoen maandelijkse actieve gebruikers in de voorgaande kalendermaand zijn, moet u een licentie aanvragen bij Tencent, die Tencent naar eigen goeddunken kan verlenen, en u bent niet gemachtigd om enige rechten uit te oefenen op grond van deze overeenkomst, tenzij en totdat Tencent u anderszins uitdrukkelijk deze rechten verleent.’
Deze clausule is duidelijk gericht op de vele bedrijven die waarschijnlijk Hunyuan Video zullen ‘tussenkantoor’ maken voor een relatief technisch ongeletterde groep gebruikers, en die verplicht zullen zijn om Tencent te betrekken bij de actie, boven een bepaalde drempel van gebruikers.
Of de brede formulering ook indirect gebruik (d.w.z. via het verstrekken van Hunyuan-geactiveerde visuele effectenuitvoer in populaire films en tv-programma’s) kan omvatten, kan verduidelijking behoeven.
Conclusie
Aangezien deepfake-video al lang bestaat, zou het gemakkelijk zijn om de betekenis van Hunyuan Video LoRA als benadering van identiteitssynthese en deepfaking te onderschatten; en om aan te nemen dat de ontwikkelingen die momenteel zichtbaar zijn in de Civit-gemeenschap en op gerelateerde Discords en subreddits, slechts een kleine incrementele stap voorwaarts zijn naar echt controleerbare menselijke videosynthese.
Waarschijnlijker is dat de huidige inspanningen slechts een fractie vertegenwoordigen van het potentieel van Hunyuan Video om volledig overtuigende full-body- en full-omgevingsdeepfakes te creëren; zodra de image-to-video-component wordt uitgebracht (waarvan wordt gezegd dat dit deze maand zal gebeuren), zal een veel gedetailleerder niveau van generatieve kracht beschikbaar komen voor zowel de hobbyist- als professionele gemeenschappen.
Toen Stability.ai Stable Diffusion in 2022 uitbracht, konden veel waarnemers niet begrijpen waarom het bedrijf zo’n waardevol en krachtig generatief systeem zou weggeven. Met Hunyuan Video is de winstmotivatie rechtstreeks in de licentie ingebouwd – hoewel het voor Tencent mogelijk moeilijk kan zijn om te bepalen wanneer een bedrijf het winstdelingsregime activeert.
In elk geval is het resultaat hetzelfde als het was in 2022: toegewijde ontwikkelingsgemeenschappen zijn onmiddellijk en met intense ijver gevormd rond de release. Sommige van de wegen die deze inspanningen in de komende 12 maanden zullen nemen, zijn zeker om nieuwe koppen te maken.
* Tot 136 op het moment van publicatie.
Eerste publicatie dinsdag 7 januari 2025












