Andersons hoek

HunyuanCustom Brengt Single-Image Video Deepfakes, Met Audio en Lip Sync

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Dit artikel bespreekt een nieuwe release van een multimodale Hunyuan Video-wereldmodel genaamd ‘HunyuanCustom’. De breedte van de dekking van het nieuwe artikel, gecombineerd met verschillende problemen in veel van de voorbeelden van video’s op de projectpagina*, beperkt ons tot een meer algemene dekking dan gebruikelijk, en tot een beperkte reproduktie van de enorme hoeveelheid video-materiaal dat bij deze release wordt geleverd (aangezien veel van de video’s aanzienlijke bewerking en verwerking vereisen om de leesbaarheid van de lay-out te verbeteren).

Let ook op dat het artikel naar de API-gebaseerde generatieve systeem Kling verwijst als ‘Keling’. Voor duidelijkheid verwijst naar ‘Kling’ in plaats daarvan.

 

Tencent is bezig met het uitbrengen van een nieuwe versie van hun Hunyuan Video-model, getiteld HunyuanCustom. De nieuwe release lijkt in staat te zijn om Hunyuan LoRA-modellen overbodig te maken, door de gebruiker in staat te stellen ‘deepfake’-stijl video-aanpassing te maken met een enkele afbeelding:

Click om af te spelen. Prompt: ‘Een man luistert naar muziek en kookt slakkennoedels in de keuken’. De nieuwe methode in vergelijking met zowel closed-source als open-source methoden, inclusief Kling, die een significante tegenstander in deze ruimte is. Source: https://hunyuancustom.github.io/ (waarschuwing: CPU/geheugenvolle site!)

In de linker kolom van de video hierboven zien we de enkele bronafbeelding die aan HunyuanCustom is geleverd, gevolgd door de nieuwe systeeminterpretatie van de prompt in de tweede kolom, ernaast. De overige kolommen laten de resultaten zien van verschillende propriëtaire en FOSS-systemen: Kling; Vidu; Pika; Hailuo; en de Wan-gebaseerde SkyReels-A2.

In de video hieronder zien we weergaven van drie scenario’s die essentieel zijn voor deze release: respectievelijk, persoon + object; single-character emulatie; en virtuele pasvorm (persoon + kleding):

Click om af te spelen. Drie voorbeelden bewerkt uit het materiaal op de ondersteunende site voor Hunyuan Video.

We kunnen een aantal dingen opmerken uit deze voorbeelden, meestal gerelateerd aan het systeem dat afhankelijk is van een enkele bronafbeelding, in plaats van meerdere afbeeldingen van hetzelfde onderwerp.

In het eerste fragment zien we dat de man in wezen nog steeds naar de camera kijkt. Hij buigt zijn hoofd naar beneden en opzij met niet veel meer dan 20-25 graden rotatie, maar bij een helling van meer dan dat, zou het systeem echt moeten beginnen met gissen hoe hij eruitziet in profiel. Dit is moeilijk, waarschijnlijk onmogelijk om nauwkeurig te meten vanuit een enkele frontale afbeelding.

In het tweede voorbeeld zien we dat het kleine meisje glimlacht in de gegenereerde video, net zoals in de enkele statische bronafbeelding. Opnieuw, met deze enkele afbeelding als referentie, zou HunyuanCustom een relatief ongeïnformeerde gok moeten maken over hoe haar ‘rustige gezicht’ eruitziet. Bovendien wijkt haar gezicht niet meer dan 20 graden van de kijkrichting af, net zoals in het vorige voorbeeld (‘man eet chips’).

In het laatste voorbeeld zien we dat, omdat het bronmateriaal – de vrouw en de kleding die ze wordt aangezet – niet complete afbeeldingen zijn, de weergave de situatie heeft afgekapt om het te passen – wat eigenlijk een vrij goede oplossing is voor een gegevensprobleem!

Het punt is dat, hoewel het nieuwe systeem meerdere afbeeldingen kan verwerken (zoals persoon + chips, of persoon + kleding), het blijkbaar geen meerdere hoeken of alternatieve weergaven van een enkel personage toelaat, zodat diverse uitdrukkingen of ongebruikelijke hoeken kunnen worden ondersteund. In deze zin kan het systeem mogelijk worstelen om de groeiende ecosystemen van LoRA-modellen te vervangen die zijn ontstaan rond HunyuanVideo sinds de release in december, aangezien deze kunnen helpen HunyuanVideo om consistentiepersonages te produceren vanuit elke hoek en met elke gezichtsuitdrukking die in de trainingsdataset wordt weergegeven (20-60 afbeeldingen is typisch).

Bedraad voor Geluid

Voor audio maakt HunyuanCustom gebruik van het LatentSync-systeem (berucht moeilijk voor hobbyisten om op te zetten en goede resultaten te behalen) voor het verkrijgen van lipbewegingen die zijn afgestemd op audio en tekst die de gebruiker levert:

Bevat audio. Click om af te spelen. Verschillende voorbeelden van lip-sync van de HunyuanCustom-supplementaire site, bewerkt tot één geheel.

Op het moment van schrijven zijn er geen Engelstalige voorbeelden, maar deze lijken vrij goed te zijn – des te meer als de methode voor het maken ervan eenvoudig te installeren en toegankelijk is.

Bestaande Video Bewerken

Het nieuwe systeem biedt wat lijkt op indrukwekkende resultaten voor video-naar-video (V2V, of Vid2Vid) bewerking, waarbij een segment van een bestaande (echte) video wordt gemaskeerd en intelligent vervangen door een onderwerp dat in een enkele referentieafbeelding wordt gegeven. Hieronder vindt u een voorbeeld van de supplementaire materialen-site:

Click om af te spelen. Alleen het centrale object wordt gericht, maar wat eromheen blijft, wordt ook gewijzigd in een HunyuanCustom vid2vid-pas.

Zoals we kunnen zien, en zoals gebruikelijk is in een vid2vid-scenario, wordt de hele video in zekere zin gewijzigd door het proces, hoewel meestal in het gerichte gebied, d.w.z. het knuffelbeest. Verondersteld kan worden dat pijplijnen kunnen worden ontwikkeld om dergelijke transformaties te maken onder een garbage matte-aanpak die de meeste video-inhoud identiek laat aan het origineel. Dit is wat Adobe Firefly onder de motorkap doet en doet vrij goed – maar het is een onderbestudeerd proces in de FOSS-generatieve scene.

Dat gezegd hebbende, doen de meeste van de alternatieve voorbeelden die worden geleverd, een betere job van het richten van deze integraties, zoals we kunnen zien in de onderstaande samengestelde compilatie:

Click om af te spelen. Uiteenlopende voorbeelden van geïnterjecteerd materiaal met behulp van vid2vid in HunyuanCustom, waarbij een opvallende respect voor het niet-gerichte materiaal wordt getoond.

Een Nieuw Begin?

Dit initiatief is een ontwikkeling van het Hunyuan Video-project, niet een harde ommekeer van die ontwikkelingsstroom. De projectverbeteringen worden geïntroduceerd als discrete architecturale invoegingen in plaats van ingrijpende structurele veranderingen, met als doel het model in staat te stellen identiteitsconsistentie over frames te behouden zonder afhankelijk te zijn van onderwerp-specifieke fine-tuning, zoals bij LoRA of tekstuele inversiebenaderingen.

Om duidelijk te zijn, is HunyuanCustom dus niet getraind vanaf scratch, maar veeleer een fine-tuning van het HunyuanVideo-grondmodel van december 2024.

Diegenen die HunyuanVideo LoRAs hebben ontwikkeld, kunnen zich afvragen of deze nog steeds zullen werken met deze nieuwe editie, of dat ze de LoRA-wiel opnieuw moeten uitvinden als ze meer aanpassingsmogelijkheden willen dan zijn ingebouwd in deze nieuwe release.

In het algemeen verandert een zwaar getrainde release van een hyperschaalmodel de modelgewichten genoeg dat LoRAs die zijn gemaakt voor het eerdere model, niet goed zullen werken, of helemaal niet, met het nieuw-gerefineerde model.

Soms kan een fine-tune echter zijn oorsprong uitdagen: een voorbeeld van een fine-tune die een effectieve fork wordt, met een eigen ecosysteem en volgers, is de Pony Diffusion-afstemming van Stable Diffusion XL (SDXL). Pony heeft momenteel 592.000+ downloads op het ever-changing CivitAI-domein, met een enorm aantal LoRAs die Pony (en niet SDXL) als basismodel hebben gebruikt, en die Pony op inference-tijd vereisen.

Uitgebracht

De projectpagina voor het nieuwe artikel (dat HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation heet) bevat links naar een GitHub-site die, op het moment van schrijven, net functioneel is geworden en alle code en noodzakelijke gewichten voor lokale implementatie bevat, samen met een voorgestelde tijdslijn (waar het enige belangrijke ding dat nog moet komen ComfyUI-integratie is).

Op het moment van schrijven is de Hugging Face-aanwezigheid van het project nog een 404. Er is echter een API-gebaseerde versie van waaruit men blijkbaar een demo van het systeem kan uitvoeren, zolang men een WeChat-scancode kan leveren.

Ik heb zelden zo’n uitgebreid en uitgebreid gebruik van zo’n breed scala aan projecten in één assemblage gezien, zoals blijkbaar het geval is met HunyuanCustom – en verondersteld kan worden dat sommige van de licenties in ieder geval een volledige release zouden verplichten.

Twee modellen worden aangekondigd op de GitHub-pagina: een 720px1280px-versie die 8) GB GPU-geheugen vereist, en een 512px896px-versie die 60 GB GPU-geheugen vereist.

Het repository vermeldt ‘De minimale GPU-geheugen die vereist is, is 24 GB voor 720px1280px129f, maar zeer langzaam…We raden aan om een GPU met 80 GB geheugen te gebruiken voor betere generatiekwaliteit’ – en herhaalt dat het systeem alleen is getest op Linux.

Het eerdere Hunyuan Video-model is, sinds de officiële release, gequantiseerd naar maten waarop het kan worden uitgevoerd met minder dan 24 GB VRAM, en het lijkt redelijk om aan te nemen dat het nieuwe model op soortgelijke wijze zal worden aangepast aan meer consumentvriendelijke vormen door de gemeenschap, en dat het snel zal worden aangepast voor gebruik op Windows-systemen.

Vanwege tijdsbeperkingen en de overweldigende hoeveelheid informatie die bij deze release wordt geleverd, kunnen we alleen een bredere, in plaats van diepgaande, blik op deze release werpen. Niettemin, laten we even onder de motorkap van HunyuanCustom kijken.

Een Kijk op het Artikel

De datapipeline voor HunyuanCustom, die blijkbaar voldoet aan het GDPR-kader, omvat zowel gesynthetiseerde als open-source videodatasets, waaronder OpenHumanVid, met acht kerncategorieën vertegenwoordigd: mensen, dieren, planten, landschappen, voertuigen, objecten, architectuur, en anime.

Uit het artikel, een overzicht van de diverse bijdragende pakketten in de HunyuanCustom datapipeline. Source: https://arxiv.org/pdf/2505.04512

Uit het artikel, een overzicht van de diverse bijdragende pakketten in de HunyuanCustom datapipeline. Source: https://arxiv.org/pdf/2505.04512

De initiële filtering begint met PySceneDetect, die video’s in enkele-shot-clips segmenteert. TextBPN-Plus-Plus wordt vervolgens gebruikt om video’s te verwijderen die on-screen tekst, ondertiteling, watermerken of logo’s bevatten.

Om inconsistenties in resolutie en duur te verhelpen, worden clips gestandaardiseerd naar vijf seconden lengte en worden ze omgerekend naar 512 of 720 pixels aan de korte kant. Esthetische filtering wordt behandeld met Koala-36M, met een aangepaste drempel van 0,06 toegepast voor de aangepaste dataset die door de onderzoekers van het nieuwe artikel is samengesteld.

Het onderwerpextractieproces combineert de Qwen7B Large Language Model (LLM), het YOLO11X objectherkenningskader, en de populaire InsightFace-architectuur, om menselijke identiteiten te identificeren en te valideren.

Voor niet-menselijke onderwerpen worden QwenVL en Grounded SAM 2 gebruikt om relevante begrenzingsvakken te extraheren, die worden verworpen als ze te klein zijn.

Voorbeelden van semantische segmentatie met Grounded SAM 2, gebruikt in het Hunyuan Control-project. Source: https://github.com/IDEA-Research/Grounded-SAM-2

Voorbeelden van semantische segmentatie met Grounded SAM 2, gebruikt in het Hunyuan Control-project. Source: https://github.com/IDEA-Research/Grounded-SAM-2

Multi-onderwerpextractie maakt gebruik van Florence2 voor begrenzingsvakannotatie, en Grounded SAM 2 voor segmentatie, gevolgd door clustering en tijdelijke segmentatie van trainingsframes.

De verwerkte clips worden verder verrijkt via annotatie, met behulp van een propriëtair gestructureerd labelingsysteem dat is ontwikkeld door het Hunyuan-team, en dat laagsgewijze metadata zoals beschrijvingen en camerabewegingshinten levert.

Maskaugmentatie-strategieën, waaronder conversie naar begrenzingsvakken, werden tijdens de training toegepast om overfitting te verminderen en ervoor te zorgen dat het model zich aanpast aan diverse objectvormen.

Audio-gegevens werden gesynchroniseerd met behulp van de eerder genoemde LatentSync, en clips werden verworpen als de synchronisatiescores onder een minimumdrempel vielen.

De blind image quality assessment framework HyperIQA werd gebruikt om video’s uit te sluiten die onder de 40 (op de HyperIQA-schaal) scoorden. Geldige audio-tracks werden vervolgens verwerkt met Whisper om functies voor downstream-taken te extraheren.

De auteurs incorporeren de LLaVA taalassistentiemodel tijdens de annotatiefase, en benadrukken de centrale positie die dit kader heeft in HunyuanCustom. LLaVA wordt gebruikt om afbeeldingsbijschriften te genereren en om visuele inhoud te helpen bij het uitlijnen met tekstprompts, waardoor de constructie van een coherente trainsignaal over modaliteiten heen wordt ondersteund:

Het HunyuanCustom-kader ondersteunt identiteitsconsistentie video-generatie die wordt geconditioneerd op tekst, afbeelding, audio en video-invoer.

Het HunyuanCustom-kader ondersteunt identiteitsconsistentie video-generatie die wordt geconditioneerd op tekst, afbeelding, audio en video-invoer.

Door LLaVA’s visie-taaluitlijningsmogelijkheden te benutten, wint de pipeline een extra laag semantische consistentie tussen visuele elementen en hun tekstuele beschrijvingen – vooral waardevol in multi-onderwerp- of complexe scenario’s.

Aangepaste Video

Om video-generatie mogelijk te maken op basis van een referentieafbeelding en een prompt, werden de twee modules rond LLaVA gemaakt, waarbij eerst de invoerstructuur van HunyuanVideo werd aangepast zodat deze een afbeelding naast tekst kon accepteren.

Dit hield in dat de prompt op een manier werd opgemaakt die de afbeelding rechtstreeks insluit of deze markeert met een korte identiteitsbeschrijving. Een scheidings token werd gebruikt om te voorkomen dat de afbeeldingsinbedding de promptinhoud overweldigt.

Aangezien LLaVA’s visuele encoder de neiging heeft om fijne ruimtelijke details samen te voegen of te verwerpen tijdens het uitlijnen van afbeeldings- en tekstfuncties (vooral wanneer een enkele referentieafbeelding wordt vertaald in een algemene semantische inbedding), werd een identiteitsversterkingsmodule geïntegreerd. Aangezien bijna alle video-latente diffusiemodellen enige moeite hebben om identiteit te behouden zonder een LoRA, zelfs in een vijfsecondenclip, kan de prestatie van deze module in communitytesting aanzienlijk blijken.

In elk geval wordt de referentieafbeelding vervolgens omgerekend en gecodeerd met behulp van de causale 3D-VAE van het oorspronkelijke HunyuanVideo-model, en wordt de latente ingevoegd in de video-latente over de tijdsas, met een ruimtelijke offset toegepast om te voorkomen dat de afbeelding rechtstreeks in de uitvoer wordt gereproduceerd, terwijl deze nog steeds de generatie leidt.

Het model werd getraind met behulp van Flow Matching, met ruismonsters getrokken uit een logit-normale verdeling – en het netwerk werd getraind om de correcte video van deze ruislatente te herstellen. LLaVA en de videogenerator werden beiden fijngesteld samen, zodat de afbeelding en prompt de uitvoer konden leiden en de onderwerpidentiteit consistent konden houden.

Voor multi-onderwerp prompts werden elk afbeelding-tekstpaar afzonderlijk ingebed en kregen een unieke tijdelijke positie, waardoor identiteiten konden worden onderscheiden en de generatie van scenario’s met meerdere interactieve onderwerpen werd ondersteund.

Geluid en Visie

HunyuanCustom conditioneert audio/spraakgeneratie met behulp van zowel gebruikersingestelde audio als een tekstprompt, waardoor personages kunnen spreken in scenario’s die de beschreven setting weerspiegelen.

Om dit te ondersteunen, introduceert de Identity-disentangled AudioNet-module audiofuncties zonder de identiteitssignalen die vanuit de referentieafbeelding en prompt zijn ingebed, te verstoren. Deze functies worden uitgelijnd met de gecomprimeerde videotijdlijn, verdeeld in frame-niveau-segmenten en geïnjecteerd met behulp van een ruimtelijke cross-attention-mechanisme dat elk frame geïsoleerd houdt, waardoor onderwerpconsistentie wordt behouden en tijdelijke interferentie wordt vermeden.

Een tweede tijdelijke injectiemodule biedt fijnere controle over timing en beweging, werkt samen met AudioNet en kaart audiofuncties naar specifieke regio’s van de latente sequentie, en gebruikt een Multi-Layer Perceptron (MLP) om deze om te zetten in token-wise bewegingsverschuivingen. Dit laat gebaren en gezichtsbewegingen toe om het ritme en de klemtoon van de gesproken invoer te volgen met grotere precisie.

HunyuanCustom laat personages in bestaande video’s rechtstreeks bewerken, door personen of objecten in een scenario te vervangen of in te voegen zonder de hele clip van scratch te hoeven opbouwen. Dit maakt het nuttig voor taken die het wijzigen van uiterlijk of beweging op een gerichte manier betreffen.

Click om af te spelen. Een verdere voorbeeld van de supplementaire site.

Om efficiënte onderwerpvervanging in bestaande video’s te faciliteren, vermijdt het nieuwe systeem de resource-intensieve aanpak van recente methoden zoals de momenteel populaire VACE, of die welke hele video-sequenties samenvoegen, en geeft de voorkeur aan het comprimeren van een referentievideo met behulp van de vooraf getrainde causale 3D-VAE – uitgelijnd met de generatiepijplijninterne video-latente – en voegt deze vervolgens samen. Dit houdt het proces relatief licht, terwijl het nog steeds toestaat dat externe video-inhoud de uitvoer leidt.

Een klein neuronaal netwerk behandelt de uitlijning tussen de schone invoervideo en de ruislatente die tijdens de generatie wordt gebruikt. Het systeem test twee manieren om deze informatie te injecteren: het samenvoegen van de twee sets functies voordat ze opnieuw worden gecomprimeerd; en het toevoegen van de functies frame voor frame. De tweede methode werkt beter, zo ontdekten de auteurs, en voorkomt kwaliteitsverlies terwijl de berekeningslast ongewijzigd blijft.

Gegevens en Tests

In tests werden de volgende metrics gebruikt: de identiteitsconsistentie-module in ArcFace, die gezichtskenmerken uit zowel de referentieafbeelding als elk frame van de gegenereerde video extraheren, en vervolgens de gemiddelde cosinusgelijkheid tussen hen berekent; onderwerpovereenkomst, via het verzenden van YOLO11x-segmenten naar Dino 2 voor vergelijking; CLIP-B, tekst-video-uitlijning, die de overeenkomst tussen de prompt en de gegenereerde video meet; CLIP-B opnieuw, om de overeenkomst tussen elk frame en zowel de aangrenzende frames als het eerste frame te berekenen, evenals tijdelijke consistentie; en dynamische graad, zoals gedefinieerd door VBench.

Zoals eerder aangegeven, waren de gesloten bronconcurrenten Hailuo; Vidu 2.0; Kling (1.6); en Pika. De concurrerende FOSS-kaders waren VACE en SkyReels-A2.

Modelprestatiebeoordeling die HunyuanCustom vergelijkt met toonaangevende video-aanpassingsmethoden over ID-consistentie (Face-Sim), onderwerpovereenkomst (DINO-Sim), tekst-video-uitlijning (CLIP-B-T), tijdelijke consistentie (Temp-Consis), en bewegingsintensiteit (DD). Optimaal en suboptimaal resultaat worden weergegeven in vet en onderstreept, respectievelijk.

Modelprestatiebeoordeling die HunyuanCustom vergelijkt met toonaangevende video-aanpassingsmethoden over ID-consistentie (Face-Sim), onderwerpovereenkomst (DINO-Sim), tekst-video-uitlijning (CLIP-B-T), tijdelijke consistentie (Temp-Consis), en bewegingsintensiteit (DD). Optimaal en suboptimaal resultaat worden weergegeven in vet en onderstreept, respectievelijk.

Van deze resultaten zeggen de auteurs:

‘Onze [HunyuanCustom] behaalt de beste ID-consistentie en onderwerpconsistentie. Het behaalt ook vergelijkbare resultaten in promptvolging en tijdelijke consistentie. [Hailuo] heeft de beste clip-score omdat het tekstuele instructies goed kan volgen met alleen ID-consistentie, waarbij het de consistentie van niet-menselijke onderwerpen opoffert (de slechtste DINO-Sim). In termen van Dynamische graad presteren [Vidu] en [VACE] slecht, wat mogelijk te wijten is aan de kleine grootte van het model.’

Hoewel de projectsite verzadigd is met vergelijkingsvideo’s (de lay-out waarvan het moeilijk maakt om de mogelijkheden van HunyuanCustom te vergelijken met die van eerdere concurrenten), moet worden opgemerkt dat weinig projecten in de video-syntheseruimte de moed hebben om zichzelf te meten tegen Kling, de commerciële video-diffusie-API die altijd op of nabij de top van de ranglijsten staat; Tencent lijkt vooruitgang te hebben geboekt tegen deze gevestigde orde op een vrij indrukwekkende manier.

 

* Het probleem is dat sommige van de video’s zo breed, kort en hoogwaardig zijn dat ze niet afgespeeld kunnen worden in standaard videospelers zoals VLC of Windows Media Player, waardoor ze een zwarte scherm tonen.

First published Thursday, 8 mei 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai