Andersons vinkel

HunyuanCustom bringer single-image video deepfakes med lyd og lip sync

mm
Føj Unite.AI til dine foretrukne kilder på Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Denne artikel diskuterer en ny udgave af en multimodal Hunyuan Video-verdenmodel kaldet ‘HunyuanCustom’. Den nye papirs bredde af dækning kombineret med flere problemer i mange af de leverede eksempelvideoer på projektsiden*, begrænser os til mere generel dækning end normalt, og til begrænset reproduktion af den enorme mængde video materiale, der følger med denne udgivelse (da mange af videoerne kræver betydelig omarbejdning og behandling for at forbedre læseligheden af layoutet).

Vær venlig at bemærke yderligere, at papiret henviser til den API-baserede generative system Kling som ‘Keling’. For klarheds skyld henviser jeg til ‘Kling’ igennem hele artiklen.

 

Tencent er i gang med at udgive en ny version af deres Hunyuan Video-model, med titlen HunyuanCustom. Den nye udgivelse synes at være i stand til at gøre Hunyuan LoRA-modeller overflødige, ved at give brugeren mulighed for at oprette ‘deepfake’-lignende video tilpasning gennem en enkel billed:

Klik for at afspille. Prompt: ‘En mand lytter til musik og laver snail nudler i køkkenet’. Den nye metode sammenlignet med både lukkede og åbne kilder, herunder Kling, som er en betydelig modstander i dette område. Kilde: https://hunyuancustom.github.io/ (advarsel: CPU-/hukommelseskrævende side!)

I den venstre kolonne af videoen ovenfor ser vi det enkeltstående billed, der er leveret til HunyuanCustom, efterfulgt af systemets fortolkning af prompten i den anden kolonne, ved siden af. De resterende kolonner viser resultaterne fra forskellige proprietære og FOSS-systemer: Kling; Vidu; Pika; Hailuo; og Wan-baseret SkyReels-A2.

I videoen nedenfor ser vi renderinger af tre scenarier, der er essentielle for denne udgivelse: henholdsvis, person + objekt; enkel-tegn emulation; og virtuel prøvning (person + tøj):

Klik for at afspille. Tre eksempler redigeret fra materialet på støttesiden for Hunyuan Video.

Vi kan bemærke nogle ting fra disse eksempler, mest relateret til, at systemet afhænger af et enkel billed, i stedet for flere billeder af samme emne.

I den første klip er manden essentielt stadig vendt mod kameraet. Han bøjer hovedet ned og sidelæns i ikke meget mere end 20-25 graders rotation, men ved en hældning på mere end det, ville systemet virkelig have brug for at starte med at gætte, hvordan han ser ud i profil. Dette er svært, sandsynligvis umuligt at bedømme nøjagtigt fra et enkelt frontbillede.

I det andet eksempel ser vi, at pigen er smilende i den renderede video, som hun er i det enkeltstående statiske billed. Igen, med dette ene billed som reference, ville HunyuanCustom have brug for at gøre en relativt uvidende gæt om, hvordan hendes ‘hvileansigt’ ser ud. Desuden afviger hendes ansigt ikke fra kamera-vendt holdning mere end det foregående eksempel (‘mand spiser chips’).

I det sidste eksempel ser vi, at da kilde materialet – kvinden og tøjet hun er bedt om at tage på – ikke er komplette billeder, har renderingen beskåret scenariet for at få det til at passe – hvilket faktisk er en ret god løsning på et data-problem!

Det væsentlige er, at selvom det nye system kan håndtere flere billeder (såsom person + chips, eller person + tøj), synes det ikke at tillade multiple vinkler eller alternative visninger af en enkelt karakter, så diverse udtryk eller usædvanlige vinkler kunne håndteres. I denne udstrækning kan systemet derfor have svært ved at erstatte den voksende økosystem af LoRA-modeller, der er opstået omkring HunyuanVideo, siden dens udgivelse sidste december, da disse kan hjælpe HunyuanVideo med at producere konsistente karakterer fra enhver vinkel og med enhver ansigtsudtryk, der er repræsenteret i træningsdatasettet (20-60 billeder er typisk).

Wired for Sound

Til lyd udnytter HunyuanCustom LatentSync-systemet (notorisk svært for hobbyister at sætte op og få gode resultater fra) til at opnå lipbevægelser, der er tilpasset til audio og tekst, som brugeren leverer:

Funktioner lyd. Klik for at afspille. Flere eksempler på lip-sync fra HunyuanCustoms supplerende side, redigeret sammen.

På tidspunktet for skrivningen er der ingen engelsksprogede eksempler, men disse synes at være ret gode – desto mere, hvis metoden til at oprette dem er let-installable og tilgængelig.

Redigering af eksisterende video

Det nye system tilbyder, hvad der synes at være meget imponerende resultater for video-til-video (V2V, eller Vid2Vid) redigering, hvor en del af en eksisterende (ægte) video er maskeret af og intelligent erstattet af et emne givet i et enkelt referencebillede. Herunder er et eksempel fra den supplerende materiale side:

Klik for at afspille. Kun det centrale objekt er målet, men hvad der er tilbage omkring det, ændres også i en HunyuanCustom vid2vid-gennemløb.

Som vi kan se, og som er standard i en vid2vid-scenario, ændres hele videoen i visse omfang af processen, selvom det meste ændres i det målte område, dvs. plush-legetøjet. Formodentlig kunne pipelines udvikles til at skabe sådanne transformationer under en garbage-matte-tilgang, der efterlader det meste af videoindholdet identisk med det originale. Dette er, hvad Adobe Firefly gør under dækket, og gør ret godt – men det er en under-undersøgt proces i FOSS-generative scenen.

Det sagde, at de fleste af de alternative eksempler, der er leveret, gør et bedre job med at målrette disse integrationer, som vi kan se i den samlede kompilation nedenfor:

Klik for at afspille. Forskellige eksempler på interjected indhold ved hjælp af vid2vid i HunyuanCustom, viser en bemærkelsesværdig respekt for det umålte materiale.

En ny start?

Dette initiativ er en udvikling af Hunyuan Video-projektet, ikke en hård vending væk fra denne udviklingsstrøm. Projektets forbedringer er introduceret som diskrete arkitektoniske indsættelser snarere end omfattende strukturelle ændringer, med det formål at give modellen mulighed for at opretholde identitets-trofasthed på tværs af rammer uden at afhænge af emne-specifik fine-tuning, som med LoRA eller tekst-inversion-tilgange.

For at være tydelig, er HunyuanCustom derfor ikke trænet fra scratch, men snarere en fin-justering af december 2024 HunyuanVideo grundmodel.

De, der har udviklet HunyuanVideo LoRAs, kan undre sig over, om de stadig vil fungere med denne nye udgave, eller om de vil have brug for at genopfinde LoRA-hjulet endnu en gang, hvis de ønsker mere tilpasningsmuligheder end dem, der er bygget ind i denne nye udgivelse.

Generelt ændrer en tungt fin-justeret udgivelse af en hyperskale-model model-vægte nok til, at LoRAs, der er lavet til den tidligere model, ikke vil fungere korrekt eller overhovedet med den ny-refinerede model.

Nogle gange kan en fin-justerings popularitet dog udfordre dens oprindelse: Et eksempel på en fin-justering, der bliver en effektiv fork, med en dedikeret økosystem og følgere på egen hånd, er Pony Diffusion-fin-justeringen af Stable Diffusion XL (SDXL). Pony har i øjeblikket 592.000+ downloads på den evigt skiftende CivitAI-domæne, med et stort udvalg af LoRAs, der har brugt Pony (og ikke SDXL) som grundmodel, og som kræver Pony ved slutningen.

Udgivelse

Projektsiden for den nye artikel (der har titlen HunyuanCustom: En multimodal-dreven arkitektur for tilpasset video-generering) indeholder links til en GitHub-side, der, da jeg skriver, lige er blevet funktionsdygtig, og synes at indeholde alle koder og nødvendige vægte til lokal implementering, sammen med en foreslået tidsplan (hvor det eneste vigtige, der endnu ikke er kommet, er ComfyUI-integration).

Da jeg skriver, er projektets Hugging Face-præsen stadig en 404. Der er dog en API-baseret version af, hvor man åbenbart kan demonstrere systemet, så længe man kan levere en WeChat-scan-kode.

Jeg har sjældent set en så omfattende og udstrakt brug af så mange forskellige projekter i en samling, som det er tilfældet med HunyuanCustom – og formodentlig ville nogle af licenserne i hvert fald kræve en fuld udgivelse.

To modeller er annonceret på GitHub-siden: en 720px1280px-version, der kræver 8 GB GPU-peak-hukommelse, og en 512px896px-version, der kræver 60 GB GPU-peak-hukommelse.

Repository’et angiver ‘Den minimale GPU-hukommelse, der kræves, er 24 GB for 720px1280px129f, men meget langsom… Vi anbefaler at bruge en GPU med 80 GB hukommelse for bedre genereringskvalitet’ – og gentager, at systemet kun er testet på Linux.

Da den tidligere Hunyuan Video-model er blevet kvantificeret ned til størrelser, hvor den kan køres på mindre end 24 GB VRAM, synes det rimeligt at antage, at den nye model også vil blive tilpasset til mere forbruger-venlige former af fællesskabet, og at den hurtigt vil blive tilpasset til brug på Windows-systemer også.

Et kig på artiklen

Data-pipelines til HunyuanCustom, der åbenbart er i overensstemmelse med GDPR-rammen, inkorporerer både syntetiserede og åbne video-datasets, herunder OpenHumanVid, med otte kernekategorier repræsenteret: mennesker, dyr, planter, landskaber, køretøjer, objekter, arkitektur og anime.

Fra udgivelsesartiklen, en oversigt over de forskellige bidragende pakker i HunyuanCustoms data-konstruktions-pipeline. Kilde: https://arxiv.org/pdf/2505.04512

Fra udgivelsesartiklen, en oversigt over de forskellige bidragende pakker i HunyuanCustoms data-konstruktions-pipeline. Kilde: https://arxiv.org/pdf/2505.04512

Initial filtrering begynder med PySceneDetect, der segmenterer videoer i enkelt-shot-klip. TextBPN-Plus-Plus bruges derefter til at fjerne videoer, der indeholder for meget tekst på skærmen, undertekster, vandmærker eller logoer.

For at håndtere inkonsistenser i opløsning og varighed standardiseres klip til fem sekunders varighed og omskaleres til 512 eller 720 pixel på den korte side. Æstetisk filtrering håndteres ved hjælp af Koala-36M, med en brugerdefineret grænseværdi på 0,06 anvendt for det tilpassede dataset, der er kurateret af artiklens forfattere.

Emne-ekstraktionsprocessen kombinerer den Qwen7B Large Language Model (LLM), den YOLO11X objekt-genkendelses-ramme og den populære InsightFace-arkitektur, for at identificere og validere menneskelige identiteter.

For ikke-menneskelige emner bruges QwenVL og Grounded SAM 2 til at udtrække relevante bounding-bokse, der kasseres, hvis de er for små.

Eksempler på semantisk segmentering med Grounded SAM 2, brugt i Hunyuan Control-projektet. Kilde: https://github.com/IDEA-Research/Grounded-SAM-2

Eksempler på semantisk segmentering med Grounded SAM 2, brugt i Hunyuan Control-projektet. Kilde: https://github.com/IDEA-Research/Grounded-SAM-2

Flere-emne-ekstraktion bruger Florence2 til bounding-boks-annotation og Grounded SAM 2 til segmentering, efterfulgt af klastering og tidsmæssig segmentering af trænings-rammer.

De behandlede klip er yderligere forbedret gennem annotation, ved hjælp af et proprietært struktureret-mærknings-system, der er udviklet af Hunyuan-holdet, og som leverer lagdelt metadata, såsom beskrivelser og kamera-bevægelses-henvisninger.

Mask-augmenterings-strategier, herunder omvandling til bounding-bokse, blev anvendt under træning for at reducere over-tilpasning og sikre, at modellen tilpasser sig til forskellige objektsformer.

Lyddata blev synkroniseret ved hjælp af den ovennævnte LatentSync, og klip kasseret, hvis synkroniserings-score falder under en minimums-grænseværdi.

Den blinde billedkvalitets-vurderings-ramme HyperIQA blev brugt til at udelukke videoer, der scorer under 40 (på HyperIQA’s særlige skala). Gyldige lydspor blev derefter behandlet med Whisper for at udtrække funktioner til efterfølgende opgaver.

Forfatterne inkorporerer LLaVA-sprog-assistent-modellen under annotations-fasen og fremhæver den centrale position, som denne ramme har i HunyuanCustom. LLaVA bruges til at generere billed-underskrifter og hjælpe med at justere visuelt indhold med tekst-prompts, og støtter opbygningen af en samlet træningssignal på tværs af modaliteter:

HunyuanCustom-rammen støtter identitets-konsistent video-generering betinget af tekst, billed-, lyd- og video-input.

HunyuanCustom-rammen støtter identitets-konsistent video-generering betinget af tekst, billed-, lyd- og video-input.

Ved at udnytte LLaVA’s vision-sprog-justerings-evner, får pipeline’en en yderligere lag af semantisk konsistens mellem visuelle elementer og deres tekst-underskrifter – især værdifuld i multi-emne- eller komplekse-scenarier.

Tilpasset video

For at tillade video-generering baseret på et referencebillede og en prompt, blev de to moduler centreret omkring LLaVA oprettet, først ved at tilpasse input-strukturen af HunyuanVideo, så den kunne acceptere et billed sammen med tekst.

Dette involverede formatering af prompten på en måde, der indlejrer billedet direkte eller mærker det med en kort identitetsbeskrivelse. En adskillelsessymbol blev brugt til at forhindre, at billed-indlejringen overvældede prompt-indholdet.

Da LLaVA’s visuelt encoder har tendens til at komprimere eller forkaste fine-grænset rumlige detaljer under justering af billed- og tekst-funktioner (især når en enkelt referencebillede oversættes til en generel semantisk indlejring), blev en identitets-forbedrings-modul inkorporeret. Da næsten alle video-latent-diffusions-modeller har nogen svigt i at opretholde identitet uden en LoRA, selv i en fem-sekunders klip, kan denne moduls ydelse i fællesskabs-testning være betydelig.

I hvert fald bliver reference-billedet derefter omskaleret og kodet ved hjælp af den kausale 3D-VAE fra den oprindelige HunyuanVideo-model, og dens latente indsættes i video-latent på tværs af den tidsmæssige akse, med en spatial forskydning anvendt for at forhindre, at billedet bliver direkte reproduceret i output, mens det stadig guider generation.

Modellen blev trænet ved hjælp af Flow Matching, med støjprøver trukket fra en logit-normal distribution – og netværket blev trænet til at genskabe den korrekte video fra disse støj-latitude. LLaVA og video-generatoren blev begge fin-justeret sammen, så billed og prompt kunne guide outputtet mere flydende og opretholde subjekt-identitet.

Til multi-emne-prompts blev hver billed-tekst-par indlejret separat og tildelt en distinkt tidsmæssig position, hvilket tillod identiteter at blive skilt, og støttede generationen af scener, der involverer flere interagerende subjekter.

Lyden og synet

HunyuanCustom betinger lyd-/tale-generering ved hjælp af både bruger-input-lyd og en tekst-prompt, hvilket giver karakterer mulighed for at tale inden for scener, der afspejler den beskrevne indstilling.

For at støtte dette introduceres en Identity-disentangled AudioNet-modul lyd-funktioner uden at forstyrre identitets-signalerne indlejret fra reference-billedet og prompt. Disse funktioner er justeret med den komprimerede video-tidslinje, inddelt i ramme-niveau-segmenter og indsprøjtet ved hjælp af en spatial cross-attention-mekanisme, der holder hver ramme isoleret, og opretholder subjekt-konsistens og undgår tidsmæssig interferens.

En anden tidsmæssig injektions-modul giver en finere kontrol over timing og bevægelse, og arbejder i tandem med AudioNet, og kortlægger lyd-funktioner til bestemte regioner af den latente sekvens, og bruger en Multi-Layer Perceptron (MLP) til at konvertere dem til token-vis bevægelses-forSkydninger. Dette giver mulighed for, at gestus og ansigtsbevægelse følger rytmen og betoningen af den talede input med større præcision.

HunyuanCustom giver mulighed for, at subjekter i eksisterende videoer kan redigeres direkte, og erstatter eller indsætter mennesker eller objekter i en scene uden at skulle genopbygge hele klippet fra scratch. Dette gør det nyttigt til opgaver, der involverer ændring af udseende eller bevægelse på en målrettet måde.

Klik for at afspille. Endnu et eksempel fra den supplerende side.

For at lette effektivt subjekt-erstatning i eksisterende videoer undgår det nye system den ressource-krævende tilgang, der er brugt i nyere metoder, såsom den nuværende populære VACE, eller de, der merger hele video-sekvenser sammen, og foretrækker i stedet komprimering af et reference-video ved hjælp af den forudindlærte kausale 3D-VAE – og justerer det med generation-pipeline’ens interne video-latente, og derefter tilføjer de to sammen. Dette holder processen relativt letvægts, mens det stadig giver mulighed for, at eksternt video-indhold kan guide outputtet.

En lille neuralt netværk håndterer justeringen mellem det rene input-video og de støj-latitude, der bruges i generation. Systemet tester to måder at indsprøjte denne information på: at merge de to sæt funktioner, før de komprimeres igen; og at tilføje funktionerne ramme for ramme. Den sidste metode fungerer bedre, finder forfatterne, og undgår kvalitets-tab, mens den holder den beregningsmæssige belastning uændret.

Data og tests

I tests blev følgende metrikker brugt: identitets-konsistens-modulen i ArcFace, der udtrækker ansigts-indlejring fra både reference-billedet og hver ramme af den genererede video, og derefter beregner den gennemsnitlige cosinus-lighed mellem dem; subjekt-lighed, via at sende YOLO11X-segmenter til Dino 2 til sammenligning; CLIP-B, tekst-video-justering, der måler lighed mellem prompten og den genererede video; CLIP-B igen, for at beregne lighed mellem hver ramme og både dens nærliggende rammer og den første ramme, samt tidsmæssig konsistens; og dynamic degree, som defineret af VBench.

Som tidligere nævnt var de lukkede kilde-konkurrenter Hailuo; Vidu 2.0; Kling (1.6); og Pika. De konkurrerende FOSS-rammer var VACE og SkyReels-A2.

Model-præstations-evaluering, der sammenligner HunyuanCustom med førende video-tilpasningsmetoder på tværs af ID-konsistens (Face-Sim), subjekt-lighed (DINO-Sim), tekst-video-justering (CLIP-B-T), tidsmæssig konsistens (Temp-Consis) og bevægelses-intensitet (DD). Optimal og underoptimal resultater er vist i fed og understreget, henholdsvis.

Model-præstations-evaluering, der sammenligner HunyuanCustom med førende video-tilpasningsmetoder på tværs af ID-konsistens (Face-Sim), subjekt-lighed (DINO-Sim), tekst-video-justering (CLIP-B-T), tidsmæssig konsistens (Temp-Consis) og bevægelses-intensitet (DD). Optimal og underoptimal resultater er vist i fed og understreget, henholdsvis.

Af disse resultater siger forfatterne:

‘Vores [HunyuanCustom] opnår den bedste ID-konsistens og subjekt-konsistens. Det opnår også sammenlignelige resultater i prompt-følgeri og tidsmæssig konsistens. [Hailuo] har den bedste clip-score, fordi det kan følge tekst-instruktioner godt med kun ID-konsistens, og ofrer konsistensen af ikke-menneskelige subjekter (den dårligste DINO-Sim). I forhold til Dynamic-degree, udfører [Vidu] og [VACE] dårligt, hvilket kan skyldes den lille model-størrelse.’

Selvom projekt-siden er mættet med sammenlignings-videoer (deres layout synes at være designet mere til websteds-æstetik end let sammenligning), har den ikke på nuværende tidspunkt en video-ækvivalent til de statiske resultater, der er proppet sammen i PDF’en, i forhold til de initielle kvalitative tests. Selvom jeg inkluderer det her, opfordrer jeg læseren til at foretage en nærmere undersøgelse af videoerne på projekt-siden, da de giver en bedre fornemmelse af resultaterne:

Fra artiklen, en sammenligning af objekt-centreret video-tilpasning. Selvom læseren bør (som altid) henvise til kilde-PDF'en for bedre opløsning, kan videoerne på projekt-siden være en mere oplysende ressource i dette tilfælde.

Fra artiklen, en sammenligning af objekt-centreret video-tilpasning. Selvom læseren bør (som altid) henvise til kilde-PDF’en for bedre opløsning, kan videoerne på projekt-siden være en mere oplysende ressource i dette tilfælde.

Forfatterne kommenterer her:

‘Det kan ses, at [Vidu], [Skyreels A2] og vores metode opnår relativt gode resultater i prompt-justering og subjekt-konsistens, men vores video-kvalitet er bedre end Vidu og Skyreels, takket være den gode video-genererings-præstation af vores grund-model, dvs. [Hunyuanvideo-13B].

‘Blandt kommercielle produkter har [Kling] en god video-kvalitet, men den første ramme af videoen har et copy-paste-problem, og nogle gange bevæger subjektet sig for hurtigt og [blurrer], hvilket giver en dårlig visningsoplevelse.’

Forfatterne kommenterer yderligere, at Pika udfører dårligt i forhold til tidsmæssig konsistens, og introducerer undertekst-artefakter (effekter af dårlig data-kurering, hvor tekst-elementer i video-klip har været tilladt at forurene de grundlæggende begreber).

Hailuo opretholder ansigts-identitet, siger de, men kan ikke bevare fuld-kropps-konsistens. Blandt åbne kilder påstår forskerne, at VACE er ude af stand til at opretholde identitets-konsistens, mens de hævder, at HunyuanCustom producerer videoer med stærk identitets-bevarelse, mens det opretholder kvalitet og diversitet.

Herefter blev tests udført for multi-emne video-tilpasning, mod de samme konkurrenter. Som i det foregående eksempel er de fladtrykte PDF-resultater ikke tryk-ækvivalenter af videoer, der er tilgængelige på projekt-siden, men er unikke blandt resultaterne, der præsenteres:

Sammenligninger ved hjælp af multi-emne video-tilpasninger. Se venligst PDF for bedre detaljer og opløsning.

Sammenligninger ved hjælp af multi-emne video-tilpasninger. Se venligst PDF for bedre detaljer og opløsning.

Artiklen siger:

‘[Pika] kan generere de angivne subjekter, men viser ustabilitet i video-rammer, med eksempler på en mand, der forsvinder i en scene, og en kvinde, der ikke kan åbne en dør, som beskrevet. [Vidu] og [VACE] fanger delvis menneskelig identitet, men mister væsentlige detaljer om ikke-menneskelige objekter, hvilket indikerer en begrænsning i at repræsentere ikke-menneskelige subjekter.

‘[SkyReels A2] oplever alvorlig ramme-ustabilitet, med bemærkelsesværdige ændringer i chips og talrige artefakter i den højre scene.

‘I modsætning hertil fanger vores HunyuanCustom effektivt både menneskelige og ikke-menneskelige subjekt-identiteter, genererer videoer, der overholder de givne promptrer, og opretholder høj visuel kvalitet og stabilitet.’

En yderligere eksperiment var ‘virtuel menneske-reklame’, hvor rammerne blev bedt om at integrere et produkt med en person:

Fra den kvalitative test-runden, eksempler på neurale 'produkt-placeringer'. Se venligst PDF for bedre detaljer og opløsning.

Fra den kvalitative test-runden, eksempler på neurale ‘produkt-placeringer’. Se venligst PDF for bedre detaljer og opløsning.

For denne runde siger forfatterne:

‘Resultaterne viser, at HunyuanCustom effektivt opretholder identiteten af mennesket, mens det bevarende detaljerne om det mål-rettede produkt, herunder teksten på det.

‘Desuden synes interaktionen mellem mennesket og produktet at være naturlig, og videoen overholder tæt den givne prompt, hvilket understreger den betydelige potentiale for HunyuanCustom i generering af reklame-videoer.’

Et område, hvor video-resultater ville have været meget nyttige, var den kvalitative runde for lyd-drevet subjekt-tilpasning, hvor karakteren taler den tilsvarende lyd fra en tekst-beskreven scene og holdning.

Delvise resultater givet for lyd-runden – selvom video-resultater måske ville have været at foretrække i dette tilfælde. Kun den øverste halvdel af PDF-figuren er reproduceret her, da den er stor og svær at rumme i denne artikel. Se venligst kilde-PDF for bedre detaljer og opløsning.

Delvise resultater givet for lyd-runden – selvom video-resultater måske ville have været at foretrække i dette tilfælde. Kun den øverste halvdel af PDF-figuren er reproduceret her, da den er stor og svær at rumme i denne artikel. Se venligst kilde-PDF for bedre detaljer og opløsning.

Forfatterne påstår:

‘Tidligere lyd-drevne menneske-animationsmetoder indtaster et menneske-billede og en lyd, hvor menneskets holdning, påklædning og omgivelser forbliver konsistente med det givne billede og kan ikke generere videoer i andre gestus og omgivelser, hvilket kan [begrænse] deres anvendelse.

‘…[Vores] HunyuanCustom giver mulighed for lyd-drevet menneske-tilpasning, hvor karakteren taler den tilsvarende lyd i en tekst-beskreven scene og holdning, hvilket giver mulighed for mere fleksible og kontrollerbare lyd-drevne menneske-animeringer.’

Yderligere tests (se venligst PDF for alle detaljer) omfattede en runde, der satte det nye system op mod VACE og Kling 1.6 til video-subjekt-erstatning:

Test af subjekt-erstatning i video-til-video-tilstand. Se venligst kilde-PDF for bedre detaljer og opløsning.

Test af subjekt-erstatning i video-til-video-tilstand. Se venligst kilde-PDF for bedre detaljer og opløsning.

Af disse, de sidste tests, der præsenteres i den nye artikel, mener forskerne:

‘VACE lider under kant-artefakter på grund af streng overholdelse af input-masker, hvilket resulterer i unaturlige subjekt-former og forstyrrede bevægelses-kontinuitet. [Kling] viser en copy-paste-effekt, hvor subjekter er direkte lagt over videoen, hvilket giver en dårlig integration med baggrunden.

‘I modsætning hertil undgår HunyuanCustom kant-artefakter, opnår en nærmest perfekt integration med video-baggrunden og opretholder stærk identitets-bevarelse – hvilket demonstrerer dets overlegne præstation i video-redigerings-opgaver.’

Konklusion

Dette er en fascinerende udgivelse, ikke mindst fordi det adresserer noget, som den altid utilfredsige hobbyist-scene har klaget over mere og mere – manglen på lip-sync, så den øgede realisme, der er mulig i systemer som Hunyuan Video og Wan 2.1, kan gives en ny dimension af autenticitet.

Selvom layoutet af næsten alle sammenlignings-video-eksempler på projekt-siden gør det ret svært at sammenligne HunyuanCustoms evner mod tidligere konkurrenter, skal det bemærkes, at meget få projekter i video-syntese-rummet har modet til at sætte sig op mod tests mod Kling, den kommercielle video-diffusions-API, der altid er nær eller på toppen af leaderboard’erne; Tencent synes at have gjort fremskridt mod denne etablerede i en ret imponerende måde.

 

* Problemet er, at nogle af videoerne er så brede, korte og højopløste, at de ikke kan afspilles i standard video-afspillere som VLC eller Windows Media Player, og viser sorte skærme.

Først udgivet torsdag, 8. maj 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai