Andersons vinkel

HunyuanCustom bringer enkeltbilde-video dybfeints, med lyd og leppesynk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Denne artikkelen diskuterer en ny utgivelse av en multimodal Hunyuan Video-verdensmodell kalt ‘HunyuanCustom’. Den nye papirens bredde av dekning, kombinert med flere problemer i mange av de supplerte eksempelvideoene på prosjektsiden*, begrenser oss til mer generell dekning enn vanlig, og til begrenset reproduksjon av den enorme mengden videoinhold som følger med denne utgivelsen (siden mange av videoene krever betydelig omskaping og prosessering for å forbedre lesbarheten av layouten).

Vær også oppmerksom på at papiret henviser til API-basert generativt system Kling som ‘Keling’. For klarhet, henviser jeg til ‘Kling’ i stedet gjennom hele.

 

Tencent er i ferd med å utgi en ny versjon av sin Hunyuan Video-modell, tittelen HunyuanCustom. Den nye utgivelsen ser ut til å være i stand til å gjøre Hunyuan LoRA-modeller unødvendige, ved å tillate brukeren å opprette ‘dybfeint’-stil video-tilpassing gjennom et enkelt bilde:

Klikk for å spille. Prompt: ‘En mann lytter til musikk og lager snail-nudler i kjøkkenet’. Den nye metoden sammenlignet med både lukket kilde og åpen kilde-metoder, inkludert Kling, som er en betydelig motstander i dette området. Kilde: https://hunyuancustom.github.io/ (advarsel: CPU/minne-intensiv side!)

I den venstre kolonnen i videoen ovenfor, ser vi det enkelt kildebildet som er levert til HunyuanCustom, fulgt av systemets tolkning av prompten i den andre kolonnen, ved siden av. De gjenværende kolonnene viser resultater fra forskjellige proprietære og FOSS-systemer: Kling; Vidu; Pika; Hailuo; og Wan-basert SkyReels-A2.

I videoen nedenfor, ser vi gjengivelser av tre scenarioer som er essensielle for denne utgivelsen: henholdsvis, person + objekt; enkeltegn-emulering; og virtuell prøving (person + klær):

Klikk for å spille. Tre eksempler redigert fra materialet på støttesiden for Hunyuan Video.

Vi kan merke noen ting fra disse eksemplene, hovedsakelig relatert til at systemet avhenger av et enkelt kildebilde, i stedet for flere bilder av samme subjekt.

I den første klippet, er mannen i hovedsak fortsatt vendt mot kameraet. Han dypper hodet ned og sidelengs i ikke mer enn 20-25 graders rotasjon, men, ved en helning i overkant av dette, ville systemet virkelig måtte begynne å gjette hva han ser ut som i profil. Dette er vanskelig, kanskje umulig å avgjøre nøyaktig fra et enkelt frontbilde.

I det andre eksemplet, ser vi at den lille jenta er smilende i den gjengitte videoen som hun er i det enkelt statiske kildebildet. Igjen, med dette enkelt bildet som referanse, ville HunyuanCustom måtte gjøre en relativt uinformert gjett om hva hennes ‘hvile-ansikt’ ser ut som. I tillegg, hennes ansikt avviker ikke fra kamera-til-stående holdning mer enn det foregående eksemplet (‘mann spiser crisps’).

I det siste eksemplet, ser vi at siden kildematerialet – kvinnen og klærne hun er bedt om å bære – ikke er fullstendige bilder, har gjengivelsen beskåret scenariet for å passe – som faktisk er en ganske god løsning på et data-problem!

Det viktige er at selv om det nye systemet kan håndtere flere bilder (slik som person + crisps, eller person + klær), ser det ikke ut til å tillate flere vinkler eller alternative visninger av et enkelt subjekt, så at forskjellige uttrykk eller uvanlige vinkler kunne håndteres. I denne sammenhengen kan systemet kanskje ha problemer med å erstatte den voksende økosystemet av LoRA-modeller som har vokst opp rundt HunyuanVideo siden dens utgivelse i desember, siden disse kan hjelpe HunyuanVideo med å produsere konsistente karakterer fra enhver vinkel og med enhver ansiktsuttrykk representert i treningsdatasettet (20-60 bilder er typisk).

Lyden er koblet til

For lyd, utnytter HunyuanCustom LatentSync-systemet (notorisk vanskelig for hobbyister å sette opp og få gode resultater fra) for å få lippebevegelser som er tilpasset lyd og tekst som brukeren leverer:

Har lyd. Klikk for å spille. Flere eksempler på lip-sync fra HunyuanCustoms suppleringsside, redigert sammen.

På tidspunktet for skriving, finnes det ingen engelskspråklige eksempler, men disse ser ut til å være ganske gode – enda bedre hvis metoden for å lage dem er enkelt å installere og tilgjengelig.

Redigering av eksisterende video

Det nye systemet tilbyr hva som ser ut til å være svært imponerende resultater for video-til-video (V2V, eller Vid2Vid) redigering, hvor en del av en eksisterende (reell) video er maskert av og inteligent erstattet av et subjekt gitt i et enkelt referansebilde. Under er et eksempel fra suppleringssiden:

Klikk for å spille. Bare det sentrale objektet er målrettet, men hva som er igjen rundt det, blir også endret i en HunyuanCustom vid2vid-gjennomgang.

Som vi kan se, og som er standard i en vid2vid-scenario, blir hele videoen til en viss grad endret av prosessen, selv om det meste endres i det målrettede området, dvs. det myke leketøyet. Antagelig kan pipelines utvikles for å lage slike transformasjoner under en garbage-matte-tilnærming som lar det meste av videoinnholdet være identisk med originalen. Dette er hva Adobe Firefly gjør under panseret, og gjør ganske bra – men det er en under-studert prosess i FOSS-generativ scenen.

Det sies at de fleste alternative eksemplene som er gitt, gjør en bedre jobb med å målrette disse integrasjonene, som vi kan se i den samlede kompilasjonen nedenfor:

Klikk for å spille. Forskjellige eksempler på injisert innhold ved hjelp av vid2vid i HunyuanCustom, som viser betydelig respekt for det umålrettede materialet.

En ny start?

Dette initiativet er en utvikling av Hunyuan Video-prosjektet, ikke en hard vending bort fra denne utviklingsstrømmen. Prosjektets forbedringer er introdusert som diskrete arkitektoniske innføringer, snarere enn sveipende strukturelle endringer, med mål om å tillate modellen å opprettholde identitets-trofasthet over rammer uten å avhenge av subjekts-spesifikke fine-tuning, som med LoRA eller tekst-inversjons-tilnærmingene.

For å være tydelig, derfor, er HunyuanCustom ikke trent fra scratch, men heller en fin-justering av HunyuanVideo-stammodellen fra desember 2024.

De som har utviklet HunyuanVideo LoRAs, kan undre seg om de fortsatt vil fungere med denne nye utgaven, eller om de må gjenskape LoRA-hjulet igjen hvis de ønsker mer tilpassingsevne enn det som er bygget inn i denne nye utgaven.

Generelt, en tungt fin-justert utgivelse av en hyperskalemodell endrer modell-vektene nok til at LoRAs laget for den tidligere modellen, ikke vil fungere ordentlig, eller i det hele tatt, med den ny-refinerte modellen.

Noen ganger, likevel, kan en fin-justerings popularitet utfordre dens opphav: et eksempel på en fin-justering som blir en effektiv fork, med en dedikert økosystem og følgere på egen hånd, er Pony Diffusion-justeringen av Stable Diffusion XL (SDXL). Pony har for øyeblikket 592 000+ nedlastinger på den evoluerende CivitAI-domene, med en stor mengde LoRAs som har brukt Pony (og ikke SDXL) som basis-modell, og som krever Pony på inferens-tid.

Utgivelse

Prosjektsiden for den nye papiren (som er tittelen HunyuanCustom: En multimodal-drevet arkitektur for tilpasset video-generering) inneholder lenker til en GitHub-side som, på tidspunktet for skriving, nettopp ble funksjonell, og som ser ut til å inneholde all kode og nødvendige vekter for lokal implementering, sammen med en foreslått tidsplan (hvor det eneste viktige som fortsatt må komme, er ComfyUI-integrasjon).

På tidspunktet for skriving, er prosjektets Hugging Face-tilstedeværelse fortsatt en 404. Det finnes imidlertid en API-basert versjon av hvor en kan tydeligvis demonstrere systemet, så lenge man kan levere en WeChat-skanne-kode.

Jeg har sjelden sett en så omfattende og ekstensiv bruk av så mange prosjekter i en sammenstilling, som er tydelig i HunyuanCustom – og antagelig ville noen av lisensene i alle fall pålegge en full utgivelse.

To modeller er kunngjort på GitHub-siden: en 720px1280px-versjon som krever 8) GB av GPU Peak Memory, og en 512px896px-versjon som krever 60GB av GPU Peak Memory.

Repositoryt uttaler ‘Den minste GPU-minnet som kreves, er 24GB for 720px1280px129f, men veldig langsom…Vi anbefaler å bruke en GPU med 80GB minne for bedre genereringskvalitet’ – og gjentar at systemet bare har blitt testet så langt på Linux.

Tidligere Hunyuan Video-modell har, siden offisiell utgivelse, blitt kvantisert ned til størrelser hvor den kan kjøres på mindre enn 24GB av VRAM, og det ser ut til å være rimelig å anta at den nye modellen også vil bli tilpasset i mer forbruker-vennlige former av samfunnet, og at den raskt vil bli tilpasset for bruk på Windows-systemer også.

På grunn av tidsbegrensninger og den overveldende mengden informasjon som følger med denne utgivelsen, kan vi bare ta en bredere, snarere enn en dyptgående, titt på denne utgivelsen. Likevel, la oss åpne hodet på HunyuanCustom litt.

En titt på papiret

Data-pipeline for HunyuanCustom, som ser ut til å være i samsvar med GDPR-rammeverket, inkorporerer både syntetiserte og åpen kilde-video-datasett, inkludert OpenHumanVid, med åtte kjerne-kategorier representert: mennesker, dyr, planter, landskap, kjøretøy, objekter, arkitektur, og anime.

Fra utgivelses-papiret, en oversikt over de forskjellige bidragende pakker i HunyuanCustoms data-konstruksjons-pipeline. Kilde: https://arxiv.org/pdf/2505.04512

Fra utgivelses-papiret, en oversikt over de forskjellige bidragende pakker i HunyuanCustoms data-konstruksjons-pipeline. Kilde: https://arxiv.org/pdf/2505.04512

Initial filtrering begynner med PySceneDetect, som segmenterer videoer i enkelt-skudd-klipp. TextBPN-Plus-Plus brukes deretter til å fjerne videoer som inneholder for mye tekst på skjermen, undertekster, vannmerker eller logoer.

For å håndtere inkonsistenser i oppløsning og varighet, standardiseres klippene til fem sekunder i lengde og størrelse til 512 eller 720 piksler på kort siden. Estetisk filtrering håndteres ved hjelp av Koala-36M, med en tilpasset terskel på 0,06 brukt for det tilpassede datasettet som er kuratert av papirets forskere.

Subjektekstraksjonsprosessen kombinerer Qwen7B Large Language Model (LLM), YOLO11X-objekt-gjenkjenning-rammeverk, og det populære InsightFace-arkitekturen, for å identifisere og validere menneskelige identiteter.

For ikke-menneskelige subjekter, brukes QwenVL og Grounded SAM 2 for å trekke ut relevante begrensning-bokser, som kastes hvis de er for små.

Eksempler på semantisk segmentering med Grounded SAM 2, brukt i Hunyuan Control-prosjektet. Kilde: https://github.com/IDEA-Research/Grounded-SAM-2

Eksempler på semantisk segmentering med Grounded SAM 2, brukt i Hunyuan Control-prosjektet. Kilde: https://github.com/IDEA-Research/Grounded-SAM-2

Flersubjektekstraksjon bruker Florence2 for begrensning-boks-annotering, og Grounded SAM 2 for segmentering, fulgt av klastering og tidsmessig segmentering av trenings-rammer.

De prosesserte klippene forbedres videre via annotering, ved hjelp av et proprietært strukturert-merkingssystem utviklet av Hunyuan-laget, og som forsyner lagret metadata som beskrivelser og kamera-bevegelseshint.

Mask-augmenteringsstrategier, inkludert konvertering til begrensning-bokser, ble brukt under trening for å redusere over-tilpasning og sikre at modellen tilpasser seg diverse objektsformer.

Lyddata ble synkronisert ved hjelp av ovennevnte LatentSync, og klipp kastet hvis synkroniseringspoeng falt under en minimums-terskel.

Den blinde bilde-kvalitets-vurderings-rammeverket HyperIQA ble brukt til å ekskludere videoer som scoret under 40 (på HyperIQA’s egen skala). Gyldige lyd-sporene ble deretter prosessert med Whisper for å trekke ut trekk for nedstrøms-oppgaver.

Forfatterne inkorporerer LLaVA-språk-hjelper-modellen under annoterings-fasen, og de understreker den sentrale posisjonen som dette rammeverket har i HunyuanCustom. LLaVA brukes til å generere bilde-underskrifter og å assistere i å justere visuelt innhold med tekst-prompt, og støtte konstruksjonen av en konsistent trenings-signal over modi:

HunyuanCustom-rammeverket støtter identitets-konsistent video-generering betinget av tekst, bilde, lyd og video-innput.

HunyuanCustom-rammeverket støtter identitets-konsistent video-generering betinget av tekst, bilde, lyd og video-innput.

Ved å utnytte LLaVA’s visjon-språk-justerings-egenskaper, får pipeline en ekstra lag semantisk konsistens mellom visuelle elementer og deres tekstlige beskrivelser – spesielt verdifullt i fler-subjekts- eller komplekse-scenarioer.

Tilpasset video

For å tillate video-generering basert på et referansebilde og en prompt, ble de to modulene sentrert rundt LLaVA skapt, først ved å tilpasse inndata-strukturen til HunyuanVideo så den kunne akseptere et bilde sammen med tekst.

Dette involverte å formatere prompten på en måte som innføyer bildet direkte eller merker det med en kort identitets-beskrivelse. En separator-token ble brukt for å forhindre at bilde-innlejringen overveldet prompt-innholdet.

Ettersom LLaVA’s visuell encoder har en tendens til å komprimere eller kaste fine-grådet romlige detaljer under justering av bilde- og tekst-trekk (spesielt når en oversetter et enkelt referansebilde til en generell semantisk innlejring), ble en identitets-forbedrings-modul inkorporert. Ettersom nesten alle video-latent-diffusjons-modeller har noen vanskeligheter med å opprettholde en identitet uten en LoRA, selv i en fem-sekunders klipp, kan ytelsen til denne modulen i samfunnets testing være betydelig.

I alle fall, blir referanse-bildet deretter størrelsesendret og kodet ved hjelp av den kausale 3D-VAE fra den opprinnelige HunyuanVideo-modellen, og dens latente innført i video-latent over den tidsmessige aksen, med en romlig forskyvning brukt for å forhindre at bildet blir direkte reproduert i utgangen, mens det likevel guider generering.

Modellen ble trent ved hjelp av Flow Matching, med støy-prøver trukket fra en logit-normal distribusjon – og nettverket ble trent til å gjenopprette den korrekte videoen fra disse støy-latentene. LLaVA og video-generatoren ble begge fin-justert sammen så prompten og bildet kunne guide utgangen mer flytende og holde subjekt-identiteten konsistent.

For fler-subjekts-prompt, ble hver bilde-tekst-par innført separat og tildelt en distinkt tidsmessig posisjon, som tillot identiteter å bli skilt, og støttet generering av scener som involverer flere interagerende subjekter.

Lyden og synet

HunyuanCustom betingelser lyd/tale-generering ved hjelp av både bruker-innputt-lyd og en tekst-prompt, som tillater karakterer å snakke i scener som reflekterer den beskrevne settingen.

For å støtte dette, introduserer en Identitet-disentangled AudioNet-modul lyd-trekk uten å forstyrre identitets-signalene innført fra referanse-bildet og prompten. Disse trekkes sammen med den komprimerte video-tidslinjen, delt inn i ramme-nivå-segmenter, og injiseres ved hjelp av en romlig cross-attention-mekanisme som holder hver ramme isolert, og opprettholder subjekt-konsistens og unngår tidsmessig interferens.

En annen tidsmessig injiserings-modul gir finere kontroll over timing og bevegelse, og arbeider i tandem med AudioNet, og kartlegger lyd-trekk til bestemte regioner av den latente sekvensen, og bruker en Multi-Layer Perceptron (MLP) for å konvertere dem til token-vis bevegelses-forskyvninger. Dette tillater gestiske og ansikts-bevegelser å følge rytmen og betoningen av den talte innputt med større presisjon.

HunyuanCustom tillater subjekter i eksisterende videoer å redigeres direkte, erstatter eller setter inn mennesker eller objekter i en scene uten å måtte bygge hele klippet fra scratch. Dette gjør det nyttig for oppgaver som involverer å endre utseende eller bevegelse på en målrettet måte.

Klikk for å spille. Et ytterligere eksempel fra suppleringssiden.

For å fasilitere effektiv subjekt-erstatter i eksisterende videoer, unngår det nye systemet den ressurs-intensive tilnærmingen til nyere metoder som den for øyeblikket populære VACE, eller de som merger hele video-sekvenser sammen, og foretrekker i stedet komprimering av et referanse-video ved hjelp av den forhånds-trente kausale 3D-VAE – som justeres med genererings-pipelineens interne video-latenter, og deretter legges sammen. Dette holder prosessen relativt lettvekt, mens det likevel tillater eksternt video-innhold å guide utgangen.

En liten neural nettverk håndterer justeringen mellom den rene inndata-videoen og de støy-latentene brukt i generering. Systemet tester to måter å injisere denne informasjonen: å slå sammen de to settene med trekk før komprimering igjen; og å legge til trekke frame for frame. Den siste metoden fungerer bedre, ifølge forfatterne, og unngår kvalitets-tap mens den holder den beregningsmessige belastningen uendret.

Data og tester

I tester, ble følgende metrikkene brukt: identitets-konsistens-modulen i ArcFace, som trekker ut ansikts-innlejring fra både referanse-bildet og hver ramme av den genererte videoen, og deretter beregner den gjennomsnittlige kosinus-ligningen mellom dem; subjekt-lignelse, via å sende YOLO11x-segmenter til Dino 2 for sammenligning; CLIP-B, tekst-video-justering, som måler lignelse mellom prompten og den genererte videoen; CLIP-B igjen, for å beregne lignelse mellom hver ramme og både dens nabolande rammene og den første ramen, samt tidsmessig konsistens; og dynami-skala, som definert av VBench.

Som tidligere indikert, var de lukkede kilde-konkurrentene Hailuo; Vidu 2.0; Kling (1.6); og Pika. De konkurrerende FOSS-rammeverkene var VACE og SkyReels-A2.

Modell-ytelses-evaluering som sammenligner HunyuanCustom med ledende video-tilpassings-metoder over ID-konsistens (Face-Sim), subjekt-lignelse (DINO-Sim), tekst-video-justering (CLIP-B-T), tidsmessig konsistens (Temp-Consis), og bevegelses-intensitet (DD). Optimale og under-optimale resultater er vist i fet og understreket, henholdsvis.

Modell-ytelses-evaluering som sammenligner HunyuanCustom med ledende video-tilpassings-metoder over ID-konsistens (Face-Sim), subjekt-lignelse (DINO-Sim), tekst-video-justering (CLIP-B-T), tidsmessig konsistens (Temp-Consis), og bevegelses-intensitet (DD). Optimale og under-optimale resultater er vist i fet og understreket, henholdsvis.

Av disse resultater, uttaler forfatterne:

‘Vår [HunyuanCustom] oppnår den beste ID-konsistens og subjekt-konsistens. Den oppnår også sammenlignbare resultater i prompt-følging og tidsmessig konsistens. [Hailuo] har den beste klippe-scoren fordi den kan følge tekst-instruksjoner godt med bare ID-konsistens, og ofrer konsistensen til ikke-menneskelige subjekter (den dårligste DINO-Sim). I forhold til Dynamisk-skala, utfører [Vidu] og [VACE] dårlig, noe som kan skyldes den lille størrelsen på modellen.’

Til tross for at prosjektsiden er mettet med sammenlignings-videoer (som ser ut til å være designet for nettside-estetikk snarere enn enkel sammenligning), har den for øyeblikket ikke en video-ekvivalent av de statiske resultater som er pakket sammen i PDF-en, i forhold til de initielle kvalitative testene. Til tross for dette, oppmuntres leseren til å gjøre en nær undersøkelse av videoene på prosjektsiden, da de gir en bedre inntrykk av resultater:

Fra papiret, en sammenligning av objekt-sentrert video-tilpassing. Selv om seeren bør (som alltid) referere til kilde-PDF-en for bedre oppløsning, kan videoene på prosjektsiden være en mer opplysende ressurs i dette tilfelle.

Fra papiret, en sammenligning av objekt-sentrert video-tilpassing. Selv om seeren bør (som alltid) referere til kilde-PDF-en for bedre oppløsning, kan videoene på prosjektsiden være en mer opplysende ressurs i dette tilfelle.

Forfatterne kommenterer her:

‘Det kan ses at [Vidu], [Skyreels A2] og vår metode oppnår relativt gode resultater i prompt-justering og subjekt-konsistens, men vår video-kvalitet er bedre enn Vidu og Skyreels, takket være den gode video-genererings-ytelsen til vår basis-modell, dvs. [Hunyuanvideo-13B].

‘Blant kommersielle produkter, selv om [Kling] har en god video-kvalitet, har den første ramen i videoen et copy-paste-problem, og noen ganger beveger subjektet seg for raskt og [blurrer], noe som fører til en dårlig visnings-erfaring.’

Forfatterne kommenterer videre at Pika utfører dårlig i forhold til tidsmessig konsistens, og introduserer undertekst-artefakter (effekter fra dårlig data-kurering, hvor tekst-elementer i video-klipp har blitt tillatt å forurenske de grunnleggende konseptene).

Hailuo opprettholder ansikts-identitet, ifølge forfatterne, men kan ikke opprettholde hel-kropps-konsistens. Blant åpne kilde-metoder, påstår forskerne at VACE er ute av stand til å opprettholde identitets-konsistens, mens de hevder at HunyuanCustom produserer videoer med sterk identitets-bevaring, samtidig som den opprettholder kvalitet og mangfold.

Deretter ble tester utført for fler-subjekts-video-tilpassing, mot de samme konkurrentene. Som i det foregående eksemplet, er de flattede PDF-resultatene ikke trykk-ekvivalenter av videoer tilgjengelige på prosjektsiden, men er unike blant resultater presentert:

Sammenligninger ved hjelp av fler-subjekts-video-tilpassing. Vennligst se PDF for bedre detalj og oppløsning.

Sammenligninger ved hjelp av fler-subjekts-video-tilpassing. Vennligst se PDF for bedre detalj og oppløsning.

Papiret uttaler:

‘[Pika] kan generere de spesifiserte subjektene, men viser ustabilitet i video-rammer, med eksempler på en mann som forsvinner i ett scenario og en kvinne som ikke klarer å åpne en dør som promptet. [Vidu] og [VACE] fanger delvis menneskelig identitet, men mister betydelige detaljer om ikke-menneskelige objekter, noe som indikerer en begrensning i å representere ikke-menneskelige subjekter.

‘[SkyReels A2] opplever alvorlig ramme-ustabilitet, med merkbar endring i chips og tallrike artefakter i det høyre scenariet.

‘I motsetning til dette, vår HunyuanCustom fanger effektivt både menneskelige og ikke-menneskelige subjekt-identiteter, genererer videoer som holder seg til de gitte promptene, og opprettholder høy visuell kvalitet og stabilitet.’

En ytterligere eksperiment var ‘virtuell menneske-reklame’, hvor rammeverkene ble bedt om å integrere et produkt med en person:

Fra den kvalitative test-runden, eksempler på neurale 'produkt-plasseringer'. Vennligst se PDF for bedre detalj og oppløsning.

Fra den kvalitative test-runden, eksempler på neurale ‘produkt-plasseringer’. Vennligst se PDF for bedre detalj og oppløsning.

For denne runden, uttaler forfatterne:

‘Resultatene demonstrerer at HunyuanCustom effektivt opprettholder identiteten til mennesket, samtidig som den bevare detaljene til mål-produktet, inkludert teksten på det.

‘Fortsatt, interaksjonen mellom mennesket og produktet ser naturlig ut, og videoen holder seg tett til den gitte prompten, og understreker den betydelige potensialet til HunyuanCustom i å generere reklame-videoer.’

Et område hvor video-resultater ville ha vært svært nyttige, var den kvalitative runden for lyd-drevet subjekt-tilpassing, hvor karakteren snakker den korresponderende lyden fra en tekst-beskrevet scene og holdning.

Delvis resultater gitt for lyd-runden – selv om video-resultater ville ha vært foretrukket i dette tilfelle. Bare den øverste halvdelen av PDF-figuren er gjengitt her, da den er stor og vanskelig å plassere i denne artikkelen. Vennligst se kilde-PDF for bedre detalj og oppløsning.

Delvis resultater gitt for lyd-runden – selv om video-resultater ville ha vært foretrukket i dette tilfelle. Bare den øverste halvdelen av PDF-figuren er gjengitt her, da den er stor og vanskelig å plassere i denne artikkelen. Vennligst se kilde-PDF for bedre detalj og oppløsning.

Forfatterne påstår:

‘Tidligere lyd-drevne menneske-animasjons-metoder tar inn et menneske-bilde og en lyd, hvor menneskets holdning, antrekk og miljø forblir konsistente med det gitte bildet og kan ikke generere videoer i andre gest og miljø, noe som kan [begrense] deres anvendelse.

‘…[Vår] HunyuanCustom muliggjør lyd-drevne menneske-tilpassing, hvor karakteren snakker den korresponderende lyden i en tekst-beskrevet scene og holdning, og tillater mer fleksible og kontrollerbare lyd-drevne menneske-animasjoner.’

Ytterligere tester (vennligst se PDF for alle detaljer) inkluderte en runde som satte det nye systemet mot VACE og Kling 1.6 for video-subjekt-erstatter:

Testing av subjekt-erstatter i video-til-video-modus. Vennligst se kilde-PDF for bedre detalj og oppløsning.

Testing av subjekt-erstatter i video-til-video-modus. Vennligst se kilde-PDF for bedre detalj og oppløsning.

Av disse, de siste testene presentert i den nye papiren, mener forskerne:

‘VACE lider av grense-artefakter på grunn av streng overholdelse av inndata-masker, noe som resulterer i unaturlige subjekt-former og forstyrrede bevegelses-kontinuitet. [Kling], på den andre siden, viser en copy-paste-effekt, hvor subjekter blir direkte lagt over videoen, noe som fører til dårlig integrasjon med bakgrunnen.

‘I motsetning til dette, HunyuanCustom unngår grense-artefakter, oppnår sømløs integrasjon med video-bakgrunnen, og opprettholder sterk identitets-bevaring—demonstrerende sin overlegne ytelse i video-redigerings-oppgaver.’

Konklusjon

Dette er en fascinerende utgivelse, ikke minst fordi den adresserer noe som den stadig misfornøyde hobbyist-scenen har klaget på mer nylig – mangelen på lip-sync, så at den økte realisme som er mulig i systemer som Hunyuan Video og Wan 2.1, kan gis en ny dimensjon av autentisitet.

Selv om layouten av nesten alle sammenlignings-video-eksemplene på prosjektsiden gjør det vanskelig å sammenligne HunyuanCustoms evner mot tidligere konkurrenter, må det bemerkes at svært få prosjekter i video-syntese-rommet har motet til å sette seg selv i tester mot Kling, den kommersielle video-diffusjons-APIen som alltid er nær eller på toppen av ledertabellene; Tencent ser ut til å ha gjort fremgang mot denne etablerte aktøren på en ganske imponerende måte.

 

* Problemene er at noen av videoene er så brede, korte og høyoppløste at de ikke vil spille i standard video-avspillere som VLC eller Windows Media Player, og viser bare svarte skjermer.

Først publisert torsdag, 8. mai 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai