Andersonin kulma

HunyuanCustom tuoaa yksinkuvioisia videodeepfakeja äänellä ja huulienkronoinnilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Images from the new paper at https://arxiv.org/pdf/2505.04512

Tässä artikkelissa käsitellään uutta Hunyuan-videomaailman mallin julkaisua, joka on nimeltään ‘HunyuanCustom’. Uuden tutkimuksen laajuus yhdistettynä useisiin ongelmallisiin esimerkkivideoihin projektisivulla*, rajoittaa meidät yleisemmän kattavuuden ja rajoitetun videoaineiston uudelleenjulkaisemiseen (koska monet videoista vaativat merkittävää editointia ja prosessointia parantamaan asettelun lukukelpoisuutta).

Lisäksi huomautus, että tutkimus viittaa API-pohjaiseen generatiiviseen järjestelmään Klingiin ‘Kelingiksi’. Selkeyden vuoksi viittaan ‘Klingiin’ tässä.

 

Tencent on julkaissut uuden version Hunyuan Video -mallistaan, joka on nimeltään HunyuanCustom. Uusi julkaisu näyttää pystyvän tekemään Hunyuan LoRA -malleja tarpeettomiksi, sallimalla käyttäjän luoda ‘deepfake’-tyyppisiä videokustomoinneja yhdellä kuvalla:

Paina toistamaan. Viesti: ‘Mies kuuntelee musiikkia ja valmistaa snail-nuudeleita keittiössä’. Uusi menetelmä verrattuna sekä suljettuihin että avoimiin lähteisiin, mukaan lukien Kling, joka on merkittävä vastustaja tässä tilassa. Lähde: https://hunyuancustom.github.io/ (varoitus: CPU/muistiriippuvainen sivu!)

Vasemmalla olevassa sarakkeessa yllä olevassa videossa näemme yksittäisen lähdekuvan, joka on toimitettu HunyuanCustomille, seuraavassa sarakkeessa uuden järjestelmän tulkinnan viestistä, ja loput sarakkeet näyttävät tulokset eri omistus- ja avoimien lähteiden järjestelmistä: Kling; Vidu; Pika; Hailuo; ja Wan-pohjainen SkyReels-A2.

Seuraavassa videossa näemme renderöintejä kolmesta skenaariosta, jotka ovat tärkeitä tämän julkaisun kannalta: vastaavasti, henkilö + esine; yksittäisen hahmon emulaatio; ja virtuaalinen koettaminen (henkilö + vaatteet):

Paina toistamaan. Kolme esimerkkiä editoitu materiaalista Hunyuan Videon tukisivulta.

Voimme huomata joitakin asioita näistä esimerkeistä, pääasiassa liittyen siihen, että järjestelmä riippuu yksittäisestä lähdekuvasta eikä useista kuvista samasta aiheesta.

Ensimmäisessä klipissä mies on käytännössä edelleen kasvot kameraan. Hän kallistaa päätään alas ja sivulle enintään 20-25 asteen kulmassa, mutta, jos kulma on yli tämän, järjestelmän on todella arvioitava, miltä hän näyttää profilissa. Tämä on vaikea, ehkä mahdoton arvioida tarkasti yksittäisestä etummaisesta kuvasta.

Toisessa esimerkissä näemme, että tyttö on hymyilevä renderöidyllä videolla, kuten hän on yksittäisessä staattisessa lähdekuvassa. Taas, tämän yksittäisen kuvan perusteella HunyuanCustomin on tehtävä suhteettain tietämätön arvio siitä, miltä hänen ‘lepokasvonsa’ näyttää. Lisäksi hänen kasvonsa eivät poikkea kameran eteenpäin suunnatusta asennosta enempää kuin edellisessä esimerkissä (‘mies syö crispejä’).

Viidessä esimerkissä näemme, että koska lähdeaineisto – nainen ja vaatteet, joihin hän on ohjattu – eivät ole täydellisiä kuvia, renderöinti on leikannut skenaariota sopimaan – mikä on itse asiassa hyvin hyvä ratkaisu dataongelmaan!

Pääasia on, että vaikka uusi järjestelmä pystyy käsittelemään useita kuvia (kuten henkilö + crisps tai henkilö + vaatteet), se ei näytä sallivan useita kulmia tai vaihtoehtoisia näkymiä yksittäisestä hahmosta, jotta erilaiset ilmeet tai epätavalliset kulmat voitaisiin ottaa huomioon. Tästä syystä järjestelmä saattaa kärsiä vaikeuksista korvaamassa kasvavaa LoRA-mallien ekosysteemiä, joka on kehittynyt HunyuanVideon ympärille sen julkaisun jälkeen viime joulukuussa, koska nämä voivat auttaa HunyuanVideoa tuottamaan johdonmukaisia hahmoja miltä tahansa kulmalta ja millä tahansa kasvonilmeellä, joka on edustettu koulutusaineistossa (20-60 kuvaa on tyypillistä).

Äänellä varustettu

HunyuanCustom käyttää LatentSync -järjestelmää (joka on mainittavasti vaikea asettaa ja saada hyviä tuloksia) äänien ja huulien liikkeiden saamiseksi, jotka ovat sopivia äänelle ja tekstille, jotka käyttäjä toimittaa:

Paina toistamaan. Eri esimerkkejä huulienkronoinnista HunyuanCustomin lisäaineistosta, editoitu yhteen.

Kirjoitushetkellä ei ole englanninkielisiä esimerkkejä, mutta ne näyttävät olevan melko hyviä – niin paljon, että menetelmä niiden luomiseksi on helposti asennettavissa ja saatavissa.

Olemassa olevan videon editointi

Uusi järjestelmä tarjoaa vaikuttavia tuloksia videosta-videoon (V2V, tai Vid2Vid) editoinnissa, jossa olemassa olevan (oikean) videon segmentti maskataan pois ja korvataan älykkäästi yksittäisellä viitekuvalla. Alla on esimerkki lisäaineiston sivustolta:

Paina toistamaan. Vain keskimmäinen esine on kohdistettu, mutta se, mikä jää sen ympärille, muuttuu myös HunyuanCustomin vid2vid-käynnissä.

Kuten voimme nähdä, ja kuten on tyypillistä vid2vid-skenaariossa, koko video muuttuu prosessissa jossain määrin, vaikka eniten kohdistetussa alueessa, eli pehmolelussa. Oletettavasti putkistot voivat kehittyä luomaan tällaisia muodonmuutoksia roskamaton -lähestymistavan mukaisesti, joka jättää suurimman osan videosisällöstä samanlaiseksi kuin alkuperäinen. Tämä on se, mitä Adobe Firefly tekee sisäisesti, ja tekee sen hyvin – mutta se on vähän tutkittu prosessi avoimien lähteiden generatiivisessa kentässä.

Se, mitä useimmat vaihtoehtoiset esimerkit tarjoavat, tekee paremmin näiden integraatioiden kohdistamista, kuten voimme nähdä alla olevassa kokoelmassa:

Paina toistamaan. Eri esimerkkejä interjektioista käyttäen vid2vid:ia HunyuanCustomissa, osoittaa merkittävää kunnioitusta kohdistamattomalle aineistolle.

Uusi alku?

Tämä aloite on Hunyuan Video -projektin kehitys, eikä sitä voida pitää poikkeamisena siitä kehityslinjasta. Projektin parannukset esitetään erillisinä arkkitehtonisina lisäyksinä eikä laajoina rakenteellisina muutoksina, tavoitteena on sallia mallin säilyttää identiteettien uskollisuus kehyksen yli ilman kohteekohtaisen hienosäätöä, kuten LoRA- tai tekstuaalisen käännöksen lähestymistavat.

Yksinkertaisesti sanottuna, HunyuanCustom ei ole koulutettu alusta alkaen, vaan se on hienosäätöä joulukuun 2024 HunyuanVideo-pohjamallista.

Ne, jotka ovat kehittäneet HunyuanVideo LoRA-malleja, saattavat ihmetellä, säilyttävätkö ne toimivuutensa tämän uuden julkaisun kanssa, tai joutuvatko he keksimään LoRA-pyörän uudelleen, jos he haluavat enemmän kustomointiominaisuuksia kuin mitä tämä uusi julkaisu sisältää.

Yleensä ottaen voimakkaasti hienosäätöity julkaisu hyperskaalaisesta mallista muuttaa mallipainot tarpeeksi, jotta LoRA-mallit, jotka on tehty aiemmalle mallille, eivät toimi oikein tai lainkaan uudella mallilla.

Joskus kuitenkin hienosäätöjulkaisun suosio voi haastaa sen alkuperän: yksi esimerkki hienosäätöjulkaisusta, josta on tullut tehokas haara, jolla on omat kannattajansa, on Pony Diffusion -säätö Stable Diffusion XL:n (SDXL) kanssa. Ponylla on 592 000+ latausta CivitAI -alueella, ja laaja valikoima LoRA-malleja, jotka ovat käyttäneet Ponya (eikä SDXL:ää) perusmallina, ja jotka vaativat Ponya inference-ajassa.

Julkaisu

Projektisivu uudelle tutkimukselle (joka on nimeltään HunyuanCustom: Monimodaalinen johdettu arkkitehtuuri kustomoidun videon luomiseksi) sisältää linkit GitHub-sivustolle, joka on juuri tullut toimivaksi, ja joka näyttää sisältävän kaiken koodin ja tarvittavat painot paikalliseen toteutukseen, yhdessä ehdotetun aikataulun (jossa ainoa asia, joka on vielä tulossa, on ComfyUI-integraatio).

Kirjoitushetkellä projektin Hugging Face -esitys on edelleen 404. On kuitenkin API-pohjainen versio järjestelmästä, jossa voi demota järjestelmää, kunhan voi tarjota WeChat-skannauskoodin.

Harvoin olen nähnyt yhtä monimutkaista ja laajaa käyttöä niin monista projekteista yhdessä kokoonpanossa kuin mitä HunyuanCustomissa on – ja oletettavasti osa näistä lisensseistä edellyttäisi täydellistä julkaisua.

Kahden mallin julkaisu on ilmoitettu GitHub-sivulla: 720px1280px-versio, joka vaatii 8 GB GPU-pikamuistia, ja 512px896px-versio, joka vaatii 60 GB GPU-pikamuistia.

Varasto ilmoittaa ‘Vähimmäisvaadittu GPU-muisti on 24GB 720px1280px129f:lle, mutta se on hyvin hidas… Suosittelemme käyttämään GPU:ta, jossa on 80GB muistia paremman generoinnin laadun vuoksi’ – ja toistaa, että järjestelmä on testattu tähän asti vain Linuxilla.

Aiempi Hunyuan Video -malli on, virallisen julkaisun jälkeen, kuantifioidu kokoja, joissa se voidaan suorittaa alle 24GB VRAM:lla, ja näyttää siltä, että uusi malli sopeutetaan myös kuluttajaystävällisempiin muotoihin yhteisön toimesta, ja se otetaan nopeasti käyttöön myös Windows-järjestelmissä.

Ajan rajoitusten ja tähän julkaisuun liittyvän valtavan määrän tietojen vuoksi voimme vain tarkastella tätä julkaisua laajemmin, eikä syvemmältä.

Tutkimuksen tarkastelu

HunyuanCustomin data-pipeline, joka näyttää olevan GDPR -yhteensopiva, sisältää sekä syntetisoitua että avoimia videoaineistoja, mukaan lukien OpenHumanVid, jossa on kahdeksan ydinkategoriaa edustettuna: ihmiset, eläimet, kasvit, maisemat, ajoneuvot, esineet, arkkitehtuuri ja animaatio.

Tutkimuspaperista, yleiskatsaus monimuotoisista paketeista HunyuanCustomin datakonstruktiossa. Lähde: https://arxiv.org/pdf/2505.04512

Tutkimuspaperista, yleiskatsaus monimuotoisista paketeista HunyuanCustomin datakonstruktiossa. Lähde: https://arxiv.org/pdf/2505.04512

Alkuvaiheen suodatus alkaa PySceneDetect:lla, joka jakaa videot yksittäisiin kohtauksiin. TextBPN-Plus-Plus poistaa videot, jotka sisältävät liikaa ruudulla olevaa tekstiä, tekstityksiä, vesi- tai logo-merkintöjä.

Jotta voimme osoittaa epäjohdonmukaisuudet resoluutiossa ja kestossa, klipit on standardisoitu viiden sekunnin pituiseksi ja kokoa on muutettu 512 tai 720 pikseliin lyhyellä sivulla. Estetiikkaa koskeva suodatus on tehty Koala-36M:lla, jossa on mukautettu kynnysarvo 0,06 sovellettavaksi tutkimuksen mukaan luodulle aineistolle.

Aiheen poistoprosessi yhdistää Qwen7B -suuren kielen mallin (LLM), YOLO11x -esiintymän tunnistuskehyksen ja suositun InsightFace -arkkitehtuurin tunnistamaan ja vahvistamaan ihmisten identiteettejä.

Epä-ihmisten kohteiden osalta QwenVL ja Grounded SAM 2 ovat käytetty merkittävien rajojen poistamiseen, jotka on hylätty, jos ne ovat liian pieniä.

Esimerkkejä semanttisesta segmentoinnista Grounded SAM 2:lla, käytetty Hunyuan Control -projektissa. Lähde: https://github.com/IDEA-Research/Grounded-SAM-2

Esimerkkejä semanttisesta segmentoinnista Grounded SAM 2:lla, käytetty Hunyuan Control -projektissa. Lähde: https://github.com/IDEA-Research/Grounded-SAM-2

Monen kohteen poistaminen käyttää Florence2:a rajojen merkintää varten ja Grounded SAM 2:ta segmentoinnissa, seurattuna ryhmittelyllä ja aikajaksojen segmentoinnilla koulutuskehyksissä.

Käsitellyt klipit on edelleen parannettu merkintöjen avulla, käyttäen omistuksellista rakenteista merkintäjärjestelmää, jonka Hunyuan-ryhmä on kehittänyt, ja joka tarjoaa kerroksellisia metatietoja, kuten kuvauksia ja kameraliikkeen vihjeitä.

Mask-augmentaatio -strategiat, mukaan lukien muunnos rajojen pakkauksiin, sovellettiin koulutuksen aikana vähentämään ylisopimista ja varmistamaan, että malli sopeutuu monimuotoisiin esineiden muotoihin.

Äänidata on synkronoitu edellä mainitun LatentSyncin avulla, ja klipit on hylätty, jos synkronointipisteet laskevat alle vähimmäiskynnyksen.

Sokea kuva-laatusoittelukehys HyperIQA käytettiin poistamaan videot, jotka saavuttivat alle 40 (HyperIQA:n mukaisessa mittarissa). Voimassa olevat ääniraidat käsiteltiin Whisper:llä poistamaan piirteitä alijärjestelmille:

Tutkijat sisällyttävät LLaVA -kielimallin merkintävaiheessa, ja he korostavat keskeistä asemaa, jonka tämä kehys HunyuanCustomissa on: LLaVAa käytetään kuvakuvauksien luomiseen ja visuaalisen sisällön tekstipromptien kohdistamiseen, tukeakseen yhdenmukaisen koulutussignaalin rakentamista modaliteetteja ylitse:

HunyuanCustom-kehys tukee identiteettiluotettavaa videon luomista, ehdotettuna teksti-, kuva-, ääni- ja videoprompteilla.

HunyuanCustom-kehys tukee identiteettiluotettavaa videon luomista, ehdotettuna teksti-, kuva-, ääni- ja videoprompteilla.

LLaVA:n visio-kieli -kohdistusominaisuuksien hyödyntämisellä putki saa lisäkerroksen semanttista johdonmukaisuutta visuaalisten elementtien ja niiden tekstikuvauksien välillä – erityisesti monikohtaisissa tai monimutkaisissa skenaarioissa.

Kustomoidut videot

Videon luomista varten, joka perustuu viitekuvan ja tekstipromptiin, kaksi LLaVA:han keskittyvää moduulia luotiin, ensin sovittamalla HunyuanVideon syötteen rakennetta siten, että se voisi hyväksyä kuvan tekstipromptin kanssa:

Tämä vaati promptin muotoilua siten, että se upottaa kuvan suoraan tai merkitsee sen lyhyellä identiteettikuvauksella. Eroinmerkki käytettiin estämään kuvan upotuksesta hallitsemasta promptin sisältöä.

Koska LLaVA:n visuaalinen koodari taipuu tukahduttamaan tai hylkäämään hienojakoiset avaruudelliset yksityiskohdat visuaalisten ja tekstipiirteiden kohdistamisessa (erityisesti, kun yksittäinen viitekuva käännetään yleiseksi semanttiseksi upotukseksi), identiteetin parantamismoduuli otettiin käyttöön. Koska melkein kaikki videolliset latentiiviset diffuusiomallit ovat vaikeuksissa identiteetin ylläpitämisessä ilman LoRA:ta, jopa viiden sekunnin klipissä, tämän moduulin suorituskyky yhteisön testauksessa saattaa osoittautua merkittäväksi.

Milloin tahansa viitekuva on kooltaan muutettu ja koodattu alkuperäisestä HunyuanVideo-mallista peräisin olevalla kausallisella 3D-VAE:lla, ja sen latenti on lisätty videolliseen latentiin aikajanan ylitse, ja siihen on sovellettu avaruudellinen siirtymä estämään kuvan suoraa toistoa tulosteessa, samalla kun se ohjaa luomista.

Malli koulutettiin Flow Matching:lla, jossa melu-näytteet otettiin logit-normaalijakaumasta – ja verkko koulutettiin palauttamaan oikean videon näistä meluisista latenteista. LLaVA ja videon generoija hienosäätöivät yhdessä siten, että kuva ja prompt voivat ohjata tulostetta sulavammin ja pitää kohteen identiteetin johdonmukaisena.

Monen kohteen viestien kohdalla kunkin kuva- ja tekstiparin upotus tehtiin erikseen ja sille määriteltiin erillinen aikajakso, mahdollistaen identiteetin erottamisen ja tukeakseen useiden vuorovaikutteisten kohteiden skenaarioiden luomista.

Ääni ja visio

HunyuanCustom ehdottaa äänen/puheen luomista käyttäen sekä käyttäjän syöttämää ääntä että tekstipromptia, sallien hahmojen puhumisen skenaarioissa, jotka heijastavat kuvattua asetelmaa.

Tukeakseen tätä, identiteetistä eriytetty AudioNet-moduuli esittää äänipiirteitä ilman identiteettimerkkien häirintää, jotka on upotettu viitekuvasta ja promptista. Nämä piirteet on kohdistettu tiivistetylle videokohtaiselle aikajanolle, jaettaen kehyksen tasoiseen segmenttiin, ja ruiskutetaan paikallisen rinnakkaisen huomion mekanismilla, joka pitää kunkin kehyksen erillään, säilyttäen kohteen johdonmukaisuuden ja välttäen aikajärjestyksessä tapahtuvia häiriöitä.

Toinen aikajärjestyksessä tapahtuva ruiskutusmoduuli tarjoaa tarkemman ohjauksen ajan ja liikkeen suhteen, toimien yhdessä AudioNetin kanssa, kartoittaen äänipiirteitä latentin aikajanan tiettyihin alueisiin, ja käyttäen monikerroksista perkussiota (MLP) muuttaakseen ne token-kohtaisiksi liikkeen siirtymiksi. Tämä sallii eleiden ja kasvojen liikkeiden seurata puhujan äänen rytmiä ja painotusta tarkemmin.

HunyuanCustom sallii kohteiden muokkaamisen suoraan olemassa olevissa videoissa, korvaamalla tai lisäämällä ihmisiä tai esineitä skenaarioon ilman koko klipin uudelleenrakentamista. Tämä tekee siitä hyödyllisen tehtävissä, jotka liittyvät ulkonäön tai liikkeen muuttamiseen kohdistetulla tavalla.

Paina toistamaan. Lisäesimerkki lisäaineistosta.

Jotta voidaan mahdollistaa tehokas kohteen korvaaminen olemassa olevissa videoissa, uusi järjestelmä välttää resursseja vaativan lähestymistavan, jota nykyään suositellaan menetelminä, kuten VACE, tai ne, jotka yhdistävät koko videosekvenssejä, suosien sen sijaan viitevideon pakkaamista esikoulutetulla kausalisella 3D-VAE:lla – kohdistamalla sen generoinnin putken sisäisiin videollisiin latenteihin, ja lisäämällä ne yhteen. Tämä pitää prosessin suhteellisen kevyenä, samalla kun se sallii ulkoisen videosisällön ohjata tulostetta.

Pieni neurverkko käsittelee kohdistamista puhdas syötevideo ja meluisat latentiit, joita käytetään generoimisessa. Järjestelmä testaa kahta tapaa tämän tiedon injektointiin: yhdistämällä ne ennen pakkaamista uudelleen; ja lisäämällä ne kehyksen kerran kerran. Jälkimmäinen menetelmä toimii paremmin, tutkijat havaitsivat, ja se välttää laadun menetyksen samalla, kun se pitää laskennallisen kuorman muuttumattomana.

Data ja testit

Testeissä käytettiin seuraavia mittareita: identiteetin johdonmukaisuusmoduuli ArcFace:ssa, joka poistaa kasvonupotukset sekä viitekuvasta että jokaisesta kehyksestä generoidussa videossa, ja laskee keskimääräisen kosiniussamankaltaisuuden heidän välillään; kohteen samankaltaisuus, lähettämällä YOLO11x-segmentit Dino 2:lle vertailtaviksi; CLIP-B, teksti-videokohdistus, joka mittaa samankaltaisuutta viesti ja generoitu videon välillä; CLIP-B uudelleen, laskeakseen samankaltaisuuden kunkin kehyksen ja sekä sen naapureiden että ensimmäisen kehyksen välillä, sekä aikajärjestyksessä oleva johdonmukaisuus; ja dynaaminen aste, määritelty VBench:lla.

Kuten aiemmin mainittiin, vertailtavat suljetut lähdekilpailijat olivat Hailuo; Vidu 2.0; Kling (1.6); ja Pika. Vastakkaiset avoimet lähdekilpailijat olivat VACE ja SkyReels-A2.

<img class=" wp-image-217329" src="https://www.unite.ai/wp-content/uploads/2025/05/table1.jpg" alt="Mallin suorituskyvyn arviointi, joka vertaa HunyuanCustomia johtaviin videon kustomointimenetelmiin ID-johdonmukaisuuden (Face-Sim), kohteen samankaltaisuuden (DINO-Sim), teksti-videokohdistuksen (CLIP-B-T), aikajärjestyksessä olevan johdonmukaisuuden (Temp-Consis) ja liikkeen voimakkuuden (DD) osalta. Optimaaliset ja alioptimaaliset tulokset on esitetty lihavoituna ja alaviivattuna.

Näistä tuloksista tutkijat toteavat:

‘Meidän (HunyuanCustom) saavuttaa parhaimman ID-johdonmukaisuuden ja kohteen johdonmukaisuuden. Se saavuttaa myös vertailukelpoiset tulokset viestin seuraamisessa ja aikajärjestyksessä olevassa johdonmukaisuudessa. [Hailuo] on paras klip-pistemäärä, koska se pystyy seuraamaan tekstiä hyvin vain ID-johdonmukaisuuden kanssa, uhraamalla epä-ihmisten kohteiden johdonmukaisuuden (huonoin DINO-Sim). Dynaamisen asteen osalta [Vidu] ja [VACE] suorittavat heikosti, mikä saattaa johtua mallin pienestä koosta.’

Vaikka projektisivu on täynnä vertailuvideoita (joiden asettelu on suunniteltu enemmän verkkosivun esteettisyyden kuin helpon vertailun vuoksi), se ei tällä hetkellä sisällä videon kaltaista vastinetta staattisille tuloksille, jotka on tiivistetty PDF-muotoon, koskien alkuvaiheen laadullisia testejä. Vaikka olen sisällyttänyt sen tähän, rohkeasti kehotan lukijoita tarkastelemaan videoita projektisivulla, koska ne antavat paremman käsityksen tuloksista:

Tutkimuksesta, vertailu esineen keskuksessa olevasta videon kustomoinnista. Vaikka lukija tulisi aina tarkastella lähdetiedostoa paremman resoluution vuoksi, videot projektisivulla saattavat olla valaistuneampi resurssi tässä tapauksessa.

Tutkimuksesta, vertailu esineen keskuksessa olevasta videon kustomoinnista. Lähde: https://arxiv.org/pdf/2505.04512

Tutkijat toteavat tässä:

‘On nähtävissä, että [Vidu], [Skyreels A2] ja meidän menetelmämme saavuttavat suhteellisen hyvät tulokset viestin seuraamisessa ja kohteen johdonmukaisuudessa, mutta meidän videon laatu on parempi kuin Vidun ja Skyreelsin, kiitos meidän perusmallin hyvän videon luomisen suorituskyvyn, eli [Hunyuanvideo-13B]. ‘

‘Kaupallisissa tuotteissa, vaikka [Kling] on hyvä videon laatu, ensimmäinen kehys videossa on kopioitu [ongelma], ja joskus kohteen liike on liian nopea ja [sumenee], josta seuraa huono katselukokemus.’

Tutkijat toteavat myös, että Pika suorittaa huonosti aikajärjestyksessä olevassa johdonmukaisuudessa, ja se esittää tekstitysartefakteja (vaikutuksia huonosta datakuratoinnista, jossa videoklippien tekstielementit on sallittu pilaantamaan perusasiat).

Hailuo säilyttää kasvon identiteetin, tutkijat toteavat, mutta se ei säilytä täydellisen kehon johdonmukaisuutta. Avoimien lähdekeinojen osalta VACE, tutkijat väittävät, ei pysty säilyttämään identiteetin johdonmukaisuutta, kun taas he väittävät, että HunyuanCustom tuottaa videoita, joissa on vahva identiteetin säilyttäminen, säilyttäen samalla laadun ja monimuotoisuuden.

Seuraavaksi tehtiin testit monen kohteen videon kustomoinnista vastaan samoja kilpailijoita vastaan. Kuten edellisessä esimerkissä, tasoitetut PDF-tulokset eivat ole tulosteiden tulostetta, mutta ne ovat ainutlaatuisia tuloksia, jotka on esitetty:

Vertailu monen kohteen videon kustomoinnista. Ole hyvä ja tarkastele PDF:ää paremman yksityiskohtaisuuden ja resoluution vuoksi.

Vertailu monen kohteen videon kustomoinnista. Ole hyvä ja tarkastele PDF:ää paremman yksityiskohtaisuuden ja resoluution vuoksi.

Tutkimus toteaa:

‘[Pika] voi luoda määritellyt kohteet, mutta se näyttää epävakautta videokehyksissä, mukaan lukien tilanteita, joissa mies katoaa yhdessä skenaariossa ja nainen epäonnistuu avaamassa ovea, kuten viestiä.

‘[Vidu] ja [VACE] osittain kaappaavat ihmisen identiteetin, mutta menettävät merkittäviä yksityiskohtia epä-ihmisten kohteista, osoittaen rajoituksen epä-ihmisten kohteiden edustamisessa.

‘[SkyReels A2] kärsii vakavasta kehysvakavuudesta, jossa on havaittavissa muutoksia chipseissä ja useita artefakteja oikeassa skenaariossa.

‘Vastakkain, meidän HunyuanCustom kaappaa tehokkaasti sekä ihmisten että epä-ihmisten kohteiden identiteetin, luoden videoita, jotka noudattavat annettuja viestejä, ja ylläpitävät korkeaa visuaalista laatua ja vakautta.’

Lisäkokeilu, jossa kehykset pyydettiin integroimaan tuotteen kanssa, jossa henkilö on:

Esimerkkejä neuronilisäksi 'tuotteen sijoittelusta'. Ole hyvä ja tarkastele PDF:ää paremman yksityiskohtaisuuden ja resoluution vuoksi.

Esimerkkejä neuronilisäksi ‘tuotteen sijoittelusta’. Ole hyvä ja tarkastele PDF:ää paremman yksityiskohtaisuuden ja resoluution vuoksi.

Tästä kierroksesta tutkijat toteavat:

‘Tulokset osoittavat, että HunyuanCustom säilyttää tehokkaasti ihmisen identiteetin, säilyttäen samalla tuotteen yksityiskohtia, mukaan lukien tekstin siinä, ja vuorovaikutus ihmisen ja tuotteen kanssa näyttää luonnolliselta, ja video noudattaa annettua viestiä, korostaa merkittävästi HunyuanCustomin potentiaalia mainosvideoiden luomisessa.’

‘Lisäksi, vuorovaikutus ihmisen ja tuotteen kanssa näyttää luonnolliselta, ja video noudattaa annettua viestiä, korostaa merkittävästi HunyuanCustomin potentiaalia mainosvideoiden luomisessa.’

Yksi alue, jossa videotulokset olisivat olleet erittäin hyödyllisiä, oli laadullinen kierros ääniohjatusta kohteen kustomoinnista, jossa hahmo puhuu vastaavaa ääntä tekstikuvattuna skenaariosta ja asennosta.

Osittaiset tulokset äänikierroksesta – vaikka videotulokset olisivat olleet mieluisampia tässä tapauksessa. Vain yläosa PDF-kuvaa on toistettu tässä, koska se on suuri ja vaikea sovittaa tähän artikkeliin. Ole hyvä ja tarkastele lähdetiedostoa paremman yksityiskohtaisuuden ja resoluution vuoksi.

Osittaiset tulokset äänikierroksesta – vaikka videotulokset olisivat olleet mieluisampia tässä tapauksessa. Ole hyvä ja tarkastele lähdetiedostoa paremman yksityiskohtaisuuden ja resoluution vuoksi.

Tutkijat toteavat:

‘Aiemmat ääniohjatut ihmisen animaatiomenetelmät ottavat ihmisen kuvan ja äänen, jossa ihmisen asento, vaatetus ja ympäristö säilytetään annetun kuvan mukaisina, eivätkä ne voi luoda videoita, jotka poikkeavat annetusta kuvasta, mikä saattaa [rajoittaa] niiden soveltamista.

‘… [Meidän] HunyuanCustom mahdollistaa ääniohjatun ihmisen kustomoinnin, jossa hahmo puhuu vastaavaa ääntä tekstikuvattuna skenaariossa ja asennossa, sallien enemmän joustavaa ja ohjattavaa ääniohjattua ihmisen animaatiota.’

Lisäksi tehtiin kokeilu, jossa uusi järjestelmä asetettiin vastakkain VACE:en ja Kling 1.6:een videokohteen korvaamisessa videosta-videoon -tilassa:

Kohteen korvaaminen videosta-videoon -tilassa. Ole hyvä ja tarkastele lähdetiedostoa paremman yksityiskohtaisuuden ja resoluution vuoksi.

Kohteen korvaaminen videosta-videoon -tilassa. Ole hyvä ja tarkastele lähdetiedostoa paremman yksityiskohtaisuuden ja resoluution vuoksi.

Näistä viimeisistä kokeiluista, jotka esitetään uudessa tutkimuksessa, tutkijat toteavat:

‘VACE kärsii reunojen artefakteista tiukasti noudattaen syötteen maskeja, johtaa epäluonnollisiin kohteen muotoihin ja rikkoo liikkeen jatkuvuuden. [Kling] taas esittää kopioi-pasta -vaikutusta, jossa kohteet ovat suoraan päällystetty videoon, johtaa huonoon integrointiin taustan kanssa.

‘Vastakkain, HunyuanCustom välttää reunojen artefakteja, saavuttaa vaivattoman integroinnin videotaustan kanssa, ja säilyttää vahvan identiteetin säilyttämisen – osoittaen sen ylivoimaisen suorituskyvyn videon muokkaustöissä.’

Johtopäätös

Tämä on mielenkiintoinen julkaisu, ei vähiten siksi, että se käsittelee jotain, mistä iäkkään harrastajakunnan on valittanut enemmän viime aikoina – lip syncin puutetta, jotta lisääntynyt realismin toteutus järjestelmissä, kuten Hunyuan Video ja Wan 2.1, saataisiin uuden autenttisuuden ulottuvuuden.

Vaikka lähes kaikkien vertailuvideoiden asettelu projektisivulla tekee sen vaikeaksi verrata HunyuanCustomin kykyjä aiempiin kilpailijoihin, on mainittava, että vain harvat projektien video-synteesitilassa ovat rohkeita asettamaan itsensä testeihin Klingiä, kaupallista videodiffuusiota vastaan, joka on aina lähellä tai huipulla johtavuustilastoissa; Tencent näyttää tehneen edistystä tämän vakiintuneen kilpailijan vastaisessa taistelussa melko vaikuttavalla tavalla.

 

* Ongelmana on, että jotkut videot ovat niin leveitä, lyhyitä ja korkearesoluutioisia, ettei niitä voida toistaa standardivideosoittimilla, kuten VLC:llä tai Windows Media Playerilla, näyttäen mustia ruutuja.

Julkaistu torstaina, 8. toukokuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai