Andersons vinkel

HunyuanCustom Medför Enkelbildsvideo Deepfakes, Med Ljud Och Läppsynk

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Denna artikel diskuterar en ny version av en multimodal Hunyuan Video-världmodell som kallas “HunyuanCustom”. Den nya artikeln omfattar ett brett spektrum av ämnen, kombinerat med flera problem i många av de tillhandahållna exempelvideorna på projektsidan*, vilket begränsar oss till en mer allmän täckning än vanligt, och till en begränsad reproduktion av den enorma mängd videomaterial som medföljer denna version (eftersom många av videorna kräver betydande omredigering och bearbetning för att förbättra läsbarheten i layouten).

Observera dessutom att artikeln hänvisar till den API-baserade generativa systemet Kling som “Keling”. För tydlighetens skull hänvisar jag till “Kling” istället genom hela artikeln.

 

Tencent är i färd med att släppa en ny version av sin Hunyuan Video-modell, med titeln HunyuanCustom. Den nya versionen verkar kunna göra Hunyuan LoRA-modeller redundant, genom att tillåta användaren att skapa “deepfake”-liknande videoanpassning genom en enda bild:

Klicka för att spela upp. Prompt: ‘En man lyssnar på musik och lagar snigelnudlar i köket’. Den nya metoden jämförs med både slutna och öppna källkodsmetoder, inklusive Kling, som är en betydande motståndare i detta område. Källa: https://hunyuancustom.github.io/ (varning: CPU/minneskrävande sida!)

I den vänstra kolumnen i videon ovan ser vi den enskilda källbilden som tillhandahålls till HunyuanCustom, följt av systemets tolkning av prompten i den andra kolumnen bredvid. De återstående kolumnerna visar resultaten från olika proprietära och FOSS-system: Kling; Vidu; Pika; Hailuo; och Wan-baserad SkyReels-A2.

I videon nedan ser vi renderingar av tre scenarier som är viktiga för denna version: respektive, person + objekt; enkelkaraktärsemulation; och virtuell provning (person + kläder):

Klicka för att spela upp. Tre exempel redigerade från materialet på den stödjande webbplatsen för Hunyuan Video.

Vi kan notera några saker från dessa exempel, mest relaterade till att systemet förlitar sig på en enda källbild, istället för flera bilder av samma ämne.

I den första klippen står mannen i princip fortfarande vänd mot kameran. Han sänker huvudet nedåt och åt sidan i inte mer än 20-25 graders rotation, men vid en lutning som överstiger detta, skulle systemet verkligen behöva börja gissa hur han ser ut i profil. Detta är svårt, förmodligen omöjligt att bedöma korrekt från en enda framsidig bild.

I det andra exemplet ser vi att den lilla flickan ler i den renderade videon, såsom hon gör i den enskilda statiska källbilden. Återigen, med denna enskilda bild som referens, skulle HunyuanCustom behöva göra en relativt oinformerad gissning om hur hennes “vilaansikte” ser ut. Dessutom avviker hennes ansikte inte från kameravändning mer än i det föregående exemplet (“mannen äter chips”).

I det sista exemplet ser vi att eftersom källmaterialet – kvinnan och kläderna hon är utrustad med – inte är kompletta bilder, har renderingen beskuret scenariot för att passa – vilket faktiskt är en ganska bra lösning på ett dataproblem!

Det viktiga är att även om det nya systemet kan hantera flera bilder (såsom person + chips eller person + kläder), verkar det inte tillåta flera vinklar eller alternativa vyerna av en enskild karaktär, så att olika uttryck eller ovanliga vinklar kunde åtföljas. I denna utsträckning kan systemet eventuellt ha svårt att ersätta den växande ekosystemen av LoRA-modeller som har uppstått runt HunyuanVideo sedan dess release i december, eftersom dessa kan hjälpa HunyuanVideo att producera konsekventa karaktärer från alla vinklar och med alla ansiktsuttryck som representeras i träningsdatasetet (20-60 bilder är typiskt).

Trådad för Ljud

För ljud använder HunyuanCustom LatentSync-systemet (som är notoriskt svårt för hobbyister att konfigurera och få bra resultat från) för att få läpprörelser som matchar ljud och text som användaren tillhandahåller:

Ljud. Klicka för att spela upp. Flertalet exempel på läppsynk från HunyuanCustoms tilläggswebbplats, redigerade tillsammans.

Vid tidpunkten för skrivande finns det inga engelskspråkiga exempel, men dessa verkar vara ganska bra – desto mer om metoden för att skapa dem är lätt att installera och komma åt.

Redigering av Befintlig Video

Det nya systemet erbjuder vad som verkar vara mycket imponerande resultat för video-till-video (V2V, eller Vid2Vid) redigering, där en del av en befintlig (verklig) video maskeras av och intelligently ersätts av ett ämne som ges i en enskild referensbild. Här är ett exempel från den tilläggswebbplatsen:

Klicka för att spela upp. Bara det centrala föremålet är måltavla, men det som förblir runt det ändras också i en HunyuanCustom vid2vid-pass.

Som vi kan se, och som är standard i en vid2vid-scenario, ändras hela videon i någon utsträckning av processen, även om den ändras mest i den måltavlaområdet, d.v.s. den mjuka leksaken. Förmodligen kunde pipelines utvecklas för att skapa sådana transformationer under en skräpmatte-tillvägagångssätt som lämnar den stora majoriteten av videoinnehållet identiskt med originalet. Detta är vad Adobe Firefly gör under huven, och gör ganska bra – men det är en understuderad process i FOSS-genereringsscenen.

Det mesta av de alternativa exemplen som tillhandahålls gör ett bättre jobb med att rikta in sig på dessa integrationer, som vi kan se i den sammansatta samlingen nedan:

Klicka för att spela upp. Diverse exempel på injicerat innehåll med hjälp av vid2vid i HunyuanCustom, som visar en anmärkningsvärd respekt för det omålade materialet.

En Ny Början?

Detta initiativ är en utveckling av Hunyuan Video-projektet, inte en hård vändning bort från den utvecklingsströmmen. Projektets förbättringar introduceras som diskreta arkitektoniska införanden snarare än svepande strukturändringar, i syfte att tillåta modellen att upprätthålla identitetstrohet över ramarna utan att förlita sig på ämnesspecifik finjustering, som med LoRA eller textuell inversionstillvägagångssätt.

För att vara tydlig, alltså, är HunyuanCustom inte tränad från scratch, utan snarare en finjustering av HunyuanVideo grundmodellen från december 2024.

De som har utvecklat HunyuanVideo LoRAs kan undra om de fortfarande kommer att fungera med denna nya version, eller om de kommer att behöva uppfinna LoRA-hjulet igen om de vill ha mer anpassningsförmåga än vad som är inbyggt i denna nya version.

I allmänhet ändrar en tungt finjusterad version av en hyperskalemodell modellvikterna tillräckligt för att LoRAs som skapats för den tidigare modellen inte kommer att fungera korrekt, eller alls, med den nyslipade modellen.

Ibland, dock, kan en finjusterings popularitet utmana dess ursprung: ett exempel på en finjustering som blir en effektiv gren, med en dedikerad ekosystem och följare på egen hand, är Pony Diffusion-finjusteringen av Stable Diffusion XL (SDXL). Pony har för närvarande 592 000+ nedladdningar på CivitAI-domänen, med ett stort antal LoRAs som har använt Pony (och inte SDXL) som basmodell, och som kräver Pony vid inferenstid.

Släpp

Projektsidan för den nya artikeln (som har titeln HunyuanCustom: En multimodal driven arkitektur för anpassad videogenerering) innehåller länkar till en GitHub-sida som, när jag skriver, just har blivit funktionsduglig, och verkar innehålla all kod och nödvändiga vikter för lokal implementering, tillsammans med en föreslagen tidsplan (där den enda viktiga sak som fortfarande är på gång är ComfyUI-integration).

Vid tidpunkten för skrivande är projektets Hugging Face-närvaro fortfarande en 404. Det finns dock en API-baserad version av var man kan demo-systemet, så länge man kan tillhandahålla en WeChat-scan-kod.

Jag har sällan sett en sådan omfattande och extensiv användning av så många projekt i en enda montering, som är tydlig i HunyuanCustom – och förmodligen skulle några av licenserna i alla fall kräva en fullständig release.

Två modeller meddelas på GitHub-sidan: en 720px1280px-version som kräver 8 GB GPU-peakhågkomst, och en 512px896px-version som kräver 60 GB GPU-peakhågkomst.

Repositoriet anger ‘Den minsta GPU-minnet som krävs är 24 GB för 720px1280px129f men är mycket långsamt… Vi rekommenderar att du använder en GPU med 80 GB minne för bättre genereringskvalitet’ – och upprepar att systemet endast har testats på Linux hittills.

Den tidigare Hunyuan Video-modellen har, sedan den officiella releasen, kvantiserats ned till storlekar där den kan köras på mindre än 24 GB VRAM, och det verkar rimligt att anta att den nya modellen också kommer att anpassas till mer konsumentvänliga former av samhället, och att den snabbt kommer att anpassas för användning på Windows-system också.

På grund av tidsbegränsningar och den överväldigande mängden information som medföljer denna version, kan vi endast ta en bredare, snarare än en djupare, titt på denna version. Trots detta, låt oss titta under huven på HunyuanCustom lite.

En Titt på Artikeln

Data-pipelinen för HunyuanCustom, som tydligen är förenlig med GDPR-ramverket, inkorporerar både syntetiserade och öppen källkods-videodatasets, inklusive OpenHumanVid, med åtta kärnkategorier representerade: människor, djur, växter, landskap, fordon, objekt, arkitektur, och anime.

Från den släppta artikeln, en översikt av de olika bidragande paketen i HunyuanCustoms datakonstruktionspipeline. Källa: https://arxiv.org/pdf/2505.04512

Från den släppta artikeln, en översikt av de olika bidragande paketen i HunyuanCustoms datakonstruktionspipeline. Källa: https://arxiv.org/pdf/2505.04512

Initial filtrering börjar med PySceneDetect, som segmenterar videor i enkelskottsklipp. TextBPN-Plus-Plus används sedan för att ta bort videor som innehåller överdrivet text på skärmen, undertexter, vattenstämplar eller logotyper.

För att hantera inkonsekvenser i upplösning och varaktighet standardiseras klippen till fem sekunder i längd och återstorleks till 512 eller 720 pixlar på den korta sidan. Estetisk filtrering hanteras med hjälp av Koala-36M, med en anpassad tröskel på 0,06 tillämpad för det anpassade dataset som curerats av artikelförfattarna.

Ämnesextraktionsprocessen kombinerar Qwen7B Large Language Model (LLM), YOLO11X objektigenkänningsramverk, och den populära InsightFace-arkitekturen, för att identifiera och validera mänskliga identiteter.

För icke-mänskliga ämnen används QwenVL och Grounded SAM 2 för att extrahera relevanta begränsningsrutor, som kasseras om de är för små.

Exempel på semantisk segmentering med Grounded SAM 2, som används i Hunyuan Control-projektet. Källa: https://github.com/IDEA-Research/Grounded-SAM-2

Exempel på semantisk segmentering med Grounded SAM 2, som används i Hunyuan Control-projektet. Källa: https://github.com/IDEA-Research/Grounded-SAM-2

Multi-ämnesextraktion använder Florence2 för begränsningsrute-annotation, och Grounded SAM 2 för segmentering, följt av kluster och tidssegmentering av träningsramar.

De bearbetade klippen förbättras ytterligare via annotation, med hjälp av ett proprietärt strukturerat märkningsystem som utvecklats av Hunyuan-teamet, och som tillhandahåller lager-metadaten som beskrivningar och kamerarörelse-hints.

Mask-förstärkningsstrategier, inklusive omvandling till begränsningsrutor, tillämpades under träningsprocessen för att minska överanpassning och säkerställa att modellen anpassar sig till olika objektsformer.

Ljuddata synkroniserades med hjälp av den ovannämnda LatentSync, och klipp kasserades om synkroniseringspoängen understeg en minimigräns.

Den blinda bildkvalitetsbedömningsramverket HyperIQA användes för att utesluta videor som poängsattes under 40 (på HyperIQA:s egen skala). Giltiga ljudspår bearbetades sedan med Whisper för att extrahera funktioner för efterföljande uppgifter.

Författarna inkorporerar LLaVA språkhjälpsmodell under annoteringsfasen, och de betonar den centrala position som detta ramverk har i HunyuanCustom. LLaVA används för att generera bildbeskrivningar och för att hjälpa till att justera visuellt innehåll med textprompten, och stödjer konstruktionen av en sammanhängande träningsignal över modaliteter:

HunyuanCustom-ramverket stödjer identitet-konsekvent videogenerering som villkorsstyrs av text-, bild-, ljud- och videoinmatningar.

HunyuanCustom-ramverket stödjer identitet-konsekvent videogenerering som villkorsstyrs av text-, bild-, ljud- och videoinmatningar.

Genom att utnyttja LLaVA:s vision-språksjusteringsförmåga, vinner pipelinen en ytterligare lager av semantisk konsekvens mellan visuella element och deras textbeskrivningar – särskilt värdefullt i multi-ämnes- eller komplexa scenariotyper.

Anpassad Video

För att tillåta videogenerering baserad på en referensbild och en prompt, skapades de två modulerna som centrerades kring LLaVA, först genom att anpassa indatastrukturen för HunyuanVideo så att den kunde acceptera en bild tillsammans med text.

Detta involverade formatering av prompten på ett sätt som inbäddar bilden direkt eller märker den med en kort identitetsbeskrivning. En separator-token användes för att förhindra att bildinbäddningen överväldigade promptinnehållet.

Eftersom LLaVA:s visuella encoder tenderar att komprimera eller kasta bort fina rumsliga detaljer under justeringen av bild- och textfunktioner (särskilt när man översätter en enskild referensbild till en allmän semantisk inbäddning), infördes en identitetshöjningsmodul. Eftersom nästan alla video-latentdiffusionsmodeller har svårt att upprätthålla en identitet utan en LoRA, även i en femsekundersklipp, kan prestationen hos denna modul i samhällets testning visa sig vara betydande.

I alla fall återstorleks referensbilden och kodas med den kausala 3D-VAE från den ursprungliga HunyuanVideo-modellen, och dess latenta införs i videolatenten över den tidsaxeln, med en rumslig offset tillämpad för att förhindra att bilden återges direkt i utmatningen, samtidigt som den fortfarande styr genereringen.

Modellen tränades med Flow Matching, med brusprover dragna från en logit-normal distribution – och nätverket tränades för att återställa den korrekta videon från dessa brusiga latenter. LLaVA och videogenereringen finjusterades tillsammans så att bilden och prompten kunde styra utmatningen mer flytande och upprätthålla ämnesidentiteten konsekvent.

För multi-ämnesprompter inbäddades varje bild-textpar separat och tilldelades en distinkt tidsposition, vilket möjliggjorde att identiteter kunde särskiljas, och stödde genereringen av scener som innehåller flera interagerande ämnen.

Ljud och Syn

HunyuanCustom villkorar ljud/talgenerering med hjälp av både användarindata-ljud och en textprompt, vilket möjliggör för karaktärer att tala inom scener som återspeglar den beskrivna miljön.

För att stödja detta introducerades en Identitet-disassocierad AudioNet-modul som inför ljudfunktioner utan att störa identitetssignalerna inbäddade från referensbilden och prompten. Dessa funktioner justeras med den komprimerade videotidslinjen, delas in i ramnivåsegment, och injiceras med hjälp av en rumslig cross-attention-mekanism som håller varje ram isolerad, vilket bevarar ämneskonsekvens och undviker tidsmässig interferens.

En andra tidsinjektionsmodul tillhandahåller en finare kontroll över timing och rörelse, som fungerar i tandem med AudioNet, och kartlägger ljudfunktioner till specifika regioner i den latenta sekvensen, och använder en Multi-Layer Perceptron (MLP) för att konvertera dem till token-vis rörelseförskjutningar. Detta möjliggör att gester och ansiktsrörelser följer rytm och betoning i det talade inmatningsmaterialet med större precision.

HunyuanCustom tillåter ämnen i befintliga videor att redigeras direkt, genom att ersätta eller infoga människor eller föremål i en scen utan att behöva bygga om hela klippet från scratch. Detta gör det användbart för uppgifter som innefattar att ändra utseende eller rörelse på ett målinriktat sätt.

Klicka för att spela upp. Ett ytterligare exempel från den tilläggswebbplatsen.

För att underlätta effektiv ämnesersättning i befintliga videor undviker det nya systemet den resurskrävande tillvägagångssättet som används av metoder som den för närvarande populära VACE, eller de som sammanfogar hela videosekvenser, och föredrar istället komprimering av en referensvideo med den förtränade kausala 3D-VAE – och justerar den med genereringspipelens interna videolatenter, och sedan lägger till de två tillsammans. Detta håller processen relativt lätt, samtidigt som det tillåter externt videoinnehåll att styra utmatningen.

En liten neural nätverks hanterar justeringen mellan den rena indata-videon och de brusiga latenter som används i generering. Systemet testar två sätt att injicera denna information: sammanfogning av de två uppsättningarna av funktioner innan de komprimeras igen; och tillägg av funktionerna ram för ram. Den senare metoden fungerar bättre, enligt författarna, och undviker kvalitetsförlust samtidigt som den håller den beräkningsmässiga belastningen oförändrad.

Data och Tester

I tester användes följande mått: identitet-konsekvensmodulen i ArcFace, som extraherar ansiktsinbäddningar från både referensbilden och varje ram i den genererade videon, och sedan beräknar den genomsnittliga kosinlikheten mellan dem; ämneslikhet, via att skicka YOLO11x-segment till Dino 2 för jämförelse; CLIP-B, text-video-justering, som mäter likheten mellan prompten och den genererade videon; CLIP-B igen, för att beräkna likheten mellan varje ram och både dess grannramar och den första ramen, samt tidsmässig konsekvens; och dynammäte, som definieras av VBench.

Som tidigare nämnts, var de slutna källkods-konkurrenterna Hailuo; Vidu 2.0; Kling (1.6); och Pika. De konkurrerande FOSS-ramverken var VACE och SkyReels-A2.

Modellprestanda utvärdering som jämför HunyuanCustom med ledande videokustomiseringsmetoder över ID-konsekvens (Face-Sim), ämneslikhet (DINO-Sim), text-video-justering (CLIP-B-T), tidsmässig konsekvens (Temp-Consis), och rörelseintensitet (DD). Optimala och underoptimala resultat visas i fetstil respektive understruket.

Modellprestanda utvärdering som jämför HunyuanCustom med ledande videokustomiseringsmetoder över ID-konsekvens (Face-Sim), ämneslikhet (DINO-Sim), text-video-justering (CLIP-B-T), tidsmässig konsekvens (Temp-Consis), och rörelseintensitet (DD). Optimala och underoptimala resultat visas i fetstil respektive understruket.

Av dessa resultat säger författarna:

‘Vår [HunyuanCustom] uppnår den bästa ID-konsekvensen och ämneskonsekvensen. Den uppnår också jämförbara resultat i promptföljande och tidsmässig konsekvens. [Hailuo] har den bästa klippscoren eftersom den kan följa textinstruktioner bra med endast ID-konsekvens, och offrar konsekvensen för icke-mänskliga ämnen (den sämsta DINO-Sim). I fråga om dynamisk mätning presterar [Vidu] och [VACE] dåligt, vilket kan bero på den lilla storleken på modellen.’

Även om projektwebbplatsen är mättad med jämförelsevideos (vars layout verkar ha designats för webbplats-estetik snarare än enkel jämförelse), innehåller den för närvarande inte en videoliknande version av de statiska resultaten som är hoptryckta i PDF:en, i fråga om de initiala kvalitativa testerna. Även om jag inkluderar det här, uppmuntrar jag läsaren att göra en noggrann undersökning av videorna på projektwebbplatsen, eftersom de ger en bättre intryck av resultaten:

Från artikeln, en jämförelse av objektorienterad videokustomisering. Även om läsaren bör (som alltid) hänvisa till käll-PDF:en för bättre upplösning, kan videorna på projektwebbplatsen vara en mer upplysande resurs i detta fall.

Från artikeln, en jämförelse av objektorienterad videokustomisering. Även om läsaren bör (som alltid) hänvisa till käll-PDF:en för bättre upplösning, kan videorna på projektwebbplatsen vara en mer upplysande resurs i detta fall.

Författarna kommenterar här:

‘Det kan ses att [Vidu], [Skyreels A2] och vår metod uppnår relativt bra resultat i promptjustering och ämneskonsekvens, men vår videokvalitet är bättre än Vidu och Skyreels, tack vare den bra videogenereringsprestandan i vår basmodell, d.v.s. [Hunyuanvideo-13B].

‘Bland kommersiella produkter, även om [Kling] har en bra videokvalitet, har den första ramen i videon ett copy-paste-problem, och ibland rör sig ämnet för snabbt och [suddas ut], vilket leder till en dålig visningsupplevelse.’

Författarna påpekar dessutom att Pika presterar dåligt i fråga om tidsmässig konsekvens, och introducerar undertextsartefakter (effekter från dålig datakurering, där textelement i videoklipp har tillåtits att förorena de grundläggande koncepten).

Hailuo upprätthåller ansiktsidentitet, enligt författarna, men misslyckas med att bevara fullständig kroppskonsekvens. Bland öppen källkods-metoder påstår forskarna att VACE är oförmögen att upprätthålla identitetskonsekvens, medan de hävdar att HunyuanCustom producerar videor med stark identitetbevarande, samtidigt som den behåller kvalitet och mångfald.

Sedan genomfördes tester för multi-ämnes-videokustomisering mot samma motståndare. Som i det tidigare exemplet är de platta PDF-resultaten inte utskriftsliknande versioner av videor som finns tillgängliga på projektwebbplatsen, men är unika bland de presenterade resultaten:

Jämförelser med hjälp av multi-ämnes-videokustomisering. Var vänlig och se PDF:en för bättre detalj och upplösning.

Jämförelser med hjälp av multi-ämnes-videokustomisering. Var vänlig och se PDF:en för bättre detalj och upplösning.

Artikeln påstår:

‘[Pika] kan generera de angivna ämnena men visar instabilitet i videoramarna, med exempel på en man som försvinner i ett scenario och en kvinna som misslyckas med att öppna en dörr som promptats. [Vidu] och [VACE] fångar delvis mänsklig identitet men förlorar betydande detaljer om icke-mänskliga föremål, vilket indikerar en begränsning i att representera icke-mänskliga ämnen.

‘[SkyReels A2] upplever allvarlig raminstabilitet, med märkbara förändringar i chips och många artefakter i det högra scenariot.

‘I kontrast till det fångar vår HunyuanCustom effektivt både mänsklig och icke-mänsklig identitet, genererar videor som följer de givna prompterna, och upprätthåller hög visuell kvalitet och stabilitet.’

Ett ytterligare experiment var “virtuell mänsklig reklam”, där ramverken fick i uppgift att integrera en produkt med en person:

Från den kvalitativa testrundan, exempel på neural “produktplacering”. Var vänlig och se PDF:en för bättre detalj och upplösning.

För denna runda påstår författarna:

‘Resultaten visar att HunyuanCustom effektivt upprätthåller identiteten hos den mänskliga medan den bevarar detaljerna i målprodukten, inklusive texten på den.

‘Dessutom verkar interaktionen mellan den mänskliga och produkten naturlig, och videon följer prompten mycket nära, vilket betonar den betydande potentialen hos HunyuanCustom för att generera reklamvideor.’

Ett område där videoresultat skulle ha varit mycket användbara var den kvalitativa rundan för ljudstyrd ämnesanpassning, där karaktären talar den motsvarande ljudet från en textbeskriven scen och hållning.

Delresultat som ges för ljudrundan – även om videoresultat skulle ha varit att föredra i detta fall. Endast den övre halvan av PDF-figuren återges här, eftersom den är stor och svår att anpassa i denna artikel. Var vänlig och se käll-PDF:en för bättre detalj och upplösning.

Delresultat som ges för ljudrundan – även om videoresultat skulle ha varit att föredra i detta fall. Endast den övre halvan av PDF-figuren återges här, eftersom den är stor och svår att anpassa i denna artikel. Var vänlig och se käll-PDF:en för bättre detalj och upplösning.

Författarna påstår:

‘Tidigare ljudstyrda mänskliga animationsmetoder kräver en mänsklig bild och ett ljud, där den mänskliga hållningen, kläder och miljön förblir konsekventa med den givna bilden och inte kan generera videor i andra gester och miljöer, vilket kan begränsa deras tillämpning.

‘…[Vår] HunyuanCustom möjliggör ljudstyrd mänsklig anpassning, där karaktären talar det motsvarande ljudet i en textbeskriven scen och hållning, vilket tillåter mer flexibel och kontrollerbar ljudstyrd mänsklig animation.’

Ytterligare tester (se PDF:en för alla detaljer) inkluderade en runda som satte det nya systemet mot VACE och Kling 1.6 för videokustomisering av ämnen:

Testning av ämnesersättning i video-till-video-läge. Var vänlig och se käll-PDF:en för bättre detalj och upplösning.

Testning av ämnesersättning i video-till-video-läge. Var vänlig och se käll-PDF:en för bättre detalj och upplösning.

Av dessa, de sista testerna som presenteras i den nya artikeln, anser forskarna:

‘VACE lider av gränsartefakter på grund av strikt följsamhet till indata-masker, vilket resulterar i onaturliga ämnesformer och störd rörelsekontinuitet. [Kling], å andra sidan, visar en copy-paste-effekt, där ämnen direkt läggs över videon, vilket leder till dålig integration med bakgrunden.

‘I jämförelse undviker HunyuanCustom gränsartefakter, uppnår sömlös integration med videobakgrunden och upprätthåller stark identitetbevarande – vilket visar dess överlägsna prestanda i videoredigeringsuppgifter.’

Slutsats

Detta är en fascinerande version, inte minst eftersom den tar itu med något som den alltid otillfredsställda hobbyist-scenen har klagat på mer nyligen – bristen på läppsynk, så att den ökade realism som är möjlig i system som Hunyuan Video och Wan 2.1 kan ges en ny dimension av autenticitet.

Även om layouten på nästan alla jämförelsevideor på projektwebbplatsen gör det ganska svårt att jämföra HunyuanCustoms förmågor mot tidigare motståndare, måste det noteras att mycket få projekt i videosyntesområdet har mod att ställa sig i tester mot Kling, den kommersiella videodiffusions-API som alltid svävar runt eller nära toppen av ledarlistorna; Tencent verkar ha gjort framsteg mot denna etablerade motståndare på ett ganska imponerande sätt.

 

* Problemet är att vissa av videorna är så breda, korta och högupplösta att de inte kan spelas upp i standardvideospelare som VLC eller Windows Media Player, och visar svarta skärmar.

Publicerad första gången torsdagen den 8 maj 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai