Andersonův úhel
HunyuanCustom Přináší Video Deepfakes Založené Na Jedné Obrázky, S Audio A Lip Sync

Tento článek diskutuje o novém vydání multimodálního modelu Hunyuan Video nazvaného ‘HunyuanCustom’. Šíře pokrytí nového článku, kombinovaná s několika problémy v mnoha z dodaných ukázkových videích na projektové stránce*, omezuje nás na obecnější pokrytí než obvykle a na omezenou reprodukci огромného množství videomateriálu, který doprovází toto vydání (protože mnoho z videí vyžaduje významné přeeditování a zpracování, aby se zlepšila čitelnost rozložení).
Dále si všimněte, že článek se odkazuje na API-založený generativní systém Kling jako ‘Keling’. Pro jasnost se odkážu na ‘Kling’ po celou dobu.
Tencent je v procesu vydávání nové verze svého modelu Hunyuan Video, nazvaného HunyuanCustom. Nové vydání je zřejmě schopné učinit Hunyuan LoRA modely zbytečnými, umožňující uživateli vytvářet ‘deepfake’-style video přizpůsobení prostřednictvím jedné obrazovky:
Klikněte pro přehrávání. Prompt: ‘Muž poslouchá hudbu a vaří šneky v kuchyni’. Nová metoda se porovnává s uzavřeným a otevřeným zdrojovým kódem, včetně Kling, který je významným soupeřem v tomto prostoru. Source: https://hunyuancustom.github.io/ (varování: CPU/paměťově náročná stránka!)
V levém sloupci videa výše vidíme jednu zdrojovou obrazovku dodanou HunyuanCustom, následovanou novým systémem interpretace promptu ve druhém sloupci, vedle něj. Zbývající sloupce ukazují výsledky z různých proprietárních a FOSS systémů: Kling; Vidu; Pika; Hailuo; a Wan-based SkyReels-A2.
V dalším videu vidíme renderování tří scénářů, které jsou pro toto vydání nezbytné: resp. osoba + objekt; single-character emulace; a virtuální vyzkoušení (osoba + oblečení):
Klikněte pro přehrávání. Tři příklady upravené z materiálu na podpůrné stránce pro Hunyuan Video.
Můžeme si všimnout několika věcí z těchto příkladů, většinou souvisejících se systémem, který se spoléhá na jednu zdrojovou obrazovku, místo mnoha obrazovek stejného subjektu.
V prvním klipu je muž prakticky stále čelem kamerou. Naklání hlavu dolů a do strany o něco více než 20-25 stupňů rotace, ale při sklonu nad tento rozsah by systém musel opravdu začít hádat, jak vypadá v profilu. To je těžké, pravděpodobně nemožné přesně určit z jediné frontální obrazovky.
V druhém příkladu vidíme, že malé děvče je usmívající se v renderovaném videu, stejně jako na jediné statické zdrojové obrazovce. Opět, s touto jedinou obrazovkou jako referencí, by HunyuanCustom musel učinit relativně neinformované odhady o tom, jak vypadá její ‘klidná tvář’. Kromě toho její tvář se neodchyluje od kamery čelem více než v předchozím příkladu (‘muž jedí chipsy’).
V posledním příkladu vidíme, že protože zdrojový materiál – žena a oblečení, které je.promptováno – nejsou kompletní obrazy, renderoval scénář tak, aby se vešel – což je vlastně docela dobré řešení problému s daty!
Bod je, že i když nový systém může zpracovat mnoho obrazovek (jako osoba + chipsy, nebo osoba + oblečení), neumožňuje multiple úhly nebo alternativní pohledy jedné osoby, takže rozmanité výrazy nebo neobvyklé úhly nemohou být akomodovány. To znamená, že systém může mít potíže s nahrazením rostoucího ekosystému LoRA modelů, které se objevily kolem HunyuanVideo od jeho vydání v prosinci, protože tyto modely mohou pomoci HunyuanVideo produkovat konzistentní postavy z libovolného úhlu a s libovolným výrazem obličeje reprezentovaným v trénovacím datasetu (20-60 obrazovek je typické).
Propojené se Zvukem
Pro audio HunyuanCustom využívá LatentSync systém (notoricky těžké pro hobbyisty nastavit a získat dobré výsledky) pro získání pohybů rtů, které jsou sladěny s audio a textem, který uživatel poskytuje:
Klikněte pro přehrávání. Různé příklady lip-sync z HunyuanCustom doplňkové stránky, upravené dohromady.
V době psaní tohoto článku nejsou k dispozici žádné anglické příklady, ale tyto se zdají být bastante dobré – tím více, pokud je metoda jejich vytváření snadno instalovatelná a přístupná.
Úprava Existujících Videí
Nový systém nabízí velmi působivé výsledky pro video-na-video (V2V, nebo Vid2Vid) úpravu, kdy je segment existujícího (reálného) videa maskován a inteligentně nahrazen subjektem zadaným v jediné referenční obrazovce. Níže je příklad z doplňkové stránky:
Klikněte pro přehrávání. Pouze centrální objekt je cílem, ale co zůstává kolem něj, se také změní v HunyuanCustom vid2vid průchodu.
Jak můžeme vidět, a jak je standardní v vid2vid scénáři, celé video je do jisté míry změněno procesem, i když nejvíce změněno v cílené oblasti, tj. v plyšovém hračku. Předpokladem je, že potrubí by mohly být vyvinuty pro vytvoření takových transformací pod garbage matte přístup, který ponechává většinu videoobsahu identické s originálem. To je to, co Adobe Firefly dělá pod kapotou, a dělá to bastante dobře – ale je to podhodnocený proces v FOSS generativním scénáři.
To řečeno, většina alternativních příkladů poskytnutých dělá lepší práci při cílení těchto integrací, jak můžeme vidět v sestaveném souboru níže:
Klikněte pro přehrávání. Různé příklady vkládání obsahu pomocí vid2vid v HunyuanCustom, ukazující pozoruhodný respekt k necílenému materiálu.
Nový Start?
Tato iniciativa je rozvojem Hunyuan Video projektu, ne tvrdý pivot pryč od tohoto vývojového proudu. Projektové vylepšení jsou představeny jako diskrétní architektonické vložky spíše než rozsáhlé strukturální změny, zaměřené na to, aby model udržel identitu věrnost napříč snímky bez spoléhání se na předmět-specifické jemné ladění, jako u LoRA nebo textové inverze přístupů.
Abyste pochopili, HunyuanCustom není trénován od začátku, ale spíše je jemné ladění prosinec 2024 HunyuanVideo základního modelu.
Ti, kteří vyvinuli HunyuanVideo LoRAs, se mohou divit, zda budou stále fungovat s touto novou edicí, nebo zda budou muset znovu vynalézt LoRA kolo znovu, pokud chtějí více přizpůsobit schopnosti než jsou vestavěny do tohoto nového vydání.
Obecně, silně vyškoleno vydání hyperscale modelu mění modelové váhy dostatečně, aby LoRAs vytvořené pro předchozí model nefungovaly správně, nebo vůbec, s nově rafinovaným modelem.
Sometimes, however, a fine-tune’s popularity can challenge its origins: one example of a fine-tune becoming an effective fork, with a dedicated ecosystem and followers of its own, is the Pony Diffusion tuning of Stable Diffusion XL (SDXL). Pony currently has 592,000+ downloads on the ever-changing CivitAI domain, with a vast range of LoRAs that have used Pony (and not SDXL) as the base model, and which require Pony at inference time.
Vydání
Projektová stránka pro nový článek (který se nazývá HunyuanCustom: Multimodální-Driven Architektura pro Přizpůsobené Video Generaci) obsahuje odkazy na GitHub stránku, která, když píšu, právě začala fungovat, a zdá se, že obsahuje veškerý kód a nezbytné váhy pro lokální implementaci, spolu s navrhovaným časovým rámcem (kde je jediným důležitým věcem, co ještě má přijít, ComfyUI integrace).
V době psaní tohoto článku je projektová přítomnost Hugging Face stále 404. Existuje však API-založená verze, kde můžete zřejmě demonstrovat systém, pokud můžete poskytnout WeChat skenovací kód.
Jsem viděl málo tak rozsáhlého a komplexního použití tak široké škály projektů v jednom sestavení, jako je tomu v HunyuanCustom – a předpokládám, že některé z licencí by v každém případě vyžadovaly plné vydání.
Dva modely jsou oznámeny na GitHub stránce: 720px1280px verze vyžadující 8 GB GPU Peak Paměti, a 512px896px verze vyžadující 60 GB GPU Peak Paměti.
Repozitář uvádí ‘Minimální GPU paměť vyžadovaná je 24 GB pro 720px1280px129f, ale velmi pomalý…Doporučujeme používat GPU s 80 GB paměti pro lepší generaci kvality’ – a opakuje, že systém byl testován pouze na Linuxu.
Předchozí Hunyuan Video model byl, od oficiálního vydání, quantizován dolů na velikosti, kde může být spuštěn na méně než 24 GB VRAM, a zdá se rozumné předpokládat, že nový model bude stejně přizpůsoben do více spotřebitelsky přátelských forem komunitou, a že bude rychle přizpůsoben pro použití na Windows systémech také.
Due to time constraints and the overwhelming amount of information accompanying this release, we can only take a broader, rather than in-depth look at this release. Nonetheless, let’s pop the hood on HunyuanCustom a little.
Pohled na Článek
Data pipeline pro HunyuanCustom, zřejmě kompatibilní s GDPR rámcem, zahrnuje både syntetizované a open-source video dataset, včetně OpenHumanVid, s osmi základními kategoriemi reprezentovanými: lidé, zvířata, rostliny, krásy, vozidla, objekty, architektura, a anime.

Z vydání článku, přehled rozmanitých přispívajících balíčků v HunyuanCustom datovém konstrukčním potrubí. Source: https://arxiv.org/pdf/2505.04512
Počáteční filtrování začíná s PySceneDetect, který segmentuje videa do jednotlivých snímků. TextBPN-Plus-Plus je pak použit k odstranění videí obsahujících nadměrný text na obrazovce, titulky, vodotisky nebo loga.
Pro řešení nekonzistence v rozlišení a délce jsou klipy standardizovány na pět sekund délky a přepočteny na 512 nebo 720 pixelů na kratší straně. Estetické filtrování je zpracováno pomocí Koala-36M, s vlastním prahem 0,06 aplikovaným pro custom dataset zkompilovaný novými výzkumníky.
Proces extrakce subjektu kombinuje Qwen7B Large Language Model (LLM), YOLO11X objektový rozpoznávací rámec, a populární InsightFace architekturu, pro identifikaci a validaci lidských identit.
Pro ne-lidské subjekty jsou QwenVL a Grounded SAM 2 použity k extrakci relevantních bounding boxů, které jsou odstraněny, pokud jsou příliš malé.

Příklady semantické segmentace s Grounded SAM 2, použitými v Hunyuan Control projektu. Source: https://github.com/IDEA-Research/Grounded-SAM-2
Multi-subjekt extrakce využívá Florence2 pro bounding box anotaci, a Grounded SAM 2 pro segmentaci, následovanou clusterováním a temporální segmentací trénovacích snímků.
Zpracované klipy jsou dále vylepšeny prostřednictvím anotace, pomocí proprietárního strukturovaného systémů označování vyvinutého Hunyuan týmem, a který poskytuje vrstvené metadata, jako jsou popisy a kamerové pohybové signály.
Mask augmentation strategie, včetně konverze na bounding boxy, byly aplikovány během trénování, aby se snížila přecenění a zajistila, aby se model přizpůsobil rozmanitým objektovým tvarům.
Audio data byla synchronizována pomocí výše zmíněného LatentSync, a klipy byly odstraněny, pokud synchronizační skóre kleslo pod minimální práh.
Blind image quality assessment framework HyperIQA byl použit k vyloučení videí, které skórovaly pod 40 (na HyperIQA’s speciálním měřítku). Validní audio stopy byly poté zpracovány s Whisper k extrakci funkcí pro downstream úkoly.
Autorům se podařilo začlenit LLaVA jazykový asistenční model během anotační fáze, a zdůrazňují centrální pozici, kterou tento rámec má v HunyuanCustom. LLaVA je použit k generování obrazových popisků a k usnadnění sladění vizuálního obsahu s textovými prompty, podporující konstrukci koherentního trénovacího signálu napříč modality:

HunyuanCustom framework podporuje identitu-konzistentní video generaci podmíněnou textem, obrazem, audio a video vstupy.
Tím, že využívá LLaVA’s vizuální-jazykové sladění schopnosti, potrubí získá další vrstvu semantické konzistence mezi vizuálními prvky a jejich textovými popisky – zejména cennou v multi-subjektových nebo složitých scénářích.
Přizpůsobené Video
Pro umožnění video generace založené na referenční obrazovce a promptu, byly vytvořeny dva moduly kolem LLaVA, nejprve přizpůsobením vstupní struktury HunyuanVideo, aby mohla přijmout obrazovku spolu s textem.
To vyžadovalo formátování promptu způsobem, který vkládá obrazovku přímo nebo ji označuje krátkým identifikačním popisem. Separator token byl použit k zastavení obrazovky z přehlcení promptového obsahu.
Pokud LLaVA’s vizuální kódovací tendence stlačuje nebo zanedbává jemné prostorové detaily během sladění obrazových a textových funkcí (zejména při překladu jediné referenční obrazovky do obecného sémantického vložení), byl začleněn identitní vylepšovací modul. Pokud téměř všechny video latentní difúzní modely mají nějaké potíže s udržením identity bez LoRA, dokonce i v pětisekundovém klipu, výkon tohoto modulu v komunitním testování může být významný.
V každém případě je referenční obrazovka poté přepočtena a zakódována pomocí kauzální 3D-VAE z originálního HunyuanVideo modelu, a jeho latent vložen do video latentního po časové ose, s prostorovým offsetem aplikovaným k zabránění přímé reprodukci obrazovky ve výstupu, zatímco stále řídí generaci.
Model byl trénován pomocí Flow Matching, s hlukovými vzorky vytaženými z logit-normálního rozdělení – a síť byla trénována k obnovení správného videa z těchto hlukových latentních.
Pro multi-subjektové prompty, každá obrazovka-textová dvojice byla vložena samostatně a přiřazena samostatnému časovému umístění, umožňující identifikaci a podporu generace scén s více interagujícími subjekty.
Zvuk a Vize
HunyuanCustom podmíněně generuje audio/reprodukci pomocí uživatelského vstupního audio a textového promptu, umožňující postavám mluvit ve scénách, které odrážejí popsáno nastavení.
Pro podporu toho, Identity-disentangled AudioNet modul zavádí audio funkce bez narušení identifikačních signálů vložených z referenční obrazovky a promptu. Tyto funkce jsou sladěny s komprimovaným video časovým úsekem, rozděleným do snímkových segmentů, a injektovány pomocí prostorového cross-attention mechanismu, který udržuje každý snímek izolovaný, zachovávající subjektovou konzistenci a zamezující temporální interferenci.
Druhý temporální injekční modul poskytuje jemnější kontrolu nad časováním a pohybem, pracující v tandemu s AudioNet, mapující audio funkce na konkrétní oblasti latentní sekvence, a používající Multi-Layer Perceptron (MLP) k jejich konverzi na token-wise pohybové offsety. To umožňuje gesta a obličejové pohyby následovat rytmus a důraz mluveného vstupu s větší přesností.
HunyuanCustom umožňuje subjekty v existujících videích být upraveny přímo, nahrazují nebo vkládají lidi nebo objekty do scény bez nutnosti přestavět celý klip od začátku. To činí jej užitečným pro úkoly, které zahrnují úpravu vzhledu nebo pohybu cíleným způsobem.
Klikněte pro přehrávání. Další příklad z doplňkové stránky.
Pro efektivní nahrazení subjektu v existujících videích se nový systém vyhýbá náročnému přístupu nedávných metod, jako je目前 populární VACE, nebo těch, které slučují celé video sekvence, místo toho preferuje komprimaci referenční videa pomocí předtrénovaného kauzálního 3D-VAE – sladění jej s generovací potrubím vnitřních video latentních, a poté přidání obou. To udržuje proces relativně lehký, zatímco stále umožňuje externí video obsah řídit výstup.
Malá neuronová síť zpracovává sladění mezi čistým vstupním videem a hlukovými latentními používanými při generaci. Systém testuje dva způsoby injektování této informace: slučování obou sad funkcí před komprimací je znovu; a přidávání funkcí snímek po snímku. Druhá metoda funguje lépe, autoři zjistili, a vyhýbá se ztrátě kvality, zatímco udržuje výpočetní zátěž nezměněnou.
Data a Testy
V testech byly použity následující metriky: identita konzistence modul v ArcFace, který extrahuje obličejové vložení z obou referenční obrazovky a každého snímku generovaného videa, a poté vypočítává průměrnou kosinovou podobnost mezi nimi; subjekt podobnost, prostřednictvím posílání YOLO11x segmentů do Dino 2 pro srovnání; CLIP-B, text-video sladění, které měří podobnost mezi promptem a generovaným videem; CLIP-B opět, pro výpočet podobnosti mezi každým snímkem a jeho sousedními snímky a prvním snímkem, stejně jako temporální konzistence; a dynamic degree, definovaný VBench.
Jako uvedeno dříve, baseline uzavřené zdrojové soutěžící byli Hailuo; Vidu 2.0; Kling (1.6); a Pika. Soutěžící FOSS rámce byly VACE a SkyReels-A2.

Modelová výkonová evaluace srovnávající HunyuanCustom s vedoucími video přizpůsobeními metodami napříč ID konzistencí (Face-Sim), subjekt podobností (DINO-Sim), text-video sladění (CLIP-B-T), temporální konzistencí (Temp-Consis), a pohybovou intenzitou (DD). Optimální a suboptimální výsledky jsou ukázány v tučném a podtrženém, resp.
Z těchto výsledků, autoři uvádějí:
‘Naše [HunyuanCustom] dosahuje nejlepší ID konzistence a subjekt konzistence. Dosahuje také srovnatelné výsledky v prompt následování a temporální konzistenci. [Hailuo] má nejlepší clip skóre, protože může následovat textové instrukce dobře s pouze ID konzistencí, obětující konzistenci ne-lidských subjektů (nejhorší DINO-Sim). V případě Dynamické míry, [Vidu] a [VACE] fungují špatně, což může být způsobeno malou velikostí modelu.’
Ačkoli projektová stránka je nasycena srovnávacími videy (jejichž rozložení bylo zřejmě navrženo pro webovou estetiku spíše než pro snadné srovnání), je třeba poznamenat, že velmi málo projektů ve video syntéze prostoru má odvahu postavit se proti Kling, komerční video difúzní API, které je vždy na nebo blízko vrcholu žebříčků; Tencent zdá se, že udělal pokrok proti tomuto etablovanému hráči bastante působivým způsobem.
Závěr
Toto je fascinující vydání, nejméně proto, že se zabývá něčím, o čem se stále více stěžuje komunita – nedostatkem lip-sync, aby se zvýšila realističnost schopná v systémech, jako je Hunyuan Video a Wan 2.1, mohla být dána nová dimenze autenticity.
Although nearly all the comparative video examples at the project site make it rather difficult to compare HunyuanCustom’s capabilities against prior contenders, it must be noted that very, very few projects in the video synthesis space have the courage to pit themselves in tests against Kling, the commercial video diffusion API which is always hovering at or near the top of the leader-boards; Tencent appears to have made headway against this incumbent in a rather impressive manner. * The issue being that some of the videos are so wide, short, and high-resolution that they will not play in standard video players such as VLC or Windows Media Player, showing black screens. First published Thursday, 8. května 2025












