Angolo di Anderson
HunyuanCustom porta video deepfake a immagine singola, con audio e sincronizzazione labiale

Questo articolo discute una nuova versione di un modello di video multimodale Hunyuan chiamato ‘HunyuanCustom’. La vastità della copertura del nuovo documento, combinata con diversi problemi presenti in molti dei video di esempio forniti nel sito del progetto*, ci costringe a una copertura più generale del solito e a una riproduzione limitata della grande quantità di materiale video che accompagna questa versione (poiché molti dei video richiedono una significativa revisione e elaborazione per migliorare la leggibilità del layout).
Si prega inoltre di notare che il documento si riferisce al sistema generativo basato sull’API Kling come ‘Keling’. Per chiarezza, mi riferisco a ‘Kling’ in tutto il testo.
Tencent sta rilasciando una nuova versione del suo modello di video Hunyuan, intitolato HunyuanCustom. La nuova versione sembra essere in grado di rendere superflui i modelli LoRA Hunyuan consentendo all’utente di creare personalizzazioni di video di tipo ‘deepfake’ attraverso un’unica immagine:
Fare clic per riprodurre. Prompt: ‘Un uomo sta ascoltando musica e cucinando noodles di lumaca in cucina’. Il nuovo metodo è stato confrontato con metodi close-source e open-source, tra cui Kling, che è un concorrente significativo in questo settore. Fonte: https://hunyuancustom.github.io/ (avvertenza: sito CPU/memoria-intensivo!)
Nella colonna più a sinistra del video sopra, vediamo l’immagine di origine singola fornita a HunyuanCustom, seguita dall’interpretazione del prompt del nuovo sistema nella seconda colonna, accanto a essa. Le colonne rimanenti mostrano i risultati di vari sistemi proprietari e FOSS: Kling; Vidu; Pika; Hailuo; e il Wan-based SkyReels-A2.
Nel video seguente, vediamo rendering di tre scenari essenziali per questa versione: rispettivamente, persona + oggetto; emulazione di un personaggio singolo; e prova virtuale (persona + abiti):
Fare clic per riprodurre. Tre esempi modificati dal materiale del sito di supporto per Hunyuan Video.
Possiamo notare alcune cose da questi esempi, principalmente relative al fatto che il sistema si basa su un’unica immagine di origine, invece di multiple immagini dello stesso soggetto.
Nel primo clip, l’uomo è essenzialmente ancora di fronte alla telecamera. Si china verso il basso e di lato di non più di 20-25 gradi di rotazione, ma, a un’inclinazione superiore a quella, il sistema dovrebbe iniziare a indovinare come appare di profilo. Questo è difficile, probabilmente impossibile da valutare con precisione da un’unica immagine frontale.
Nel secondo esempio, vediamo che la bambina sorride nel video generato come nel’unica immagine statica di origine. Ancora una volta, con questa unica immagine come riferimento, HunyuanCustom dovrebbe fare una stima relativamente non informata su come appare il suo ‘viso a riposo’. Inoltre, il suo viso non si discosta dalla posizione di fronte alla telecamera di più del precedente esempio (‘uomo che mangia patatine’).
Nell’ultimo esempio, vediamo che poiché il materiale di origine – la donna e gli abiti che indossa – non sono immagini complete, il rendering ha ritagliato la scena per adattarla – che è in realtà una soluzione abbastanza buona per un problema di dati!
Il punto è che anche se il nuovo sistema può gestire più immagini (come persona + patatine o persona + abiti), non sembra consentire angoli o viste alternative di un singolo personaggio, in modo che possano essere rappresentate espressioni diverse o angoli insoliti. In questo senso, il sistema potrebbe quindi avere difficoltà a sostituire l’ecosistema in crescita di modelli LoRA che sono apparsi intorno a HunyuanVideo dal suo rilascio di dicembre, poiché questi possono aiutare HunyuanVideo a produrre personaggi coerenti da qualsiasi angolo e con qualsiasi espressione facciale rappresentata nel set di dati di formazione (20-60 immagini è tipico).
Collegato al suono
Per l’audio, HunyuanCustom utilizza il sistema LatentSync (notoriamente difficile per gli appassionati di configurare e ottenere buoni risultati) per ottenere movimenti labiali che corrispondono all’audio e al testo fornito dall’utente:
Fare clic per riprodurre. Vari esempi di sincronizzazione labiale dal sito supplementare di HunyuanCustom, modificati insieme.
Al momento della stesura, non ci sono esempi in lingua inglese, ma questi sembrano essere piuttosto buoni – tanto più se il metodo di creazione è facilmente installabile e accessibile.
Modifica di video esistenti
Il nuovo sistema offre risultati apparentemente impressionanti per la modifica di video esistenti (V2V, o Vid2Vid), in cui un segmento di un video reale esistente viene mascherato e sostituito intelligentemente con un soggetto fornito in un’unica immagine di riferimento. Ecco un esempio dal sito dei materiali supplementari:
Fare clic per riprodurre. Solo l’oggetto centrale è bersagliato, ma ciò che rimane intorno ad esso viene anche alterato in un passaggio vid2vid di HunyuanCustom.
Come possiamo vedere, e come è standard in un scenario vid2vid, l’intero video viene alterato in qualche misura dal processo, anche se la maggior parte è alterata nella regione bersagliata, ovvero il giocattolo di peluche. Presumibilmente, potrebbero essere sviluppati pipeline per creare tali trasformazioni sotto un approccio di garbage matte che lascia la maggior parte del contenuto video identico all’originale. Questo è ciò che fa Adobe Firefly sotto il cofano, e lo fa abbastanza bene – ma è un processo poco studiato nella scena generativa FOSS.
Detto questo, la maggior parte degli esempi alternativi forniti fa un lavoro migliore nel bersagliare queste integrazioni, come possiamo vedere nella raccolta compilata di seguito:
Fare clic per riprodurre. Esempi diversi di contenuto interjectato utilizzando vid2vid in HunyuanCustom, mostrando un notevole rispetto per il materiale non bersagliato.
Un nuovo inizio?
Questa iniziativa è uno sviluppo del progetto di video Hunyuan, non un cambio di direzione netto rispetto a quel flusso di sviluppo. I miglioramenti del progetto sono introdotti come inserzioni architettoniche discrete piuttosto che cambiamenti strutturali radicali, con l’obiettivo di consentire al modello di mantenere la fedeltà dell’identità tra i fotogrammi senza affidarsi a soggetto-specifico fine-tuning, come con gli approcci LoRA o di inversione testuale.
Per essere chiari, quindi, HunyuanCustom non è stato addestrato da zero, ma piuttosto è un fine-tuning del modello di base di HunyuanVideo di dicembre 2024.
Coloro che hanno sviluppato LoRA HunyuanVideo potrebbero chiedersi se funzioneranno ancora con questa nuova edizione, o se dovranno reinventare la ruota LoRA ancora una volta se desiderano maggiori capacità di personalizzazione rispetto a quelle costruite in questa nuova versione.
In generale, un rilascio di un modello iperscalabile altamente personalizzato altera i pesi del modello abbastanza da rendere difficile che le LoRA create per il modello precedente funzionino correttamente, o affatto, con il modello raffinato di recente.
A volte, tuttavia, la popolarità di un fine-tuning può sfidare le sue origini: un esempio di un fine-tuning che diventa un fork efficace, con un ecosistema e seguaci dedicati, è il Pony Diffusion del modello Stable Diffusion XL (SDXL). Pony attualmente ha oltre 592.000 download nel dominio CivitAI, con una vasta gamma di LoRA che hanno utilizzato Pony (e non SDXL) come modello di base, e che richiedono Pony al momento dell’inferenza.
Rilascio
La pagina del progetto per il nuovo documento (che si intitola HunyuanCustom: un’architettura guidata multimodale per la generazione di video personalizzati) presenta collegamenti a un sito GitHub che, al momento della stesura, è appena diventato funzionale, e sembra contenere tutto il codice e i pesi necessari per l’implementazione locale, insieme a una proposta di timeline (dove l’unica cosa importante ancora da venire è l’integrazione di ComfyUI).
Al momento della stesura, la presenza del progetto su Hugging Face è ancora un 404. C’è, tuttavia, una versione basata sull’API del sistema, dove apparentemente si può dimostrare il sistema, a condizione di poter fornire un codice di scansione WeChat.
Raramente ho visto un utilizzo così elaborato e esteso di una così vasta gamma di progetti in un’unica assemblea, come è evidente in HunyuanCustom – e presumibilmente alcune delle licenze obbligherebbero comunque un rilascio completo.
Due modelli sono annunciati nella pagina GitHub: una versione da 720px1280px che richiede 8 GB di memoria GPU Peak, e una versione da 512px896px che richiede 60 GB di memoria GPU Peak.
Il repository afferma ‘La memoria GPU minima richiesta è di 24 GB per 720px1280px129f, ma molto lenta… Consigliamo di utilizzare una GPU con 80 GB di memoria per una migliore qualità di generazione’ – e ribadisce che il sistema è stato testato solo su Linux fino ad ora.
Il modello Hunyuan Video precedente, dal suo rilascio ufficiale, è stato quantizzato verso dimensioni in cui può essere eseguito con meno di 24 GB di VRAM, e sembra ragionevole supporre che il nuovo modello sarà adattato in forme più amichevoli per i consumatori dalla comunità, e che sarà adattato rapidamente per l’uso su sistemi Windows.
A causa di limiti di tempo e della quantità soverchiante di informazioni che accompagnano questo rilascio, possiamo solo dare uno sguardo più ampio, piuttosto che approfondito, a questo rilascio. Tuttavia, proviamo a sbirciare un po’ dentro HunyuanCustom.
Uno sguardo al documento
La pipeline di dati per HunyuanCustom, apparentemente conforme al quadro GDPR, incorpora sia dataset video sintetici che open-source, tra cui OpenHumanVid, con otto categorie centrali rappresentate: umani, animali, piante, paesaggi, veicoli, oggetti, architettura, e anime.

Dall’articolo di rilascio, una panoramica dei diversi pacchetti che contribuiscono alla costruzione dei dati di HunyuanCustom. Fonte: https://arxiv.org/pdf/2505.04512
La filtrazione iniziale inizia con PySceneDetect, che segmenta i video in clip a un solo fotogramma. TextBPN-Plus-Plus viene quindi utilizzato per rimuovere i video che contengono testo su schermo eccessivo, sottotitoli, filigrane o loghi.
Per affrontare le incoerenze nella risoluzione e nella durata, le clip vengono standardizzate a cinque secondi di lunghezza e ridimensionate a 512 o 720 pixel sul lato corto. La filtrazione estetica è gestita utilizzando Koala-36M, con una soglia personalizzata di 0,06 applicata per il set di dati personalizzato curato dai ricercatori del nuovo documento.
Il processo di estrazione del soggetto combina il modello di linguaggio Qwen7B, il framework di riconoscimento di oggetti YOLO11X e l’architettura popolare InsightFace, per identificare e convalidare le identità umane.
Per soggetti non umani, QwenVL e Grounded SAM 2 vengono utilizzati per estrarre le caselle di delimitazione rilevanti, che vengono scartate se troppo piccole.

Esempi di segmentazione semantica con Grounded SAM 2, utilizzato nel progetto Hunyuan Control. Fonte: https://github.com/IDEA-Research/Grounded-SAM-2
La estrazione di più soggetti utilizza Florence2 per l’annotazione delle caselle di delimitazione, e Grounded SAM 2 per la segmentazione, seguita da clustering e segmentazione temporale dei fotogrammi di formazione.
Le clip elaborate vengono ulteriormente arricchite attraverso l’annotazione, utilizzando un sistema di etichettatura strutturata proprietario sviluppato dal team Hunyuan, che fornisce metadati stratificati come descrizioni e suggerimenti di movimento della telecamera.
Le strategie di mask augmentation sono state applicate durante la formazione per ridurre l’overfitting e garantire che il modello si adatti a forme di oggetto diverse.
I dati audio sono stati sincronizzati utilizzando il già menzionato LatentSync, e le clip scartate se i punteggi di sincronizzazione scendono al di sotto di una soglia minima.
Il framework di valutazione della qualità delle immagini cieche HyperIQA è stato utilizzato per escludere i video con un punteggio inferiore a 40 (nella scala personalizzata di HyperIQA). Le tracce audio valide sono state quindi elaborate con Whisper per estrarre le caratteristiche per le attività a valle.
Gli autori incorporano il modello di assistente linguistico LLaVA durante la fase di annotazione, e sottolineano la posizione centrale che questo framework ha in HunyuanCustom. LLaVA viene utilizzato per generare didascalie di immagini e assistere nell’allineamento del contenuto visivo con i prompt testuali, supportando la costruzione di un segnale di formazione coerente attraverso le modalità:

Il framework HunyuanCustom supporta la generazione di video coerenti con l’identità condizionata su input testuali, immagini, audio e video.
Sfruttando le capacità di allineamento visione-linguaggio di LLaVA, la pipeline guadagna un ulteriore livello di coerenza semantica tra elementi visivi e le loro descrizioni testuali – particolarmente prezioso in scenari di più soggetti o scene complesse.
Video personalizzato
Per consentire la generazione di video in base a un’immagine di riferimento e a un prompt, sono stati creati due moduli centrati su LLaVA, adattando prima la struttura di input di HunyuanVideo in modo che potesse accettare un’immagine insieme al testo.
Questo ha comportato la formattazione del prompt in un modo che incorpora l’immagine direttamente o la etichetta con una breve descrizione di identità. Un token di separazione è stato utilizzato per impedire che l’incorporamento dell’immagine sopraffaccia il contenuto del prompt.
Poiché l’encoder visivo di LLaVA tende a comprimere o scartare dettagli spaziali fini durante l’allineamento delle caratteristiche di immagine e testo (in particolare quando si traduce un’unica immagine di riferimento in un’impronta semantica generale), è stato incorporato un modulo di miglioramento dell’identità. Poiché quasi tutti i modelli di diffusione di video latente hanno difficoltà a mantenere un’identità senza un LoRA, anche in un clip di cinque secondi, le prestazioni di questo modulo potrebbero rivelarsi significative durante i test della comunità.
In ogni caso, l’immagine di riferimento viene quindi ridimensionata e codificata utilizzando il 3D-VAE causale dell’originale modello HunyuanVideo, e il suo latente viene inserito nel latente video lungo l’asse temporale, con un offset spaziale applicato per evitare che l’immagine venga riprodotta direttamente nel output, mentre ancora guida la generazione.
Il modello è stato addestrato utilizzando Flow Matching, con campioni di rumore tratti da una distribuzione logit-normale – e la rete è stata addestrata a recuperare il video corretto da questi latenti rumorosi. LLaVA e il generatore di video sono stati entrambi ritoccati insieme in modo che l’immagine e il prompt potessero guidare l’output in modo più fluido e mantenere la coerenza dell’identità del soggetto.
Per prompt multi-soggetto, ogni coppia di immagine-testo è stata incorporata separatamente e assegnata a una posizione temporale distinta, consentendo di distinguere le identità e supportando la generazione di scene che coinvolgono più soggetti interagenti.
Suono e visione
HunyuanCustom condiziona la generazione di audio/discorso utilizzando sia l’audio di input dell’utente che un prompt testuale, consentendo ai personaggi di parlare all’interno di scene che riflettono l’ambientazione descritta.
Per supportare questo, un modulo di rete neurale Identity-disentangled AudioNet introduce le caratteristiche audio senza disturbare i segnali di identità incorporati dall’immagine di riferimento e dal prompt. Queste caratteristiche sono allineate con la timeline video compressa, divisa in segmenti a livello di fotogramma, e iniettate utilizzando un meccanismo di attenzione spaziale cross-attention che mantiene ogni fotogramma isolato, preservando la coerenza del soggetto e evitando interferenze temporali.
Un secondo modulo di iniezione temporale fornisce un controllo più fine sulla tempistica e il movimento, lavorando in tandem con AudioNet, mappando le caratteristiche audio in regioni specifiche della sequenza latente, e utilizzando un perceptron multistrato (MLP) per convertirle in offset di movimento token-wise. Ciò consente ai gesti e ai movimenti facciali di seguire il ritmo e l’enfasi dell’input parlato con maggiore precisione.
HunyuanCustom consente di modificare direttamente i soggetti presenti in video esistenti, sostituendo o inserendo persone o oggetti in una scena senza dover ricostruire l’intero clip da zero. Ciò lo rende utile per attività che coinvolgono la modifica dell’aspetto o del movimento in modo mirato.
Fare clic per riprodurre. Un ulteriore esempio dal sito supplementare.
Per facilitare la sostituzione efficiente del soggetto in video esistenti, il nuovo sistema evita l’approccio intensivo in termini di risorse dei metodi recenti come il popolare VACE, o quelli che fondono intere sequenze video, preferendo invece la compressione di un video di riferimento utilizzando il 3D-VAE pre-addestrato – allineandolo con i latenti video della pipeline di generazione, e poi aggiungendoli. Ciò mantiene il processo relativamente leggero, mentre consente comunque al contenuto video esterno di guidare l’output.
Un piccolo network neurale gestisce l’allineamento tra il video di input pulito e i latenti rumorosi utilizzati nella generazione. Il sistema testa due modi di iniettare queste informazioni: fondendo i due set di caratteristiche prima di comprimerle di nuovo; e aggiungendo le caratteristiche fotogramma per fotogramma. Il secondo metodo funziona meglio, hanno trovato gli autori, e evita la perdita di qualità mentre mantiene invariato il carico computazionale.
Dati e test
Nei test, le metriche utilizzate sono state: il modulo di coerenza dell’identità in ArcFace, che estrae le impronte facciali dall’immagine di riferimento e da ogni fotogramma del video generato, e poi calcola la similarità coseno media tra di loro; similitudine del soggetto, tramite l’invio di segmenti YOLO11x a Dino 2 per il confronto; CLIP-B, allineamento testo-video, che misura la similarità tra il prompt e il video generato; CLIP-B nuovamente, per calcolare la similarità tra ogni fotogramma e sia i fotogrammi adiacenti che il primo fotogramma, nonché la coerenza temporale; e grado dinamico, come definito da VBench.
Come indicato in precedenza, i concorrenti di base chiusi sono stati Hailuo; Vidu 2.0; Kling (1.6); e Pika. I framework FOSS concorrenti sono stati VACE e SkyReels-A2.

Valutazione delle prestazioni del modello confrontando HunyuanCustom con i principali metodi di personalizzazione video in termini di coerenza dell’identità (Face-Sim), similitudine del soggetto (DINO-Sim), allineamento testo-video (CLIP-B-T), coerenza temporale (Temp-Consis), e intensità del movimento (DD). I risultati ottimali e sub-ottimali sono mostrati in grassetto e sottolineato, rispettivamente.
Di questi risultati, gli autori affermano:
‘Il nostro [HunyuanCustom] raggiunge la migliore coerenza dell’identità e la migliore coerenza del soggetto. Raggiunge anche risultati paragonabili nel seguire il prompt e nella coerenza temporale. [Hailuo] ha il miglior punteggio CLIP perché segue bene le istruzioni testuali con solo la coerenza dell’identità, sacrificando la coerenza dei soggetti non umani (la peggiore DINO-Sim). In termini di grado dinamico, [Vidu] e [VACE] si esibiscono male, il che potrebbe essere dovuto alle piccole dimensioni del modello.’
Sebbene il sito del progetto sia saturo di video di confronto (la cui disposizione sembra essere stata progettata per l’estetica del sito web piuttosto che per un facile confronto), attualmente non presenta un video equivalente ai risultati statici stipati insieme nel PDF, per quanto riguarda i test qualitativi iniziali. Sebbene io lo includa qui, incoraggio il lettore a esaminare attentamente i video sul sito del progetto, poiché offrono una migliore impressione degli esiti:

Dal documento, un confronto sulla personalizzazione di video centrata sull’oggetto. Sebbene il lettore dovrebbe (come sempre) fare riferimento al PDF di origine per una migliore risoluzione, i video sul sito del progetto potrebbero essere una risorsa più illuminante in questo caso.
Gli autori commentano qui:
‘Si può vedere che [Vidu], [Skyreels A2] e il nostro metodo raggiungono risultati relativamente buoni nell’allineamento del prompt e nella coerenza del soggetto, ma la nostra qualità video è migliore di Vidu e Skyreels, grazie alle buone prestazioni di generazione video del nostro modello di base, ovvero [Hunyuanvideo-13B]. ‘
‘Tra i prodotti commerciali, sebbene [Kling] abbia una buona qualità video, il primo fotogramma del video ha un problema di copia-incolla, e a volte il soggetto si muove troppo velocemente e [si sfoca], portando a una scarsa esperienza di visione.’
Gli autori affermano inoltre che Pika si esibisce male in termini di coerenza temporale, introducendo artefatti di sottotitoli (effetti di una cattiva curazione dei dati, in cui elementi testuali nei clip video sono stati consentiti di inquinare i concetti centrali).
Hailuo mantiene l’identità facciale, affermano gli autori, ma non mantiene la coerenza del corpo intero. Tra i metodi open-source, VACE, i ricercatori affermano, non è in grado di mantenere la coerenza dell’identità, mentre sostengono che HunyuanCustom produce video con una forte conservazione dell’identità, mantenendo allo stesso tempo la qualità e la diversità.
Successivamente, sono stati condotti test per la personalizzazione di video multi-soggetto, contro gli stessi concorrenti. Come nell’esempio precedente, i risultati del PDF appiattiti non sono equivalenti dei video disponibili sul sito del progetto, ma sono unici tra i risultati presentati:

Confronti utilizzando la personalizzazione di video multi-soggetto. Si prega di fare riferimento al PDF per una migliore risoluzione e dettaglio.
Il documento afferma:
‘[Pika] può generare i soggetti specificati, ma mostra instabilità nei fotogrammi video, con istanze di un uomo che scompare in una scena e una donna che non riesce ad aprire una porta come richiesto. [Vidu] e [VACE] catturano parzialmente l’identità umana, ma perdono dettagli significativi di oggetti non umani, indicando una limitazione nella rappresentazione di soggetti non umani. ‘
‘[SkyReels A2] sperimenta una grave instabilità dei fotogrammi, con cambiamenti evidenti nei chip e numerosi artefatti nella scena di destra. ‘
‘In contrasto, il nostro HunyuanCustom cattura efficacemente sia le identità umane che quelle non umane, genera video che aderiscono ai prompt dati e mantiene un’elevata qualità visiva e stabilità.’
Un ulteriore esperimento è stato ‘pubblicità virtuale umana’, in cui i framework sono stati incaricati di integrare un prodotto con una persona:

Dall’round di test qualitativi, esempi di ‘collocazione di prodotto’ neurale. Si prega di fare riferimento al PDF per una migliore risoluzione e dettaglio.
Per questo round, gli autori affermano:
‘I risultati dimostrano che HunyuanCustom mantiene efficacemente l’identità umana, conservando allo stesso tempo i dettagli del prodotto bersaglio, compreso il testo su di esso. ‘
‘Inoltre, l’interazione tra l’umano e il prodotto appare naturale, e il video aderisce strettamente al prompt dato, evidenziando il potenziale sostanziale di HunyuanCustom nella generazione di video pubblicitari.’
Un’area in cui i risultati video sarebbero stati molto utili è stata la fase qualitativa per la personalizzazione del soggetto guidata dall’audio, in cui il personaggio parla l’audio corrispondente da una scena e una postura descritte testualmente.

Risultati parziali dati per il round audio – sebbene i risultati video sarebbero stati preferibili in questo caso. Solo la metà superiore della figura del PDF è riprodotta qui, poiché è grande e difficile da accomodare in questo articolo. Si prega di fare riferimento al PDF di origine per una migliore risoluzione e dettaglio.
Gli autori affermano:
‘I metodi di animazione umana guidata dall’audio precedenti richiedono un’immagine umana e un audio, dove la postura, l’abbigliamento e l’ambiente dell’umano rimangono coerenti con l’immagine data e non possono generare video in altre pose e ambienti, il che può [limitare] la loro applicazione. ‘
‘… [Il nostro] HunyuanCustom consente la personalizzazione umana guidata dall’audio, dove il personaggio parla l’audio corrispondente in una scena e postura descritte testualmente, consentendo un’animazione umana guidata dall’audio più flessibile e controllabile.’
Ulteriori test (si prega di fare riferimento al PDF per tutti i dettagli) hanno incluso un round che ha messo il nuovo sistema contro VACE e Kling 1.6 per la sostituzione del soggetto in modalità video-a-video:

Test della sostituzione del soggetto in modalità video-a-video. Si prega di fare riferimento al PDF di origine per una migliore risoluzione e dettaglio.
Di questi, gli ultimi test presentati nel nuovo documento, i ricercatori opinano:
‘VACE soffre di artefatti di bordo a causa dell’aderenza rigorosa alle maschere di input, risultando in forme di soggetto innaturali e continuità di movimento interrotta. [Kling], d’altra parte, esibisce un effetto di copia-incolla, dove i soggetti vengono sovrapposti direttamente al video, portando a una scarsa integrazione con lo sfondo. ‘
‘In confronto, HunyuanCustom evita efficacemente gli artefatti di bordo, raggiunge un’integrazione senza soluzione di continuità con lo sfondo video e mantiene una forte conservazione dell’identità – dimostrando la sua prestazione superiore nelle attività di editing video.’
Conclusione
Questo è un rilascio affascinante, non da ultimo perché affronta qualcosa che la scena degli appassionati sempre insoddisfatta ha lamentato di più ultimamente – la mancanza di sincronizzazione labiale, in modo che il realismo aumentato possibile in sistemi come Hunyuan Video e Wan 2.1 possa essere dato una nuova dimensione di autenticità.
Sebbene la disposizione della maggior parte degli esempi video comparativi sul sito del progetto renda difficile confrontare le capacità di HunyuanCustom con quelle dei concorrenti precedenti, è importante notare che pochi progetti nello spazio della sintesi video hanno il coraggio di mettersi alla prova contro Kling, l’API di diffusione video commerciale che è sempre in cima o vicino alla cima delle classifiche; Tencent sembra aver fatto progressi contro questo concorrente in modo abbastanza impressionante.
* Il problema è che alcuni dei video sono così ampi, corti e ad alta risoluzione che non verranno riprodotti in lettori video standard come VLC o Windows Media Player, mostrando schermi neri.
Pubblicato per la prima volta giovedì, 8 maggio 2025












