Angle d’Anderson

HunyuanCustom Apporte des Deepfakes Vidéo à partir d’une Seule Image, avec Audio et Synchro des Lèvres

mm
Ajouter Unite.AI à vos sources préférées sur Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Cet article traite d’une nouvelle version d’un modèle de monde vidéo multimodal Hunyuan appelé ‘HunyuanCustom’. La portée de la nouvelle publication, combinée avec plusieurs problèmes dans de nombreux exemples de vidéos fournis sur la page du projet*, nous oblige à une couverture plus générale que d’habitude, et à une reproduction limitée de la grande quantité de contenu vidéo qui accompagne cette publication (puisqu’une grande partie des vidéos nécessite une réédition et un traitement importants pour améliorer la lisibilité de la mise en page).

Veuillez noter en outre que l’article fait référence au système génératif basé sur l’API Kling sous le nom de ‘Keling’. Pour plus de clarté, je fais référence à ‘Kling’ tout au long.

 

Tencent est en train de publier une nouvelle version de son modèle de vidéo Hunyuan, intitulé HunyuanCustom. La nouvelle publication semble capable de rendre les modèles LoRA Hunyuan obsolètes, en permettant à l’utilisateur de créer des personnalisations de vidéo de type ‘deepfake’ à partir d’une seule image:

Cliquez pour lire. Invite: ‘Un homme écoute de la musique et cuisine des nouilles de escargot dans la cuisine’. La nouvelle méthode est comparée aux méthodes à code source fermé et open-source, y compris Kling, qui est un adversaire important dans cet espace. Source: https://hunyuancustom.github.io/ (attention: site gourmand en CPU/mémoire!)

Dans la colonne la plus à gauche de la vidéo ci-dessus, nous voyons l’image source unique fournie à HunyuanCustom, suivie de l’interprétation du système de l’invite dans la deuxième colonne, à côté. Les colonnes restantes montrent les résultats de divers systèmes propriétaires et open-source: Kling; Vidu; Pika; Hailuo; et le Wan-based SkyReels-A2.

Dans la vidéo ci-dessous, nous voyons des rendus de trois scénarios essentiels à cette publication: respectivement, personne + objet; émulation de personnage unique; et essai virtuel (personne + vêtements):

Cliquez pour lire. Trois exemples édités à partir du matériel du site de support pour Hunyuan Video.

Nous pouvons remarquer quelques choses à partir de ces exemples, principalement liées au fait que le système repose sur une seule image source, au lieu de plusieurs images du même sujet.

Dans le premier extrait, l’homme est essentiellement toujours face à la caméra. Il baisse la tête et se détourne à peine plus de 20-25 degrés de rotation, mais, à une inclinaison supérieure à celle-ci, le système devrait vraiment commencer à deviner à quoi il ressemble en profil. C’est difficile, probablement impossible à évaluer avec précision à partir d’une seule image frontale.

Dans le deuxième exemple, nous voyons que la petite fille sourit dans la vidéo rendue comme elle le fait dans l’image source statique. Encore une fois, avec cette seule image comme référence, HunyuanCustom devrait faire une supposition relativement non informée sur à quoi ressemble son ‘visage au repos’. De plus, son visage ne s’écarte pas de la position face à la caméra de plus de l’exemple précédent (‘homme mangeant des chips’).

Dans le dernier exemple, nous voyons que puisque le matériel source – la femme et les vêtements qu’elle est invitée à porter – ne sont pas des images complètes, le rendu a coupé le scénario pour l’adapter – ce qui est en fait une bonne solution à un problème de données!

Le point est que même si le nouveau système peut gérer plusieurs images (comme personne + chips, ou personne + vêtements), il n’apparaît pas permettre plusieurs angles ou vues alternatives d’un seul personnage, de sorte que des expressions diverses ou des angles inhabituels puissent être pris en compte. Dans cette mesure, le système peut donc avoir du mal à remplacer l’écosystème croissant de modèles LoRA qui ont surgi autour de HunyuanVideo depuis sa publication en décembre dernier, puisque ceux-ci peuvent aider HunyuanVideo à produire des personnages cohérents à partir de n’importe quel angle et avec n’importe quelle expression faciale représentée dans l’ensemble de formation (20-60 images est typique).

Branché pour le Son

Pour l’audio, HunyuanCustom utilise le système LatentSync (notoirement difficile pour les amateurs à configurer et obtenir de bons résultats) pour obtenir des mouvements de lèvres qui correspondent à l’audio et au texte fournis par l’utilisateur:

Cliquez pour lire. Divers exemples de synchronisation des lèvres à partir du site supplémentaire de HunyuanCustom, édités ensemble.

Au moment de la rédaction, il n’y a pas d’exemples en anglais, mais ceux-ci semblent être plutôt bons – d’autant plus si la méthode de les créer est facilement installable et accessible.

Édition de Vidéo Existante

Le nouveau système offre des résultats impressionnants pour l’édition de vidéo à vidéo (V2V, ou Vid2Vid), dans laquelle un segment d’une vidéo existante (réelle) est masqué et remplacé de manière intelligente par un sujet donné dans une seule image de référence. Voici un exemple à partir du site de matériel supplémentaire:

Cliquez pour lire. Seul l’objet central est ciblé, mais ce qui reste autour de lui est également modifié dans un passage Vid2Vid de HunyuanCustom.

Comme nous le voyons, et comme c’est standard dans un scénario Vid2Vid, la vidéo entière est modifiée à un certain degré par le processus, bien que la plupart des modifications soient apportées à la région ciblée, c’est-à-dire le jouet en peluche. On peut supposer que des pipelines pourraient être développés pour créer de telles transformations sous une approche de garbage matte qui laisse la majeure partie du contenu de la vidéo identique à l’original. C’est ce que fait Adobe Firefly sous le capot, et le fait plutôt bien – mais c’est un processus peu étudié dans la scène générative open-source.

Cela étant dit, la plupart des exemples alternatifs fournis font un meilleur travail pour cibler ces intégrations, comme on peut le voir dans la compilation ci-dessous:

Cliquez pour lire. Divers exemples d’intégration de contenu à l’aide de Vid2Vid dans HunyuanCustom, montrant un respect notable pour le matériel non ciblé.

Un Nouveau Départ?

Cette initiative est un développement du projet de vidéo Hunyuan, et non un changement de direction loin de ce flux de développement. Les améliorations du projet sont introduites comme des insertions architecturales discrètes plutôt que des changements structurels importants, visant à permettre au modèle de maintenir la fidélité de l’identité à travers les cadres sans s’appuyer sur une personnalisation spécifique fine-tuning, comme avec les approches LoRA ou d’inversion textuelle.

Il est clair, par conséquent, que HunyuanCustom n’est pas formé à partir de zéro, mais plutôt est un fine-tuning du modèle de base de vidéo Hunyuan de décembre 2024.

Celui qui a développé des LoRAs HunyuanVideo peut se demander si ceux-ci fonctionneront toujours avec cette nouvelle édition, ou s’ils devront réinventer la roue LoRA encore une fois s’ils veulent plus de capacités de personnalisation que celles intégrées dans cette nouvelle publication.

En général, une publication fortement fine-tunée d’un modèle à grande échelle modifie les poids du modèle suffisamment pour que les LoRAs créés pour le modèle précédent ne fonctionnent pas correctement, ou du tout, avec le modèle révisé.

Parfois, cependant, la popularité d’un fine-tuning peut remettre en question ses origines: un exemple d’un fine-tuning devenant un fork efficace, avec un écosystème dédié et des partisans à lui, est le Pony Diffusion de Stable Diffusion XL (SDXL). Pony compte actuellement 592 000+ téléchargements sur le domaine CivitAI en constante évolution, avec une vaste gamme de LoRAs qui ont utilisé Pony (et non SDXL) comme modèle de base, et qui nécessitent Pony au moment de l’inférence.

Publication

La page du projet pour la nouvelle publication (qui s’intitule HunyuanCustom: Une architecture multimodale pour la génération de vidéos personnalisées) comporte des liens vers un site GitHub qui, au moment où j’écris, vient de devenir fonctionnel, et semble contenir tout le code et les poids nécessaires pour une mise en œuvre locale, ainsi qu’un calendrier proposé (où la seule chose importante à venir est l’intégration de ComfyUI).

À l’heure de la rédaction, la présence du projet sur Hugging Face est toujours une erreur 404. Il y a cependant une version basée sur l’API du système que l’on peut apparemment tester, à condition de pouvoir fournir un code de scan WeChat.

J’ai rarement vu une utilisation si élaborée et étendue d’un tel éventail de projets dans une assemblage, comme c’est le cas avec HunyuanCustom – et il est probable que certaines des licences obligeraient de toute façon à une publication complète.

Deux modèles sont annoncés sur la page GitHub: une version 720px1280px nécessitant 8)Go de mémoire GPU Peak, et une version 512px896px nécessitant 60Go de mémoire GPU Peak.

Le référentiel indique ‘La mémoire GPU minimale requise est de 24Go pour 720px1280px129f mais très lente… Nous recommandons d’utiliser une GPU avec 80Go de mémoire pour une meilleure qualité de génération’ – et il est précisé que le système n’a été testé jusqu’à présent que sur Linux.

Le modèle précédent de vidéo Hunyuan a, depuis sa publication officielle, été quantifié jusqu’à des tailles où il peut être exécuté avec moins de 24Go de VRAM, et il semble raisonnable de supposer que le nouveau modèle sera également adapté en formes plus conviviales pour les consommateurs par la communauté, et qu’il sera rapidement adapté pour une utilisation sur les systèmes Windows également.

En raison de contraintes de temps et de la quantité écrasante d’informations qui accompagnent cette publication, nous ne pouvons prendre qu’un regard plus large, plutôt que plus approfondi, sur cette publication. Néanmoins, essayons d’ouvrir un peu le capot de HunyuanCustom.

Un Regard sur le Document

Le pipeline de données pour HunyuanCustom, apparemment conforme au cadre du RGPD, intègre à la fois des ensembles de données vidéo synthétisés et open-source, y compris OpenHumanVid, avec huit catégories de base représentées: humains, animaux, plantes, paysages, véhicules, objets, architecture, et anime.

À partir de la publication, une vue d'ensemble des packages divers contribuant au pipeline de construction de données de HunyuanCustom. Source: https://arxiv.org/pdf/2505.04512

À partir de la publication, une vue d’ensemble des packages divers contribuant au pipeline de construction de données de HunyuanCustom. Source: https://arxiv.org/pdf/2505.04512

Le filtrage initial commence avec PySceneDetect, qui divise les vidéos en clips à un seul plan. TextBPN-Plus-Plus est ensuite utilisé pour supprimer les vidéos contenant du texte à l’écran excessif, des sous-titres, des filigranes ou des logos.

Pour résoudre les incohérences de résolution et de durée, les clips sont standardisés à cinq secondes de longueur et redimensionnés à 512 ou 720 pixels sur le côté court. Le filtrage esthétique est géré à l’aide de Koala-36M, avec un seuil personnalisé de 0,06 appliqué pour l’ensemble de données personnalisé curé par les chercheurs de la nouvelle publication.

Le processus d’extraction du sujet combine le Qwen7B Large Language Model (LLM), le YOLO11X cadre de reconnaissance d’objets, et l’architecture populaire InsightFace, pour identifier et valider les identités humaines.

Pour les sujets non humains, QwenVL et Grounded SAM 2 sont utilisés pour extraire les boîtes de délimitation pertinentes, qui sont rejetées si elles sont trop petites.

Exemples de segmentation sémantique avec Grounded SAM 2, utilisé dans le projet Hunyuan Control. Source: https://github.com/IDEA-Research/Grounded-SAM-2

Exemples de segmentation sémantique avec Grounded SAM 2, utilisé dans le projet Hunyuan Control. Source: https://github.com/IDEA-Research/Grounded-SAM-2

La extraction de plusieurs sujets utilise Florence2 pour l’annotation de la boîte de délimitation, et Grounded SAM 2 pour la segmentation, suivie d’un regroupement et d’une segmentation temporelle des cadres de formation.

Les clips traités sont ensuite améliorés via l’annotation, à l’aide d’un système de marquage structuré propriétaire développé par l’équipe Hunyuan, et qui fournit des métadonnées en couches telles que des descriptions et des indices de mouvement de caméra.

Les stratégies d’augmentation de masque Mask augmentation, y compris la conversion en boîtes de délimitation, ont été appliquées pendant la formation pour réduire la suradaptation et s’assurer que le modèle s’adapte à des formes d’objets diverses.

Les données audio ont été synchronisées à l’aide du système LatentSync mentionné précédemment, et les clips ont été rejetés si les scores de synchronisation sont inférieurs à un seuil minimum.

Le cadre d’évaluation de la qualité d’image aveugle HyperIQA a été utilisé pour exclure les vidéos ayant un score inférieur à 40 (sur l’échelle personnalisée de HyperIQA). Les pistes audio valides ont ensuite été traitées avec Whisper pour extraire des fonctionnalités pour les tâches en aval.

Les auteurs intègrent le modèle d’assistant de langage LLaVA pendant la phase d’annotation, et ils soulignent la position centrale que ce cadre occupe dans HunyuanCustom. LLaVA est utilisé pour générer des légendes d’images et aider à aligner le contenu visuel avec les invites textuelles, soutenant ainsi la construction d’un signal de formation cohérent à travers les modalités:

Le cadre HunyuanCustom prend en charge la génération de vidéos cohérentes avec l'identité, conditionnée par des invites texte, image, audio et vidéo.

Le cadre HunyuanCustom prend en charge la génération de vidéos cohérentes avec l’identité, conditionnée par des invites texte, image, audio et vidéo.

En exploitant les capacités d’alignement vision-langage de LLaVA, le pipeline gagne une couche supplémentaire de cohérence sémantique entre les éléments visuels et leurs descriptions textuelles – surtout précieuse dans des scénarios à plusieurs sujets ou à scène complexe.

vidéo personnalisée

Pour permettre la génération de vidéo basée sur une image de référence et une invite, les deux modules centrés autour de LLaVA ont été créés, en adaptant d’abord la structure d’entrée de HunyuanVideo pour qu’il puisse accepter une image ainsi que du texte.

Cela a impliqué de formater l’invite d’une manière qui intègre l’image directement ou la marque d’une brève description d’identité. Un jeton de séparateur a été utilisé pour empêcher l’intégration de l’image de submerger le contenu de l’invite.

Puisque l’encodeur visuel de LLaVA a tendance à compresser ou à supprimer les détails spatiaux fins pendant l’alignement des fonctionnalités d’image et de texte (en particulier lors de la traduction d’une seule image de référence en une embedding sémantique générale), un module d’amélioration d’identité a été incorporé. Puisque presque tous les modèles de diffusion de vidéo latente ont du mal à maintenir une identité sans LoRA, même dans un clip de cinq secondes, les performances de ce module dans les tests de la communauté peuvent s’avérer importantes.

Quoi qu’il en soit, l’image de référence est ensuite redimensionnée et encodée à l’aide du 3D-VAE causal de l’original modèle HunyuanVideo, et son latent est inséré dans le latent de vidéo le long de l’axe temporel, avec un décalage spatial appliqué pour empêcher l’image d’être reproduite directement dans la sortie, tout en guidant la génération.

Le modèle a été formé en utilisant Flow Matching, avec des échantillons de bruit tirés d’une distribution logit-normale – et le réseau a été formé pour récupérer la vidéo correcte à partir de ces latents bruyants. LLaVA et le générateur de vidéo ont tous deux été fine-tunés ensemble pour que l’image et l’invite puissent guider la sortie plus fluide et maintenir la cohérence de l’identité du sujet.

Pour les invites à plusieurs sujets, chaque paire image-texte a été intégrée séparément et a reçu une position temporelle distincte, permettant aux identités d’être distinguées et soutenant la génération de scènes impliquant plusieurs sujets interactifs.

Son et Vision

HunyuanCustom conditionne la génération d’audio/parole en utilisant à la fois l’audio et l’invite textuelle fournis par l’utilisateur, permettant aux personnages de parler dans des scènes qui reflètent le décor décrit.

Pour soutenir cela, un module AudioNet désentrelacé introduit des fonctionnalités audio sans perturber les signaux d’identité intégrés à partir de l’image de référence et de l’invite. Ces fonctionnalités sont alignées avec la chronologie vidéo compressée, divisée en segments de niveau de trame, et injectées à l’aide d’un mécanisme d’attention spatiale cross-attention qui maintient chaque trame isolée, préservant ainsi la cohérence du sujet et évitant les interférences temporelles.

Un deuxième module d’injection temporelle fournit un contrôle plus fin sur le timing et le mouvement, travaillant en tandem avec AudioNet, en cartographiant les fonctionnalités audio sur des régions spécifiques de la séquence latente, et en utilisant un perceptron multi-couches (MLP) pour les convertir en décalages de mouvement au niveau du jeton. Cela permet aux gestes et aux mouvements faciaux de suivre le rythme et l’accent de l’entrée parlée avec plus de précision.

HunyuanCustom permet aux sujets dans les vidéos existantes d’être édités directement, en remplaçant ou en insérant des personnes ou des objets dans une scène sans avoir besoin de reconstruire l’ensemble du clip à partir de zéro. Cela le rend utile pour les tâches qui impliquent la modification de l’apparence ou du mouvement de manière ciblée.

Cliquez pour lire. Un autre exemple du site supplémentaire.

Pour faciliter la substitution de sujet efficace dans les vidéos existantes, le nouveau système évite l’approche gourmande en ressources des méthodes récentes telles que le VACE actuellement populaire, ou celles qui fusionnent des séquences de vidéo entières, favorisant à la place la compression d’une vidéo de référence à l’aide du 3D-VAE préformé – aligné avec les latents de la pipeline de génération, puis ajouté aux deux. Cela maintient le processus relativement léger, tout en permettant au contenu de la vidéo externe de guider la sortie.

Un petit réseau neuronal gère l’alignement entre la vidéo d’entrée propre et les latents bruyants utilisés dans la génération. Le système teste deux façons d’injecter ces informations: la fusion des deux ensembles de fonctionnalités avant de les compresser à nouveau; et l’ajout des fonctionnalités image par image. La deuxième méthode fonctionne mieux, ont constaté les auteurs, et évite la perte de qualité tout en maintenant la charge de calcul inchangée.

Données et Tests

Dans les tests, les métriques utilisées étaient: le module de cohérence d’identité dans ArcFace, qui extrait les embeddings faciaux à la fois de l’image de référence et de chaque trame de la vidéo générée, et calcule ensuite la similarité cosinus moyenne entre eux; similarité de sujet, via l’envoi de segments YOLO11x à Dino 2 pour comparaison; CLIP-B, alignement texte-vidéo, qui mesure la similarité entre l’invite et la vidéo générée; CLIP-B à nouveau, pour calculer la similarité entre chaque trame et à la fois ses trames voisines et la première trame, ainsi que la cohérence temporelle; et degré dynamique, tel que défini par VBench.

Comme indiqué précédemment, les compétiteurs de référence à code source fermé étaient Hailuo; Vidu 2.0; Kling (1.6); et Pika. Les cadres FOSS concurrents étaient VACE et SkyReels-A2.

Évaluation des performances du modèle en comparant HunyuanCustom avec les principales méthodes de personnalisation de vidéo à travers la cohérence d'identité (Face-Sim), la similarité de sujet (DINO-Sim), l'alignement texte-vidéo (CLIP-B-T), la cohérence temporelle (Temp-Consis), et l'intensité de mouvement (DD). Les résultats optimaux et sous-optimels sont indiqués en gras et en souligné, respectivement.

Évaluation des performances du modèle en comparant HunyuanCustom avec les principales méthodes de personnalisation de vidéo à travers la cohérence d’identité (Face-Sim), la similarité de sujet (DINO-Sim), l’alignement texte-vidéo (CLIP-B-T), la cohérence temporelle (Temp-Consis), et l’intensité de mouvement (DD). Les résultats optimaux et sous-optimels sont indiqués en gras et en souligné, respectivement.

Parmi ces résultats, les auteurs déclarent:

‘Notre [HunyuanCustom] atteint la meilleure cohérence d’identité et de sujet. Il atteint également des résultats comparables en termes de suivi d’invite et de cohérence temporelle. [Hailuo] a le meilleur score de clip car il peut suivre les instructions textuelles avec seulement une cohérence d’identité, sacrifiant la cohérence des sujets non humains (la pire DINO-Sim). En termes de degré dynamique, [Vidu] et [VACE] se comportent mal, ce qui peut être dû à la petite taille du modèle.’

Bien que le site du projet soit saturé de vidéos de comparaison (la disposition desquelles semble avoir été conçue pour l’esthétique du site Web plutôt que pour une comparaison facile), il ne comporte actuellement pas de vidéo équivalente aux résultats statiques regroupés dans le PDF, en ce qui concerne les tests qualitatifs initiaux. Bien que je l’inclue ici, j’encourage le lecteur à examiner de près les vidéos sur le site du projet, car elles donnent une meilleure impression des résultats:

À partir de la publication, une comparaison de la personnalisation de vidéo centrée sur l'objet. Bien que le lecteur devrait (comme toujours) se référer au PDF source pour une meilleure résolution, les vidéos sur le site du projet pourraient être une ressource plus éclairante.

À partir de la publication, une comparaison de la personnalisation de vidéo centrée sur l’objet. Bien que le lecteur devrait (comme toujours) se référer au PDF source pour une meilleure résolution, les vidéos sur le site du projet pourraient être une ressource plus éclairante dans ce cas.

Les auteurs commentent ici:

‘Il peut être vu que [Vidu], [Skyreels A2] et notre méthode atteignent des résultats relativement bons en termes d’alignement d’invite et de cohérence de sujet, mais notre qualité de vidéo est meilleure que celle de Vidu et Skyreels, grâce aux bonnes performances de génération de vidéo de notre modèle de base, c’est-à-dire [Hunyuanvideo-13B]. ‘

‘Parmi les produits commerciaux, bien que [Kling] ait une bonne qualité de vidéo, la première trame de la vidéo a un problème de copie-collage, et parfois le sujet bouge trop vite et [floue], ce qui entraîne une mauvaise expérience de visualisation.’

Les auteurs commentent en outre que Pika se comporte mal en termes de cohérence temporelle, introduisant des artefacts de sous-titres (effets d’une mauvaise curation de données, où des éléments textuels dans les clips vidéo ont été autorisés à polluer les concepts de base).

Hailuo maintient l’identité faciale, déclarent-ils, mais ne parvient pas à préserver la cohérence corporelle totale. Parmi les méthodes open-source, VACE, les chercheurs affirment qu’elle est incapable de maintenir la cohérence d’identité, tandis qu’ils prétendent que HunyuanCustom produit des vidéos avec une forte préservation d’identité, tout en conservant la qualité et la diversité.

Ensuite, des tests ont été menés pour la personnalisation de vidéo à plusieurs sujets, contre les mêmes concurrents. Comme dans l’exemple précédent, les résultats à plat du PDF ne sont pas l’équivalent des vidéos disponibles sur le site du projet, mais sont uniques parmi les résultats présentés:

Comparaisons utilisant la personnalisation de vidéo à plusieurs sujets. Veuillez vous référer au PDF pour plus de détails et de résolution.

Comparaisons utilisant la personnalisation de vidéo à plusieurs sujets. Veuillez vous référer au PDF pour plus de détails et de résolution.

La publication indique:

‘[Pika] peut générer les sujets spécifiés mais présente une instabilité dans les trames de vidéo, avec des instances d’un homme disparaissant dans un scénario et d’une femme échouant à ouvrir une porte comme indiqué. [Vidu] et [VACE] capturent partiellement l’identité humaine mais perdent des détails importants d’objets non humains, indiquant une limitation dans la représentation d’objets non humains.

‘[SkyReels A2] connaît une grave instabilité de trame, avec des changements notables dans les puces et de nombreux artefacts dans le scénario de droite.

‘En revanche, notre HunyuanCustom capture efficacement à la fois les identités humaines et non humaines, génère des vidéos qui adhèrent aux invites données, et maintient une qualité visuelle et une stabilité élevées.’

Un autre test a consisté à ‘publicité virtuelle pour les humains’, dans lequel les cadres ont été chargés d’intégrer un produit avec une personne:

À partir du tour de tests qualitatifs, des exemples de 'placement de produit' neural. Veuillez vous référer au PDF pour plus de détails et de résolution.

À partir du tour de tests qualitatifs, des exemples de ‘placement de produit’ neural. Veuillez vous référer au PDF pour plus de détails et de résolution.

Pour ce tour, les auteurs déclarent:

‘Les résultats démontrent que HunyuanCustom maintient efficacement l’identité de l’humain tout en préservant les détails du produit cible, y compris le texte qui se trouve dessus.

‘De plus, l’interaction entre l’humain et le produit semble naturelle, et la vidéo adhère étroitement à l’invite donnée, mettant en évidence le potentiel important de HunyuanCustom pour générer des vidéos publicitaires.’

Une zone où les résultats vidéo auraient été très utiles était le tour qualitatif pour la personnalisation de sujet audio, où le personnage parle l’audio correspondant à partir d’une scène et d’une posture décrites par le texte.

Résultats partiels donnés pour le tour audio – bien que les résultats vidéo auraient été préférables dans ce cas. Seule la moitié supérieure de la figure PDF est reproduite ici, car elle est grande et difficile à accommoder dans cet article. Veuillez vous référer au PDF source pour plus de détails et de résolution.

Résultats partiels donnés pour le tour audio – bien que les résultats vidéo auraient été préférables dans ce cas. Seule la moitié supérieure de la figure PDF est reproduite ici, car elle est grande et difficile à accommoder dans cet article. Veuillez vous référer au PDF source pour plus de détails et de résolution.

Les auteurs affirment:

‘Les méthodes d’animation humaine audio-drivées précédentes prennent une image humaine et un audio en entrée, où la posture, les vêtements et l’environnement de l’humain restent cohérents avec l’image donnée et ne peuvent pas générer des vidéos dans d’autres gestes et environnements, ce qui peut [limiter] leur application.

‘…[Notre] HunyuanCustom permet la personnalisation humaine audio-drivée, où le personnage parle l’audio correspondant dans une scène et une posture décrites par le texte, permettant ainsi une animation humaine audio-drivée plus flexible et contrôlable.’

D’autres tests (veuillez vous référer au PDF pour tous les détails) ont inclus un tour opposant le nouveau système à VACE et Kling 1.6 pour le remplacement de sujet de vidéo:

Test du remplacement de sujet dans le mode vidéo-à-vidéo. Veuillez vous référer au PDF source pour plus de détails et de résolution.

Test du remplacement de sujet dans le mode vidéo-à-vidéo. Veuillez vous référer au PDF source pour plus de détails et de résolution.

De ces derniers tests présentés dans la nouvelle publication, les chercheurs estiment:

‘VACE souffre d’artefacts de limite en raison d’une adhérence stricte aux masques d’entrée, entraînant des formes de sujet non naturelles et une continuité de mouvement perturbée. [Kling], en revanche, présente un effet de copie-collage, où les sujets sont directement superposés sur la vidéo, entraînant une mauvaise intégration avec l’arrière-plan.

‘En comparaison, HunyuanCustom évite efficacement les artefacts de limite, réalise une intégration transparente avec l’arrière-plan de la vidéo et maintient une forte préservation d’identité – démontrant ainsi sa performance supérieure dans les tâches d’édition de vidéo.’

Conclusion

Il s’agit d’une publication fascinante, ne serait-ce que parce qu’elle aborde quelque chose dont la scène des amateurs insatisfaits se plaint de plus en plus ces derniers temps – le manque de synchronisation des lèvres, de sorte que le réalisme accru capable dans des systèmes tels que Hunyuan Video et Wan 2.1 puisse être doté d’une nouvelle dimension d’authenticité.

Bien que la disposition de presque toutes les vidéos de comparaison sur le site du projet rende difficile la comparaison des capacités de HunyuanCustom avec les prétendants précédents, il doit être noté que très peu de projets dans l’espace de synthèse de vidéo ont le courage de s’opposer aux tests contre Kling, l’API de diffusion de vidéo commerciale qui plane toujours à ou près du sommet des classements; Tencent semble avoir fait des progrès contre ce titulaire de manière plutôt impressionnante.

 

* Le problème étant que certaines des vidéos sont si larges, courtes et à haute résolution qu’elles ne peuvent pas être lues dans des lecteurs de vidéo standard tels que VLC ou Windows Media Player, affichant des écrans noirs.

Publié pour la première fois jeudi 8 mai 2025

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai