Η γωνία του Anderson
HunyuanCustom Φέρνει Βίντεο Deepfakes από Μια Μόνη Εικόνα, Με Ήχο και Συγχρονισμό Χειλιών

Αυτό το άρθρο συζητά μια νέα έκδοση ενός πολυμορφικού μοντέλου Hunyuan Video με το όνομα ‘HunyuanCustom’. Το νέο έγγραφο έχει ένα ευρύ φάσμα κάλυψης, σε συνδυασμό με几个 προβλήματα σε πολλά από τα παραδείγματα βίντεο στη σελίδα του έργου*, που μας οδηγεί σε μια πιο γενική κάλυψη από το συνηθισμένο και σε περιορισμένη αναπαραγωγή του τεράστιου ποσού υλικού βίντεο που συνοδεύει αυτή την έκδοση (καθώς πολλά από τα βίντεο απαιτούν σημαντική επεξεργασία και επεξεργασία για να βελτιωθεί η αναγνωσιμότητα του σχεδιασμού).
Παρακαλώ σημειώστε επιπλέον ότι το έγγραφο αναφέρεται στο σύστημα γεννήτριας API με βάση το Kling ως ‘Keling’. Για σαφήνεια, αναφέρομαι στο ‘Kling’ σε όλο το κείμενο.
Η Tencent βρίσκεται στη διαδικασία κυκλοφορίας μιας νέας έκδοσης του μοντέλου Hunyuan Video, με τίτλο HunyuanCustom. Η νέα έκδοση φαίνεται να είναι σε θέση να κάνει τα μοντέλα Hunyuan LoRA περιττά, επιτρέποντας στον χρήστη να δημιουργήσει βίντεο με στυλ ‘deepfake’ μέσω μιας μίας εικόνας:
Πατήστε για αναπαραγωγή. Πρόταση: ‘Ένας άνθρωπος ακούει μουσική και μαγειρεύει νούντλς με γαρίδες στην κουζίνα’. Η νέα μέθοδος σε σύγκριση με τις κλειστές και ανοιχτές πηγές μεθόδους, συμπεριλαμβανομένων Kling, που είναι ένας σημαντικός αντίπαλος σε αυτόν τον χώρο. Πηγή: https://hunyuancustom.github.io/ (πρόωση: CPU/μνήμη-εντατική ιστοσελίδα!)
Στη στήλη πιο αριστερά του βίντεο παραπάνω, βλέπουμε την εικόνα πηγή που παρέχεται στο HunyuanCustom, ακολουθούμενη από την ερμηνεία του συστήματος της πρότασης στη δεύτερη στήλη, δίπλα της. Οι υπόλοιπες στήλες δείχνουν τα αποτελέσματα από διάφορα ιδιόκτητα και FOSS συστήματα: Kling; Vidu; Pika; Hailuo; και το Wan-βασισμένο SkyReels-A2.
Στο βίντεο παρακάτω, βλέπουμε αναπαραγωγές τριών σεναρίων που είναι απαραίτητα για αυτή την έκδοση: αντίστοιχα, πρόσωπο + αντικείμενο; μιμική ενός χαρακτήρα; και εικονική δοκιμή (πρόσωπο + ρούχα):
Πατήστε για αναπαραγωγή. Τρία παραδείγματα που έχουν επεξεργαστεί από το υλικό στη σελίδα υποστήριξης για Hunyuan Video.
Μπορούμε να παρατηρήσουμε μερικά πράγματα από αυτά τα παραδείγματα, κυρίως σχετικά με το σύστημα που βασίζεται σε μια seule εικόνα πηγή, αντί για πολλές εικόνες του ίδιου αντικειμένου.
Στην πρώτη κλιπ, ο άνθρωπος είναι ουσιαστικά ακόμα στραμμένος στην κάμερα. Καλύπτει το κεφάλι του προς τα κάτω και πλάγια σε γωνίες που δεν υπερβαίνουν τα 20-25 μοιράδες, αλλά, σε μια κλίση που υπερβαίνει αυτό, το σύστημα θα πρέπει πραγματικά να αρχίσει να μαντεύει πώς φαίνεται σε προφίλ. Αυτό είναι δύσκολο, πιθανώς αδύνατο να μετρηθεί ακριβώς από μια einz εικόνα.
Στο δεύτερο παράδειγμα, βλέπουμε ότι το μικρό κορίτσι χμείει στο αναπαραχθέν βίντεο όπως και στην στατική εικόνα πηγή. Πάλι, με αυτή τη seule εικόνα ως αναφορά, το HunyuanCustom θα πρέπει να κάνει μια σχετικά ακαδημαϊκή εκτίμηση για το πώς φαίνεται το ‘απλό πρόσωπο’ της. Επιπλέον, το πρόσωπό της δεν απομακρύνεται από την κάμερα περισσότερο από το προηγούμενο παράδειγμα (‘άνθρωπος που τρώει τσιπς’).
Στο τελευταίο παράδειγμα, βλέπουμε ότι既然 το υλικό πηγή – η γυναίκα και τα ρούχα που της ζητείται να φορέσει – δεν είναι πλήρεις εικόνες, η αναπαραγωγή έχει περικοπήσει το σενάριο για να ταιριάξει – που είναι στην πραγματικότητα μια khá καλή λύση σε ένα πρόβλημα δεδομένων!
Το σημείο είναι ότι αν και το νέο σύστημα μπορεί να χειριστεί πολλές εικόνες (όπως πρόσωπο + τσιπς, ή πρόσωπο + ρούχα), δεν φαίνεται να επιτρέπει πολλαπλές γωνίες ή εναλλακτικές απόψεις ενός seul χαρακτήρα, ώστε να μπορούν να ανταποκριθούν διαφορετικές εκφράσεις ή ασυνήθιστες γωνίες. Σε αυτό το βαθμό, το σύστημα μπορεί να δυσκολευτεί να αντικαταστήσει το αυξανόμενο οικοσύστημα των μοντέλων LoRA που έχουν εμφανιστεί γύρω από το HunyuanVideo από την κυκλοφορία του τον περασμένο Δεκέμβριο,既然 αυτά μπορούν να βοηθήσουν το HunyuanVideo να παράγει συνεπή χαρακτήρες από οποιαδήποτε γωνία και με οποιαδήποτε εκφραστική αναπαράσταση που αντιπροσωπεύεται στο σύνολο δεδομένων εκπαίδευσης (20-60 εικόνες είναι τυπικό).
Συνδεδεμένο με τον Ήχο
Για τον ήχο, το HunyuanCustom χρησιμοποιεί το LatentSync σύστημα (που είναι δυσκόλως για τους χόμπι να το εγκαταστήσουν και να πάρουν καλά αποτελέσματα) για την απόκτηση κινήσεων χειλιών που ταιριάζουν με τον ήχο και το κείμενο που παρέχει ο χρήστης:
Πατήστε για αναπαραγωγή. Διάφορα παραδείγματα συγχρονισμού χειλιών από την σελίδα HunyuanCustom, επεξεργασμένα μαζί.
Στην ώρα της γραφής, δεν υπάρχουν παραδείγματα στην αγγλική γλώσσα, αλλά αυτά φαίνονται να είναι khá καλά – το πιο πολύ αν η μέθοδος δημιουργίας τους είναι εύκολα εγκαταστημένη και προσιτή.
Επεξεργασία Υπαρχόντων Βίντεο
Το νέο σύστημα προσφέρει τι φαίνονται να είναι πολύ εντυπωσιακά αποτελέσματα για επεξεργασία βίντεο-προς-βίντεο (V2V, ή Vid2Vid), όπου ένα τμήμα ενός υφιστάμενου (πραγματικού) βίντεο είναι μασκοφωμένο και έξυπνα αντικαταστάθηκε από ένα αντικείμενο που δίνεται σε μια seule εικόνα αναφοράς. Παρακάτω είναι ένα παράδειγμα από την σελίδα υλικού:
Πατήστε για αναπαραγωγή. Μόνο το κεντρικό αντικείμενο στοχεύεται, αλλά αυτό που παραμένει γύρω του επίσης αλλάζει σε μια διαδικασία vid2vid του HunyuanCustom.
Όπως podemos δούμε, και όπως είναι τυπικό σε μια διαδικασία vid2vid, όλο το βίντεο αλλάζει σε κάποιο βαθμό από τη διαδικασία, αν και το περισσότερο στοχευμένο περιοχή, δηλαδή το παιχνίδι PLUSH. Προφανώς, μπορεί να αναπτυχθούν διαδικασίες για να δημιουργηθούν τέτοιες μετατροπές υπό μια απώλεια μάσκας που αφήνει την πλειοψηφία του περιεχομένου του βίντεο ταυτόσημο με το πρωτότυπο. Αυτό είναι αυτό που κάνει η Adobe Firefly κάτω από το καπό, και το κάνει khá καλά – αλλά είναι μια υποεκτιμώμενη διαδικασία στο FOSS γεννήτρια σκηνικού.
Αυτά τα εναλλακτικά παραδείγματα που παρέχονται κάνουν καλύτερη δουλειά στο να στοχεύουν αυτές τις ενσωματώσεις, όπως μπορούμε να δούμε στην επεξεργασμένη συλλογή παρακάτω:
Πατήστε για αναπαραγωγή. Διάφορα παραδείγματα ενσωματωμένων περιεχομένων με τη χρήση vid2vid στο HunyuanCustom, που δείχνουν αξιοσημείωτη σεβασμό για το μη στοχευμένο υλικό.
Μια Νέα Αρχή;
Αυτή η πρωτοβουλία είναι μια ανάπτυξη του έργου Hunyuan Video, και όχι μια σκληρή στροφή μακριά από αυτή τη ροή ανάπτυξης. Οι βελτιώσεις του έργου εισάγονται ως διακριτές αρχιτεκτονικές εισαγωγές και όχι ως ριζικές αλλαγές, με στόχο να επιτρέψουν στο μοντέλο να διατηρεί την πιστότητα ταυτότητας σε όλη τη διάρκεια των καδρών χωρίς να βασίζεται σε αντικειμενο-ειδικές λεπτές ρυθμίσεις, όπως με τις προσεγγίσεις LoRA ή κειμενικής αναστροφής.
Για να είμαστε σαφείς, λοιπόν, το HunyuanCustom δεν εκπαιδεύεται από την αρχή, αλλά είναι μια λεπτή ρύθμιση του μοντέλου HunyuanVideo του Δεκεμβρίου 2024.
Αυτοί που έχουν αναπτύξει μοντέλα LoRA HunyuanVideo μπορεί να αναρωτιούνται αν θα συνεχίσουν να λειτουργούν με αυτή τη νέα έκδοση, ή αν θα πρέπει να ξαναδημιουργήσουν το τροχό LoRA ξανά αν θέλουν περισσότερες δυνατότητες προσαρμογής από αυτές που είναι ενσωματωμένες σε αυτή τη νέα έκδοση.
Γενικά, μια βαθιά ρυθμισμένη έκδοση ενός υπερκλίμακων μοντέλου αλλάζει τα βαρίδια του μοντέλου αρκετά, ώστε τα LoRA που δημιουργήθηκαν για το προηγούμενο μοντέλο να μην λειτουργούν σωστά, ή καθόλου, με το νέο μοντέλο.
Συχνά, ωστόσο, μια λεπτή ρύθμιση μπορεί να προκαλέσει μια πρόκληση στις ρίζες της: ένα παράδειγμα μιας λεπτής ρύθμισης που γίνεται μια αποτελεσματική διχασμός, με ένα αφοσιωμένο οικοσύστημα και οπαδούς του δικού του, είναι η Pony Diffusion ρύθμιση του Stable Diffusion XL (SDXL). Το Pony έχει 592.000+ λήψεις στο αλλάζοντας CivitAI domaine, με một τεράστια ποικιλία LoRA που έχουν χρησιμοποιηθεί με το Pony (και όχι το SDXL) ως το βασικό μοντέλο, και που απαιτούν το Pony στην ερμηνεία.
Κυκλοφορία
Η σελίδα του έργου για το νέο έγγραφο (που έχει τίτλο HunyuanCustom: Μια Πολυμορφική-Οδηγούμενη Αρχιτεκτονική για Προσαρμοσμένη Γεννήτρια Βίντεο) περιλαμβάνει συνδέσμους σε μια σελίδα GitHub που, στην ώρα της γραφής, μόλις έγινε λειτουργική, και φαίνεται να περιέχει όλο το κώδικα και τα απαραίτητα βαρίδια για τοπική εφαρμογή, μαζί με einen προτεινόμενο χρονοδιάγραμμα (όπου το μόνο σημαντικό που còn πρέπει να έρθει είναι η ενσωμάτωση ComfyUI).
Στην ώρα της γραφής, η παρουσία του έργου στο Hugging Face είναι ακόμα μια 404. Υπάρχει, ωστόσο, μια API-βασισμένη έκδοση του συστήματος, όπου φαίνεται να μπορείτε να δοκιμάσετε το σύστημα, αρκεί να μπορείτε να παρέχετε έναν κωδικό WeChat.
Σπάνια έχω δει μια τόσο περίπλοκη και εκτεταμένη χρήση ενός τόσο μεγάλου αριθμού έργων σε μια συναρμολόγηση, όπως είναι εμφανές στο HunyuanCustom – και προφανώς κάποια από τις άδειες θα επιβάλλουν μια πλήρη κυκλοφορία.
Δύο μοντέλα ανακοινώνονται στη σελίδα GitHub: ένα 720px1280px που απαιτεί 8)GB της μνήμης GPU Peak, και ένα 512px896px που απαιτεί 60GB της μνήμης GPU Peak.
Το αποθετήριο αναφέρει ‘Η ελάχιστη απαιτούμενη μνήμη GPU είναι 24GB για 720px1280px129f αλλά πολύ αργή…Συνιστούμε να χρησιμοποιείτε μια GPU με 80GB της μνήμης για καλύτερη ποιότητα γεννήτριας’ – και επαναλαμβάνει ότι το σύστημα έχει δοκιμαστεί μέχρι τώρα μόνο σε Linux.
Το προηγούμενο μοντέλο Hunyuan Video έχει, από την επίσημη κυκλοφορία, quantized μέχρι μεγέθη όπου μπορεί να τρέξει με λιγότερο από 24GB της μνήμης VRAM, και φαίνεται λογικό να υποθέσουμε ότι το νέο μοντέλο θα επίσης προσαρμοστεί σε πιο φιλικές προς τον καταναλωτή μορφές από την κοινότητα, και ότι θα προσαρμοστεί γρήγορα για χρήση σε συστήματα Windows επίσης.
Λόγω χρονικών περιορισμών και του τεράστιου ποσού πληροφοριών που συνοδεύουν αυτή την έκδοση, μπορούμε μόνο να ρίξουμε μια ευρύτερη, παρά μια λεπτομερή, ματιά σε αυτή την έκδοση. Παρόλα αυτά, ας ανοίξουμε το καπό του HunyuanCustom λίγο.
Μια Ματιά στο Έγγραφο
Η διαδικασία δεδομένων για το HunyuanCustom, που φαίνεται να είναι σύμφωνη με το πλαίσιο GDPR, ενσωματώνει και συνθετικά και ανοιχτά δεδομένα βίντεο, συμπεριλαμβανομένων OpenHumanVid, με οκτώ βασικές κατηγορίες που αντιπροσωπεύονται: άνθρωποι, ζώα, φυτά, τοπία, οχήματα, αντικείμενα, αρχιτεκτονική, και ανιμέ.

Από το έγγραφο, μια επισκόπηση των διαφόρων συνεισφορών στο HunyuanCustom data construction pipeline. Πηγή: https://arxiv.org/pdf/2505.04512
Η αρχική φιλτράρισή αρχίζει με PySceneDetect, που διαχωρίζει τα βίντεο σε einzel-shot κλιπ. TextBPN-Plus-Plus χρησιμοποιείται τότε για να αφαιρέσει τα βίντεο που περιέχουν υπερβολικό κείμενο στην οθόνη, υπότιτλους, νερόσημα, ή λογότυπα.
Για να αντιμετωπιστούν οι ασυνεπείς διαστάσεις και διάρκεια, τα κλιπ τυποποιούνται σε πέντε δευτερόλεπτα διάρκειας και αναδιαστατοποιούνται σε 512 ή 720 εικονοστοιχεία στην κοντή πλευρά. Η αισθητική φιλτράρισή γίνεται με Koala-36M, με έναν προσαρμοσμένο κατώτατο όριο 0.06 που εφαρμόζεται για το προσαρμοσμένο σύνολο δεδομένων που έχει δημιουργηθεί από τους ερευνητές του νέου εγγράφου.
Η διαδικασία εξαγωγής του αντικειμένου συνδυάζει το Qwen7B Μεγάλο Γλωσσικό Μοντέλο (LLM), το YOLO11X πλαίσιο αναγνώρισης αντικειμένων, και το δημοφιλές InsightFace αρχιτεκτονική, για να αναγνωρίσει και να επικυρώσει ανθρώπινες ταυτότητες.
Για μη-ανθρώπινους αντικείμενα, QwenVL και Grounded SAM 2 χρησιμοποιούνται για να εξαγάγουν σχετικές θυρίδες, που απορρίπτονται αν είναι πολύ μικρές.

Παραδείγματα σεμαντικής διαχωριστικής με Grounded SAM 2, που χρησιμοποιούνται στο έργο Hunyuan Control. Πηγή: https://github.com/IDEA-Research/Grounded-SAM-2
Η εξαγωγή πολλών αντικειμένων χρησιμοποιεί Florence2 για την αναγραφή θυρίδων, και Grounded SAM 2 για διαχωρισμό, ακολουθούμενο από συγχώνευση και χρονική διαχωριστική των καδρών εκπαίδευσης.
Τα επεξεργασμένα κλιπ ενισχύονται περαιτέρω μέσω αναγραφή, χρησιμοποιώντας ένα ιδιόκτητο σύστημα αναγραφή που έχει αναπτύξει η ομάδα Hunyuan, και που παρέχει στρωμένα μεταδεδομένα όπως περιγραφές και ενδείξεις κίνησης κάμερας.
Στρατηγικές αύξησης μάσκας εφαρμόζονται κατά τη διάρκεια της εκπαίδευσης για να μειώσουν την υπερπροσαρμογή και να διασφαλίσουν ότι το μοντέλο προσαρμόζεται σε διαφορετικά σχήματα αντικειμένων.
Τα δεδομένα ήχου συγχρονίζονται χρησιμοποιώντας το LatentSync, και τα κλιπ απορρίπτονται αν οι βαθμοί συγχρονισμού πέφτουν κάτω από ένα ελάχιστο κατώτατο όριο.
Το πλαίσιο αξιολόγησης ποιότητας εικόνας HyperIQA χρησιμοποιείται για να αποκλείσει βίντεο που βαθμολογούνται κάτω από 40 (στην ιδιόμορφη κλίμακα του HyperIQA). Οι έγκυρες pistes ήχου επεξεργάζονται με Whisper για να εξαγάγουν χαρακτηριστικά για τις κατωτέρω εργασίες.
Οι συγγραφείς ενσωματώνουν το LLaVA μοντέλο βοηθού助言 κατά τη φάση αναγραφή, και τονίζουν τη κεντρική θέση που έχει αυτό το πλαίσιο στο HunyuanCustom. Το LLaVA χρησιμοποιείται για να δημιουργήσει περιγραφές εικόνας και να βοηθήσει στην ευθυγράμμιση του οπτικού περιεχομένου με τις κειμενικές προτάσεις, υποστηρίζοντας την κατασκευή ενός συνεπούς σήματος εκπαίδευσης σε όλες τις modalities:

Το HunyuanCustom υποστηρίζει τη γεννήτρια βίντεο που είναι συνεπής με την ταυτότητα, υπό την προϋπόθεση κειμένου, εικόνας, ήχου και βίντεο.
Με την αξιοποίηση των ικανοτήτων συγχρονισμού οπτικής-γλώσσας του LLaVA, η διαδικασία κερδίζει ένα επιπλέον στρώμα σεμαντικής συνεκτικότητας μεταξύ οπτικών στοιχείων και των κειμενικών περιγραφών τους – ιδιαίτερατιμήσιμο σε σεναριά με πολλά αντικείμενα ή σύνθετα σκηνικά.
Προσαρμοσμένα Βίντεο
Για να επιτρέψουν τη γεννήτρια βίντεο με βάση μια εικόνα αναφοράς και μια πρόταση, τα δύο μονάδες που κεντρίζονται γύρω από το LLaVA δημιουργήθηκαν, πρώτα προσαρμόζοντας τη δομή εισόδου του HunyuanVideo ώστε να μπορεί να δεχθεί μια εικόνα μαζί με κείμενο.
Αυτό περιελάμβανε τη διαμόρφωση της πρότασης με τρόπο που ενσωματώνει την εικόνα απευθείας ή την αναγράφει με μια σύντομη περιγραφή ταυτότητας. Ένας διαχωριστικός κωδικός χρησιμοποιήθηκε για να σταματήσει η εικόνα από το να υπερβεί το περιεχόμενο της πρότασης.
Καθώς ο οπτικός κωδικοποιητής του LLaVA τείνει να συμπιέζει ή να απορρίπτει λεπτομερείς χωρικές λεπτομέρειες κατά τη διάρκεια της ευθυγράμμισης των χαρακτηριστικών εικόνας και κειμένου (ιδιαίτερα όταν μεταφράζει μια seule εικόνα αναφοράς σε μια γενική σεμαντική ενσωμάτωση), ένας μονάδας ενίσχυσης ταυτότητας ενσωματώθηκε. Καθώς σχεδόν όλα τα μοντέλα γεννήτριας βίντεο έχουν κάποια δυσκολία στη διατήρηση της ταυτότητας χωρίς ένα LoRA, ακόμη και σε ένα κλιπ πέντε δευτερολέπτων, η απόδοση αυτού του μονάδας στη δοκιμή της κοινότητας μπορεί να αποδειχθεί σημαντική.
Οπωσδήποτε, η εικόνα αναφοράς αναδιαστατοποιείται και κωδικοποιείται χρησιμοποιώντας τον αιτιολογικό 3D-VAE από το αρχικό μοντέλο HunyuanVideo, και το λατινικό της εισάγεται στο βίντεο λατινικό σε όλη τη διάρκεια του χρονικού άξονα, με μια χωρική μετατόπιση που εφαρμόζεται για να αποτρέψει την εικόνα από το να αναπαραχθεί απευθείας στην έξοδο, ενώ vẫn οδηγεί τη γεννήτρια.
Το μοντέλο εκπαιδεύτηκε χρησιμοποιώντας Flow Matching, με δείγματα θορύβου που τραβήχτηκαν από μια logit-κανονική κατανομή – και το δίκτυο εκπαιδεύτηκε για να ανακτήσει το σωστό βίντεο από αυτά τα θορυβώδη λατινικά. Το LLaVA και ο γεννήτορας βίντεο ήταν και οι δύο λεπτά ρυθμισμένοι μαζί, ώστε η εικόνα και η πρόταση να οδηγούν την έξοδο πιο ομαλά και να διατηρούν την ταυτότητα του αντικειμένου.
Για πολλαπλά αντικείμενα, κάθε ζεύγος εικόνας-κειμένου ενσωματώνεται ξεχωριστά και ανατίθεται σε μια διαφορετική χρονική θέση, επιτρέποντας την ταυτότητα να διακρίνεται, και υποστηρίζοντας τη γεννήτρια σκηνών που περιλαμβάνουν πολλά互одействούντα αντικείμενα.
Ήχος και Όραση
Το HunyuanCustom συνδέει την γεννήτρια ήχου/ομιλίας χρησιμοποιώντας τόσο την είσοδο ήχου του χρήστη όσο και μια κειμενική πρόταση, επιτρέποντας στους χαρακτήρες να μιλούν μέσα σε σκηνές που ανταποκρίνονται στην περιγραφόμενη ρύθμιση.
Για να υποστηρίξουν αυτό, ένας Identity-disentangled AudioNet μονάδας εισάγει χαρακτηριστικά ήχου χωρίς να διαταράσσει τα σήματα ταυτότητας που ενσωματώνονται από την εικόνα αναφοράς και την πρόταση. Αυτά τα χαρακτηριστικά ευθυγραμμίζονται με το συμπιεσμένο χρονοδιάγραμμα βίντεο, διαιρούνται σε τμήματα καδρών, και εγχέονται χρησιμοποιώντας einen χωρική cross-attention μηχανισμό που κρατά κάθε кадρό απομονωμένο, διατηρώντας την ταυτότητα του αντικειμένου και αποφεύγοντας τη χρονική παρέμβαση.
Ένας δεύτερος χρονικός μηχανισμός ένεσης παρέχει μεγαλύτερο έλεγχο πάνω στη χρονική και κίνηση, εργαζόμενος σε συνδυασμό με το AudioNet, χαρτογραφώντας χαρακτηριστικά ήχου σε συγκεκριμένες περιοχές της λατινικής ακολουθίας, και χρησιμοποιώντας einen Multi-Layer Perceptron (MLP) για να τα μετατρέψει σε token-wise μετατοπίσεις κίνησης. Αυτό επιτρέπει τις χειρονομίες και τις κινήσεις του προσώπου να ακολουθούν τον ρυθμό και την έμφαση της ομιλίας με μεγαλύτερη ακρίβεια.
Το HunyuanCustom επιτρέπει την επεξεργασία των αντικειμένων σε υπάρχοντα βίντεο, αντικαθιστώντας ή εισάγοντας ανθρώπους ή αντικείμενα σε μια σκηνή χωρίς να χρειάζεται να ξαναχτίσει ολόκληρο το κλιπ από την αρχή. Αυτό το καθιστά χρήσιμο για εργασίες που涉αζουν την αλλαγή της εμφάνισης ή της κίνησης με έναν στοχευμένο τρόπο.
Πατήστε για αναπαραγωγή. Ένα ακόμη παράδειγμα από την σελίδα υποστήριξης.
Για να διευκολύνουν την αποτελεσματική αντικατάσταση αντικειμένων σε υπάρχοντα βίντεο, το νέο σύστημα αποφεύγει την πόρων-εντατική προσέγγιση των πρόσφατων μεθόδων όπως η τρέχουσα δημοφιλής VACE, ή αυτές που ενσωματώνουν ολόκληρες ακολουθίες βίντεο μαζί, προτιμώντας αντ’ αυτού την συμπίεση μιας εικόνας αναφοράς χρησιμοποιώντας τον προ-εκπαιδευμένο αιτιολογικό 3D-VAE – ευθυγραμμίζοντάς την με το εσωτερικό βίντεο λατινικό της διαδικασίας γεννήτριας, και τότε προσθέτοντας τα δύο μαζί. Αυτό κρατά τη διαδικασία σχετικά ελαφριά, ενώ vẫn επιτρέπει το εξωτερικό περιεχόμενο βίντεο να οδηγεί την έξοδο.
Ένας μικρός νευρωνικός συνδετικός χειρίζεται την ευθυγράμμιση μεταξύ του καθαρού εισόδου βίντεο και των θορυβωδών λατινικών που χρησιμοποιούνται στη γεννήτρια. Το σύστημα δοκιμάζει δύο τρόπους εισαγωγής αυτής της πληροφορίας: συγχωνεύοντας τα δύο σύνολα χαρακτηριστικών πριν τα συμπιέσει ξανά; και προσθέτοντας τα χαρακτηριστικά кадρά προς кадρά. Η δεύτερη μέθοδος λειτουργεί καλύτερα, οι συγγραφείς βρήκαν, και αποφεύγει την απώλεια ποιότητας ενώ διατηρεί την υπολογιστική φόρτωση αμετάβλητη.
Δεδομένα και Δοκιμές
Στις δοκιμές, τα μετρικά που χρησιμοποιήθηκαν ήταν: το μονάδα συνεκτικότητας ταυτότητας στο ArcFace, που εξάγει ενσωματώσεις προσώπου από την εικόνα αναφοράς και κάθε кадρό του γεννημένου βίντεο, και τότε υπολογίζει τη μέση κοσινική ομοιότητα μεταξύ τους; ομοιότητα αντικειμένου, μέσω της αποστολής τμημάτων YOLO11x στο Dino 2 για σύγκριση; CLIP-B, ευθυγράμμιση κειμένου-βίντεο, που μετράει την ομοιότητα μεταξύ της πρότασης και του γεννημένου βίντεο; CLIP-B ξανά, για να υπολογίσει την ομοιότητα μεταξύ κάθε кадρού και των γειτονικών του καδρών και του πρώτου кадρού, καθώς και τη χρονική συνεκτικότητα; και δυναμικό βαθμό, όπως ορίζεται από το VBench.
Όπως αναφέρθηκε νωρίτερα, οι βασικοί ανταγωνιστές ήταν Hailuo; Vidu 2.0; Kling (1.6); και Pika. Οι ανταγωνιστές FOSS ήταν VACE και SkyReels-A2.

Αξιολόγηση απόδοσης μοντέλου που συγκρίνει το HunyuanCustom με τις principales μεθόδους προσαρμογής βίντεο σε διάφορους τομείς: ID συνεκτικότητα (Face-Sim), ομοιότητα αντικειμένου (DINO-Sim), ευθυγράμμιση κειμένου-βίντεο (CLIP-B-T), χρονική συνεκτικότητα (Temp-Consis), και ένταση κίνησης (DD). Τα βέλτιστα και υπο-βέλτιστα αποτελέσματα εμφανίζονται με έντονα και υπογραμμισμένα, αντίστοιχα.
Από αυτά τα αποτελέσματα, οι συγγραφείς αναφέρουν:
‘Το HunyuanCustom μας επιτύγχαίνει την καλύτερη συνεκτικότητα ID και ομοιότητα αντικειμένου. Επίσης, επιτύγχαίνει συγκρίσιμα αποτελέσματα στην ευθυγράμμιση πρότασης και τη χρονική συνεκτικότητα. [Hailuo] έχει το καλύτερο σκορ CLIP-B, επειδή μπορεί να ακολουθήσει τις οδηγίες κειμένου καλά με μόνο συνεκτικότητα ID, θυσιάζοντας τη συνεκτικότητα των μη-ανθρώπινων αντικειμένων (η χειρότερη DINO-Sim). Σε όρους Δυναμικού Βαθμού, [Vidu] και [VACE] εκτελούνται κακώς, που μπορεί να οφείλεται στο μικρό μέγεθος του μοντέλου.’
Αν και η σελίδα του έργου είναι κορεσμένη με βίντεο σύγκρισης (η διάταξη των οποίων φαίνεται να έχει σχεδιαστεί για αισθητική της ιστοσελίδας παρά για εύκολη σύγκριση), δεν περιλαμβάνει προς το παρόν ένα βίντεο ισοδύναμο με τα στατικά αποτελέσματα που συγχωνεύονται μαζί στο PDF, σε σχέση με τις αρχικές ποιοτικές δοκιμές. Αν και το περιλαμβάνω εδώ, σας ενθαρρύνω να κάνετε μια στενή εξέταση των βίντεο στη σελίδα του έργου, καθώς παρέχουν μια καλύτερη εντύπωση των αποτελεσμάτων:

Από το έγγραφο, μια σύγκριση σε κεντρική προσαρμογή βίντεο. Αν και ο αναγνώστης πρέπει (όπως πάντα) να αναφερθεί στο PDF για καλύτερη ανάλυση, τα βίντεο στη σελίδα του έργου μπορεί να είναι ένα πιο φωτιστικό πόρο σε αυτή την περίπτωση.
Οι συγγραφείς σχολιάζουν εδώ:
‘Μπορεί να φανεί ότι [Vidu], [Skyreels A2] και η μέθοδός μας επιτύγχαίνουν σχετικά καλά αποτελέσματα στην ευθυγράμμιση πρότασης και τη συνεκτικότητα αντικειμένου, αλλά η ποιότητα βίντεο μας είναι καλύτερη από Vidu και Skyreels, χάρη στην καλή απόδοση της βασικής μας γεννήτριας, δηλαδή [Hunyuanvideo-13B]. ‘
‘Μεταξύ εμπορικών προϊόντων, αν και [Kling] έχει καλή ποιότητα βίντεο, η πρώτη καρέ του βίντεο έχει ένα πρόβλημα αντίγραφου-επικόλλησης, και đôi και ο χρόνος κίνησης του αντικειμένου είναι πολύ γρήγορος και [θολός], οδηγώντας σε μια κακή οπτική εμπειρία.’
Οι συγγραφείς σχολιάζουν περαιτέρω ότι η Pika εκτελείται κακώς σε όρους χρονικής συνεκτικότητας, εισάγοντας υποτιτλικές αρτεφάκτ (επιπτώσεις από κακή επιμέλεια δεδομένων, όπου κείμενο στοιχεία σε κλιπ βίντεο έχουν επιτρέψει να μολύνουν τις βασικές έννοιες).
Το Hailuo διατηρεί την ταυτότητα του προσώπου, αναφέρουν, αλλά δεν διατηρεί τη συνεκτικότητα του σώματος. Μεταξύ ανοιχτών μεθόδων, η VACE, οι ερευνητές ισχυρίζονται, δεν μπορεί να διατηρήσει τη συνεκτικότητα της ταυτότητας, ενώ το HunyuanCustom παράγει βίντεο με ισχυρή διατήρηση ταυτότητας, ενώ διατηρεί την ποιότητα και τη ποικιλία.
Επόμενη, δοκιμές διεξήχθησαν για πολλαπλή προσαρμογή βίντεο, ενάντια στους ίδιους ανταγωνιστές. Όπως και στο προηγούμενο παράδειγμα, τα επίπεδα αποτελέσματα PDF δεν είναι ισοδύναμα με τα βίντεο που διατίθενται στη σελίδα του έργου, αλλά είναι μοναδικά μεταξύ των αποτελεσμάτων που παρουσιάζονται:

Συγκρίσεις με πολλαπλή προσαρμογή βίντεο. Παρακαλώ δείτε το PDF για καλύτερη λεπτομέρεια και ανάλυση.
Το έγγραφο αναφέρει:
‘[Pika] μπορεί να γεννήσει τα καθορισμένα αντικείμενα αλλά εμφανίζει αστάθεια στα καρέ βίντεο, με περιπτώσεις ενός άνδρα που εξαφανίζεται σε ένα σενάριο και μια γυναίκα που αποτυγχάνει να ανοίξει μια πόρτα όπως καθοδηγείται. [Vidu] και [VACE] συλλαμβάνουν μερικώς την ταυτότητα του ανθρώπου αλλά χάνουν σημαντικές λεπτομέρειες μη-ανθρώπινων αντικειμένων, υποδεικνύοντας μια περιορισμένη αναπαράσταση μη-ανθρώπινων αντικειμένων. ‘
‘[SkyReels A2] βιώνει σοβαρή αστάθεια καρέ, με εμφανείς αλλαγές σε τσιπ και πολλά αρτεφάκτ στο右 σενάριο. ‘
‘Αντίθετα, το HunyuanCustom μας συλλαμβάνει αποτελεσματικά τόσο ανθρώπινες όσο και μη-ανθρώπινες ταυτότητες, γεννά βίντεο που ταιριάζουν με τις δοθείσες προτάσεις, και διατηρεί υψηλή οπτική ποιότητα και σταθερότητα.’
Μια περαιτέρω πειραματική δοκιμή ήταν ‘εικονική διαφήμιση ανθρώπου’, όπου τα πλαίσια ζητήθηκαν να ενσωματώσουν ένα προϊόν με ένα πρόσωπο:

Από τη ποιοτική δοκιμή, παραδείγματα νευρωνικής ‘τοποθέτησης προϊόντος’. Παρακαλώ δείτε το PDF για καλύτερη λεπτομέρεια και ανάλυση.
Για αυτή τη γύρα, οι συγγραφείς αναφέρουν:
‘Τα αποτελέσματα δείχνουν ότι το HunyuanCustom διατηρεί αποτελεσματικά την ταυτότητα του ανθρώπου ενώ διατηρεί τις λεπτομέρειες του στόχου προϊόντος, συμπεριλαμβανομένου του κειμένου σε αυτό. ‘
‘Επιπλέον, η αλληλεπίδραση μεταξύ του ανθρώπου και του προϊόντος φαίνεται φυσική, και το βίντεο ταιριάζει στενά με την δοθείσα πρόταση, υπογραμμίζοντας το σημαντικό потенシャル του HunyuanCustom στη γεννήτρια διαφημιστικών βίντεο.’
Ένας τομέας όπου τα αποτελέσματα βίντεο θα ήταν πολύ χρήσιμα ήταν η ποιοτική γύρα για την προσαρμογή αντικειμένου με ήχο, όπου ο χαρακτήρας μιλάει τον αντίστοιχο ήχο από μια κειμενική περιγραφή σκηνής και στάσης.

Μερικά αποτελέσματα δίνονται για τη γύρα ήχου – αν και τα αποτελέσματα βίντεο θα ήταν προτιμότερα σε αυτή την περίπτωση. Μόνο το πάνω μισό της φιγούρας PDF αναπαράγεται εδώ, καθώς είναι μεγάλο και δύσκολο να τοποθετηθεί σε αυτό το άρθρο. Παρακαλώ αναφερθείτε στο PDF για καλύτερη λεπτομέρεια και ανάλυση.
Οι συγγραφείς ισχυρίζονται:
‘Προηγούμενες μεθόδους οδηγούμενες από ήχο για ανθρώπινη animation εισάγουν μια εικόνα ανθρώπου και ήχου, όπου η στάση, το ένδυμα και το περιβάλλον του ανθρώπου παραμένουν συνεπή με την δοθείσα εικόνα και δεν μπορούν να γεννήσουν βίντεο σε άλλες στάσεις και περιβάλλοντα, που μπορεί να [περιορίσουν] την εφαρμογή τους. ‘
‘…[Το HunyuanCustom] μας επιτρέπει την οδηγούμενη από ήχο προσαρμογή ανθρώπου, όπου ο χαρακτήρας μιλάει τον αντίστοιχο ήχο σε μια κειμενική περιγραφή σκηνής και στάσης, επιτρέποντας μια πιο ευέλικτη και ελεγχόμενη οδηγούμενη από ήχο ανθρώπινη animation.’
Περαιτέρω δοκιμές (παρακαλώ δείτε το PDF για όλες τις λεπτομέρειες) περιελάμβαναν μια γύρα που έβαλε το νέο σύστημα ενάντια στο VACE και Kling 1.6 για αντικατάσταση αντικειμένου βίντεο:

Δοκιμή αντικατάστασης αντικειμένου σε λειτουργία βίντεο-προς-βίντεο. Παρακαλώ αναφερθείτε στο PDF για καλύτερη λεπτομέρεια και ανάλυση.
Από αυτές, οι τελευταίες δοκιμές που παρουσιάζονται στο νέο έγγραφο, οι ερευνητές σχολιάζουν:
‘Το VACE υποφέρει από αρτεφάκτ ορίων λόγω αυστηρής τήρησης των εισόδων μάσκας, οδηγώντας σε μη φυσικά σχήματα αντικειμένων και διαταραγμένη συνέχεια κίνησης. [Kling], αντίθετα, εμφανίζει ένα αποτέλεσμα αντίγραφου-επικόλλησης, όπου τα αντικείμενα τοποθετούνται απευθείας πάνω στο βίντεο, οδηγώντας σε μια κακή ολοκλήρωση με το φόντο. ‘
‘Σε σύγκριση, το HunyuanCustom αποφεύγει αρτεφάκτ ορίων, επιτύγχαίνει μια αμαδιαία ολοκλήρωση με το βίντεο φόντο, και διατηρεί ισχυρή διατήρηση ταυτότητας—δείχνοντας την υπεροχή του σε εργασίες επεξεργασίας βίντεο.’
Συμπέρασμα
Αυτή είναι μια fascinující έκδοση, όχι τουλάχιστον επειδή αντιμετωπίζει κάτι που η αέναα απατημένη σκηνή χόμπι έχει παραπονεθεί περισσότερο πρόσφατα – την έλλειψη συγχρονισμού χειλιών, ώστε η αυξημένη πραγματικότητα που είναι ικανή σε συστήματα όπως Hunyuan Video και Wan 2.1 μπορεί να δοθεί μια νέα διάσταση αυθεντικότητας.
Αν και η διάταξη σχεδόν όλων των συγκριτικών βίντεο παραδειγμάτων στη σελίδα του έργου κάνει δύσκολο να συγκρίνουμε τις ικανότητες του HunyuanCustom με τους προηγούμενους ανταγωνιστές, πρέπει να σημειωθεί ότι πολύ λίγα έργα στο χώρο της σύνθεσης βίντεο έχουν το θάρρος να τοποθετήσουν τον εαυτό τους σε δοκιμές ενάντια στο Kling, το εμπορικό API διάχυσης βίντεο που είναι πάντα κοντά ή κοντά στο vrchol των leader-boards; Η Tencent φαίνεται να έχει κάνει πρόοδο ενάντια σε αυτόν τον εδραιωμένο αντίπαλο με έναν khá εντυπωσιακό τρόπο.
* Το πρόβλημα είναι ότι κάποια από τα βίντεο είναι τόσο широкά, σύντομα και υψηλής ανάλυσης που δεν θα παίξουν σε τυπικούς παίκτες βίντεο όπως το VLC ή το Windows Media Player, εμφανίζοντας μαύρες οθόνες.
Πρώτη δημοσίευση Πέμπτη, 8 Μαΐου 2025












