Η γωνία του Anderson
Η Άνοδος των Hunyuan Video Deepfakes

Λόγω της φύσης ορισμένων από τα υλικά που συζητιούνται εδώ, αυτό το άρθρο θα περιέχει λιγότερους συνδέσμους αναφοράς και εικονογραφήσεις από το συνηθισμένο.
Κάτι αξιοσημείωτο συμβαίνει αυτή τη στιγμή στην κοινότητα της συνθετικής νοημοσύνης, αν και η σημασία του μπορεί να χρειαστεί κάποιο χρόνο για να γίνει σαφής. Οι χομπίστες εκπαιδεύουν μοντέλα γενετικής νοημοσύνης βίντεο για να αναπαράγουν τις ομοιότητες των ανθρώπων, χρησιμοποιώντας βίντεο-βασισμένες LoRAs στο πρόσφατα κυκλοφορημένο ανοιχτό κώδικα πλαίσιο Hunyuan Video.*
Πατήστε για αναπαραγωγή. Ποικίλες αποτελέσματα από Hunyuan-based LoRA customizations ελεύθερα διαθέσιμα στην κοινότητα Civit. Με την εκπαίδευση μοντέλων χαμηλού βαθμού προσαρμογής (LoRAs), τα προβλήματα με τη χρονική σταθερότητα, τα οποία έχουν πLAGUED την γενετική σύνθεση βίντεο για δύο χρόνια, μειώνονται σημαντικά. Πηγές: civit.ai
Στο βίντεο που εμφανίζεται παραπάνω, οι ομοιότητες των ηθοποιών Natalie Portman, Christina Hendricks και Scarlett Johansson, μαζί με τον τεχνολογικό ηγέτη Elon Musk, έχουν εκπαιδευτεί σε σχετικά μικρά αρχεία για το σύστημα Hunyuan, το οποίο μπορεί να εγκατασταθεί χωρίς φίλτρα περιεχομένου (όπως φίλτρα NSFW) στον υπολογιστή του χρήστη.
Ο δημιουργός του LoRA Christina Hendricks που εμφανίζεται παραπάνω δηλώνει ότι χρειάστηκαν μόνο 16 εικόνες από την τηλεοπτική σειρά Mad Men για να αναπτύξει το μοντέλο (το οποίο είναι μια απλή λήψη 307mb); πολλαπλά μηνύματα από την κοινότητα Stable Diffusion στο Reddit και Discord επιβεβαιώνουν ότι LoRAs αυτού του είδους δεν απαιτούν μεγάλα ποσά δεδομένων εκπαίδευσης ή χρόνους εκπαίδευσης, στις περισσότερες περιπτώσεις.
Πατήστε για αναπαραγωγή. Ο Arnold Schwarzenegger αναβιώνει σε ένα Hunyuan βίντεο LoRA που μπορεί να κατεβάσει από το Civit. Δείτε https://www.youtube.com/watch?v=1D7B9g9rY68 για thêm παραδείγματα, από τον ενθουσιώδη Bob Doyle.
Τα Hunyuan LoRAs μπορούν να εκπαιδευτούν είτε σε στατικές εικόνες είτε σε βίντεο, αν και η εκπαίδευση σε βίντεο απαιτεί μεγαλύτερες απαιτήσεις υλικού και αυξημένο χρόνο εκπαίδευσης.
Το μοντέλο Hunyuan Video διαθέτει 13 δισεκατομμύρια παραμέτρους, υπερβαίνοντας τις 12 δισεκατομμύρια παραμέτρους του Sora και πολύ περισσότερες από το λιγότερο ικανό μοντέλο Hunyuan-DiT που κυκλοφόρησε σε ανοιχτό κώδικα το καλοκαίρι του 2024, το οποίο έχει μόνο 1,5 δισεκατομμύρια παραμέτρους.
Όπως συνέβη πριν από δύομισι χρόνια με το Stable Diffusion και το LoRA (δείτε παραδείγματα του Stable Diffusion 1.5 εδώ), το βασικό μοντέλο έχει μια πολύ πιο περιορισμένη κατανόηση των προσωπικοτήτων των διασημοτήτων, σε σύγκριση με το επίπεδο πιστότητας που μπορεί να επιτευχθεί μέσω της υλοποίησης LoRA.
Επιδράκως, ένα εξατομικευμένο, επικεντρωμένο LoRA λαμβάνει μια “δωρεάν διαδρομή” στις σημαντικές ικανότητες σύνθεσης του βασικού μοντέλου Hunyuan, προσφέροντας μια αξιοσημείωτα πιο αποτελεσματική ανθρώπινη σύνθεση από ότι μπορεί να επιτευχθεί είτε από τα αυτοενκωδικοποιητές deepfakes του 2017 είτε με την προσθήκη κίνησης σε στατικές εικόνες μέσω συστημάτων όπως το LivePortrait.
Όλα τα LoRAs που απεικονίζονται εδώ μπορούν να κατεβαστούν δωρεάν από την πολύ δημοφιλή κοινότητα Civit, ενώ ο μεγαλύτερος αριθμός παλαιότερων εξατομικευμένων LoRAs “στατικών εικόνων” μπορεί επίσης να δημιουργήσει “σπέρματα” εικόνων για τη διαδικασία δημιουργίας βίντεο (δηλαδή, εικόνα-βίντεο, μια εκκρεμής κυκλοφορία για το Hunyuan Video, αν και υπάρχουν παρόδι για την ώρα).
Πατήστε για αναπαραγωγή. Παραπάνω, δείγματα από ένα “στατικό” Flux LoRA. Και παρακάτω, παραδείγματα από ένα Hunyuan βίντεο LoRA με τον μουσικό Taylor Swift. Και τα δύο LoRAs είναι διαθέσιμα δωρεάν στην κοινότητα Civit.
Όπως γράφω, η ιστοσελίδα Civit προσφέρει 128 αποτελέσματα αναζήτησης για ‘Hunyuan’. Почти όλα αυτά είναι σε κάποιο βαθμό NSFW μοντέλα. 22 απεικονίζουν διασημότητες. 18 σχεδιάζονται για να διευκολύνουν τη δημιουργία πορνογραφικού περιεχομένου. Και μόνο επτά από αυτά απεικονίζουν άνδρες αντί για γυναίκες.
Τι είναι καινούριο;
Λόγω της εξελισσόμενης φύσης του όρου deepfake και της περιορισμένης δημόσιας κατανόησης των (πολύ σοβαρών) περιορισμών των συστημάτων σύνθεσης βίντεο με τη βοήθεια της νοημοσύνης, η σημασία του Hunyuan LoRA δεν είναι εύκολο να κατανοηθεί για κάποιον που ακολουθεί την κοινότητα της γενετικής νοημοσύνης. Ας αναλύσουμε μερικές από τις βασικές διαφορές μεταξύ Hunyuan LoRAs και προηγούμενων προσεγγίσεων για την ταυτότητα-βασισμένη σύνθεση βίντεο.
1: Ανεμπόδιστη Τοπική Εγκατάσταση
Το πιο σημαντικό χαρακτηριστικό του Hunyuan Video είναι το γεγονός ότι μπορεί να κατεβαστεί τοπικά και να τοποθετηθεί ένα πολύ ισχυρό και απαράδεκτο σύστημα σύνθεσης βίντεο με τη βοήθεια της νοημοσύνης στα χέρια του καθημερινού χρήστη, καθώς και της κοινότητας VFX (στο βαθμό που επιτρέπουν οι άδειες σε γεωγραφικές περιοχές).
Η τελευταία φορά που συνέβη κάτι τέτοιο ήταν η κυκλοφορία του μοντέλου Stable Diffusion το καλοκαίρι του 2022. Τότε, το DALL-E2 της OpenAI είχε κατακτήσει τη φαντασία του κοινού, αν και το DALLE-2 ήταν μια πληρωμένη υπηρεσία με σημαντικές περιορισμοί (οι οποίοι αυξήθηκαν με τον καιρό).
Όταν κυκλοφόρησε το Stable Diffusion, και η προσαρμογή χαμηλού βαθμού έκανε δυνατή τη σύνθεση εικόνων της ταυτότητας οποιουδήποτε ατόμου (διασημότητας ή όχι), το τεράστιο ενδιαφέρον των dévelopερ και των καταναλωτών βοήθησε το Stable Diffusion να ξεπεράσει τη δημοτικότητα του DALLE-2. Αν και το δεύτερο ήταν ένα πιο ικανό σύστημα out-of-the-box, τα φίλτρα цензуры του θεωρήθηκαν ονέρευτα από πολλούς χρήστες, και η εξατομίκευση δεν ήταν δυνατή.
Αξιολόγως, η ίδια σκηνή ισχύει τώρα μεταξύ Sora και Hunyuan – ή, πιο ακριβώς, μεταξύ Sora-grade ιδιωτικών συστημάτων σύνθεσης βίντεο και ανοιχτών πηγών, από τις οποίες το Hunyuan είναι το πρώτο – αλλά πιθανώς όχι το τελευταίο (εδώ, θεωρήστε ότι η Flux θα κερδίσει σημαντικό έδαφος στο Stable Diffusion).
Οι χρήστες που επιθυμούν να δημιουργήσουν Hunyuan LoRA εξόδου αλλά δεν διαθέτουν επαρκές υλικό, μπορούν, όπως πάντα, να εκχωρήσουν το τμήμα GPU της εκπαίδευσης σε online υπηρεσίες όπως το RunPod. Αυτό δεν είναι το ίδιο με τη δημιουργία βίντεο με τη βοήθεια της νοημοσύνης σε πλατφόρμες όπως το Kaiber ή το Kling, поскольку δεν υπάρχει σεμάντική ή εικονογραφική φιλτράρισμα (цензура) που εμπλέκεται στην ενοικίαση μιας online GPU για την υποστήριξη μιας τοπικής ροής εργασίας.
2: Χωρίς Ανάγκη για ‘Host’ Βίντεο και Υψηλή Προσπάθεια
Όταν τα deepfakes εμφανίστηκαν στη σκηνή στο τέλος του 2017, ο ανώνυμος κώδικας θα εξελισσόταν σε mainstream forks DeepFaceLab και FaceSwap (以及 DeepFaceLive πραγματικού χρόνου deepfaking σύστημα).
Αυτή η μέθοδος απαιτούσε την προσεκτική επιμέλεια χιλιάδων εικόνων προσώπου για κάθε ταυτότητα που θα ανταλλαγεί. Όσο λιγότερη προσπάθεια επενδιδόταν σε αυτό το στάδιο, τόσο λιγότερο αποτελεσματικό θα ήταν το μοντέλο. Επιπλέον, οι χρόνοι εκπαίδευσης ποικίλλουν μεταξύ 2-14 ημερών, ανάλογα με το διαθέσιμο υλικό, που έτρεχαν ακόμη και ικανά συστήματα μακροπρόθεσμα.
Όταν το μοντέλο ήταν τελικά έτοιμο, μπορούσε μόνο να επιβάλλει πρόσωπα σε υπάρχοντα βίντεο και συνήθως χρειαζόταν ένα “στόχο” (δηλαδή, πραγματική) ταυτότητα που ήταν κοντά σε εμφάνιση με την υπεραποτιθέμενη ταυτότητα.
Πιο πρόσφατα, ROOP, LivePortrait και πολλά παρόμοια πλαίσια έχουν παρέχουν παρόμοια λειτουργικότητα με πολύ λιγότερη προσπάθεια και συχνά με ανώτερα αποτελέσματα – αλλά χωρίς τη δυνατότητα να δημιουργήσουν ακριβείς πλήρεις deepfakes – ή οποιοδήποτε άλλο στοιχείο εκτός από τα πρόσωπα.

Παραδείγματα του ROOP Unleashed και του LivePortrait (παράθυρο κάτω αριστερά), από το ρεύμα περιεχομένου του Bob Doyle στο YouTube. Πηγές: https://www.youtube.com/watch?v=i39xeYPBAAM και https://www.youtube.com/watch?v=QGatEItg2Ns
3: Μαζικά Βελτιωμένη Χρονική Σταθερότητα
Η χρονική σταθερότητα έχει sido το Άγιο Δισκοπότηρο της σύνθεσης βίντεο για αρκετά χρόνια τώρα. Η χρήση ενός LoRA, μαζί με κατάλληλες προτροπές, δίνει μια Hunyuan βίντεο σύνθεση μια σταθερή αναφορά ταυτότητας για να ακολουθήσει. Θεωρητικά (αυτά είναι πρώιμα ημέρες), θα ήταν δυνατό να εκπαιδεύσετε πολλά LoRAs μιας συγκεκριμένης ταυτότητας, κάθε ένα φορούσε συγκεκριμένα ρούχα.
Υπό αυτές τις προϋποθέσεις, τα ρούχα είναι επίσης λιγότερο πιθανό να “μεταλλαχθούν” κατά τη διάρκεια μιας βίντεο σύνθεσης (εφόσον το γενετικό σύστημα βασίζεται σε μια πολύ περιορισμένη παράθυρο προηγούμενων πλαισίων).
(Εναλλακτικά, όπως με τα συστήματα εικόνας-βασισμένων LoRA, μπορείτε να εφαρμόσετε πολλά LoRAs, όπως ταυτότητα + στολή LoRAs, σε μια seule βίντεο σύνθεση)
4: Πρόσβαση στο ‘Πείραμα Ανθρώπου’
Όπως πρόσφατα ανέφερα, ο ιδιωτικός και FAANG-επίπεδο τομέας της γενετικής νοημοσύνης φαίνεται τώρα να είναι τόσο προσεκτικός σχετικά με τις δυνατότητες σύνθεσης ανθρώπινου βίντεο των έργων του, ότι τα πραγματικά άνθρωποι σπάνια εμφανίζονται σε σελίδες έργων για σημαντικές ανακοινώσεις και κυκλοφορίες. Αντίθετα, η σχετική δημοσιευμένη λογοτεχνία τείνει όλο και περισσότερο να δείχνει “γλυκά” και “μη απειλητικά” αντικείμενα σε συνθετικά αποτελέσματα.
Επιπτώσεις
Από τη στιγμή που μια αναζήτηση για ‘Hunyuan’ στην κοινότητα Civit δείχνει κυρίως LoRAs διασημοτήτων και “σκληρά” LoRAs, η κεντρική επιπτώσεις της εμφάνισης Hunyuan LoRAs είναι ότι θα χρησιμοποιηθούν για τη δημιουργία AI πορνογραφικών (ή άλλων δυσφημιστικών) βίντεο πραγματικών ανθρώπων – διασημοτήτων και αγνώστων.
Η Κινητήρια Δύναμη
Όπως πάντα, η πορνογραφία παραμένει η κινητήρια δύναμη της τεχνολογίας. Όποια και αν είναι η γνώμη μας για τέτοια χρήση, αυτή η ακαταμάχητη δύναμη οδηγεί τις προόδους στην κατάσταση της τεχνολογίας που μπορούν τελικά να ωφελήσουν μια πιο κυρίαρχη υιοθέτηση.
Σε αυτή την περίπτωση, είναι πιθανό ότι το τίμημα θα είναι υψηλότερο από το συνηθισμένο,既然 η ανοιχτή πηγή της υπερπραγματικής δημιουργίας βίντεο έχει σαφείς επιπτώσεις για εγκληματική, πολιτική και ηθική κακοποίηση.
VFX
Η τεράστια αύξηση της χρονικής σταθερότητας που προσφέρουν τα Hunyuan Video LoRAs είναι ένα σαφές πλεονέκτημα για τη βιομηχανία AI οπτικών εφέ, η οποία βασίζεται πολύ στην προσαρμογή ανοιχτού κώδικα.
Όπως και η κοινότητα των χομπίστας, οι εταιρείες VFX πρέπει να περιμένουν την κυκλοφορία της λειτουργίας εικόνας-βίντεο και βίντεο-βίντεο του Hunyuan Video, η οποία είναι πιθανώς η πιο χρήσιμη γέφυρα μεταξύ LoRA-οδηγούμενου, ID-βασισμένου “deepfake” περιεχομένου. Ή αλλιώς, να αυτοσχεδιάσουν και να χρησιμοποιήσουν το διάστημα για να διερευνήσουν τις εξωτερικές ικανότητες του πλαισίου και των πιθανών προσαρμογών, ακόμη και ιδιωτικών εσωτερικών forks του Hunyuan Video.
Συμπέρασμα
Από τη στιγμή που η τεχνολογία deepfake βίντεο υπάρχει για πολύ καιρό, θα ήταν εύκολο να υποτιμήσουμε τη σημασία του Hunyuan Video LoRA ως μια προσέγγιση για την ταυτότητα-σύνθεση και deepfaking. Και να υποθέσουμε ότι οι τρέχουσες προσπάθειες που εκδηλώνονται στην κοινότητα Civit και σε σχετικά Discords και subreddits αντιπροσωπεύουν απλά μια μικρή ώθηση προς την πλήρη ελεγχόμενη ανθρώπινη σύνθεση βίντεο.
Πιθανότερα είναι ότι οι τρέχουσες προσπάθειες αντιπροσωπεύουν μόνο μια μικρή parte του potencial του Hunyuan Video για τη δημιουργία πλήρως πιστευτών πλήρους-σώματος και πλήρους-περιβάλλοντος deepfakes. Μόλις κυκλοφορήσει η λειτουργία εικόνας-βίντεο (η οποία φημολογείται ότι θα συμβεί αυτό το μήνα), ένα πολύ πιο λεπτομερές επίπεδο γενετικής δύναμης θα γίνει διαθέσιμο τόσο για την κοινότητα των χομπίστας όσο και για την επαγγελματική κοινότητα.
Όταν η Stability.ai κυκλοφόρησε το Stable Diffusion το 2022, πολλοί παρατηρητές δεν μπορούσαν να κατανοήσουν γιατί η εταιρεία θα δώσει δωρεάν ένα τόσο πολύτιμο και ισχυρό γενετικό σύστημα. Με το Hunyuan Video, ο κίνητρο του κέρδους είναι χτισμένο trực tiếp στην άδεια – αν και μπορεί να αποδειχθεί δύσκολο για την Tencent να καθορίσει όταν μια εταιρεία ενεργοποιεί το σχήμα κερδών.
Σε κάθε περίπτωση, το αποτέλεσμα είναι το ίδιο με αυτό του 2022: αφοσιωμένες κοινότητες ανάπτυξης έχουν σχηματιστεί αμέσως και με έντονη ζέση γύρω από την κυκλοφορία. Κάποιες από τις οδούς που αυτές οι προσπάθειες θα πάρουν τα επόμενα 12 μήνες είναι βέβαιο ότι θα προκαλέσουν νέες επικεφαλίδες.
* Μέχρι 136 την ώρα της κυκλοφορίας.
Πρώτη κυκλοφορία την Τρίτη, 7 Ιανουαρίου 2025












