Η γωνία του Anderson

Πώς να εκπαιδεύσετε και να χρησιμοποιήσετε τα μοντέλα Hunyuan Video LoRA

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
ChatGPT-4o: Variation on 'Create me an image 1792 x 1024. It should be in the style of Théodore Géricault, and should depict a dark medieval figure seated in front of a laptop, illuminated by the screen. We are facing the figure, and can only see the back of the laptop lid. Around the seated medieval figure are many other medieval men and women, curious as to what is happening on the computer screen'

Αυτό το άρθρο θα σας δείξει πώς να εγκαταστήσετε και να χρησιμοποιήσετε λογισμικό βασισμένο σε Windows που μπορεί να εκπαιδεύσει μοντέλα Hunyuan video LoRA, επιτρέποντας στον χρήστη να δημιουργήσει προσαρμοσμένες προσωπικότητες στο μοντέλο Hunyuan Video.

[βίντεο πλάτος=”1200″ ύψος=”900″ mp4=”https://www.unite.ai/wp-content/uploads/2025/01/loras-hunyuan-AE2.mp4″][/βίντεο]

Πατήστε για αναπαραγωγή. Παραδείγματα από την πρόσφατη έκρηξη των celeb Hunyuan LoRAs από την κοινότητα civit.ai.

Στο παρόν, οι δύο πιο δημοφιλείς τρόποι δημιουργίας μοντέλων Hunyuan LoRA τοπικά είναι:

1) Το diffusion-pipe-ui Docker-based framework, το οποίο βασίζεται σε Windows Subsystem for Linux (WSL) για να χειριστεί ορισμένες από τις διαδικασίες.

2) Musubi Tuner, μια νέα προσθήκη στην δημοφιλή архιτεκτονική εκπαίδευσης diffusion Kohya ss. Ο Musubi Tuner δεν απαιτεί Docker και δεν εξαρτάται από WSL ή άλλους μεσάζοντες Linux – αλλά μπορεί να είναι δύσκολο να τρέξει σε Windows.

Επομένως, αυτή η παρουσίαση θα επικεντρωθεί στον Musubi Tuner και θα παρέχει μια完全 τοπική λύση για την εκπαίδευση και δημιουργία Hunyuan LoRA, χωρίς τη χρήση API-κίνητων ιστοσελίδων ή εμπορικών διαδικασιών ενοικίασης GPU όπως το Runpod.

[βίντεο πλάτος=”1200″ ύψος=”674″ mp4=”https://www.unite.ai/wp-content/uploads/2025/01/example-woman-hunyuan-loras.mp4″ loop=”true”][/βίντεο]

Πατήστε για αναπαραγωγή. Δείγματα από την εκπαίδευση LoRA στο Musubi Tuner για αυτό το άρθρο. Όλες οι άδειες χορηγήθηκαν από το άτομο που απεικονίζεται, για τους σκοπούς της εικονογράφησης αυτού του άρθρου.

ΑΠΑΙΤΗΣΕΙΣ

Η εγκατάσταση θα απαιτήσει τουλάχιστον ένα υπολογιστή Windows 10 με κάρτα NVIDIA 30+/40+ σειράς που έχει τουλάχιστον 12GB VRAM (αν και 16GB συνιστάται). Η εγκατάσταση που χρησιμοποιήθηκε για αυτό το άρθρο δοκιμάστηκε σε einen υπολογιστή με 64GB RAM και κάρτα γραφικών NVIDIA 3090 με 24GB VRAM. Εγκαταστάθηκε σε einem αφιερωμένο σύστημα δοκιμών με μια νέα εγκατάσταση Windows 10 Professional, σε ένα διαμέρισμα με 600+GB ελεύθερου χώρου δίσκου.

ΠΡΟΕΙΔΟΠΟΙΗΣΗ

Η εγκατάσταση του Musubi Tuner και των προαπαιτούμενων του cũng συνεπάγεται την εγκατάσταση λογισμικού και πακέτων προγραμματιστή απευθείας στον κύριο υπολογιστή Windows. Λαμβάνοντας υπόψη την εγκατάσταση του ComfyUI για τα τελικά στάδια, αυτό το έργο θα απαιτήσει περίπου 400-500 γιγαμπάιτ χώρου δίσκου. Αν και έχω δοκιμάσει την διαδικασία χωρίς περιστατικά σε νεοεγκαταστημένα περιβάλλοντα δοκιμών Windows 10, ούτε εγώ ούτε το unite.ai ευθύνονται για οποιαδήποτε ζημιά σε συστήματα από την ακολουθία αυτών των οδηγιών. Συμβουλεύω να δημιουργήσετε αντίγραφα ασφαλείας για οποιαδήποτε σημαντικά δεδομένα πριν από την απόπειρα εγκατάστασης αυτής της διαδικασίας.

ΣΥΝΕΠΑΓΜΑΤΑ

Είναι ακόμη έγκυρος αυτός ο τρόπος;

Η σκηνή της γενετικής AI κινείται πολύ γρήγορα και μπορούμε να περιμένουμε καλύτερες και πιο ροϊκές μεθόδους Hunyuan Video LoRA φέτος.

…ή ακόμη και αυτή την εβδομάδα! Ενώ έγραφα αυτό το άρθρο, ο dévelopπερας του Kohya/Musubi παρήγαγε musubi-tuner-gui, μια σύνθετη Gradio GUI για τον Musubi Tuner:

Προφανώς, ένα φιλικό προς τον χρήστη GUI είναι προτιμότερο από τα αρχεία BAT που χρησιμοποιώ σε αυτό το χαρακτηριστικό – μια φορά που το musubi-tuner-gui λειτουργεί. Όπως γράφω, πήγε διαδικτυακά πριν από πέντε ημέρες και δεν μπορώ να βρω κανένα λογαριασμό για κανέναν που το έχει χρησιμοποιήσει επιτυχώς.

Σύμφωνα με τις αναρτήσεις στο αποθετήριο, η νέα GUI προορίζεται να ενσωματωθεί直接 στο έργο Musubi Tuner το συντομότερο δυνατό, το οποίο θα τερματίσει την τρέχουσα ύπαρξή του ως ξεχωριστό αποθετήριο GitHub.

Βάσει των τρεχουσών οδηγιών εγκατάστασης, η νέα GUI κλωνοποιείται απευθείας στο υφιστάμενο εικονικό περιβάλλον Musubi. Και, παρά τις πολλές προσπάθειες, δεν μπορώ να την συσχετίσω με την υφιστάμενη εγκατάσταση Musubi. Αυτό σημαίνει ότι όταν εκτελείται, θα διαπιστώσει ότι δεν έχει μηχανή!

Μόλις η GUI ενσωματωθεί στον Musubi Tuner, τέτοιου είδους προβλήματα θα επιλυθούν σίγουρα. Αν και ο συγγραφέας παραδέχεται ότι το νέο έργο είναι ‘πολύ άσχημο’, είναι αισιόδοξος για την ανάπτυξή του και την ενσωμάτωση απευθείας στον Musubi Tuner.

Δεδομένων αυτών των ζητημάτων (επίσης σχετικά με προεπιλεγμένες διαδρομές κατά την εγκατάσταση και τη χρήση του πακέτου Python UV, το οποίο περιπλέκει ορισμένες διαδικασίες στην νέα έκδοση), θα πρέπει να περιμένουμε λίγο για μια ομαλότερη εμπειρία Hunyuan Video LoRA.

Αλλά αν δεν μπορείτε να περιμένετε και είστε διατεθειμένοι να ρίξετε τα μανίκια σας, μπορείτε να ξεκινήσετε την εκπαίδευση Hunyuan video LoRA τοπικά ngay τώρα.

Ας ξεκινήσουμε.

Γιατί να εγκαταστήσετε οτιδήποτε σε γυμνό μέταλλο;

(Παράλειψη αυτής της παραγράφου αν είστε προηγμένος χρήστης)
Οι προηγμένοι χρήστες θα αναρωτηθούν γιατί επέλεξα να εγκαταστήσω τόσο λογισμικό στην εγκατάσταση Windows 10 γυμνό μέταλλο αντί σε ένα εικονικό περιβάλλον. Ο λόγος είναι ότι η βασική πύλη Windows του Linux-βασισμένου πακέτου Triton είναι πολύ πιο δύσκολο να λειτουργήσει σε ένα εικονικό περιβάλλον. Όλες οι άλλες εγκαταστάσεις γυμνού μετάλλου σε αυτό το tutorial δεν θα μπορούσαν να εγκατασταθούν σε ένα εικονικό περιβάλλον, καθώς πρέπει να επικοινωνούν απευθείας με τοπικό υλικό.

Εγκατάσταση προαπαιτούμενων πακέτων και προγραμμάτων

Για τα προγράμματα και τα πακέτα που πρέπει να εγκατασταθούν αρχικά, η σειρά εγκατάστασης έχει σημασία. Ας ξεκινήσουμε.

1: Λήψη Microsoft Redistributable

Λήψη και εγκατάσταση του πακέτου Microsoft Redistributable από https://aka.ms/vs/17/release/vc_redist.x64.exe.

Αυτή είναι μια απλή και ταχεία εγκατάσταση.

2: Εγκατάσταση Visual Studio 2022

Λήψη της κοινότητας Microsoft Visual Studio 2022 από https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta

Εκκίνηση του ληφθέντος εγκαταστάτη:

Δεν χρειαζόμαστε όλα τα διαθέσιμα πακέτα, τα οποία θα ήταν μια βαριά και μακρά εγκατάσταση. Στη σελίδα Workloads που ανοίγει, επιλέξτε Desktop Development with C++ (δείτε την εικόνα παρακάτω).

Τώρα, πατήστε το κουμπί Individual Components στο πάνω αριστερό μέρος της διεπαφής και χρησιμοποιήστε το πλαίσιο αναζήτησης για να βρείτε ‘Windows SDK’.

Από προεπιλογή, μόνο το Windows 11 SDK είναι επιλεγμένο. Εάν είστε σε Windows 10 (αυτή η διαδικασία εγκατάστασης δεν έχει δοκιμαστεί από εμένα σε Windows 11), επιλέξτε την τελευταία έκδοση Windows 10, όπως φαίνεται στην εικόνα παρακάτω.

Αναζητήστε ‘C++ CMake’ και ελέγξτε αν το C++ CMake tools for Windows είναι επιλεγμένο.

Αυτή η εγκατάσταση θα πάρει τουλάχιστον 13 GB χώρου.

Όταν ο Visual Studio έχει εγκατασταθεί, θα προσπαθήσει να εκτελεστεί στον υπολογιστή σας. Αφήστε το να ανοίξει πλήρως. Όταν η πλήρης διεπαφή του Visual Studio είναι ορατή, κλείστε το πρόγραμμα.

3: Εγκατάσταση Visual Studio 2019

Ορισμένα από τα επόμενα πακέτα για τον Musubi περιμένουν μια παλαιότερη έκδοση του Microsoft Visual Studio, ενώ άλλα χρειάζονται μια πιο πρόσφατη έκδοση.

Επομένως, κατεβάστε επίσης την ελεύθερη έκδοση Community του Visual Studio 19 είτε από τη Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – απαιτείται λογαριασμός) είτε από το Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).

Εγκαταστήστε το με τις ίδιες επιλογές όπως για το Visual Studio 2022 (δείτε τη διαδικασία παραπάνω, εκτός από το ότι το Windows SDK είναι ήδη επιλεγμένο στον εγκαταστάτη του Visual Studio 2019).

Θα δείτε ότι ο εγκαταστάτης του Visual Studio 2019 είναι ήδη ενήμερος για την existence της νεότερης έκδοσης κατά την εγκατάσταση:

Όταν η εγκατάσταση ολοκληρωθεί και έχετε ανοίξει και κλείσει την εγκαταστημένη εφαρμογή Visual Studio 2019, ανοίξτε ένα παράθυρο εντολών Windows (Γράψτε CMD στο πλαίσιο αναζήτησης) και πληκτρολογήστε και εκτελέστε:

where cl

Το αποτέλεσμα θα πρέπει να είναι οι γνωστές τοποθεσίες των δύο εγκαταστημένων εκδόσεων του Visual Studio.

Εάν αντίθετα λάβετε INFO: Could not find files for the given pattern(s), δείτε το τμήμα Ελέγξτε τη διαδρομή αυτού του άρθρου παρακάτω και χρησιμοποιήστε τις οδηγίες για να προσθέσετε τις σχετικές διαδρομές του Visual Studio στο περιβάλλον του Windows.

Αποθηκεύστε τις αλλαγές που έγιναν σύμφωνα με το τμήμα Ελέγξτε τη διαδρομή παρακάτω και στη συνέχεια δοκιμάστε την εντολή where cl ξανά.

4: Εγκατάσταση CUDA 11 + 12 Toolkits

Τα διάφορα πακέτα που εγκαταστάθηκαν στο Musubi χρειάζονται διαφορετικές εκδόσεις του NVIDIA CUDA, το οποίο επιταχύνει και βελτιώνει την εκπαίδευση σε κάρτες γραφικών NVIDIA.

Ο λόγος που εγκαταστήσαμε πρώτα τις εκδόσεις του Visual Studio είναι ότι οι εγκαταστάτες του NVIDIA CUDA αναζητούν και ενσωματώνουν με τις υπάρχουσες εγκαταστάσεις του Visual Studio.

Λήψη ενός πακέτου εγκατάστασης CUDA 11+ σειράς από:

https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (κατεβάστε το ‘exe (local)’)

Λήψη ενός πακέτου εγκατάστασης CUDA 12+ σειράς από:

https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64

Η διαδικασία εγκατάστασης είναι相同 για τους δύο εγκαταστάτες. Παραλείψτε οποιαδήποτε προειδοποιήσεις σχετικά με την ύπαρξη ή μη εγκατάστασης διαδρομών σε μεταβλητές περιβάλλοντος του Windows – θα τις αντιμετωπίσουμε χειροκίνητα αργότερα.

Εγκατάσταση NVIDIA CUDA Toolkit V11+

Εκκίνηση του εγκαταστάτη για το CUDA Toolkit 11+ σειράς.

Στη σελίδα Installation Options, επιλέξτε Custom (Advanced) και συνεχίστε.

Απενεργοποιήστε την επιλογή NVIDIA GeForce Experience και πατήστε Next.

Αφήστε την Επιλογή τοποθεσίας εγκατάστασης στις προεπιλογές (αυτό είναι σημαντικό):

Πατήστε Next και αφήστε την εγκατάσταση να ολοκληρωθεί.

Παραλείψτε οποιαδήποτε προειδοποίηση ή σημειώσεις που ο εγκαταστάτης δίνει σχετικά με την Nsight Visual Studio ενσωμάτωση, η οποία δεν χρειάζεται για την περίπτωσή μας.

Εγκατάσταση NVIDIA CUDA Toolkit V12+

Επανάλαβε την ίδια διαδικασία για τον εγκαταστάτη CUDA 12+ σειράς που κατεβάσατε:

Η διαδικασία εγκατάστασης είναι ίδια με αυτήν της έκδοσης 11+, εκτός από μια προειδοποίηση σχετικά με τις διαδρομές περιβάλλοντος, την οποία μπορείτε να αγνοήσετε:

Όταν η εγκατάσταση της έκδοσης CUDA 12+ ολοκληρωθεί, ανοίξτε ένα παράθυρο εντολών Windows και πληκτρολογήστε και εκτελέστε:

nvcc --version

Αυτό θα επιβεβαιώσει πληροφορίες σχετικά με την εγκαταστημένη έκδοση οδηγού:

Για να ελέγξετε αν η κάρτα σας αναγνωρίζεται, πληκτρολογήστε και εκτελέστε:

nvidia-smi

5: Εγκατάσταση GIT

Το GIT θα χειρίζεται την εγκατάσταση του αποθετηρίου Musubi στον τοπικό σας υπολογιστή. Λήψη του εγκαταστάτη GIT από:

https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Εκκίνηση του εγκαταστάτη:

Χρησιμοποιήστε τις προεπιλογές για Επιλογή组件:

Αφήστε τον προεπιλεγμένο επεξεργαστή σε Vim:

Αφήστε το GIT να αποφασίσει για τα ονόματα κλάδων:

Χρησιμοποιήστε τις προτεινόμενες ρυθμίσεις για τη Διαδρομή περιβάλλοντος:

Χρησιμοποιήστε τις προτεινόμενες ρυθμίσεις για SSH:

Χρησιμοποιήστε τις προτεινόμενες ρυθμίσεις για HTTPS Transport backend:

Χρησιμοποιήστε τις προτεινόμενες ρυθμίσεις για μετατροπές τερματικών:

Επιλέξτε το προεπιλεγμένο τερματικό του Windows ως Τερματικό:

Χρησιμοποιήστε τις προτεινόμενες ρυθμίσεις για Git Pull:

Χρησιμοποιήστε το Git-Credential Manager (η προεπιλεγμένη ρύθμιση) για Βοηθό πιστοποίησης:

Στην Εξτρα επιλογές, αφήστε την Ενεργοποίηση 캐σιγκ επιλεγμένη και την Ενεργοποίηση συμβολικών συνδέσμων απενεργοποιημένη (εκτός αν είστε προηγμένος χρήστης που χρησιμοποιεί σκληρούς συνδέσμους για einen κεντρικό αποθετήριο μοντέλων).

Ολοκληρώστε την εγκατάσταση και δοκιμάστε ότι το GIT έχει εγκατασταθεί σωστά ανοίγοντας ένα παράθυρο CMD και πληκτρολογώντας και εκτελώντας:

git --version

Σύνδεση GitHub

Αργότερα, όταν θα προσπαθήσετε να κλωνοποιήσετε αποθετήρια GitHub, μπορεί να σας ζητηθούν τα διαπιστευτήρια GitHub. Για να προετοιμαστείτε για αυτό, συνδεθείτε στο λογαριασμό GitHub σας (δημιουργήστε έναν, αν χρειάζεται) σε οποιοδήποτε πρόγραμμα περιήγησης που είναι εγκαταστημένο στον υπολογιστή Windows σας. Με αυτόν τον τρόπο, η μέθοδος πιστοποίησης 0Auth (παράθυρο pop-up) θα πάρει όσο το δυνατόν λιγότερο χρόνο.

Μετά από αυτήν την αρχική πρόκληση, θα παραμείνετε πιστοποιημένοι αυτόματα.

6: Εγκατάσταση CMake

Απαιτείται CMake 3.21 ή νεότερη για μέρη της εγκατάστασης του Musubi. Το CMake είναι μια δια-πλατφορμική αρχιτεκτονική ανάπτυξης που μπορεί να διευθύνει ποικίλους μεταγλωττιστές και να μεταγλωττίσει λογισμικό από κώδικα πηγής.

Λήψη από:

https://cmake.org/download/ (‘Windows x64 Installer’)

Εκκίνηση του εγκαταστάτη:

Βεβαιωθείτε ότι η Προσθήκη Cmake στο περιβάλλον είναι επιλεγμένη.

Πατήστε Επόμενο.

Πληκτρολογήστε και εκτελέστε αυτήν την εντολή σε ένα παράθυρο εντολών Windows:

cmake --version

Εάν το CMake εγκατασταθεί επιτυχώς, θα εμφανίσει κάτι σαν:

cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: Εγκατάσταση Python 3.10

Ο ερμηνευτής Python είναι κεντρικός σε αυτό το έργο. Λήψη της έκδοσης 3.10 (η καλύτερη συμβιβαστική λύση μεταξύ των διαφορετικών απαιτήσεων των πακέτων Musubi) από:

https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)

Εκκίνηση του ληφθέντος εγκαταστάτη και αφήστε τις προεπιλογές:

Στο τέλος της διαδικασίας εγκατάστασης, πατήστε Απενεργοποίηση του ορίου μήκους διαδρομής (απαιτεί επιβεβαίωση διαχειριστή UAC):

Πληκτρολογήστε και εκτελέστε αυτήν την εντολή σε ένα παράθυρο εντολών Windows:

python --version

Αυτό θα οδηγήσει σε Python 3.10.0

Ελέγξτε τις διαδρομές

Η κλωνοποίηση και εγκατάσταση των πλαισίων Musubi, καθώς και η κανονική λειτουργία μετά την εγκατάσταση, απαιτεί να γνωρίζουν οι συνιστώσες του Musubi τη διαδρομή σε ορισμένα σημαντικά εξωτερικά στοιχεία στο Windows, ιδιαίτερα το CUDA.

Επομένως, πρέπει να ανοίξουμε το περιβάλλον διαδρομής και να ελέγξουμε ότι όλα τα απαιτούμενα είναι εκεί.

Ένας γρήγορος τρόπος για να पहρέψετε τον έλεγχο του περιβάλλοντος του Windows είναι να πληκτρολογήσετε Επεξεργασία των συστημικών μεταβλητών περιβάλλοντος στο πλαίσιο αναζήτησης του Windows.

Πατώντας αυτό, θα ανοίξει το Παράθυρο ιδιοκτητών συστήματος. Στο κάτω δεξιά μέρος του Παράθυρο ιδιοκτητών συστήματος, πατήστε το κουμπί Μεταβλητές περιβάλλοντος και ένα παράθυρο με το όνομα Μεταβλητές περιβάλλοντος ανοίγει. Στο πάνελ Συστημικές μεταβλητές στο κάτω μισό αυτού του παραθύρου, κύλιστε xuống στο Διαδρομή και κάντε διπλό κλικ σε αυτό. Αυτό ανοίγει ένα παράθυρο με το όνομα Επεξεργασία μεταβλητών περιβάλλοντος. Τραβήξτε το πλάτος αυτού του παραθύρου, ώστε να μπορείτε να δείτε την πλήρη διαδρομή των μεταβλητών:

Εδώ, οι σημαντικές εγγραφές είναι:

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin

Στις περισσότερες περιπτώσεις, οι σωστές μεταβλητές διαδρομής θα είναι ήδη παρόντες.

Προσθέστε τις διαδρομές που λείπουν, πατώντας Νέο στο αριστερό μέρος του παραθύρου Επεξεργασία μεταβλητών περιβάλλοντος και επικολλώντας τη σωστή διαδρομή:

Μην αντικαταστήσετε απλώς τις διαδρομές από τις παραπάνω λίστες. Ελέγξτε ότι κάθε αντίστοιχη διαδρομή υπάρχει στην εγκατάσταση του Windows σας.

Εάν υπάρχουν μικρές παραλλαγές διαδρομών (ιδιαίτερα με εγκαταστάσεις Visual Studio), χρησιμοποιήστε τις διαδρομές από πάνω για να βρείτε τους σωστούς φακέλους (π.χ. x64 σε Host64 στην εγκατάσταση σας). Στη συνέχεια, επικολλήστε αυτές τις διαδρομές στο παράθυρο Επεξεργασία μεταβλητών περιβάλλοντος.

Μετά από αυτό, επανεκκινήστε τον υπολογιστή.

Εγκατάσταση Musubi

Επιβεβαίωση PIP

Η χρήση της τελευταίας έκδοσης του εγκαταστάτη PIP μπορεί να απλοποιήσει ορισμένα στάδια της εγκατάστασης. Σε ένα παράθυρο εντολών Windows με προνόμια διαχειριστή (δείτε Ανύψωση παρακάτω), πληκτρολογήστε και εκτελέστε:

pip install --upgrade pip

Ανύψωση

Ορισμένες εντολές μπορεί να απαιτούν προνόμια διαχειριστή (δηλαδή, να εκτελούνται ως διαχειριστής). Εάν λαμβάνετε μηνύματα λάθους σχετικά με άδειες, κλείστε το παράθυρο εντολών και ξανανοίξτε το σε λειτουργία διαχειριστή, πληκτρολογώντας CMD στο πλαίσιο αναζήτησης του Windows, κάντε δεξί κλικ στο Παράθυρο εντολών και επιλέξτε Εκτέλεση ως διαχειριστής:

Για τα επόμενα στάδια, θα χρησιμοποιήσουμε το Windows Powershell αντί του παραθύρου εντολών του Windows. Μπορείτε να το βρείτε πληκτρολογώντας Powershell στο πλαίσιο αναζήτησης του Windows και (αν χρειάζεται) κάντε δεξί κλικ σε αυτό και επιλέξτε Εκτέλεση ως διαχειριστής:

Εγκατάσταση Torch

Στο Powershell, πληκτρολογήστε και εκτελέστε:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

Περιμένετε耐心τικά ενώ εγκαθίστανται πολλά πακέτα.

Όταν ολοκληρωθεί, μπορείτε να επιβεβαιώσετε μια εγκατάσταση PyTorch με υποστήριξη GPU, πληκτρολογώντας και εκτελώντας:

python -c "import torch; print(torch.cuda.is_available())"

Αυτό θα οδηγήσει σε:

C:\WINDOWS\system32>python -c "import torch;
print(torch.cuda.is_available())"
True

Εγκατάσταση Triton για Windows

Επόμενη, η εγκατάσταση του συνιστώσας Triton για Windows. Στο ανυψωμένο Powershell, πληκτρολογήστε (σε μια γραμμή):

pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl

(Ο εγκαταστάτης triton-3.1.0-cp310-cp310-win_amd64.whl λειτουργεί και για Intel και AMD CPU, εφόσον η αρχιτεκτονική είναι 64-bit και το περιβάλλον ταιριάζει με την έκδοση Python)

Μετά την εκτέλεση, αυτό θα οδηγήσει σε:

Successfully installed triton-3.1.0

Μπορούμε να ελέγξουμε αν ο Triton λειτουργεί, εισάγοντας τον σε Python. Πληκτρολογήστε και εκτελέστε:

python -c "import triton; print('Triton is working')"

Αυτό θα εκτυπώσει:

Triton is working

Για να ελέγξουμε αν ο Triton είναι GPU-ενεργοποιημένος, πληκτρολογήστε:

python -c "import torch; print(torch.cuda.is_available())"

Αυτό θα οδηγήσει σε True:

Δημιουργία του εικονικού περιβάλλοντος για τον Musubi

Από τώρα και στο εξής, θα εγκαταστήσουμε οποιοδήποτε επιπλέον λογισμικό σε ένα εικονικό περιβάλλον Pythonvenv). Αυτό σημαίνει ότι όλα όσα θα χρειαστείτε να κάνετε για να απεγκαταστήσετε όλα τα επόμενα λογισμικά είναι να σύρετε τον φάκελο εγκατάστασης του venv στο κάδους.

Ας δημιουργήσουμε τον φάκελο εγκατάστασης:

Δημιουργήστε έναν φάκελο με το όνομα Musubi στον επιφάνεια εργασίας σας. Τα παρακάτω παραδείγματα υποθέτουν ότι αυτός ο φάκελος υπάρχει:

C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\

Στο Powershell, μεταβείτε σε αυτόν τον φάκελο, πληκτρολογώντας:

cd C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi

Θέλουμε το εικονικό περιβάλλον να έχει πρόσβαση σε αυτά που έχουμε εγκαταστήσει ήδη (ιδιαίτερα τον Triton), οπότε θα χρησιμοποιήσουμε τη σημαία --system-site-packages. Πληκτρολογήστε:

python -m venv --system-site-packages musubi

Περιμένετε μέχρι να δημιουργηθεί το περιβάλλον και στη συνέχεια ενεργοποιήστε το, πληκτρολογώντας:

.\musubi\Scripts\activate

Από αυτό το σημείο και μετά, μπορείτε να δείτε ότι βρίσκεστε στο ενεργοποιημένο εικονικό περιβάλλον, επειδή (musubi) εμφανίζεται στην αρχή όλων των προτροπών σας.

Κλωνοποίηση του αποθετηρίου

Μεταβείτε στον nově δημιουργημένο φάκελο musubi (ο οποίος βρίσκεται μέσα στον φάκελο Musubi στον επιφάνεια εργασίας σας):

cd musubi

Τώρα που βρίσκεστε στη σωστή θέση, πληκτρολογήστε την ακόλουθη εντολή:

git clone https://github.com/kohya-ss/musubi-tuner.git

Περιμένετε μέχρι να ολοκληρωθεί η κλωνοποίηση (δεν θα πάρει πολύ χρόνο).

Εγκατάσταση απαιτήσεων

Μεταβείτε στον φάκελο εγκατάστασης:

cd musubi-tuner

Πληκτρολογήστε:

pip install -r requirements.txt

Περιμένετε μέχρι να ολοκληρωθούν οι πολλές εγκαταστάσεις (αυτό θα πάρει περισσότερο χρόνο).

Αυτοματοποίηση πρόσβασης στο Hunyuan Video Venv

Για να ενεργοποιήσετε και να αποκτήσετε πρόσβαση στο νέο venv για μελλοντικές συνεδρίες, επικολλήστε τον ακόλουθο κώδικα σε ένα αρχείο Notepad και αποθηκεύστε το με το όνομα activate.bat, αποθηκεύοντάς το με την επιλογή Όλα τα αρχεία (δείτε την εικόνα παρακάτω).

@echo off

call C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\Scripts\activate

cd C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner

cmd

(Αντικαταστήστε [Το όνομα του προφίλ σας] με το πραγματικό όνομα του προφίλ χρήστη Windows)

Δεν έχει σημασία σε ποια θέση αποθηκεύσετε αυτό το αρχείο.

Από τώρα και στο εξής, μπορείτε να κάνετε διπλό κλικ στο activate.bat και να ξεκινήσετε να εργάζεστε αμέσως.

Χρήση του Musubi Tuner

Λήψη των μοντέλων

Η διαδικασία εκπαίδευσης Hunyuan Video LoRA απαιτεί τη λήψη τουλάχιστον επτά μοντέλων για να υποστηρίξει όλες τις πιθανές επιλογές για προ-κэshing και εκπαίδευση Hunyuan video LoRA. Μαζί, αυτά τα μοντέλα ζυγίζουν περισσότερο από 60GB.

Τρέχουσες οδηγίες για τη λήψη τους μπορούν να βρεθούν στο https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download

Ωστόσο, αυτές είναι οι οδηγίες λήψης κατά την время της γραφής:

clip_l.safetensors
llava_llama3_fp16.safetensors
και
llava_llama3_fp8_scaled.safetensors
μπορούν να κατεβαστούν στο https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders

mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt
και
mp_rank_00_model_states_fp8_map.pt
μπορούν να κατεβαστούν στο https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers

pytorch_model.pt
μπορεί να κατεβαστεί στο https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae

Αν και μπορείτε να τα τοποθετήσετε σε οποιοδήποτε φάκελο επιθυμείτε, για συνέπεια με τις επόμενες δέσμες ενεργειών, ας τα τοποθετήσουμε στο:

C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\models\

Αυτό είναι σύμφωνο με τη διάταξη φακέλων πριν από αυτό το σημείο. Μην ξεχάσετε να αντικαταστήσετε [Το όνομα του προφίλ σας] με το πραγματικό όνομα του φακέλου προφίλ Windows.

Προετοιμασία συνόλου δεδομένων

Αγνοώντας την κοινότητα διαμάχη σε αυτό το σημείο, είναι δίκαιο να πούμε ότι θα χρειαστείτε κάπου μεταξύ 10-100 φωτογραφιών για ένα σύνολο δεδομένων εκπαίδευσης για το Hunyuan LoRA. Πολύ καλά αποτελέσματα μπορούν να επιτευχθούν ακόμη και με 15 εικόνες, εφόσον οι εικόνες είναι ισορροπημένες και της καλής ποιότητας.

Ένα Hunyuan LoRA μπορεί να εκπαιδευτεί και σε εικόνες ή πολύ σύντομες και χαμηλής ανάλυσης βίντεο κλιπ, ή ακόμη και μια смесь και των δύο – αν και η χρήση βίντεο κλιπ ως δεδομένων εκπαίδευσης είναι μια πρόκληση, ακόμη και για μια κάρτα 24GB.

Ωστόσο, τα βίντεο κλιπ είναι πραγματικά χρήσιμα μόνο αν το χαρακτήρας σας κινείται με έναν ασυνήθιστο τρόπο που το μοντέλο Hunyuan Video μπορεί να μην γνωρίζει ή να μην μπορεί να το μαντέψει.

Παραδείγματα θα ήταν Roger Rabbit, một xenomorph, The Mask, Spider-Man, ή άλλα πρόσωπα που κατέχουν μοναδικές χαρακτηριστικές κινήσεις.

Εφόσον το Hunyuan Video ήδη γνωρίζει πώς κινείται ο άνθρωπος, τα βίντεο κλιπ δεν είναι απαραίτητα για να λάβουμε ένα πειστικό Hunyuan Video LoRA ανθρώπινου τύπου. Οπότε θα χρησιμοποιήσουμε στατικές εικόνες.

Προετοιμασία εικόνων

Η λίστα Bucket

Η σύντομη εκδοχή:

Είναι καλύτερο να χρησιμοποιήσετε εικόνες που είναι όλες της ίδιας μεγέθους για το σύνολο δεδομένων σας, ή να χρησιμοποιήσετε μια 50/50 διαίρεση μεταξύ δύο διαφορετικών μεγεθών, π.χ. 10 εικόνες που είναι 512x768px και 10 που είναι 768x512px.

Η εκπαίδευση μπορεί να πάρει καλά ακόμη και αν δεν το κάνετε αυτό – τα Hunyuan Video LoRAs μπορούν να είναι εκπληκτικά συγχωροτικά.

Η εκτενής εκδοχή

Όπως και με τα Kohya-ss LoRAs για στατικές γενετικές συστήματα όπως το Stable Diffusion, bucketing χρησιμοποιείται για να διανείμει το έργο σε διαφορετικά μεγέθη εικόνων, επιτρέποντας την χρήση μεγαλύτερων εικόνων χωρίς να προκαλεί λάθη out-of-memory κατά την εκπαίδευση (δηλαδή, το bucketing ‘κόβει’ τις εικόνες σε κομμάτια που η GPU μπορεί να χειριστεί, διατηρώντας την οντολογική ακεραιότητα της ολόκληρης εικόνας).

Για κάθε μέγεθος εικόνας που περιλαμβάνεται στο σύνολο δεδομένων εκπαίδευσης (π.χ. 512x768px), θα δημιουργηθεί ένα bucket, ή ‘υπο-εργασία’ για αυτό το μέγεθος. Έτσι, αν έχετε την ακόλουθη κατανομή εικόνων, αυτή είναι η τρόπος με τον οποίο η προσοχή bucket γίνεται ανισορροπημένη, και κινδυνεύει ότι ορισμένες φωτογραφίες θα δοθούν μεγαλύτερη προσοχή στην εκπαίδευση από άλλες:

2x 512x768px εικόνες
7x 768x512px εικόνες
1x 1000x600px εικόνα
3x 400x800px εικόνες

Μπορούμε να δούμε ότι η προσοχή bucket είναι διαιρεμένη ανισόμορφα μεταξύ αυτών των εικόνων:

Επομένως, είτε να μείνετε σε ένα μορφότυπο μεγέθους, είτε να προσπαθήσετε να διατηρήσετε τη διανομή των διαφορετικών μεγεθών σχετικά ισορροπημένη.

Σε κάθε περίπτωση, αποφύγετε πολύ μεγάλες εικόνες, καθώς αυτό πιθανότατα θα επιβραδύνει την εκπαίδευση, με αμελητέα οφέλη.

Για απλότητα, χρησιμοποίησα 512x768px για όλες τις φωτογραφίες στο σύνολο δεδομένων μου.

Διακοσμήσεις: Το μοντέλο (άτομο) που χρησιμοποιήθηκε στο σύνολο δεδομένων μου έδωσε πλήρη άδεια να χρησιμοποιήσω αυτές τις εικόνες για αυτόν τον σκοπό, και έδωσε έγκριση για όλες τις AI-βασισμένες εξόδους που απεικονίζουν την ομοιότητα του στο αυτό το άρθρο.

Το σύνολο δεδομένων μου αποτελείται από 40 εικόνες, σε μορφότυπο PNG (αν και το JPG είναι επίσης εντάξει). Οι εικόνες μου αποθηκεύτηκαν στο C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman

Θα πρέπει να δημιουργήσετε έναν φάκελο cache μέσα στο φάκελο εικόνων εκπαίδευσης:

Τώρα ας δημιουργήσουμε ένα ειδικό αρχείο που θα ρυθμίσει την εκπαίδευση.

Αρχεία TOML

Η διαδικασία εκπαίδευσης και προ-κэshing των Hunyuan Video LoRAs λαμβάνει τις διαδρομές αρχείων από ένα πλάγιο κείμενο με την .toml επέκταση.

Για το δικό μου τεστ, το TOML βρίσκεται στο C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml

Ο περιεχόμενος του δικού μου αρχείου TOML training έχει την ακόλουθη μορφή:

[general]

resolution = [512, 768]

caption_extension = ".txt"

batch_size = 1

enable_bucket = true

bucket_no_upscale = false

[[datasets]]

image_directory = "C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman"

cache_directory = "C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman\cache"

num_repeats = 1

(Οι διπλοί αντίστροφοι σλαχ είναι όχι πάντα απαραίτητοι, αλλά μπορούν να βοηθήσουν να αποφευχθούν λάθη σε περιπτώσεις όπου υπάρχει ένα κενό στη διαδρομή. Έχω εκπαιδεύσει μοντέλα με αρχεία.toml που χρησιμοποιούσαν đơnους προώρους και αντίστροφους σλαχ)

Μπορούμε να δούμε στην ενότητα resolution ότι δύο ανάλυσεις θα ληφθούν υπόψη – 512px και 768px. Μπορείτε επίσης να αφήσετε αυτήν την ανάλυση σε 512, και ακόμη να λάβετε καλά αποτελέσματα.

Λεζάντες

Το Hunyuan Video είναι ένα κείμενο+όραση μοντέλο, οπότε χρειαζόμαστε περιγραφικές λεζάντες για αυτές τις εικόνες, οι οποίες θα ληφθούν υπόψη κατά την εκπαίδευση. Η διαδικασία εκπαίδευσης θα αποτύχει χωρίς λεζάντες.

Υπάρχουν πολλά ανοιχτά συστήματα λεζαντών που μπορούμε να χρησιμοποιήσουμε για αυτό το έργο, αλλά ας κρατήσουμε απλά και να χρησιμοποιήσουμε το taggui σύστημα. Αν και είναι αποθηκευμένο στο GitHub, και αν και κατεβάζει κάποια πολύ βαρέα μοντέλα deep learning κατά την πρώτη εκτέλεση, έρχεται στη μορφή ενός απλού εκτελέσιμου Windows που φορτώνει βιβλιοθήκες Python και μια απλή διεπαφή.

Μετά την εκκίνηση του Taggui, χρησιμοποιήστε Αρχείο > Φόρτωση καταλόγου για να μεταβείτε στο σύνολο δεδομένων εικόνων σας, και προαιρετικά βάλτε ένα αναγνωριστικό token (σε αυτήν την περίπτωση, examplewoman) που θα προστεθεί σε όλες τις λεζάντες:

(Βεβαιωθείτε ότι απενεργοποιήσετε την Φόρτωση σε 4-bit όταν το Taggui ανοίγει για πρώτη φορά – θα ρίξει σφάλματα κατά τη διάρκεια της λεζαντοποίησης αν αυτό παραμείνει ενεργοποιημένο)

Επιλέξτε μια εικόνα στη στήλη προεπισκόπησης αριστερά και πατήστε CTRL+A για να επιλέξετε όλες τις εικόνες. Στη συνέχεια, πατήστε το κουμπί Ξεκινήστε την αυτόματη λεζαντοποίηση στη δεξιά πλευρά:

Θα δείτε το Taggui να κατεβάζει μοντέλα στο μικρό CLI στη δεξιά πλευρά, αλλά μόνο αν αυτό είναι η πρώτη φορά που έχετε εκτελέσει τον λεζαντοποιό. Αλλιώς, θα δείτε μια προεπισκόπηση των λεζαντών.

Τώρα, κάθε φωτογραφία έχει μια αντίστοιχη.txt λεζάντα με περιγραφή του περιεχομένου της εικόνας:

Μπορείτε να κάνετε κλικ στο Προηγμένα στο Taggui για να αυξήσετε το μήκος και το στυλ των λεζαντών, αλλά αυτό είναι πέρα από το πεδίο εφαρμογής αυτής της παρουσιάσης.

Κλείστε το Taggui και ας προχωρήσουμε…

Προ-κэshing Latent

Για να αποφευχθεί η υπερβολική φόρτωση GPU κατά την εκπαίδευση, είναι απαραίτητο να δημιουργηθούν δύο τύποι προ-κэshing αρχείων – ένα για να αντιπροσωπεύει τη.latent εικόνα που προέρχεται από τις εικόνες themselves, και ένα για να αξιολογήσει μια κωδικοποίηση κειμένου που σχετίζεται με το περιεχόμενο λεζαντών.

Για να απλοποιήσετε και τις τρεις διαδικασίες (2x κэshing + εκπαίδευση), μπορείτε να χρησιμοποιήσετε δια互одействτικά αρχεία.BAT που θα σας ζητήσουν ερωτήσεις και θα εκτελέσουν τις διαδικασίες όταν έχετε δώσει τις απαραίτητες πληροφορίες.

Για το προ-κэshing latent, αντιγράψτε τον ακόλουθο κώδικα σε ένα αρχείο Notepad και αποθηκεύστε το ως αρχείο.BAT (π.χ. ονομάστε το latent-precache.bat), όπως και πριν, βεβαιωθείτε ότι ο τύπος αρχείου στη λίστα αναπτύγματος στο παράθυρο Αποθήκευση ως είναι Όλα τα αρχεία (δείτε την εικόνα παρακάτω):

@echo off

REM Activate the virtual environment

call C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\Scripts\activate

REM Get user input

set /p IMAGE_PATH=Enter the path to the image directory:

set /p CACHE_PATH=Enter the path to the cache directory:

set /p TOML_PATH=Enter the path to the TOML file:

echo You entered:

echo Image path: %IMAGE_PATH%

echo Cache path: %CACHE_PATH%

echo TOML file path: %TOML_PATH%

set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM Run the latent pre-caching script

python C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling

) else (

echo Operation canceled.

)

REM Keep the window open

pause

(Βεβαιωθείτε ότι αντικαταστήσετε [Το όνομα του προφίλ σας] με το πραγματικό όνομα του φακέλου προφίλ Windows)

Τώρα μπορείτε να εκτελέσετε το αρχείο.BAT για αυτόματη προ-κэshing:

Όταν σας ζητηθούν από το αρχείο.BAT, επικολλήστε ή πληκτρολογήστε τη διαδρομή του συνόλου δεδομένων, φακέλου cache και αρχείου TOML.

Προ-κэshing κειμένου

Θα δημιουργήσουμε ένα δεύτερο αρχείο.BAT, αυτή τη φορά για το προ-κэshing κειμένου.

@echo off

REM Activate the virtual environment

call C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\Scripts\activate

REM Get user input

set /p IMAGE_PATH=Enter the path to the image directory:

set /p CACHE_PATH=Enter the path to the cache directory:

set /p TOML_PATH=Enter the path to the TOML file:

echo You entered:

echo Image path: %IMAGE_PATH%

echo Cache path: %CACHE_PATH%

echo TOML file path: %TOML_PATH%

set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM Use the python executable from the virtual environment

python C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16

) else (

echo Operation canceled.

)

REM Keep the window open

pause

Αντικαταστήστε το όνομα του προφίλ σας και αποθηκεύστε αυτό ως text-cache.bat (ή οποιοδήποτε όνομα σας αρέσει), σε οποιαδήποτε βολική θέση, όπως και για το προηγούμενο αρχείο.BAT.

Εκτελέστε αυτό το νέο αρχείο.BAT, ακολουθήστε τις οδηγίες και τα απαραίτητα αρχεία κειμένου-κωδικοποίησης θα εμφανιστούν στο φάκελο cache:

Εκπαίδευση του Hunyuan Video Lora

Η εκπαίδευση του LoRA θα πάρει σημαντικά περισσότερο χρόνο από τις δύο προπαρασκευαστικές διαδικασίες.

Αν και υπάρχουν πολλές μεταβλητές που θα μπορούσαμε να ανησυχούμε (όπως μέγεθος batch, επαναλήψεις, επαναλήψεις, και αν θα χρησιμοποιήσουμε πλήρη ή quantized μοντέλα, μεταξύ άλλων), θα αφήσουμε αυτές τις σκέψεις για μια άλλη μέρα, και μια πιο sâuτή εξέταση των λεπτομερειών της δημιουργίας LoRA.

Για τώρα, ας μειώσουμε τις επιλογές μας και εκπαιδεύσουμε ένα LoRA με ‘μεσαίες’ ρυθμίσεις.

Θα δημιουργήσουμε ένα τρίτο αρχείο.BAT, αυτή τη φορά για την εκκίνηση της εκπαίδευσης. Αντιγράψτε τον ακόλουθο κώδικα σε ένα αρχείο Notepad και αποθηκεύστε το ως αρχείο.BAT, όπως και πριν, ως training.bat (ή οποιοδήποτε όνομα σας αρέσει):

@echo off

REM Activate the virtual environment

call C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\Scripts\activate

REM Get user input

set /p DATASET_CONFIG=Enter the path to the dataset configuration file:

set /p EPOCHS=Enter the number of epochs to train:

set /p OUTPUT_NAME=Enter the output model name (e.g., example0001):

set /p LEARNING_RATE=Choose learning rate (1 for 1e-3, 2 for 5e-3, default 1e-3):

if "%LEARNING_RATE%"=="1" set LR=1e-3

if "%LEARNING_RATE%"=="2" set LR=5e-3

if "%LEARNING_RATE%"=="" set LR=1e-3

set /p SAVE_STEPS=How often (in steps) to save preview images:

set /p SAMPLE_PROMPTS=What is the location of the text-prompt file for training previews?

echo You entered:

echo Dataset configuration file: %DATASET_CONFIG%

echo Number of epochs: %EPOCHS%

echo Output name: %OUTPUT_NAME%

echo Learning rate: %LR%

echo Save preview images every %SAVE_STEPS% steps.

echo Text-prompt file: %SAMPLE_PROMPTS%

REM Prepare the command

set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^

C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^

--dit C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^

--dataset_config %DATASET_CONFIG% ^

--sdpa ^

--mixed_precision bf16 ^

--fp8_base ^

--optimizer_type adamw8bit ^

--learning_rate %LR% ^

--gradient_checkpointing ^

--max_data_loader_n_workers 2 ^

--persistent_data_loader_workers ^

--network_module=networks.lora ^

--network_dim=32 ^

--timestep_sampling sigmoid ^

--discrete_flow_shift 1.0 ^

--max_train_epochs %EPOCHS% ^

--save_every_n_epochs=1 ^

--seed 42 ^

--output_dir "C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\Output Models" ^

--output_name %OUTPUT_NAME% ^

--vae C:/Users/[Το όνομα του προφίλ σας]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^

--vae_chunk_size 32 ^

--vae_spatial_tile_sample_min_size 128 ^

--text_encoder1 C:/Users/[Το όνομα του προφίλ σας]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^

--text_encoder2 C:/Users/[Το όνομα του προφίλ σας]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^

--sample_prompts %SAMPLE_PROMPTS% ^

--sample_every_n_steps %SAVE_STEPS% ^

--sample_at_first

echo The following command will be executed:

echo %CMD%

set /p CONFIRM=Do you want to proceed with training (y/n)?

if /i "%CONFIRM%"=="y" (

%CMD%

) else (

echo Operation canceled.

)

REM Keep the window open

cmd /k

Όπως και πριν, βεβαιωθείτε ότι αντικαταστήσετε όλες τις εμφανίσεις του [Το όνομα του προφίλ σας] με το σωστό όνομα του προφίλ Windows.

Βεβαιωθείτε ότι ο φάκελος C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\Output Models\ υπάρχει, και δημιουργήστε τον σε αυτή τη θέση αν δεν υπάρχει.

Προεπισκόπηση εκπαίδευσης

Υπάρχει ένα πολύ βασικό χαρακτηριστικό προεπισκόπησης εκπαίδευσης που έχει ενεργοποιηθεί πρόσφατα για τον Musubi trainer, το οποίο σας επιτρέπει να αναγκάσετε το μοντέλο εκπαίδευσης να σταματήσει και να δημιουργήσει εικόνες με βάση τις προτροπές που έχετε αποθηκεύσει. Αυτές αποθηκεύονται σε ένα αυτόματα δημιουργημένο φάκελο με το όνομα Sample, στον ίδιο φάκελο που αποθηκεύονται τα εκπαιδευμένα μοντέλα.

Για να ενεργοποιήσετε αυτό, θα πρέπει να αποθηκεύσετε τουλάχιστον μια προτροπή σε ένα αρχείο κειμένου. Το αρχείο εκπαίδευσης.BAT θα σας ζητήσει να εισαγάγετε τη θέση αυτού του αρχείου. Οπότε μπορείτε να ονομάσετε το αρχείο προτροπής οτιδήποτε σας αρέσει και να το αποθηκεύσετε οπουδήποτε.

Εδώ είναι κάποια παραδείγματα προτροπών για ένα αρχείο που θα εξαγάγει τρεις διαφορετικές εικόνες όταν ζητηθεί από τη διαδικασία εκπαίδευσης:

Όπως μπορείτε να δείτε στο παραπάνω παράδειγμα, μπορείτε να τοποθετήσετε σημαίες στο τέλος της προτροπής που θα επηρεάσουν τις εικόνες:

–w είναι πλάτος (προεπιλογή 256px αν δεν οριστεί, σύμφωνα με τα έγγραφα)
–h είναι ύψος (προεπιλογή 256px αν δεν οριστεί)
–f είναι ο αριθμός καρέ. Αν οριστεί σε 1, παράγεται μια εικόνα. Περισσότερα από 1, παράγεται ένα βίντεο.
–d είναι ο σπόρος. Αν δεν οριστεί, είναι τυχαίος. Ορίστε τον για να δείτε μια προτροπή να εξελίσσεται.
–s είναι ο αριθμός βημάτων στη διαδικασία διάχυσης, προεπιλογή 20.

Δείτε τα επίσημα έγγραφα για επιπλέον σημαίες.

Αν και οι προεπισκόπησεις εκπαίδευσης μπορούν να αποκαλύψουν γρήγορα ορισμένα ζητήματα που μπορεί να σας κάνουν να ακυρώσετε την εκπαίδευση και να ξανασκεφτείτε τα δεδομένα ή τη ρύθμιση, θυμηθείτε ότι κάθε πρόσθετη προτροπή επιβραδύνει την εκπαίδευση λίγο περισσότερο.

Και, το μεγαλύτερο πλάτος και ύψος της εικόνας προεπισκόπησης (όπως ορίζεται από τις σημαίες που αναφέρθηκαν παραπάνω), το μεγαλύτερο θα επιβραδύνει την εκπαίδευση.

Εκκίνηση του αρχείου εκπαίδευσης.BAT.

Ερώτηση #1 είναι ‘Εισαγάγετε τη διαδρομή του αρχείου ρύθμισης συνόλου δεδομένων’. Επικολλήστε ή πληκτρολογήστε τη σωστή διαδρομή του αρχείου TOML.

Ερώτηση #2 είναι ‘Εισαγάγετε τον αριθμό επαναλήψεων για εκπαίδευση’. Αυτή είναι μια μεταβλητή που πρέπει να δοκιμαστεί, επειδή επηρεάζεται από την ποσότητα και την ποιότητα των εικόνων, καθώς και από τις λεζάντες και άλλα παράγοντες. Γενικά, είναι καλύτερο να τη ρυθμίσετε υψηλότερα παρά χαμηλότερα, επειδή μπορείτε πάντα να σταματήσετε την εκπαίδευση με Ctrl+C στο παράθυρο εκπαίδευσης αν νιώσετε ότι το μοντέλο έχει προχωρήσει αρκετά. Ρυθμίστε το σε 100 για πρώτη φορά και δείτε πώς θα πάνε τα πράγματα.

Ερώτηση #3 είναι ‘Εισαγάγετε το όνομα του μοντέλου εξόδου’. Ονομάστε το μοντέλο σας! Ίσως είναι καλύτερο να διατηρήσετε το όνομα σχετικά σύντομο και απλό.

Ερώτηση #4 είναι ‘Επιλέξτε τη ταχύτητα μάθησης’, η οποία προεπιλογή είναι 1e-3 (επιλογή 1). Αυτή είναι μια καλή θέση για να ξεκινήσετε, με βάση την εμπειρία.

Ερώτηση #5 είναι ‘Πόσο συχνά (σε βήματα) να αποθηκεύσετε προεπισκόπησεις εικόνων’. Αν τη ρυθμίσετε πολύ χαμηλά, θα δείτε λίγη πρόοδο μεταξύ των αποθηκευμένων προεπισκόπησεων, και αυτό θα επιβραδύνει την εκπαίδευση.

Ερώτηση #6 είναι ‘Ποια είναι η θέση του αρχείου προτροπής για προεπισκόπηση εκπαίδευσης’. Επικολλήστε ή πληκτρολογήστε τη διαδρομή του αρχείου προτροπής.

Το αρχείο.BAT θα σας δείξει την εντολή που θα στείλει στο μοντέλο Hunyuan, και θα σας ζητήσει αν θέλετε να συνεχίσετε, y/n.

Συνεχίστε και ξεκινήστε την εκπαίδευση:

Κατά τη διάρκεια αυτής της περιόδου, αν ελέγξετε το τμήμα GPU του παραθύρου επιδόσεων του Windows Task Manager, θα δείτε ότι η διαδικασία καταλαμβάνει περίπου 16GB VRAM.

Αυτό μπορεί να μην είναι μια τυχαία τιμή, επειδή αυτό είναι η ποσότητα VRAM που διαθέτουν πολλές κάρτες γραφικών NVIDIA, και ο κώδικας upstream μπορεί να έχει βελτιστοποιηθεί για να ταιριάζει σε 16GB για το όφελος εκείνων που κατέχουν τέτοιες κάρτες.

Ωστόσο, είναι πολύ εύκολο να αυξήσετε αυτή τη χρήση, στέλνοντας πιο ακραίες σημαίες στην εντολή εκπαίδευσης.

Κατά τη διάρκεια της εκπαίδευσης, θα δείτε στη δεξιά κάτω γωνία του παραθύρου CMD μια τιμή για το χρόνο που έχει περάσει από την έναρξη της εκπαίδευσης, και μια εκτίμηση του συνολικού χρόνου εκπαίδευσης (ο οποίος μπορεί να ποικίλλει πολύ, ανάλογα με τις σημαίες που ορίστηκαν, τον αριθμό των εικόνων εκπαίδευσης, τον αριθμό των προεπισκόπησεων εκπαίδευσης, και πολλούς άλλους παράγοντες).

Ο τυπικός χρόνος εκπαίδευσης είναι περίπου 3-4 ώρες σε μεσαίες ρυθμίσεις, ανάλογα με το διαθέσιμο υλικό, τον αριθμό των εικόνων, τις ρυθμίσεις σημαίων, και άλλους παράγοντες.

Χρήση των εκπαιδευμένων LoRA μοντέλων σας στο Hunyuan Video

Επιλογή σημείων

Όταν η εκπαίδευση ολοκληρωθεί, θα έχετε ένα σημείο μοντέλου για κάθε επανάληψη εκπαίδευσης.

Αυτή η συχνότητα αποθήκευσης μπορεί να αλλάξει από τον χρήστη για να αποθηκεύσει πιο συχνά ή λιγότερο συχνά, όπως επιθυμείτε, τροποποιώντας την --save_every_n_epochs [N] αριθμό στο αρχείο εκπαίδευσης.BAT. Αν έχετε ορίσει ένα χαμηλό αριθμό για αποθήκευση-βήματα, θα υπάρχει ένα μεγάλο αριθμός αρχείων σημείων.

Ποιο σημείο να επιλέξετε;

Όπως αναφέρθηκε νωρίτερα, τα πρώτα εκπαιδευμένα μοντέλα θα είναι πιο ευέλικτα, ενώ τα τελευταία σημεία μπορεί να προσφέρουν περισσότερη λεπτομέρεια. Ο único τρόπος για να ελέγξετε αυτά τα παράμετρους είναι να τρέξετε ορισμένα LoRAs και να δημιουργήσετε quelques βίντεο. Με αυτόν τον τρόπο, μπορείτε να μάθετε ποια σημεία είναι πιο παραγωγικά και αντιπροσωπεύουν τη καλύτερη ισορροπία μεταξύ ευελιξίας και πιστότητας.

ComfyUI

Το πιο δημοφιλές (αν και όχι το μόνο) περιβάλλον για τη χρήση Hunyuan Video LoRAs, αυτή τη στιγμή, είναι το ComfyUI, ένας node-βασισμένος editor με μια περίπλοκη Gradio διεπαφή που τρέχει στο πρόγραμμα περιήγησης web σας.

Πηγή: https://github.com/comfyanonymous/ComfyUI

Πηγή: https://github.com/comfyanonymous/ComfyUI

Οι οδηγίες εγκατάστασης είναι απλές και διαθέσιμες στο επίσημο αποθετήριο GitHub (πρόσθετα μοντέλα θα πρέπει να κατεβαστούν).

Μετατροπή μοντέλων για ComfyUI

Τα εκπαιδευμένα μοντέλα σας αποθηκεύονται σε μορφή (diffusers) που δεν είναι συμβατή με τις περισσότερες υλοποιήσεις του ComfyUI. Ο Musubi μπορεί να μετατρέψει ένα μοντέλο σε μορφή ComfyUI. Ας ρυθμίσουμε ένα αρχείο.BAT για να υλοποιήσουμε αυτό.

Πριν από την εκτέλεση αυτού του αρχείου.BAT, δημιουργήστε τον φάκελο C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\CONVERTED\ που το σενάριο περιμένει.

@echo off

REM Activate the virtual environment

call C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\Scripts\activate

:START

REM Get user input

set /p INPUT_PATH=Enter the path to the input Musubi safetensors file (or type "exit" to quit):

REM Exit if the user types "exit"

if /i "%INPUT_PATH%"=="exit" goto END

REM Extract the file name from the input path and append 'converted' to it

for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF

set OUTPUT_PATH=C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors

set TARGET=other

echo You entered:

echo Input file: %INPUT_PATH%

echo Output file: %OUTPUT_PATH%

echo Target format: %TARGET%

set /p CONFIRM=Do you want to proceed with the conversion (y/n)?

if /i "%CONFIRM%"=="y" (

REM Run the conversion script with correctly quoted paths

python C:\Users\[Το όνομα του προφίλ σας]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%

echo Conversion complete.

) else (

echo Operation canceled.

)

REM Return to start for another file

goto START

:END

REM Keep the window open

echo Exiting the script.

pause

Όπως και πριν, αποθηκεύστε το σενάριο ως ‘All files’ από το Notepad, ονομάζοντάς το convert.bat (ή οποιοδήποτε όνομα σας αρέσει).

Μόλις αποθηκευτεί, κάντε διπλό κλικ στο νέο αρχείο.BAT, το οποίο θα σας ζητήσει τη θέση του αρχείου για μετατροπή.

Επικολλήστε ή πληκτρολογήστε τη διαδρομή του αρχείου που θέλετε να μετατρέψετε, πατήστε y, και πατήστε enter.

Μετά την αποθήκευση του μετατρεπόμενου LoRA στο φάκελο CONVERTED, το σενάριο θα σας ζητήσει αν θέλετε να μετατρέψετε ένα άλλο αρχείο. Αν θέλετε να δοκιμάσετε πολλά σημεία, μετατρέψτε μια επιλογή μοντέλων.

Όταν έχετε μετατρέψει αρκετά μοντέλα, κλείστε το παράθυρο εντολών.BAT.

Τώρα μπορείτε να αντιγράψετε τα μετατρεπόμενα μοντέλα σας στο φάκελο models\loras στην εγκατάσταση ComfyUI σας.

Τυπικά, η σωστή θέση είναι κάτι σαν:

C:\Users\[Το όνομα του προφίλ σας]\Desktop\ComfyUI\models\loras\

Δημιουργία Hunyuan Video LoRAs στο ComfyUI

Αν και οι node-βασισμένες ροές του ComfyUI φαίνονται σύνθετες αρχικά, οι ρυθμίσεις άλλων πιο εμπειρογνώμονων χρηστών μπορούν να φορτωθούν με την σύρεση μιας εικόνας (δημιουργημένης με τις ρυθμίσεις ComfyUI άλλου χρήστη) απευθείας στο παράθυρο ComfyUI. Οι ροές μπορούν επίσης να εξαχθούν ως αρχεία JSON, τα οποία μπορούν να εισαχθούν χειροκίνητα, ή να σύρουν στο παράθυρο ComfyUI.

Ορισμένες εισαγμένες ροές μπορεί να έχουν εξαρτήσεις που δεν υπάρχουν στην εγκατάσταση σας. Οπότε, εγκαταστήστε το ComfyUI-Manager, το οποίο μπορεί να ανακτήσει αυτόματα τις λείπουσες μονάδες.

Πηγή: https://github.com/ltdrdata/ComfyUI-Manager

Πηγή: https://github.com/ltdrdata/ComfyUI-Manager

Για να φορτώσετε μια ροή που χρησιμοποιήθηκε για να δημιουργήσει βίντεο από τα μοντέλα σε αυτό το tutorial, κατεβάστε αυτό το αρχείο JSON και σύρετέ το στο παράθυρο ComfyUI (αν και υπάρχουν πολύ καλύτερα παραδείγματα ροών διαθέσιμα στις διάφορες κοινότητες Reddit και Discord που έχουν υιοθετήσει το Hunyuan Video, και η δική μου είναι προσαρμοσμένη από μια από αυτές).

Αυτό δεν είναι ο χώρος για μια εκτεταμένη οδηγία χρήσης του ComfyUI, αλλά αξίζει να αναφερθεί ότι ορισμένα κρίσιμα παράμετροι που θα επηρεάσουν την έξοδο σας αν κατεβάσετε και χρησιμοποιήσετε τη διάταξη JSON που συνδέζω παραπάνω.

1) Πλάτος και Ύψος

Το μεγαλύτερο πλάτος και ύψος της εικόνας, το μεγαλύτερο θα πάρει η δημιουργία, και το μεγαλύτερο το ρίσκο λάθους out-of-memory.

2) Μήκος

Αυτή είναι η αριθμητική τιμή για τον αριθμό των καρέ. Πόσος χρόνος αντιστοιχεί σε αυτό зависит από τη συχνότητα καρέ (οριστεί σε 30fps σε αυτή τη διάταξη). Μπορείτε να μετατρέψετε δευτερόλεπτα σε καρέ με βάση τη συχνότητα καρέ στο Omnicalculator.

3) Μέγεθος batch

Το υψηλότερο που ορίσετε το μέγεθος batch, το γρηγορότερο μπορεί να έρθει το αποτέλεσμα, αλλά το μεγαλύτερο το βάρος της VRAM. Ορίστε το πολύ υψηλά και μπορεί να πάθετε λάθος out-of-memory.

4) Ελέγχος μετά τη δημιουργία

Αυτό ελέγχει τον τυχαίο σπόρο. Οι επιλογές για αυτό το υπο-κόμβο είναι σταθερός, αύξηση, μείωση και τυχαίος. Αν αφήσετε το σταθερό και δεν αλλάξετε την κείμενο προτροπή, θα λάβετε την ίδια εικόνα κάθε φορά. Αν τροποποιήσετε την κείμενο προτροπή, η εικόνα θα αλλάξει σε κάποιο βαθμό. Οι ρυθμίσεις αύξησης και μείωσης σας επιτρέπουν να εξερευνήσετε γειτονικούς σπόρους, ενώ η ρύθμιση τυχαίου σας δίνει μια完全 νέα ερμηνεία της προτροπής.

5) Όνομα LoRA

Θα πρέπει να επιλέξετε το δικό σας εγκατεστημένο μοντέλο εδώ, πριν από την απόπειρα δημιουργίας.

6) Token

Αν έχετε εκπαιδεύσει το μοντέλο σας να ενεργοποιήσει την έννοια με ένα token (π.χ. ‘example-person’), βάλτε αυτή τη λέξη κλειδί στην προτροπή.

7) Βήματα

Αυτό αντιπροσωπεύει πόσα βήματα θα εφαρμοστούν στη διαδικασία διάχυσης. Υψηλότερα βήματα μπορεί να λάβουν καλύτερη λεπτομέρεια, αλλά υπάρχει ένα όριο στη αποτελεσματικότητα αυτής της προσέγγισης, και αυτό το όριο μπορεί να είναι δύσκολο να βρεθεί. Η κοινή περιοχή βημάτων είναι γύρω στα 20-30.

8) Μέγεθος Tile

Αυτό ορίζει πόση πληροφορία χειρίζεται κάθε φορά κατά τη δημιουργία. Ορίστε το mặc định σε 256. Αύξηση του μπορεί να επιταχύνει τη δημιουργία, αλλά αύξηση του πολύ υψηλά μπορεί να οδηγήσει σε ένα besonders ενοχλητικό λάθος out-of-memory, επειδή έρχεται στο τέλος μιας μακράς διαδικασίας.

9) Χρονική επικάλυψη

Η δημιουργία Hunyuan Video ανθρώπων μπορεί να οδηγήσει σε ‘ghosting’, ή μη πειστική κίνηση αν ορίσετε αυτό πολύ χαμηλά. Γενικά, η τρέχουσα σοφία είναι ότι αυτό πρέπει να οριστεί σε υψηλότερη τιμή από τον αριθμό των καρέ, για να παράγει καλύτερη κίνηση.

Συμπέρασμα

Αν και η περαιτέρω εξερεύνηση της χρήσης του ComfyUI είναι πέρα από το πεδίο εφαρμογής αυτού του άρθρου, η εμπειρία της κοινότητας στο Reddit και Discord μπορεί να διευκολύνει την εκμάθηση, και υπάρχουν διάφορα διαδικτυακά οδηγοί που εισάγουν τις βασικές έννοιες.

 

Πρώτη δημοσίευση Πέμπτη, 23 Ιανουαρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai