Andersons Blickwinkel
Wie man Hunyuan-Video-LoRA-Modelle trainiert und verwendet

Dieser Artikel zeigt Ihnen, wie Sie Windows-basierte Software installieren und verwenden kÃķnnen, um Hunyuan-Video-LoRA-Modelle zu trainieren, sodass der Benutzer benutzerdefinierte PersÃķnlichkeiten im Hunyuan-Video-Grundmodell erstellen kann:
Klicken Sie, um abzuspielen. Beispiele aus der jÞngsten Explosion von Celebrity-Hunyuan-LoRAs aus der civit.ai-Community.
Zurzeit gibt es zwei beliebte Methoden, um Hunyuan-LoRA-Modelle lokal zu generieren:
1) Das diffusion-pipe-ui-Docker-basierte Framework, das auf Windows-Subsystem fÞr Linux (WSL) angewiesen ist, um einige der Prozesse zu verarbeiten.
2) Musubi-Tuner, ein neuer Teil der beliebten Kohya-ss-Diffusions-Trainings-Architektur. Musubi-Tuner benÃķtigt kein Docker und hÃĪngt nicht von WSL oder anderen Linux-basierten Proxys ab â aber es kann schwierig sein, es auf Windows zum Laufen zu bringen.
Daher konzentriert sich diese DurchfÞhrung auf Musubi-Tuner und bietet eine vollstÃĪndig lokale LÃķsung fÞr die Hunyuan-LoRA-Ausbildung und -Generierung, ohne die Verwendung von API-getriebenen Websites oder kommerziellen GPU-Verleihprozessen wie Runpod.
Klicken Sie, um abzuspielen. Beispiele aus der LoRA-Ausbildung auf Musubi-Tuner fÞr diesen Artikel. Alle Genehmigungen wurden von der abgebildeten Person erteilt, um diesen Artikel zu illustrieren.
ANFORDERUNGEN
Die Installation erfordert mindestens einen Windows-10-PC mit einer 30+/40+-Serie-NVIDIA -Karte, die mindestens 12 GB VRAM hat (obwohl 16 GB empfohlen wird). Die fÞr diesen Artikel verwendete Installation wurde auf einem System mit 64 GB System-RAM und einer NVIDIA-3090-Grafikkarte mit 24 GB VRAM getestet. Es wurde auf einem dedizierten Test-Bed-System mit einer frischen Installation von Windows 10 Professional auf einer Partition mit 600+ GB freiem Festplattenspeicher getestet.
WARNUNG
Die Installation von Musubi-Tuner und seinen Voraussetzungen beinhaltet auch die Installation von entwicklerorientierter Software und Paketen direkt auf die Haupt-Windows-Installation eines PCs. Wenn man die Installation von ComfyUI in den Endstadien berÞcksichtigt, benÃķtigt dieses Projekt etwa 400-500 Gigabyte Festplattenspeicher. Obwohl ich das Verfahren mehrmals in neu installierten Test-Bed-Windows-10-Umgebungen ohne ZwischenfÃĪlle getestet habe, bin ich weder haftbar fÞr SchÃĪden an Systemen durch Befolgen dieser Anweisungen. Ich empfehle Ihnen, alle wichtigen Daten vor dem Versuch einer solchen Installationsprozedur zu sichern.
ÃBERLEGUNGEN
Ist diese Methode noch gÞltig?
Die generative KI-Szene bewegt sich sehr schnell, und wir kÃķnnen besser und strÃķmungsoptimierte Methoden fÞr Hunyuan-Video-LoRA-Frameworks in diesem Jahr erwarten.
âĶ oder sogar diese Woche! WÃĪhrend ich diesen Artikel schrieb, produzierte der Entwickler von Kohya/Musubi musubi-tuner-gui, eine fortschrittliche Gradio-OberflÃĪche fÞr Musubi-Tuner:

Offensichtlich ist eine benutzerfreundliche OberflÃĪche einer BAT-Datei vorzuziehen, die ich in diesem Feature verwende â sobald musubi-tuner-gui funktioniert. Als ich schrieb, war es erst vor fÞnf Tagen online gegangen, und ich konnte keine Berichte darÞber finden, dass jemand es erfolgreich verwendet hat.
Laut Posts im Repository soll die neue OberflÃĪche so bald wie mÃķglich direkt in das Musubi-Tuner-Projekt integriert werden, was sein aktuelles Dasein als separates GitHub-Repository beenden wird.
Basierend auf den aktuellen Installationsanweisungen wird die neue OberflÃĪche direkt in die bestehende Musubi-Virtual-Umgebung geklont; und trotz vieler BemÞhungen kann ich sie nicht mit der bestehenden Musubi-Installation verknÞpfen. Das bedeutet, dass sie, wenn sie lÃĪuft, feststellen wird, dass sie keinen Motor hat!
Sobald die OberflÃĪche in Musubi-Tuner integriert ist, werden Probleme dieser Art sicherlich behoben. Obwohl der Autor zugeben muss, dass das neue Projekt âsehr rauâ ist, ist er optimistisch Þber seine Entwicklung und Integration direkt in Musubi-Tuner.
Angesichts dieser Probleme (auch im Hinblick auf Standardpfade zur Installationszeit und die Verwendung des UV-Python-Pakets, das bestimmte Verfahren in der neuen Version kompliziert), werden wir wahrscheinlich ein wenig warten mÞssen, bis wir eine reibungslosere Hunyuan-Video-LoRA-Trainings-Erfahrung haben. Das sieht jedoch sehr vielversprechend aus!
Aber wenn Sie nicht warten kÃķnnen und bereit sind, Ihre Ãrmel hochzukrempeln, kÃķnnen Sie Hunyuan-Video-LoRA-Training direkt jetzt lokal ausfÞhren.
Lassen Sie uns beginnen.
WARUM ETWAS AUF BARE METAL INSTALLIEREN?
(Ãberspringen Sie diesen Absatz, wenn Sie kein fortgeschrittener Benutzer sind)
Fortgeschrittene Benutzer werden sich fragen, warum ich so viel Software auf der Bare-Metal-Windows-10-Installation installiert habe, anstatt in einer virtuellen Umgebung. Der Grund dafÞr ist, dass die wesentliche Windows-Port der Linux-basierten Triton-Paketes viel schwieriger in einer virtuellen Umgebung zu installieren ist. Alle anderen Bare-Metal-Installationen in diesem Tutorial konnten nicht in einer virtuellen Umgebung installiert werden, da sie direkt mit lokalen Hardware-Komponenten interagieren mÞssen.
INSTALLATION VON VORAUSSETZUNGENSPAKETEN UND PROGRAMMEN
FÞr die Programme und Pakete, die zunÃĪchst installiert werden mÞssen, ist die Reihenfolge der Installation wichtig. Lassen Sie uns beginnen.
1: HERUNTERLADEN VON MICROSOFT REDISTRIBUTABLE
Laden Sie das Microsoft -Redistributable-Paket von https://aka.ms/vs/17/release/vc_redist.x64.exe herunter und installieren Sie es.
Dies ist eine einfache und schnelle Installation.

2: INSTALLATION VON VISUAL STUDIO 2022
Laden Sie die Microsoft-Visual-Studio-2022-Community-Edition von https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta herunter.
Starten Sie den heruntergeladenen Installer:

Wir benÃķtigen nicht alle verfÞgbaren Pakete, was eine schwere und lange Installation wÃĪre. Auf der anfÃĪnglichen Workloads-Seite, die geÃķffnet wird, aktivieren Sie Desktop-Entwicklung mit C++ (siehe Bild unten).

Jetzt klicken Sie auf die Individual Components-Registerkarte in der oberen linken Ecke der OberflÃĪche und verwenden Sie die Suchleiste, um âWindows-SDKâ zu finden.

StandardmÃĪÃig ist nur das Windows-11-SDK aktiviert. Wenn Sie auf Windows 10 sind (diese Installationsprozedur wurde von mir nicht auf Windows 11 getestet), aktivieren Sie die neueste Windows-10-Version, wie im Bild oben angezeigt.
Suchen Sie nach âC++ CMakeâ und ÞberprÞfen Sie, ob C++ CMake-Tools fÞr Windows aktiviert sind.

Diese Installation wird mindestens 13 GB Speicherplatz benÃķtigen.

Sobald Visual Studio installiert ist, wird es versuchen, auf Ihrem Computer zu starten. Lassen Sie es vollstÃĪndig Ãķffnen. Wenn die vollstÃĪndige Visual-Studio-OberflÃĪche endlich sichtbar ist, schlieÃen Sie das Programm.
3: INSTALLATION VON VISUAL STUDIO 2019
Einige der nachfolgenden Pakete fÞr Musubi erwarten eine ÃĪltere Version von Microsoft Visual Studio, wÃĪhrend andere eine neuere Version benÃķtigen.
Deshalb laden Sie auch die kostenlose Community-Edition von Visual Studio 19 entweder von Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ â Konto erforderlich) oder Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html) herunter.
Installieren Sie es mit den gleichen Optionen wie fÞr Visual Studio 2022 (siehe Prozedur oben, auÃer dass Windows-SDK im Visual-Studio-2019-Installer bereits aktiviert ist).
Sie werden sehen, dass der Visual-Studio-2019-Installer bereits die neuere Version kennt, wÃĪhrend er installiert wird:

Wenn die Installation abgeschlossen ist und Sie die installierte Visual-Studio-2019-Anwendung geÃķffnet und geschlossen haben, Ãķffnen Sie ein Windows-Kommandozeilenfenster (Tippen Sie CMD in die Start-Suche) und geben Sie ein und fÞhren Sie aus:
where cl
Das Ergebnis sollte die bekannten Orte der beiden installierten Visual-Studio-Editionen sein.

Wenn Sie stattdessen INFO: Could not find files for the given pattern(s) erhalten, sehen Sie sich den ÃberprÞfen des Pfads-Abschnitt dieses Artikels an und verwenden Sie diese Anweisungen, um die relevanten Visual-Studio-Pfade zur Windows-Umgebung hinzuzufÞgen.
Speichern Sie alle Ãnderungen, die gemÃĪà dem ÃberprÞfen des Pfads-Abschnitt unten vorgenommen wurden, und versuchen Sie dann, den where cl-Befehl erneut auszufÞhren.
4: INSTALLATION VON CUDA 11 + 12-TOOLKITS
Die verschiedenen Pakete, die in Musubi installiert werden, benÃķtigen unterschiedliche Versionen von NVIDIA-CUDA, die die Ausbildung auf NVIDIA-Grafikkarten beschleunigt und optimiert.
Der Grund, warum wir die Visual-Studio-Versionen zuerst installiert haben, ist, dass die NVIDIA-CUDA-Installationsprogramme nach vorhandenen Visual-Studio-Installationen suchen und sich in diese integrieren.
Laden Sie ein 11+-Serie-CUDA-Installationspaket von
https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (laden Sie âexe (lokal)â herunter)
Laden Sie ein 12+-Serie-CUDA-Toolkit-Installationspaket von
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
Der Installationsprozess ist fÞr beide Installationsprogramme identisch. Ignorieren Sie alle Warnungen Þber die Existenz oder Nichtexistenz von Installationspfaden in Windows-Umgebungsvariablen â wir werden uns spÃĪter darum kÞmmern.
INSTALLATION VON NVIDIA-CUDA-TOOLKIT V11+
Starten Sie das Installationsprogramm fÞr die 11+-Serie-CUDA-Toolkit.


Bei Installationsoptionen wÃĪhlen Sie Benutzerdefiniert (Erweitert) und gehen Sie weiter.

Deaktivieren Sie die Option NVIDIA GeForce Experience und klicken Sie auf Weiter.

Lassen Sie Auswahl des Installationsorts auf den Standardwerten (das ist wichtig):

Klicken Sie auf Weiter und lassen Sie die Installation abgeschlossen werden.

Ignorieren Sie alle Warnungen oder Hinweise, die das Installationsprogramm Þber Nsight-Visual-Studio-Integration gibt, die fÞr unseren Anwendungsfall nicht erforderlich ist.
INSTALLATION VON NVIDIA-CUDA-TOOLKIT V12+
Wiederholen Sie den gesamten Prozess fÞr das separate 12+-NVIDIA-Toolkit-Installationsprogramm, das Sie heruntergeladen haben:

Der Installationsprozess fÞr diese Version ist identisch mit dem oben beschriebenen (11+-Version), auÃer einer Warnung Þber Umgebungswege, die Sie ignorieren kÃķnnen:

Wenn die 12+-CUDA-Version-Installation abgeschlossen ist, Ãķffnen Sie ein Kommandozeilenfenster in Windows und geben Sie ein und fÞhren Sie aus:
nvcc --version
Dies sollte Informationen Þber die installierte Treiberversion anzeigen:

Um zu ÞberprÞfen, ob Ihre Karte erkannt wird, geben Sie ein und fÞhren Sie aus:
nvidia-smi

5: INSTALLATION VON GIT
GIT wird die Installation des Musubi-Repositorys auf Ihrem lokalen Computer verwalten. Laden Sie den GIT-Installer von
https://git-scm.com/downloads/win (â64-Bit-Git-for-Windows-Setupâ)

FÞhren Sie den Installer aus:

Verwenden Sie die Standardkomponenten fÞr AuswÃĪhlen der Komponenten:

Lassen Sie den Standard-Editor bei Vim:

Lassen Sie GIT entscheiden, wie die Branch-Namen lauten sollen:

Verwenden Sie die empfohlenen Einstellungen fÞr den Pfad der Umgebung:

Verwenden Sie die empfohlenen Einstellungen fÞr SSH:

Verwenden Sie die empfohlenen Einstellungen fÞr HTTPS-Transport-Backend:

Verwenden Sie die empfohlenen Einstellungen fÞr Zeilenende-Konvertierungen:

WÃĪhlen Sie die Windows-Standardkonsole als Terminal-Emulator:

Verwenden Sie die Standard-Einstellungen (Fast-Forward oder ZusammenfÞhren) fÞr Git-Pull:

Verwenden Sie Git-Credential-Manager (die Standard-Einstellung) fÞr Credential-Helfer:

In Konfigurieren von Zusatzoptionen lassen Sie Dateisystem-Caching aktivieren aktiviert und Symbolische Links aktivieren deaktiviert (es sei denn, Sie sind ein fortgeschrittener Benutzer, der fÞr ein zentrales Modell-Repository harte Links verwendet).

Beenden Sie die Installation und testen Sie, ob GIT ordnungsgemÃĪà installiert ist, indem Sie ein Kommandozeilenfenster in Windows Ãķffnen und eingeben und ausfÞhren:
git --version

GITHUB-LOGIN
SpÃĪter, wenn Sie versuchen, GitHub-Repositorys zu klonen, werden Sie mÃķglicherweise nach Ihren GitHub-Anmeldeinformationen gefragt. Um dies zu antizipieren, melden Sie sich in Ihrem GitHub-Konto an (erstellen Sie eines, wenn notwendig) auf jedem Windows-System, auf dem Sie installiert sind. Auf diese Weise sollte die 0Auth-Authentifizierungsmethode (ein Pop-up-Fenster) so wenig Zeit wie mÃķglich in Anspruch nehmen.
Nach dieser anfÃĪnglichen Herausforderung sollten Sie automatisch authentifiziert bleiben.
6: INSTALLATION VON CMAKE
CMake 3.21 oder neuer ist fÞr Teile des Musubi-Installationsprozesses erforderlich. CMake ist eine plattformÞbergreifende Entwicklungsumgebung, die in der Lage ist, diverse Compiler zu orchestrieren und Software aus Quellcode zu kompilieren.
Laden Sie es von
https://cmake.org/download/ (âWindows x64-Installerâ)
Starten Sie den Installer:

Stellen Sie sicher, dass CMake dem Pfad der Umgebung hinzufÞgen aktiviert ist.

Klicken Sie auf Weiter.

Geben Sie in einem Windows-Kommandozeilenfenster ein und fÞhren Sie aus:
cmake --version
Wenn CMake erfolgreich installiert ist, sollte es etwas wie folgt anzeigen:
cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: INSTALLATION VON PYTHON 3.10
Der Python-Interpreter ist fÞr dieses Projekt von zentraler Bedeutung. Laden Sie die Version 3.10 (der beste Kompromiss zwischen den verschiedenen Anforderungen der Musubi-Pakete) von
https://www.python.org/downloads/release/python-3100/ (âWindows-Installer (64-Bit)â)
FÞhren Sie den heruntergeladenen Installer aus und lassen Sie die Standard-Einstellungen:


Am Ende des Installationsprozesses klicken Sie auf PfadlÃĪngenbegrenzung deaktivieren (erfordert UAC-Admin-BestÃĪtigung):

Geben Sie in einem Windows-Kommandozeilenfenster ein und fÞhren Sie aus:
python --version
Dies sollte Python 3.10.0 ergeben

ÃBERPRÃFEN DER PFADE
Das Klonen und die Installation der Musubi-Frameworks sowie deren normale Funktionsweise nach der Installation erfordern, dass ihre Komponenten den Pfad zu mehreren wichtigen externen Komponenten in Windows kennen, insbesondere CUDA.
Wir mÞssen also die Pfadumgebung Ãķffnen und ÞberprÞfen, ob alle erforderlichen Komponenten vorhanden sind.
Ein schneller Weg, um zu den Steuerungen fÞr die Windows-Umgebung zu gelangen, besteht darin, Systemumgebungsvariablen bearbeiten in die Windows-Suche zu tippen.

Wenn Sie dies anklicken, Ãķffnet sich das Systemeigenschaften-Steuerungsfeld. In der unteren rechten Ecke des Systemeigenschaften-Steuerungsfelds klicken Sie auf die Umgebungsvariablen-SchaltflÃĪche, und ein Fenster namens Umgebungsvariablen Ãķffnet sich. Im Systemvariablen-Panel in der unteren HÃĪlfte dieses Fensters scrollen Sie nach unten zu Pfad und doppelklicken Sie darauf. Dies Ãķffnet ein Fenster namens Umgebungsvariablen bearbeiten. Ziehen Sie die Breite dieses Fensters weiter, damit Sie den vollstÃĪndigen Pfad der Variablen sehen kÃķnnen:

Hier sind die wichtigsten EintrÃĪge:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin
In den meisten FÃĪllen sollten die richtigen Pfadvariablen bereits vorhanden sein.
FÞgen Sie fehlende Pfade hinzu, indem Sie Neu auf der linken Seite des Umgebungsvariablen bearbeiten-Fensters anklicken und den richtigen Pfad einfÞgen:

Ãbersetzen Sie nicht einfach aus den oben aufgefÞhrten Pfaden; ÞberprÞfen Sie, ob jeder ÃĪquivalente Pfad in Ihrer eigenen Windows-Installation vorhanden ist.
Wenn es geringe Pfadabweichungen gibt (insbesondere bei Visual-Studio-Installationen), verwenden Sie die oben aufgefÞhrten Pfade, um die richtigen Zielordner zu finden (d. h. x64 in Host64 in Ihrer eigenen Installation). FÞgen Sie dann diese Pfade in das Umgebungsvariablen bearbeiten-Fenster ein.
Nach diesem Schritt starten Sie den Computer neu.
INSTALLATION VON MUSUBI
Aktualisieren von PIP
Die Verwendung der neuesten Version des PIP-Installationsprogramms kann einige der Installationsstufen erleichtern. In einem Windows-Kommandozeilenfenster mit Administratorrechten (siehe ErhÃķhung unten) geben Sie ein und fÞhren Sie aus:
pip install --upgrade pip
ErhÃķhung
Einige Befehle kÃķnnen erhÃķhte Rechte erfordern (d. h. sie mÞssen als Administrator ausgefÞhrt werden). Wenn Sie Fehlermeldungen Þber Berechtigungen erhalten, schlieÃen Sie das Kommandozeilenfenster und Ãķffnen Sie es erneut im Administrator-Modus, indem Sie CMD in die Windows-Suche eingeben, mit der rechten Maustaste auf Command Prompt klicken und AusfÞhren als Administrator auswÃĪhlen:

FÞr die nÃĪchsten Schritte werden wir anstelle des Windows-Kommandozeilenfensters Windows-PowerShell verwenden. Sie kÃķnnen dies finden, indem Sie PowerShell in die Windows-Suche eingeben und (falls erforderlich) mit der rechten Maustaste darauf klicken und AusfÞhren als Administrator auswÃĪhlen:

INSTALLATION VON TORCH
In PowerShell geben Sie ein und fÞhren Sie aus:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
Seien Sie geduldig, wÃĪhrend die vielen Pakete installiert werden.
Wenn die Installation abgeschlossen ist, kÃķnnen Sie eine GPU-aktivierte PyTorch-Installation ÞberprÞfen, indem Sie eingeben und ausfÞhren:
python -c "import torch; print(torch.cuda.is_available())"
Dies sollte True ergeben

INSTALLATION VON TRITON FÃR WINDOWS
Als NÃĪchstes die Installation der Triton fÞr Windows-Komponente. In PowerShell mit erhÃķhten Rechten geben Sie ein und fÞhren Sie aus (in einer Zeile):
pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(Das Installationsprogramm triton-3.1.0-cp310-cp310-win_amd64.whl funktioniert sowohl fÞr Intel- als auch fÞr AMD-Prozessoren, solange die Architektur 64-Bit und die Umgebung der Python-Version entspricht)
Nach dem AusfÞhren sollte dies zu Successfully installed triton-3.1.0 fÞhren
Wir kÃķnnen ÞberprÞfen, ob Triton funktioniert, indem wir es in Python importieren. Geben Sie ein:
python -c "import triton; print('Triton is working')"
Dies sollte Triton is working ausgeben
Um zu ÞberprÞfen, ob Triton GPU-aktiviert ist, geben Sie ein:
python -c "import torch; print(torch.cuda.is_available())"
Dies sollte True ergeben

ERSTELLEN DER VIRTUELLEN UMGEbung FÃR MUSUBI
Von jetzt an werden wir alle weitere Software in einer Python-Virtual-Umgebung (oder venv) installieren. Dies bedeutet, dass Sie alles, was Sie installieren, durch das Verschieben des venv-Installationsordners in den Papierkorb deinstallieren kÃķnnen.
Lassen Sie uns den Installationsordner erstellen: Erstellen Sie einen Ordner namens Musubi auf Ihrem Desktop. Die folgenden Beispiele gehen davon aus, dass dieser Ordner existiert: C:\Users\[Ihr Profilname]\Desktop\Musubi\.
In PowerShell navigieren Sie zu diesem Ordner, indem Sie eingeben:
cd C:\Users\[Ihr Profilname]\Desktop\Musubi
Wir mÃķchten, dass die virtuelle Umgebung Zugriff auf das hat, was wir bereits installiert haben (insbesondere Triton), also werden wir die --system-site-packages-Flag verwenden. Geben Sie ein:
python -m venv --system-site-packages musubi
Warten Sie, bis die Umgebung erstellt ist, und aktivieren Sie sie dann, indem Sie eingeben:
.\musubi\Scripts\activate
Von diesem Punkt an kÃķnnen Sie erkennen, dass Sie in der aktivierten virtuellen Umgebung sind, indem Sie (musubi) am Anfang aller Ihrer Prompts sehen.

KLONEN DES REPOSITORIES
Navigieren Sie zum neu erstellten musubi-Ordner (der sich im Musubi-Ordner auf Ihrem Desktop befindet):
cd musubi
Jetzt, da wir am richtigen Ort sind, geben Sie den folgenden Befehl ein:
git clone https://github.com/kohya-ss/musubi-tuner.git
Warten Sie, bis das Klonen abgeschlossen ist (es wird nicht lange dauern).

INSTALLATION DER VORAUSSETZUNGEN
Navigieren Sie zum Installationsordner:
cd musubi-tuner
Geben Sie ein:
pip install -r requirements.txt
Warten Sie, bis die vielen Installationen abgeschlossen sind (dies wird lÃĪnger dauern).

AUTOMATISIERUNG DES ZUGRIFFS ZUR HUNYUAN-VIDEO-VENV
Um leicht auf die neue venv fÞr zukÞnftige Sitzungen zuzugreifen, kopieren Sie den folgenden Text in Notepad und speichern Sie ihn mit dem Namen activate.bat, indem Sie ihn im Alle Dateien-Format speichern (siehe Bild unten).
@echo off
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate
cd C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner
cmd
(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Es ist nicht wichtig, in welchen Speicherort Sie diese Datei speichern.
Ab jetzt kÃķnnen Sie durch Doppelklicken auf activate.bat sofort beginnen.

VERWENDEN VON MUSUBI-TUNER
HERUNTERLADEN DER MODELLE
Der Hunyuan-Video-LoRA-Trainingsprozess erfordert das Herunterladen von mindestens sieben Modellen, um alle mÃķglichen Optimierungsoptionen fÞr das Pre-Caching und das Training eines Hunyuan-Video-LoRAs zu unterstÞtzen. Zusammen wiegen diese Modelle mehr als 60 GB.
Aktuelle Anweisungen zum Herunterladen finden Sie unter https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download
Es handelt sich jedoch um die Download-Anweisungen zum Zeitpunkt des Schreibens:
clip_l.safetensors und
llava_llama3_fp16.safetensors
llava_llama3_fp8_scaled.safetensors
kÃķnnen von https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders heruntergeladen werden
mp_rank_00_model_states.pt und
mp_rank_00_model_states_fp8.pt
mp_rank_00_model_states_fp8_map.pt
kÃķnnen von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers heruntergeladen werden
pytorch_model.pt
kann von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae heruntergeladen werden
Obwohl Sie diese in jedem Ordner speichern kÃķnnen, den Sie mÃķchten, sollten Sie sie fÞr Konsistenz mit spÃĪteren Skripten in C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\ speichern.
Dies ist konsistent mit der Ordnerstruktur vor diesem Punkt. Vergessen Sie nicht, [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils zu ersetzen.
DATENPRÃPARATION
Wenn man die Community-Kontroverse Þber diesen Punkt ignoriert, kann man sagen, dass Sie zwischen 10-100 Fotos fÞr ein Trainingsdataset fÞr Ihre Hunyuan-LoRA benÃķtigen. Sehr gute Ergebnisse kÃķnnen sogar mit 15 Bildern erzielt werden, solange die Bilder gut ausgewogen und von guter QualitÃĪt sind.
Ein Hunyuan-LoRA kann sowohl auf Bildern als auch auf sehr kurzen und niedrig auflÃķsenden Videoclips trainiert werden oder sogar auf einer Mischung aus beidem â obwohl die Verwendung von Videoclips als Trainingsdaten selbst fÞr eine 24-GB-Karte herausfordernd ist.
Beispiele wÃĪren Roger Rabbit, ein Xenomorph, The Mask, Spider-Man oder andere PersÃķnlichkeiten, die einzigartige charakteristische Bewegungen besitzen.
Da Hunyuan-Video bereits weiÃ, wie normale MÃĪnner und Frauen sich bewegen, sind Videoclips nicht notwendig, um eine Þberzeugende Hunyuan-Video-LoRA-Menschentyp-PersÃķnlichkeit zu erhalten. Wir werden also statische Bilder verwenden.
BILDPRAPARATION
DER EIMER-LISTE
Die Kurzversion:
Es ist am besten, entweder Bilder zu verwenden, die alle die gleiche GrÃķÃe haben, oder eine 50/50-Aufteilung zwischen zwei verschiedenen GrÃķÃen, d. h. 10 Bilder, die 512x768px und 10, die 768x512px sind.
Das Training kann gut verlaufen, auch wenn Sie dies nicht tun â Hunyuan-Video-LoRAs kÃķnnen Þberraschend nachsichtig sein.
Die lÃĪngere Version
Wie bei Kohya-ss-LoRAs fÞr statische generative Systeme wie Stable Diffusion wird Bucketing verwendet, um die Arbeitslast auf unterschiedlich groÃe Bilder zu verteilen, sodass grÃķÃere Bilder ohne AuslÃķsen von Out-of-Memory-Fehlern wÃĪhrend des Trainings verwendet werden kÃķnnen (d. h. Bucketing âschneidetâ die Bilder in StÞcke, die die GPU verarbeiten kann, wÃĪhrend die semantische IntegritÃĪt des gesamten Bildes erhalten bleibt).
FÞr jede BildgrÃķÃe, die Sie in Ihrem Trainingsdataset enthalten (d. h. 512x768px), wird ein Bucket oder âTeilaufgabeâ erstellt. Wenn Sie also die folgende Verteilung von Bildern haben, wird die Bucket-Aufmerksamkeit ungleich unter den Bildern verteilt und birgt das Risiko, dass einige Fotos bei der Ausbildung mehr BerÞcksichtigung finden als andere:
2x 512x768px-Bilder
7x 768x512px-Bilder
1x 1000x600px-Bild
3x 400x800px-Bilder
Wir kÃķnnen sehen, dass die Bucket-Aufmerksamkeit unter diesen Bildern ungleich verteilt ist:

Daher sollten Sie entweder bei einem Format bleiben oder versuchen, die Verteilung der verschiedenen GrÃķÃen relativ gleich zu halten.
Vermeiden Sie sehr groÃe Bilder, da dies das Training verlangsamen kann, ohne nennenswerte Vorteile zu bieten.
Ich habe fÞr alle Fotos in meinem Dataset 512x768px verwendet.
Haftungsausschluss: Das Modell (die Person) in dem Dataset gab mir die volle Erlaubnis, diese Bilder fÞr diesen Zweck zu verwenden, und genehmigte alle AI-basierten Ausgaben, die ihre Ãhnlichkeit in diesem Artikel darstellen.

Mein Dataset besteht aus 40 Bildern im PNG-Format (obwohl JPG auch in Ordnung ist). Meine Bilder wurden in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman gespeichert
Sie sollten einen Cache-Ordner innerhalb des Trainingsbildordners erstellen:

Lassen Sie uns nun eine spezielle Datei erstellen, die das Training konfigurieren wird.
TOML-DATEIEN
Der Trainings- und Pre-Caching-Prozess von Hunyuan-Video-LoRAs erhÃĪlt die Dateipfade aus einer flachen Textdatei mit der .toml-Erweiterung.
FÞr meinen Test befindet sich die TOML-Datei in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml
Der Inhalt meiner Trainings-TOML sieht so aus:
[general]
resolution = [512, 768]
caption_extension = ".txt"
batch_size = 1
enable_bucket = true
bucket_no_upscale = false
[[datasets]]
image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"
cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"
num_repeats = 1
(Die doppelten Backslashes fÞr Bild- und Cache-Verzeichnisse sind nicht immer notwendig, kÃķnnen aber helfen, Fehler zu vermeiden, wenn es einen Leerzeichen im Pfad gibt. Ich habe Modelle trainiert, deren.toml-Dateien einfache VorwÃĪrts- und RÞckwÃĪrts-Slashes verwendet haben)
Wir kÃķnnen im resolution-Abschnitt sehen, dass zwei AuflÃķsungen berÞcksichtigt werden â 512px und 768px. Sie kÃķnnen dies auch auf 512 belassen und dennoch gute Ergebnisse erzielen.
UNTERSCHEIFTE
Hunyuan-Video ist ein Text+Bild-Grundmodell, daher benÃķtigen wir beschreibende Unterscheifte fÞr diese Bilder, die wÃĪhrend des Trainings berÞcksichtigt werden. Der Trainingsprozess schlÃĪgt fehl, wenn keine Unterscheifte vorhanden sind.
Es gibt eine Vielfalt von Open-Source-Beschriftungssystemen, die wir fÞr diese Aufgabe verwenden kÃķnnten, aber lassen Sie uns es einfach halten und das taggui-System verwenden. Obwohl es auf GitHub gespeichert ist und obwohl es bei der ersten AusfÞhrung einige sehr groÃe Deep-Learning-Modelle herunterlÃĪdt, kommt es in Form eines einfachen Windows-Executable vor, der Python-Bibliotheken und eine einfache OberflÃĪche lÃĪdt.
Nach dem Starten von Taggui verwenden Sie Datei > Verzeichnis laden, um zu Ihrem Bild-DataSet zu navigieren, und geben Sie optional einen Token-Bezeichner ein (in diesem Fall examplewoman), der allen Unterscheiften hinzugefÞgt wird:

(Stellen Sie sicher, dass Sie Laden in 4-Bit deaktivieren, wenn Taggui zum ersten Mal geÃķffnet wird â es wird Fehler wÃĪhrend der Beschriftung ausgeben, wenn dies aktiviert bleibt)
WÃĪhlen Sie ein Bild in der linken Vorschau-Spalte aus und drÞcken Sie STRG+A, um alle Bilder auszuwÃĪhlen. Dann klicken Sie auf die SchaltflÃĪche Auto-Beschriftung starten auf der rechten Seite:

Sie werden sehen, wie Taggui Modelle im kleinen CLI im rechten Spaltenbereich herunterlÃĪdt, aber nur, wenn dies das erste Mal ist, dass Sie den Beschriftungs-Tool verwenden. Andernfalls sehen Sie eine Vorschau der Beschriftungen.

Jetzt hat jedes Foto eine entsprechende.txt-Unterschrift mit einer Beschreibung des Bildinhalts:

Sie kÃķnnen auf Erweiterte Optionen in Taggui klicken, um die LÃĪnge und den Stil der Beschriftungen zu erhÃķhen, aber das geht Þber den Rahmen dieses Durchlaufs hinaus.
Beenden Sie Taggui und lassen Sie uns zuâĶ
LATENTE VORCACHING
Um eine ÞbermÃĪÃige GPU-Last wÃĪhrend des Trainings zu vermeiden, ist es notwendig, zwei Arten von vorverarbeiteten Dateien zu erstellen â eine, um das latente Bild abzubilden, das aus den Bildern selbst abgeleitet wird, und eine andere, um eine Textkodierung im Zusammenhang mit der Beschriftungsinhaltsbeschreibung zu bewerten.
Um alle drei Prozesse (2x Cache + Training) zu vereinfachen, kÃķnnen Sie interaktive.BAT-Dateien verwenden, die Ihnen Fragen stellen und die Prozesse ausfÞhren, wenn Sie die erforderlichen Informationen bereitgestellt haben.
FÞr die latente Vorverarbeitung kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei (z. B. nennen Sie sie latent-precache.bat), wie zuvor, und stellen Sie sicher, dass der Dateityp im Speichern unter-Dialog auf Alle Dateien gesetzt ist:
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:
set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:
set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:
echo Sie haben eingegeben:
echo Bildpfad: %IMAGE_PATH%
echo Cache-Pfad: %CACHE_PATH%
echo TOML-Dateipfad: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM FÞhren Sie das Skript fÞr die latente Vorverarbeitung aus
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geÃķffnet
pause
(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Jetzt kÃķnnen Sie die.BAT-Datei fÞr die automatische latente Vorverarbeitung ausfÞhren:

Wenn Sie von der.BAT-Datei aufgefordert werden, fÞgen Sie den Pfad zu Ihrem Dataset, Cache-Ordner und TOML-Datei ein.
TEXT-VORCACHING
Wir werden eine zweite.BAT-Datei erstellen, diesmal fÞr die Text-Vorverarbeitung.
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:
set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:
set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:
echo Sie haben eingegeben:
echo Bildpfad: %IMAGE_PATH%
echo Cache-Pfad: %CACHE_PATH%
echo TOML-Dateipfad: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Verwenden des Python-Interpreters aus der virtuellen Umgebung
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geÃķffnet
pause
Ersetzen Sie Ihren Windows-Profilnamen und speichern Sie dies als text-cache.bat (oder einen anderen Namen, den Sie bevorzugen), an einem geeigneten Speicherort, wie bei der vorherigen.BAT-Datei.
FÞhren Sie diese neue.BAT-Datei aus, befolgen Sie die Anweisungen, und die erforderlichen textkodierten Dateien werden im Cache-Ordner erscheinen:

TRAINING DES HUNYUAN-VIDEO-LORA
Das Training des eigentlichen LoRAs wird erheblich lÃĪnger dauern als diese beiden Vorbereitungsprozesse.
Obwohl es auch mehrere Variable gibt, Þber die wir uns Sorgen machen kÃķnnten (wie Batch-GrÃķÃe, Wiederholungen, Epochen und ob wir vollstÃĪndige oder quantifizierte Modelle verwenden sollten), werden wir diese Ãberlegungen fÞr einen anderen Tag und einen tieferen Blick auf die Feinheiten der LoRA-Erstellung aufheben.
Um die AuswahlmÃķglichkeiten ein wenig zu minimieren, werden wir ein LoRA auf âMedianâ-Einstellungen trainieren.
Wir werden eine dritte.BAT-Datei erstellen, diesmal zum Initiieren des Trainings. Kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei, wie zuvor, als training.bat (oder einen anderen Namen, den Sie bevorzugen):
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p DATASET_CONFIG=geben Sie den Pfad zur Dataset-Konfigurationsdatei ein:
set /p EPOCHS=geben Sie die Anzahl der Epochen zum Trainieren ein:
set /p OUTPUT_NAME=geben Sie den Ausgabemodellnamen ein (z. B. example0001):
set /p LEARNING_RATE=WÃĪhlen Sie den Lernfaktor (1 fÞr 1e-3, 2 fÞr 5e-3, Standard 1e-3):
if "%LEARNING_RATE%"=="1" set LR=1e-3
if "%LEARNING_RATE%"=="2" set LR=5e-3
if "%LEARNING_RATE%"=="" set LR=1e-3
set /p SAVE_STEPS=Wie oft (in Schritten) Vorschaubilder speichern:
set /p SAMPLE_PROMPTS=Wo befindet sich die Text-Prompt-Datei fÞr Trainingsvorschaubilder?
echo Sie haben eingegeben:
echo Dataset-Konfigurationsdatei: %DATASET_CONFIG%
echo Anzahl der Epochen: %EPOCHS%
echo Ausgabename: %OUTPUT_NAME%
echo Lernfaktor: %LR%
echo Speichern Sie Vorschaubilder alle %SAVE_STEPS% Schritte.
echo Text-Prompt-Datei: %SAMPLE_PROMPTS%
REM Vorbereiten des Befehls
set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^
C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^
--dit C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^
--dataset_config %DATASET_CONFIG% ^
--sdpa ^
--mixed_precision bf16 ^
--fp8_base ^
--optimizer_type adamw8bit ^
--learning_rate %LR% ^
--gradient_checkpointing ^
--max_data_loader_n_workers 2 ^
--persistent_data_loader_workers ^
--network_module=networks.lora ^
--network_dim=32 ^
--timestep_sampling sigmoid ^
--discrete_flow_shift 1.0 ^
--max_train_epochs %EPOCHS% ^
--save_every_n_epochs=1 ^
--seed 42 ^
--output_dir "C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models" ^
--output_name %OUTPUT_NAME% ^
--vae C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^
--vae_chunk_size 32 ^
--vae_spatial_tile_sample_min_size 128 ^
--text_encoder1 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^
--text_encoder2 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^
--sample_prompts %SAMPLE_PROMPTS% ^
--sample_every_n_steps %SAVE_STEPS% ^
--sample_at_first
echo Der folgende Befehl wird ausgefÞhrt:
echo %CMD%
set /p CONFIRM=Do you want to proceed with training (y/n)?
if /i "%CONFIRM%"=="y" (
%CMD%
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geÃķffnet
cmd /k
Wie bei den vorherigen.BAT-Dateien ersetzen Sie alle Instanzen von [Ihr Profilname] durch Ihren richtigen Windows-Profilnamen.
Stellen Sie sicher, dass der Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\ existiert, und erstellen Sie ihn an diesem Speicherort, wenn er nicht vorhanden ist.
TRAININGSVORSCHAUEN
Es gibt eine sehr grundlegende Trainingsvorschau-Funktion, die kÞrzlich fÞr Musubi-Trainer aktiviert wurde, die es ermÃķglicht, das Trainingsmodell zu pausieren und Bilder basierend auf Prompts zu generieren, die Sie gespeichert haben. Diese werden in einem automatisch erstellten Ordner namens Sample im gleichen Verzeichnis gespeichert, in dem die trainierten Modelle gespeichert werden.

Um dies zu aktivieren, mÞssen Sie mindestens ein Prompt in einer Textdatei speichern. Das Trainings-.BAT wird Sie auffordern, den Speicherort dieser Datei einzugeben; daher kÃķnnen Sie die Prompt-Datei beliebig nennen und an einem beliebigen Speicherort speichern.
Hier sind einige Beispiele fÞr Prompts, die in einer Datei gespeichert werden kÃķnnen, um drei verschiedene Bilder zu generieren, wenn sie vom Trainingsroutine angefordert werden:

Wie Sie im obigen Beispiel sehen kÃķnnen, kÃķnnen Sie Flags am Ende des Prompts hinzufÞgen, die die generierten Bilder beeinflussen:
âw ist die Breite (standardmÃĪÃig 256px, wenn nicht angegeben, laut den Dokumenten)
âh ist die HÃķhe (standardmÃĪÃig 256px, wenn nicht angegeben)
âf ist die Anzahl der Frames. Wenn sie auf 1 gesetzt ist, wird ein Bild generiert; mehr als eins, ein Video.
âd ist der Seed. Wenn er nicht angegeben ist, ist er zufÃĪllig; aber Sie sollten ihn setzen, um einen Prompt zu sehen, der sich entwickelt.
âs ist die Anzahl der Schritte in der Generierung, standardmÃĪÃig 20.
Sehen Sie sich die offizielle Dokumentation fÞr weitere Flags an.
Obwohl Trainingsvorschauen schnell einige Probleme aufdecken kÃķnnen, die dazu fÞhren, dass Sie das Training abbrechen und die Daten oder die Einrichtung Þberdenken, denken Sie daran, dass jeder zusÃĪtzliche Prompt das Training ein wenig verlangsamen kann.
AuÃerdem verlangsamen grÃķÃere Trainingsvorschau-Bildbreite und -hÃķhe (wie durch die oben aufgefÞhrten Flags angegeben) das Training.
Starten Sie Ihre Trainings-.BAT-Datei.
Frage #1 ist âgeben Sie den Pfad zur Dataset-Konfigurationsdatei einâ. FÞgen Sie den richtigen Pfad zu Ihrer TOML-Datei ein.
Frage #2 ist âgeben Sie die Anzahl der Epochen zum Trainieren einâ. Dies ist eine trial-and-error-Variable, da sie von der Menge und QualitÃĪt der Bilder, den Beschriftungen und anderen Faktoren abhÃĪngt. Im Allgemeinen ist es am besten, sie zu hoch zu setzen, da Sie das Training jederzeit mit Strg+C im Trainingsfenster abbrechen kÃķnnen. Setzen Sie es auf 100, um zu sehen, wie es geht.
Frage #3 ist âgeben Sie den Ausgabemodellnamen einâ. Benennen Sie Ihr Modell! Es ist vielleicht am besten, den Namen kurz und einfach zu halten.
Frage #4 ist âWÃĪhlen Sie den Lernfaktorâ, der standardmÃĪÃig auf 1e-3 (Option 1) gesetzt ist. Dies ist ein guter Ausgangspunkt, vorbehaltlich weiterer Erfahrungen.
Frage #5 ist âWie oft (in Schritten) Vorschaubilder speichernâ. Wenn Sie dies zu niedrig setzen, werden Sie wenig Fortschritt zwischen den Vorschaubilderspeicherungen sehen, und dies wird das Training verlangsamen.
Frage #6 ist âWo befindet sich die Text-Prompt-Datei fÞr Trainingsvorschaubilder?â. FÞgen Sie den Pfad zu Ihrer Prompts-Textdatei ein.
Das.BAT zeigt Ihnen den Befehl, den es an das Hunyuan-Modell senden wird, und fragt, ob Sie fortfahren mÃķchten, y/n.
Fahren Sie mit dem Training fort:

WÃĪhrend dieser Zeit werden Sie, wenn Sie den GPU-Abschnitt des Leistungs-Tab in Windows Task Manager ÞberprÞfen, sehen, dass der Prozess etwa 16 GB VRAM verwendet.

Dies mag kein willkÞrlicher Wert sein, da dies die Menge an VRAM ist, die auf vielen NVIDIA-Grafikkarten verfÞgbar ist, und der Upstream-Code mÃķglicherweise so optimiert wurde, dass die Aufgaben in 16 GB passen, zum Vorteil derjenigen, die solche Karten besitzen.
Dass dies jedoch leicht zu erhÃķhen ist, indem man extravagante Flags an den Trainingsbefehl sendet.
WÃĪhrend des Trainings werden Sie in der unteren rechten Ecke des CMD-Fensters eine Zahl fÞr die seit dem Beginn des Trainings vergangene Zeit und eine SchÃĪtzung der Gesamtrainingszeit (die stark je nach Flags, Anzahl der Trainingsbilder, Anzahl der Trainingsvorschaubilder und anderen Faktoren variieren kann) sehen.

Eine typische Trainingszeit betrÃĪgt etwa 3-4 Stunden bei medianen Einstellungen, abhÃĪngig von der verfÞgbaren Hardware, der Anzahl der Bilder, den Flag-Einstellungen und anderen Faktoren.
VERWENDEN IHRE AUSGEBILDETEN LORA-MODELLE IN HUNYUAN-VIDEO
AUSWÃHLEN VON CHECKPOINTS
Wenn das Training abgeschlossen ist, haben Sie einen Modell-Checkpoint fÞr jede Trainings-Epoche.

Diese SpeicherhÃĪufigkeit kann durch Ãndern der --save_every_n_epochs [N]-Zahl in der Trainings-.BAT-Datei geÃĪndert werden. Wenn Sie eine niedrige Zahl fÞr Speicherungen pro Schritten beim Einrichten des Trainings mit der.BAT-Datei angegeben haben, gibt es eine hohe Anzahl von gespeicherten Checkpoint-Dateien.
WELCHEN CHECKPOINT SOLLTE ICH WÃHLEN?
Wie bereits erwÃĪhnt, sind die frÞhesten trainierten Modelle am flexibelsten, wÃĪhrend die spÃĪteren Checkpoints mÃķglicherweise die meisten Details bieten. Der einzige Weg, dies zu ÞberprÞfen, ist, einige der LoRAs auszufÞhren und einige Videos zu generieren. Auf diese Weise kÃķnnen Sie herausfinden, welche Checkpoints am produktivsten sind und den besten Kompromiss zwischen FlexibilitÃĪt und Treue bieten.
COMFYUI
Die derzeit (noch) beliebteste (wenn auch nicht die einzige) Umgebung fÞr die Verwendung von Hunyuan-Video-LoRAs ist ComfyUI, ein node-basierter Editor mit einer umfassenden Gradio-OberflÃĪche, die in Ihrem Webbrowser lÃĪuft.

Quelle: https://github.com/comfyanonymous/ComfyUI
Die Installationsanweisungen sind einfach und im offiziellen GitHub-Repository verfÞgbar (zusÃĪtzliche Modelle mÞssen heruntergeladen werden).
KONVERTIEREN VON MODELLen FÃR COMFYUI
Ihre trainierten Modelle werden im (diffusers)-Format gespeichert, das nicht mit den meisten ComfyUI-Implementierungen kompatibel ist. Musubi kann ein Modell in ein ComfyUI-kompatibles Format konvertieren. Lassen Sie uns eine.BAT-Datei einrichten, um diese Konvertierung durchzufÞhren.
Bevor Sie diese.BAT-Datei ausfÞhren, erstellen Sie den Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\CONVERTED\, den das Skript erwartet.
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
:START
REM Benutzereingabe abrufen
set /p INPUT_PATH=geben Sie den Pfad zur Eingabe-Musubi-safetensors-Datei ein (oder tippen Sie 'exit', um zu beenden):
REM Beenden, wenn der Benutzer 'exit' eingibt
if /i "%INPUT_PATH%"=="exit" goto END
REM Extrahieren des Dateinamens aus dem Eingabepfad und HinzufÞgen von 'converted' zum Namen
for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF
set OUTPUT_PATH=C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors
set TARGET=other
echo Sie haben eingegeben:
echo Eingabedatei: %INPUT_PATH%
echo Ausgabedatei: %OUTPUT_PATH%
echo Zielformat: %TARGET%
set /p CONFIRM=Do you want to proceed with the conversion (y/n)?
if /i "%CONFIRM%"=="y" (
REM FÞhren Sie das Konvertierungsskript mit korrekt angegebenen Pfaden aus
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%
echo Konvertierung abgeschlossen.
) else (
echo Operation abgebrochen.
)
REM ZurÞck zum Start fÞr eine weitere Datei
goto START
:END
REM Halten Sie das Fenster geÃķffnet
echo Beenden des Skripts.
pause
Wie bei den vorherigen.BAT-Dateien speichern Sie das Skript als âAlle Dateienâ von Notepad, benennen es convert.bat (oder einen anderen Namen, den Sie bevorzugen).
Sobald gespeichert, doppelklicken Sie auf die neue.BAT-Datei, die nach dem Speicherort einer Datei zum Konvertieren fragt.

FÞgen Sie den Pfad zu der Datei ein, die Sie konvertieren mÃķchten, tippen Sie y und drÞcken Sie Enter.

Nachdem das konvertierte LoRA im CONVERTED-Ordner gespeichert wurde, fragt das Skript, ob Sie eine weitere Datei konvertieren mÃķchten. Wenn Sie mehrere Checkpoints in ComfyUI testen mÃķchten, konvertieren Sie eine Auswahl der Modelle.
Sobald Sie genÞgend Checkpoints konvertiert haben, schlieÃen Sie das.BAT-Kommando-Fenster.
Sie kÃķnnen Ihre konvertierten Modelle jetzt in den models\loras-Ordner in Ihrer ComfyUI-Installation kopieren.
Typischerweise ist der richtige Speicherort etwas wie:
C:\Users\[Ihr Profilname]\Desktop\ComfyUI\models\loras\
ERSTELLEN VON HUNYUAN-VIDEO-LORAS IN COMFYUI
Obwohl die node-basierten Workflows von ComfyUI anfangs komplex erscheinen, kÃķnnen die Einstellungen anderer, erfahrenerer Benutzer durch Ziehen eines Bildes (das mit den ComfyUI-Einstellungen eines anderen Benutzers erstellt wurde) direkt in das ComfyUI-Fenster geladen werden. Workflows kÃķnnen auch als JSON-Dateien exportiert werden, die manuell importiert oder in ein ComfyUI-Fenster gezogen werden kÃķnnen.
Einige importierte Workflows haben AbhÃĪngigkeiten, die mÃķglicherweise nicht in Ihrer Installation vorhanden sind. Installieren Sie daher ComfyUI-Manager, der fehlende Module automatisch abrufen kann.

Quelle: https://github.com/ltdrdata/ComfyUI-Manager
Um einen der Workflows zu laden, der zum Generieren von Videos aus den Modellen in diesem Tutorial verwendet wurde, laden Sie diese JSON-Datei herunter und ziehen Sie sie in Ihr ComfyUI-Fenster (obwohl es im Reddit- und Discord-Community-Forum, das Hunyuan-Video angenommen hat, und meinem eigenen, das von einem dieser Foren adaptiert wurde, bessere Workflow-Beispiele gibt).
Dies ist nicht der richtige Ort fÞr eine umfassende Anleitung zur Verwendung von ComfyUI, aber es ist erwÃĪhnenswert, dass einige der kritischen Parameter, die Ihre Ausgabe beeinflussen werden, wenn Sie die JSON-Layout-Datei verwenden, die ich verknÞpft habe, wie folgt sind:

1) Breite und HÃķhe
Je grÃķÃer Ihr Bild, desto lÃĪnger dauert die Generierung, und desto hÃķher ist das Risiko eines Out-of-Memory-Fehlers (OOM).
2) LÃĪnge
Dies ist der numerische Wert fÞr die Anzahl der Frames. Wie viele Sekunden es sich daraus ergibt, hÃĪngt von der Bildfrequenz ab (die auf 30 fps in diesem Layout eingestellt ist). Sie kÃķnnen Sekunden in Frames umrechnen, basierend auf fps bei Omnicalculator.
3) Batch-GrÃķÃe
Je hÃķher Sie die Batch-GrÃķÃe setzen, desto schneller kann das Ergebnis kommen, aber desto grÃķÃer ist die Belastung des VRAM. Setzen Sie es zu hoch, und Sie erhalten mÃķglicherweise einen OOM.
4) Steuern nach Generierung
Dies steuert den Zufalls-Seed. Die Optionen fÞr diesen Unter-Node sind fest, erhÃķhen, erniedrigen und zufÃĪllig. Wenn Sie es auf fest belassen und den Text-Prompt nicht ÃĪndern, erhalten Sie jedes Mal das gleiche Bild. Wenn Sie den Text-Prompt ÃĪndern, ÃĪndert sich das Bild in begrenztem Umfang. Die erhÃķhen und erniedrigen Einstellungen ermÃķglichen es Ihnen, nahegelegene Seed-Werte zu erkunden, wÃĪhrend zufÃĪllig Ihnen eine vÃķllig neue Interpretation des Prompts gibt.
5) LoRA-Name
Sie mÞssen Ihr eigenes installiertes Modell hier auswÃĪhlen, bevor Sie versuchen, zu generieren.
6) Token
Wenn Sie Ihr Modell so trainiert haben, dass es auf ein Token reagiert (z. B. example-person), fÞgen Sie das Trigger-Wort in Ihren Prompt ein.
7) Schritte
Dies stellt die Anzahl der Schritte dar, die der Diffusionsprozess anwenden wird. HÃķhere Schritte kÃķnnen bessere Details liefern, aber es gibt eine Decke, wie effektiv dieser Ansatz ist, und diese Schwelle kann schwer zu finden sein. Der Þbliche Bereich fÞr Schritte liegt bei etwa 20-30.
8) KachelgrÃķÃe
Dies legt fest, wie viel Information gleichzeitig wÃĪhrend der Generierung verarbeitet wird. Es ist standardmÃĪÃig auf 256 gesetzt. Das ErhÃķhen kann die Generierung beschleunigen, aber das ErhÃķhen auf zu hohe Werte kann zu einem besonders frustrierenden OOM-Erlebnis fÞhren, da es am Ende eines langen Prozesses auftritt.
9) Zeitliche Ãberlappung
Die Generierung von Hunyuan-Video-Personen kann zu âGhostingâ oder unÞberzeugender Bewegung fÞhren, wenn dies zu niedrig gesetzt ist. Im Allgemeinen gilt, dass dies auf einen hÃķheren Wert als die Anzahl der Frames gesetzt werden sollte, um bessere Bewegungen zu erzeugen.
FAZIT
Obwohl eine weitere Erforschung der Verwendung von ComfyUI den Rahmen dieses Artikels Þbersteigt, kann die Erfahrung der Community auf Reddit und Discord den Lernprozess erleichtern, und es gibt mehrere Online-Anleitungen, die die Grundlagen einfÞhren.
Â
ErstverÃķffentlicht am Donnerstag, den 23. Januar 2025












