KI-Modelle und Plattformen
Wie man Hunyuan-Video-LoRA-Modelle trainiert und verwendet

Dieser Artikel zeigt Ihnen, wie Sie Windows-basierte Software installieren und verwenden können, um Hunyuan-Video-LoRA-Modelle zu trainieren, sodass der Benutzer benutzerdefinierte Persönlichkeiten im Hunyuan-Video-Grundmodell erstellen kann:
Klicken Sie, um abzuspielen. Beispiele aus der jüngsten Explosion von Celebrity-Hunyuan-LoRAs aus der civit.ai-Community.
Zurzeit gibt es zwei beliebte Methoden, um Hunyuan-LoRA-Modelle lokal zu generieren:
1) Das diffusion-pipe-ui-Docker-basierte Framework, das auf Windows-Subsystem für Linux (WSL) angewiesen ist, um einige der Prozesse zu verarbeiten.
2) Musubi-Tuner, ein neuer Teil der beliebten Kohya-ss-Diffusions-Trainings-Architektur. Musubi-Tuner benötigt kein Docker und hängt nicht von WSL oder anderen Linux-basierten Proxys ab – aber es kann schwierig sein, es auf Windows zum Laufen zu bringen.
Daher konzentriert sich diese Durchführung auf Musubi-Tuner und bietet eine vollständig lokale Lösung für die Hunyuan-LoRA-Ausbildung und -Generierung, ohne die Verwendung von API-getriebenen Websites oder kommerziellen GPU-Verleihprozessen wie Runpod.
Klicken Sie, um abzuspielen. Beispiele aus der LoRA-Ausbildung auf Musubi-Tuner für diesen Artikel. Alle Genehmigungen wurden von der abgebildeten Person erteilt, um diesen Artikel zu illustrieren.
ANFORDERUNGEN
Die Installation erfordert mindestens einen Windows-10-PC mit einer 30+/40+-Serie-NVIDIA -Karte, die mindestens 12 GB VRAM hat (obwohl 16 GB empfohlen wird). Die für diesen Artikel verwendete Installation wurde auf einem System mit 64 GB System-RAM und einer NVIDIA-3090-Grafikkarte mit 24 GB VRAM getestet. Es wurde auf einem dedizierten Test-Bed-System mit einer frischen Installation von Windows 10 Professional auf einer Partition mit 600+ GB freiem Festplattenspeicher getestet.
WARNUNG
Die Installation von Musubi-Tuner und seinen Voraussetzungen beinhaltet auch die Installation von entwicklerorientierter Software und Paketen direkt auf die Haupt-Windows-Installation eines PCs. Wenn man die Installation von ComfyUI in den Endstadien berücksichtigt, benötigt dieses Projekt etwa 400-500 Gigabyte Festplattenspeicher. Obwohl ich das Verfahren mehrmals in neu installierten Test-Bed-Windows-10-Umgebungen ohne Zwischenfälle getestet habe, bin ich weder haftbar für Schäden an Systemen durch Befolgen dieser Anweisungen. Ich empfehle Ihnen, alle wichtigen Daten vor dem Versuch einer solchen Installationsprozedur zu sichern.
ÜBERLEGUNGEN
Ist diese Methode noch gültig?
Die generative KI-Szene bewegt sich sehr schnell, und wir können besser und strömungsoptimierte Methoden für Hunyuan-Video-LoRA-Frameworks in diesem Jahr erwarten.
… oder sogar diese Woche! Während ich diesen Artikel schrieb, produzierte der Entwickler von Kohya/Musubi musubi-tuner-gui, eine fortschrittliche Gradio-Oberfläche für Musubi-Tuner:

Offensichtlich ist eine benutzerfreundliche Oberfläche einer BAT-Datei vorzuziehen, die ich in diesem Feature verwende – sobald musubi-tuner-gui funktioniert. Als ich schrieb, war es erst vor fünf Tagen online gegangen, und ich konnte keine Berichte darüber finden, dass jemand es erfolgreich verwendet hat.
Laut Posts im Repository soll die neue Oberfläche so bald wie möglich direkt in das Musubi-Tuner-Projekt integriert werden, was sein aktuelles Dasein als separates GitHub-Repository beenden wird.
Basierend auf den aktuellen Installationsanweisungen wird die neue Oberfläche direkt in die bestehende Musubi-Virtual-Umgebung geklont; und trotz vieler Bemühungen kann ich sie nicht mit der bestehenden Musubi-Installation verknüpfen. Das bedeutet, dass sie, wenn sie läuft, feststellen wird, dass sie keinen Motor hat!
Sobald die Oberfläche in Musubi-Tuner integriert ist, werden Probleme dieser Art sicherlich behoben. Obwohl der Autor zugeben muss, dass das neue Projekt ‘sehr rau’ ist, ist er optimistisch über seine Entwicklung und Integration direkt in Musubi-Tuner.
Angesichts dieser Probleme (auch im Hinblick auf Standardpfade zur Installationszeit und die Verwendung des UV-Python-Pakets, das bestimmte Verfahren in der neuen Version kompliziert), werden wir wahrscheinlich ein wenig warten müssen, bis wir eine reibungslosere Hunyuan-Video-LoRA-Trainings-Erfahrung haben. Das sieht jedoch sehr vielversprechend aus!
Aber wenn Sie nicht warten können und bereit sind, Ihre Ärmel hochzukrempeln, können Sie Hunyuan-Video-LoRA-Training direkt jetzt lokal ausführen.
Lassen Sie uns beginnen.
WARUM ETWAS AUF BARE METAL INSTALLIEREN?
(Überspringen Sie diesen Absatz, wenn Sie kein fortgeschrittener Benutzer sind)
Fortgeschrittene Benutzer werden sich fragen, warum ich so viel Software auf der Bare-Metal-Windows-10-Installation installiert habe, anstatt in einer virtuellen Umgebung. Der Grund dafür ist, dass die wesentliche Windows-Port der Linux-basierten Triton-Paketes viel schwieriger in einer virtuellen Umgebung zu installieren ist. Alle anderen Bare-Metal-Installationen in diesem Tutorial konnten nicht in einer virtuellen Umgebung installiert werden, da sie direkt mit lokalen Hardware-Komponenten interagieren müssen.
INSTALLATION VON VORAUSSETZUNGENSPAKETEN UND PROGRAMMEN
Für die Programme und Pakete, die zunächst installiert werden müssen, ist die Reihenfolge der Installation wichtig. Lassen Sie uns beginnen.
1: HERUNTERLADEN VON MICROSOFT REDISTRIBUTABLE
Laden Sie das Microsoft -Redistributable-Paket von https://aka.ms/vs/17/release/vc_redist.x64.exe herunter und installieren Sie es.
Dies ist eine einfache und schnelle Installation.

2: INSTALLATION VON VISUAL STUDIO 2022
Laden Sie die Microsoft-Visual-Studio-2022-Community-Edition von https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta herunter.
Starten Sie den heruntergeladenen Installer:

Wir benötigen nicht alle verfügbaren Pakete, was eine schwere und lange Installation wäre. Auf der anfänglichen Workloads-Seite, die geöffnet wird, aktivieren Sie Desktop-Entwicklung mit C++ (siehe Bild unten).

Jetzt klicken Sie auf die Individual Components-Registerkarte in der oberen linken Ecke der Oberfläche und verwenden Sie die Suchleiste, um ‘Windows-SDK’ zu finden.

Standardmäßig ist nur das Windows-11-SDK aktiviert. Wenn Sie auf Windows 10 sind (diese Installationsprozedur wurde von mir nicht auf Windows 11 getestet), aktivieren Sie die neueste Windows-10-Version, wie im Bild oben angezeigt.
Suchen Sie nach ‘C++ CMake’ und überprüfen Sie, ob C++ CMake-Tools für Windows aktiviert sind.

Diese Installation wird mindestens 13 GB Speicherplatz benötigen.

Sobald Visual Studio installiert ist, wird es versuchen, auf Ihrem Computer zu starten. Lassen Sie es vollständig öffnen. Wenn die vollständige Visual-Studio-Oberfläche endlich sichtbar ist, schließen Sie das Programm.
3: INSTALLATION VON VISUAL STUDIO 2019
Einige der nachfolgenden Pakete für Musubi erwarten eine ältere Version von Microsoft Visual Studio, während andere eine neuere Version benötigen.
Deshalb laden Sie auch die kostenlose Community-Edition von Visual Studio 19 entweder von Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – Konto erforderlich) oder Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html) herunter.
Installieren Sie es mit den gleichen Optionen wie für Visual Studio 2022 (siehe Prozedur oben, außer dass Windows-SDK im Visual-Studio-2019-Installer bereits aktiviert ist).
Sie werden sehen, dass der Visual-Studio-2019-Installer bereits die neuere Version kennt, während er installiert wird:

Wenn die Installation abgeschlossen ist und Sie die installierte Visual-Studio-2019-Anwendung geöffnet und geschlossen haben, öffnen Sie ein Windows-Kommandozeilenfenster (Tippen Sie CMD in die Start-Suche) und geben Sie ein und führen Sie aus:
where cl
Das Ergebnis sollte die bekannten Orte der beiden installierten Visual-Studio-Editionen sein.

Wenn Sie stattdessen INFO: Could not find files for the given pattern(s) erhalten, sehen Sie sich den Überprüfen des Pfads-Abschnitt dieses Artikels an und verwenden Sie diese Anweisungen, um die relevanten Visual-Studio-Pfade zur Windows-Umgebung hinzuzufügen.
Speichern Sie alle Änderungen, die gemäß dem Überprüfen des Pfads-Abschnitt unten vorgenommen wurden, und versuchen Sie dann, den where cl-Befehl erneut auszuführen.
4: INSTALLATION VON CUDA 11 + 12-TOOLKITS
Die verschiedenen Pakete, die in Musubi installiert werden, benötigen unterschiedliche Versionen von NVIDIA-CUDA, die die Ausbildung auf NVIDIA-Grafikkarten beschleunigt und optimiert.
Der Grund, warum wir die Visual-Studio-Versionen zuerst installiert haben, ist, dass die NVIDIA-CUDA-Installationsprogramme nach vorhandenen Visual-Studio-Installationen suchen und sich in diese integrieren.
Laden Sie ein 11+-Serie-CUDA-Installationspaket von
https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (laden Sie ‘exe (lokal)’ herunter)
Laden Sie ein 12+-Serie-CUDA-Toolkit-Installationspaket von
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
Der Installationsprozess ist für beide Installationsprogramme identisch. Ignorieren Sie alle Warnungen über die Existenz oder Nichtexistenz von Installationspfaden in Windows-Umgebungsvariablen – wir werden uns später darum kümmern.
INSTALLATION VON NVIDIA-CUDA-TOOLKIT V11+
Starten Sie das Installationsprogramm für die 11+-Serie-CUDA-Toolkit.


Bei Installationsoptionen wählen Sie Benutzerdefiniert (Erweitert) und gehen Sie weiter.

Deaktivieren Sie die Option NVIDIA GeForce Experience und klicken Sie auf Weiter.

Lassen Sie Auswahl des Installationsorts auf den Standardwerten (das ist wichtig):

Klicken Sie auf Weiter und lassen Sie die Installation abgeschlossen werden.

Ignorieren Sie alle Warnungen oder Hinweise, die das Installationsprogramm über Nsight-Visual-Studio-Integration gibt, die für unseren Anwendungsfall nicht erforderlich ist.
INSTALLATION VON NVIDIA-CUDA-TOOLKIT V12+
Wiederholen Sie den gesamten Prozess für das separate 12+-NVIDIA-Toolkit-Installationsprogramm, das Sie heruntergeladen haben:

Der Installationsprozess für diese Version ist identisch mit dem oben beschriebenen (11+-Version), außer einer Warnung über Umgebungswege, die Sie ignorieren können:

Wenn die 12+-CUDA-Version-Installation abgeschlossen ist, öffnen Sie ein Kommandozeilenfenster in Windows und geben Sie ein und führen Sie aus:
nvcc --version
Dies sollte Informationen über die installierte Treiberversion anzeigen:

Um zu überprüfen, ob Ihre Karte erkannt wird, geben Sie ein und führen Sie aus:
nvidia-smi

5: INSTALLATION VON GIT
GIT wird die Installation des Musubi-Repositorys auf Ihrem lokalen Computer verwalten. Laden Sie den GIT-Installer von
https://git-scm.com/downloads/win (’64-Bit-Git-for-Windows-Setup’)

Führen Sie den Installer aus:

Verwenden Sie die Standardkomponenten für Auswählen der Komponenten:

Lassen Sie den Standard-Editor bei Vim:

Lassen Sie GIT entscheiden, wie die Branch-Namen lauten sollen:

Verwenden Sie die empfohlenen Einstellungen für den Pfad der Umgebung:

Verwenden Sie die empfohlenen Einstellungen für SSH:

Verwenden Sie die empfohlenen Einstellungen für HTTPS-Transport-Backend:

Verwenden Sie die empfohlenen Einstellungen für Zeilenende-Konvertierungen:

Wählen Sie die Windows-Standardkonsole als Terminal-Emulator:

Verwenden Sie die Standard-Einstellungen (Fast-Forward oder Zusammenführen) für Git-Pull:

Verwenden Sie Git-Credential-Manager (die Standard-Einstellung) für Credential-Helfer:

In Konfigurieren von Zusatzoptionen lassen Sie Dateisystem-Caching aktivieren aktiviert und Symbolische Links aktivieren deaktiviert (es sei denn, Sie sind ein fortgeschrittener Benutzer, der für ein zentrales Modell-Repository harte Links verwendet).

Beenden Sie die Installation und testen Sie, ob GIT ordnungsgemäß installiert ist, indem Sie ein Kommandozeilenfenster in Windows öffnen und eingeben und ausführen:
git --version

GITHUB-LOGIN
Später, wenn Sie versuchen, GitHub-Repositorys zu klonen, werden Sie möglicherweise nach Ihren GitHub-Anmeldeinformationen gefragt. Um dies zu antizipieren, melden Sie sich in Ihrem GitHub-Konto an (erstellen Sie eines, wenn notwendig) auf jedem Windows-System, auf dem Sie installiert sind. Auf diese Weise sollte die 0Auth-Authentifizierungsmethode (ein Pop-up-Fenster) so wenig Zeit wie möglich in Anspruch nehmen.
Nach dieser anfänglichen Herausforderung sollten Sie automatisch authentifiziert bleiben.
6: INSTALLATION VON CMAKE
CMake 3.21 oder neuer ist für Teile des Musubi-Installationsprozesses erforderlich. CMake ist eine plattformübergreifende Entwicklungsumgebung, die in der Lage ist, diverse Compiler zu orchestrieren und Software aus Quellcode zu kompilieren.
Laden Sie es von
https://cmake.org/download/ (‘Windows x64-Installer’)
Starten Sie den Installer:

Stellen Sie sicher, dass CMake dem Pfad der Umgebung hinzufügen aktiviert ist.

Klicken Sie auf Weiter.

Geben Sie in einem Windows-Kommandozeilenfenster ein und führen Sie aus:
cmake --version
Wenn CMake erfolgreich installiert ist, sollte es etwas wie folgt anzeigen:
cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: INSTALLATION VON PYTHON 3.10
Der Python-Interpreter ist für dieses Projekt von zentraler Bedeutung. Laden Sie die Version 3.10 (der beste Kompromiss zwischen den verschiedenen Anforderungen der Musubi-Pakete) von
https://www.python.org/downloads/release/python-3100/ (‘Windows-Installer (64-Bit)’)
Führen Sie den heruntergeladenen Installer aus und lassen Sie die Standard-Einstellungen:


Am Ende des Installationsprozesses klicken Sie auf Pfadlängenbegrenzung deaktivieren (erfordert UAC-Admin-Bestätigung):

Geben Sie in einem Windows-Kommandozeilenfenster ein und führen Sie aus:
python --version
Dies sollte Python 3.10.0 ergeben

ÜBERPRÜFEN DER PFADE
Das Klonen und die Installation der Musubi-Frameworks sowie deren normale Funktionsweise nach der Installation erfordern, dass ihre Komponenten den Pfad zu mehreren wichtigen externen Komponenten in Windows kennen, insbesondere CUDA.
Wir müssen also die Pfadumgebung öffnen und überprüfen, ob alle erforderlichen Komponenten vorhanden sind.
Ein schneller Weg, um zu den Steuerungen für die Windows-Umgebung zu gelangen, besteht darin, Systemumgebungsvariablen bearbeiten in die Windows-Suche zu tippen.

Wenn Sie dies anklicken, öffnet sich das Systemeigenschaften-Steuerungsfeld. In der unteren rechten Ecke des Systemeigenschaften-Steuerungsfelds klicken Sie auf die Umgebungsvariablen-Schaltfläche, und ein Fenster namens Umgebungsvariablen öffnet sich. Im Systemvariablen-Panel in der unteren Hälfte dieses Fensters scrollen Sie nach unten zu Pfad und doppelklicken Sie darauf. Dies öffnet ein Fenster namens Umgebungsvariablen bearbeiten. Ziehen Sie die Breite dieses Fensters weiter, damit Sie den vollständigen Pfad der Variablen sehen können:

Hier sind die wichtigsten Einträge:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin
In den meisten Fällen sollten die richtigen Pfadvariablen bereits vorhanden sein.
Fügen Sie fehlende Pfade hinzu, indem Sie Neu auf der linken Seite des Umgebungsvariablen bearbeiten-Fensters anklicken und den richtigen Pfad einfügen:

Übersetzen Sie nicht einfach aus den oben aufgeführten Pfaden; überprüfen Sie, ob jeder äquivalente Pfad in Ihrer eigenen Windows-Installation vorhanden ist.
Wenn es geringe Pfadabweichungen gibt (insbesondere bei Visual-Studio-Installationen), verwenden Sie die oben aufgeführten Pfade, um die richtigen Zielordner zu finden (d. h. x64 in Host64 in Ihrer eigenen Installation). Fügen Sie dann diese Pfade in das Umgebungsvariablen bearbeiten-Fenster ein.
Nach diesem Schritt starten Sie den Computer neu.
INSTALLATION VON MUSUBI
Aktualisieren von PIP
Die Verwendung der neuesten Version des PIP-Installationsprogramms kann einige der Installationsstufen erleichtern. In einem Windows-Kommandozeilenfenster mit Administratorrechten (siehe Erhöhung unten) geben Sie ein und führen Sie aus:
pip install --upgrade pip
Erhöhung
Einige Befehle können erhöhte Rechte erfordern (d. h. sie müssen als Administrator ausgeführt werden). Wenn Sie Fehlermeldungen über Berechtigungen erhalten, schließen Sie das Kommandozeilenfenster und öffnen Sie es erneut im Administrator-Modus, indem Sie CMD in die Windows-Suche eingeben, mit der rechten Maustaste auf Command Prompt klicken und Ausführen als Administrator auswählen:

Für die nächsten Schritte werden wir anstelle des Windows-Kommandozeilenfensters Windows-PowerShell verwenden. Sie können dies finden, indem Sie PowerShell in die Windows-Suche eingeben und (falls erforderlich) mit der rechten Maustaste darauf klicken und Ausführen als Administrator auswählen:

INSTALLATION VON TORCH
In PowerShell geben Sie ein und führen Sie aus:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
Seien Sie geduldig, während die vielen Pakete installiert werden.
Wenn die Installation abgeschlossen ist, können Sie eine GPU-aktivierte PyTorch-Installation überprüfen, indem Sie eingeben und ausführen:
python -c "import torch; print(torch.cuda.is_available())"
Dies sollte True ergeben

INSTALLATION VON TRITON FÜR WINDOWS
Als Nächstes die Installation der Triton für Windows-Komponente. In PowerShell mit erhöhten Rechten geben Sie ein und führen Sie aus (in einer Zeile):
pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(Das Installationsprogramm triton-3.1.0-cp310-cp310-win_amd64.whl funktioniert sowohl für Intel- als auch für AMD-Prozessoren, solange die Architektur 64-Bit und die Umgebung der Python-Version entspricht)
Nach dem Ausführen sollte dies zu Successfully installed triton-3.1.0 führen
Wir können überprüfen, ob Triton funktioniert, indem wir es in Python importieren. Geben Sie ein:
python -c "import triton; print('Triton is working')"
Dies sollte Triton is working ausgeben
Um zu überprüfen, ob Triton GPU-aktiviert ist, geben Sie ein:
python -c "import torch; print(torch.cuda.is_available())"
Dies sollte True ergeben

ERSTELLEN DER VIRTUELLEN UMGEbung FÜR MUSUBI
Von jetzt an werden wir alle weitere Software in einer Python-Virtual-Umgebung (oder venv) installieren. Dies bedeutet, dass Sie alles, was Sie installieren, durch das Verschieben des venv-Installationsordners in den Papierkorb deinstallieren können.
Lassen Sie uns den Installationsordner erstellen: Erstellen Sie einen Ordner namens Musubi auf Ihrem Desktop. Die folgenden Beispiele gehen davon aus, dass dieser Ordner existiert: C:\Users\[Ihr Profilname]\Desktop\Musubi\.
In PowerShell navigieren Sie zu diesem Ordner, indem Sie eingeben:
cd C:\Users\[Ihr Profilname]\Desktop\Musubi
Wir möchten, dass die virtuelle Umgebung Zugriff auf das hat, was wir bereits installiert haben (insbesondere Triton), also werden wir die --system-site-packages-Flag verwenden. Geben Sie ein:
python -m venv --system-site-packages musubi
Warten Sie, bis die Umgebung erstellt ist, und aktivieren Sie sie dann, indem Sie eingeben:
.\musubi\Scripts\activate
Von diesem Punkt an können Sie erkennen, dass Sie in der aktivierten virtuellen Umgebung sind, indem Sie (musubi) am Anfang aller Ihrer Prompts sehen.

KLONEN DES REPOSITORIES
Navigieren Sie zum neu erstellten musubi-Ordner (der sich im Musubi-Ordner auf Ihrem Desktop befindet):
cd musubi
Jetzt, da wir am richtigen Ort sind, geben Sie den folgenden Befehl ein:
git clone https://github.com/kohya-ss/musubi-tuner.git
Warten Sie, bis das Klonen abgeschlossen ist (es wird nicht lange dauern).

INSTALLATION DER VORAUSSETZUNGEN
Navigieren Sie zum Installationsordner:
cd musubi-tuner
Geben Sie ein:
pip install -r requirements.txt
Warten Sie, bis die vielen Installationen abgeschlossen sind (dies wird länger dauern).

AUTOMATISIERUNG DES ZUGRIFFS ZUR HUNYUAN-VIDEO-VENV
Um leicht auf die neue venv für zukünftige Sitzungen zuzugreifen, kopieren Sie den folgenden Text in Notepad und speichern Sie ihn mit dem Namen activate.bat, indem Sie ihn im Alle Dateien-Format speichern (siehe Bild unten).
@echo off
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate
cd C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner
cmd
(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Es ist nicht wichtig, in welchen Speicherort Sie diese Datei speichern.
Ab jetzt können Sie durch Doppelklicken auf activate.bat sofort beginnen.

VERWENDEN VON MUSUBI-TUNER
HERUNTERLADEN DER MODELLE
Der Hunyuan-Video-LoRA-Trainingsprozess erfordert das Herunterladen von mindestens sieben Modellen, um alle möglichen Optimierungsoptionen für das Pre-Caching und das Training eines Hunyuan-Video-LoRAs zu unterstützen. Zusammen wiegen diese Modelle mehr als 60 GB.
Aktuelle Anweisungen zum Herunterladen finden Sie unter https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download
Es handelt sich jedoch um die Download-Anweisungen zum Zeitpunkt des Schreibens:
clip_l.safetensors und
llava_llama3_fp16.safetensors
llava_llama3_fp8_scaled.safetensors
können von https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders heruntergeladen werden
mp_rank_00_model_states.pt und
mp_rank_00_model_states_fp8.pt
mp_rank_00_model_states_fp8_map.pt
können von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers heruntergeladen werden
pytorch_model.pt
kann von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae heruntergeladen werden
Obwohl Sie diese in jedem Ordner speichern können, den Sie möchten, sollten Sie sie für Konsistenz mit späteren Skripten in C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\ speichern.
Dies ist konsistent mit der Ordnerstruktur vor diesem Punkt. Vergessen Sie nicht, [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils zu ersetzen.
DATENPRÄPARATION
Wenn man die Community-Kontroverse über diesen Punkt ignoriert, kann man sagen, dass Sie zwischen 10-100 Fotos für ein Trainingsdataset für Ihre Hunyuan-LoRA benötigen. Sehr gute Ergebnisse können sogar mit 15 Bildern erzielt werden, solange die Bilder gut ausgewogen und von guter Qualität sind.
Ein Hunyuan-LoRA kann sowohl auf Bildern als auch auf sehr kurzen und niedrig auflösenden Videoclips trainiert werden oder sogar auf einer Mischung aus beidem – obwohl die Verwendung von Videoclips als Trainingsdaten selbst für eine 24-GB-Karte herausfordernd ist.
Beispiele wären Roger Rabbit, ein Xenomorph, The Mask, Spider-Man oder andere Persönlichkeiten, die einzigartige charakteristische Bewegungen besitzen.
Da Hunyuan-Video bereits weiß, wie normale Männer und Frauen sich bewegen, sind Videoclips nicht notwendig, um eine überzeugende Hunyuan-Video-LoRA-Menschentyp-Persönlichkeit zu erhalten. Wir werden also statische Bilder verwenden.
BILDPRAPARATION
DER EIMER-LISTE
Die Kurzversion:
Es ist am besten, entweder Bilder zu verwenden, die alle die gleiche Größe haben, oder eine 50/50-Aufteilung zwischen zwei verschiedenen Größen, d. h. 10 Bilder, die 512x768px und 10, die 768x512px sind.
Das Training kann gut verlaufen, auch wenn Sie dies nicht tun – Hunyuan-Video-LoRAs können überraschend nachsichtig sein.
Die längere Version
Wie bei Kohya-ss-LoRAs für statische generative Systeme wie Stable Diffusion wird Bucketing verwendet, um die Arbeitslast auf unterschiedlich große Bilder zu verteilen, sodass größere Bilder ohne Auslösen von Out-of-Memory-Fehlern während des Trainings verwendet werden können (d. h. Bucketing ‘schneidet’ die Bilder in Stücke, die die GPU verarbeiten kann, während die semantische Integrität des gesamten Bildes erhalten bleibt).
Für jede Bildgröße, die Sie in Ihrem Trainingsdataset enthalten (d. h. 512x768px), wird ein Bucket oder ‘Teilaufgabe’ erstellt. Wenn Sie also die folgende Verteilung von Bildern haben, wird die Bucket-Aufmerksamkeit ungleich unter den Bildern verteilt und birgt das Risiko, dass einige Fotos bei der Ausbildung mehr Berücksichtigung finden als andere:
2x 512x768px-Bilder
7x 768x512px-Bilder
1x 1000x600px-Bild
3x 400x800px-Bilder
Wir können sehen, dass die Bucket-Aufmerksamkeit unter diesen Bildern ungleich verteilt ist:

Daher sollten Sie entweder bei einem Format bleiben oder versuchen, die Verteilung der verschiedenen Größen relativ gleich zu halten.
Vermeiden Sie sehr große Bilder, da dies das Training verlangsamen kann, ohne nennenswerte Vorteile zu bieten.
Ich habe für alle Fotos in meinem Dataset 512x768px verwendet.
Haftungsausschluss: Das Modell (die Person) in dem Dataset gab mir die volle Erlaubnis, diese Bilder für diesen Zweck zu verwenden, und genehmigte alle AI-basierten Ausgaben, die ihre Ähnlichkeit in diesem Artikel darstellen.

Mein Dataset besteht aus 40 Bildern im PNG-Format (obwohl JPG auch in Ordnung ist). Meine Bilder wurden in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman gespeichert
Sie sollten einen Cache-Ordner innerhalb des Trainingsbildordners erstellen:

Lassen Sie uns nun eine spezielle Datei erstellen, die das Training konfigurieren wird.
TOML-DATEIEN
Der Trainings- und Pre-Caching-Prozess von Hunyuan-Video-LoRAs erhält die Dateipfade aus einer flachen Textdatei mit der .toml-Erweiterung.
Für meinen Test befindet sich die TOML-Datei in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml
Der Inhalt meiner Trainings-TOML sieht so aus:
[general]
resolution = [512, 768]
caption_extension = ".txt"
batch_size = 1
enable_bucket = true
bucket_no_upscale = false
[[datasets]]
image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"
cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"
num_repeats = 1
(Die doppelten Backslashes für Bild- und Cache-Verzeichnisse sind nicht immer notwendig, können aber helfen, Fehler zu vermeiden, wenn es einen Leerzeichen im Pfad gibt. Ich habe Modelle trainiert, deren.toml-Dateien einfache Vorwärts- und Rückwärts-Slashes verwendet haben)
Wir können im resolution-Abschnitt sehen, dass zwei Auflösungen berücksichtigt werden – 512px und 768px. Sie können dies auch auf 512 belassen und dennoch gute Ergebnisse erzielen.
UNTERSCHEIFTE
Hunyuan-Video ist ein Text+Bild-Grundmodell, daher benötigen wir beschreibende Unterscheifte für diese Bilder, die während des Trainings berücksichtigt werden. Der Trainingsprozess schlägt fehl, wenn keine Unterscheifte vorhanden sind.
Es gibt eine Vielfalt von Open-Source-Beschriftungssystemen, die wir für diese Aufgabe verwenden könnten, aber lassen Sie uns es einfach halten und das taggui-System verwenden. Obwohl es auf GitHub gespeichert ist und obwohl es bei der ersten Ausführung einige sehr große Deep-Learning-Modelle herunterlädt, kommt es in Form eines einfachen Windows-Executable vor, der Python-Bibliotheken und eine einfache Oberfläche lädt.
Nach dem Starten von Taggui verwenden Sie Datei > Verzeichnis laden, um zu Ihrem Bild-DataSet zu navigieren, und geben Sie optional einen Token-Bezeichner ein (in diesem Fall examplewoman), der allen Unterscheiften hinzugefügt wird:

(Stellen Sie sicher, dass Sie Laden in 4-Bit deaktivieren, wenn Taggui zum ersten Mal geöffnet wird – es wird Fehler während der Beschriftung ausgeben, wenn dies aktiviert bleibt)
Wählen Sie ein Bild in der linken Vorschau-Spalte aus und drücken Sie STRG+A, um alle Bilder auszuwählen. Dann klicken Sie auf die Schaltfläche Auto-Beschriftung starten auf der rechten Seite:

Sie werden sehen, wie Taggui Modelle im kleinen CLI im rechten Spaltenbereich herunterlädt, aber nur, wenn dies das erste Mal ist, dass Sie den Beschriftungs-Tool verwenden. Andernfalls sehen Sie eine Vorschau der Beschriftungen.

Jetzt hat jedes Foto eine entsprechende.txt-Unterschrift mit einer Beschreibung des Bildinhalts:

Sie können auf Erweiterte Optionen in Taggui klicken, um die Länge und den Stil der Beschriftungen zu erhöhen, aber das geht über den Rahmen dieses Durchlaufs hinaus.
Beenden Sie Taggui und lassen Sie uns zu…
LATENTE VORCACHING
Um eine übermäßige GPU-Last während des Trainings zu vermeiden, ist es notwendig, zwei Arten von vorverarbeiteten Dateien zu erstellen – eine, um das latente Bild abzubilden, das aus den Bildern selbst abgeleitet wird, und eine andere, um eine Textkodierung im Zusammenhang mit der Beschriftungsinhaltsbeschreibung zu bewerten.
Um alle drei Prozesse (2x Cache + Training) zu vereinfachen, können Sie interaktive.BAT-Dateien verwenden, die Ihnen Fragen stellen und die Prozesse ausführen, wenn Sie die erforderlichen Informationen bereitgestellt haben.
Für die latente Vorverarbeitung kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei (z. B. nennen Sie sie latent-precache.bat), wie zuvor, und stellen Sie sicher, dass der Dateityp im Speichern unter-Dialog auf Alle Dateien gesetzt ist:
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:
set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:
set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:
echo Sie haben eingegeben:
echo Bildpfad: %IMAGE_PATH%
echo Cache-Pfad: %CACHE_PATH%
echo TOML-Dateipfad: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Führen Sie das Skript für die latente Vorverarbeitung aus
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geöffnet
pause
(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Jetzt können Sie die.BAT-Datei für die automatische latente Vorverarbeitung ausführen:

Wenn Sie von der.BAT-Datei aufgefordert werden, fügen Sie den Pfad zu Ihrem Dataset, Cache-Ordner und TOML-Datei ein.
TEXT-VORCACHING
Wir werden eine zweite.BAT-Datei erstellen, diesmal für die Text-Vorverarbeitung.
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:
set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:
set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:
echo Sie haben eingegeben:
echo Bildpfad: %IMAGE_PATH%
echo Cache-Pfad: %CACHE_PATH%
echo TOML-Dateipfad: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Verwenden des Python-Interpreters aus der virtuellen Umgebung
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geöffnet
pause
Ersetzen Sie Ihren Windows-Profilnamen und speichern Sie dies als text-cache.bat (oder einen anderen Namen, den Sie bevorzugen), an einem geeigneten Speicherort, wie bei der vorherigen.BAT-Datei.
Führen Sie diese neue.BAT-Datei aus, befolgen Sie die Anweisungen, und die erforderlichen textkodierten Dateien werden im Cache-Ordner erscheinen:

TRAINING DES HUNYUAN-VIDEO-LORA
Das Training des eigentlichen LoRAs wird erheblich länger dauern als diese beiden Vorbereitungsprozesse.
Obwohl es auch mehrere Variable gibt, über die wir uns Sorgen machen könnten (wie Batch-Größe, Wiederholungen, Epochen und ob wir vollständige oder quantifizierte Modelle verwenden sollten), werden wir diese Überlegungen für einen anderen Tag und einen tieferen Blick auf die Feinheiten der LoRA-Erstellung aufheben.
Um die Auswahlmöglichkeiten ein wenig zu minimieren, werden wir ein LoRA auf ‘Median’-Einstellungen trainieren.
Wir werden eine dritte.BAT-Datei erstellen, diesmal zum Initiieren des Trainings. Kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei, wie zuvor, als training.bat (oder einen anderen Namen, den Sie bevorzugen):
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Benutzereingabe abrufen
set /p DATASET_CONFIG=geben Sie den Pfad zur Dataset-Konfigurationsdatei ein:
set /p EPOCHS=geben Sie die Anzahl der Epochen zum Trainieren ein:
set /p OUTPUT_NAME=geben Sie den Ausgabemodellnamen ein (z. B. example0001):
set /p LEARNING_RATE=Wählen Sie den Lernfaktor (1 für 1e-3, 2 für 5e-3, Standard 1e-3):
if "%LEARNING_RATE%"=="1" set LR=1e-3
if "%LEARNING_RATE%"=="2" set LR=5e-3
if "%LEARNING_RATE%"=="" set LR=1e-3
set /p SAVE_STEPS=Wie oft (in Schritten) Vorschaubilder speichern:
set /p SAMPLE_PROMPTS=Wo befindet sich die Text-Prompt-Datei für Trainingsvorschaubilder?
echo Sie haben eingegeben:
echo Dataset-Konfigurationsdatei: %DATASET_CONFIG%
echo Anzahl der Epochen: %EPOCHS%
echo Ausgabename: %OUTPUT_NAME%
echo Lernfaktor: %LR%
echo Speichern Sie Vorschaubilder alle %SAVE_STEPS% Schritte.
echo Text-Prompt-Datei: %SAMPLE_PROMPTS%
REM Vorbereiten des Befehls
set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^
C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^
--dit C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^
--dataset_config %DATASET_CONFIG% ^
--sdpa ^
--mixed_precision bf16 ^
--fp8_base ^
--optimizer_type adamw8bit ^
--learning_rate %LR% ^
--gradient_checkpointing ^
--max_data_loader_n_workers 2 ^
--persistent_data_loader_workers ^
--network_module=networks.lora ^
--network_dim=32 ^
--timestep_sampling sigmoid ^
--discrete_flow_shift 1.0 ^
--max_train_epochs %EPOCHS% ^
--save_every_n_epochs=1 ^
--seed 42 ^
--output_dir "C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models" ^
--output_name %OUTPUT_NAME% ^
--vae C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^
--vae_chunk_size 32 ^
--vae_spatial_tile_sample_min_size 128 ^
--text_encoder1 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^
--text_encoder2 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^
--sample_prompts %SAMPLE_PROMPTS% ^
--sample_every_n_steps %SAVE_STEPS% ^
--sample_at_first
echo Der folgende Befehl wird ausgeführt:
echo %CMD%
set /p CONFIRM=Do you want to proceed with training (y/n)?
if /i "%CONFIRM%"=="y" (
%CMD%
) else (
echo Operation abgebrochen.
)
REM Halten Sie das Fenster geöffnet
cmd /k
Wie bei den vorherigen.BAT-Dateien ersetzen Sie alle Instanzen von [Ihr Profilname] durch Ihren richtigen Windows-Profilnamen.
Stellen Sie sicher, dass der Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\ existiert, und erstellen Sie ihn an diesem Speicherort, wenn er nicht vorhanden ist.
TRAININGSVORSCHAUEN
Es gibt eine sehr grundlegende Trainingsvorschau-Funktion, die kürzlich für Musubi-Trainer aktiviert wurde, die es ermöglicht, das Trainingsmodell zu pausieren und Bilder basierend auf Prompts zu generieren, die Sie gespeichert haben. Diese werden in einem automatisch erstellten Ordner namens Sample im gleichen Verzeichnis gespeichert, in dem die trainierten Modelle gespeichert werden.

Um dies zu aktivieren, müssen Sie mindestens ein Prompt in einer Textdatei speichern. Das Trainings-.BAT wird Sie auffordern, den Speicherort dieser Datei einzugeben; daher können Sie die Prompt-Datei beliebig nennen und an einem beliebigen Speicherort speichern.
Hier sind einige Beispiele für Prompts, die in einer Datei gespeichert werden können, um drei verschiedene Bilder zu generieren, wenn sie vom Trainingsroutine angefordert werden:

Wie Sie im obigen Beispiel sehen können, können Sie Flags am Ende des Prompts hinzufügen, die die generierten Bilder beeinflussen:
–w ist die Breite (standardmäßig 256px, wenn nicht angegeben, laut den Dokumenten)
–h ist die Höhe (standardmäßig 256px, wenn nicht angegeben)
–f ist die Anzahl der Frames. Wenn sie auf 1 gesetzt ist, wird ein Bild generiert; mehr als eins, ein Video.
–d ist der Seed. Wenn er nicht angegeben ist, ist er zufällig; aber Sie sollten ihn setzen, um einen Prompt zu sehen, der sich entwickelt.
–s ist die Anzahl der Schritte in der Generierung, standardmäßig 20.
Sehen Sie sich die offizielle Dokumentation für weitere Flags an.
Obwohl Trainingsvorschauen schnell einige Probleme aufdecken können, die dazu führen, dass Sie das Training abbrechen und die Daten oder die Einrichtung überdenken, denken Sie daran, dass jeder zusätzliche Prompt das Training ein wenig verlangsamen kann.
Außerdem verlangsamen größere Trainingsvorschau-Bildbreite und -höhe (wie durch die oben aufgeführten Flags angegeben) das Training.
Starten Sie Ihre Trainings-.BAT-Datei.
Frage #1 ist ‘geben Sie den Pfad zur Dataset-Konfigurationsdatei ein’. Fügen Sie den richtigen Pfad zu Ihrer TOML-Datei ein.
Frage #2 ist ‘geben Sie die Anzahl der Epochen zum Trainieren ein’. Dies ist eine trial-and-error-Variable, da sie von der Menge und Qualität der Bilder, den Beschriftungen und anderen Faktoren abhängt. Im Allgemeinen ist es am besten, sie zu hoch zu setzen, da Sie das Training jederzeit mit Strg+C im Trainingsfenster abbrechen können. Setzen Sie es auf 100, um zu sehen, wie es geht.
Frage #3 ist ‘geben Sie den Ausgabemodellnamen ein’. Benennen Sie Ihr Modell! Es ist vielleicht am besten, den Namen kurz und einfach zu halten.
Frage #4 ist ‘Wählen Sie den Lernfaktor’, der standardmäßig auf 1e-3 (Option 1) gesetzt ist. Dies ist ein guter Ausgangspunkt, vorbehaltlich weiterer Erfahrungen.
Frage #5 ist ‘Wie oft (in Schritten) Vorschaubilder speichern’. Wenn Sie dies zu niedrig setzen, werden Sie wenig Fortschritt zwischen den Vorschaubilderspeicherungen sehen, und dies wird das Training verlangsamen.
Frage #6 ist ‘Wo befindet sich die Text-Prompt-Datei für Trainingsvorschaubilder?’. Fügen Sie den Pfad zu Ihrer Prompts-Textdatei ein.
Das.BAT zeigt Ihnen den Befehl, den es an das Hunyuan-Modell senden wird, und fragt, ob Sie fortfahren möchten, y/n.
Fahren Sie mit dem Training fort:

Während dieser Zeit werden Sie, wenn Sie den GPU-Abschnitt des Leistungs-Tab in Windows Task Manager überprüfen, sehen, dass der Prozess etwa 16 GB VRAM verwendet.

Dies mag kein willkürlicher Wert sein, da dies die Menge an VRAM ist, die auf vielen NVIDIA-Grafikkarten verfügbar ist, und der Upstream-Code möglicherweise so optimiert wurde, dass die Aufgaben in 16 GB passen, zum Vorteil derjenigen, die solche Karten besitzen.
Dass dies jedoch leicht zu erhöhen ist, indem man extravagante Flags an den Trainingsbefehl sendet.
Während des Trainings werden Sie in der unteren rechten Ecke des CMD-Fensters eine Zahl für die seit dem Beginn des Trainings vergangene Zeit und eine Schätzung der Gesamtrainingszeit (die stark je nach Flags, Anzahl der Trainingsbilder, Anzahl der Trainingsvorschaubilder und anderen Faktoren variieren kann) sehen.

Eine typische Trainingszeit beträgt etwa 3-4 Stunden bei medianen Einstellungen, abhängig von der verfügbaren Hardware, der Anzahl der Bilder, den Flag-Einstellungen und anderen Faktoren.
VERWENDEN IHRE AUSGEBILDETEN LORA-MODELLE IN HUNYUAN-VIDEO
AUSWÄHLEN VON CHECKPOINTS
Wenn das Training abgeschlossen ist, haben Sie einen Modell-Checkpoint für jede Trainings-Epoche.

Diese Speicherhäufigkeit kann durch Ändern der --save_every_n_epochs [N]-Zahl in der Trainings-.BAT-Datei geändert werden. Wenn Sie eine niedrige Zahl für Speicherungen pro Schritten beim Einrichten des Trainings mit der.BAT-Datei angegeben haben, gibt es eine hohe Anzahl von gespeicherten Checkpoint-Dateien.
WELCHEN CHECKPOINT SOLLTE ICH WÄHLEN?
Wie bereits erwähnt, sind die frühesten trainierten Modelle am flexibelsten, während die späteren Checkpoints möglicherweise die meisten Details bieten. Der einzige Weg, dies zu überprüfen, ist, einige der LoRAs auszuführen und einige Videos zu generieren. Auf diese Weise können Sie herausfinden, welche Checkpoints am produktivsten sind und den besten Kompromiss zwischen Flexibilität und Treue bieten.
COMFYUI
Die derzeit (noch) beliebteste (wenn auch nicht die einzige) Umgebung für die Verwendung von Hunyuan-Video-LoRAs ist ComfyUI, ein node-basierter Editor mit einer umfassenden Gradio-Oberfläche, die in Ihrem Webbrowser läuft.

Quelle: https://github.com/comfyanonymous/ComfyUI
Die Installationsanweisungen sind einfach und im offiziellen GitHub-Repository verfügbar (zusätzliche Modelle müssen heruntergeladen werden).
KONVERTIEREN VON MODELLen FÜR COMFYUI
Ihre trainierten Modelle werden im (diffusers)-Format gespeichert, das nicht mit den meisten ComfyUI-Implementierungen kompatibel ist. Musubi kann ein Modell in ein ComfyUI-kompatibles Format konvertieren. Lassen Sie uns eine.BAT-Datei einrichten, um diese Konvertierung durchzuführen.
Bevor Sie diese.BAT-Datei ausführen, erstellen Sie den Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\CONVERTED\, den das Skript erwartet.
@echo off
REM Aktivieren der virtuellen Umgebung
call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat
:START
REM Benutzereingabe abrufen
set /p INPUT_PATH=geben Sie den Pfad zur Eingabe-Musubi-safetensors-Datei ein (oder tippen Sie 'exit', um zu beenden):
REM Beenden, wenn der Benutzer 'exit' eingibt
if /i "%INPUT_PATH%"=="exit" goto END
REM Extrahieren des Dateinamens aus dem Eingabepfad und Hinzufügen von 'converted' zum Namen
for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF
set OUTPUT_PATH=C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors
set TARGET=other
echo Sie haben eingegeben:
echo Eingabedatei: %INPUT_PATH%
echo Ausgabedatei: %OUTPUT_PATH%
echo Zielformat: %TARGET%
set /p CONFIRM=Do you want to proceed with the conversion (y/n)?
if /i "%CONFIRM%"=="y" (
REM Führen Sie das Konvertierungsskript mit korrekt angegebenen Pfaden aus
python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%
echo Konvertierung abgeschlossen.
) else (
echo Operation abgebrochen.
)
REM Zurück zum Start für eine weitere Datei
goto START
:END
REM Halten Sie das Fenster geöffnet
echo Beenden des Skripts.
pause
Wie bei den vorherigen.BAT-Dateien speichern Sie das Skript als ‘Alle Dateien’ von Notepad, benennen es convert.bat (oder einen anderen Namen, den Sie bevorzugen).
Sobald gespeichert, doppelklicken Sie auf die neue.BAT-Datei, die nach dem Speicherort einer Datei zum Konvertieren fragt.

Fügen Sie den Pfad zu der Datei ein, die Sie konvertieren möchten, tippen Sie y und drücken Sie Enter.

Nachdem das konvertierte LoRA im CONVERTED-Ordner gespeichert wurde, fragt das Skript, ob Sie eine weitere Datei konvertieren möchten. Wenn Sie mehrere Checkpoints in ComfyUI testen möchten, konvertieren Sie eine Auswahl der Modelle.
Sobald Sie genügend Checkpoints konvertiert haben, schließen Sie das.BAT-Kommando-Fenster.
Sie können Ihre konvertierten Modelle jetzt in den models\loras-Ordner in Ihrer ComfyUI-Installation kopieren.
Typischerweise ist der richtige Speicherort etwas wie:
C:\Users\[Ihr Profilname]\Desktop\ComfyUI\models\loras\
ERSTELLEN VON HUNYUAN-VIDEO-LORAS IN COMFYUI
Obwohl die node-basierten Workflows von ComfyUI anfangs komplex erscheinen, können die Einstellungen anderer, erfahrenerer Benutzer durch Ziehen eines Bildes (das mit den ComfyUI-Einstellungen eines anderen Benutzers erstellt wurde) direkt in das ComfyUI-Fenster geladen werden. Workflows können auch als JSON-Dateien exportiert werden, die manuell importiert oder in ein ComfyUI-Fenster gezogen werden können.
Einige importierte Workflows haben Abhängigkeiten, die möglicherweise nicht in Ihrer Installation vorhanden sind. Installieren Sie daher ComfyUI-Manager, der fehlende Module automatisch abrufen kann.

Quelle: https://github.com/ltdrdata/ComfyUI-Manager
Um einen der Workflows zu laden, der zum Generieren von Videos aus den Modellen in diesem Tutorial verwendet wurde, laden Sie diese JSON-Datei herunter und ziehen Sie sie in Ihr ComfyUI-Fenster (obwohl es im Reddit- und Discord-Community-Forum, das Hunyuan-Video angenommen hat, und meinem eigenen, das von einem dieser Foren adaptiert wurde, bessere Workflow-Beispiele gibt).
Dies ist nicht der richtige Ort für eine umfassende Anleitung zur Verwendung von ComfyUI, aber es ist erwähnenswert, dass einige der kritischen Parameter, die Ihre Ausgabe beeinflussen werden, wenn Sie die JSON-Layout-Datei verwenden, die ich verknüpft habe, wie folgt sind:

1) Breite und Höhe
Je größer Ihr Bild, desto länger dauert die Generierung, und desto höher ist das Risiko eines Out-of-Memory-Fehlers (OOM).
2) Länge
Dies ist der numerische Wert für die Anzahl der Frames. Wie viele Sekunden es sich daraus ergibt, hängt von der Bildfrequenz ab (die auf 30 fps in diesem Layout eingestellt ist). Sie können Sekunden in Frames umrechnen, basierend auf fps bei Omnicalculator.
3) Batch-Größe
Je höher Sie die Batch-Größe setzen, desto schneller kann das Ergebnis kommen, aber desto größer ist die Belastung des VRAM. Setzen Sie es zu hoch, und Sie erhalten möglicherweise einen OOM.
4) Steuern nach Generierung
Dies steuert den Zufalls-Seed. Die Optionen für diesen Unter-Node sind fest, erhöhen, erniedrigen und zufällig. Wenn Sie es auf fest belassen und den Text-Prompt nicht ändern, erhalten Sie jedes Mal das gleiche Bild. Wenn Sie den Text-Prompt ändern, ändert sich das Bild in begrenztem Umfang. Die erhöhen und erniedrigen Einstellungen ermöglichen es Ihnen, nahegelegene Seed-Werte zu erkunden, während zufällig Ihnen eine völlig neue Interpretation des Prompts gibt.
5) LoRA-Name
Sie müssen Ihr eigenes installiertes Modell hier auswählen, bevor Sie versuchen, zu generieren.
6) Token
Wenn Sie Ihr Modell so trainiert haben, dass es auf ein Token reagiert (z. B. example-person), fügen Sie das Trigger-Wort in Ihren Prompt ein.
7) Schritte
Dies stellt die Anzahl der Schritte dar, die der Diffusionsprozess anwenden wird. Höhere Schritte können bessere Details liefern, aber es gibt eine Decke, wie effektiv dieser Ansatz ist, und diese Schwelle kann schwer zu finden sein. Der übliche Bereich für Schritte liegt bei etwa 20-30.
8) Kachelgröße
Dies legt fest, wie viel Information gleichzeitig während der Generierung verarbeitet wird. Es ist standardmäßig auf 256 gesetzt. Das Erhöhen kann die Generierung beschleunigen, aber das Erhöhen auf zu hohe Werte kann zu einem besonders frustrierenden OOM-Erlebnis führen, da es am Ende eines langen Prozesses auftritt.
9) Zeitliche Überlappung
Die Generierung von Hunyuan-Video-Personen kann zu ‘Ghosting’ oder unüberzeugender Bewegung führen, wenn dies zu niedrig gesetzt ist. Im Allgemeinen gilt, dass dies auf einen höheren Wert als die Anzahl der Frames gesetzt werden sollte, um bessere Bewegungen zu erzeugen.
FAZIT
Obwohl eine weitere Erforschung der Verwendung von ComfyUI den Rahmen dieses Artikels übersteigt, kann die Erfahrung der Community auf Reddit und Discord den Lernprozess erleichtern, und es gibt mehrere Online-Anleitungen, die die Grundlagen einführen.
Erstveröffentlicht am Donnerstag, den 23. Januar 2025












