Andersons Blickwinkel

Wie man Hunyuan-Video-LoRA-Modelle trainiert und verwendet

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen
ChatGPT-4o: Variation on 'Create me an image 1792 x 1024. It should be in the style of ThÃĐodore GÃĐricault, and should depict a dark medieval figure seated in front of a laptop, illuminated by the screen. We are facing the figure, and can only see the back of the laptop lid. Around the seated medieval figure are many other medieval men and women, curious as to what is happening on the computer screen'

Dieser Artikel zeigt Ihnen, wie Sie Windows-basierte Software installieren und verwenden kÃķnnen, um Hunyuan-Video-LoRA-Modelle zu trainieren, sodass der Benutzer benutzerdefinierte PersÃķnlichkeiten im Hunyuan-Video-Grundmodell erstellen kann:

Klicken Sie, um abzuspielen. Beispiele aus der jÞngsten Explosion von Celebrity-Hunyuan-LoRAs aus der civit.ai-Community.

Zurzeit gibt es zwei beliebte Methoden, um Hunyuan-LoRA-Modelle lokal zu generieren:

1) Das diffusion-pipe-ui-Docker-basierte Framework, das auf Windows-Subsystem fÞr Linux (WSL) angewiesen ist, um einige der Prozesse zu verarbeiten.

2) Musubi-Tuner, ein neuer Teil der beliebten Kohya-ss-Diffusions-Trainings-Architektur. Musubi-Tuner benÃķtigt kein Docker und hÃĪngt nicht von WSL oder anderen Linux-basierten Proxys ab – aber es kann schwierig sein, es auf Windows zum Laufen zu bringen.

Daher konzentriert sich diese DurchfÞhrung auf Musubi-Tuner und bietet eine vollstÃĪndig lokale LÃķsung fÞr die Hunyuan-LoRA-Ausbildung und -Generierung, ohne die Verwendung von API-getriebenen Websites oder kommerziellen GPU-Verleihprozessen wie Runpod.

Klicken Sie, um abzuspielen. Beispiele aus der LoRA-Ausbildung auf Musubi-Tuner fÞr diesen Artikel. Alle Genehmigungen wurden von der abgebildeten Person erteilt, um diesen Artikel zu illustrieren.

ANFORDERUNGEN

Die Installation erfordert mindestens einen Windows-10-PC mit einer 30+/40+-Serie-NVIDIA -Karte, die mindestens 12 GB VRAM hat (obwohl 16 GB empfohlen wird). Die fÞr diesen Artikel verwendete Installation wurde auf einem System mit 64 GB System-RAM und einer NVIDIA-3090-Grafikkarte mit 24 GB VRAM getestet. Es wurde auf einem dedizierten Test-Bed-System mit einer frischen Installation von Windows 10 Professional auf einer Partition mit 600+ GB freiem Festplattenspeicher getestet.

WARNUNG

Die Installation von Musubi-Tuner und seinen Voraussetzungen beinhaltet auch die Installation von entwicklerorientierter Software und Paketen direkt auf die Haupt-Windows-Installation eines PCs. Wenn man die Installation von ComfyUI in den Endstadien berÞcksichtigt, benÃķtigt dieses Projekt etwa 400-500 Gigabyte Festplattenspeicher. Obwohl ich das Verfahren mehrmals in neu installierten Test-Bed-Windows-10-Umgebungen ohne ZwischenfÃĪlle getestet habe, bin ich weder haftbar fÞr SchÃĪden an Systemen durch Befolgen dieser Anweisungen. Ich empfehle Ihnen, alle wichtigen Daten vor dem Versuch einer solchen Installationsprozedur zu sichern.

ÜBERLEGUNGEN

Ist diese Methode noch gÞltig?

Die generative KI-Szene bewegt sich sehr schnell, und wir kÃķnnen besser und strÃķmungsoptimierte Methoden fÞr Hunyuan-Video-LoRA-Frameworks in diesem Jahr erwarten.

â€Ķ oder sogar diese Woche! WÃĪhrend ich diesen Artikel schrieb, produzierte der Entwickler von Kohya/Musubi musubi-tuner-gui, eine fortschrittliche Gradio-OberflÃĪche fÞr Musubi-Tuner:

Offensichtlich ist eine benutzerfreundliche OberflÃĪche einer BAT-Datei vorzuziehen, die ich in diesem Feature verwende – sobald musubi-tuner-gui funktioniert. Als ich schrieb, war es erst vor fÞnf Tagen online gegangen, und ich konnte keine Berichte darÞber finden, dass jemand es erfolgreich verwendet hat.

Laut Posts im Repository soll die neue OberflÃĪche so bald wie mÃķglich direkt in das Musubi-Tuner-Projekt integriert werden, was sein aktuelles Dasein als separates GitHub-Repository beenden wird.

Basierend auf den aktuellen Installationsanweisungen wird die neue OberflÃĪche direkt in die bestehende Musubi-Virtual-Umgebung geklont; und trotz vieler BemÞhungen kann ich sie nicht mit der bestehenden Musubi-Installation verknÞpfen. Das bedeutet, dass sie, wenn sie lÃĪuft, feststellen wird, dass sie keinen Motor hat!

Sobald die OberflÃĪche in Musubi-Tuner integriert ist, werden Probleme dieser Art sicherlich behoben. Obwohl der Autor zugeben muss, dass das neue Projekt ‘sehr rau’ ist, ist er optimistisch Þber seine Entwicklung und Integration direkt in Musubi-Tuner.

Angesichts dieser Probleme (auch im Hinblick auf Standardpfade zur Installationszeit und die Verwendung des UV-Python-Pakets, das bestimmte Verfahren in der neuen Version kompliziert), werden wir wahrscheinlich ein wenig warten mÞssen, bis wir eine reibungslosere Hunyuan-Video-LoRA-Trainings-Erfahrung haben. Das sieht jedoch sehr vielversprechend aus!

Aber wenn Sie nicht warten kÃķnnen und bereit sind, Ihre Ärmel hochzukrempeln, kÃķnnen Sie Hunyuan-Video-LoRA-Training direkt jetzt lokal ausfÞhren.

Lassen Sie uns beginnen.

WARUM ETWAS AUF BARE METAL INSTALLIEREN?

(Überspringen Sie diesen Absatz, wenn Sie kein fortgeschrittener Benutzer sind)
Fortgeschrittene Benutzer werden sich fragen, warum ich so viel Software auf der Bare-Metal-Windows-10-Installation installiert habe, anstatt in einer virtuellen Umgebung. Der Grund dafÞr ist, dass die wesentliche Windows-Port der Linux-basierten Triton-Paketes viel schwieriger in einer virtuellen Umgebung zu installieren ist. Alle anderen Bare-Metal-Installationen in diesem Tutorial konnten nicht in einer virtuellen Umgebung installiert werden, da sie direkt mit lokalen Hardware-Komponenten interagieren mÞssen.

INSTALLATION VON VORAUSSETZUNGENSPAKETEN UND PROGRAMMEN

FÞr die Programme und Pakete, die zunÃĪchst installiert werden mÞssen, ist die Reihenfolge der Installation wichtig. Lassen Sie uns beginnen.

1: HERUNTERLADEN VON MICROSOFT REDISTRIBUTABLE

Laden Sie das Microsoft -Redistributable-Paket von https://aka.ms/vs/17/release/vc_redist.x64.exe herunter und installieren Sie es.

Dies ist eine einfache und schnelle Installation.

2: INSTALLATION VON VISUAL STUDIO 2022

Laden Sie die Microsoft-Visual-Studio-2022-Community-Edition von https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta herunter.

Starten Sie den heruntergeladenen Installer:

Wir benÃķtigen nicht alle verfÞgbaren Pakete, was eine schwere und lange Installation wÃĪre. Auf der anfÃĪnglichen Workloads-Seite, die geÃķffnet wird, aktivieren Sie Desktop-Entwicklung mit C++ (siehe Bild unten).

Jetzt klicken Sie auf die Individual Components-Registerkarte in der oberen linken Ecke der OberflÃĪche und verwenden Sie die Suchleiste, um ‘Windows-SDK’ zu finden.

StandardmÃĪßig ist nur das Windows-11-SDK aktiviert. Wenn Sie auf Windows 10 sind (diese Installationsprozedur wurde von mir nicht auf Windows 11 getestet), aktivieren Sie die neueste Windows-10-Version, wie im Bild oben angezeigt.

Suchen Sie nach ‘C++ CMake’ und ÞberprÞfen Sie, ob C++ CMake-Tools fÞr Windows aktiviert sind.

Diese Installation wird mindestens 13 GB Speicherplatz benÃķtigen.

Sobald Visual Studio installiert ist, wird es versuchen, auf Ihrem Computer zu starten. Lassen Sie es vollstÃĪndig Ãķffnen. Wenn die vollstÃĪndige Visual-Studio-OberflÃĪche endlich sichtbar ist, schließen Sie das Programm.

3: INSTALLATION VON VISUAL STUDIO 2019

Einige der nachfolgenden Pakete fÞr Musubi erwarten eine ÃĪltere Version von Microsoft Visual Studio, wÃĪhrend andere eine neuere Version benÃķtigen.

Deshalb laden Sie auch die kostenlose Community-Edition von Visual Studio 19 entweder von Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – Konto erforderlich) oder Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html) herunter.

Installieren Sie es mit den gleichen Optionen wie fÞr Visual Studio 2022 (siehe Prozedur oben, außer dass Windows-SDK im Visual-Studio-2019-Installer bereits aktiviert ist).

Sie werden sehen, dass der Visual-Studio-2019-Installer bereits die neuere Version kennt, wÃĪhrend er installiert wird:

Wenn die Installation abgeschlossen ist und Sie die installierte Visual-Studio-2019-Anwendung geÃķffnet und geschlossen haben, Ãķffnen Sie ein Windows-Kommandozeilenfenster (Tippen Sie CMD in die Start-Suche) und geben Sie ein und fÞhren Sie aus:

where cl

Das Ergebnis sollte die bekannten Orte der beiden installierten Visual-Studio-Editionen sein.

Wenn Sie stattdessen INFO: Could not find files for the given pattern(s) erhalten, sehen Sie sich den ÜberprÞfen des Pfads-Abschnitt dieses Artikels an und verwenden Sie diese Anweisungen, um die relevanten Visual-Studio-Pfade zur Windows-Umgebung hinzuzufÞgen.

Speichern Sie alle Änderungen, die gemÃĪß dem ÜberprÞfen des Pfads-Abschnitt unten vorgenommen wurden, und versuchen Sie dann, den where cl-Befehl erneut auszufÞhren.

4: INSTALLATION VON CUDA 11 + 12-TOOLKITS

Die verschiedenen Pakete, die in Musubi installiert werden, benÃķtigen unterschiedliche Versionen von NVIDIA-CUDA, die die Ausbildung auf NVIDIA-Grafikkarten beschleunigt und optimiert.

Der Grund, warum wir die Visual-Studio-Versionen zuerst installiert haben, ist, dass die NVIDIA-CUDA-Installationsprogramme nach vorhandenen Visual-Studio-Installationen suchen und sich in diese integrieren.

Laden Sie ein 11+-Serie-CUDA-Installationspaket von

https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (laden Sie ‘exe (lokal)’ herunter)

Laden Sie ein 12+-Serie-CUDA-Toolkit-Installationspaket von

https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64

Der Installationsprozess ist fÞr beide Installationsprogramme identisch. Ignorieren Sie alle Warnungen Þber die Existenz oder Nichtexistenz von Installationspfaden in Windows-Umgebungsvariablen – wir werden uns spÃĪter darum kÞmmern.

INSTALLATION VON NVIDIA-CUDA-TOOLKIT V11+

Starten Sie das Installationsprogramm fÞr die 11+-Serie-CUDA-Toolkit.

Bei Installationsoptionen wÃĪhlen Sie Benutzerdefiniert (Erweitert) und gehen Sie weiter.

Deaktivieren Sie die Option NVIDIA GeForce Experience und klicken Sie auf Weiter.

Lassen Sie Auswahl des Installationsorts auf den Standardwerten (das ist wichtig):

Klicken Sie auf Weiter und lassen Sie die Installation abgeschlossen werden.

Ignorieren Sie alle Warnungen oder Hinweise, die das Installationsprogramm Þber Nsight-Visual-Studio-Integration gibt, die fÞr unseren Anwendungsfall nicht erforderlich ist.

INSTALLATION VON NVIDIA-CUDA-TOOLKIT V12+

Wiederholen Sie den gesamten Prozess fÞr das separate 12+-NVIDIA-Toolkit-Installationsprogramm, das Sie heruntergeladen haben:

Der Installationsprozess fÞr diese Version ist identisch mit dem oben beschriebenen (11+-Version), außer einer Warnung Þber Umgebungswege, die Sie ignorieren kÃķnnen:

Wenn die 12+-CUDA-Version-Installation abgeschlossen ist, Ãķffnen Sie ein Kommandozeilenfenster in Windows und geben Sie ein und fÞhren Sie aus:

nvcc --version

Dies sollte Informationen Þber die installierte Treiberversion anzeigen:

Um zu ÞberprÞfen, ob Ihre Karte erkannt wird, geben Sie ein und fÞhren Sie aus:

nvidia-smi

5: INSTALLATION VON GIT

GIT wird die Installation des Musubi-Repositorys auf Ihrem lokalen Computer verwalten. Laden Sie den GIT-Installer von

https://git-scm.com/downloads/win (’64-Bit-Git-for-Windows-Setup’)

FÞhren Sie den Installer aus:

Verwenden Sie die Standardkomponenten fÞr AuswÃĪhlen der Komponenten:

Lassen Sie den Standard-Editor bei Vim:

Lassen Sie GIT entscheiden, wie die Branch-Namen lauten sollen:

Verwenden Sie die empfohlenen Einstellungen fÞr den Pfad der Umgebung:

Verwenden Sie die empfohlenen Einstellungen fÞr SSH:

Verwenden Sie die empfohlenen Einstellungen fÞr HTTPS-Transport-Backend:

Verwenden Sie die empfohlenen Einstellungen fÞr Zeilenende-Konvertierungen:

WÃĪhlen Sie die Windows-Standardkonsole als Terminal-Emulator:

Verwenden Sie die Standard-Einstellungen (Fast-Forward oder ZusammenfÞhren) fÞr Git-Pull:

Verwenden Sie Git-Credential-Manager (die Standard-Einstellung) fÞr Credential-Helfer:

In Konfigurieren von Zusatzoptionen lassen Sie Dateisystem-Caching aktivieren aktiviert und Symbolische Links aktivieren deaktiviert (es sei denn, Sie sind ein fortgeschrittener Benutzer, der fÞr ein zentrales Modell-Repository harte Links verwendet).

Beenden Sie die Installation und testen Sie, ob GIT ordnungsgemÃĪß installiert ist, indem Sie ein Kommandozeilenfenster in Windows Ãķffnen und eingeben und ausfÞhren:

git --version

GITHUB-LOGIN

SpÃĪter, wenn Sie versuchen, GitHub-Repositorys zu klonen, werden Sie mÃķglicherweise nach Ihren GitHub-Anmeldeinformationen gefragt. Um dies zu antizipieren, melden Sie sich in Ihrem GitHub-Konto an (erstellen Sie eines, wenn notwendig) auf jedem Windows-System, auf dem Sie installiert sind. Auf diese Weise sollte die 0Auth-Authentifizierungsmethode (ein Pop-up-Fenster) so wenig Zeit wie mÃķglich in Anspruch nehmen.

Nach dieser anfÃĪnglichen Herausforderung sollten Sie automatisch authentifiziert bleiben.

6: INSTALLATION VON CMAKE

CMake 3.21 oder neuer ist fÞr Teile des Musubi-Installationsprozesses erforderlich. CMake ist eine plattformÞbergreifende Entwicklungsumgebung, die in der Lage ist, diverse Compiler zu orchestrieren und Software aus Quellcode zu kompilieren.

Laden Sie es von

https://cmake.org/download/ (‘Windows x64-Installer’)

Starten Sie den Installer:

Stellen Sie sicher, dass CMake dem Pfad der Umgebung hinzufÞgen aktiviert ist.

Klicken Sie auf Weiter.

Geben Sie in einem Windows-Kommandozeilenfenster ein und fÞhren Sie aus:

cmake --version

Wenn CMake erfolgreich installiert ist, sollte es etwas wie folgt anzeigen:

cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: INSTALLATION VON PYTHON 3.10

Der Python-Interpreter ist fÞr dieses Projekt von zentraler Bedeutung. Laden Sie die Version 3.10 (der beste Kompromiss zwischen den verschiedenen Anforderungen der Musubi-Pakete) von

https://www.python.org/downloads/release/python-3100/ (‘Windows-Installer (64-Bit)’)

FÞhren Sie den heruntergeladenen Installer aus und lassen Sie die Standard-Einstellungen:

Am Ende des Installationsprozesses klicken Sie auf PfadlÃĪngenbegrenzung deaktivieren (erfordert UAC-Admin-BestÃĪtigung):

Geben Sie in einem Windows-Kommandozeilenfenster ein und fÞhren Sie aus:

python --version

Dies sollte Python 3.10.0 ergeben

ÜBERPRÜFEN DER PFADE

Das Klonen und die Installation der Musubi-Frameworks sowie deren normale Funktionsweise nach der Installation erfordern, dass ihre Komponenten den Pfad zu mehreren wichtigen externen Komponenten in Windows kennen, insbesondere CUDA.

Wir mÞssen also die Pfadumgebung Ãķffnen und ÞberprÞfen, ob alle erforderlichen Komponenten vorhanden sind.

Ein schneller Weg, um zu den Steuerungen fÞr die Windows-Umgebung zu gelangen, besteht darin, Systemumgebungsvariablen bearbeiten in die Windows-Suche zu tippen.

Wenn Sie dies anklicken, Ãķffnet sich das Systemeigenschaften-Steuerungsfeld. In der unteren rechten Ecke des Systemeigenschaften-Steuerungsfelds klicken Sie auf die Umgebungsvariablen-SchaltflÃĪche, und ein Fenster namens Umgebungsvariablen Ãķffnet sich. Im Systemvariablen-Panel in der unteren HÃĪlfte dieses Fensters scrollen Sie nach unten zu Pfad und doppelklicken Sie darauf. Dies Ãķffnet ein Fenster namens Umgebungsvariablen bearbeiten. Ziehen Sie die Breite dieses Fensters weiter, damit Sie den vollstÃĪndigen Pfad der Variablen sehen kÃķnnen:

Hier sind die wichtigsten EintrÃĪge:

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin

In den meisten FÃĪllen sollten die richtigen Pfadvariablen bereits vorhanden sein.

FÞgen Sie fehlende Pfade hinzu, indem Sie Neu auf der linken Seite des Umgebungsvariablen bearbeiten-Fensters anklicken und den richtigen Pfad einfÞgen:

Übersetzen Sie nicht einfach aus den oben aufgefÞhrten Pfaden; ÞberprÞfen Sie, ob jeder ÃĪquivalente Pfad in Ihrer eigenen Windows-Installation vorhanden ist.

Wenn es geringe Pfadabweichungen gibt (insbesondere bei Visual-Studio-Installationen), verwenden Sie die oben aufgefÞhrten Pfade, um die richtigen Zielordner zu finden (d. h. x64 in Host64 in Ihrer eigenen Installation). FÞgen Sie dann diese Pfade in das Umgebungsvariablen bearbeiten-Fenster ein.

Nach diesem Schritt starten Sie den Computer neu.

INSTALLATION VON MUSUBI

Aktualisieren von PIP

Die Verwendung der neuesten Version des PIP-Installationsprogramms kann einige der Installationsstufen erleichtern. In einem Windows-Kommandozeilenfenster mit Administratorrechten (siehe ErhÃķhung unten) geben Sie ein und fÞhren Sie aus:

pip install --upgrade pip

ErhÃķhung

Einige Befehle kÃķnnen erhÃķhte Rechte erfordern (d. h. sie mÞssen als Administrator ausgefÞhrt werden). Wenn Sie Fehlermeldungen Þber Berechtigungen erhalten, schließen Sie das Kommandozeilenfenster und Ãķffnen Sie es erneut im Administrator-Modus, indem Sie CMD in die Windows-Suche eingeben, mit der rechten Maustaste auf Command Prompt klicken und AusfÞhren als Administrator auswÃĪhlen:

FÞr die nÃĪchsten Schritte werden wir anstelle des Windows-Kommandozeilenfensters Windows-PowerShell verwenden. Sie kÃķnnen dies finden, indem Sie PowerShell in die Windows-Suche eingeben und (falls erforderlich) mit der rechten Maustaste darauf klicken und AusfÞhren als Administrator auswÃĪhlen:

INSTALLATION VON TORCH

In PowerShell geben Sie ein und fÞhren Sie aus:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

Seien Sie geduldig, wÃĪhrend die vielen Pakete installiert werden.

Wenn die Installation abgeschlossen ist, kÃķnnen Sie eine GPU-aktivierte PyTorch-Installation ÞberprÞfen, indem Sie eingeben und ausfÞhren:

python -c "import torch; print(torch.cuda.is_available())"

Dies sollte True ergeben

INSTALLATION VON TRITON FÜR WINDOWS

Als NÃĪchstes die Installation der Triton fÞr Windows-Komponente. In PowerShell mit erhÃķhten Rechten geben Sie ein und fÞhren Sie aus (in einer Zeile):

pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl

(Das Installationsprogramm triton-3.1.0-cp310-cp310-win_amd64.whl funktioniert sowohl fÞr Intel- als auch fÞr AMD-Prozessoren, solange die Architektur 64-Bit und die Umgebung der Python-Version entspricht)

Nach dem AusfÞhren sollte dies zu Successfully installed triton-3.1.0 fÞhren

Wir kÃķnnen ÞberprÞfen, ob Triton funktioniert, indem wir es in Python importieren. Geben Sie ein:

python -c "import triton; print('Triton is working')"

Dies sollte Triton is working ausgeben

Um zu ÞberprÞfen, ob Triton GPU-aktiviert ist, geben Sie ein:

python -c "import torch; print(torch.cuda.is_available())"

Dies sollte True ergeben

ERSTELLEN DER VIRTUELLEN UMGEbung FÜR MUSUBI

Von jetzt an werden wir alle weitere Software in einer Python-Virtual-Umgebung (oder venv) installieren. Dies bedeutet, dass Sie alles, was Sie installieren, durch das Verschieben des venv-Installationsordners in den Papierkorb deinstallieren kÃķnnen.

Lassen Sie uns den Installationsordner erstellen: Erstellen Sie einen Ordner namens Musubi auf Ihrem Desktop. Die folgenden Beispiele gehen davon aus, dass dieser Ordner existiert: C:\Users\[Ihr Profilname]\Desktop\Musubi\.

In PowerShell navigieren Sie zu diesem Ordner, indem Sie eingeben:

cd C:\Users\[Ihr Profilname]\Desktop\Musubi

Wir mÃķchten, dass die virtuelle Umgebung Zugriff auf das hat, was wir bereits installiert haben (insbesondere Triton), also werden wir die --system-site-packages-Flag verwenden. Geben Sie ein:

python -m venv --system-site-packages musubi

Warten Sie, bis die Umgebung erstellt ist, und aktivieren Sie sie dann, indem Sie eingeben:

.\musubi\Scripts\activate

Von diesem Punkt an kÃķnnen Sie erkennen, dass Sie in der aktivierten virtuellen Umgebung sind, indem Sie (musubi) am Anfang aller Ihrer Prompts sehen.

KLONEN DES REPOSITORIES

Navigieren Sie zum neu erstellten musubi-Ordner (der sich im Musubi-Ordner auf Ihrem Desktop befindet):

cd musubi

Jetzt, da wir am richtigen Ort sind, geben Sie den folgenden Befehl ein:

git clone https://github.com/kohya-ss/musubi-tuner.git

Warten Sie, bis das Klonen abgeschlossen ist (es wird nicht lange dauern).

INSTALLATION DER VORAUSSETZUNGEN

Navigieren Sie zum Installationsordner:

cd musubi-tuner

Geben Sie ein:

pip install -r requirements.txt

Warten Sie, bis die vielen Installationen abgeschlossen sind (dies wird lÃĪnger dauern).

AUTOMATISIERUNG DES ZUGRIFFS ZUR HUNYUAN-VIDEO-VENV

Um leicht auf die neue venv fÞr zukÞnftige Sitzungen zuzugreifen, kopieren Sie den folgenden Text in Notepad und speichern Sie ihn mit dem Namen activate.bat, indem Sie ihn im Alle Dateien-Format speichern (siehe Bild unten).

@echo off

call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate

cd C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner

cmd

(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Es ist nicht wichtig, in welchen Speicherort Sie diese Datei speichern.

Ab jetzt kÃķnnen Sie durch Doppelklicken auf activate.bat sofort beginnen.

VERWENDEN VON MUSUBI-TUNER

HERUNTERLADEN DER MODELLE

Der Hunyuan-Video-LoRA-Trainingsprozess erfordert das Herunterladen von mindestens sieben Modellen, um alle mÃķglichen Optimierungsoptionen fÞr das Pre-Caching und das Training eines Hunyuan-Video-LoRAs zu unterstÞtzen. Zusammen wiegen diese Modelle mehr als 60 GB.

Aktuelle Anweisungen zum Herunterladen finden Sie unter https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download

Es handelt sich jedoch um die Download-Anweisungen zum Zeitpunkt des Schreibens:

clip_l.safetensors
llava_llama3_fp16.safetensors
und
llava_llama3_fp8_scaled.safetensors
kÃķnnen von https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders heruntergeladen werden

mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt
und
mp_rank_00_model_states_fp8_map.pt
kÃķnnen von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers heruntergeladen werden

pytorch_model.pt
kann von https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae heruntergeladen werden

Obwohl Sie diese in jedem Ordner speichern kÃķnnen, den Sie mÃķchten, sollten Sie sie fÞr Konsistenz mit spÃĪteren Skripten in C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\ speichern.

Dies ist konsistent mit der Ordnerstruktur vor diesem Punkt. Vergessen Sie nicht, [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils zu ersetzen.

DATENPRÄPARATION

Wenn man die Community-Kontroverse Þber diesen Punkt ignoriert, kann man sagen, dass Sie zwischen 10-100 Fotos fÞr ein Trainingsdataset fÞr Ihre Hunyuan-LoRA benÃķtigen. Sehr gute Ergebnisse kÃķnnen sogar mit 15 Bildern erzielt werden, solange die Bilder gut ausgewogen und von guter QualitÃĪt sind.

Ein Hunyuan-LoRA kann sowohl auf Bildern als auch auf sehr kurzen und niedrig auflÃķsenden Videoclips trainiert werden oder sogar auf einer Mischung aus beidem – obwohl die Verwendung von Videoclips als Trainingsdaten selbst fÞr eine 24-GB-Karte herausfordernd ist.

Beispiele wÃĪren Roger Rabbit, ein Xenomorph, The Mask, Spider-Man oder andere PersÃķnlichkeiten, die einzigartige charakteristische Bewegungen besitzen.

Da Hunyuan-Video bereits weiß, wie normale MÃĪnner und Frauen sich bewegen, sind Videoclips nicht notwendig, um eine Þberzeugende Hunyuan-Video-LoRA-Menschentyp-PersÃķnlichkeit zu erhalten. Wir werden also statische Bilder verwenden.

BILDPRAPARATION

DER EIMER-LISTE

Die Kurzversion:

Es ist am besten, entweder Bilder zu verwenden, die alle die gleiche GrÃķße haben, oder eine 50/50-Aufteilung zwischen zwei verschiedenen GrÃķßen, d. h. 10 Bilder, die 512x768px und 10, die 768x512px sind.

Das Training kann gut verlaufen, auch wenn Sie dies nicht tun – Hunyuan-Video-LoRAs kÃķnnen Þberraschend nachsichtig sein.

Die lÃĪngere Version

Wie bei Kohya-ss-LoRAs fÞr statische generative Systeme wie Stable Diffusion wird Bucketing verwendet, um die Arbeitslast auf unterschiedlich große Bilder zu verteilen, sodass grÃķßere Bilder ohne AuslÃķsen von Out-of-Memory-Fehlern wÃĪhrend des Trainings verwendet werden kÃķnnen (d. h. Bucketing ‘schneidet’ die Bilder in StÞcke, die die GPU verarbeiten kann, wÃĪhrend die semantische IntegritÃĪt des gesamten Bildes erhalten bleibt).

FÞr jede BildgrÃķße, die Sie in Ihrem Trainingsdataset enthalten (d. h. 512x768px), wird ein Bucket oder ‘Teilaufgabe’ erstellt. Wenn Sie also die folgende Verteilung von Bildern haben, wird die Bucket-Aufmerksamkeit ungleich unter den Bildern verteilt und birgt das Risiko, dass einige Fotos bei der Ausbildung mehr BerÞcksichtigung finden als andere:

2x 512x768px-Bilder
7x 768x512px-Bilder
1x 1000x600px-Bild
3x 400x800px-Bilder

Wir kÃķnnen sehen, dass die Bucket-Aufmerksamkeit unter diesen Bildern ungleich verteilt ist:

Daher sollten Sie entweder bei einem Format bleiben oder versuchen, die Verteilung der verschiedenen GrÃķßen relativ gleich zu halten.

Vermeiden Sie sehr große Bilder, da dies das Training verlangsamen kann, ohne nennenswerte Vorteile zu bieten.

Ich habe fÞr alle Fotos in meinem Dataset 512x768px verwendet.

Haftungsausschluss: Das Modell (die Person) in dem Dataset gab mir die volle Erlaubnis, diese Bilder fÞr diesen Zweck zu verwenden, und genehmigte alle AI-basierten Ausgaben, die ihre Ähnlichkeit in diesem Artikel darstellen.

Mein Dataset besteht aus 40 Bildern im PNG-Format (obwohl JPG auch in Ordnung ist). Meine Bilder wurden in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman gespeichert

Sie sollten einen Cache-Ordner innerhalb des Trainingsbildordners erstellen:

Lassen Sie uns nun eine spezielle Datei erstellen, die das Training konfigurieren wird.

TOML-DATEIEN

Der Trainings- und Pre-Caching-Prozess von Hunyuan-Video-LoRAs erhÃĪlt die Dateipfade aus einer flachen Textdatei mit der .toml-Erweiterung.

FÞr meinen Test befindet sich die TOML-Datei in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml

Der Inhalt meiner Trainings-TOML sieht so aus:

[general]

resolution = [512, 768]

caption_extension = ".txt"

batch_size = 1

enable_bucket = true

bucket_no_upscale = false

[[datasets]]

image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"

cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"

num_repeats = 1

(Die doppelten Backslashes fÞr Bild- und Cache-Verzeichnisse sind nicht immer notwendig, kÃķnnen aber helfen, Fehler zu vermeiden, wenn es einen Leerzeichen im Pfad gibt. Ich habe Modelle trainiert, deren.toml-Dateien einfache VorwÃĪrts- und RÞckwÃĪrts-Slashes verwendet haben)

Wir kÃķnnen im resolution-Abschnitt sehen, dass zwei AuflÃķsungen berÞcksichtigt werden – 512px und 768px. Sie kÃķnnen dies auch auf 512 belassen und dennoch gute Ergebnisse erzielen.

UNTERSCHEIFTE

Hunyuan-Video ist ein Text+Bild-Grundmodell, daher benÃķtigen wir beschreibende Unterscheifte fÞr diese Bilder, die wÃĪhrend des Trainings berÞcksichtigt werden. Der Trainingsprozess schlÃĪgt fehl, wenn keine Unterscheifte vorhanden sind.

Es gibt eine Vielfalt von Open-Source-Beschriftungssystemen, die wir fÞr diese Aufgabe verwenden kÃķnnten, aber lassen Sie uns es einfach halten und das taggui-System verwenden. Obwohl es auf GitHub gespeichert ist und obwohl es bei der ersten AusfÞhrung einige sehr große Deep-Learning-Modelle herunterlÃĪdt, kommt es in Form eines einfachen Windows-Executable vor, der Python-Bibliotheken und eine einfache OberflÃĪche lÃĪdt.

Nach dem Starten von Taggui verwenden Sie Datei > Verzeichnis laden, um zu Ihrem Bild-DataSet zu navigieren, und geben Sie optional einen Token-Bezeichner ein (in diesem Fall examplewoman), der allen Unterscheiften hinzugefÞgt wird:

(Stellen Sie sicher, dass Sie Laden in 4-Bit deaktivieren, wenn Taggui zum ersten Mal geÃķffnet wird – es wird Fehler wÃĪhrend der Beschriftung ausgeben, wenn dies aktiviert bleibt)

WÃĪhlen Sie ein Bild in der linken Vorschau-Spalte aus und drÞcken Sie STRG+A, um alle Bilder auszuwÃĪhlen. Dann klicken Sie auf die SchaltflÃĪche Auto-Beschriftung starten auf der rechten Seite:

Sie werden sehen, wie Taggui Modelle im kleinen CLI im rechten Spaltenbereich herunterlÃĪdt, aber nur, wenn dies das erste Mal ist, dass Sie den Beschriftungs-Tool verwenden. Andernfalls sehen Sie eine Vorschau der Beschriftungen.

Jetzt hat jedes Foto eine entsprechende.txt-Unterschrift mit einer Beschreibung des Bildinhalts:

Sie kÃķnnen auf Erweiterte Optionen in Taggui klicken, um die LÃĪnge und den Stil der Beschriftungen zu erhÃķhen, aber das geht Þber den Rahmen dieses Durchlaufs hinaus.

Beenden Sie Taggui und lassen Sie uns zuâ€Ķ

LATENTE VORCACHING

Um eine ÞbermÃĪßige GPU-Last wÃĪhrend des Trainings zu vermeiden, ist es notwendig, zwei Arten von vorverarbeiteten Dateien zu erstellen – eine, um das latente Bild abzubilden, das aus den Bildern selbst abgeleitet wird, und eine andere, um eine Textkodierung im Zusammenhang mit der Beschriftungsinhaltsbeschreibung zu bewerten.

Um alle drei Prozesse (2x Cache + Training) zu vereinfachen, kÃķnnen Sie interaktive.BAT-Dateien verwenden, die Ihnen Fragen stellen und die Prozesse ausfÞhren, wenn Sie die erforderlichen Informationen bereitgestellt haben.

FÞr die latente Vorverarbeitung kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei (z. B. nennen Sie sie latent-precache.bat), wie zuvor, und stellen Sie sicher, dass der Dateityp im Speichern unter-Dialog auf Alle Dateien gesetzt ist:

@echo off

REM Aktivieren der virtuellen Umgebung

call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Benutzereingabe abrufen

set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:

set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:

set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:

echo Sie haben eingegeben:

echo Bildpfad: %IMAGE_PATH%

echo Cache-Pfad: %CACHE_PATH%

echo TOML-Dateipfad: %TOML_PATH%

set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM FÞhren Sie das Skript fÞr die latente Vorverarbeitung aus

python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling

) else (

echo Operation abgebrochen.

)

REM Halten Sie das Fenster geÃķffnet

pause

(Ersetzen Sie [Ihr Profilname] durch den richtigen Namen Ihres Windows-Benutzerprofils)

Jetzt kÃķnnen Sie die.BAT-Datei fÞr die automatische latente Vorverarbeitung ausfÞhren:

Wenn Sie von der.BAT-Datei aufgefordert werden, fÞgen Sie den Pfad zu Ihrem Dataset, Cache-Ordner und TOML-Datei ein.

TEXT-VORCACHING

Wir werden eine zweite.BAT-Datei erstellen, diesmal fÞr die Text-Vorverarbeitung.

@echo off

REM Aktivieren der virtuellen Umgebung

call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Benutzereingabe abrufen

set /p IMAGE_PATH=geben Sie den Pfad zum Bildverzeichnis ein:

set /p CACHE_PATH=geben Sie den Pfad zum Cache-Verzeichnis ein:

set /p TOML_PATH=geben Sie den Pfad zur TOML-Datei ein:

echo Sie haben eingegeben:

echo Bildpfad: %IMAGE_PATH%

echo Cache-Pfad: %CACHE_PATH%

echo TOML-Dateipfad: %TOML_PATH%

set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM Verwenden des Python-Interpreters aus der virtuellen Umgebung

python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16

) else (

echo Operation abgebrochen.

)

REM Halten Sie das Fenster geÃķffnet

pause

Ersetzen Sie Ihren Windows-Profilnamen und speichern Sie dies als text-cache.bat (oder einen anderen Namen, den Sie bevorzugen), an einem geeigneten Speicherort, wie bei der vorherigen.BAT-Datei.

FÞhren Sie diese neue.BAT-Datei aus, befolgen Sie die Anweisungen, und die erforderlichen textkodierten Dateien werden im Cache-Ordner erscheinen:

TRAINING DES HUNYUAN-VIDEO-LORA

Das Training des eigentlichen LoRAs wird erheblich lÃĪnger dauern als diese beiden Vorbereitungsprozesse.

Obwohl es auch mehrere Variable gibt, Þber die wir uns Sorgen machen kÃķnnten (wie Batch-GrÃķße, Wiederholungen, Epochen und ob wir vollstÃĪndige oder quantifizierte Modelle verwenden sollten), werden wir diese Überlegungen fÞr einen anderen Tag und einen tieferen Blick auf die Feinheiten der LoRA-Erstellung aufheben.

Um die AuswahlmÃķglichkeiten ein wenig zu minimieren, werden wir ein LoRA auf ‘Median’-Einstellungen trainieren.

Wir werden eine dritte.BAT-Datei erstellen, diesmal zum Initiieren des Trainings. Kopieren Sie den folgenden Text in Notepad und speichern Sie ihn als.BAT-Datei, wie zuvor, als training.bat (oder einen anderen Namen, den Sie bevorzugen):

@echo off

REM Aktivieren der virtuellen Umgebung

call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Benutzereingabe abrufen

set /p DATASET_CONFIG=geben Sie den Pfad zur Dataset-Konfigurationsdatei ein:

set /p EPOCHS=geben Sie die Anzahl der Epochen zum Trainieren ein:

set /p OUTPUT_NAME=geben Sie den Ausgabemodellnamen ein (z. B. example0001):

set /p LEARNING_RATE=WÃĪhlen Sie den Lernfaktor (1 fÞr 1e-3, 2 fÞr 5e-3, Standard 1e-3):

if "%LEARNING_RATE%"=="1" set LR=1e-3

if "%LEARNING_RATE%"=="2" set LR=5e-3

if "%LEARNING_RATE%"=="" set LR=1e-3

set /p SAVE_STEPS=Wie oft (in Schritten) Vorschaubilder speichern:

set /p SAMPLE_PROMPTS=Wo befindet sich die Text-Prompt-Datei fÞr Trainingsvorschaubilder?

echo Sie haben eingegeben:

echo Dataset-Konfigurationsdatei: %DATASET_CONFIG%

echo Anzahl der Epochen: %EPOCHS%

echo Ausgabename: %OUTPUT_NAME%

echo Lernfaktor: %LR%

echo Speichern Sie Vorschaubilder alle %SAVE_STEPS% Schritte.

echo Text-Prompt-Datei: %SAMPLE_PROMPTS%

REM Vorbereiten des Befehls

set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^

C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^

--dit C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^

--dataset_config %DATASET_CONFIG% ^

--sdpa ^

--mixed_precision bf16 ^

--fp8_base ^

--optimizer_type adamw8bit ^

--learning_rate %LR% ^

--gradient_checkpointing ^

--max_data_loader_n_workers 2 ^

--persistent_data_loader_workers ^

--network_module=networks.lora ^

--network_dim=32 ^

--timestep_sampling sigmoid ^

--discrete_flow_shift 1.0 ^

--max_train_epochs %EPOCHS% ^

--save_every_n_epochs=1 ^

--seed 42 ^

--output_dir "C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models" ^

--output_name %OUTPUT_NAME% ^

--vae C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^

--vae_chunk_size 32 ^

--vae_spatial_tile_sample_min_size 128 ^

--text_encoder1 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^

--text_encoder2 C:/Users/[Ihr Profilname]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^

--sample_prompts %SAMPLE_PROMPTS% ^

--sample_every_n_steps %SAVE_STEPS% ^

--sample_at_first

echo Der folgende Befehl wird ausgefÞhrt:

echo %CMD%

set /p CONFIRM=Do you want to proceed with training (y/n)?

if /i "%CONFIRM%"=="y" (

%CMD%

) else (

echo Operation abgebrochen.

)

REM Halten Sie das Fenster geÃķffnet

cmd /k

Wie bei den vorherigen.BAT-Dateien ersetzen Sie alle Instanzen von [Ihr Profilname] durch Ihren richtigen Windows-Profilnamen.

Stellen Sie sicher, dass der Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\ existiert, und erstellen Sie ihn an diesem Speicherort, wenn er nicht vorhanden ist.

TRAININGSVORSCHAUEN

Es gibt eine sehr grundlegende Trainingsvorschau-Funktion, die kÞrzlich fÞr Musubi-Trainer aktiviert wurde, die es ermÃķglicht, das Trainingsmodell zu pausieren und Bilder basierend auf Prompts zu generieren, die Sie gespeichert haben. Diese werden in einem automatisch erstellten Ordner namens Sample im gleichen Verzeichnis gespeichert, in dem die trainierten Modelle gespeichert werden.

Um dies zu aktivieren, mÞssen Sie mindestens ein Prompt in einer Textdatei speichern. Das Trainings-.BAT wird Sie auffordern, den Speicherort dieser Datei einzugeben; daher kÃķnnen Sie die Prompt-Datei beliebig nennen und an einem beliebigen Speicherort speichern.

Hier sind einige Beispiele fÞr Prompts, die in einer Datei gespeichert werden kÃķnnen, um drei verschiedene Bilder zu generieren, wenn sie vom Trainingsroutine angefordert werden:

Wie Sie im obigen Beispiel sehen kÃķnnen, kÃķnnen Sie Flags am Ende des Prompts hinzufÞgen, die die generierten Bilder beeinflussen:

–w ist die Breite (standardmÃĪßig 256px, wenn nicht angegeben, laut den Dokumenten)
–h ist die HÃķhe (standardmÃĪßig 256px, wenn nicht angegeben)
–f ist die Anzahl der Frames. Wenn sie auf 1 gesetzt ist, wird ein Bild generiert; mehr als eins, ein Video.
–d ist der Seed. Wenn er nicht angegeben ist, ist er zufÃĪllig; aber Sie sollten ihn setzen, um einen Prompt zu sehen, der sich entwickelt.
–s ist die Anzahl der Schritte in der Generierung, standardmÃĪßig 20.

Sehen Sie sich die offizielle Dokumentation fÞr weitere Flags an.

Obwohl Trainingsvorschauen schnell einige Probleme aufdecken kÃķnnen, die dazu fÞhren, dass Sie das Training abbrechen und die Daten oder die Einrichtung Þberdenken, denken Sie daran, dass jeder zusÃĪtzliche Prompt das Training ein wenig verlangsamen kann.

Außerdem verlangsamen grÃķßere Trainingsvorschau-Bildbreite und -hÃķhe (wie durch die oben aufgefÞhrten Flags angegeben) das Training.

Starten Sie Ihre Trainings-.BAT-Datei.

Frage #1 ist ‘geben Sie den Pfad zur Dataset-Konfigurationsdatei ein’. FÞgen Sie den richtigen Pfad zu Ihrer TOML-Datei ein.

Frage #2 ist ‘geben Sie die Anzahl der Epochen zum Trainieren ein’. Dies ist eine trial-and-error-Variable, da sie von der Menge und QualitÃĪt der Bilder, den Beschriftungen und anderen Faktoren abhÃĪngt. Im Allgemeinen ist es am besten, sie zu hoch zu setzen, da Sie das Training jederzeit mit Strg+C im Trainingsfenster abbrechen kÃķnnen. Setzen Sie es auf 100, um zu sehen, wie es geht.

Frage #3 ist ‘geben Sie den Ausgabemodellnamen ein’. Benennen Sie Ihr Modell! Es ist vielleicht am besten, den Namen kurz und einfach zu halten.

Frage #4 ist ‘WÃĪhlen Sie den Lernfaktor’, der standardmÃĪßig auf 1e-3 (Option 1) gesetzt ist. Dies ist ein guter Ausgangspunkt, vorbehaltlich weiterer Erfahrungen.

Frage #5 ist ‘Wie oft (in Schritten) Vorschaubilder speichern’. Wenn Sie dies zu niedrig setzen, werden Sie wenig Fortschritt zwischen den Vorschaubilderspeicherungen sehen, und dies wird das Training verlangsamen.

Frage #6 ist ‘Wo befindet sich die Text-Prompt-Datei fÞr Trainingsvorschaubilder?’. FÞgen Sie den Pfad zu Ihrer Prompts-Textdatei ein.

Das.BAT zeigt Ihnen den Befehl, den es an das Hunyuan-Modell senden wird, und fragt, ob Sie fortfahren mÃķchten, y/n.

Fahren Sie mit dem Training fort:

WÃĪhrend dieser Zeit werden Sie, wenn Sie den GPU-Abschnitt des Leistungs-Tab in Windows Task Manager ÞberprÞfen, sehen, dass der Prozess etwa 16 GB VRAM verwendet.

Dies mag kein willkÞrlicher Wert sein, da dies die Menge an VRAM ist, die auf vielen NVIDIA-Grafikkarten verfÞgbar ist, und der Upstream-Code mÃķglicherweise so optimiert wurde, dass die Aufgaben in 16 GB passen, zum Vorteil derjenigen, die solche Karten besitzen.

Dass dies jedoch leicht zu erhÃķhen ist, indem man extravagante Flags an den Trainingsbefehl sendet.

WÃĪhrend des Trainings werden Sie in der unteren rechten Ecke des CMD-Fensters eine Zahl fÞr die seit dem Beginn des Trainings vergangene Zeit und eine SchÃĪtzung der Gesamtrainingszeit (die stark je nach Flags, Anzahl der Trainingsbilder, Anzahl der Trainingsvorschaubilder und anderen Faktoren variieren kann) sehen.

Eine typische Trainingszeit betrÃĪgt etwa 3-4 Stunden bei medianen Einstellungen, abhÃĪngig von der verfÞgbaren Hardware, der Anzahl der Bilder, den Flag-Einstellungen und anderen Faktoren.

VERWENDEN IHRE AUSGEBILDETEN LORA-MODELLE IN HUNYUAN-VIDEO

AUSWÄHLEN VON CHECKPOINTS

Wenn das Training abgeschlossen ist, haben Sie einen Modell-Checkpoint fÞr jede Trainings-Epoche.

Diese SpeicherhÃĪufigkeit kann durch Ändern der --save_every_n_epochs [N]-Zahl in der Trainings-.BAT-Datei geÃĪndert werden. Wenn Sie eine niedrige Zahl fÞr Speicherungen pro Schritten beim Einrichten des Trainings mit der.BAT-Datei angegeben haben, gibt es eine hohe Anzahl von gespeicherten Checkpoint-Dateien.

WELCHEN CHECKPOINT SOLLTE ICH WÄHLEN?

Wie bereits erwÃĪhnt, sind die frÞhesten trainierten Modelle am flexibelsten, wÃĪhrend die spÃĪteren Checkpoints mÃķglicherweise die meisten Details bieten. Der einzige Weg, dies zu ÞberprÞfen, ist, einige der LoRAs auszufÞhren und einige Videos zu generieren. Auf diese Weise kÃķnnen Sie herausfinden, welche Checkpoints am produktivsten sind und den besten Kompromiss zwischen FlexibilitÃĪt und Treue bieten.

COMFYUI

Die derzeit (noch) beliebteste (wenn auch nicht die einzige) Umgebung fÞr die Verwendung von Hunyuan-Video-LoRAs ist ComfyUI, ein node-basierter Editor mit einer umfassenden Gradio-OberflÃĪche, die in Ihrem Webbrowser lÃĪuft.

Quelle: https://github.com/comfyanonymous/ComfyUI

Quelle: https://github.com/comfyanonymous/ComfyUI

Die Installationsanweisungen sind einfach und im offiziellen GitHub-Repository verfÞgbar (zusÃĪtzliche Modelle mÞssen heruntergeladen werden).

KONVERTIEREN VON MODELLen FÜR COMFYUI

Ihre trainierten Modelle werden im (diffusers)-Format gespeichert, das nicht mit den meisten ComfyUI-Implementierungen kompatibel ist. Musubi kann ein Modell in ein ComfyUI-kompatibles Format konvertieren. Lassen Sie uns eine.BAT-Datei einrichten, um diese Konvertierung durchzufÞhren.

Bevor Sie diese.BAT-Datei ausfÞhren, erstellen Sie den Ordner C:\Users\[Ihr Profilname]\Desktop\Musubi\CONVERTED\, den das Skript erwartet.

@echo off

REM Aktivieren der virtuellen Umgebung

call C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\Scripts\activate.bat

:START

REM Benutzereingabe abrufen

set /p INPUT_PATH=geben Sie den Pfad zur Eingabe-Musubi-safetensors-Datei ein (oder tippen Sie 'exit', um zu beenden):

REM Beenden, wenn der Benutzer 'exit' eingibt

if /i "%INPUT_PATH%"=="exit" goto END

REM Extrahieren des Dateinamens aus dem Eingabepfad und HinzufÞgen von 'converted' zum Namen

for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF

set OUTPUT_PATH=C:\Users\[Ihr Profilname]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors

set TARGET=other

echo Sie haben eingegeben:

echo Eingabedatei: %INPUT_PATH%

echo Ausgabedatei: %OUTPUT_PATH%

echo Zielformat: %TARGET%

set /p CONFIRM=Do you want to proceed with the conversion (y/n)?

if /i "%CONFIRM%"=="y" (

REM FÞhren Sie das Konvertierungsskript mit korrekt angegebenen Pfaden aus

python C:\Users\[Ihr Profilname]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%

echo Konvertierung abgeschlossen.

) else (

echo Operation abgebrochen.

)

REM ZurÞck zum Start fÞr eine weitere Datei

goto START

:END

REM Halten Sie das Fenster geÃķffnet

echo Beenden des Skripts.

pause

Wie bei den vorherigen.BAT-Dateien speichern Sie das Skript als ‘Alle Dateien’ von Notepad, benennen es convert.bat (oder einen anderen Namen, den Sie bevorzugen).

Sobald gespeichert, doppelklicken Sie auf die neue.BAT-Datei, die nach dem Speicherort einer Datei zum Konvertieren fragt.

FÞgen Sie den Pfad zu der Datei ein, die Sie konvertieren mÃķchten, tippen Sie y und drÞcken Sie Enter.

Nachdem das konvertierte LoRA im CONVERTED-Ordner gespeichert wurde, fragt das Skript, ob Sie eine weitere Datei konvertieren mÃķchten. Wenn Sie mehrere Checkpoints in ComfyUI testen mÃķchten, konvertieren Sie eine Auswahl der Modelle.

Sobald Sie genÞgend Checkpoints konvertiert haben, schließen Sie das.BAT-Kommando-Fenster.

Sie kÃķnnen Ihre konvertierten Modelle jetzt in den models\loras-Ordner in Ihrer ComfyUI-Installation kopieren.

Typischerweise ist der richtige Speicherort etwas wie:

C:\Users\[Ihr Profilname]\Desktop\ComfyUI\models\loras\

ERSTELLEN VON HUNYUAN-VIDEO-LORAS IN COMFYUI

Obwohl die node-basierten Workflows von ComfyUI anfangs komplex erscheinen, kÃķnnen die Einstellungen anderer, erfahrenerer Benutzer durch Ziehen eines Bildes (das mit den ComfyUI-Einstellungen eines anderen Benutzers erstellt wurde) direkt in das ComfyUI-Fenster geladen werden. Workflows kÃķnnen auch als JSON-Dateien exportiert werden, die manuell importiert oder in ein ComfyUI-Fenster gezogen werden kÃķnnen.

Einige importierte Workflows haben AbhÃĪngigkeiten, die mÃķglicherweise nicht in Ihrer Installation vorhanden sind. Installieren Sie daher ComfyUI-Manager, der fehlende Module automatisch abrufen kann.

Quelle: https://github.com/ltdrdata/ComfyUI-Manager

Quelle: https://github.com/ltdrdata/ComfyUI-Manager

Um einen der Workflows zu laden, der zum Generieren von Videos aus den Modellen in diesem Tutorial verwendet wurde, laden Sie diese JSON-Datei herunter und ziehen Sie sie in Ihr ComfyUI-Fenster (obwohl es im Reddit- und Discord-Community-Forum, das Hunyuan-Video angenommen hat, und meinem eigenen, das von einem dieser Foren adaptiert wurde, bessere Workflow-Beispiele gibt).

Dies ist nicht der richtige Ort fÞr eine umfassende Anleitung zur Verwendung von ComfyUI, aber es ist erwÃĪhnenswert, dass einige der kritischen Parameter, die Ihre Ausgabe beeinflussen werden, wenn Sie die JSON-Layout-Datei verwenden, die ich verknÞpft habe, wie folgt sind:

1) Breite und HÃķhe

Je grÃķßer Ihr Bild, desto lÃĪnger dauert die Generierung, und desto hÃķher ist das Risiko eines Out-of-Memory-Fehlers (OOM).

2) LÃĪnge

Dies ist der numerische Wert fÞr die Anzahl der Frames. Wie viele Sekunden es sich daraus ergibt, hÃĪngt von der Bildfrequenz ab (die auf 30 fps in diesem Layout eingestellt ist). Sie kÃķnnen Sekunden in Frames umrechnen, basierend auf fps bei Omnicalculator.

3) Batch-GrÃķße

Je hÃķher Sie die Batch-GrÃķße setzen, desto schneller kann das Ergebnis kommen, aber desto grÃķßer ist die Belastung des VRAM. Setzen Sie es zu hoch, und Sie erhalten mÃķglicherweise einen OOM.

4) Steuern nach Generierung

Dies steuert den Zufalls-Seed. Die Optionen fÞr diesen Unter-Node sind fest, erhÃķhen, erniedrigen und zufÃĪllig. Wenn Sie es auf fest belassen und den Text-Prompt nicht ÃĪndern, erhalten Sie jedes Mal das gleiche Bild. Wenn Sie den Text-Prompt ÃĪndern, ÃĪndert sich das Bild in begrenztem Umfang. Die erhÃķhen und erniedrigen Einstellungen ermÃķglichen es Ihnen, nahegelegene Seed-Werte zu erkunden, wÃĪhrend zufÃĪllig Ihnen eine vÃķllig neue Interpretation des Prompts gibt.

5) LoRA-Name

Sie mÞssen Ihr eigenes installiertes Modell hier auswÃĪhlen, bevor Sie versuchen, zu generieren.

6) Token

Wenn Sie Ihr Modell so trainiert haben, dass es auf ein Token reagiert (z. B. example-person), fÞgen Sie das Trigger-Wort in Ihren Prompt ein.

7) Schritte

Dies stellt die Anzahl der Schritte dar, die der Diffusionsprozess anwenden wird. HÃķhere Schritte kÃķnnen bessere Details liefern, aber es gibt eine Decke, wie effektiv dieser Ansatz ist, und diese Schwelle kann schwer zu finden sein. Der Þbliche Bereich fÞr Schritte liegt bei etwa 20-30.

8) KachelgrÃķße

Dies legt fest, wie viel Information gleichzeitig wÃĪhrend der Generierung verarbeitet wird. Es ist standardmÃĪßig auf 256 gesetzt. Das ErhÃķhen kann die Generierung beschleunigen, aber das ErhÃķhen auf zu hohe Werte kann zu einem besonders frustrierenden OOM-Erlebnis fÞhren, da es am Ende eines langen Prozesses auftritt.

9) Zeitliche Überlappung

Die Generierung von Hunyuan-Video-Personen kann zu ‘Ghosting’ oder unÞberzeugender Bewegung fÞhren, wenn dies zu niedrig gesetzt ist. Im Allgemeinen gilt, dass dies auf einen hÃķheren Wert als die Anzahl der Frames gesetzt werden sollte, um bessere Bewegungen zu erzeugen.

FAZIT

Obwohl eine weitere Erforschung der Verwendung von ComfyUI den Rahmen dieses Artikels Þbersteigt, kann die Erfahrung der Community auf Reddit und Discord den Lernprozess erleichtern, und es gibt mehrere Online-Anleitungen, die die Grundlagen einfÞhren.

 

ErstverÃķffentlicht am Donnerstag, den 23. Januar 2025

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist in der menschlichen Bildsynthese. Ehemaliger Leiter des Forschungsinhalts bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Seite: martinanderson.ai
Kontakt: [email protected]