Kąt Andersona
Jak trenować i używać modeli Hunyuan Video LoRA

Ten artykuł pokaże Ci, jak zainstalować i używać oprogramowania z systemu Windows, które może trenować modele Hunyuan Video LoRA, umożliwiając użytkownikowi generowanie niestandardowych osobowości w modelu Hunyuan Video.
Kliknij, aby odtworzyć. Przykłady z niedawnego wybuchu LoRA celebrów z społeczności civit.ai.
W tym momencie dwa najpopularniejsze sposoby generowania modeli Hunyuan LoRA lokalnie to:
1) diffusion-pipe-ui, framework oparty na Docker, który wykorzystuje Windows Subsystem for Linux (WSL) do obsługi niektórych procesów.
2) Musubi Tuner, nowy dodatek do popularnej architektury Kohya ss do szkolenia dyfuzji. Musubi Tuner nie wymaga Docker i nie zależy od WSL ani innych proxy Linux.
Dlatego ten przebieg będzie się koncentrował na Musubi Tuner i na zapewnieniu całkowicie lokalnego rozwiązania do szkolenia i generowania modeli Hunyuan LoRA, bez użycia stron internetowych napędzanych przez API lub komercyjnych procesów wynajmu GPU, takich jak Runpod.
Kliknij, aby odtworzyć. Przykłady z treningu LoRA w Musubi Tuner dla tego artykułu. Wszystkie pozwolenia udzielone przez osobę przedstawioną, w celu ilustracji tego artykułu.
WYMAGANIA
Instalacja wymaga co najmniej komputera z systemem Windows 10 i kartą graficzną NVIDIA serii 30+/40+ z co najmniej 12 GB pamięci VRAM (choć zalecane jest 16 GB). Instalacja użyta do tego artykułu została przetestowana na maszynie z 64 GB pamięci systemowej i kartą graficzną NVIDIA 3090 z 24 GB pamięci VRAM. Została przetestowana na dedykowanym systemie testowym z nową instalacją systemu Windows 10 Professional, na partycji z ponad 600 GB wolnej przestrzeni dyskowej.
OSTRZEŻENIE
Instalacja Musubi Tuner i jego wymagań obejmuje również instalację oprogramowania i pakietów skierowanych do deweloperów bezpośrednio na główną instalację systemu Windows komputera. Biorąc pod uwagę instalację ComfyUI w późniejszych etapach, ten projekt wymaga około 400-500 gigabajtów miejsca na dysku. Chociaż przetestowałem tę procedurę bez incydentu kilka razy w nowo zainstalowanych środowiskach testowych systemu Windows 10, ani ja, ani unite.ai nie ponoszą odpowiedzialności za jakiekolwiek uszkodzenia systemu wynikające z postępowania zgodnie z tymi instrukcjami. Zalecam wykonywanie kopii zapasowych wszelkich ważnych danych przed podjęciem próby tej instalacji.
ROZWAGI
Czy ta metoda jest nadal ważna?
Scena generatywnego AI rozwija się bardzo szybko, a możemy oczekiwać lepszych i bardziej uporządkowanych metod ram Hunyuan Video LoRA w tym roku.
…lub nawet w tym tygodniu! Podczas gdy pisałem ten artykuł, deweloper Kohya/Musubi wydał musubi-tuner-gui, zaawansowane Gradio GUI dla Musubi Tuner:

Oczywiście, przyjazne GUI jest preferowane w stosunku do plików BAT, których używam w tym artykule – gdy tylko musubi-tuner-gui będzie działać. Jak piszę, został on opublikowany pięć dni temu i nie mogę znaleźć żadnego opisu kogoś, kto z powodzeniem go użył.
Zgodnie z postami w repozytorium, nowe GUI ma zostać włączone bezpośrednio do projektu Musubi Tuner tak szybko, jak to możliwe, co zakończy jego obecne istnienie jako oddzielnego repozytorium GitHub.
Na podstawie obecnych instrukcji instalacji, nowe GUI jest klonowane bezpośrednio do istniejącego środowiska wirtualnego Musubi; a pomimo wielu wysiłków, nie mogę go skojarzyć z istniejącą instalacją Musubi.
Gdy GUI zostanie zintegrowane z Musubi Tuner, problemy tego rodzaju na pewno zostaną rozwiązane. Chociaż autor przyznaje, że nowy projekt jest ‘bardzo surowy’, jest optymistycznie nastawiony do jego rozwoju i integracji bezpośrednio z Musubi Tuner.
Biorąc pod uwagę te problemy (również dotyczące ścieżek domyślnych w czasie instalacji i użycia pakietu UV Python, który utrudnia niektóre procedury w nowej wersji), prawdopodobnie będziemy musieli trochę poczekać na bardziej uporządkowane doświadczenie szkolenia Hunyuan Video LoRA. To powiedziawszy, wygląda to bardzo obiecująco!
Ale jeśli nie możesz czekać i jesteś gotów nieco się napocić, możesz uruchomić szkolenie Hunyuan video LoRA lokalnie już teraz.
Zacznijmy.
Dlaczego instalować cokolwiek na gołym metalu?
(Pomiń ten akapit, jeśli nie jesteś zaawansowanym użytkownikiem)
Użytkownicy zaawansowani będą się zastanawiać, dlaczego zdecydowałem się zainstalować tak wiele oprogramowania na gołym metalu systemu Windows 10 zamiast w środowisku wirtualnym. Powodem jest to, że istotna wersja systemu Windows pakietu opartego na Linuksie Triton jest znacznie trudniejsza do uruchomienia w środowisku wirtualnym. Wszystkie inne instalacje na gołym metalu w tym tutorialu nie mogą być zainstalowane w środowisku wirtualnym, ponieważ muszą komunikować się bezpośrednio z lokalnym sprzętem.
INSTALOWANIE WYMAGAŃ I PROGRAMÓW
Dla programów i pakietów, które muszą być początkowo zainstalowane, kolejność instalacji jest istotna. Zacznijmy.
1: Pobierz Microsoft Redistributable
Pobierz i zainstaluj pakiet Microsoft Redistributable z https://aka.ms/vs/17/release/vc_redist.x64.exe.
To jest prosta i szybka instalacja.

2: Zainstaluj Visual Studio 2022
Pobierz edycję Community Microsoft Visual Studio 2022 z https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta
Uruchom pobrany instalator:

Nie potrzebujemy wszystkich dostępnych pakietów, co byłoby ciężką i długą instalacją. Na początkowej stronie Workloads, która się otwiera, zaznacz Desktop Development with C++ (patrz poniższe zdjęcie).

Teraz kliknij zakładkę Individual Components w lewym górnym rogu interfejsu i użyj pola wyszukiwania, aby znaleźć ‘Windows SDK’.

Domyslnie tylko Windows 11 SDK jest zaznaczony. Jeśli używasz systemu Windows 10 (ta procedura instalacji nie została przetestowana przeze mnie na systemie Windows 11), zaznacz najnowszą wersję systemu Windows 10, wskazaną na poniższym zdjęciu.
Wyszukaj ‘C++ CMake’ i upewnij się, że C++ CMake tools for Windows jest zaznaczony.

Instalacja ta zajmie co najmniej 13 GB miejsca.

Gdy Visual Studio zostanie zainstalowane, spróbuje uruchomić się na Twoim komputerze. Pozwól mu się w pełni otworzyć. Gdy pełnoekranowy interfejs Visual Studio jest wreszcie widoczny, zamknij program.
3: Zainstaluj Visual Studio 2019
Niektóre z późniejszych pakietów dla Musubi oczekują starszej wersji Microsoft Visual Studio, podczas gdy inne potrzebują nowszej.
Dlatego też pobierz bezpłatną edycję Community Visual Studio 19 albo z Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – wymagane konto) albo Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).
Zainstaluj go z tymi samymi opcjami, co Visual Studio 2022 (patrz powyższa procedura, z wyjątkiem tego, że Windows SDK jest już zaznaczony w instalatorze Visual Studio 2019).
Zobaczysz, że instalator Visual Studio 2019 jest już świadomy nowszej wersji podczas instalacji:

Gdy instalacja zostanie ukończona, a Ty otworzyłeś i zamknąłeś zainstalowaną aplikację Visual Studio 2019, otwórz okno poleceń systemu Windows (wpisz CMD w polu wyszukiwania Start) i wpisz i wykonaj:
where cl
Wynik powinien wyświetlić znane lokalizacje zainstalowanych edycji Visual Studio.

Jeśli zamiast tego otrzymasz INFO: Could not find files for the given pattern(s), zobacz sekcję Sprawdź ścieżki w tym artykule poniżej i użyj tych instrukcji, aby dodać odpowiednie ścieżki Visual Studio do środowiska systemu Windows.
Zapisz wszystkie zmiany dokonane zgodnie z sekcją Sprawdź ścieżki poniżej, a następnie spróbuj ponownie polecenie where cl.
4: Zainstaluj CUDA 11 + 12 Toolkity
Różne pakiety zainstalowane w Musubi wymagają różnych wersji NVIDIA CUDA, które przyspieszają i optymalizują szkolenie na kartach graficznych NVIDIA.
Powodem, dla którego zainstalowaliśmy wersje Visual Studio wcześniej, jest to, że instalatorzy pakietów NVIDIA CUDA wyszukują i integrują się z istniejącymi instalacjami Visual Studio.
Pobierz pakiet instalacyjny serii 11 CUDA z:
https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (pobierz ‘exe (local)’)
Pobierz pakiet instalacyjny serii 12 CUDA Toolkit z:
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
Proces instalacji jest identyczny dla obu instalatorów. Ignoruj wszelkie ostrzeżenia dotyczące istnienia lub nieistnienia ścieżek instalacji w zmiennych środowiskowych systemu Windows – zajmiemy się tym ręcznie później.
Zainstaluj NVIDIA CUDA Toolkit V11+
Uruchom instalator pakietu CUDA serii 11.


Na stronie Installation Options wybierz Custom (Advanced) i przejdź dalej.

Odznacz opcję NVIDIA GeForce Experience i kliknij Next.

Zostaw Select Installation Location w ustawieniach domyślnych (to jest ważne):

Kliknij Next i pozwól instalacji dojść do końca.

Ignoruj wszelkie ostrzeżenia lub uwagi, które instalator daje dotyczące Nsight Visual Studio integracji, której nie potrzebujemy w naszym przypadku.
Zainstaluj NVIDIA CUDA Toolkit V12+
Powtórz cały proces dla oddzielnego instalatora narzędzi NVIDIA Toolkit serii 12, który pobrano:

Proces instalacji jest identyczny jak powyżej (dla wersji 11+), z wyjątkiem jednego ostrzeżenia dotyczącego ścieżek środowiskowych, które możesz zignorować:

Gdy instalacja wersji 12 CUDA zostanie ukończona, otwórz okno poleceń systemu Windows i wpisz i wykonaj:
nvcc --version
To powinno potwierdzić informacje o zainstalowanej wersji sterownika:

Aby sprawdzić, czy Twoja karta jest rozpoznawana, wpisz i wykonaj:
nvidia-smi

5: Zainstaluj GIT
GIT będzie obsługiwał instalację repozytorium Musubi na Twoim komputerze. Pobierz instalator GIT z:
https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Uruchom instalator:

Użyj ustawień domyślnych dla Select Components:

Zostaw edytor domyślny ustawiony na Vim:

Pozwól GIT zdecydować o nazwach gałęzi:

Użyj zalecanych ustawień dla Path Environment:

Użyj zalecanych ustawień dla SSH:

Użyj zalecanych ustawień dla HTTPS Transport backend:

Użyj zalecanych ustawień dla konwersji końców wierszy:

Wybierz domyślny konsol systemu Windows jako emulator terminala:

Użyj ustawień domyślnych (Fast-forward or merge) dla Git Pull:

Użyj Git-Credential Manager (ustawienie domyślne) dla Credential Helper:

W Configuring extra options pozostaw Enable file system caching zaznaczone i Enable symbolic links odznaczone (chyba że jesteś zaawansowanym użytkownikiem, który używa linków twardych dla scentralizowanego repozytorium modeli).

Zakończ instalację i przetestuj, czy GIT jest poprawnie zainstalowany, otwierając okno poleceń i wpisując i wykonując:
git --version

Logowanie do GitHub
Później, gdy będziesz próbować sklonować repozytoria GitHub, możesz zostać poproszony o Twoje poświadczenia GitHub. Aby się do tego przygotować, zaloguj się do swojego konta GitHub (utwórz je, jeśli potrzebujesz) na dowolnym przeglądarce zainstalowanej na Twoim systemie Windows. W ten sposób metoda uwierzytelniania 0Auth (okno podręczne) powinna potrwać jak najkrócej.
Po tej początkowej wyzwani, powinieneś pozostać uwierzytelniony automatycznie.
6: Zainstaluj CMake
CMake 3.21 lub nowszy jest wymagany do części procesu instalacji Musubi. CMake to architektura rozwoju, która potrafi orkiestrować różne kompilatory i kompilować oprogramowanie z kodów źródłowych.
Pobierz go z:
https://cmake.org/download/ (‘Windows x64 Installer’)
Uruchom instalator:

Upewnij się, że Add Cmake to the PATH environment variable jest zaznaczone.

Kliknij Next.

Wpisz i wykonaj to polecenie w oknie poleceń systemu Windows:
cmake --version
Jeśli CMake zainstalował się pomyślnie, powinno wyświetlić coś takiego:
cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: Zainstaluj Python 3.10
Interpretery Pythona są kluczowe dla tego projektu. Pobierz wersję 3.10 (najlepszy kompromis między różnymi wymaganiami pakietów Musubi) z:
https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)
Uruchom pobrany instalator i pozostaw ustawienia domyślne:


Na końcu procesu instalacji kliknij Disable path length limit (wymaga potwierdzenia administracyjnego UAC):

W oknie poleceń systemu Windows wpisz i wykonaj:
python --version
To powinno wynikować w Python 3.10.0

SPRAWDŹ ŚCIEŻKI
Klonowanie i instalacja ram Musubi, a także ich normalne działanie po instalacji, wymaga, aby ich składniki wiedziały o ścieżce do kilku ważnych składników zewnętrznych w systemie Windows, szczególnie CUDA.
Dlatego musimy otworzyć środowisko i sprawdzić, czy wszystkie wymagania są tam.
Szybki sposób, aby uzyskać dostęp do kontroli środowiska systemu Windows, to wpisanie Edytuj zmienne środowiskowe systemu w pasku wyszukiwania systemu Windows.

Kliknięcie tego otworzy Właściwości systemu. W dolnej prawej części Właściwości systemu kliknij przycisk Zmienne środowiskowe, a otworzy się okno Zmienne środowiskowe. W panelu Zmienne systemowe w dolnej połowie tego okna przewiń w dół do Path i kliknij je dwukrotnie. To otworzy okno Edytuj zmienne środowiskowe. Przeciągnij szerokość tego okna, aby zobaczyć pełną ścieżkę zmiennych:

Oto ważne wpisy:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin
W większości przypadków odpowiednie zmienne środowiskowe powinny już być obecne.
Dodaj brakujące ścieżki, klikając New po lewej stronie okna Edytuj zmienne środowiskowe i wklejając odpowiednią ścieżkę:

Nie kopiuj i nie wklejaj ścieżek z powyższej listy; sprawdź, czy każda odpowiednia ścieżka istnieje w Twojej własnej instalacji systemu Windows.
Jeśli są niewielkie różnice w ścieżkach (szczególnie z instalacjami Visual Studio), użyj powyższych ścieżek, aby znaleźć odpowiednie foldery docelowe (tj. x64 w Host64 w Twojej własnej instalacji). Następnie wklej te ścieżki do okna Edytuj zmienne środowiskowe.
Po tym restartuj komputer.
INSTALOWANIE MUSUBI
Uaktualnij PIP
Użycie najnowszej wersji instalatora PIP może ułatwić niektóre etapy instalacji. W oknie poleceń systemu Windows z uprawnieniami administratora (patrz Podniesienie uprawnień poniżej) wpisz i wykonaj:
pip install --upgrade pip
Podniesienie uprawnień
Niektóre polecenia mogą wymagać podniesionych uprawnień (tj. muszą być uruchomione jako administrator). Jeśli otrzymasz komunikaty o błędach dotyczących uprawnień w następnych etapach, zamknij okno poleceń i otwórz je ponownie w trybie administratora, wpisując CMD w pasku wyszukiwania systemu Windows, klikając prawym przyciskiem myszy Command Prompt i wybierając Uruchom jako administrator:

Dla następnych etapów będziemy używać Windows Powershell zamiast okna poleceń systemu Windows. Możesz to znaleźć, wpisując Powershell w pasku wyszukiwania systemu Windows i (jeśli to konieczne) klikając prawym przyciskiem myszy i wybierając Uruchom jako administrator:

Zainstaluj Torch
W Powershell wpisz i wykonaj:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
Bądź cierpliwy, aż wiele pakietów zostanie zainstalowanych.
Gdy instalacja zostanie ukończona, możesz zweryfikować instalację PyTorch z obsługą GPU, wpisując i wykonując:
python -c "import torch; print(torch.cuda.is_available())"
To powinno wynikować w:
True

Zainstaluj Triton dla systemu Windows
Następnie instalacja składnika Triton for Windows. W Powershell z uprawnieniami administratora wpisz (w jednej linii):
pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(Instalator triton-3.1.0-cp310-cp310-win_amd64.whl działa zarówno dla procesorów Intel, jak i AMD, o ile architektura jest 64-bitowa i środowisko odpowiada wersji Pythona)
Po uruchomieniu to powinno wynikować w:
Successfully installed triton-3.1.0
Możemy sprawdzić, czy Triton działa, importując go w Pythonie. Wpisz i wykonaj to polecenie:
python -c "import triton; print('Triton is working')"
To powinno wyświetlić:
Triton is working
Aby sprawdzić, czy Triton jest obsługiwany przez GPU, wpisz i wykonaj:
python -c "import torch; print(torch.cuda.is_available())"
To powinno wynikować w True:

Utwórz środowisko wirtualne dla Musubi
Od tego momentu zainstalujemy wszelkie dodatkowe oprogramowanie w środowisku wirtualnym Pythona (lub venv). To oznacza, że wszystko, co będziesz musiał zrobić, aby odinstalować następujące oprogramowanie, to przeciągnąć folder instalacji venv do kosza.
Utwórzmy folder instalacji: utwórz folder o nazwie Musubi na swoim biurku. Następujące przykłady zakładają, że ten folder istnieje: C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\.
W Powershell nawiguj do tego folderu, wpisując:
cd C:\Users\[Twoje nazwa profilu]\Desktop\Musubi
Chcemy, aby środowisko wirtualne miało dostęp do tego, co zainstalowaliśmy już (szczególnie Triton), więc użyjemy flagi --system-site-packages. Wpisz i wykonaj to:
python -m venv --system-site-packages musubi
Zaczekaj, aż środowisko zostanie utworzone, a następnie aktywuj je, wpisując:
.\musubi\Scripts\activate
Od tego momentu możesz zobaczyć, że jesteś w aktywnym środowisku wirtualnym, ponieważ (musubi) pojawia się na początku wszystkich Twoich poleceń.

Klonuj repozytorium
Nawiguj do nowo utworzonego folderu musubi (który znajduje się w folderze Musubi na Twoim biurku):
cd musubi
Teraz, gdy jesteśmy w odpowiednim miejscu, wpisz i wykonaj to polecenie:
git clone https://github.com/kohya-ss/musubi-tuner.git
Zaczekaj, aż klonowanie zostanie ukończone (nie powinno to potrwać długo).

Instaluj wymagania
Nawiguj do folderu instalacji:
cd musubi-tuner
Wpisz i wykonaj:
pip install -r requirements.txt
Zaczekaj, aż wiele instalacji zostanie ukończonych (to potrwa dłużej).

Automatyzacja dostępu do Hunyuan Video Venv
Aby łatwo aktywować i uzyskać dostęp do nowego venv w przyszłych sesjach, wklej poniższy tekst do Notepad i zapisz go z nazwą activate.bat, zapisując go z opcją Wszystkie pliki (patrz poniższe zdjęcie).
@echo off
call C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\Scripts\activate
cd C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner
cmd
(Zamień [Twoje nazwa profilu] na swoją prawdziwą nazwę folderu profilu systemu Windows)

Nie ma znaczenia, w której lokalizacji zapiszesz ten plik.
Od tego momentu możesz kliknąć dwukrotnie activate.bat i natychmiast zacząć pracę.

UŻYTYWANIE MUSUBI TUNER
Pobieranie modeli
Proces szkolenia Hunyuan Video LoRA wymaga pobrania co najmniej siedmiu modeli, aby obsłużyć wszystkie możliwe opcje optymalizacji do pre-cachingu i szkolenia Hunyuan video LoRA. Razem te modele ważą ponad 60 GB.
Bieżące instrukcje dotyczące pobierania ich można znaleźć w https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download
Jednak te są instrukcje pobierania w momencie pisania:
clip_l.safetensors, llava_llama3_fp16.safetensors i llava_llama3_fp8_scaled.safetensors można pobrać z https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders
mp_rank_00_model_states.pt, mp_rank_00_model_states_fp8.pt i mp_rank_00_model_states_fp8_map.pt można pobrać z https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers
pytorch_model.pt można pobrać z https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae
Chociaż możesz umieścić je w dowolnym katalogu, dla spójności z późniejszymi skryptami umieść je w:
C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\models\
To jest spójne z układem katalogów przed tym punktem. Nie zapomnij zamienić [Twoje nazwa profilu] na swoją prawdziwą nazwę folderu profilu systemu Windows.
PRZYGOTOWANIE ZBIORU DANYCH
Ignorując kontrowersje społeczne na ten temat, można powiedzieć, że będziesz potrzebować gdzieś między 10 a 100 zdjęć do zestawu danych szkoleniowych dla Twojego Hunyuan LoRA. Bardzo dobre wyniki można uzyskać nawet z 15 obrazami, o ile obrazy są dobrze zbalansowane i mają dobrą jakość.
Model Hunyuan LoRA można trenować zarówno na obrazach, jak i bardzo krótkich i niskich klipach wideo, lub nawet ich połączeniu – chociaż używanie klipów wideo jako danych szkoleniowych jest wyzwaniem, nawet dla karty z 24 GB.
Jednak klipy wideo są naprawdę przydatne tylko wtedy, gdy Twoja postać porusza się w sposób nietypowy, o którym model Hunyuan Video może nie wiedzieć, lub nie może go odgadnąć.
Przykłady obejmują Rogera Rabbita, ksenomorf, Maska, Spider-Mana lub inne postacie, które posiadają unikalne cechy ruchu.
Ponieważ Hunyuan Video już wie, jak zwykle poruszają się mężczyźni i kobiety, klipy wideo nie są konieczne do uzyskania przekonywującego Hunyuan Video LoRA człowieka. Więc użyjemy statycznych obrazów.
PRZYGOTOWANIE OBRAZÓW
LISTA WYKONANIA
Wersja TLDR:
Najlepiej jest używać obrazów, które wszystkie mają ten sam rozmiar w swoim zestawie danych, lub używać podziału 50/50 między dwa różne rozmiary, np. 10 obrazów o rozmiarze 512×768 px i 10 o rozmiarze 768×512 px.
Szkolenie może przebiec dobrze nawet jeśli nie zrobisz tego – Hunyuan Video LoRAs mogą być dość wyrozumiałe.
Dłuższa wersja
Podobnie jak w przypadku Kohya-ss LoRAs dla statycznych systemów generatywnych, takich jak Stable Diffusion, bucketing jest używany do rozłożenia obciążenia na różnej wielkości obrazów, umożliwiając użycie większych obrazów bez powodowania błędów braku pamięci w czasie szkolenia (tj. bucketing ‘rozdziela’ obrazy na kawałki, które GPU może obsłużyć, zachowując semantyczną integralność całego obrazu).
Dla każdego rozmiaru obrazu, który umieścisz w swoim zestawie danych (tj. 512×768 px), utworzony zostanie bucket, lub ‘podzadanie’. Więc jeśli masz następujący rozkład obrazów:
2x 512x768px obrazy
7x 768x512px obrazy
1x 1000x600px obraz
3x 400x800px obrazy
Możemy zobaczyć, że uwaga bucket jest nierównomiernie rozłożona wśród tych obrazów:

Dlatego albo trzymaj się jednego formatu rozmiaru, albo staraj się utrzymać równy rozkład różnych rozmiarów.
W obu przypadkach unikaj bardzo dużych obrazów, ponieważ może to spowolnić szkolenie, bez znaczącej korzyści.
Dla prostoty użyłem 512x768px dla wszystkich zdjęć w moim zestawie danych.
Disclaimer: Model (osoba) użyty w zestawie danych dał mi pełne pozwolenie na użycie tych zdjęć do tego celu i zaakceptował wszystkie wyniki AI przedstawiające jego podobiznę, przedstawione w tym artykule.

Mój zestaw danych składa się z 40 obrazów w formacie PNG (choć JPG jest również w porządku). Moje obrazy zostały przechowywane w C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman
Należy utworzyć folder cache wewnątrz folderu z obrazami szkoleniowymi:

Teraz utwórz specjalny plik, który skonfiguruje szkolenie.
PLIKI TOML
Procesy szkolenia i pre-cachingu modeli Hunyuan Video LoRA pobierają ścieżki plików z płaskiego pliku tekstowego z rozszerzeniem .toml.
Dla mojego testu plik TOML znajduje się w C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml
Zawartość mojego pliku szkoleniowego TOML wygląda tak:
[general]
resolution = [512, 768]
caption_extension = ".txt"
batch_size = 1
enable_bucket = true
bucket_no_upscale = false
[[datasets]]
image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"
cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"
num_repeats = 1
(Podwójne back-slashy dla katalogów obrazów i pamięci podręcznej nie są zawsze konieczne, ale mogą pomóc uniknąć błędów w przypadku, gdy w ścieżce jest spacja. Szkoliłem modele z plikami.toml, które używały pojedynczych forward-slash i pojedynczych back-slash)
Widzimy w sekcji resolution, że rozważane będą dwa rozmiary – 512 px i 768 px. Można również pozostawić to na 512, a nadal uzyskać dobre wyniki.
PODPISY
Hunyuan Video jest modelem tekst+wizja, więc potrzebujemy opisowych podpisów dla tych obrazów, które będą brane pod uwagę podczas szkolenia. Proces szkolenia zakończy się niepowodzeniem bez podpisów.
Istnieje wiele otwartych systemów kapionowania, których moglibyśmy użyć do tego zadania, ale utrzymajmy prostotę i użyjmy systemu taggui. Chociaż jest przechowywany w GitHub i chociaż pobiera pewne bardzo ciężkie modele głębokiego uczenia podczas pierwszego uruchomienia, przychodzi w postaci prostego wykonywalnego pliku systemu Windows, który ładuje biblioteki Pythona i prosty interfejs użytkownika.
Po uruchomieniu Taggui użyj Plik > Załaduj katalog, aby przejść do swojego zestawu danych obrazów i opcjonalnie umieść token identyfikatora (w tym przypadku examplewoman), który zostanie dodany do wszystkich podpisów:

(Upewnij się, że wyłączysz Ładuj w 4-bit, gdy Taggui po raz pierwszy otworzy się – to wyrzuci błędy podczas kapionowania, jeśli to pozostanie włączone)
Wybierz obraz w lewej kolumnie podglądu i naciśnij CTRL+A, aby wybrać wszystkie obrazy. Następnie naciśnij przycisk Start Auto-Captioning po prawej:

Zobaczysz Taggui pobierający modele w małym CLI w prawej kolumnie, ale tylko wtedy, gdy jest to pierwszy raz, kiedy uruchamiasz kapionator. W przeciwnym razie zobaczysz podgląd podpisów.

Teraz każde zdjęcie ma odpowiadający mu plik.txt z opisem zawartości obrazu:

Możesz kliknąć Advanced Options w Taggui, aby zwiększyć długość i styl podpisów, ale to wykracza poza zakres tego przewodnika.
Zamknij Taggui i przejdź do…
PRE-CACHING LATENTNY
Aby uniknąć nadmiernego obciążenia GPU w czasie szkolenia, konieczne jest utworzenie dwóch typów plików pre-cached – jednego, aby reprezentować latentny obraz pochodzący z samych obrazów, i innego, aby ocenić kodowanie tekstu dotyczące zawartości podpisu.
Aby uprościć wszystkie trzy procesy (2x cache + szkolenie), możesz użyć interaktywnych plików.BAT, które poproszą Cię o pytania i przeprowadzą procesy, gdy udzielisz niezbędnych informacji.
Dla pre-cachingu latentnego skopiuj poniższy tekst do Notepad i zapisz go jako plik.BAT (tj. nazwij go czymś takim jak latent-precache.bat), jak wcześniej, upewniając się, że typ pliku w menu rozwijanym Zapisz jako to Wszystkie pliki (patrz poniższe zdjęcie):
@echo off
REM Aktywuj środowisko wirtualne
call C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Pobierz dane wejściowe
set /p IMAGE_PATH=Enter the path to the image directory:
set /p CACHE_PATH=Enter the path to the cache directory:
set /p TOML_PATH=Enter the path to the TOML file:
echo You entered:
echo Image path: %IMAGE_PATH%
echo Cache path: %CACHE_PATH%
echo TOML file path: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Uruchom skrypt pre-cachingu
python C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling
) else (
echo Operation canceled.
)
REM Pozostaw okno otwarte
pause
(Zamień [Twoje nazwa profilu] na swoją prawdziwą nazwę folderu profilu systemu Windows)

Teraz możesz uruchomić plik.BAT dla automatycznego pre-cachingu latentnego:

Gdy zostaniesz poproszony przez plik.BAT o różne pytania, wklej lub wpisz ścieżkę do swojego zestawu danych, folderów pamięci podręcznej i pliku TOML.
PRE-CACHING TEKSTU
Utwórzmy drugi plik.BAT, tym razem dla pre-cachingu tekstu.
@echo off
REM Aktywuj środowisko wirtualne
call C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Pobierz dane wejściowe
set /p IMAGE_PATH=Enter the path to the image directory:
set /p CACHE_PATH=Enter the path to the cache directory:
set /p TOML_PATH=Enter the path to the TOML file:
echo You entered:
echo Image path: %IMAGE_PATH%
echo Cache path: %CACHE_PATH%
echo TOML file path: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Użyj wykonywalnego pythona z środowiska wirtualnego
python C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16
) else (
echo Operation canceled.
)
REM Pozostaw okno otwarte
pause
Zamień swoją nazwę folderu profilu systemu Windows i zapisz to jako text-cache.bat (lub dowolną inną nazwę), w dowolnej dogodnej lokalizacji, zgodnie z procedurą poprzedniego pliku.BAT.
Uruchom ten nowy plik.BAT, postępuj zgodnie z instrukcjami, a niezbędne pliki zakodowane tekstowo pojawią się w folderze cache:

SZKOLENIE MODELU HUNYUAN VIDEO LORA
Szkolenie samego LoRA potrwa znacznie dłużej niż te dwa procesy przygotowawcze.
Chociaż istnieją również wiele zmiennych, o które możemy się martwić (takich jak rozmiar partii, powtórzenia, epoki i czy używać pełnych czy kwantyzowanych modeli, wśród innych), oszczędzimy te rozważania na później i głębsze spojrzenie na niuanse tworzenia LoRA.
Dla teraz po prostu zminimalizujmy wybory i przeszkolimy LoRA na ‘median’ ustawieniach.
Utwórzmy trzeci plik.BAT, tym razem do zainicjowania szkolenia. Skopiuj poniższy tekst do Notepad i zapisz go jako plik.BAT, jak wcześniej, jako training.bat (lub dowolną inną nazwę):
@echo off
REM Aktywuj środowisko wirtualne
call C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Pobierz dane wejściowe
set /p DATASET_CONFIG=Enter the path to the dataset configuration file:
set /p EPOCHS=Enter the number of epochs to train:
set /p OUTPUT_NAME=Enter the output model name (e.g., example0001):
set /p LEARNING_RATE=Choose learning rate (1 for 1e-3, 2 for 5e-3, default 1e-3):
if "%LEARNING_RATE%"=="1" set LR=1e-3
if "%LEARNING_RATE%"=="2" set LR=5e-3
if "%LEARNING_RATE%"=="" set LR=1e-3
set /p SAVE_STEPS=How often (in steps) to save preview images:
set /p SAMPLE_PROMPTS=What is the location of the text-prompt file for training previews?
echo You entered:
echo Dataset configuration file: %DATASET_CONFIG%
echo Number of epochs: %EPOCHS%
echo Output name: %OUTPUT_NAME%
echo Learning rate: %LR%
echo Save preview images every %SAVE_STEPS% steps.
echo Text-prompt file: %SAMPLE_PROMPTS%
REM Przygotuj polecenie
set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^
C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^
--dit C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^
--dataset_config %DATASET_CONFIG% ^
--sdpa ^
--mixed_precision bf16 ^
--fp8_base ^
--optimizer_type adamw8bit ^
--learning_rate %LR% ^
--gradient_checkpointing ^
--max_data_loader_n_workers 2 ^
--persistent_data_loader_workers ^
--network_module=networks.lora ^
--network_dim=32 ^
--timestep_sampling sigmoid ^
--discrete_flow_shift 1.0 ^
--max_train_epochs %EPOCHS% ^
--save_every_n_epochs=1 ^
--seed 42 ^
--output_dir "C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\Output Models" ^
--output_name %OUTPUT_NAME% ^
--vae C:/Users/[Twoje nazwa profilu]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^
--vae_chunk_size 32 ^
--vae_spatial_tile_sample_min_size 128 ^
--text_encoder1 C:/Users/[Twoje nazwa profilu]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^
--text_encoder2 C:/Users/[Twoje nazwa profilu]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^
--sample_prompts %SAMPLE_PROMPTS% ^
--sample_every_n_steps %SAVE_STEPS% ^
--sample_at_first
echo The following command will be executed:
echo %CMD%
set /p CONFIRM=Do you want to proceed with training (y/n)?
if /i "%CONFIRM%"=="y" (
%CMD%
) else (
echo Operation canceled.
)
REM Pozostaw okno otwarte
cmd /k
Jak zwykle upewnij się, że zamieniłeś wszystkie wystąpienia [Twoje nazwa profilu] na swoją prawidłową nazwę folderu profilu systemu Windows.
Upewnij się, że folder C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\Output Models\ istnieje i utwórz go w tej lokalizacji, jeśli nie.
PODGLĄDY SZKOLENIA
Istnieje bardzo podstawowa funkcja podglądu szkolenia, która została ostatnio włączona dla Musubi trainer, która pozwala na przerwanie szkolenia modelu i wygenerowanie obrazów na podstawie podanych podpowiedzi. Zapisywane są one w automatycznie utworzonym folderze o nazwie Sample, w tym samym katalogu, w którym zapisywane są przeszkolone modele.

Aby włączyć tę funkcję, będziesz musiał zapisać co najmniej jedną podpowiedź w pliku tekstowym. Polecenie szkoleniowe.BAT poprosi Cię o podanie lokalizacji tego pliku; dlatego możesz nazwać plik podpowiedzi dowolną nazwą i zapisać go w dowolnej lokalizacji.
Oto kilka przykładów podpowiedzi dla pliku, który wygeneruje trzy różne obrazy, gdy zostanie zażądane przez rutynę szkolenia:

Jak widać na powyższym przykładzie, możesz umieścić flagi na końcu podpowiedzi, które wpłyną na obrazy:
–w to szerokość (domyślnie 256 px, jeśli nie jest ustawiona, zgodnie z dokumentacją)
–h to wysokość (domyślnie 256 px, jeśli nie jest ustawiona)
–f to liczba klatek. Jeśli jest ustawiona na 1, generowany jest obraz; więcej niż jeden, generowany jest film.
–d to nasiono. Jeśli nie jest ustawione, jest losowe; ale powinieneś je ustawić, aby zobaczyć jedną podpowiedź ewoluującą.
–s to liczba kroków w generowaniu, domyślnie 20.
Zobacz oficjalną dokumentację dla dodatkowych flag.
Chociaż podglądy szkolenia mogą szybko ujawnić pewne problemy, które mogą skłonić Cię do anulowania szkolenia i ponownego rozważenia danych lub ustawień, pamiętaj, że każda dodatkowa podpowiedź spowalnia szkolenie nieco bardziej.
Ponadto im większa szerokość i wysokość obrazu podglądu szkolenia (ustawiona za pomocą powyższych flag), tym bardziej spowolni szkolenie.
Uruchom swój plik szkoleniowy.BAT.
Pytanie #1 to ‘Enter the path to the dataset configuration’. Wklej lub wpisz prawidłową ścieżkę do swojego pliku TOML.
Pytanie #2 to ‘Enter the number of epochs to train’. To zmienna prób i błędów, ponieważ jest wpływana przez ilość i jakość obrazów, a także podpisów i innych czynników. Ogólnie najlepiej jest ustawić ją zbyt wysoko niż zbyt nisko, ponieważ zawsze możesz przerwać szkolenie za pomocą Ctrl+C w oknie szkolenia, jeśli poczujesz, że model jest wystarczająco zaawansowany. Ustaw ją na 100 w pierwszej instancji i zobacz, jak to idzie.
Pytanie #3 to ‘Enter the output model name’. Nazwij swój model! Najlepiej jest trzymać się krótkiej i prostej nazwy.
Pytanie #4 to ‘Choose learning rate’, która domyślnie jest ustawiona na 1e-3 (opcja 1). To dobre miejsce do rozpoczęcia, biorąc pod uwagę dalsze doświadczenia.
Pytanie #5 to ‘How often (in steps) to save preview images’. Jeśli ustawisz to zbyt nisko, zobaczysz niewielki postęp między zapisami obrazów podglądu, a to spowolni szkolenie.
Pytanie #6 to ‘What is the location of the text-prompt file for training previews?’. Wklej lub wpisz ścieżkę do swojego pliku tekstowego z podpowiedziami.
Polecenie.BAT wyświetli Ci polecenie, które zostanie wysłane do modelu Hunyuan, i poprosi, czy chcesz kontynuować, y/n.
Przejdź do szkolenia:

W tym czasie, jeśli sprawdzisz sekcję GPU w zakładce Wydajność Menedżera zadań systemu Windows, zobaczysz, że proces zajmuje około 16 GB pamięci VRAM.

To może nie być arbitralną liczbą, ponieważ jest to ilość pamięci VRAM dostępna na wielu kartach graficznych NVIDIA, a kod źródłowy mógł być zoptymalizowany, aby zmieścić się w 16 GB dla korzyści tych, którzy posiadają takie karty.
To powiedziawszy, jest bardzo łatwo zwiększyć to użycie, wysyłając bardziej ekstrawaganckie flagi do polecenia szkolenia.
Podczas szkolenia zobaczysz w dolnej prawej części okna CMD liczbę godzin, które upłynęły od rozpoczęcia szkolenia, oraz szacowany czas szkolenia (który może się znacznie różnić w zależności od ustawień flag, liczby obrazów szkoleniowych, liczby obrazów podglądu szkolenia i innych czynników).

Typowy czas szkolenia wynosi około 3-4 godzin na ustawieniach mediany, w zależności od dostępnego sprzętu, liczby obrazów, ustawień flag i innych czynników.
UŻYTYWANIE PRZESZKOLONYCH MODELI LORA W HUNYUAN VIDEO
WYBÓR PUNKTÓW
Gdy szkolenie zostanie ukończone, będziesz miał punkt kontrolny dla każdej epoki szkolenia.

Częstotliwość zapisywania może być zmieniona przez użytkownika, aby zapisywać częściej lub rzadziej, zgodnie z życzeniem, poprzez zmianę liczby --save_every_n_epochs [N] w pliku szkoleniowym.BAT. Jeśli dodano niską liczbę kroków do zapisywania podglądów, gdy ustawiałeś szkolenie za pomocą pliku.BAT, będzie wiele zapisanych plików punktów kontrolnych.
KTÓRY PUNKT KONTROLNY WYBRAĆ?
Jak wspomniano wcześniej, najwcześniej wytrenowane modele będą najbardziej elastyczne, podczas gdy późniejsze punkty kontrolne mogą oferować najwięcej szczegółów. Jedynym sposobem, aby to sprawdzić, jest uruchomienie niektórych LoRAs i wygenerowanie kilku filmów. W ten sposób możesz dowiedzieć się, które punkty kontrolne są najbardziej produktywne i reprezentują najlepszy balans między elastycznością a wiernością.
COMFYUI
Najpopularniejsze (choć nie jedyne) środowisko do korzystania z modeli Hunyuan Video LoRA, obecnie jest ComfyUI, edytor oparty na węzłach z zaawansowanym interfejsem Gradio, który działa w Twojej przeglądarce internetowej.

Źródło: https://github.com/comfyanonymous/ComfyUI
Instrukcje instalacji są proste i dostępne w oficjalnym repozytorium GitHub (dodatkowe modele muszą być pobrane).
KONWERTOWANIE MODELI DLA COMFYUI
Twoje przeszkolone modele są zapisane w formacie (diffusers), który nie jest kompatybilny z większością wdrożeń ComfyUI. Musubi może przekonwertować model do formatu kompatybilnego z ComfyUI. Ustawmy plik.BAT, aby to zrobić.
Przed uruchomieniem tego pliku.BAT utwórz folder C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\CONVERTED\, który skrypt oczekuje.
@echo off
REM Aktywuj środowisko wirtualne
call C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\Scripts\activate.bat
:START
REM Pobierz dane wejściowe
set /p INPUT_PATH=Enter the path to the input Musubi safetensors file (or type "exit" to quit):
REM Zakończ, jeśli użytkownik wpisze "exit"
if /i "%INPUT_PATH%"=="exit" goto END
REM Wyodrębnij nazwę pliku ze ścieżki wejściowej i dodaj 'converted' do niej
for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF
set OUTPUT_PATH=C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors
set TARGET=other
echo You entered:
echo Input file: %INPUT_PATH%
echo Output file: %OUTPUT_PATH%
echo Target format: %TARGET%
set /p CONFIRM=Do you want to proceed with the conversion (y/n)?
if /i "%CONFIRM%"=="y" (
REM Uruchom skrypt konwersji z poprawnie cytowanymi ścieżkami
python C:\Users\[Twoje nazwa profilu]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%
echo Konwersja zakończona.
) else (
echo Operation canceled.
)
REM Wróć do początku dla innego pliku
goto START
:END
REM Pozostaw okno otwarte
echo Zakończono skrypt.
pause
Jak zwykle zapisz skrypt jako ‘Wszystkie pliki’ z Notepad, nazywając go convert.bat (lub dowolną inną nazwę).
Gdy zostanie zapisany, kliknij dwukrotnie nowy plik.BAT, który poprosi o lokalizację pliku do przekonwertowania.

Wklej lub wpisz ścieżkę do przeszkolonego pliku, który chcesz przekonwertować, kliknij y, a następnie naciśnij enter.

Po zapisaniu przekonwertowanego LoRA do folderu CONVERTED, skrypt poprosi, czy chcesz przekonwertować inny plik. Jeśli chcesz przetestować wiele punktów kontrolnych w ComfyUI, przekonwertuj wybrany zestaw modeli.
Gdy przekonwertujesz wystarczającą liczbę punktów kontrolnych, zamknij okno polecenia.BAT.
Możesz teraz skopiować swoje przekonwertowane modele do folderu C:\Users\[Twoje nazwa profilu]\Desktop\ComfyUI\models\loras\
TWORZENIE MODELI HUNYUAN VIDEO LORA W COMFYUI
Chociaż oparte na węzłach przepływy ComfyUI wydają się skomplikowane początkowo, ustawienia innych, bardziej doświadczonych użytkowników mogą być ładowane przez przeciągnięcie obrazu (utworzonego przy użyciu ComfyUI innego użytkownika) bezpośrednio do okna ComfyUI. Przepływy mogą być również eksportowane jako pliki JSON, które mogą być importowane ręcznie lub przeciągnięte do okna ComfyUI.
Niektóre zaimportowane przepływy mogą mieć zależności, których nie ma w Twojej instalacji. Dlatego zainstaluj ComfyUI-Manager, który może automatycznie pobrać brakujące moduły.

Źródło: https://github.com/ltdrdata/ComfyUI-Manager
Aby załadować jeden z przepływów używanych do generowania filmów z modelami w tym tutorialu, pobierz ten plik JSON i przeciągnij go do swojego okna ComfyUI (chociaż istnieją znacznie lepsze przykłady przepływów dostępne w różnych społecznościach Reddit i Discord, które przyjęły Hunyuan Video, a mój jest oparty na jednym z nich).
To nie jest miejsce na rozszerzony samouczek dotyczący użycia ComfyUI, ale warto wspomnieć o kilku kluczowych parametrach, które wpłyną na Twoje dane wyjściowe, jeśli pobierzesz i użyjesz powiązanego pliku JSON:

1) Szerokość i wysokość
Im większy Twój obraz, tym dłużej potrwa generowanie, a tym większe ryzyko błędu braku pamięci (OOM).
2) Długość
To jest liczba klatek. Ile sekund to dodaje, zależy od częstotliwości klatek (ustawionej na 30 fps w tym układzie). Możesz przekonwertować sekundy>klatki na podstawie fps w Omnicalculator.
3) Rozmiar partii
Im wyższy ustawisz rozmiar partii, tym szybciej wynik może być, ale tym większe obciążenie pamięci VRAM. Ustawienie go zbyt wysoko może spowodować błąd braku pamięci.
4) Kontrola po generowaniu
To kontroluje losowe nasiono. Opcje dla tego węzła to fixed, increment, decrement i randomize. Jeśli pozostawisz to na fixed i nie zmienisz podpowiedzi, zawsze otrzymasz ten sam obraz. Jeśli zmienisz podpowiedź, obraz zmieni się w ograniczonym stopniu. Ustawienia increment i decrement pozwalają na eksplorację pobliskich wartości nasion, podczas gdy randomize daje całkowicie nową interpretację podpowiedzi.
5) Nazwa LoRA
Będziesz musiał wybrać swoje zainstalowane modele tutaj, zanim spróbujesz wygenerować.
6) Token
Jeśli przeszkoliłeś swój model, aby wyzwolić pojęcie za pomocą tokenu (np. ‘example-person’), umieść ten wyzwalacz w swojej podpowiedzi.
7) Kroki
To reprezentuje liczbę kroków, które system będzie stosował w procesie dyfuzji. Wyższe kroki mogą dać lepsze szczegóły, ale jest limit skuteczności tego podejścia, a ten próg może być trudny do znalezienia. Typowy zakres kroków wynosi około 20-30.
8) Rozmiar płytek
To definiuje, jak dużo informacji jest obsługiwanych jednocześnie podczas generowania. Domyślnie jest ustawiony na 256. Zwiększenie go może przyspieszyć generowanie, ale zwiększenie go zbyt wysoko może prowadzić do szczególnie frustrującego błędu braku pamięci, ponieważ pojawia się on na końcu długiego procesu.
9) Nachodzenie czasowe
Generowanie Hunyuan Video osób może prowadzić do ‘zjawiska ghostingu’ lub nieprzekonywającego ruchu, jeśli jest to ustawione zbyt nisko. Ogólnie rzecz biorąc, obecna mądrość jest taka, że powinno to być ustawione na wyższą wartość niż liczba klatek, aby wyprodukować lepszy ruch.
PODSUMOWANIE
Chociaż dalsze eksplorowanie użycia ComfyUI wykracza poza zakres tego artykułu, doświadczenie społeczne na Reddit i Discord może ułatwić naukę, a istnieją również kilka online przewodników, które wprowadzają w podstawy.
Pierwotnie opublikowany w czwartek, 23 stycznia 2025












