Unghiul lui Anderson

Cum să antrenați și să utilizați modelele LoRA Hunyuan Video

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-4o: Variation on 'Create me an image 1792 x 1024. It should be in the style of Théodore Géricault, and should depict a dark medieval figure seated in front of a laptop, illuminated by the screen. We are facing the figure, and can only see the back of the laptop lid. Around the seated medieval figure are many other medieval men and women, curious as to what is happening on the computer screen'

Acest articol vă va arăta cum să instalați și să utilizați software-ul bazat pe Windows care poate antrena modele LoRA Hunyuan video, permițând utilizatorului să genereze personalități personalizate în modelul de bază Hunyuan Video:

Faceți clic pentru a juca. Exemple din explozia recentă a celebrilor Hunyuan LoRAs din comunitatea civit.ai.

În acest moment, cele două moduri principale de generare a modelelor LoRA Hunyuan local sunt:

1) Framework-ul diffusion-pipe-ui bazat pe Docker, care se bazează pe Subsistemul Windows pentru Linux (WSL) pentru a gestiona unele procese.

2) Musubi Tuner, o nouă adăugare la arhitectura de antrenare a difuziei Kohya ss. Musubi Tuner nu necesită Docker și nu depinde de WSL sau de proxy-uri Linux – dar poate fi dificil de instalat pe Windows.

Prin urmare, acest tutorial se va concentra pe Musubi Tuner și pe furnizarea unei soluții complet locale pentru antrenarea și generarea LoRA Hunyuan, fără utilizarea de site-uri web conduse de API sau procese de închiriere de GPU comerciale, cum ar fi Runpod.

Faceți clic pentru a juca. Mostre din antrenarea LoRA pe Musubi Tuner pentru acest articol. Toate permisiunile au fost acordate de persoana din imagine, pentru ilustrarea acestui articol.

CERINȚE

Instalarea va necesita minim un PC cu Windows 10 cu o placă grafică NVIDIA din seria 30+/40+ care are cel puțin 12 GB de VRAM (deși 16 GB este recomandat). Instalarea utilizată pentru acest articol a fost testată pe un sistem cu 64 GB de RAM de sistem și o placă grafică NVIDIA 3090 cu 24 GB de VRAM. A fost testat pe un sistem de test dedicat, utilizând o instalare proaspătă a Windows 10 Professional, pe o partiție cu peste 600 GB de spațiu de disc disponibil.

AVERTISMENT

Instalarea Musubi Tuner și a componentelor sale implică, de asemenea, instalarea de software și pachete orientate către dezvoltatori direct pe instalarea principală a Windows a unui PC. Luând în considerare instalarea ComfyUI în etapele finale, acest proiect va necesita aproximativ 400-500 de gigabiți de spațiu de disc. Deși am testat procedura fără incidente de mai multe ori în medii de testare Windows 10 proaspăt instalate, nici eu, nici unite.ai nu suntem răspunzători pentru orice daune aduse sistemelor prin urmarea acestor instrucțiuni. Vă recomand să faceți o copie de siguranță a oricăror date importante înainte de a încerca această procedură de instalare.

CONSIDERAȚII

Este încă valabilă această metodă?

Scena de inteligență artificială generativă se mișcă foarte repede, și putem aștepta metode mai bune și mai eficiente de cadre LoRA Hunyuan Video în acest an.

…sau chiar în această săptămână! În timp ce scriam acest articol, dezvoltatorul Kohya/Musubi a produs musubi-tuner-gui, o interfață grafică Gradio sofisticată pentru Musubi Tuner:

Este evident că o interfață grafică cu utilizator este preferabilă fișierelor BAT pe care le utilizez în acest articol – odată ce musubi-tuner-gui este funcțional. În timp ce scriam, a fost lansat acum cinci zile, și nu am găsit niciun raport despre cineva care a reușit să o utilizeze.

Conform postărilor din depozit, noul GUI este destinat să fie integrat direct în proiectul Musubi Tuner cât mai curând posibil, ceea ce va încheia existența sa ca depozit GitHub separat.

Pe baza instrucțiunilor de instalare actuale, noul GUI este clonat direct în mediul virtual Musubi; și, în ciuda numeroaselor eforturi, nu reușesc să îl asociez cu instalarea Musubi existentă. Acest lucru înseamnă că atunci când rulează, va constata că nu are niciun motor!

Odată ce GUI-ul este integrat în Musubi Tuner, astfel de probleme vor fi, fără îndoială, rezolvate. Deși autorul admite că noul proiect este “foarte brut”, el este optimist cu privire la dezvoltarea și integrarea sa directă în Musubi Tuner.

Având în vedere aceste probleme (și cele referitoare la căile implicite la momentul instalării și utilizarea pachetului Python UV, care complică anumite proceduri în această lansare), probabil că va trebui să așteptăm puțin pentru o experiență de antrenare LoRA Hunyuan Video mai bună. Cu toate acestea, pare foarte promițător!

Dacă nu puteți aștepta și sunteți dispuși să vă străduiți un pic, puteți face ca antrenarea video LoRA Hunyuan să ruleze local chiar acum.

Haidem să începem.

DE CE SĂ INSTALAȚI CEVA PE HARDWARE GOL?

(Săriți acest paragraf dacă sunteți un utilizator avansat)
Utilizatorii avansați se vor întreba de ce am ales să instalez atât de mult software pe instalarea de bază a Windows 10, în loc de a-l instala într-un mediu virtual. Motivul este că portul Windows al pachetului bazat pe Linux Triton este mult mai dificil de instalat într-un mediu virtual. Toate celelalte instalări de hardware gol din tutorialul de față nu ar fi putut fi instalate într-un mediu virtual, deoarece trebuie să interacționeze direct cu hardware-ul local.

INSTALAREA PACHETELOR ȘI PROGRAMELOR PRERECHIZITE

Pentru programele și pachetele care trebuie instalate inițial, ordinea de instalare contează. Haidem să începem.

1: DESCĂRCAREA MICROSOFT REDISTRIBUTABLE

Descărcați și instalați pachetul Microsoft Redistributable de la https://aka.ms/vs/17/release/vc_redist.x64.exe.

Aceasta este o instalare rapidă și simplă.

2: INSTALAREA VISUAL STUDIO 2022

Descărcați ediția Community a Microsoft Visual Studio 2022 de la https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta

Începeți installerul descărcat:

Nu avem nevoie de toate pachetele disponibile, ceea ce ar fi o instalare lungă și grea. La pagina inițială Workloads care se deschide, bifați Desktop Development with C++ (a se vedea imaginea de mai jos).

Apoi, faceți clic pe fila Individual Components din partea stângă superioară a interfeței și utilizați caseta de căutare pentru a găsi ‘Windows SDK’.

Prin definiție, doar Windows 11 SDK este bifat. Dacă sunteți pe Windows 10 (această procedură de instalare nu a fost testată de mine pe Windows 11), bifați cea mai recentă versiune Windows 10, indicată în imaginea de mai sus.

Căutați ‘C++ CMake’ și verificați dacă C++ CMake tools for Windows este bifat.

Această instalare va ocupa cel puțin 13 GB de spațiu.

Odată ce Visual Studio a fost instalat, va încerca să ruleze pe computerul dvs. Lăsați-l să se deschidă pe deplin. Când interfața cu ecran complet a Visual Studio este în cele din urmă vizibilă, închideți programul.

3: INSTALAREA VISUAL STUDIO 2019

Unele dintre pachetele ulterioare pentru Musubi așteaptă o versiune mai veche a Microsoft Visual Studio, în timp ce altele necesită o versiune mai recentă.

Prin urmare, descărcați, de asemenea, ediția gratuită Community a Visual Studio 19, fie de la Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – cont necesar) sau Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).

Instalați-l cu aceleași opțiuni ca și pentru Visual Studio 2022 (a se vedea procedura de mai sus, cu excepția faptului că Windows SDK este deja bifat în installerul Visual Studio 2019).

Veți vedea că installerul Visual Studio 2019 este deja conștient de versiunea mai nouă în timp ce o instalează:

Când instalarea este completă și ați deschis și închis aplicația Visual Studio 2019 instalată, deschideți o fereastră de comandă Windows (tastați CMD în caseta de căutare Start) și tastați și introduceți:

where cl

Rezultatul ar trebui să fie locațiile cunoscute ale celor două ediții Visual Studio instalate.

Dacă, în schimb, primiți INFO: Could not find files for the given pattern(s), consultați secțiunea Verificați căile din acest articol mai jos și utilizați acele instrucțiuni pentru a adăuga căile Visual Studio relevante la mediul Windows.

Salvați orice modificări efectuate conform secțiunii Verificați căile de mai jos, și apoi încercați din nou comanda where cl.

4: INSTALAREA CUDA 11 + 12 TOOLKIT

Diversele pachete instalate în Musubi necesită versiuni diferite de NVIDIA CUDA, care accelerează și optimizează antrenamentul pe plăci grafice NVIDIA.

Motivul pentru care am instalat versiunile Visual Studio înainte este că installerii NVIDIA CUDA caută și se integrează cu orice instalări Visual Studio existente.

Descărcați un pachet de instalare a kit-ului de dezvoltare CUDA 11+ de la:

https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (descărcați ‘exe (local)’)

Descărcați un pachet de instalare a kit-ului de dezvoltare CUDA 12+ de la:

https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64

Procesul de instalare este identic pentru ambele instalatori. Ignorați orice avertizări despre existența sau inexistența căilor de instalare în variabilele de mediu Windows – le vom rezolva manual mai târziu.

INSTALAREA NVIDIA CUDA TOOLKIT V11+

Începeți installerul pentru kitul de dezvoltare CUDA 11+.

La Opțiuni de instalare, alegeți Custom (Advanced) și continuați.

Debifați opțiunea NVIDIA GeForce Experience și faceți clic pe Next.

Lăsați Selectați locația de instalare la valorile implicite (acest lucru este important):

Faceți clic pe Next și lăsați instalarea să se încheie.

Ignorați orice avertizări sau note pe care installerul le dă despre Nsight Visual Studio integrare, care nu este necesară pentru cazul nostru.

INSTALAREA NVIDIA CUDA TOOLKIT V12+

Repetați întregul proces pentru installerul separat al kit-ului de dezvoltare NVIDIA 12+ pe care l-ați descărcat:

Procesul de instalare pentru această versiune este identic cu cel descris mai sus (versiunea 11+), cu excepția unei avertizări despre variabilele de mediu, pe care o puteți ignora:

Când instalarea versiunii 12+ CUDA este finalizată, deschideți o fereastră de comandă Windows și tastați și introduceți:

nvcc --version

Acest lucru ar trebui să confirme informații despre versiunea driverului instalat:

Pentru a verifica dacă placa dvs. este recunoscută, tastați și introduceți:

nvidia-smi

5: INSTALAREA GIT

GIT va gestiona instalarea depozitului Musubi pe mașina dvs. locală. Descărcați installerul GIT de la:

https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Rulați installerul:

Utilizați setări implicite pentru Selectați componente:

Lăsați editorul implicit la Vim:

Lăsați GIT să decidă despre numele ramurilor:

Utilizați setări recomandate pentru Cale Mediul:

Utilizați setări recomandate pentru SSH:

Utilizați setări recomandate pentru Transport HTTPS:

Utilizați setări recomandate pentru conversia sfârșiturilor de linie:

Alegeți consola Windows implicită ca emulator de terminal:

Utilizați setări implicite (Fast-forward sau merge) pentru Git Pull:

Utilizați Git-Credential Manager (setarea implicită) pentru Helper de credențiale:

În Configurarea opțiunilor suplimentare, lăsați bifat Activarea cache-ului de sistem de fișiere și debifați Activarea legăturilor simbolice (cu excepția cazului în care sunteți un utilizator avansat care utilizați legături dure pentru un depozit de modele centralizat).

Finalizați instalarea și testați dacă GIT este instalat corect prin deschiderea unei ferestre de comandă CMD și tastând și introducând:

git --version

CONECTAREA LA GITHUB

Mai târziu, atunci când veți încerca să clonați depozite GitHub, vă puteți confrunta cu o solicitare pentru credențialele dvs. GitHub. Pentru a anticipa acest lucru, conectați-vă la contul dvs. GitHub (creați unul, dacă este necesar) pe orice browser instalat pe sistemul dvs. Windows. În acest fel, metoda de autentificare 0Auth (o fereastră pop-up) ar trebui să dureze cât mai puțin timp posibil.

După această provocare inițială, ar trebui să rămâneți autentificați în mod automat.

6: INSTALAREA CMAKE

CMake 3.21 sau o versiune mai recentă este necesar pentru părți ale procesului de instalare Musubi. CMake este o arhitectură de dezvoltare cross-platform capabilă să orchestreze diverse compilatoare și să compileze software din cod sursă.

Descărcați-l de la:

https://cmake.org/download/ (‘Windows x64 Installer’)

Lansați installerul:

Asigurați-vă că Adăugați Cmake la variabila de mediu PATH este bifată.

Faceți clic pe Next.

Tastați și introduceți această comandă într-o fereastră de comandă Windows:

cmake --version

Dacă CMake s-a instalat cu succes, ar trebui să afișeze ceva de genul:

cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: INSTALAREA PYTHON 3.10

Interpreteorul Python este esențial pentru acest proiect. Descărcați versiunea 3.10 (cea mai bună compromis între diversele cerințe ale pachetelor Musubi) de la:

https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)

Rulați installerul descărcat și lăsați setările la valorile implicite:

La sfârșitul procesului de instalare, faceți clic pe Dezactivați limita lungimii căii (necesită confirmare de administrator UAC):

Într-o fereastră de comandă Windows, tastați și introduceți:

python --version

Acest lucru ar trebui să rezulte în Python 3.10.0

VERIFICAȚI CĂILE

Clonarea și instalarea cadrului Musubi, precum și funcționarea sa normală după instalare, necesită ca componentele sale să cunoască calea către diverse componente externe importante în Windows, în special CUDA.

Prin urmare, trebuie să deschidem mediul și să verificăm dacă toate cerințele sunt acolo.

O modalitate rapidă de a ajunge la controalele pentru variabilele de mediu ale sistemului Windows este de a tasta Editează variabilele de mediu ale sistemului în bara de căutare Windows.

Prin clic pe aceasta, se va deschide panoul de control Proprietăți ale sistemului. În partea dreapta inferioară a Proprietăților sistemului, faceți clic pe butonul Variabile de mediu, și se va deschide o fereastră numită Variabile de mediu. În panoul Variabile de sistem din partea inferioară a acestei ferestre, derulați până la Cale și faceți dublu clic pe ea. Acest lucru va deschide o fereastră numită Editează variabile de mediu. Trageți lățimea acestei ferestre mai larg, astfel încât să puteți vedea calea completă a variabilelor:

Aici, intrările importante sunt:

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin

În majoritatea cazurilor, variabilele de cale corecte ar trebui să fie deja prezente.

Adăugați orice căi lipsă prin clic pe Nou în partea stângă a ferestrei Editează variabile de mediu și lipirea căii corecte:

NU copiați și lipiți direct din căile enumerate mai sus; verificați dacă fiecare cale echivalentă există în propria dvs. instalare Windows.

Dacă există variații minore ale căilor (în special cu instalări Visual Studio), utilizați căile de mai sus pentru a găsi folderele țintă corecte (de exemplu, x64 în Host64 în instalarea dvs.). Apoi lipiți acele căi în fereastra Editează variabila de mediu.

După aceea, reporniți computerul.

INSTALAREA MUSUBI

Actualizați PIP

Utilizarea celei mai recente versiuni a installerului PIP poate simplifica unele etape de instalare. Într-o fereastră de comandă Windows cu privilegii de administrator (a se vedea Ridicarea mai jos), tastați și introduceți:

pip install --upgrade pip

RIDICAREA

Unele comenzi pot necesita privilegii ridicate (adică, să fie rulate ca administrator). Dacă primiți mesaje de eroare despre permisiuni în etapele următoare, închideți fereastra de comandă și redeschide-o în modul administrator, tastând CMD în caseta de căutare Windows, făcând clic dreapta pe Command Prompt și selectând Rulați ca administrator:

Pentru etapele următoare, vom utiliza Windows Powershell în loc de fereastra de comandă Windows. Puteți găsi acest lucru tastând Powershell în caseta de căutare Windows și (după cum este necesar) făcând clic dreapta pe el pentru a Rulați ca administrator:

INSTALAREA TORCH

În Powershell, tastați și introduceți:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

Fiți răbdători în timp ce se instalează multe pachete.

Când este finalizat, puteți verifica o instalare PyTorch cu GPU prin tastarea și introducerea:

python -c "import torch; print(torch.cuda.is_available())"

Acest lucru ar trebui să rezulte în:

C:\WINDOWS\system32>python -c "import torch;
print(torch.cuda.is_available())"
True

INSTALAREA TRITON PENTRU WINDOWS

Următoarea etapă este instalarea componentei Triton pentru Windows. În Powershell cu privilegii ridicate, introduceți (pe o singură linie):

pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl

(Installerul triton-3.1.0-cp310-cp310-win_amd64.whl funcționează atât pentru procesoare Intel, cât și pentru AMD, cu condiția ca arhitectura să fie 64 de biți și mediul să corespundă versiunii Python)

După rulare, acest lucru ar trebui să rezulte în:

Successfully installed triton-3.1.0

Putem verifica dacă Triton funcționează importându-l în Python. Introduceți această comandă:

python -c "import triton; print('Triton is working')"

Acest lucru ar trebui să afișeze:

Triton is working

Pentru a verifica dacă Triton este activat cu GPU, introduceți:

python -c "import torch; print(torch.cuda.is_available())"

Acest lucru ar trebui să rezulte în True:

CREAȚI MEDIUL VIRTUAL PENTRU MUSUBI

De acum înainte, vom instala orice software suplimentar într-un mediu virtual Python (sau venv). Acest lucru înseamnă că tot ce veți trebui să faceți pentru a deinstala toate software-urile ulterioare este să trageți folderul venv în coșul de gunoi.

Haidem să creăm folderul de instalare:

Faceți un folder numit Musubi pe desktop. Exemplele de mai jos presupun că acest folder există: C:\Users\[Numele dvs. de profil]\Desktop\Musubi\.

În Powershell, navigați la acel folder prin introducerea:

cd C:\Users\[Numele dvs. de profil]\Desktop\Musubi

Vrem ca mediul virtual să aibă acces la ceea ce am instalat deja (în special Triton), așa că vom utiliza steagul --system-site-packages. Introduceți:

python -m venv --system-site-packages musubi

Așteptați ca mediul să fie creat, și apoi activați-l prin introducerea:

.\musubi\Scripts\activate

De la acest punct, puteți spune că sunteți în mediul virtual activat prin faptul că (musubi) apare la începutul tuturor prompturilor dvs.

CLONAȚI DEPOZITUL

Navigați la folderul musubi nou creat (care este în folderul Musubi de pe desktop):

cd musubi

Acum că suntem în locul potrivit, introduceți următoarea comandă:

git clone https://github.com/kohya-ss/musubi-tuner.git

Așteptați ca clonarea să se finalizeze (nu va dura mult).

INSTALAREA CERINȚELOR

Navigați la folderul de instalare:

cd musubi-tuner

Introduceți:

pip install -r requirements.txt

Așteptați ca multe instalări să se finalizeze (acest lucru va dura ceva timp).

Automatizați accesul la Hunyuan Video Venv

Pentru a activa și accesa cu ușurință mediul virtual pentru sesiuni viitoare, lipiți următorul text în Notepad și salvați-l cu numele activate.bat, salvându-l cu opțiunea Toate fișierele (a se vedea imaginea de mai jos).

@echo off

call C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\Scripts\activate

cd C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner

cmd

(Înlocuiți [Numele dvs. de profil] cu numele real al profilului dvs. Windows)

Nu are importanță în ce locație salvați acest fișier.

De acum înainte, puteți face dublu clic pe activate.bat și începeți să lucrați imediat.

UTILIZAREA MUSUBI TUNER

DESCĂRCAREA MODELELOR

Procesul de antrenare LoRA Hunyuan Video necesită descărcarea a cel puțin șapte modele pentru a susține toate opțiunile de optimizare posibile pentru precaching și antrenarea unui LoRA Hunyuan video. Împreună, aceste modele cântăresc mai mult de 60 GB.

Instrucțiunile curente pentru descărcarea lor pot fi găsite la https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download

Cu toate acestea, acestea sunt instrucțiunile de descărcare la momentul scrierii:

clip_l.safetensors, llava_llama3_fp16.safetensors și llava_llama3_fp8_scaled.safetensors pot fi descărcate de la https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders

mp_rank_00_model_states.pt, mp_rank_00_model_states_fp8.pt și mp_rank_00_model_states_fp8_map.pt pot fi descărcate de la https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers

pytorch_model.pt poate fi descărcat de la https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae

Deși le puteți plasa în orice director doriți, pentru a păstra consistența cu scripting-ul ulterioară, să le păstrăm în:

C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\

Acest lucru este consecvent cu aranjamentul de foldere până în acest punct. Nu uitați să înlocuiți [Numele dvs. de profil] cu numele real al folderului dvs. de profil Windows.

PREGĂTIREA SETULUI DE DATE

Ignorând controversele din comunitate pe acest punct, este corect să spunem că veți avea nevoie de undeva între 10-100 de fotografii pentru un set de date de antrenament pentru LoRA dvs. Hunyuan. Rezultate foarte bune pot fi obținute chiar și cu 15 imagini, atâta timp cât imaginile sunt bine echilibrate și de calitate.

Un LoRA Hunyuan poate fi antrenat atât pe imagini, cât și pe clipuri video scurte și de rezoluție joasă, sau chiar pe ambele – deși utilizarea clipurilor video ca date de antrenament este o provocare, chiar și pentru o placă grafică de 24 GB.

Exemple ar include Roger Rabbit, un xenomorf, The Mask, Spider-Man sau alte personalități care posedă mișcări unice caracteristice.

Deoarece Hunyuan Video știe deja cum se mișcă oamenii obișnuiți, clipurile video nu sunt necesare pentru a obține un LoRA Hunyuan video uman tipic. Prin urmare, vom utiliza imagini statice.

PREGĂTIREA IMAGINILOR

LISTA DE ÎMPĂRȚIRE

Versiunea TLDR:

Cel mai bine este să utilizați imagini care au toate aceeași dimensiune pentru setul dvs. de date, sau să utilizați o împărțire 50/50 între două dimensiuni diferite, de exemplu, 10 imagini care sunt 512x768px și 10 care sunt 768x512px.

Antrenamentul poate merge bine chiar și dacă nu faceți acest lucru – LoRAs Hunyuan Video pot fi surprinzător de iertători.

Versiunea mai lungă

La fel ca și LoRAs Kohya-ss pentru sisteme generative statice, cum ar fi Stable Diffusion, împărțirea este utilizată pentru a distribui sarcina de lucru pe imagini de diferite dimensiuni, permițând utilizarea de imagini mai mari fără a cauza erori de lipsă de memorie la momentul antrenamentului (adică, împărțirea “taie” imaginile în bucăți pe care GPU-le le pot gestiona, menținând în același timp integritatea semantică a întregii imagini).

Pentru fiecare dimensiune de imagine pe care o includeți în setul dvs. de date de antrenament (de exemplu, 512x768px), se va crea o “împărțire” sau “sub-însărcinare” pentru acea dimensiune. Așa că, dacă aveți următoarea distribuție de imagini:

2x 512x768px imagini
7x 768x512px imagini
1x 1000x600px imagine
3x 400x800px imagini

Putem vedea că atenția împărțirii este împărțită inegal între aceste imagini:

Prin urmare, fie rămâneți la o singură format de dimensiune, fie încercați să păstrați distribuția diferitelor dimensiuni relativ egală.

În orice caz, evitați imagini foarte mari, deoarece acest lucru este probabil să încetinească antrenamentul, fără un beneficiu semnificativ.

Pentru simplitate, am utilizat 512x768px pentru toate fotografiile din setul meu de date.

Declarație: Modelul (persoana) utilizat în setul de date mi-a dat permisiunea deplină să utilizez aceste imagini în acest scop și a aprobat toate ieșirile AI care îi reprezintă imaginea, prezentate în acest articol.

Setul meu de date conține 40 de imagini, în format PNG (deși JPG este, de asemenea, în regulă). Imaginile mele au fost stocate la C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman

Trebuie să creați un folder cache în interiorul folderului de imagini de antrenament:

Acum, haidem să creăm un fișier special care va configura antrenamentul.

FIIȘIERE TOML

Procesele de antrenament și precaching ale LoRAs Hunyuan Video obțin căile de fișiere dintr-un fișier text plat cu extensia .toml.

Pentru testul meu, fișierul TOML este situat la C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml

Conținutul fișierului meu TOML de antrenament arată astfel:

[general]

resolution = [512, 768]

caption_extension = ".txt"

batch_size = 1

enable_bucket = true

bucket_no_upscale = false

[[datasets]]

image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"

cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"

num_repeats = 1

(Bara oblică dublă pentru directoarele de imagini și cache nu este întotdeauna necesară, dar poate ajuta la evitarea erorilor în cazul în care există un spațiu în calea de acces. Am antrenat modele cu fișiere.toml care au utilizat bara oblică înainte și bara oblică înapoi)

Putem vedea în secțiunea resolution că două dimensiuni vor fi luate în considerare – 512px și 768px. De asemenea, puteți lăsa aceasta la 512 și totuși obține rezultate bune.

CAPTIONĂRI

Hunyuan Video este un model de text+vizualizare, deci avem nevoie de descrieri pentru aceste imagini, care vor fi luate în considerare în timpul antrenamentului. Procesul de antrenament va eșua fără captionări.

Există o mulțime de sisteme de captionare deschise pe care le-am putea utiliza pentru această sarcină, dar haidem să o ținem simplă și să utilizăm sistemul taggui. Deși este stocat pe GitHub și deși descarcă unele modele de învățare profundă foarte grele la prima rulare, vine sub forma unui executabil Windows simplu care încarcă biblioteci Python și o interfață grafică ușor de utilizat.

După ce ați început Taggui, utilizați Fișier > Încărcați director pentru a naviga la setul dvs. de date de imagini și, opțional, puneți un identificator de token (în acest caz, examplewoman) care va fi adăugat la toate captionările:

(Asigurați-vă că ați oprit Încărcați în 4 biți atunci când Taggui se deschide pentru prima dată – va arunca erori în timpul captionării dacă această opțiune este lăsată activată)

Selectați o imagine în coloana de previzualizare din stânga și apăsați CTRL+A pentru a selecta toate imaginile. Apoi, faceți clic pe butonul Începeți auto-captionarea din partea dreaptă:

Veți vedea Taggui descărcând modele în coloana CLI mică din partea dreaptă, dar numai dacă este prima dată când ați rulat captionatorul. În caz contrar, veți vedea o previzualizare a captionărilor.

Acum, fiecare fotografie are un fișier.txt corespunzător cu o descriere a conținutului său de imagine:

Puteți face clic pe Opțiuni avansate în Taggui pentru a crește lungimea și stilul captionărilor, dar acest lucru este dincolo de scopul acestui tutorial.

Închideți Taggui și haidem să trecem la…

PRECACHING LATENT

Pentru a evita o încărcare excesivă a GPU la momentul antrenamentului, este necesar să creați două tipuri de fișiere precache – unul pentru a reprezenta imaginea latentă derivată din imaginile însele și altul pentru a evalua o codificare de text legată de conținutul captionării.

Pentru a simplifica toate cele trei procese (2x cache + antrenament), puteți utiliza fișiere.BAT interactive care vă vor cere întrebări și vor efectua procesele atunci când veți furniza informațiile necesare.

Pentru precachingul latent, copiați următorul text în Notepad și salvați-l ca un fișier.BAT (de exemplu, numiți-l latent-precache.bat), așa cum am făcut mai devreme, asigurându-vă că tipul de fișier din meniul derulant din fereastra Salvați ca este Toate fișierele (a se vedea imaginea de mai jos):

@echo off

REM Activarea mediului virtual

call C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Obțineți intrarea utilizatorului

set /p IMAGE_PATH=Introduceți calea către directorul de imagini:

set /p CACHE_PATH=Introduceți calea către directorul de cache:

set /p TOML_PATH=Introduceți calea către fișierul TOML:

echo Ați introdus:

echo Calea imaginii: %IMAGE_PATH%

echo Calea cache-ului: %CACHE_PATH%

echo Calea fișierului TOML: %TOML_PATH%

set /p CONFIRM=Doriți să continuați cu precachingul latent (y/n)?

if /i "%CONFIRM%"=="y" (

REM Rulați scriptul de precaching latent

python C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling

) else (

echo Operațiunea a fost anulată.

)

REM Păstrați fereastra deschisă

pause

(Asigurați-vă că înlocuiți [Numele dvs. de profil] cu numele real al folderului dvs. de profil Windows)

Acum puteți rula fișierul.BAT pentru precachingul latent automat:

Când fișierul.BAT vă solicită diverse întrebări, lipiți sau tastați calea către setul dvs. de date, folderele de cache și fișierul TOML.

PRECACHING TEXT

Vom crea un al doilea fișier.BAT, de data aceasta pentru precachingul textului.

@echo off

REM Activarea mediului virtual

call C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Obțineți intrarea utilizatorului

set /p IMAGE_PATH=Introduceți calea către directorul de imagini:

set /p CACHE_PATH=Introduceți calea către directorul de cache:

set /p TOML_PATH=Introduceți calea către fișierul TOML:

echo Ați introdus:

echo Calea imaginii: %IMAGE_PATH%

echo Calea cache-ului: %CACHE_PATH%

echo Calea fișierului TOML: %TOML_PATH%

set /p CONFIRM=Doriți să continuați cu precachingul ieșirii codificatorului de text (y/n)?

if /i "%CONFIRM%"=="y" (

REM Utilizați executabilul python din mediul virtual

python C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16

) else (

echo Operațiunea a fost anulată.

)

REM Păstrați fereastra deschisă

pause

Înlocuiți numele dvs. de profil Windows și salvați acest fișier ca text-cache.bat (sau orice nume doriți), în orice locație convenabilă, așa cum am procedat pentru fișierul.BAT anterior.

Rulați acest nou fișier.BAT, urmați instrucțiunile și fișierele text codificate necesare vor apărea în folderul cache:

ANTRENAREA MODELULUI HUNYUAN VIDEO LORA

Antrenarea propriu-zisă a LoRA va dura considerabil mai mult decât aceste două procese pregătitoare.

Deși există, de asemenea, multe variabile pe care le-am putea îngrijora (cum ar fi dimensiunea lotului, repetiții, epoci și dacă se utilizează modele complete sau cuantificate, printre altele), le vom salva pentru altă dată și o examinare mai profundă a nuanțelor creării LoRA.

Pentru acum, haidem să minimizăm alegerile un pic și să antrenăm un LoRA pe setări “medii”.

Vom crea un al treilea fișier.BAT, de data aceasta pentru a iniția antrenamentul. Copiați următorul text în Notepad și salvați-l ca un fișier.BAT, așa cum am făcut mai devreme, numindu-l training.bat (sau orice nume doriți):

@echo off

REM Activarea mediului virtual

call C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Obțineți intrarea utilizatorului

set /p DATASET_CONFIG=Introduceți calea către fișierul de configurare a setului de date:

set /p EPOCHS=Introduceți numărul de epoci de antrenat:

set /p OUTPUT_NAME=Introduceți numele de ieșire al modelului (de exemplu, example0001):

set /p LEARNING_RATE=Alegeți rata de învățare (1 pentru 1e-3, 2 pentru 5e-3, implicit 1e-3):

if "%LEARNING_RATE%"=="1" set LR=1e-3

if "%LEARNING_RATE%"=="2" set LR=5e-3

if "%LEARNING_RATE%"=="" set LR=1e-3

set /p SAVE_STEPS=În câte pași să salvați imaginile de previzualizare:

set /p SAMPLE_PROMPTS=Care este locația fișierului de prompturi de text pentru previzualizări de antrenament?

echo Ați introdus:

echo Fișierul de configurare a setului de date: %DATASET_CONFIG%

echo Numărul de epoci: %EPOCHS%

echo Numele de ieșire: %OUTPUT_NAME%

echo Rata de învățare: %LR%

echo Salvați imaginile de previzualizare la fiecare %SAVE_STEPS% pași.

echo Fișierul de prompturi de text: %SAMPLE_PROMPTS%

REM Pregătiți comanda

set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^

C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^

--dit C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^

--dataset_config %DATASET_CONFIG% ^

--sdpa ^

--mixed_precision bf16 ^

--fp8_base ^

--optimizer_type adamw8bit ^

--learning_rate %LR% ^

--gradient_checkpointing ^

--max_data_loader_n_workers 2 ^

--persistent_data_loader_workers ^

--network_module=networks.lora ^

--network_dim=32 ^

--timestep_sampling sigmoid ^

--discrete_flow_shift 1.0 ^

--max_train_epochs %EPOCHS% ^

--save_every_n_epochs=1 ^

--seed 42 ^

--output_dir "C:\Users\[Numele dvs. de profil]\Desktop\Musubi\Output Models" ^

--output_name %OUTPUT_NAME% ^

--vae C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt ^

--vae_chunk_size 32 ^

--vae_spatial_tile_sample_min_size 128 ^

--text_encoder1 C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors ^

--text_encoder2 C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors ^

--sample_prompts %SAMPLE_PROMPTS% ^

--sample_every_n_steps %SAVE_STEPS% ^

--sample_at_first

echo Comanda următoare va fi executată:

echo %CMD%

set /p CONFIRM=Doriți să continuați cu antrenamentul (y/n)?

if /i "%CONFIRM%"=="y" (

%CMD%

) else (

echo Operațiunea a fost anulată.

)

REM Păstrați fereastra deschisă

cmd /k

Așa cum am făcut mai devreme, asigurați-vă că înlocuiți toate instanțele [Numele dvs. de profil] cu numele real al folderului dvs. de profil Windows.

Asigurați-vă că directorul C:\Users\[Numele dvs. de profil]\Desktop\Musubi\Output Models\ există și creați-l la acea locație dacă nu există.

PREVIZUALIZĂRI DE ANTRENAMENT

Există o funcție de previzualizare de antrenament foarte de bază, recent activată pentru Musubi trainer, care vă permite să forțați modelul de antrenament să se oprească și să genereze imagini pe baza unor prompturi pe care le-ați salvat. Acestea sunt salvate într-un folder automat creat numit Sample, în același director în care sunt salvate modelele antrenate.

Pentru a activa această funcție, veți avea nevoie să salvați cel puțin un prompt într-un fișier de text. Fișierul.BAT de antrenament pe care l-am creat vă va cere să introduceți locația acestui fișier; prin urmare, puteți numi fișierul de prompt orice doriți și să-l salvați oriunde.

Iată câteva exemple de prompturi pentru un fișier care va produce trei imagini diferite atunci când este solicitat de rutina de antrenament:

După cum puteți vedea în exemplul de mai sus, puteți pune steaguri la sfârșitul promptului care vor afecta imaginile:

–w este lățime (implicit 256px dacă nu este setat, conform documentației)
–h este înălțime (implicit 256px dacă nu este setat)
–f este numărul de cadre. Dacă este setat la 1, se produce o imagine; mai mult de unul, un videoclip.
–d este sămânța. Dacă nu este setată, este aleatorie; dar ar trebui să o setați pentru a vedea o evoluție a unui prompt.
–s este numărul de pași în generare, implicit 20.

Consultați documentația oficială pentru steaguri suplimentare.

Deși previzualizările de antrenament pot dezvălui rapid unele probleme care v-ar putea face să anulați antrenamentul și să reevaluați datele sau setarea, astfel încât să economisiți timp, rețineți că fiecare prompt suplimentar încetinește antrenamentul puțin mai mult.

De asemenea, cu cât imaginea de previzualizare de antrenament este mai mare (așa cum este setat în steagurile enumerate mai sus), cu atât va încetini antrenamentul.

Lansați fișierul.BAT de antrenament.

Întrebarea #1 este “Introduceți calea către fișierul de configurare a setului de date”. Lipiți sau tastați calea corectă către fișierul dvs. TOML.

Întrebarea #2 este “Introduceți numărul de epoci de antrenat”. Această variabilă este una de încercare și eroare, deoarece este afectată de cantitatea și calitatea imaginilor, precum și de captionări și alte factori. În general, este mai bine să o setați prea mare decât prea mică, deoarece puteți întotdeauna opri antrenamentul cu Ctrl+C în fereastra de antrenament dacă simțiți că modelul a evoluat suficient. Set-o la 100 pentru prima dată și vedeți cum merge.

Întrebarea #3 este “Introduceți numele de ieșire al modelului”. Numiți-vă modelul! Poate fi mai bine să păstrați numele scurt și simplu.

Întrebarea #4 este “Alegeți rata de învățare”, care se setează implicit la 1e-3 (opțiunea 1). Acesta este un punct bun de plecare, în așteptarea unei experiențe ulterioare.

Întrebarea #5 este “În câte pași să salvați imaginile de previzualizare”. Dacă o setați prea mică, veți vedea puțin progres între salvarea imaginilor de previzualizare și acest lucru va încetini antrenamentul.

Întrebarea #6 este “Care este locația fișierului de prompturi de text pentru previzualizări de antrenament?”. Lipiți sau tastați calea către fișierul dvs. de prompturi de text.

Fișierul.BAT apoi vă arată comanda pe care o va trimite modelului Hunyuan și vă întreabă dacă doriți să continuați, y/n.

Mergeți mai departe și începeți antrenamentul:

În timpul acestui proces, dacă verificați secțiunea GPU a tab-ului Performanță din Managerul de sarcini Windows, veți vedea că procesul utilizează aproximativ 16 GB de VRAM.

Acest lucru nu poate fi o cifră arbitrară, deoarece aceasta este cantitatea de VRAM disponibilă pe multe plăci grafice NVIDIA și codul de upstream poate fi optimizat pentru a se potrivi sarcinilor în 16 GB pentru beneficiul celor care dețin astfel de plăci.

Acest lucru spus, este foarte ușor să creșteți această utilizare, trimițând steaguri mai exorbitante comenzii de antrenament.

În timpul antrenamentului, veți vedea în partea dreapta inferioară a ferestrei CMD o cifră pentru timpul care a trecut de la începerea antrenamentului și o estimare a timpului total de antrenament (care va varia puternic în funcție de steaguri setate, numărul de imagini de antrenament, numărul de imagini de previzualizare de antrenament și alți factori).

Un timp de antrenament tipic este de aproximativ 3-4 ore pe setări medii, în funcție de hardware-ul disponibil, numărul de imagini, setări de steaguri și alți factori.

UTILIZAREA MODELULUI DVS. DE ANTRENAT LORA ÎN HUNYUAN VIDEO

ALEGEREA PUNCTELOR DE CONTROL

Când antrenamentul este finalizat, veți avea un punct de control pentru fiecare epocă de antrenament.

Această frecvență de salvare poate fi modificată de utilizator pentru a salva mai des sau mai puțin frecvent, după cum este dorit, prin modificarea numărului --save_every_n_epochs [N] în fișierul.BAT de antrenament. Dacă ați adăugat un număr mic de pași pentru salvare atunci când ați setat antrenamentul cu fișierul.BAT, va exista un număr mare de fișiere de puncte de control salvate.

CARE PUNCT DE CONTROL SĂ ALEGEȚI?

Așa cum s-a menționat mai devreme, primele modele antrenate vor fi mai flexibile, în timp ce punctele de control ulterioare pot oferi mai multe detalii. Singurul mod de a testa aceste factori este de a rula unele dintre LoRAs și de a genera câteva videoclipuri. În acest fel, puteți învăța care puncte de control sunt mai productive și reprezintă cel mai bun echilibru între flexibilitate și fidelitate.

COMFYUI

Cel mai popular (deși nu singurul) mediu pentru utilizarea LoRAs Hunyuan Video, în acest moment, este ComfyUI, un editor bazat pe noduri cu o interfață Gradio elaborată care rulează în browserul dvs. web.

Sursă: https://github.com/comfyanonymous/ComfyUI

Sursă: https://github.com/comfyanonymous/ComfyUI

Instrucțiunile de instalare sunt simple și disponibile în depozitul oficial GitHub (modele suplimentare vor trebui să fie descărcate).

CONVERTIREA MODELELOR PENTRU COMFYUI

Modelele dvs. antrenate sunt salvate într-un format (diffusers) care nu este compatibil cu majoritatea implementărilor ComfyUI. Musubi poate converti un model într-un format compatibil ComfyUI. Să setăm un fișier.BAT pentru a implementa acest lucru.

Înainte de a rula acest fișier.BAT, creați folderul C:\Users\[Numele dvs. de profil]\Desktop\Musubi\CONVERTED\ pe care scriptul îl așteaptă.

@echo off

REM Activarea mediului virtual

call C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\Scripts\activate.bat

:START

REM Obțineți intrarea utilizatorului

set /p INPUT_PATH=Introduceți calea către fișierul Musubi safetensors (sau tastați "exit" pentru a ieși):

REM Ieșiți dacă utilizatorul tastează "exit"

if /i "%INPUT_PATH%"=="exit" goto END

REM Extrage numele fișierului din calea de intrare și adaugă "converted" la acesta

for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF

set OUTPUT_PATH=C:\Users\[Numele dvs. de profil]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors

set TARGET=other

echo Ați introdus:

echo Fișierul de intrare: %INPUT_PATH%

echo Fișierul de ieșire: %OUTPUT_PATH%

echo Formatul țintă: %TARGET%

set /p CONFIRM=Doriți să continuați cu conversia (y/n)?

if /i "%CONFIRM%"=="y" (

REM Rulați scriptul de conversie cu căi corect cotate

python C:\Users\[Numele dvs. de profil]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%

echo Conversia a fost finalizată.

) else (

echo Operațiunea a fost anulată.

)

REM Reveniți la început pentru un alt fișier

goto START

:END

REM Păstrați fereastra deschisă

echo Ieșirea din script.

pause

Așa cum am făcut mai devreme, salvați scriptul ca “Toate fișierele” din Notepad, numindu-l convert.bat (sau orice nume doriți).

Când ați salvat, faceți dublu clic pe noul fișier.BAT, care vă va cere locația unui fișier pentru a-l converti.

Lipiți calea către fișierul pe care doriți să-l convertiți, faceți clic pe y și apăsați Enter.

După ce ați salvat LoRA convertit în folderul CONVERTED, scriptul vă va cere dacă doriți să convertiți un alt fișier. Dacă doriți să testați mai multe puncte de control în ComfyUI, convertiți o selecție de modele.

Când ați convertit suficiente puncte de control, închideți fereastra de comandă.BAT.

Acum puteți copia modelele dvs. convertite în folderul models\loras din instalarea dvs. ComfyUI.

De obicei, locația corectă este ceva de genul:

C:\Users\[Numele dvs. de profil]\Desktop\ComfyUI\models\loras\

CREAREA DE MODELE LORA HUNYUAN ÎN COMFYUI

Deși fluxurile de lucru bazate pe noduri ale ComfyUI par complexe la început, setările altor utilizatori mai experimentați pot fi încărcate prin tragerea unei imagini (creată cu ComfyUI a altui utilizator) direct în fereastra ComfyUI. Fluxurile de lucru pot fi, de asemenea, exportate ca fișiere JSON, care pot fi importate manual sau trase într-o fereastră ComfyUI.

Unele fluxuri de lucru importate pot avea dependențe care nu există în instalarea dvs. Prin urmare, instalați ComfyUI-Manager, care poate prelua module lipsă în mod automat.

Sursă: https://github.com/ltdrdata/ComfyUI-Manager

Sursă: https://github.com/ltdrdata/ComfyUI-Manager

Pentru a încărca una dintre fluxurile de lucru utilizate pentru a genera videoclipuri din modelele din acest tutorial, descărcați acest fișier JSON și trageți-l în fereastra dvs. ComfyUI (deși există exemple de fluxuri de lucru mult mai bune disponibile la diversele comunități Reddit și Discord care au adoptat Hunyuan Video, și al meu este adaptat din una dintre acestea).

Acesta nu este locul pentru un tutorial extins despre utilizarea ComfyUI, dar merită menționat câteva dintre parametrii cheie care vor afecta ieșirea dvs. dacă descărcați și utilizați layout-ul JSON pe care l-am legat mai sus:

1) LĂȚIME ȘI ÎNĂLȚIME

Cu cât imaginea dvs. este mai mare, cu atât mai mult timp va dura generarea și cu atât mai mare este riscul unei erori de lipsă de memorie (OOM).

2) LUNGIME

Acesta este valoarea numerică pentru numărul de cadre. Câte secunde adaugă depind de rata de cadre (setată la 30fps în acest layout). Puteți converti secunde în cadre pe baza fps la Omnicalculator.

3) DIMENSIUNE DE LOT

Cu cât setați dimensiunea lotului mai mare, cu atât mai rapidă va fi rezultatul, dar cu atât mai mare va fi și încărcarea VRAM. Setarea acesteia prea mare poate duce la o eroare OOM.

4) CONTROL DUPĂ GENERARE

Acesta controlează sămânța aleatorie. Opțiunile pentru acest nod sunt fix, increment, decrement și aleatoriu. Dacă îl lăsați la fix și nu modificați promptul de text, veți obține aceeași imagine de fiecare dată. Dacă modificați promptul de text, imaginea se va schimba într-o anumită măsură. Setările increment și decrement vă permit să explorați valori de sămânță apropiate, în timp ce aleatoriu vă oferă o interpretare complet nouă a promptului.

5) NUME DE LORA

Veți trebui să selectați modelul dvs. instalat aici, înainte de a încerca să generați.

6) TOKEN

Dacă ați antrenat modelul dvs. pentru a declanșa conceptul cu un token (de exemplu, ‘example-person’), puneți cuvântul declanșator în promptul dvs.

7) PAȘI

Acesta reprezintă numărul de pași pe care sistemul îi va aplica procesului de difuzie. Pași mai mari pot obține detalii mai bune, dar există un plafon în ceea ce privește eficacitatea acestei abordări, și acest prag poate fi dificil de găsit. Gama comună de pași este de aproximativ 20-30.

8) DIMENSIUNE DE PĂTRAT

Acesta definește câtă informație este gestionată odată în timpul generării. Este setat la 256 implicit. Creșterea acestuia poate accelera generarea, dar creșterea lui prea mult poate duce la o experiență OOM deosebit de frustrantă, deoarece apare la sfârșitul unui proces lung.

9) SUPRAPUNERE TEMPORALĂ

Generarea de videoclipuri Hunyuan Video poate duce la “spectre” sau mișcări neconvingătoare dacă acesta este setat prea mic. În general, înțelepciunea actuală este că acesta ar trebui să fie setat la o valoare mai mare decât numărul de cadre, pentru a produce o mișcare mai bună.

CONCLUZII

Deși explorarea ulterioară a utilizării ComfyUI este dincolo de scopul acestui articol, experiența comunității de pe Reddit și Discord poate facilita curba de învățare, și există câteva ghiduri online care introduc conceptele de bază.

 

Publicat pentru prima dată joi, 23 ianuarie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai