Andersonin kulma
Hunyuan Video LoRA -mallien koulutus ja käyttäminen

Tämä artikkeli opastaa Windows-pohjaisen ohjelmiston asentamisessa ja käytössä, joka voi kouluttaa Hunyuan Video LoRA -malleja, mahdollistaen käyttäjän luoda mukautettuja persoonallisuutta Hunyuan Video -perusmallissa.
Klikkaa toistaa. Esimerkkejä viimeaikaisesta celebri-Hunyuan LoRA -räjähdyksestä civit.ai -yhteisöstä.
Tällä hetkellä kaksi suosituinta tapaa paikallisen Hunyuan LoRA -mallin luomiseen ovat:
1) Diffusion-pipe-ui Docker-pohjainen kehys, joka riippuu Windowsin alijärjestelmästä Linuxille (WSL) joitain prosesseja varten.
2) Musubi Tuner, uusi lisäys suositulle Kohya ss -diffuusiokoulutusarkkitehtuuriin. Musubi Tuner ei vaadi Dockeria eikä riipu WSL:stä tai muista Linux-pohjaisista välittäjistä – mutta se voi olla haasteellista asentaa Windowsiin.
Siksi tämä ohjeistus keskittyy Musubi Tuneriin ja tarjoaa täysin paikallisen ratkaisun Hunyuan LoRA -koulutukseen ja generointiin ilman API-pohjaisia verkkosivustoja tai kaupallisia GPU-vuokrausprosesseja, kuten Runpod.
Klikkaa toistaa. Esimerkkejä LoRA-koulutuksesta Musubi Tunerilla tätä artikkelia varten. Kaikki tarvittavat luvat on saatu henkilöltä, joka on kuvattuna, tätä artikkelia varten.
VAATIMUKSET
Asennus vaatii vähintään Windows 10 -koneen, jossa on 30+/40+ -sarjan NVIDIA -näytönohjain, jolla on vähintään 12 GB VRAM:ia (vaikka 16 GB on suositeltavaa). Asennus, jota käytettiin tähän artikkeliin, testattiin koneella, jossa oli 64 GB järjestelmämuistia ja NVIDIA 3090 -näytönohjain, jossa oli 24 GB VRAM:ia. Se testattiin omistettuun testijärjestelmään, jossa oli tuore asennus Windows 10 Professionalista, jaettuun osioon, jolla oli yli 600 GB vapaata levytilaa.
VAROITUS
Musubi Tunerin ja sen edellytysten asentaminen sisältää myös kehittäjäkeskeisten ohjelmistojen ja pakettien asentamisen suoraan Windowsin pääasennukseen. Ottaen huomioon ComfyUI:n asentamisen lopputiloissa, tämä projekti vaatii noin 400-500 gigatavua levytilaa. Vaikka olen testannut menettelyä useita kertoja ilman vaaroja uusissa testijärjestelmissä, enkä unite.ai ole vastuussa vahingoista, jotka johtuvat näiden ohjeiden seuraamisesta. Suosittelen varmuuskopioimaan tärkeät tiedot ennen asennuksen aloittamista.
HARKINTA
ONKO TÄMÄ MENETELMÄ EDelleen VOIMASSA?
Generatiivisen tekoälyn ala kehittyy erittäin nopeasti, ja voidaan odottaa parempia ja sujuvampia menetelmiä Hunyuan Video LoRA -kehyksille tänä vuonna.
…tai jopa tällä viikolla! Kun kirjoitin tätä artikkelia, Kohya/Musubi-kehittäjä julkaisi musubi-tuner-gui, sophisticated Gradio-käyttöliittymä Musubi Tunerille:

Ilmeisesti käyttöliittymä on mieluummin kuin BAT-tiedostot, joita käytän tässä ominaisuudessa – kun musubi-tuner-gui toimii. Kirjoitan, se julkaistiin viisi päivää sitten, ja en löydä ketään, joka olisi onnistunut käyttämään sitä.
Musubi Tuner -projektin mukaan uusi käyttöliittymä on tarkoitus sisällyttää Musubi Tuneriin mahdollisimman pian, mikä lopettaa sen olemassaolon erillisenä GitHub-arkistona.
Sen mukaan uusi käyttöliittymä voidaan kloonata suoraan olemassa olevaan Musubi-virtuaaliympäristöön; ja vaikka olen yrittänyt useita kertoja, en pysty liittämään sitä olemassa olevaan Musubi-asennukseen. Tämä tarkoittaa, että kun se toimii, se ei löydä moottoria!
Kun käyttöliittymä on integroitu Musubi Tuneriin, tämänkaltaiset ongelmat (kuten oletuspolut asennuksen aikana ja UV Python -paketin käyttö) ratkaistaan varmasti. Vaikka tekijä myöntää, että uusi projekti on ‘really rough’, hän on optimistinen sen kehittämisestä ja integroimisesta suoraan Musubi Tuneriin.
Johtuen näistä ongelmista (mukaan lukien oletuspolut asennuksen aikana ja UV Python -paketin käyttö), joutuu odottamaan vähän sujuvampaa Hunyuan Video LoRA -koulutuskokemusta. Se näyttää kuitenkin lupaavalta!
Mutta jos et voi odottaa, ja olet valmis rullata hihaasi, voit käynnistää Hunyuan Video LoRA -koulutuksen paikallisesti jo nyt.
Aloita.
MIKSI ASENTAISI MITÄÄN BARE METALILLE?
(Ohita tämä kappale, jos et ole edistynyt käyttäjä)
Edistyneet käyttäjät ihmettelevät, miksi olen valinnut asentaa niin paljon ohjelmistoa suoraan Windows 10 -asennukseen ilman virtuaaliympäristöä. Syy on, että Windowsin portti Linux-pohjaisesta Triton-pakettiin on paljon vaikeampi saada toimimaan virtuaaliympäristössä. Kaikki muut bare metal -asennukset tässä opasohjelmassa eivät voisi asentaa virtuaaliympäristöön, koska ne on suunniteltu suoraan paikallisen laitteiston kanssa.
ASENNAKSESI EDellytyspaketteja JA -OHJELMIA
Ohjelmien ja pakettien asennuksessa, jotka on asennettava aluksi, asennusjärjestys on tärkeää. Aloita.
1: LATAA MICROSOFT REDISTRIBUTABLE
Lataa ja asenna Microsoft Redistributable -paketti osoitteesta https://aka.ms/vs/17/release/vc_redist.x64.exe.
Tämä on suoraviivainen ja nopea asennus.

2: ASENNAA VISUAL STUDIO 2022
Lataa Microsoft Visual Studio 2022 Community -versio osoitteesta https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta
Käynnistä ladataksi ladattu asennin:

Emme tarvitse kaikkia saatavilla olevia paketteja, mikä olisi raskas ja pitkä asennus. Alkuvaiheessa avautuvalla Workloads -sivulla valitse Desktop Development with C++ (ks. kuva alla).

Nyt valitse Individual Components -välilehti ylävasemmasta kulmasta ja käytä hakukenttää etsimään ‘Windows SDK’.

Oletuksena vain Windows 11 SDK on valittu. Jos käytät Windows 10:ää (tämä asennusmenettely ei ole testattu minun toimestani Windows 11:llä), valitse uusin Windows 10 -versio, kuten kuvassa yllä.
Hae ‘C++ CMake’ ja varmista, että C++ CMake tools for Windows on valittu.

Tämä asennus vie vähintään 13 GB tilaa.

Kun Visual Studio on asennettu, se yrittää käynnistää sen tietokoneellasi. Anna sen avautua täysin. Kun Visual Studio’n täysikokoinen käyttöliittymä on vihdoin näkyvissä, sulje ohjelma.
3: ASENNAA VISUAL STUDIO 2019
Jotkut myöhemmät paketit Musubiin odottavat vanhempaa Microsoft Visual Studio -versiota, kun taas toiset tarvitsevat uudempaa.
Siksi lataa myös ilmainen Community -versio Visual Studio 19 joko Microsoftilta (https://visualstudio.microsoft.com/vs/older-downloads/ – vaatii tilin) tai Techspotilta (https://www.techspot.com/downloads/7241-visual-studio-2019.html).
Asenna se samoin kuin Visual Studio 2022 (ks. yllä oleva menettely, paitsi että Windows SDK on jo valittu Visual Studio 2019 -asennuksessa).
Näet, että Visual Studio 2019 -asennin on jo tietoinen uudeammasta versiosta, kun se asennetaan:

Kun asennus on valmis ja olet avannut ja sulkenut asennetun Visual Studio 2019 -sovelluksen, avaa Windowsin komentokehote (kirjoita CMD Käynnistä-haun kenttään) ja kirjoita ja suorita:
where cl
Tulos pitäisi olla tunnettu sijainti kahdelle asennetulle Visual Studio -versiolle.

Jos saat sen sijaan INFO: Could not find files for the given pattern(s), katso Check Path -osio tästä artikkelista ja käytä niitä ohjeita lisätäksesi tarvittavat Visual Studio -polut Windowsin ympäristöön.
Tallenna kaikki muutokset, jotka on tehty Check Paths -osiossa, ja yritä where cl -komentoa uudelleen.
4: ASENNAA CUDA 11 + 12 -TYÖKALUPAKETIT
Eri paketit, jotka asennetaan Musubiin, tarvitsevat eri versioita NVIDIA CUDA:a, joka kiihdyttää ja optimoi koulutusta NVIDIA -näytönohjaimilla.
Syy, miksi asensimme Visual Studio -versiot ensin, on, että NVIDIA CUDA -asennuspaketteja etsivät ja integroivat kaikki olemassa olevat Visual Studio -asennukset.
Lataa 11+ -sarjan CUDA-asennuspaketti osoitteesta:
https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (lataa ‘exe (local)’ )
Lataa 12+ -sarjan CUDA-työkalupaketti osoitteesta:
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
Asennusprosessi on identtinen molemmille asennuksille. Ohita kaikki varoitukset, jotka liittyvät olemassa oleviin asennuspolkuihin Windowsin ympäristössä – me huolehdimme siitä manuaalisesti myöhemmin.
ASENNAA NVIDIA CUDA -TYÖKALUPAKETTI V11+
Käynnistä 11+ -sarjan CUDA-työkalupaketti.


Kohdassa Asennusvaihtoehdot valitse Custom (Advanced) ja jatka.

Poista valinta NVIDIA GeForce Experience -vaihtoehdosta ja valitse Seuraava.

Jätä Valitse asennussijainti oletusarvoihin (tämä on tärkeää):

Valitse Seuraava ja anna asennuksen valmistua.

Ohita kaikki varoitukset tai huomautukset, jotka asennin antaa Nsight Visual Studio -integroinnista, jota ei tarvita tässä tapauksessa.
ASENNAA NVIDIA CUDA -TYÖKALUPAKETTI V12+
Toista koko prosessi erillisen 12+ -NVIDIA-työkalupaketin lataamiseksi, jonka latait:

Asennusprosessi on identtinen edelliselle versiolle (11+), paitsi yksi varoitus, joka liittyy ympäristöpolkuihin, jonka voit ohittaa:

Kun 12+ -CUDA-versio on asennettu, avaa Windowsin komentokehote ja kirjoita ja suorita:
nvcc --version
Tämä pitäisi vahvistaa tiedot asennetusta ajuriversiosta:

Tarkista, että kortti on tunnistettu, kirjoita ja suorita:
nvidia-smi

5: ASENNAA GIT
GIT vastaa Musubi-repositorion asentamisesta paikallisesti. Lataa GIT-asennin osoitteesta:
https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Suorita asennin:

Käytä oletusarvoja Valitse komponentit -välilehdellä:

Jätä oletusarvo Vim -muokkaimelle:

Anna GIT päättää haara-nimistä:

Käytä suositeltuja asetuksia Polku -ympäristössä:

Käytä suositeltuja asetuksia SSH:lle:

Käytä suositeltuja asetuksia HTTPS Transport backend -välilehdellä:

Käytä suositeltuja asetuksia rivin päättymisen muunnoksille:

Valitse Windowsin oletusarvoinen konsoli terminaali-emulaattoriksi:

Käytä oletusarvoa (Fast-forward or merge) Git Pull -välilehdellä:

Käytä Git-Credential Manageria (oletusarvo) tunnistevälittäjänä:

Lisäksi Configuring extra options -välilehdellä jätä Enable file system caching valittuna ja Enable symbolic links valitsematta (ellei ole edistynyt käyttäjä, joka käyttää kiinteitä linkkejä keskitetyssä mallirepositoriossa).

Päätä asennus ja testaa, onko GIT asennettu oikein, avaamalla CMD-ikkunan ja kirjoittamalla ja suorittamalla:
git --version

GITHUB-KIRJAUTUMINEN
Myöhemmin, kun yrität kloonata GitHub-repositorioita, sinut voidaan haastaa antamaan GitHub-tunnukset. Ennakkoon, kirjaudu GitHub-tiliisi (luo yksi, jos tarpeen) missä tahansa Windows-järjestelmässä. Tällä tavoin 0Auth-todennusmenetelmä (ponnahdusikkuna) pitäisi kestää vain lyhyen ajan.
Kun teit alkuhaasteen, sinun pitäisi pysyä automaattisesti kirjautuneena.
6: ASENNAA CMAKE
CMake 3.21 tai uudempi on vaadittu osalle Musubi-asennusta. CMake on monialustainen kehitysarkkitehtuuri, joka pystyy orkesteroida erilaisia kääntäjiä ja kääntämään ohjelmistoja lähdekoodista.
Lataa se osoitteesta:
https://cmake.org/download/ (‘Windows x64 Installer’)
Käynnistä asennin:

Varmista, että Lisää CMake polkuun on valittu.

Valitse Seuraava.

Kirjoita ja suorita seuraava komento Windowsin komentokehoitteessa:
cmake --version
Jos CMake on asennettu onnistuneesti, se tulostaa jotain tällaista:
cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: ASENNAA PYTHON 3.10
Python-tulkki on keskeinen tässä projektissa. Lataa 3.10 -versio (paras kompromissi eri Musubi-pakettien vaatimusten välillä) osoitteesta:
https://www.python.org/downloads/release/python-3100/ (‘Windows-asennin (64-bittinen)’)
Suorita lataamasi asennin ja jätä oletusarvot:


Lopussa asennusprosessia valitse Estä polun pituuden rajoitus (vaatii UAC-hallinnon vahvistuksen):

Kirjoita ja suorita seuraava komento Windowsin komentokehoitteessa:
python --version
Tämä pitäisi tulostaa Python 3.10.0

TARKISTA POLKU
Musubi-kehyksen ja sen normaalin toiminnan jälkeen asennuksen jälkeen edellyttää, että sen komponentit tietävät useiden tärkeiden ulkoisten komponenttien polun Windowsissa, erityisesti CUDA:sta.
Tarvitaan avata polku-ympäristö ja tarkistaa, että kaikki vaaditut ovat siellä.
Nopea tapa päästä Windowsin ympäristön hallintaan on kirjoittaa Muokkaa järjestelmän ympäristömuuttujia Windowsin hakukenttään.

Tämä avaa Järjestelmän ominaisuudet -ohjauspaneelin. Järjestelmän ominaisuudet -ikkunan alaoikeassa reunassa valitse Ympäristömuuttujat -painike, ja avautuu Ympäristömuuttujat -ikkuna. Järjestelmän muuttujat -paneelissa ikkunan alaosassa vieritä alas Polku ja kaksoisklikkaa sitä. Tämä avaa Muokkaa ympäristömuuttujaa -ikkunan. Vedä ikkunan leveyttä, jotta näet koko polun:

Tässä ovat tärkeät merkinnät:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin
Useimmissa tapauksissa oikeat polku-muuttujat pitäisi jo olla läsnä.
Lisää puuttuvat polut valitsemalla Uusi Muokkaa ympäristömuuttujaa -ikkunan vasemmasta reunasta ja liittämällä oikean polun:

Älä kopioi ja liitä polkuja suoraan yllä olevasta luettelosta; tarkista, että kunkin vastaava polku on olemassa omassa Windows-asennuksessasi.
Jos on pieniä polkueron muutoksia (erityisesti Visual Studio -asennuksissa), käytä yllä olevia polkuja löytääksesi oikeat kohdekansiot (esim. x64 Host64:ssä omassa asennuksessasi). Kopioi sitten nämä polut Muokkaa ympäristömuuttujaa -ikkunaan.
Kun olet tehnyt tämän, käynnistä uudelleen tietokoneen.
ASENNA MUSUBI
PII PIP
Käyttämällä uusinta PIP-asenninta voidaan helpottaa joitain asennusvaiheita. Ylivaltuutetussa Windowsin komentokehoitteessa kirjoita ja suorita:
pip install --upgrade pip
KOROTETTU
Jotkut komennot saattavat vaatia korotettuja oikeuksia (ts. ne on suoritettava järjestelmänvalvojana). Jos saat virheilmoituksia oikeuksista seuraavissa vaiheissa, sulje komentokehote-ikkuna ja avaa se uudelleen ylivaltuutetussa tilassa kirjoittamalla CMD Windowsin hakukenttään, oikeaklikkaamalla Komentokehote ja valitsemalla Suorita järjestelmänvalvojana:

Seuraavissa vaiheissa käytetään Windows Powershellia sen sijaan, että Windowsin komentokehote. Voit löytää sen kirjoittamalla Powershell Windowsin hakukenttään ja (tarvittaessa) oikeaklikkaamalla sitä ja valitsemalla Suorita järjestelmänvalvojana:

ASENNA TORCH
Powershellissa kirjoita ja suorita:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
Ole kärsivällinen, kun monet paketit asennetaan.
Kun asennus on valmis, voit vahvistaa GPU:lla varustetun PyTorch-asennuksen kirjoittamalla ja suorittamalla:
python -c "import torch; print(torch.cuda.is_available())"
Tämä pitäisi tulostaa:
C:\WINDOWS\system32>python -c "import torch;
print(torch.cuda.is_available())"
True
ASENNA TRITON WINDOWSILLE
Seuraavaksi asennetaan Triton for Windows -komponentti. Ylivaltuutetussa Powershellissa kirjoita (yhdellä rivillä):
pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(Asennin triton-3.1.0-cp310-cp310-win_amd64.whl toimii sekä Intel- että AMD-suorittimille, kunhan arkkitehtuuri on 64-bittinen ja ympäristö vastaa Python-versiota)
Kun suoritusta on suoritettu, tämä pitäisi tulostaa:
Successfully installed triton-3.1.0
Voimme tarkistaa, onko Triton toiminnassa, tuomalla sen Pythonissa. Kirjoita:
python -c "import triton; print('Triton is working')"
Tämä pitäisi tulostaa:
Triton is working
Tarkista, onko Triton GPU:lla varustettu, kirjoittamalla:
python -c "import torch; print(torch.cuda.is_available())"
Tämä pitäisi tulostaa True:

LUO VIRTUAALIYMPÄRISTÖ MUSUBILLE
Tästä lähtien asennamme kaiken seuraavan ohjelmiston Python-virtuaaliympäristöön (tai venv). Tämä tarkoittaa, että kaiken seuraavan ohjelmiston poistaminen on helppoa – sinun tarvitsee vain raahata venv:n asennuskansio roskakoriin.
Luo kansio nimeltä Musubi työpöydälle. Seuraavat esimerkit olettavat, että tämä kansio on olemassa: C:\Users\[Käyttäjänimi]\Desktop\Musubi\.
Powershellissa siirry kansioon:
cd C:\Users\[Käyttäjänimi]\Desktop\Musubi
Haluan, että virtuaaliympäristöllä on pääsy kaikkeen, mitä olemme asentaneet tähän asti (erityisesti Triton), joten käytän --system-site-packages -valitsinta. Kirjoita:
python -m venv --system-site-packages musubi
Odota, kunnes ympäristö on luotu, ja aktivoi se:
.\musubi\Scripts\activate
Tästä lähtien voit tietää, että olet virtuaaliympäristössä, koska (musubi) näkyy kaikkien komentojen alkussa.

KLONOI REPOSITOIO
Siirry äsken luotuun musubi -kansioon (joka on Musubi -kansiossa työpöydällä):
cd musubi
Nyt olemme oikeassa paikassa, kirjoita:
git clone https://github.com/kohya-ss/musubi-tuner.git
Odota, kunnes klooni on valmis (se ei kestä kauan).

ASENNA VAATIMUKSET
Siirry asennuskansioon:
cd musubi-tuner
Kirjoita:
pip install -r requirements.txt
Odota, kunnes monet asennukset on tehty (tämä kestää kauemmin).

Automaattinen pääsy Hunyuan Video Venv:hen
Helppo tapa aktivoida ja päästä venv:hen tuleviin istuntoihin on liittää seuraavaa Notepad-koodia ja tallentaa se nimellä activate.bat (tai mikä tahansa muu nimi), tallentamalla sen missä tahansa paikassa, kuten aiemmin:
@echo off
call C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\Scripts\activate
cd C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner
cmd
(Korvaa [Käyttäjänimi] oikealla Windowsin käyttäjänimelläsi)

Tämä ei vaikuta siihen, minne tallennat tiedoston.
Tästä lähtien voit kaksinkertaisella klikkauksella activate.bat -tiedostoa ja aloittaa työskentelyn välittömästi:

KÄYTTÄMINEN MUSUBI TUNERIA
LATAA MALLIT
Hunyuan Video LoRA -koulutusprosessi vaatii vähintään seitsemän mallin lataamisen tukemaan kaikkia mahdollisia optimointivaihtoehtoja esikäsittelylle ja koulutukselle. Nämä mallit yhdessä painavat yli 60 GB.
Voit ladata ne osoitteesta https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download
Näin ne voidaan ladata (kirjoitusajankohtana):
clip_l.safetensors ja
llava_llama3_fp16.safetensors
llava_llama3_fp8_scaled.safetensors
voivat ladata osoitteesta:
https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders
mp_rank_00_model_states.pt ja
mp_rank_00_model_states_fp8.pt
mp_rank_00_model_states_fp8_map.pt
voivat ladata osoitteesta:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers
pytorch_model.pt
voi ladata osoitteesta:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae
Voit sijoittaa ne mihin tahansa kansioon, mutta konsistenssin vuoksi myöhempien skriptien kanssa, laita ne kansioon:
C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\models\
Tämä on konsistenttia aiemman kansiorakenteen kanssa. Älä unohda korvata [Käyttäjänimi] oikealla Windowsin käyttäjänimelläsi.
DATAN VALMISTELU
Ohita yhteisön kiistan aiheesta, on reilua sanoa, että tarvitset 10-100 valokuvaa Hunyuan LoRA -koulutusaineistoksi. Hyvät tulokset voidaan saada jopa 15 kuvalla, jos ne ovat tasapainoisia ja laadukkaita.
Hunyuan LoRA voidaan kouluttaa sekä kuvista että hyvin lyhyistä ja matalaresoluutioisista videoklippeistä tai jopa niiden yhdistelmästä – vaikka videoklipien käyttäminen koulutusaineistona on haasteellista, jopa 24 GB:n kortilla.
Videoklipit ovat kuitenkin vain hyödyllisiä, jos hahmosi liikkuu epätavallisella tavalla, josta Hunyuan Video -perusmalli ei voi tietää tai arvata.
Esimerkkejä ovat Roger Rabbit, xenomorph, The Mask, Spider-Man tai muut persoonallisuudet, joilla on ainutlaatuinen liikeominaisuus.
Koska Hunyuan Video jo tietää, miten tavalliset miehet ja naiset liikkuvat, videoklippejä ei tarvita saadakseen vakuuttavan Hunyuan Video LoRA -ihmishahmon. Käytetään siis statisia kuvia.
KUVIEN VALMISTELU
BUCKET-LUETTELO
TLDR-versio:
On parasta käyttää kuvia, jotka ovat kaikki saman kokoisia koulutusaineistoon, tai käyttää 50/50 -jakoa kahden eri koosta, esim. 10 kuvaa, jotka ovat 512x768px ja 10, jotka ovat 768x512px.
Koulutus voi onnistua, vaikka et tee tätä – Hunyuan Video LoRA:t voivat olla yllättävän anteeksiantavaisia.
Pitkä versio
Kuten Kohya-ss LoRA:issa staattisille generatiivisille järjestelmille, kuten Stable Diffusion, bucketing käytetään jakamaan työmäärää eri kokoisille kuville, jotta voidaan käyttää suurempia kuvia ilman muistivirheitä koulutuksen aikana (ts. bucketing ‘jakaa’ kuvat paloiksi, joita GPU pystyy käsittelemään, säilyttäen koko kuvan semanttisen eheyden).
Jokaiselle kuvasoolle, jonka sisällytät koulutusaineistoon (esim. 512x768px), luodaan “bucket” tai “alitehtävä”. Jos sinulla on seuraava kuva-jaon jakautuminen:
2x 512x768px kuvaa
7x 768x512px kuvaa
1x 1000x600px kuva
3x 400x800px kuvaa
Voimme nähdä, että bucket-huomio on jakautunut epätasaisesti näiden kuvien kesken:

Siksi kannattaa joko pitäytyä yhdessä formaatissa tai yrittää pitää eri kokoisten kuvien jakautumista suhteellisen tasapuolisena.
Pienet kuvat eivät ole hyödyllisiä, koska ne eivät tarjoa tarpeeksi tietoa koulutukseen.
Käytin kaikissa kuvissani 512x768px-kokoa.
Varoitus: Malli (henkilö) koulutusaineistossa antoi minulle luvan käyttää näitä kuvia tähän tarkoitukseen, ja hyväksyi kaikki AI-pohjaiset tulosteet, jotka esittävät hänen kaltaisuutensa tässä artikkelissa.

Koulutusaineistoni koostuu 40 kuvasta PNG-muodossa (vaikka JPG on myös ok). Kuvat tallennettiin kansioon C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman
Pitäisi luoda cache -kansio koulutuskuvakansioon:

Nyt luodaan erityinen tiedosto, joka määrittää koulutuksen.
TOML-TIEDOSTOT
Hunyuan Video LoRA -koulutus- ja esikäsittelyprosessit saavat tiedostopolut .toml -laajuisesta tekstitiedostosta.
Koulutukseni TOML-tiedosto on sijainnissa C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml
Minun koulutukseni TOML-tiedoston sisältö on:
[general]
resolution = [512, 768]
caption_extension = ".txt"
batch_size = 1
enable_bucket = true
bucket_no_upscale = false
[[datasets]]
image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"
cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"
num_repeats = 1
(Kaksoispistekohtamerkit kuvien ja välimuistin kansioissa eivät aina ole välttämättömiä, mutta ne voivat auttaa välttämään virheitä, jos polussa on välilyönti. Olen kouluttanut malleja.toml-tiedostoilla, jotka käyttivät eteen- ja taaksepäin suuntautuneita ja taaksepäin suuntautuneita kaksoispisteitä)
Voimme nähdä resoluutio -osiossa, että kaksi resoluutiota otetaan huomioon – 512px ja 768px. Voit myös jättää sen 512:ksi ja saada hyvät tulokset.
SELITEKSTIT
Hunyuan Video on teksti+näkemysperusmalli, joten tarvitsemme kuvauksellisia selitekstejä näille kuville, jotka otetaan huomioon koulutuksen aikana. Koulutusprosessi epäonnistuu ilman selitekstejä.
On olemassa monia avoimia lähdekoodin selitejärjestelmiä, joita voimme käyttää tähän tehtävään, mutta pidetään se yksinkertaisena ja käytetään taggui -järjestelmää. Vaikka se on tallennettu GitHubiin, ja vaikka se lataa joitain raskaita syväoppimismalleja ensimmäisellä suorituskerralla, se tulee muodossa, jossa on yksinkertainen Windows-komentotiedosto, joka lataa Python-kirjastot ja suorittaa suoraviivaisen käyttöliittymän.
Kun Taggui on käynnistetty, käytä Tiedosto > Lataa kansio siirtymään koulutuskuvakansioon, ja valinnaisesti laita tunniste (tässä tapauksessa examplewoman), joka lisätään kaikkiin seliteksteihin:

(Varmista, että Lataa 4-bittisinä on poistettu, kun Taggui ensin avataan – se heittää virheitä käsittelyssä, jos se on päällä)
Valitse kuva vasemmalla esikatselupalkissa ja paina CTRL+A valitsemaan kaikki kuvat. Sitten paina Käynnistä automaattinen käsittely -painiketta oikealla:

Näet Tagguin lataamassa malleja pienessä CLI-ikkunassa oikealla, mutta vain, jos tämä on ensimmäinen kerta, kun olet suorittanut käsittelyn. Muuten näet selitekstejä.

Nyt jokaisella kuvalla on vastaava.txt-selite, jossa on kuvaus kuvan sisällöstä:

Voit napsauttaa Edistyneet vaihtoehdot Tagguissa lisätäksesi selitekstejä ja tyylittääksesi niitä, mutta se on tämän opaan ulottumaton.
Sulje Taggui ja siirry seuraavaan…
LATENTTIINEN ESIKÄSITTELY
Jotta voidaan välttää liiallinen GPU-kuormitus koulutuksen aikana, on luotava kaksi tyyppiä esikäsiteltyjä tiedostoja – yksi edustaa latenttia kuvaa, joka on johdettu kuvista itsestään, ja toinen arvioi tekstikoodauksen, joka liittyy seliteksteihin.
Yksinkertaistamaan kaikkia kolmea prosessia (2x cache + koulutus) voidaan käyttää interaktiivisia.BAT-tiedostoja, jotka kysyvät kysymyksiä ja suorittavat prosessit, kun olet antanut tarvittavat tiedot.
Latenttiselle esikäsittelylle kopioi seuraava teksti Notepadista ja tallenna se.BAT-tiedostona (esim. latent-precache.bat), kuten aiemmin, varmistamalla, että tiedostotyyppi pudotusvalikossa Tallenna nimellä -valintaikkunassa on Kaikki tiedostot (ks. kuva alla):
@echo off
REM Aktivoi virtuaaliympäristö
call C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Kysy käyttäjältä
set /p KUVA_POLKU=Anna kuvakansion polku:
set /p VÄLIMUISTI_POLKU=Anna välimuistikansion polku:
set /p TOML_POLKU=Anna TOML-tiedoston polku:
echo Sinä annoit:
echo Kuva polku: %KUVA_POLKU%
echo Välimuisti polku: %VÄLIMUISTI_POLKU%
echo TOML-tiedoston polku: %TOML_POLKU%
set /p VARMISTUS=Haluatko jatkaa latenttisella esikäsittelyllä (k/e)?
if /i "%VARMISTUS%"=="k" (
REM Suorita latenttinen esikäsittelyskripti
python C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_POLKU% --vae C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling
) else (
echo Toiminto peruttu.
)
REM Pidä ikkuna auki
pause
(Korvaa [Käyttäjänimi] oikealla Windowsin käyttäjänimelläsi)

Nyt voit suorittaa.BAT-tiedoston automaattiselle latenttiselle esikäsittelylle:

Kun.BAT-tiedosto kysyy kysymyksiä, liitä tai kirjoita polku koulutuskuviin, välimuistikansioon ja TOML-tiedostoon.
TEKSTIN ESIKÄSITTELY
Luodaan toinen.BAT-tiedosto, tällä kertaa tekstiesikäsittelyyn.
@echo off
REM Aktivoi virtuaaliympäristö
call C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Kysy käyttäjältä
set /p KUVA_POLKU=Anna kuvakansion polku:
set /p VÄLIMUISTI_POLKU=Anna välimuistikansion polku:
set /p TOML_POLKU=Anna TOML-tiedoston polku:
echo Sinä annoit:
echo Kuva polku: %KUVA_POLKU%
echo Välimuisti polku: %VÄLIMUISTI_POLKU%
echo TOML-tiedoston polku: %TOML_POLKU%
set /p VARMISTUS=Haluatko jatkaa tekstikoodauksen esikäsittelyllä (k/e)?
if /i "%VARMISTUS%"=="k" (
REM Käytä Python-suoritinta virtuaaliympäristöstä
python C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_POLKU% --text_encoder1 C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16
) else (
echo Toiminto peruttu.
)
REM Pidä ikkuna auki
pause
Korvaa [Käyttäjänimi] oikealla Windowsin käyttäjänimelläsi ja tallenna se text-cache.bat -tiedostona (tai minkä tahansa nimen haluat), missä tahansa kätevällä paikalla, kuten edellisessä.BAT-tiedostossa.
Suorita uusi.BAT-tiedosto, seuraa ohjeita, ja tarvittavat tekstikoodatut tiedostot ilmestyvät cache -kansioon:

KOULUTA HUNYUAN VIDEO LORA
Itse LoRA:n koulutus kestää huomattavasti kauemmin kuin nämä kaksi valmisteluprosessia.
Vaikka on monia muuttujia, joista voimme huolehtia (kuten batch-koko, toistot, epochit ja käytetäänkö täysiä tai kvantisoituja malleja), säästämme ne tulevaan, syvemmän LoRA-luomisen katsaukseen.
Luodaan kolmas.BAT-tiedosto, tällä kertaa koulutuksen aloittamiseksi. Kopioi seuraava teksti Notepadista ja tallenna se.BAT-tiedostona, kuten aiemmin, nimellä training.bat (tai minkä tahansa nimen haluat):
@echo off
REM Aktivoi virtuaaliympäristö
call C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Kysy käyttäjältä
set /p DATASET_CONFIG=Anna koulutusaineiston konfiguraatiotiedoston polku:
set /p EPOCHIT=Anna koulutusepochien määrä:
set /p OUTPUT_NIMI=Anna tulostusmallin nimi (esim. example0001):
set /p OPPIKURSSI=Valitse oppimiskurssi (1 oppimiskurssi 1e-3, 2 oppimiskurssi 5e-3, oletus 1e-3):
if "%OPPIKURSSI%"=="1" set LR=1e-3
if "%OPPIKURSSI%"=="2" set LR=5e-3
if "%OPPIKURSSI%"=="" set LR=1e-3
set /p TALLENNUS_VÄLIT=Kuinka usein (askelissa) tallennetaan esikatselukuvia:
set /p NÄYTTÖTEKSTI=Missä on koulutuksen esikatselun tekstiprompt-tiedosto?
echo Sinä annoit:
echo Koulutusaineiston konfiguraatiotiedosto: %DATASET_CONFIG%
echo Koulutusepochien määrä: %EPOCHIT%
echo Tulostusmallin nimi: %OUTPUT_NIMI%
echo Oppimiskurssi: %LR%
echo Tallenna esikatselukuvat joka %TALLENNUS_VÄLIT% askelta.
echo Tekstiprompt-tiedosto: %NÄYTTÖTEKSTI%
REM Valmistele komento
set KOMENTO=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^
C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^
--dit C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^
--dataset_config %DATASET_CONFIG% ^
--sdpa ^
--mixed_precision bf16 ^
--fp8_base ^
--optimizer_type adamw8bit ^
--learning_rate %LR% ^
--gradient_checkpointing ^
--max_data_loader_n_workers 2 ^
--persistent_data_loader_workers ^
--network_module=networks.lora ^
--network_dim=32 ^
--timestep_sampling sigmoid ^
--discrete_flow_shift 1.0 ^
--max_train_epochs %EPOCHIT% ^
--save_every_n_epochs=1 ^
--seed 42 ^
--output_dir "C:\Users\[Käyttäjänimi]\Desktop\Musubi\Output Models" ^
--output_name %OUTPUT_NIMI% ^
--vae C:/Users/[Käyttäjänimi]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^
--vae_chunk_size 32 ^
--vae_spatial_tile_sample_min_size 128 ^
--text_encoder1 C:/Users/[Käyttäjänimi]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^
--text_encoder2 C:/Users/[Käyttäjänimi]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^
--sample_prompts %NÄYTTÖTEKSTI% ^
--sample_every_n_steps %TALLENNUS_VÄLIT% ^
--sample_at_first
echo Seuraava komento suoritetaan:
echo %KOMENTO%
set /p VARMISTUS=Haluatko jatkaa koulutuksella (k/e)?
if /i "%VARMISTUS%"=="k" (
%KOMENTO%
) else (
echo Toiminto peruttu.
)
REM Pidä ikkuna auki
cmd /k
Kuten aiemmin, varmista, että korvaat kaikki [Käyttäjänimi] -ilmoitukset oikealla Windowsin käyttäjänimelläsi.
Varmista, että kansio C:\Users\[Käyttäjänimi]\Desktop\Musubi\Output Models\ on olemassa, ja luo se, jos se ei ole.
KOULUTUKSEN ESIKATSLET
On olemassa erittäin perustava koulutusen esikatseluominaisuus Musubi-kouluttajassa, joka mahdollistaa koulutusmallin pysäyttämisen ja kuvien luomisen annetuilla teksteillä. Nämä tallennetaan automaattisesti luotuun kansioon nimeltä Näyte, samassa kansiossa, jossa koulutetut mallit tallennetaan.

Jotta voit käyttää tätä, sinun on tallennettava vähintään yksi teksti tiedostoon. Koulutus-BAT, jonka loimme, kysyy sinulta tekstiprompt-tiedoston sijaintia; siksi voit antaa sille minkä tahansa nimen ja tallentaa sen minne tahansa.
Tässä on joitain esimerkkejä tekstiprompt-tiedostosta, joka tuottaa kolme eri kuvaa, kun koulutusohjelma pyytää:

Kuten näet yllä olevassa esimerkissä, voit lisätä lippuja tekstin loppuun, jotka vaikuttavat tuotoksiin:
–w on leveys (oletusarvo 256px, jos ei määritelty, kuten dokumentaatio sanoo)
–h on korkeus (oletusarvo 256px, jos ei määritelty)
–f on kehyksiä. Jos se on 1, luodaan kuva; enemmän kuin 1, luodaan video.
–d on siemen. Jos se ei ole määritelty, se on satunnainen; mutta sinun pitäisi määritellä se, jotta voit nähdä yhden tekstin kehittymisen.
–s on askelten määrä generoinnissa, oletusarvo 20.
Katso virallinen dokumentaatio lisätietoja lippujen käytöstä.
Vaikka koulutusen esikatselut voivat paljastaa joitain ongelmia, jotka voivat johtaa koulutuksen keskeyttämiseen ja uudelleenarviointiin, muista, että jokainen lisäteksti hidastaa koulutusta hieman enemmän.
Lisäksi esikatselukuvan leveyden ja korkeuden (kuten yllä mainittujen lippujen määrittämät) suuret koot hidastavat koulutusta.
Käynnistä koulutus-BAT-tiedosto.
Kysymys #1 on ‘Anna koulutusaineiston konfiguraatiotiedoston polku’. Liitä tai kirjoita oikea polku TOML-tiedostoon.
Kysymys #2 on ‘Anna koulutusepochien määrä’. Tämä on kokeilu- ja virheen muuttuja, koska se riippuu kuvien ja selitekstien määrästä ja laadusta sekä muista tekijöistä. Yleensä on parasta asettaa se liian korkeaksi kuin liian alhaiseksi, koska voit aina keskeyttää koulutuksen Ctrl+C:llä koulutusikkunassa, jos koet, että malli on edennyt tarpeeksi. Aseta se 100:aan aluksi ja katso, miten se menee.
Kysymys #3 on ‘Anna tulostusmallin nimi’. Anna mallille nimi! On ehkä parasta pitää se lyhyenä ja yksinkertaisena.
Kysymys #4 on ‘Valitse oppimiskurssi’, joka oletusarvoisesti on 1e-3 (vaihtoehto 1). Tämä on hyvä paikka aloittaa, odottamatta tulevaa kokemusta.
Kysymys #5 on ‘Kuinka usein (askelissa) tallennetaan esikatselukuvia’. Jos asetat sen liian alhaiseksi, et näe paljon edistymistä esikatselukuvien tallennuksissa, ja se hidastaa koulutusta.
Kysymys #6 on ‘Missä on koulutuksen esikatselun tekstiprompt-tiedosto?’. Liitä tai kirjoita polku tekstiprompt-tiedostoon.
BAT-tiedosto näyttää sinulle komennon, jonka se lähettää Hunyuan-mallille, ja kysyy, haluatko jatkaa, k/e.
Aloita koulutus:

Kun tarkkailet GPU-osaa Windowsin suorituskykytabissa, näet, että prosessi vie noin 16 GB VRAM:ia.

Tämä ei välttämättä ole satunnainen luku, koska tämä on määrä VRAM:ia, jota on monilla NVIDIA-grafiikkakorteilla, ja ylävirta-koodi on saattanut olla optimoitu sopimaan näille korteille.
Silti on erittäin helppo nostaa tämä käyttö, lähettämällä komentoon enemmän vaativia lippuja.
Koulutuksen aikana näet alhaalla oikeassa reunassa luvun siitä, kuinka kauan koulutus on kestänyt, ja arvion koulutuksen kokonaiskestosta (joka voi vaihdella suuresti lippujen, kuvien määrän, esikatselukuvien määrän ja muiden tekijöiden mukaan).

Tyypillinen koulutusaika on noin 3-4 tuntia keskimääräisillä asetuksilla, riippuen saatavilla olevasta laitteistosta, kuvien määrästä, lippujen asetuksista ja muista tekijöistä.
KÄYTTÄMINEN KOULUTETTUJA LORA-MALLEJA HUNYUAN VIDEOSSA
VALITSE KESKEYTYKSET
Kun koulutus on valmis, sinulla on mallin keskeytys jokaiselle koulutusepochille.

Tämä tallennusväli voidaan muuttaa käyttäjän toimesta tallentamalla useammin tai vähemmän usein, kuten halutaan, muuttamalla --save_every_n_epochs [N] -luvun koulutus-BAT-tiedostossa. Jos lisäsit matalan luvun tallennuksille askelissa, kun määritit koulutuksen BAT:in, on suuri määrä tallennettuja keskeytys-tiedostoja.
MITÄ KESKEYTYSTÄ VALITA?
Kuten mainittiin aiemmin, varhaisimmin koulutetut mallit ovat joustavampia, kun taas myöhemmät keskeytykset tarjoavat ehkä enemmän yksityiskohtia. Ainoa tapa testata näitä tekijöitä on suorittaa joitain LoRA:ita ja luoda muutamia videoita. Tällä tavoin voit tietää, mitkä keskeytykset ovat tuottavampia ja edustavat parasta tasapainoa joustavuuden ja uskottavuuden välillä.
COMFYUI
Suosituin (vaikka ei ainoa) ympäristö Hunyuan Video LoRA:iden käyttöön on tällä hetkellä ComfyUI, solmun perustuva editori, joka suoritetaan verkkoselaimessasi.

Lähde: https://github.com/comfyanonymous/ComfyUI
Asennusohjeet ovat suoraviivaiset ja saatavilla viralliselta GitHub-repositoriolta (lisäksi on ladattava joitain malleja).
MUUNTA MALLIT COMFYUI:lle
Koulutetut mallisi on tallennettu (diffusers) -muodossa, joka ei ole yhteensopiva useimpien ComfyUI-toteutusten kanssa. Musubi pystyy muuntamaan mallin ComfyUI-yhteensopivaan muotoon. Luodaan BAT-tiedosto, joka suorittaa tämän muunnoksen.
Ennen kuin suoritat tämän BAT-tiedoston, luo kansio C:\Users\[Käyttäjänimi]\Desktop\Musubi\CONVERTED\, jonka skripti odottaa.
@echo off
REM Aktivoi virtuaaliympäristö
call C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\Scripts\activate.bat
:START
REM Kysy käyttäjältä
set /p SYÖTEPOLKU=Anna Musubi-safetensors-tiedoston polku (tai kirjoita "exit" lopettaaksesi):
REM Lopeta, jos käyttäjä kirjoittaa "exit"
if /i "%SYÖTEPOLKU%"=="exit" goto END
REM Poista tiedostonimi syötepolusta ja liitä "converted" siihen
for %%F in ("%SYÖTEPOLKU%") do set TIEDOSTONIMI=%%~nF
set TULOSTUSPOLKU=C:\Users\[Käyttäjänimi]\Desktop\Musubi\Output Models\CONVERTED\%TIEDOSTONIMI%_converted.safetensors
set KOHDE=other
echo Sinä annoit:
echo Syötepolku: %SYÖTEPOLKU%
echo Tulostuspolku: %TULOSTUSPOLKU%
echo Kohdemuoto: %KOHD
set /p VARMISTUS=Haluatko jatkaa muunnoksella (k/e)?
if /i "%VARMISTUS%"=="k" (
REM Suorita muunnosskripti oikein merkatuilla poluilla
python C:\Users\[Käyttäjänimi]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%SYÖTEPOLKU%" --output "%TULOSTUSPOLKU%" --target %KOHD
echo Muunnos valmis.
) else (
echo Toiminto peruttu.
)
REM Palaa aloituskohtaan seuraavaan tiedostoon
goto START
:END
REM Pidä ikkuna auki
echo Skripti lopetetaan.
pause
Kuten aiemmin, tallenna skripti Notepadista kaikki tiedostot -valinnalla, nimeämällä sen convert.bat (tai minkä tahansa nimen haluat).
Kun olet tallentanut, suorita uusi.BAT-tiedosto, joka kysyy sinulta tiedoston sijaintia, jonka haluat muuttaa:

Liitä tai kirjoita polku koulutettuun tiedostoon, jonka haluat muuttaa, valitse k ja paina enter.

Kun muunnos on valmis ja muunnettu LoRA on tallennettu Muunnettu -kansioon, skripti kysyy, haluatko muuttaa toisen tiedoston. Jos haluat testata useita keskeytyksiä ComfyUI:ssa, muunna joukon malleja.
Kun olet muunnos useita keskeytyksiä, sulje.BAT-komentoikkuna.
Voit nyt kopioida muunnetut mallisi ComfyUI-asennuksen models\loras -kansioon.
Yleensä oikea sijainti on jokin seuraavista:
C:\Users\[Käyttäjänimi]\Desktop\ComfyUI\models\loras\
LUO HUNYUAN VIDEO LORA:TA COMFYUI:SSA
Vaikka ComfyUI:n solmupohjainen työkalu näyttää monimutkaiselta aluksi, muiden käyttäjien asetukset voidaan ladata vetämällä kuva (joka on tehty toisen käyttäjän ComfyUI:lla) suoraan ComfyUI-ikkunaan. Työkalut voidaan myös viedä JSON-tiedostona, joka voidaan tuoda manuaalisesti tai vetämällä se ComfyUI-ikkunaan.
Jotkut tuodut työkalut saattavat vaatia puuttuvia moduuleja, jotka eivät ole asennettuna. Siksi asenna ComfyUI-Manager, joka voi hakea puuttuvat moduulit automaattisesti.

Lähde: https://github.com/ltdrdata/ComfyUI-Manager
Lataa tämä JSON-tiedosto ja vedä se ComfyUI-ikkunaan (vaikka on olemassa paljon parempia esimerkkejä eri Reddit- ja Discord-yhteisöissä, jotka ovat omaksuneet Hunyuan Videon, ja minun omat ovat mukautettu yhdestä näistä).
Tämä ei ole paikka ComfyUI:n perusteelliselle opastukselle, mutta on mainittava muutamia tärkeitä parametreja, jotka vaikuttavat tuloksiin, jos lataat ja käytät JSON-määritystä, jonka linkasin yllä:

1) LEVEYS JA KORKEUS
Suuremmat kuvat kestävät kauemmin, ja niillä on suurempi riski muistivirheestä.
2) PITUUS
Tämä on numeerinen arvo kehyksien määrälle. Kuinka monta sekuntia se kattaa, riippuu kehysnopeudesta (joka on asetettu 30fps:aan tässä määrityksessä). Voit muuttaa sekunneista kehyksiin Omnicalculatorissa.
3) ERÄKOKO
Mitä suurempi eräkoko on, sitä nopeammin tulos saadaan, mutta suurempi on myös VRAM:n kuormitus. Aseta se liian korkeaksi, ja saat muistivirheen.
4) OHJAA GENEROINTI
Tämä ohjaa satunnaisen siemenen. Vaihtoehdot ovat kiinteä, kasvava, väheneminen ja satunnainen. Jos jätät sen kiinteäksi ja et muuta tekstiprompttia, saat aina saman kuvan. Jos muutat tekstiprompttia, kuva muuttuu jonkin verran. Kasvava ja väheneminen -asetukset sallivat sinun tutkia lähellä olevia siemenarvoja, kun taas satunnainen antaa sinulle täysin uuden tulkinnan tekstipromptista.
5) LORA-NIMI
Sinun on valittava asennettu mallisi tässä.
6) TOKENI
Jos olet kouluttanut mallisi käyttämään tiettyä tokenia (kuten example-person), laita se tekstiprompttiin.
7) ASKELT
Tämä edustaa, kuinka monta askelta diffuusioprosessiin sovelletaan. Suuremmat askelmaarat voivat johtaa parempaan yksityiskohtaiseen, mutta on katto, kuinka tehokas tämä lähestymistapa on, ja se voi olla haasteellista löytää. Yleinen askelten määrä on noin 20-30.
8) LAATIKON KOKO
Tämä määrittää, kuinka paljon tietoa käsitellään kerran generoinnissa. Se on oletusarvoisesti 256. Nostamalla sitä voidaan nopeuttaa generointia, mutta nostamalla sitä liian korkeaksi voidaan johtaa erittäin ärsyttävään muistivirheeseen, koska se tulee lopussa pitkän prosessin.
9) AJALLINEN OVELAUS
Hunyuan Videon generointi ihmisille voi johtaa ‘haamuihin’ tai epäuskottaviin liikkeisiin, jos se on asetettu liian alhaiseksi. Yleensä nykyinen viisaus on, että se tulisi asettaa korkeammaksi kuin kehysmäärä, jotta liike olisi uskottavampaa.
JOHTOPÄÄTÖS
Vaikka ComfyUI:n käytön syventäminen on tämän artikkelin ulottumaton, yhteisön kokemus Redditissä ja Discordissa voi helpottaa oppimiskäyrää, ja on useita verkkokäyttöohjeita, jotka esittelevät perusteet.
Julkaistu torstaina, 23. tammikuuta 2025












