Andersons hoek

Hoe Hunyuan Video LoRA-modellen te trainen en gebruiken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
ChatGPT-4o: Variation on 'Create me an image 1792 x 1024. It should be in the style of Théodore Géricault, and should depict a dark medieval figure seated in front of a laptop, illuminated by the screen. We are facing the figure, and can only see the back of the laptop lid. Around the seated medieval figure are many other medieval men and women, curious as to what is happening on the computer screen'

Dit artikel laat zien hoe u Windows-gebaseerde software kunt installeren en gebruiken om Hunyuan video LoRA-modellen te trainen, waardoor u aangepaste persoonlijkheden kunt maken in het Hunyuan Video-foundation model:

Klik om af te spelen. Voorbeelden van de recente explosie van celebrity Hunyuan LoRAs van de civit.ai-gemeenschap.

Op dit moment zijn de twee meest populaire manieren om Hunyuan LoRA-modellen lokaal te genereren:

1) Het diffusion-pipe-ui Docker-gebaseerd framework, dat afhankelijk is van Windows Subsystem for Linux (WSL) om sommige processen te verwerken.

2) Musubi Tuner, een nieuwe toevoeging aan de populaire Kohya ss diffusie-trainingsarchitectuur. Musubi Tuner heeft geen Docker nodig en is niet afhankelijk van WSL of andere Linux-gebaseerde proxies – maar het kan moeilijk zijn om het op Windows te laten werken.

Daarom zal deze doorloop zich richten op Musubi Tuner en op het bieden van een volledig lokale oplossing voor Hunyuan LoRA-training en -generatie, zonder het gebruik van API-georiënteerde websites of commerciële GPU-huurprocessen zoals Runpod.

Klik om af te spelen. Voorbeelden van LoRA-training op Musubi Tuner voor dit artikel. Alle toestemmingen zijn verleend door de persoon die is afgebeeld, voor het illustreren van dit artikel.

VEREISTEN

De installatie vereist minimaal een Windows 10-pc met een 30+/40+ serie NVIDIA -kaart die ten minste 12 GB VRAM heeft (hoewel 16 GB aanbevolen wordt). De installatie die voor dit artikel is gebruikt, is getest op een machine met 64 GB systeemgeheugen en een NVIDIA 3090-grafische kaart met 24 GB VRAM. Het is getest op een speciale testomgeving met een verse installatie van Windows 10 Professional, op een partitie met 600+ GB vrije schijfruimte.

WAARSCHUWING

Het installeren van Musubi Tuner en zijn vereisten houdt ook het installeren van developer-georiënteerde software en pakketten rechtstreeks op de hoofd-Windows-installatie van een pc in. Het nemen van de installatie van ComfyUI in overweging, voor de eindfase, zal dit project ongeveer 400-500 gigabyte schijfruimte vereisen. Hoewel ik de procedure verschillende keren zonder incidenten in nieuw geïnstalleerde testomgevingen van Windows 10 heb getest, zijn noch ik noch unite.ai aansprakelijk voor eventuele schade aan systemen door deze instructies te volgen. Ik adviseer u om alle belangrijke gegevens te back-uppen voordat u deze soort installatieprocedure uitvoert.

OVERWEGINGEN

IS DEZE METHODE NOG STEEDS GELDIG?

De generatieve AI-scene beweegt zich zeer snel, en we kunnen betere en gestroomlijndere methoden voor Hunyuan Video LoRA-kaders verwachten dit jaar.

…of zelfs deze week! Terwijl ik dit artikel schreef, produceerde de ontwikkelaar van Kohya/Musubi musubi-tuner-gui, een geavanceerde Gradio GUI voor Musubi Tuner:

Een gebruikersvriendelijke GUI is natuurlijk beter dan de BAT-bestanden die ik in deze functie gebruik – zodra musubi-tuner-gui werkt. Toen ik schreef, was het pas vijf dagen online en kon ik geen rekening vinden van iemand die het succesvol had gebruikt.

Volgens berichten in het repository is de nieuwe GUI bedoeld om rechtstreeks in het Musubi Tuner-project te worden geïntegreerd zodra mogelijk, wat einde maakt aan zijn huidige bestaan als een afzonderlijk GitHub-repository.

Op basis van de huidige installatie-instructies, wordt de nieuwe GUI rechtstreeks in de bestaande Musubi-omgeving gekloond; en, ondanks vele pogingen, kan ik het niet laten associëren met de bestaande Musubi-installatie. Dit betekent dat wanneer het wordt uitgevoerd, het zal ontdekken dat het geen motor heeft!

Als de GUI eenmaal in Musubi Tuner is geïntegreerd, zullen dergelijke problemen zeker worden opgelost. Hoewel de auteur toegeeft dat het nieuwe project ‘echt ruw’ is, is hij optimistisch over de ontwikkeling en integratie rechtstreeks in Musubi Tuner.

Gezien deze problemen (ook met betrekking tot standaardpaden bij installatietijd en het gebruik van het UV Python-pakket, dat bepaalde procedures in de nieuwe release compliceert), zullen we waarschijnlijk moeten wachten tot een soepeler Hunyuan Video LoRA-training ervaring. Dat gezegd hebbende, het ziet er veelbelovend uit!

Maar als je niet kunt wachten en bereid bent je mouwen op te stropen, kun je Hunyuan video LoRA-training lokaal nu direct starten.

Laten we beginnen.

WAAROM IETS INSTALLEREN OP BARE METAL?

(Sla deze alinea over als je geen geavanceerde gebruiker bent)
Geavanceerde gebruikers zullen zich afvragen waarom ik zo veel software rechtstreeks op de kale Windows 10-installatie heb geïnstalleerd in plaats van in een virtuele omgeving. De reden is dat de essentiële Windows-poort van het Linux-gebaseerde Triton-pakket veel moeilijker te laten werken is in een virtuele omgeving. Alle andere kale metaal-installaties in de tutorial konden niet in een virtuele omgeving worden geïnstalleerd, omdat ze rechtstreeks moeten communiceren met lokale hardware.

HET INSTALLEREN VAN VOORWAARDEN-PACKETTEN EN PROGRAMMA’S

Voor de programma’s en pakketten die aanvankelijk moeten worden geïnstalleerd, is de volgorde van installatie belangrijk. Laten we beginnen.

1: DOWNLOAD MICROSOFT REDISTRIBUTABLE

Download en installeer het Microsoft Redistributable-pakket van https://aka.ms/vs/17/release/vc_redist.x64.exe.

Dit is een eenvoudige en snelle installatie.

2: INSTALLEER VISUAL STUDIO 2022

Download de Microsoft Visual Studio 2022 Community-editie van https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta

Start de gedownloade installer:

We hebben niet alle beschikbare pakketten nodig, wat een zware en lange installatie zou zijn. Op de initiële Workloads-pagina die opent, vink Desktop Development with C++ aan (zie afbeelding hieronder).

Ga nu naar het Individual Components-tabblad linksboven in het interface en gebruik het zoekvak om ‘Windows SDK’ te vinden.

Standaard is alleen de Windows 11 SDK aangevinkt. Als u op Windows 10 bent (deze installatieprocedure is niet door mij getest op Windows 11), vink de laatste Windows 10-versie aan, zoals aangegeven in de afbeelding hierboven.

Zoek naar ‘C++ CMake’ en controleer of C++ CMake tools for Windows is aangevinkt.

Deze installatie zal ten minste 13 GB aan ruimte in beslag nemen.

Zodra Visual Studio is geïnstalleerd, zal het proberen te openen op uw computer. Laat het volledig openen. Wanneer het volledige scherm van Visual Studio zichtbaar is, sluit u het programma.

3: INSTALLEER VISUAL STUDIO 2019

Sommige van de latere pakketten voor Musubi verwachten een oudere versie van Microsoft Visual Studio, terwijl anderen een recentere versie nodig hebben.

Download daarom ook de gratis Community-editie van Visual Studio 19, hetzij van Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – account vereist) of Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).

Installeer het met dezelfde opties als voor Visual Studio 2022 (zie procedure hierboven, behalve dat Windows SDK al is aangevinkt in de Visual Studio 2019-installer).

U zult zien dat de Visual Studio 2019-installer zich al bewust is van de nieuwere versie tijdens de installatie:

Wanneer de installatie is voltooid en u de geïnstalleerde Visual Studio 2019-toepassing hebt geopend en gesloten, opent u een Windows-opdrachtprompt (Typ CMD in Start Search) en typt u in en voert u uit:

where cl

Het resultaat moet de bekende locaties van de twee geïnstalleerde Visual Studio-edities zijn.

Als u in plaats daarvan INFO: Could not find files for the given pattern(s) krijgt, zie de Check Path-sectie van dit artikel hieronder en gebruik die instructies om de relevante Visual Studio-paden toe te voegen aan Windows-omgeving.

Sla alle wijzigingen op die zijn aangebracht volgens de Check Paths-sectie hieronder en probeer het where cl-commando opnieuw.

4: INSTALLEER CUDA 11 + 12 TOOLKITS

De verschillende pakketten die in Musubi worden geïnstalleerd, hebben verschillende versies van NVIDIA CUDA nodig, die de training op NVIDIA-grafische kaarten versnelt en optimaliseert.

De reden waarom we de Visual Studio-versies eerst hebben geïnstalleerd, is dat de NVIDIA CUDA-installers zoeken naar en integreren met bestaande Visual Studio-installaties.

Download een 11+ serie CUDA-installatiepakket van:

https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (download ‘exe (local’))

Download een 12+ serie CUDA Toolkit-installatiepakket van:

https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64

Het installatieproces is identiek voor beide installers. Negeer eventuele waarschuwingen over het bestaan of niet-bestaan van installatiepaden in Windows-omgevingsvariabelen – we zullen ons daar later mee bezighouden.

INSTALLEER NVIDIA CUDA TOOLKIT V11+

Start de installer voor de 11+ serie CUDA Toolkit.

Bij Installation Options kiest u Custom (Advanced) en gaat u verder.

Ontvink de NVIDIA GeForce Experience-optie en klik op Next.

Laat Select Installation Location op standaardwaarden staan (dit is belangrijk):

Klik op Next en laat de installatie afronden.

Negeer eventuele waarschuwingen of notities die de installer geeft over Nsight Visual Studio-integratie, die niet nodig is voor ons gebruik.

INSTALLEER NVIDIA CUDA TOOLKIT V12+

Herhaal het gehele proces voor de afzonderlijke 12+ NVIDIA Toolkit-installer die u hebt gedownload:

Het installatieproces voor deze versie is identiek aan dat van de 11+ versie (hierboven), behalve één waarschuwing over omgevingspaden, die u kunt negeren:

Wanneer de 12+ CUDA-versie-installatie is voltooid, opent u een opdrachtprompt in Windows en typt u in en voert u uit:

nvcc --version

Dit moet informatie over de geïnstalleerde stuurprogrammaversie bevestigen:

Om te controleren of uw kaart wordt herkend, typt u in en voert u uit:

nvidia-smi

5: INSTALLEER GIT

GIT zal de installatie van het Musubi-repository op uw lokale machine afhandelen. Download de GIT-installer van:

https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Voer de installer uit:

Gebruik standaardinstellingen voor Select Components:

Laat de standaardeditor op Vim staan:

Laat GIT beslissen over branchnamen:

Gebruik aanbevolen instellingen voor de Path-omgeving:

Gebruik aanbevolen instellingen voor SSH:

Gebruik aanbevolen instellingen voor HTTPS Transport backend:

Gebruik aanbevolen instellingen voor lijneinde-conversies:

Kies Windows-standaardconsole als Terminal Emulator:

Gebruik standaardinstellingen (Fast-forward or merge) voor Git Pull:

Gebruik Git-Credential Manager (de standaardinstelling) voor Credential Helper:

In Configuring extra options laat u Enable file system caching aangevinkt en Enable symbolic links uitgevinkt (tenzij u een geavanceerde gebruiker bent die harde links gebruikt voor een centraal modelrepository).

Voltooi de installatie en test of Git correct is geïnstalleerd door een CMD-venster te openen en in te voeren:

git --version

GITHUB LOGIN

Later, wanneer u probeert GitHub-repositories te klonen, kunt u worden uitgedaagd voor uw GitHub-referenties. Om dit te anticiperen, logt u in op uw GitHub-account (maakt u er een aan als dat nodig is) op elke browser die op uw Windows-systeem is geïnstalleerd. Op deze manier moet de 0Auth-verificatiemethode (een pop-upvenster) zo min mogelijk tijd in beslag nemen.

Nadat u voor het eerst bent uitgedaagd, blijft u automatisch aangemeld.

6: INSTALLEER CMAKE

CMake 3.21 of nieuwer is vereist voor delen van het installatieproces van Musubi. CMake is een cross-platform-ontwikkelingsarchitectuur die in staat is om diverse compilers te orkestreren en software vanuit broncode te compileren.

Download het van:

https://cmake.org/download/ (‘Windows x64 Installer’)

Voer de installer uit:

Zorg ervoor dat Add Cmake to the PATH environment variable is aangevinkt.

Druk op Next.

Typ in en voer uit deze opdracht in een Windows-opdrachtprompt:

cmake --version

Als CMake succesvol is geïnstalleerd, moet het iets zoals dit weergeven:

cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: INSTALLEER PYTHON 3.10

De Python-interpreter is essentieel voor dit project. Download de 3.10-versie (de beste compromis tussen de verschillende eisen van Musubi-pakketten) van:

https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)

Voer de download-installer uit en laat deze op standaardinstellingen staan:

Aan het einde van het installatieproces klikt u op Disable path length limit (vereist UAC-beheerdersbevestiging):

Typ in en voer uit in een Windows-opdrachtprompt:

python --version

Dit moet Python 3.10.0 opleveren

CONTROLEER PADEN

Het klonen en installeren van de Musubi-kaders, evenals de normale werking na installatie, vereist dat de componenten de paden naar verschillende belangrijke externe componenten in Windows kennen, met name CUDA.

We moeten dus de padomgeving openen en controleren of alle vereisten erin staan.

Een snelle manier om toegang te krijgen tot de besturingselementen voor Windows-omgeving is door Edit the system environment variables in de Windows-zoekbalk in te voeren.

Door hierop te klikken, opent u het System Properties-configuratiepaneel. In de rechterbenedenhoek van System Properties klikt u op de Environment Variables-knop en opent u een venster met de naam Environment Variables. In het System Variables-paneel in de onderste helft van dit venster, scrolt u omlaag naar Path en dubbelklikt u erop. Dit opent een venster met de naam Edit environment variables. Trek de breedte van dit venster wijder, zodat u de volledige paden van de variabelen kunt zien:

Hier zijn de belangrijke ingangen:

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin

In de meeste gevallen zouden de correcte padvariabelen al aanwezig moeten zijn.

Voeg eventuele ontbrekende paden toe door New links van het Edit environment variable-venster te klikken en het correcte pad te plakken:

Voeg geen paden toe door ze alleen maar te kopiëren en plakken uit de hierboven vermelde paden; controleer of elk equivalent pad in uw eigen Windows-installatie bestaat.

Als er kleine padvariaties zijn (met name met Visual Studio-installaties), gebruikt u de paden hierboven om de correcte doelmappen te vinden (d.w.z. x64 in Host64 in uw eigen installatie). Plak die paden vervolgens in het Edit environment variable-venster.

Na dit alles, start u de computer opnieuw.

INSTALLEER MUSUBI

UPGRADE PIP

Het gebruik van de laatste versie van de PIP-installer kan sommige installatiestadia vereenvoudigen. Typ in een Windows-opdrachtprompt met beheerdersrechten (zie Elevation hieronder) en voer uit:

pip install --upgrade pip

VERHEFFING

Sommige opdrachten kunnen verhoogde privileges vereisen (d.w.z. moeten worden uitgevoerd als beheerder). Als u foutberichten over machtigingen krijgt in de volgende fasen, sluit u het opdrachtpromptvenster en opent u het opnieuw in beheerdersmodus door CMD in de Windows-zoekbalk in te voeren, met de rechtermuisknop op Command Prompt te klikken en Run as administrator te selecteren:

Vanaf nu zullen we Windows Powershell gebruiken in plaats van de Windows-opdrachtprompt. U kunt dit vinden door Powershell in de Windows-zoekbalk in te voeren en (indien nodig) met de rechtermuisknop erop te klikken en Run as administrator te selecteren:

INSTALLEER TORCH

In Powershell, typt u in en voert u uit:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

Wees geduldig terwijl de vele pakketten worden geïnstalleerd.

Wanneer de installatie is voltooid, kunt u een GPU-geactiveerde PyTorch-installatie verifiëren door in te voeren en uit te voeren:

python -c "import torch; print(torch.cuda.is_available())"

Dit moet True opleveren

INSTALLEER TRITON VOOR WINDOWS

Vervolgens de installatie van de Triton for Windows-component. In verhoogde Powershell voert u uit (op één regel):

pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl

(De installer triton-3.1.0-cp310-cp310-win_amd64.whl werkt voor zowel Intel- als AMD-CPU’s, zolang de architectuur 64-bit is en de omgeving overeenkomt met de Python-versie)

Na het uitvoeren, zou dit moeten resulteren in:

Successfully installed triton-3.1.0

We kunnen controleren of Triton werkt door het te importeren in Python. Voer deze opdracht uit:

python -c "import triton; print('Triton is working')"

Dit zou Triton is working moeten weergeven

Om te controleren of Triton GPU-geactiveerd is, voert u uit:

python -c "import torch; print(torch.cuda.is_available())"

Dit zou True moeten weergeven:

MAAK DE VIRTUELE OMGEVING VOOR MUSUBI

Vanaf nu zullen we alle verdere software installeren in een Python-virtuele omgeving (of venv). Dit betekent dat alles wat u hoeft te doen om alle volgende software te verwijderen, is het venv-installatiemapje naar de prullenbak slepen.

Laten we die installatiemap maken: maak een map met de naam Musubi op uw bureaublad. De volgende voorbeelden gaan ervan uit dat deze map bestaat: C:\Users\[Uw profielnaam]\Desktop\Musubi\.

In Powershell, navigeert u naar die map door in te voeren:

cd C:\Users\[Uw profielnaam]\Desktop\Musubi

We willen dat de virtuele omgeving toegang heeft tot wat we al hebben geïnstalleerd (vooral Triton), dus we zullen de --system-site-packages-vlag gebruiken. Voer uit:

python -m venv --system-site-packages musubi

Wacht tot de omgeving is gemaakt en activeer deze door in te voeren:

.\musubi\Scripts\activate

Vanaf dit punt kunt u zien dat u in de geactiveerde virtuele omgeving bent door het feit dat (musubi) aan het begin van al uw prompts verschijnt.

KLONEER HET REPOSITORY

Navigeer naar de zojuist gemaakte musubi-map (die zich binnen de Musubi-map op uw bureaublad bevindt):

cd musubi

Nu we op de juiste plek zijn, voert u de volgende opdracht uit:

git clone https://github.com/kohya-ss/musubi-tuner.git

Wacht tot het klonen is voltooid (het zal niet lang duren).

INSTALLEER VEREISTEN

Navigeer naar de installatiemap:

cd musubi-tuner

Voer uit:

pip install -r requirements.txt

Wacht tot de vele installaties zijn voltooid (dit zal langer duren).

GEAUTOMATISEERDE TOEGANG TOT DE HUNYUAN VIDEO VENV

Om gemakkelijk toegang te krijgen tot de nieuwe venv voor toekomstige sessies, plakt u de volgende tekst in Kladblok en slaat u deze op met de naam activate.bat, en slaat u deze op met de optie Alle bestanden (zie afbeelding hieronder).

@echo off

call C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\Scripts\activate

cd C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner

cmd

(Vervang [Uw profielnaam] door de werkelijke naam van uw Windows-profielmap)

Het maakt niet uit waar u dit bestand opslaat.

Vanaf nu kunt u dubbelklikken op activate.bat en meteen beginnen.

GEBRUIK MUSUBI TUNER

DOWNLOAD DE MODELEN

Het Hunyuan Video LoRA-trainingsproces vereist het downloaden van ten minste zeven modellen om alle mogelijke optimalisatie-opties voor pre-caching en training van een Hunyuan video LoRA te ondersteunen. Samen wegen deze modellen meer dan 60 GB.

Huidige instructies voor het downloaden ervan zijn te vinden op https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download

Hoewel deze de downloadinstructies zijn op het moment van schrijven:

clip_l.safetensors
llava_llama3_fp16.safetensors
en
llava_llama3_fp8_scaled.safetensors
kunnen worden gedownload op:
https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders

mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt
en
mp_rank_00_model_states_fp8_map.pt
kunnen worden gedownload op:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers

pytorch_model.pt
kan worden gedownload op:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae

Hoewel u ze in elke map kunt plaatsen die u wilt, is het voor consistentie met latere scripting het beste om ze in te plaatsen:

C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\models\

Dit is consistent met de directory-opstelling voorafgaand aan dit punt. Vergeet niet [Uw profielnaam] te vervangen door de werkelijke naam van uw Windows-profielmap.

DATASETVOORBEREIDING

Het is redelijk om te zeggen dat u tussen de 10-100 foto’s nodig hebt voor een trainingsdataset voor uw Hunyuan LoRA. Zeer goede resultaten kunnen worden behaald, zelfs met 15 afbeeldingen, zolang de afbeeldingen goed gebalanceerd en van goede kwaliteit zijn.

Een Hunyuan LoRA kan worden getraind op zowel afbeeldingen als zeer korte en lage-resolutievideo’s, of zelfs een combinatie van beide – hoewel het gebruik van video’s als trainingsgegevens uitdagend is, zelfs voor een 24 GB-kaart.

Video’s zijn echter alleen echt nuttig als uw personage op een ongebruikelijke manier beweegt die het Hunyuan Video-foundation model misschien niet kent, of kan raden.

Voorbeelden zijn Roger Rabbit, een xenomorph, The Mask, Spider-Man of andere personages die unieke karakteristieke beweging bezitten.

Aangezien Hunyuan Video al weet hoe gewone mannen en vrouwen bewegen, zijn video’s niet nodig om een overtuigend Hunyuan Video LoRA-menselijk type-personage te verkrijgen. Dus we gebruiken statische afbeeldingen.

AFBEELDINGVOORBEREIDING

HET EMMERLIJSTJE

De TLDR-versie:

Het is het beste om afbeeldingen te gebruiken die allemaal dezelfde grootte hebben voor uw dataset, of een 50/50-verdeling tussen twee verschillende groottes, d.w.z. 10 afbeeldingen die 512x768px zijn en 10 die 768x512px zijn.

De training kan goed verlopen, zelfs als u dit niet doet – Hunyuan Video LoRAs kunnen verrassend vergevend zijn.

De langere versie

Net als bij Kohya-ss LoRAs voor statische generatieve systemen zoals Stable Diffusion, wordt bucketing gebruikt om de workload over afbeeldingen van verschillende groottes te verdelen, waardoor grotere afbeeldingen kunnen worden gebruikt zonder dat er out-of-memory-fouten optreden tijdens de training (d.w.z. bucketing ‘snijdt’ de afbeeldingen in stukken die de GPU aankan, terwijl de semantische integriteit van de hele afbeelding behouden blijft).

Voor elke afbeeldingsgrootte die u in uw trainingsdataset opneemt (d.w.z. 512x768px), wordt een bucket of ‘subtaak’ gemaakt voor die grootte. Dus als u de volgende verdeling van afbeeldingen heeft, wordt de bucket-aandacht ongelijkmatig verdeeld en bestaat het risico dat sommige foto’s meer aandacht krijgen in de training dan andere:

2x 512x768px-afbeeldingen
7x 768x512px-afbeeldingen
1x 1000x600px-afbeelding
3x 400x800px-afbeeldingen

We kunnen zien dat de bucket-aandacht onder deze afbeeldingen ongelijkmatig verdeeld is:

Daarom is het het beste om één formaatgrootte aan te houden of proberen de verdeling van verschillende groottes relatief gelijk te houden.

Verder is het beter om zeer grote afbeeldingen te vermijden, aangezien dit de training kan vertragen, zonder enig voordeel.

Om het eenvoudig te houden, heb ik voor alle foto’s in mijn dataset 512x768px gebruikt.

Disclaimer: Het model (persoon) dat in de dataset wordt gebruikt, heeft me toestemming gegeven om deze afbeeldingen voor dit doel te gebruiken en heeft alle door AI gegenereerde uitvoer die hun gelijkenis weergeeft, goedgekeurd.

Mijn dataset bestaat uit 40 afbeeldingen in PNG-formaat (hoewel JPG ook prima is). Mijn afbeeldingen zijn opgeslagen in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman

U moet een cache-map maken in de trainingsafbeeldingsmap:

Laten we nu een speciaal bestand maken dat de training zal configureren.

TOML-BESTANDEN

Het Hunyuan Video LoRA-trainings- en pre-cacheproces haalt de bestandspaden op uit een platte tekstbestand met de .toml-extensie.

Voor mijn test is het TOML-bestand gelegen in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml

De inhoud van mijn trainings-TOML ziet er zo uit:

[general]

resolution = [512, 768]

caption_extension = ".txt"

batch_size = 1

enable_bucket = true

bucket_no_upscale = false

[[datasets]]

image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"

cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"

num_repeats = 1

(De dubbele back-slashes voor afbeeldings- en cache-mappen zijn niet altijd nodig, maar ze kunnen helpen om fouten te voorkomen in gevallen waarin er een spatie in het pad is. Ik heb modellen getraind met.toml-bestanden die enkele voorwaartse en enkele achterwaartse slashes gebruikten)

We kunnen zien in de resolution-sectie dat twee resoluties in aanmerking worden genomen – 512px en 768px. U kunt deze ook op 512 laten staan en nog steeds goede resultaten behalen.

ONDERTEKSTEN

Hunyuan Video is een tekst+visie foundation model, dus we hebben beschrijvende onderteksten nodig voor deze afbeeldingen, die tijdens de training in aanmerking worden genomen. Het trainingsproces zal mislukken zonder onderteksten.

Er zijn een overvloed aan open source-ondersteunende systemen die we hiervoor kunnen gebruiken, maar laten we het eenvoudig houden en taggui gebruiken. Hoewel het op GitHub wordt opgeslagen en hoewel het enkele zware diepe leermodellen downloadt bij de eerste uitvoering, komt het in de vorm van een eenvoudige Windows-executeerbaar bestand dat Python-bibliotheken en een eenvoudige GUI laadt.

Nadat u Taggui heeft gestart, gebruikt u Bestand > Map laden om naar uw afbeeldingsdataset te navigeren en optioneel een token-identifier (in dit geval examplewoman) die aan alle onderteksten wordt toegevoegd:

(Zorg ervoor dat u Laad in 4-bits uitschakelt wanneer Taggui voor het eerst opent – het zal fouten tijdens het ondertekenen veroorzaken als dit is ingeschakeld)

Selecteer een afbeelding in de linkerkolom met miniaturen en druk op CTRL+A om alle afbeeldingen te selecteren. Druk vervolgens op de knop Start Auto-Captioning rechts:

U zult zien dat Taggui modellen downloadt in de kleine CLI in de rechterkolom, maar alleen als dit de eerste keer is dat u de ondertitelingsfunctie gebruikt. Anders ziet u een voorbeeld van de onderteksten.

Elke foto heeft nu een overeenkomende.txt-ondersteuning met een beschrijving van de afbeeldingsinhoud:

U kunt Geavanceerde opties klikken in Taggui om de lengte en stijl van de onderteksten te verhogen, maar dat valt buiten het bestek van deze doorloop.

Sluit Taggui en laten we doorgaan met…

LATENTE PRE-CACHING

Om excessieve GPU-belasting tijdens de training te voorkomen, is het nodig om twee soorten pre-gecacheerde bestanden te maken – één om de latent afgeleide afbeelding af te leiden uit de afbeeldingen zelf, en een andere om een tekstencodering te evalueren die verband houdt met ondertekstinhoud.

Om alle drie processen (2x cache + training) te vereenvoudigen, kunt u interactieve.BAT-bestanden gebruiken die u vragen zullen stellen en de processen zullen uitvoeren wanneer u de nodige informatie heeft verstrekt.

Voor de latent pre-caching kopieert u de volgende tekst naar Kladblok en slaat u deze op als een.BAT-bestand (d.w.z. noem het iets als latent-precache.bat), zoals eerder, waarbij u ervoor zorgt dat het bestandstype in het Save As-dialoogvenster Alle bestanden is (zie afbeelding hieronder):

@echo off

REM Activeer de virtuele omgeving

call C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Krijg gebruikersinvoer

set /p IMAGE_PATH=Voer het pad naar de afbeeldingsmap in:

set /p CACHE_PATH=Voer het pad naar de cache-map in:

set /p TOML_PATH=Voer het pad naar het TOML-bestand in:

echo U hebt ingevoerd:

echo Afbeeldingspad: %IMAGE_PATH%

echo Cache-pad: %CACHE_PATH%

echo TOML-bestandspad: %TOML_PATH%

set /p CONFIRM=Wil je doorgaan met latent pre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM Voer het latent pre-caching-script uit

python C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling

) else (

echo Operatie geannuleerd.

)

REM Houd het venster open

pause

(Vervang [Uw profielnaam] door de werkelijke naam van uw Windows-profielmap)

U kunt nu het.BAT-bestand voor automatische latent caching uitvoeren:

Wanneer u wordt gevraagd door de verschillende vragen van het.BAT-bestand, plakt u het pad naar uw dataset, cache-mappen en TOML-bestand.

TEKST PRE-CACHING

We zullen een tweede.BAT-bestand maken, deze keer voor tekst pre-caching.

@echo off

REM Activeer de virtuele omgeving

call C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Krijg gebruikersinvoer

set /p IMAGE_PATH=Voer het pad naar de afbeeldingsmap in:

set /p CACHE_PATH=Voer het pad naar de cache-map in:

set /p TOML_PATH=Voer het pad naar het TOML-bestand in:

echo U hebt ingevoerd:

echo Afbeeldingspad: %IMAGE_PATH%

echo Cache-pad: %CACHE_PATH%

echo TOML-bestandspad: %TOML_PATH%

set /p CONFIRM=Wil je doorgaan met tekstencoderuitvoerpre-caching (y/n)?

if /i "%CONFIRM%"=="y" (

REM Gebruik de python-executeerbaar uit de virtuele omgeving

python C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16

) else (

echo Operatie geannuleerd.

)

REM Houd het venster open

pause

Vervang uw Windows-profielnaam en sla dit op als text-cache.bat (of elke andere naam die u wilt), op elke handige locatie, volgens de procedure voor het vorige.BAT-bestand.

Voer dit nieuwe.BAT-bestand uit, volg de instructies en de nodige tekst-gecodeerde bestanden zullen verschijnen in de cache-map:

TRAINING VAN DE HUNYUAN VIDEO LORA

Het trainen van de daadwerkelijke LoRA zal aanzienlijk langer duren dan deze twee voorbereidingsprocessen.

Hoewel er ook meerdere variabelen zijn waar we ons zorgen over kunnen maken (zoals batchgrootte, herhalingen, epochs en of we volledige of gequantificeerde modellen moeten gebruiken, onder andere), zullen we die overwegingen voor een andere dag en een diepere kijk op de nuances van LoRA-creatie bewaren.

Om de keuzes een beetje te beperken, laten we een LoRA trainen op ‘mediaan’-instellingen.

We zullen een derde.BAT-bestand maken, deze keer om de training te initiëren. Kopieer deze tekst naar Kladblok en sla deze op als een.BAT-bestand, zoals eerder, als training.bat (of elke andere naam die u wilt):

@echo off

REM Activeer de virtuele omgeving

call C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Krijg gebruikersinvoer

set /p DATASET_CONFIG=Voer het pad naar het datasetconfiguratiebestand in:

set /p EPOCHS=Voer het aantal epochs in om te trainen:

set /p OUTPUT_NAME=Voer de uitvoernaam van het model in (bijv. example0001):

set /p LEARNING_RATE=Kies de leerfactor (1 voor 1e-3, 2 voor 5e-3, standaard 1e-3):

if "%LEARNING_RATE%"=="1" set LR=1e-3

if "%LEARNING_RATE%"=="2" set LR=5e-3

if "%LEARNING_RATE%"=="" set LR=1e-3

set /p SAVE_STEPS=Hoe vaak (in stappen) moet het model preview-afbeeldingen opslaan?

set /p SAMPLE_PROMPTS=Waar is de locatie van het tekstpromptbestand voor trainingsvoorbeelden?

echo U hebt ingevoerd:

echo Datasetconfiguratiebestand: %DATASET_CONFIG%

echo Aantal epochs: %EPOCHS%

echo Uitvoernaam: %OUTPUT_NAME%

echo Leerfactor: %LR%

echo Sla preview-afbeeldingen op elke %SAVE_STEPS% stappen.

echo Tekstpromptbestand: %SAMPLE_PROMPTS%

REM Bereid de opdracht voor

set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^

C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^

--dit C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^

--dataset_config %DATASET_CONFIG% ^

--sdpa ^

--mixed_precision bf16 ^

--fp8_base ^

--optimizer_type adamw8bit ^

--learning_rate %LR% ^

--gradient_checkpointing ^

--max_data_loader_n_workers 2 ^

--persistent_data_loader_workers ^

--network_module=networks.lora ^

--network_dim=32 ^

--timestep_sampling sigmoid ^

--discrete_flow_shift 1.0 ^

--max_train_epochs %EPOCHS% ^

--save_every_n_epochs=1 ^

--seed 42 ^

--output_dir "C:\Users\[Uw profielnaam]\Desktop\Musubi\Output Models" ^

--output_name %OUTPUT_NAME% ^

--vae C:/Users/[Uw profielnaam]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^

--vae_chunk_size 32 ^

--vae_spatial_tile_sample_min_size 128 ^

--text_encoder1 C:/Users/[Uw profielnaam]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^

--text_encoder2 C:/Users/[Uw profielnaam]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^

--sample_prompts %SAMPLE_PROMPTS% ^

--sample_every_n_steps %SAVE_STEPS% ^

--sample_at_first

echo De volgende opdracht zal worden uitgevoerd:

echo %CMD%

set /p CONFIRM=Wil je doorgaan met training (y/n)?

if /i "%CONFIRM%"=="y" (

%CMD%

) else (

echo Operatie geannuleerd.

)

REM Houd het venster open

cmd /k

Zoals gewoonlijk moet u alle instanties van [Uw profielnaam] vervangen door uw werkelijke Windows-profielnaam.

Zorg ervoor dat de map C:\Users\[Uw profielnaam]\Desktop\Musubi\Output Models\ bestaat en maak deze op die locatie als deze nog niet bestaat.

TRAININGVOORBEELDEN

Er is een zeer basale trainingspreview-functie ingeschakeld voor Musubi-trainer, die u in staat stelt de trainingsmodel te laten pauzeren en afbeeldingen te genereren op basis van prompts die u hebt opgeslagen. Deze worden opgeslagen in een automatisch gemaakte map met de naam Sample, in dezelfde directory waarin de getrainde modellen worden opgeslagen.

Om dit te inschakelen, moet u ten minste één prompt in een tekstbestand opslaan. Het trainings-BAT dat we hebben gemaakt, zal u vragen de locatie van dit bestand in te voeren; u kunt het promptbestand daarom elke naam geven die u wilt en opslaan op elke locatie.

Hier zijn enkele voorbeelden van prompts voor een bestand dat drie verschillende afbeeldingen zal produceren wanneer dit wordt aangevraagd door de trainingsroutine:

U kunt zien dat u vlaggen aan het einde van de prompt kunt toevoegen die de gegenereerde afbeeldingen beïnvloeden:

–w is breedte (standaard 256px als niet ingesteld, volgens de documentatie)
–h is hoogte (standaard 256px als niet ingesteld)
–f is het aantal frames. Als ingesteld op 1, wordt een afbeelding gegenereerd; meer dan één, een video.
–d is de zaad. Als niet ingesteld, is het willekeurig; maar u moet het instellen om één prompt te zien evolueren.
–s is het aantal stappen in de generatie, standaard 20.

Zie de officiële documentatie voor extra vlaggen.

Hoewel trainingsvoorbeelden snel enkele problemen kunnen onthullen die u ertoe kunnen brengen de training te annuleren en de gegevens of de instellingen opnieuw te bekijken, en zo tijd te besparen, moet u zich ervan bewust zijn dat elke extra prompt de training een beetje vertraagt.

Bovendien vertraagt de grotere breedte en hoogte van de trainingspreview-afbeelding (zoals ingesteld in de hierboven genoemde vlaggen) de training.

Start uw trainings-BAT-bestand.

Vraag #1 is ‘Voer het pad naar de datasetconfiguratie in’. Plak of typ het correcte pad naar uw TOML-bestand.

Vraag #2 is ‘Voer het aantal epochs in om te trainen’. Dit is een trial-and-error-variabele, omdat het wordt beïnvloed door de hoeveelheid en kwaliteit van de afbeeldingen, evenals de onderteksten en andere factoren. In het algemeen is het het beste om het te hoog in te stellen dan te laag, omdat u de training altijd met Ctrl+C in het trainingsvenster kunt stoppen als u voelt dat het model voldoende is geavanceerd. Stel het in op 100 in de eerste instantie en zie hoe het gaat.

Vraag #3 is ‘Voer de uitvoernaam van het model in’. Noem uw model! Het is misschien het beste om de naam redelijk kort en eenvoudig te houden.

Vraag #4 is ‘Kies de leerfactor’, die standaard is ingesteld op 1e-3 (optie 1). Dit is een goede plek om te beginnen, in afwachting van verdere ervaring.

Vraag #5 is ‘Hoe vaak (in stappen) moet het model preview-afbeeldingen opslaan? Als u dit te laag instelt, ziet u weinig vooruitgang tussen de opgeslagen preview-afbeeldingen, en dit zal de training vertragen.

Vraag #6 is ‘Waar is de locatie van het tekstpromptbestand voor trainingsvoorbeelden?’. Plak of typ het pad naar uw prompts-tekstbestand.

Het.BAT-bestand toont u vervolgens de opdracht die het naar het Hunyuan-model zal sturen en vraagt of u wilt doorgaan, y/n.

Ga door en begin met trainen:

Tijdens deze tijd ziet u in het GPU-gedeelte van het Prestatie-tabblad van Windows Taakbeheer dat het proces ongeveer 16 GB VRAM in beslag neemt.

Dit kan geen willekeurig getal zijn, aangezien dit het bedrag aan VRAM is dat op veel NVIDIA-grafische kaarten beschikbaar is, en de upstream-code kan zijn geoptimaliseerd om de taken in 16 GB te passen voor het voordeel van degenen die dergelijke kaarten bezitten.

Dat gezegd hebbende, is het heel gemakkelijk om dit gebruik te verhogen door meer buitensporige vlaggen naar de trainingsopdracht te sturen.

Tijdens de training ziet u in de rechterbenedenhoek van het CMD-venster een getal voor de tijd die is verstreken sinds de training is gestart, en een schatting van de totale trainingsduur (die zwaar kan variëren, afhankelijk van vlaggen, aantal trainingsafbeeldingen, aantal trainingspreview-afbeeldingen en verschillende andere factoren).

Een typische trainingsduur is ongeveer 3-4 uur op mediane instellingen, afhankelijk van de beschikbare hardware, het aantal afbeeldingen, vlaginstellingen en andere factoren.

UW GETRAINDE LORA-MODELLEN GEBRUIKEN IN HUNYUAN VIDEO

KEUZEN VAN CONTROLEPUNTEN

Wanneer de training is voltooid, hebt u een modelcontrolepunt voor elke epoch van de training.

Deze opslagfrequentie kan door de gebruiker worden gewijzigd door het --save_every_n_epochs [N]-nummer in het trainings-BAT-bestand te wijzigen. Als u een laag getal voor opslag-per-stappen hebt ingesteld bij het instellen van de training met het BAT-bestand, zijn er een groot aantal opgeslagen controlepuntbestanden.

WELK CONTROLEPUNT MOET U KIEZEN?

Zoals eerder vermeld, zullen de vroegst getrainde modellen het meest flexibel zijn, terwijl de latere controlepunten mogelijk meer detail kunnen bieden. De enige manier om dit te testen is door enkele van de LoRAs uit te voeren en enkele video’s te genereren. Op deze manier kunt u leren welke controlepunten het meest productief zijn en het beste evenwicht tussen flexibiliteit en geloofwaardigheid vertegenwoordigen.

COMFYUI

De meest populaire (hoewel niet de enige) omgeving voor het gebruik van Hunyuan Video LoRAs op dit moment is ComfyUI, een node-gebaseerde editor met een geavanceerde Gradio-interface die in uw webbrowser wordt uitgevoerd.

Bron: https://github.com/comfyanonymous/ComfyUI

Bron: https://github.com/comfyanonymous/ComfyUI

Installatie-instructies zijn rechttoe rechtaan en beschikbaar op het officiële GitHub-repository (aanvullende modellen moeten worden gedownload).

CONVERTEREN VAN MODELEN VOOR COMFYUI

Uw getrainde modellen zijn opgeslagen in een (diffusers) formaat dat niet compatibel is met de meeste ComfyUI-implementaties. Musubi kan een model converteren naar een ComfyUI-compatibel formaat. Laten we een.BAT-bestand instellen om deze conversie uit te voeren.

Voordat u dit.BAT-bestand uitvoert, maakt u de C:\Users\[Uw profielnaam]\Desktop\Musubi\CONVERTED\-map die het script verwacht.

@echo off

REM Activeer de virtuele omgeving

call C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\Scripts\activate.bat

:START

REM Krijg gebruikersinvoer

set /p INPUT_PATH=Voer het pad naar het invoer-Musubi safetensors-bestand in (of typ "exit" om te stoppen):

REM Stop als de gebruiker "exit" typt

if /i "%INPUT_PATH%"=="exit" goto END

REM Haal de bestandsnaam op uit het invoerpad en voeg 'converted' toe

for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF

set OUTPUT_PATH=C:\Users\[Uw profielnaam]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors

set TARGET=other

echo U hebt ingevoerd:

echo Invoerbestand: %INPUT_PATH%

echo Uitvoerbestand: %OUTPUT_PATH%

echo Doelformaat: %TARGET%

set /p CONFIRM=Wil je doorgaan met de conversie (y/n)?

if /i "%CONFIRM%"=="y" (

REM Voer het conversiescript uit met correct gequote paden

python C:\Users\[Uw profielnaam]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%

echo Conversie voltooid.

) else (

echo Operatie geannuleerd.

)

REM Ga terug naar start voor een ander bestand

goto START

:END

REM Houd het venster open

echo Script afgesloten.

pause

Zoals eerder, slaat u het script op als ‘Alle bestanden’ vanuit Kladblok, waarbij u het convert.bat noemt (of elke andere naam die u wilt).

Als u dit nieuwe.BAT-bestand uitvoert, wordt u gevraagd de locatie van een bestand op te geven om te converteren.

Plak of typ het pad naar het getrainde bestand dat u wilt converteren, typ y en druk op Enter.

Nadat u het geconverteerde LoRA heeft opgeslagen in de CONVERTED-map, zal het script vragen of u een ander bestand wilt converteren. Als u meerdere controlepunten wilt testen in ComfyUI, converteert u een selectie van de modellen.

Wanneer u voldoende controlepunten hebt geconverteerd, sluit u het.BAT-opdrachtvenster.

U kunt uw geconverteerde modellen nu kopiëren naar de models\loras-map in uw ComfyUI-installatie.

Typisch is de juiste locatie iets als:

C:\Users\[Uw profielnaam]\Desktop\ComfyUI\models\loras\

HUNYUAN VIDEO LORA’S MAKEN IN COMFYUI

Hoewel de node-gebaseerde workflows van ComfyUI aanvankelijk complex lijken, kunnen de instellingen van andere meer ervaren gebruikers worden geladen door een afbeelding (gemaakt met de ComfyUI van een andere gebruiker) rechtstreeks in het ComfyUI-venster te slepen. Workflows kunnen ook als JSON-bestanden worden geëxporteerd, die handmatig of door ze rechtstreeks in een ComfyUI-venster te slepen, kunnen worden geïmporteerd.

Sommige geïmporteerde workflows hebben afhankelijkheden die mogelijk niet in uw installatie bestaan. Daarom moet u ComfyUI-Manager installeren, die ontbrekende modules automatisch kan ophalen.

Bron: https://github.com/ltdrdata/ComfyUI-Manager

Bron: https://github.com/ltdrdata/ComfyUI-Manager

Om een van de workflows te laden die zijn gebruikt om video’s te genereren van de modellen in deze tutorial, downloadt u dit JSON-bestand en sleept u het naar uw ComfyUI-venster (hoewel er veel betere workflowvoorbeelden beschikbaar zijn op de verschillende Reddit- en Discord-gemeenschappen die Hunyuan Video hebben geadopteerd, en de mijne is aangepast van een van deze).

Dit is niet de plek voor een uitgebreide tutorial over het gebruik van ComfyUI, maar het is de moeite waard om enkele van de cruciale parameters te noemen die uw uitvoer zullen beïnvloeden als u het JSON-layout downloadt dat ik hierboven heb gelinkt.

1) BREEDTE EN HOOGTE

De grotere uw afbeelding, des te langer de generatie zal duren, en des te groter het risico op een out-of-memory (OOM)-fout.

2) LENGTE

Dit is het numerieke waarde voor het aantal frames. Hoeveel seconden het zich ophoopt, hangt af van de framefrequentie (ingesteld op 30 fps in deze lay-out). U kunt seconden>frames omrekenen op basis van fps op Omnicalculator.

3) BATCHGROOTE

Hoe hoger u de batchgrootte instelt, des te sneller het resultaat kan komen, maar des te groter de belasting van de VRAM. Stel deze te hoog in en u kunt een OOM krijgen.

4) CONTROLE NA GENEREREN

Dit controleert de willekeurige zaad. De opties voor deze subnode zijn fixed, increment, decrement en randomize. Als u het op fixed laat staan en de tekstprompt niet wijzigt, krijgt u elke keer dezelfde afbeelding. Als u de tekstprompt wijzigt, zal de afbeelding enigszins veranderen. De increment– en decrement-instellingen laten u toe om nabije zaadwaarden te verkennen, terwijl randomize u een volledig nieuwe interpretatie van de prompt geeft.

5) LORA-NAAM

U moet uw eigen geïnstalleerde model hier selecteren voordat u probeert te genereren.

6) TOKEN

Als u uw model hebt getraind om het concept te activeren met een token (zoals ‘example-person’), voegt u dat triggerwoord toe aan uw prompt.

7) STAPPEN

Dit vertegenwoordigt het aantal stappen dat het systeem zal toepassen op het diffuseerproces. Hogere stappen kunnen meer detail opleveren, maar er is een plafond voor hoe effectief deze benadering is, en dat plafond kan moeilijk te vinden zijn. Het gebruikelijke bereik van stappen is ongeveer 20-30.

8) TEILEN GROOTE

Dit definieert hoeveel informatie tegelijk wordt verwerkt tijdens de generatie. Het is standaard ingesteld op 256. Het verhogen van de waarde kan de generatie versnellen, maar het verhogen van de waarde te veel kan leiden tot een bijzonder frustrerende OOM-ervaring, omdat deze optreedt aan het einde van een lang proces.

9) TEMPORAAL OVERLAP

Hunyuan Video-generatie van personen kan leiden tot ‘ghosting’ of onovertuigende beweging als deze te laag is ingesteld. In het algemeen is de huidige wijsheid dat deze moet worden ingesteld op een hogere waarde dan het aantal frames, om betere beweging te produceren.

CONCLUSIE

Hoewel verdere exploratie van ComfyUI-gebruik buiten het bereik van dit artikel valt, kan community-ervaring op Reddit en Discords de leercurve vergemakkelijken, en er zijn verschillende online-gidsen die de basis introduceren.

 

Publicatie op donderdag 23 januari 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai