Modelli e piattaforme di IA

Come Addestrare e Utilizzare i Modelli LoRA di Hunyuan Video

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
ChatGPT-4o: Variation on 'Create me an image 1792 x 1024. It should be in the style of Théodore Géricault, and should depict a dark medieval figure seated in front of a laptop, illuminated by the screen. We are facing the figure, and can only see the back of the laptop lid. Around the seated medieval figure are many other medieval men and women, curious as to what is happening on the computer screen'

Questo articolo ti mostrerà come installare e utilizzare software basato su Windows in grado di addestrare i modelli LoRA di Hunyuan Video, consentendo all’utente di generare personalità personalizzate nel modello di base di Hunyuan Video:

Fai clic per riprodurre. Esempi dell’ultima esplosione di celebrità Hunyuan LoRA dalla community civit.ai.

Al momento, i due modi più popolari per generare modelli LoRA di Hunyuan localmente sono:

1) Il framework diffusion-pipe-ui basato su Docker, che si affida al sottosistema Windows per Linux (WSL) per gestire alcuni dei processi.

2) Musubi Tuner, una nuova aggiunta all’architettura di addestramento della diffusione Kohya ss popolare. Musubi Tuner non richiede Docker e non dipende da WSL o proxy Linux-based – ma può essere difficile da eseguire su Windows.

Pertanto, questo passo dopo passo si concentrerà su Musubi Tuner e sulla fornitura di una soluzione completamente locale per l’addestramento e la generazione di LoRA di Hunyuan, senza l’uso di siti web guidati da API o processi di noleggio GPU commerciali come Runpod.

Fai clic per riprodurre. Campioni dall’addestramento LoRA su Musubi Tuner per questo articolo. Tutti i permessi sono stati concessi dalla persona ritratta, per illustrare questo articolo.

REQUISITI

L’installazione richiederà almeno un PC Windows 10 con una scheda NVIDIA della serie 30+/40+ con almeno 12GB di VRAM (anche se 16GB è consigliato). L’installazione utilizzata per questo articolo è stata testata su una macchina con 64GB di RAM di sistema e una scheda grafica NVIDIA 3090 con 24GB di VRAM. È stato testato su un sistema di test dedicato utilizzando una nuova installazione di Windows 10 Professional, su una partizione con oltre 600GB di spazio disco disponibile.

AVVERTENZA

L’installazione di Musubi Tuner e dei suoi prerequisiti comporta anche l’installazione di software e pacchetti orientati allo sviluppatore direttamente sull’installazione principale di Windows di un PC. Considerando l’installazione di ComfyUI per le fasi finali, questo progetto richiederà circa 400-500 gigabyte di spazio su disco. Sebbene abbia testato la procedura senza incidenti diverse volte in ambienti di test di Windows 10 appena installati, né io né unite.ai siamo responsabili per eventuali danni ai sistemi derivanti dall’esecuzione di queste istruzioni. Consiglio di eseguire il backup di eventuali dati importanti prima di tentare questo tipo di procedura di installazione.

CONSIDERAZIONI

È Ancora Valido Questo Metodo?

La scena dell’intelligenza artificiale generativa si sta muovendo molto velocemente e possiamo aspettarci metodi migliori e più fluidi per i framework LoRA di Hunyuan Video quest’anno.

…o anche questa settimana! Mentre stavo scrivendo questo articolo, lo sviluppatore di Kohya/Musubi ha prodotto musubi-tuner-gui, una GUI Gradio sofisticata per Musubi Tuner:

È ovvio che un’interfaccia utente user-friendly sia preferibile ai file BAT che utilizzo in questa funzione – una volta che musubi-tuner-gui funziona. Mentre scrivo, è stato pubblicato solo cinque giorni fa e non riesco a trovare alcun resoconto di qualcuno che lo abbia utilizzato con successo.

Secondo i post nel repository, la nuova GUI è destinata a essere integrata direttamente nel progetto Musubi Tuner il più presto possibile, il che porrà fine alla sua esistenza come repository GitHub autonomo.

Basato sulle istruzioni di installazione attuali, la nuova GUI viene clonata direttamente nell’ambiente virtuale esistente di Musubi; e, nonostante molti sforzi, non riesco a farla associare all’installazione di Musubi esistente. Ciò significa che quando si esegue, si accorgerà di non avere alcun motore!

Una volta che la GUI sarà integrata in Musubi Tuner, problemi di questo tipo saranno sicuramente risolti. Sebbene l’autore ammetta che il nuovo progetto è ‘molto grezzo’, è ottimista per il suo sviluppo e integrazione diretta in Musubi Tuner.

Considerate questi problemi (anche relativi ai percorsi predefiniti al momento dell’installazione e all’uso del pacchetto Python UV, che complica alcune procedure nella nuova versione), probabilmente dovremo aspettare un po’ per un’esperienza di addestramento LoRA di Hunyuan Video più fluida. Tuttavia, sembra molto promettente!

Ma se non puoi aspettare e sei disposto a mettere le mani un po’, puoi far funzionare l’addestramento LoRA di Hunyuan localmente già adesso.

Iniziamo.

Perché Installare Qualsiasi Cosa su Bare Metal?

(Saltare questo paragrafo se non sei un utente avanzato)
Gli utenti avanzati si chiederanno perché ho scelto di installare così tanto software sulle bare metal di Windows 10 invece che in un ambiente virtuale. Il motivo è che l’essenziale port di Windows del pacchetto basato su Linux Triton è molto più difficile da far funzionare in un ambiente virtuale. Tutte le altre installazioni bare-metal nel tutorial non potevano essere installate in un ambiente virtuale, poiché devono interfacciarsi direttamente con l’hardware locale.

INSTALLAZIONE DEI PACCHETTI E PROGRAMMI PREREQUISITI

Per i programmi e i pacchetti che devono essere inizialmente installati, l’ordine di installazione è importante. Iniziamo.

1: Scaricare Microsoft Redistributable

Scaricare e installare il pacchetto Microsoft Redistributable da https://aka.ms/vs/17/release/vc_redist.x64.exe.

Questa è un’installazione rapida e semplice.

2: Installare Visual Studio 2022

Scaricare l’edizione Community di Microsoft Visual Studio 2022 da https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta

Avviare l’installer scaricato:

Non abbiamo bisogno di tutti i pacchetti disponibili, che sarebbero un’installazione lunga e pesante. Nella pagina iniziale Workloads che si apre, selezionare Sviluppo desktop con C++ (vedere immagine in basso).

Ora fare clic sulla scheda Componenti individuali in alto a sinistra e utilizzare la casella di ricerca per trovare ‘Windows SDK’.

Per impostazione predefinita, solo Windows 11 SDK è selezionato. Se si utilizza Windows 10 (la procedura di installazione non è stata testata da me su Windows 11), selezionare l’ultima versione di Windows 10, indicata nell’immagine in basso.

Cercare ‘C++ CMake’ e verificare che Strumenti C++ CMake per Windows sia selezionato.

Questa installazione richiederà almeno 13 GB di spazio.

Una volta installato Visual Studio, tenterà di eseguirsi sul computer. Lasciarlo aprire completamente. Quando l’interfaccia a schermo intero di Visual Studio sarà finalmente visibile, chiudere il programma.

3: Installare Visual Studio 2019

Alcuni dei pacchetti successivi per Musubi si aspettano una versione più vecchia di Microsoft Visual Studio, mentre altri ne richiedono una più recente.

Pertanto, scaricare anche l’edizione Community gratuita di Visual Studio 19 da Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – account richiesto) o Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).

Installare con le stesse opzioni di Visual Studio 2022 (procedura sopra, tranne che Windows SDK è già selezionato nell’installer di Visual Studio 2019).

Si vedrà che l’installer di Visual Studio 2019 è già a conoscenza della versione più recente mentre si installa:

Quando l’installazione è completa e si è aperto e chiuso l’applicazione Visual Studio 2019 installata, aprire un prompt dei comandi di Windows e digitare e eseguire:

where cl

Il risultato dovrebbe essere i percorsi noti delle due edizioni di Visual Studio installate.

Se invece si ottiene INFO: Impossibile trovare file per i modelli dati specificati, vedere la sezione Verifica dei percorsi di questo articolo e utilizzare quelle istruzioni per aggiungere i percorsi di Visual Studio alle variabili di ambiente di Windows.

Salvare eventuali modifiche apportate in base alla sezione Verifica dei percorsi in basso e quindi provare nuovamente il comando where cl.

4: Installare CUDA 11 + 12 Toolkit

I vari pacchetti installati in Musubi richiedono versioni diverse di NVIDIA CUDA, che accelera e ottimizza l’addestramento su schede grafiche NVIDIA.

Il motivo per cui abbiamo installato le versioni di Visual Studio prima è che gli installer di NVIDIA CUDA cercano e si integrano con le installazioni di Visual Studio esistenti.

Scaricare un pacchetto di installazione della serie 11+ CUDA da:

https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (scaricare ‘exe (locale)’ )

Scaricare un pacchetto di installazione della serie 12+ CUDA Toolkit da:

https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64

Il processo di installazione è identico per entrambi gli installer. Ignorare eventuali avvertimenti sull’esistenza o meno di percorsi di installazione nelle variabili di ambiente di Windows – ci occuperemo di questo manualmente più tardi.

Installare NVIDIA CUDA Toolkit V11+

Avviare l’installer per la serie 11+ CUDA Toolkit.

Alle Opzioni di installazione, scegliere Personalizzato (Avanzato) e procedere.

Descelezionare l’opzione NVIDIA GeForce Experience e fare clic su Avanti.

Lasciare Selezionare percorso di installazione ai valori predefiniti (questo è importante):

Fare clic su Avanti e lasciare che l’installazione si concluda.

Ignorare eventuali avvertimenti o note che l’installer fornisce su Nsight Visual Studio integration, che non è necessaria per il nostro caso.

Installare NVIDIA CUDA Toolkit V12+

Ripetere l’intero processo per l’installer della serie 12+ NVIDIA Toolkit che si è scaricato:

Il processo di installazione per questa versione è identico a quello elencato sopra (la versione 11+), tranne per un avvertimento sui percorsi di ambiente, che si può ignorare:

Quando l’installazione della versione 12+ CUDA è completata, aprire un prompt dei comandi di Windows e digitare e eseguire:

nvcc --version

Questo dovrebbe confermare informazioni sulla versione del driver installato:

Per verificare che la scheda sia riconosciuta, digitare e eseguire:

nvidia-smi

5: Installare GIT

GIT gestirà l’installazione del repository Musubi sulla macchina locale. Scaricare l’installer GIT da:

https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Eseguire l’installer:

Utilizzare le impostazioni predefinite per Selezionare componenti:

Lasciare l’editor predefinito su Vim:

Lasciare che GIT decida i nomi dei rami:

Utilizzare le impostazioni consigliate per il Percorso dell’ambiente:

Utilizzare le impostazioni consigliate per SSH:

Utilizzare le impostazioni consigliate per HTTPS Transport backend:

Utilizzare le impostazioni consigliate per le conversioni dei terminatori di riga:

Scegliere la console predefinita di Windows come emulatore del terminale:

Utilizzare le impostazioni predefinite (Fast-forward o merge) per Git Pull:

Utilizzare Git-Credential Manager (l’impostazione predefinita) per Credential Helper:

Nella sezione Configurazione opzioni aggiuntive, lasciare Abilita caching del file system selezionato e Abilita collegamenti simbolici deselezionato (a meno che non siate un utente avanzato che utilizza collegamenti rigidi per un repository di modelli centralizzato).

Concludere l’installazione e testare che GIT sia installato correttamente aprendo una finestra dei comandi di Windows e digitando e eseguendo:

git --version

Accesso a GitHub

In seguito, quando si tenta di clonare repository GitHub, potrebbe essere richiesto di inserire le credenziali GitHub. Per anticipare questo, accedere al proprio account GitHub (creare uno, se necessario) su qualsiasi browser installato nel sistema Windows. In questo modo, il metodo di autenticazione 0Auth (una finestra di dialogo) dovrebbe richiedere il minor tempo possibile.

Dopo la sfida iniziale, si dovrebbe rimanere autenticati automaticamente.

6: Installare CMake

CMake 3.21 o successivo è necessario per alcune parti del processo di installazione di Musubi. CMake è un’architettura di sviluppo multipiattaforma in grado di orchestrare diversi compilatori e di compilare software da codice sorgente.

Scaricarlo da:

https://cmake.org/download/ (‘Windows x64 Installer’)

Avviare l’installer:

Assicurarsi che Aggiungere CMake al percorso dell’ambiente sia selezionato.

Fare clic su Avanti.

Digitare e eseguire questo comando in un prompt dei comandi di Windows:

cmake --version

Se CMake è stato installato correttamente, dovrebbe visualizzare qualcosa come:

cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: Installare Python 3.10

L’interprete Python è fondamentale per questo progetto. Scaricare la versione 3.10 (il miglior compromesso tra le diverse richieste dei pacchetti Musubi) da:

https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)

Eseguire l’installer del download, lasciando le impostazioni predefinite:

Al termine del processo di installazione, fare clic su Disabilita limite di lunghezza del percorso (richiede conferma dell’amministratore UAC):

In un prompt dei comandi di Windows, digitare e eseguire:

python --version

Questo dovrebbe risultare in Python 3.10.0

VERIFICA DEI PERCORSI

La clonazione e l’installazione dei framework Musubi, nonché il suo funzionamento normale dopo l’installazione, richiedono che i suoi componenti conoscano il percorso di diversi componenti esterni importanti in Windows, in particolare CUDA.

Pertanto, è necessario aprire il percorso dell’ambiente e verificare che tutti i requisiti siano presenti.

Un modo rapido per accedere ai controlli dell’ambiente di Windows è digitare Modificare le variabili di sistema nella barra di ricerca di Windows.

Fare clic su questo aprirà il pannello di controllo Proprietà del sistema. Nella parte inferiore destra di Proprietà del sistema, fare clic sul pulsante Variabili di ambiente, e si aprirà una finestra chiamata Variabili di ambiente. Nel pannello Variabili di sistema nella metà inferiore di questa finestra, scorrere verso il basso fino a Percorso e fare doppio clic su di esso. Ciò aprirà una finestra chiamata Modifica variabile di ambiente. Trascinare la larghezza di questa finestra in modo da poter vedere l’intero percorso delle variabili:

Qui le voci importanti sono:

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin

Nella maggior parte dei casi, le variabili del percorso corrette dovrebbero già essere presenti.

Aggiungere eventuali percorsi mancanti facendo clic su Nuovo a sinistra della finestra Modifica variabile di ambiente e incollando il percorso corretto:

Non copiare e incollare semplicemente dai percorsi elencati sopra; verificare che ogni percorso equivalente esista nella propria installazione di Windows.

Se ci sono variazioni minori dei percorsi (in particolare con le installazioni di Visual Studio), utilizzare i percorsi elencati sopra per trovare le cartelle di destinazione corrette (ad esempio, x64 in Host64 nella propria installazione). Quindi incollare quei percorsi nella finestra Modifica variabile di ambiente.

Dopo di ciò, riavviare il computer.

INSTALLAZIONE DI MUSUBI

Aggiornamento di PIP

L’utilizzo dell’ultima versione dell’installer PIP può semplificare alcune fasi di installazione. In un prompt dei comandi di Windows con privilegi amministrativi (vedere Elevazione di seguito), digitare e eseguire:

pip install --upgrade pip

Elevazione

Alcuni comandi possono richiedere privilegi elevati (ad esempio, eseguire come amministratore). Se si ricevono messaggi di errore relativi alle autorizzazioni nelle fasi successive, chiudere la finestra del prompt dei comandi e riaprirla in modalità amministrativa digitando CMD nella barra di ricerca di Windows, facendo clic con il pulsante destro del mouse su Prompt dei comandi e selezionando Esegui come amministratore:

Per le fasi successive, verrà utilizzato Windows Powershell invece del prompt dei comandi di Windows. È possibile trovarlo digitando Powershell nella barra di ricerca di Windows e (se necessario) facendo clic con il pulsante destro del mouse su di esso per Esegui come amministratore:

Installare Torch

In Powershell, digitare e eseguire:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

Siate pazienti mentre si installano i molti pacchetti.

Quando l’installazione è completata, è possibile verificare un’installazione di PyTorch abilitata per GPU digitando e eseguendo:

python -c "import torch; print(torch.cuda.is_available())"

Questo dovrebbe risultare in:

True

Installare Triton per Windows

Successivamente, l’installazione del componente Triton per Windows. In Powershell elevato, immettere (su una sola riga):

pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl

(L’installer triton-3.1.0-cp310-cp310-win_amd64.whl funziona sia per CPU Intel che AMD, a condizione che l’architettura sia a 64 bit e l’ambiente corrisponda alla versione di Python)

Dopo l’esecuzione, questo dovrebbe risultare in:

Successfully installed triton-3.1.0

Possiamo verificare se Triton funziona importandolo in Python. Immettere questo comando:

python -c "import triton; print('Triton is working')"

Questo dovrebbe visualizzare:

Triton is working

Per verificare che Triton sia abilitato per GPU, immettere:

python -c "import torch; print(torch.cuda.is_available())"

Questo dovrebbe risultare in True:

Crea l’ambiente virtuale per Musubi

Da questo momento in poi, installeremo ulteriore software in un ambiente virtuale Python (o venv). Ciò significa che tutto ciò che si dovrà fare per disinstallare tutto il software successivo sarà trascinare la cartella di installazione del venv nel cestino.

Creiamo la cartella di installazione: creare una cartella chiamata Musubi sul desktop. Gli esempi seguenti presuppongono che questa cartella esista: C:\Users\[Nome del profilo]\Desktop\Musubi\.

In Powershell, navigare fino a quella cartella digitando:

cd C:\Users\[Nome del profilo]\Desktop\Musubi

Vogliamo che l’ambiente virtuale abbia accesso a ciò che abbiamo installato fino ad ora (in particolare Triton), quindi useremo il flag --system-site-packages. Immettere questo:

python -m venv --system-site-packages musubi

Aspettare che l’ambiente venga creato, quindi attivarlo digitando:

.\musubi\Scripts\activate

Da questo punto in poi, è possibile capire di essere nell’ambiente virtuale attivato dal fatto che (musubi) appare all’inizio di tutte le promt:

Clonare il repository

Navigare fino alla cartella appena creata musubi (che si trova all’interno della cartella Musubi sul desktop):

cd musubi

Ora che si è nella posizione giusta, immettere il seguente comando:

git clone https://github.com/kohya-ss/musubi-tuner.git

Aspettare che il cloning sia completato (non ci vorrà molto).

Installazione dei requisiti

Navigare fino alla cartella di installazione:

cd musubi-tuner

Immettere:

pip install -r requirements.txt

Aspettare che le molte installazioni siano completate (ciò richiederà più tempo).

Automatizzare l’accesso all’ambiente virtuale di Hunyuan Video

Per accedere facilmente e attivare l’ambiente virtuale per future sessioni, incollare il seguente testo in Notepad e salvarlo con il nome activate.bat, salvandolo con l’opzione Tutti i file (vedere immagine in basso).

@echo off

call C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\Scripts\activate

cd C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner

cmd

(Sostituire [Nome del profilo] con il nome reale della cartella del profilo Windows)

Non importa in quale posizione si salvi questo file.

Da questo momento in poi, è possibile attivare l’ambiente virtuale facendo doppio clic su activate.bat e iniziare a lavorare immediatamente.

USARE MUSUBI TUNER

Scaricare i modelli

Il processo di addestramento LoRA di Hunyuan Video richiede il download di almeno sette modelli per supportare tutte le possibili opzioni di ottimizzazione per la memorizzazione nella cache e l’addestramento di un LoRA di Hunyuan Video, per un totale di oltre 60GB.

Le istruzioni attuali per scaricarli si trovano all’indirizzo https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download

Tuttavia, queste sono le istruzioni di download al momento della stesura:

clip_l.safetensors
llava_llama3_fp16.safetensors
e
llava_llama3_fp8_scaled.safetensors
possono essere scaricati all’indirizzo https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders

mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt
e
mp_rank_00_model_states_fp8_map.pt
possono essere scaricati all’indirizzo https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers

pytorch_model.pt
può essere scaricato all’indirizzo https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae

Sebbene sia possibile posizionarli in qualsiasi directory, per coerenza con la disposizione della directory fino a questo punto, mettiamoli in:

C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\models\

Questo è coerente con la disposizione della directory fino a questo punto. Non dimenticare di sostituire [Nome del profilo] con il nome reale della cartella del profilo Windows.

PREPARAZIONE DEL SET DI DATI

Ignorando la controversia comunitaria su questo punto, è lecito affermare che si avrà bisogno di circa 10-100 foto per un set di dati di addestramento per il proprio LoRA, per ottenere risultati molto buoni anche con 15 immagini, a condizione che le immagini siano ben equilibrate e di buona qualità.

Un LoRA di Hunyuan può essere addestrato sia su immagini che su brevi clip video a bassa risoluzione, o anche su una combinazione di entrambi – sebbene l’utilizzo di clip video come dati di addestramento sia impegnativo, anche per una scheda da 24GB.

Tuttavia, le clip video sono utili solo se il personaggio si muove in un modo così insolito che il modello di base di Hunyuan Video potrebbe non conoscerlo o non essere in grado di indovinarlo.

Esempi includono Roger Rabbit, un xenomorfo, The Mask, Spider-Man o altre personalità che possiedono caratteristiche di movimento uniche.

Poiché Hunyuan Video già conosce come si muovono gli uomini e le donne normali, le clip video non sono necessarie per ottenere un LoRA di Hunyuan Video convincente di tipo umano. Quindi useremo immagini statiche.

PREPARAZIONE DELLE IMMAGINI

La lista delle richieste

La versione TLDR:

È meglio utilizzare immagini tutte della stessa dimensione per il set di dati o utilizzare una divisione 50/50 tra due dimensioni diverse, ad esempio 10 immagini che sono 512x768px e 10 che sono 768x512px.

L’addestramento potrebbe andare bene anche se non si fa questo – i LoRA di Hunyuan Video possono essere sorprendentemente perdonativi.

La versione più lunga

Come per i LoRA di Kohya-ss per sistemi generativi statici come Stable Diffusion, bucketing viene utilizzato per distribuire il carico di lavoro su immagini di dimensioni diverse, consentendo l’utilizzo di immagini più grandi senza causare errori di memoria durante l’addestramento (ad esempio, il bucketing ‘taglia’ le immagini in chunk che la GPU può gestire, mantenendo l’integrità semantica dell’intera immagine).

Per ogni dimensione di immagine inclusa nel set di dati di addestramento (ad esempio 512x768px), verrà creata una bucket o ‘sottotask’. Quindi, se si dispone della seguente distribuzione di immagini, l’attenzione della bucket diventa sbilanciata e rischia che alcune foto ricevano maggiore considerazione nell’addestramento rispetto ad altre:

2x 512x768px immagini
7x 768x512px immagini
1x 1000x600px immagine
3x 400x800px immagini

È possibile vedere che l’attenzione della bucket è divisa in modo disuguale tra queste immagini:

Pertanto, è meglio attenersi a un formato di dimensione o cercare di mantenere la distribuzione di diverse dimensioni relativamente equa.

In entrambi i casi, evitare immagini molto grandi, poiché ciò potrebbe rallentare l’addestramento, con scarso beneficio.

Per semplicità, ho utilizzato 512x768px per tutte le foto nel mio set di dati.

Disclaimer: Il modello (persona) utilizzato nel set di dati mi ha concesso il permesso di utilizzare queste immagini a questo scopo e ha approvato tutte le immagini di output AI che rappresentano la sua somiglianza presentate in questo articolo.

Il mio set di dati consiste di 40 immagini, in formato PNG (anche se JPG va bene). Le mie immagini sono state archiviate in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman

È necessario creare una cartella cache all’interno della cartella delle immagini di addestramento:

Ora creiamo un file speciale che configurerà l’addestramento.

File TOML

I processi di addestramento e memorizzazione nella cache dei LoRA di Hunyuan Video ottengono i percorsi dei file da un file di testo piatto con l’estensione .toml.

Per il mio test, il file TOML si trova in C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml

Il contenuto del mio file TOML di addestramento è il seguente:

[general]

risoluzione = [512, 768]

estensione_didascalia = ".txt"

dimensione_batch = 1

abilita_bucket = true

bucket_no_upscale = false

[[datasets]]

directory_immagini = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"

directory_cache = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"

num_repeats = 1

(I doppi backslash per le directory delle immagini e della cache non sono sempre necessari, ma possono aiutare a evitare errori nei casi in cui c’è uno spazio nel percorso. Ho addestrato modelli con file.toml che utilizzavano singoli slash in avanti e singoli backslash)

Possiamo vedere nella sezione risoluzione che due risoluzioni saranno considerate – 512px e 768px. È anche possibile lasciare questo a 512 e ottenere comunque buoni risultati.

Didascalie

Hunyuan Video è un modello di base testo+visione, quindi abbiamo bisogno di didascalie descrittive per queste immagini, che saranno considerate durante l’addestramento. Il processo di addestramento fallirà senza didascalie.

Esistono molte sistemi di didascalia open source che potremmo utilizzare per questo compito, ma cerchiamo di mantenerlo semplice e utilizzare il sistema taggui. Sebbene sia archiviato su GitHub e sebbene scarichi alcuni modelli di apprendimento automatico pesanti al primo avvio, si presenta come un’eseguibile Windows semplice che carica librerie Python e una semplice interfaccia utente.

Dopo aver avviato Taggui, utilizzare File > Carica directory per navigare fino al set di dati delle immagini e, facoltativamente, inserire un identificatore di token (in questo caso, examplewoman) che verrà aggiunto a tutte le didascalie:

(Assicurarsi di disattivare Carica in 4-bit quando Taggui si apre per la prima volta – getterà errori durante la didascalia se questo è lasciato su)

Selezionare un’immagine nella colonna di anteprima a sinistra e premere CTRL+A per selezionare tutte le immagini. Quindi premere il pulsante Avvia didascalia automatica a destra:

Si vedrà Taggui che scarica modelli nella piccola finestra CLI nella colonna destra, ma solo se è la prima volta che si esegue il programma di didascalia. Altrimenti si vedrà un’anteprima delle didascalie.

Ora, ogni foto ha una didascalia.txt corrispondente con una descrizione del contenuto dell’immagine:

È possibile fare clic su Opzioni avanzate in Taggui per aumentare la lunghezza e lo stile delle didascalie, ma ciò va oltre lo scopo di questo tutorial.

Uscire da Taggui e passare a…

MEMORIZZAZIONE LATENTE

Per evitare un carico eccessivo di GPU durante l’addestramento, è necessario creare due tipi di file memorizzati nella cache – uno per rappresentare l’immagine latente derivata dalle immagini stesse e un altro per valutare una codifica di testo relativa al contenuto della didascalia.

Per semplificare i tre processi (2x cache + addestramento), è possibile utilizzare file.BAT interattivi che chiederanno domande e svolgeranno i processi quando si forniranno le informazioni necessarie.

Per la memorizzazione nella cache latente, copiare il seguente testo in Notepad e salvarlo come file.BAT (ad esempio, denominarlo latent-precaching.bat), come in precedenza, assicurandosi che il tipo di file nel menu a discesa della finestra di dialogo Salva con nome sia Tutti i file (vedere immagine in basso):

@echo off

REM Attivare l'ambiente virtuale

call C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Ottenere input utente

set /p PERCORSO_IMMAGINE=Inserire il percorso della directory delle immagini:

set /p PERCORSO_CACHE=Inserire il percorso della directory della cache:

set /p PERCORSO_TOML=Inserire il percorso del file TOML:

echo Hai inserito:

echo Percorso immagine: %PERCORSO_IMMAGINE%

echo Percorso cache: %PERCORSO_CACHE%

echo Percorso file TOML: %PERCORSO_TOML%

set /p CONFERMA=Desideri procedere con la memorizzazione nella cache latente (s/n)?

if /i "%CONFERMA%"=="s" (

REM Eseguire lo script di memorizzazione nella cache latente

python C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %PERCORSO_TOML% --vae C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling

) else (

echo Operazione annullata.

)

REM Mantenere la finestra aperta

pause

(Sostituire [Nome del profilo] con il nome reale della cartella del profilo Windows)

Ora è possibile eseguire il file.BAT per la memorizzazione nella cache latente automatica:

Quando richiesto dal file.BAT, incollare o digitare il percorso del set di dati, delle cartelle della cache e del file TOML.

MEMORIZZAZIONE DEL TESTO

Creeremo un secondo file.BAT, questa volta per la memorizzazione nella cache del testo.

@echo off

REM Attivare l'ambiente virtuale

call C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Ottenere input utente

set /p PERCORSO_IMMAGINE=Inserire il percorso della directory delle immagini:

set /p PERCORSO_CACHE=Inserire il percorso della directory della cache:

set /p PERCORSO_TOML=Inserire il percorso del file TOML:

echo Hai inserito:

echo Percorso immagine: %PERCORSO_IMMAGINE%

echo Percorso cache: %PERCORSO_CACHE%

echo Percorso file TOML: %PERCORSO_TOML%

set /p CONFERMA=Desideri procedere con la memorizzazione nella cache del testo (s/n)?

if /i "%CONFERMA%"=="s" (

REM Utilizzare l'eseguibile python dall'ambiente virtuale

python C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %PERCORSO_TOML% --text_encoder1 C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16

) else (

echo Operazione annullata.

)

REM Mantenere la finestra aperta

pause

(Sostituire il nome del profilo con il nome reale della cartella del profilo Windows e salvare questo come text-cache.bat (o qualsiasi altro nome si desidera), in qualsiasi posizione conveniente, come per il file.BAT precedente.

Eseguire questo nuovo file.BAT, seguire le istruzioni e i file di testo codificati necessari appariranno nella cartella cache:

ADDESTRAMENTO DELLO LoRA DI HUNYUAN VIDEO

L’addestramento dello LoRA vero e proprio richiederà molto più tempo di questi due processi preparatori.

Sebbene ci siano anche molte variabili che potremmo preoccuparci (come la dimensione del batch, i ripeti, le epoche e se utilizzare modelli completi o quantizzati, tra gli altri), salveremo queste considerazioni per un altro giorno e un’analisi più approfondita della creazione di LoRA.

Per ora, cerchiamo di minimizzare le scelte un po’ e addestrare uno LoRA con impostazioni ‘medie’.

Creeremo un terzo file.BAT, questa volta per avviare l’addestramento. Copiare il seguente testo in Notepad e salvarlo come file.BAT, come in precedenza, come training.bat (o qualsiasi altro nome si desidera):

@echo off

REM Attivare l'ambiente virtuale

call C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\Scripts\activate.bat

REM Ottenere input utente

set /p CONFIGURAZIONE_DATASET=Inserire il percorso del file di configurazione del set di dati:

set /p EPOCHE=Inserire il numero di epoche di addestramento:

set /p NOME_OUTPUT=Inserire il nome del modello di output (ad esempio, example0001):

set /p TASSO_APPRENDIMENTO=Scegliere il tasso di apprendimento (1 per 1e-3, 2 per 5e-3, predefinito 1e-3):

if "%TASSO_APPRENDIMENTO%"=="1" set LR=1e-3

if "%TASSO_APPRENDIMENTO%"=="2" set LR=5e-3

if "%TASSO_APPRENDIMENTO%"=="" set LR=1e-3

set /p SALVA_PASSI=Con quale frequenza (in passi) salvare le immagini di anteprima:

set /p PROMPT_FILE=Qual è la posizione del file di prompt per le anteprime di addestramento?

echo Hai inserito:

echo Percorso file di configurazione del set di dati: %CONFIGURAZIONE_DATASET%

echo Numero di epoche: %EPOCHE%

echo Nome di output: %NOME_OUTPUT%

echo Tasso di apprendimento: %LR%

echo Salvare immagini di anteprima ogni %SALVA_PASSI% passi.

echo File di prompt: %PROMPT_FILE%

REM Preparare il comando

set COMANDO=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^

C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^

--dit C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^

--dataset_config %CONFIGURAZIONE_DATASET% ^

--sdpa ^

--mixed_precision bf16 ^

--fp8_base ^

--optimizer_type adamw8bit ^

--learning_rate %LR% ^

--gradient_checkpointing ^

--max_data_loader_n_workers 2 ^

--persistent_data_loader_workers ^

--network_module=networks.lora ^

--network_dim=32 ^

--timestep_sampling sigmoid ^

--discrete_flow_shift 1.0 ^

--max_train_epochs %EPOCHE% ^

--save_every_n_epochs=1 ^

--seed 42 ^

--output_dir "C:\Users\[Nome del profilo]\Desktop\Musubi\Output Models" ^

--output_name %NOME_OUTPUT% ^

--vae C:/Users/[Nome del profilo]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^

--vae_chunk_size 32 ^

--vae_spatial_tile_sample_min_size 128 ^

--text_encoder1 C:/Users/[Nome del profilo]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^

--text_encoder2 C:/Users/[Nome del profilo]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^

--sample_prompts %PROMPT_FILE% ^

--sample_every_n_steps %SALVA_PASSI% ^

--sample_at_first

echo Il seguente comando verrà eseguito:

echo %COMANDO%

set /p CONFERMA=Desideri procedere con l'addestramento (s/n)?

if /i "%CONFERMA%"=="s" (

%COMANDO%

) else (

echo Operazione annullata.

)

REM Mantenere la finestra aperta

cmd /k

(Sostituire tutte le istanze di [Nome del profilo] con il nome reale della cartella del profilo Windows)

Assicurarsi che la directory C:\Users\[Nome del profilo]\Desktop\Musubi\Output Models\ esista e crearla in quella posizione se non esiste.

ANTEPRIME DELL’ADDESTRAMENTO

Esiste una funzione di anteprima di addestramento molto di base abilitata di recente per Musubi trainer, che consente di forzare il modello di addestramento a interrompersi e generare immagini in base a prompt che si sono salvati. Queste vengono salvate in una cartella automaticamente creata chiamata Sample, nella stessa directory in cui vengono salvati i modelli di addestramento.

Per abilitare questo, sarà necessario salvare almeno un prompt in un file di testo. Il file.BAT di addestramento che abbiamo creato chiederà di immettere la posizione di questo file; pertanto, è possibile denominare il file di prompt con qualsiasi nome si desidera e salvarlo in qualsiasi posizione.

Ecco alcuni esempi di prompt per un file che produrrà tre diverse immagini quando richiesto dalla routine di addestramento:

Come si può vedere nell’esempio sopra, è possibile aggiungere flag alla fine del prompt che influenzeranno le immagini:

–w è la larghezza (predefinita a 256px se non impostata, secondo la documentazione)
–h è l’altezza (predefinita a 256px se non impostata)
–f è il numero di frame. Se impostato su 1, viene prodotta un’immagine; più di uno, un video.
–d è il seed. Se non impostato, è casuale; ma è necessario impostarlo per vedere un prompt evolversi.
–s è il numero di passi nella generazione, predefinito a 20.

Vedere la documentazione ufficiale per flag aggiuntivi.

Sebbene le anteprime di addestramento possano rivelare rapidamente alcuni problemi che potrebbero portare a interrompere l’addestramento e riconsiderare i dati o l’impostazione, quindi risparmiare tempo, ricordare che ogni prompt aggiuntivo rallenta leggermente l’addestramento.

Inoltre, le anteprime di addestramento con immagini di anteprima più grandi (come impostato nei flag sopra) rallenteranno ulteriormente l’addestramento.

Avviare il file.BAT di addestramento.

Domanda #1 è ‘Inserire il percorso del file di configurazione del set di dati’. Incollare o digitare il percorso corretto del file TOML.

Domanda #2 è ‘Inserire il numero di epoche di addestramento’. Questa è una variabile da prova e errore, poiché è influenzata dalla quantità e dalla qualità delle immagini, nonché dalle didascalie e altri fattori. In generale, è meglio impostarla troppo alta piuttosto che troppo bassa, poiché è sempre possibile interrompere l’addestramento con Ctrl+C nella finestra di addestramento se si ritiene che il modello abbia avanzato abbastanza. Impostarlo su 100 per la prima volta e vedere come va.

Domanda #3 è ‘Inserire il nome del modello di output’. Denominare il modello! Potrebbe essere meglio mantenere il nome ragionevolmente breve e semplice.

Domanda #4 è ‘Scegliere il tasso di apprendimento’, che predefinito è 1e-3 (opzione 1). Questo è un buon punto di partenza, in attesa di ulteriore esperienza.

Domanda #5 è ‘Con quale frequenza (in passi) salvare le immagini di anteprima’. Se si imposta questo troppo basso, si vedrà poco progresso tra i salvataggi delle immagini di anteprima e ciò rallenterà l’addestramento.

Domanda #6 è ‘Qual è la posizione del file di prompt per le anteprime di addestramento?’. Incollare o digitare il percorso del file di testo dei prompt.

Il file.BAT mostrerà il comando che verrà inviato al modello di Hunyuan e chiederà se si desidera procedere, s/n.

Procedere e iniziare l’addestramento:

Durante questo tempo, se si controlla la sezione GPU della scheda delle prestazioni di Windows Task Manager, si vedrà che il processo sta utilizzando circa 16GB di VRAM.

Questo potrebbe non essere un numero arbitrario, poiché questo è l’importo di VRAM disponibile su molte schede grafiche NVIDIA e il codice upstream potrebbe essere stato ottimizzato per adattarsi a 16GB per il beneficio di coloro che possiedono tali schede.

Tuttavia, è molto facile aumentare questo utilizzo inviando flag più esorbitanti al comando di addestramento.

Durante l’addestramento, si vedrà nella parte inferiore destra della finestra del prompt un numero per il tempo trascorso dall’inizio dell’addestramento e una stima del tempo di addestramento totale (che varierà notevolmente a seconda dei flag impostati, del numero di immagini di addestramento, delle immagini di anteprima di addestramento, e molti altri fattori).

Un tempo di addestramento tipico è di circa 3-4 ore con impostazioni medie, a seconda dell’hardware disponibile, del numero di immagini, dei flag impostati e altri fattori.

USARE I MODELLI LoRA ADDESTRATI IN HUNYUAN VIDEO

SELEZIONARE I PUNTi DI CONTROLLO

Quando l’addestramento è concluso, si avrà un punto di controllo per ogni epoca di addestramento.

Questa frequenza di salvataggio può essere modificata dall’utente per salvare più o meno frequentemente, come desiderato, modificando il numero --save_every_n_epochs [N] nel file.BAT di addestramento. Se si è aggiunto un numero basso per i salvataggi-per-passi quando si è impostato l’addestramento con il file.BAT, ci sarà un numero elevato di file di checkpoint salvati.

QUALE PUNTO DI CONTROLLO SELEZIONARE?

Come menzionato in precedenza, i modelli addestrati più precoci saranno più flessibili, mentre i punti di controllo più tardi potrebbero offrire più dettagli. L’unico modo per testare questi fattori è eseguire alcuni degli LoRA e generare alcune immagini. In questo modo è possibile scoprire quali punti di controllo sono più produttivi e rappresentano il miglior equilibrio tra flessibilità e fedeltà.

COMFYUI

L’ambiente più popolare (anche se non l’unico) per l’utilizzo di LoRA di Hunyuan Video al momento è ComfyUI, un editor basato su nodi con un’interfaccia Gradio elaborata che si esegue nel browser web.

Fonte: https://github.com/comfyanonymous/ComfyUI

Fonte: https://github.com/comfyanonymous/ComfyUI

Le istruzioni di installazione sono dirette e disponibili nel repository GitHub ufficiale (saranno necessari ulteriori download di modelli).

CONVERTIRE I MODELLI PER COMFYUI

I modelli addestrati sono salvati in un formato (diffusers) che non è compatibile con la maggior parte delle implementazioni di ComfyUI. Musubi è in grado di convertire un modello in un formato compatibile con ComfyUI. Creiamo un file.BAT per implementare questo.

Prima di eseguire questo file.BAT, creare la cartella C:\Users\[Nome del profilo]\Desktop\Musubi\CONVERTED\ che lo script si aspetta.

@echo off

REM Attivare l'ambiente virtuale

call C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\Scripts\activate.bat

:START

REM Ottenere input utente

set /p PERCORSO_INPUT=Inserire il percorso del file Musubi safetensors (o digitare "exit" per uscire):

REM Uscire se l'utente digita "exit"

if /i "%PERCORSO_INPUT%"=="exit" goto END

REM Estrarre il nome del file dal percorso di input e aggiungere 'converted' a esso

for %%F in ("%PERCORSO_INPUT%") do set NOME_FILE=%%~nF

set PERCORSO_OUTPUT=C:\Users\[Nome del profilo]\Desktop\Musubi\Output Models\CONVERTED\%NOME_FILE%_converted.safetensors

set TARGET=other

echo Hai inserito:

echo File di input: %PERCORSO_INPUT%

echo File di output: %PERCORSO_OUTPUT%

echo Formato di destinazione: %TARGET%

set /p CONFERMA=Desideri procedere con la conversione (s/n)?

if /i "%CONFERMA%"=="s" (

REM Eseguire lo script di conversione con percorsi correttamente virgolettati

python C:\Users\[Nome del profilo]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%PERCORSO_INPUT%" --output "%PERCORSO_OUTPUT%" --target %TARGET%

echo Conversione completata.

) else (

echo Operazione annullata.

)

REM Tornare all'inizio per un altro file

goto START

:END

REM Mantenere la finestra aperta

echo Uscita dallo script.

pause

Come per i file.BAT precedenti, salvare lo script come ‘Tutti i file’ da Notepad, denominandolo convert.bat (o qualsiasi altro nome si desidera).

Una volta salvato, fare doppio clic sul nuovo file.BAT, che chiederà la posizione di un file da convertire.

Incollare o digitare il percorso del file addestrato che si desidera convertire, fare clic su s e premere invio.

Dopo aver salvato il LoRA convertito nella cartella CONVERTED, lo script chiederà se si desidera convertire un altro file. Se si desidera testare più punti di controllo in ComfyUI, convertire una selezione di modelli.

Una volta convertiti sufficienti punti di controllo, chiudere la finestra del prompt dei comandi.

Ora è possibile copiare i modelli convertiti nella cartella models\loras dell’installazione di ComfyUI.

Di solito la posizione corretta è qualcosa come:

C:\Users\[Nome del profilo]\Desktop\ComfyUI\models\loras\

CREAZIONE DI LoRA DI HUNYUAN VIDEO IN COMFYUI

Sebbene i flussi di lavoro basati su nodi di ComfyUI sembrino complessi inizialmente, le impostazioni di altri utenti più esperti possono essere caricate trascinando un’immagine (creata con le impostazioni di ComfyUI dell’altro utente) direttamente nella finestra di ComfyUI. I flussi di lavoro possono anche essere esportati come file JSON, che possono essere importati manualmente o trascinati in una finestra di ComfyUI.

Alcuni flussi di lavoro importati potrebbero avere dipendenze che non esistono nell’installazione. Pertanto, installare ComfyUI-Manager, che può recuperare automaticamente i moduli mancanti.

Fonte: https://github.com/ltdrdata/ComfyUI-Manager

Fonte: https://github.com/ltdrdata/ComfyUI-Manager

Per caricare uno dei flussi di lavoro utilizzati per generare video dai modelli in questo tutorial, scaricare questo file JSON e trascinarlo nella finestra di ComfyUI (sebbene siano disponibili molti esempi di flussi di lavoro migliori nelle varie community di Reddit e Discord che hanno adottato Hunyuan Video, e il mio è stato adattato da uno di questi).

Questo non è il posto per un tutorial esteso sull’uso di ComfyUI, ma vale la pena menzionare alcuni dei parametri cruciali che influenzeranno l’output se si scarica e si utilizza il layout JSON collegato sopra.

1) Larghezza e altezza

Le immagini più grandi richiederanno più tempo per la generazione e aumenteranno il rischio di un errore di memoria (OOM).

2) Lunghezza

Questo è il valore numerico per il numero di frame. Quanti secondi si sommano dipendono dalla frequenza dei fotogrammi (impostata su 30fps in questo layout). È possibile convertire secondi>frame in base alla frequenza dei fotogrammi su Omnicalculator.

3) Dimensione del batch

Impostare la dimensione del batch più alta potrebbe rendere il risultato più veloce, ma aumenterà il carico di VRAM. Impostarlo troppo alto potrebbe causare un errore di memoria.

4) Controllo dopo la generazione

Questo controlla il seed casuale. Le opzioni per questo nodo sono fixed, increment, decrement e randomize. Se si lascia su fixed e non si modifica il prompt di testo, si otterrà la stessa immagine ogni volta. Se si modifica il prompt di testo, l’immagine cambierà in misura limitata. Le impostazioni increment e decrement consentono di esplorare valori di seed vicini, mentre randomize fornisce un’interpretazione completamente nuova del prompt.

5) Nome LoRA

Sarà necessario selezionare il proprio modello installato qui, prima di tentare di generare.

6) Token

Se si è addestrato il modello per attivare il concetto con un token (ad esempio ‘example-person’), inserire la parola di attivazione nel prompt.

7) Passi

Questo rappresenta il numero di passi che il sistema applicherà al processo di diffusione. Passi più alti possono ottenere più dettagli, ma c’è un limite a quanto efficace è questo approccio, e quel limite può essere difficile da trovare. L’intervallo di passi comune è intorno a 20-30.

8) Dimensione della piastrella

Questo definisce quanta informazione viene gestita alla volta durante la generazione. È impostato su 256 per impostazione predefinita. Aumentarlo può accelerare la generazione, ma aumentarlo troppo può portare a un’esperienza di errore di memoria particolarmente frustrante, poiché si verifica alla fine di un lungo processo.

9) Sovrapposizione temporale

La generazione di Hunyuan Video di persone può portare a ‘ghosting’ o movimenti non convincenti se questo è impostato troppo basso. In generale, l’attuale saggezza è che questo dovrebbe essere impostato su un valore più alto del numero di frame, per produrre un movimento migliore.

CONCLUSIONE

Sebbene ulteriori esplorazioni dell’uso di ComfyUI siano al di fuori dell’ambito di questo articolo, l’esperienza della community su Reddit e Discord può facilitare la curva di apprendimento e ci sono diverse guide online che introducono i concetti di base.

 

Pubblicato per la prima volta giovedì 23 gennaio 2025

Scrittore di apprendimento automatico, specialista di dominio nella sintesi di immagini umane. Ex responsabile dei contenuti di ricerca presso Metaphysic.ai, fino alla sua fusione nella Brahma.ai di DNEG.
Sito web: martinanderson.ai
Contatto: martin@martinanderson.ai