Góc nhìn Anderson
Hướng Dẫn Huấn Luyện và Sử Dụng Mô Hình LoRA Hunyuan Video

Bài viết này sẽ hướng dẫn bạn cách cài đặt và sử dụng phần mềm dựa trên Windows để huấn luyện mô hình LoRA Hunyuan video, cho phép người dùng tạo ra các nhân vật tùy chỉnh trong mô hình nền tảng Hunyuan Video:
Nhấn để phát. Ví dụ về sự bùng nổ của các mô hình LoRA Hunyuan nổi tiếng từ cộng đồng civit.ai.
Hiện tại, hai cách phổ biến nhất để tạo ra mô hình LoRA Hunyuan cục bộ là:
1) Khung công tác diffusion-pipe-ui dựa trên Docker, phụ thuộc vào Windows Subsystem for Linux (WSL) để xử lý một số quá trình.
2) Musubi Tuner, một bổ sung mới cho kiến trúc đào tạo khuếch tán phổ biến Kohya ss. Musubi Tuner không yêu cầu Docker và không phụ thuộc vào WSL hoặc proxy Linux – nhưng nó có thể khó cài đặt trên Windows.
Vì vậy, hướng dẫn này sẽ tập trung vào Musubi Tuner và cung cấp một giải pháp cục bộ hoàn toàn cho đào tạo và tạo mô hình LoRA Hunyuan, không sử dụng các trang web được điều khiển bởi API hoặc các quy trình cho thuê GPU thương mại như Runpod.
Nhấn để phát. Mẫu từ đào tạo LoRA trên Musubi Tuner cho bài viết này. Tất cả các quyền đã được người trong ảnh cho phép, để minh họa cho bài viết này.
YÊU CẦU
Cài đặt sẽ yêu cầu tối thiểu một máy tính Windows 10 với thẻ đồ họa NVIDIA series 30+/40+ có ít nhất 12GB VRAM (mặc dù 16GB được khuyến nghị). Cài đặt được sử dụng cho bài viết này đã được thử nghiệm trên một máy có 64GB RAM hệ thống và thẻ đồ họa NVIDIA 3090 với 24GB VRAM. Nó đã được thử nghiệm trên một hệ thống thử nghiệm chuyên dụng sử dụng cài đặt Windows 10 Professional mới, trên một phân vùng có hơn 600GB dung lượng đĩa trống.
CẢNH BÁO
Cài đặt Musubi Tuner và các phần mềm yêu cầu cũng bao gồm việc cài đặt các gói và phần mềm tập trung vào nhà phát triển trực tiếp vào cài đặt Windows chính của máy tính. Việc thực hiện dự án này sẽ yêu cầu khoảng 400-500 gigabyte dung lượng đĩa. Mặc dù tôi đã thử nghiệm quy trình này mà không có sự cố vài lần trong môi trường thử nghiệm Windows 10 mới, nhưng tôi hay unite.ai không chịu trách nhiệm về bất kỳ thiệt hại nào đối với hệ thống từ việc làm theo các hướng dẫn này. Tôi khuyên bạn nên sao lưu bất kỳ dữ liệu quan trọng nào trước khi cố gắng cài đặt quy trình này.
XEM XÉT
Phương Pháp Này Còn Hợp Lệ Chưa?
Scène trí tuệ tạo ra đang di chuyển rất nhanh, và chúng ta có thể mong đợi những phương pháp tốt hơn và tinh gọn hơn cho các khuôn khổ LoRA Hunyuan Video trong năm nay.
…hoặc thậm chí là tuần này! Trong khi tôi đang viết bài viết này, nhà phát triển của Kohya/Musubi đã tạo ra musubi-tuner-gui, một giao diện Gradio tinh gọn cho Musubi Tuner:

Đương nhiên, một giao diện người dùng thân thiện là điều mong muốn so với các tệp BAT mà tôi sử dụng trong tính năng này – một khi musubi-tuner-gui hoạt động. Khi tôi viết, nó chỉ được đăng trực tuyến năm ngày trước, và tôi không thể tìm thấy bất kỳ tài khoản nào về việc ai đó đã sử dụng nó thành công.
Theo các bài đăng trong kho lưu trữ, giao diện mới này được dự định sẽ được tích hợp trực tiếp vào dự án Musubi Tuner càng sớm càng tốt, điều này sẽ kết thúc sự tồn tại hiện tại của nó như một kho lưu trữ GitHub độc lập.
Dựa trên hướng dẫn cài đặt hiện tại, giao diện mới được sao chép trực tiếp vào môi trường ảo Musubi hiện có; và, mặc dù tôi đã cố gắng rất nhiều, tôi không thể khiến nó liên kết với cài đặt Musubi hiện có. Điều này có nghĩa là khi nó chạy, nó sẽ thấy rằng nó không có động cơ!
Khi giao diện được tích hợp vào Musubi Tuner, những vấn đề như vậy chắc chắn sẽ được giải quyết. Mặc dù tác giả nhận xét rằng dự án mới này là ‘thực sự thô’, anh ấy lạc quan về sự phát triển và tích hợp trực tiếp vào Musubi Tuner.
Do những vấn đề này (cũng liên quan đến các đường dẫn cài đặt thời gian và việc sử dụng gói Python UV, điều này làm phức tạp một số thủ tục trong bản phát hành mới), chúng ta sẽ phải chờ một chút để có trải nghiệm đào tạo LoRA Hunyuan Video mượt mà hơn. Đó nói, nó trông rất hứa hẹn!
Nhưng nếu bạn không thể chờ đợi, và sẵn sàng cuộn lên tay áo một chút, bạn có thể bắt đầu đào tạo LoRA Hunyuan video cục bộ ngay bây giờ.
Hãy bắt đầu.
TẠI SAO CÀI ĐẶT BẤT KÌ TRÊN BARE METAL?
(Bỏ qua đoạn này nếu bạn không phải là người dùng nâng cao)
Người dùng nâng cao sẽ thắc mắc tại sao tôi đã chọn cài đặt rất nhiều phần mềm trên cài đặt Windows 10 trần mà không phải trong môi trường ảo. Lý do là cổng Windows của gói Linux dựa trên Triton khó cài đặt hơn nhiều trong môi trường ảo. Tất cả các cài đặt bare-metal khác trong hướng dẫn này không thể được cài đặt trong môi trường ảo, vì chúng phải giao tiếp trực tiếp với phần cứng cục bộ.
CÀI ĐẶT CÁC GÓI VÀ CHƯƠNG TRÌNH YÊU CẦU
Đối với các chương trình và gói phải được cài đặt ban đầu, thứ tự cài đặt quan trọng. Hãy bắt đầu.
1: TẢI XUỐNG MICROSOFT REDISTRIBUTABLE
Tải xuống và cài đặt gói Microsoft Redistributable từ https://aka.ms/vs/17/release/vc_redist.x64.exe.
Đây là một cài đặt đơn giản và nhanh chóng.

2: CÀI ĐẶT VISUAL STUDIO 2022
Tải xuống phiên bản Community của Microsoft Visual Studio 2022 từ https://visualstudio.microsoft.com/downloads/?cid=learn-onpage-download-install-visual-studio-page-cta
Khởi chạy trình cài đặt đã tải xuống:

Chúng tôi không cần mọi gói có sẵn, điều này sẽ là một cài đặt nặng và dài. Tại trang Workloads ban đầu mở ra, tick Desktop Development with C++ (xem hình ảnh dưới đây).

Bây giờ, nhấp vào tab Individual Components ở phía trên bên trái của giao diện và sử dụng hộp tìm kiếm để tìm ‘Windows SDK’.

Bằng cách mặc định, chỉ có Windows 11 SDK được tick. Nếu bạn đang sử dụng Windows 10 (quy trình cài đặt này chưa được thử nghiệm bởi tôi trên Windows 11), tick phiên bản Windows 10 mới nhất, như trong hình ảnh trên.
Tìm kiếm ‘C++ CMake’ và kiểm tra xem C++ CMake tools for Windows đã được kiểm tra chưa.

Cài đặt này sẽ chiếm ít nhất 13 GB không gian.

Khi Visual Studio đã được cài đặt, nó sẽ cố gắng chạy trên máy tính của bạn. Hãy để nó mở hoàn toàn. Khi giao diện đầy đủ của Visual Studio cuối cùng xuất hiện, hãy đóng chương trình.
3: CÀI ĐẶT VISUAL STUDIO 2019
Một số gói tiếp theo cho Musubi đang mong đợi một phiên bản cũ hơn của Microsoft Visual Studio, trong khi những gói khác cần một phiên bản mới hơn.
Vì vậy, hãy tải xuống phiên bản Community miễn phí của Visual Studio 19 từ Microsoft (https://visualstudio.microsoft.com/vs/older-downloads/ – tài khoản được yêu cầu) hoặc Techspot (https://www.techspot.com/downloads/7241-visual-studio-2019.html).
Cài đặt nó với cùng các tùy chọn như Visual Studio 2022 (xem thủ tục trên, ngoại trừ Windows SDK đã được tick trong trình cài đặt Visual Studio 2019).
Bạn sẽ thấy rằng trình cài đặt Visual Studio 2019 đã biết về phiên bản mới hơn khi nó được cài đặt:

Khi cài đặt hoàn thành, và bạn đã mở và đóng ứng dụng Visual Studio 2019 đã cài đặt, hãy mở một lệnh Windows (gõ CMD vào hộp tìm kiếm) và nhập và thực thi:
where cl
Kết quả nên là các vị trí đã biết của hai phiên bản Visual Studio đã cài đặt.

Nếu bạn thay vào đó nhận được INFO: Could not find files for the given pattern(s), hãy xem phần Check Path của bài viết này dưới đây và sử dụng các hướng dẫn đó để thêm các đường dẫn Visual Studio vào môi trường Windows.
Lưu bất kỳ thay đổi nào được thực hiện theo phần Check Paths dưới đây, sau đó thử lệnh where cl lại.
4: CÀI ĐẶT CUDA 11 + 12 TOOLKITS
Các gói khác nhau được cài đặt trong Musubi cần các phiên bản khác nhau của NVIDIA CUDA, giúp tăng tốc và tối ưu hóa đào tạo trên thẻ đồ họa NVIDIA.
Lý do chúng tôi cài đặt các phiên bản Visual Studio trước là vì các trình cài đặt NVIDIA CUDA tìm kiếm và tích hợp với bất kỳ cài đặt Visual Studio nào hiện có.
Tải xuống một gói cài đặt CUDA 11+ từ:
https://developer.nvidia.com/cuda-11-8-0-download-archive?target_os=Windows&target_arch=x86_64&target_version=11&target_type=exe_local (tải xuống ‘exe (local)’ )
Tải xuống một gói cài đặt CUDA 12+ từ:
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
Quá trình cài đặt là giống nhau cho cả hai trình cài đặt. Hãy bỏ qua bất kỳ cảnh báo nào về sự tồn tại hoặc không tồn tại của các đường dẫn cài đặt trong biến môi trường Windows – chúng tôi sẽ tự xử lý điều này sau.
CÀI ĐẶT NVIDIA CUDA TOOLKIT V11+
Khởi chạy trình cài đặt cho CUDA Toolkit 11+.


Ở Installation Options, chọn Custom (Advanced) và tiếp tục.

Bỏ chọn tùy chọn NVIDIA GeForce Experience và nhấp vào Next.

Để Select Installation Location ở mặc định (điều này rất quan trọng):

Nhấp vào Next và để cài đặt kết thúc.

Bỏ qua bất kỳ cảnh báo hoặc lưu ý nào mà trình cài đặt đưa ra về Nsight Visual Studio tích hợp, điều này không cần thiết cho trường hợp của chúng tôi.
CÀI ĐẶT NVIDIA CUDA TOOLKIT V12+
Lặp lại toàn bộ quá trình cho trình cài đặt CUDA 12+ riêng biệt mà bạn đã tải xuống:

Quá trình cài đặt cho phiên bản này giống hệt với phiên bản 11+ (được liệt kê ở trên), ngoại trừ một cảnh báo về các đường dẫn môi trường, bạn có thể bỏ qua:

Khi cài đặt CUDA 12+ hoàn thành, hãy mở một lệnh Windows và nhập và thực thi:
nvcc --version
Điều này nên xác nhận thông tin về phiên bản trình điều khiển đã cài đặt:

Để kiểm tra xem thẻ của bạn đã được nhận diện, hãy nhập và thực thi:
nvidia-smi

5: CÀI ĐẶT GIT
GIT sẽ xử lý việc cài đặt kho lưu trữ Musubi trên máy cục bộ của bạn. Tải xuống trình cài đặt GIT tại:
https://git-scm.com/downloads/win (’64-bit Git for Windows Setup’)

Chạy trình cài đặt:

Sử dụng các thiết lập mặc định cho Select Components:

Để trình soạn thảo mặc định ở Vim:

Hãy để GIT quyết định về tên nhánh:

Sử dụng các thiết lập được đề xuất cho Path Environment:

Sử dụng các thiết lập được đề xuất cho SSH:

Sử dụng các thiết lập được đề xuất cho HTTPS Transport backend:

Sử dụng các thiết lập được đề xuất cho chuyển đổi kết thúc dòng:

Chọn Console Windows mặc định làm Trình mô phỏng Terminal:

Sử dụng các thiết lập mặc định (Fast-forward or merge) cho Git Pull:

Sử dụng Trình quản lý Git-Credential (cài đặt mặc định) cho Trợ lý Thông tin đăng nhập:

Trong Configuring extra options, hãy để Enable file system caching được tick và Enable symbolic links không được tick (trừ khi bạn là người dùng nâng cao đang sử dụng liên kết cứng cho một kho lưu trữ mô hình tập trung).

Kết thúc cài đặt và kiểm tra xem GIT đã được cài đặt đúng bằng cách mở một cửa sổ lệnh CMD và nhập và thực thi:
git --version

ĐĂNG NHẬP GITHUB
Sau này, khi bạn cố gắng sao chép các kho lưu trữ GitHub, bạn có thể bị thách thức về thông tin đăng nhập GitHub của mình. Để dự đoán điều này, hãy đăng nhập vào tài khoản GitHub của bạn (tạo một tài khoản nếu cần) trên bất kỳ trình duyệt nào được cài đặt trên hệ thống Windows của bạn. Theo cách này, phương pháp xác thực 0Auth (một cửa sổ bật lên) nên mất ít thời gian nhất.
6: CÀI ĐẶT CMAKE
CMake 3.21 hoặc mới hơn được yêu cầu cho một số phần của quá trình cài đặt Musubi. CMake là một kiến trúc phát triển đa nền tảng có khả năng điều khiển các trình biên dịch đa dạng và biên dịch phần mềm từ mã nguồn.
Tải xuống tại:
https://cmake.org/download/ (‘Windows x64 Installer’)
Khởi chạy trình cài đặt:

Đảm bảo Thêm Cmake vào biến môi trường PATH được kiểm tra.

Nhấn Next.

Nhập và thực thi lệnh này trong một lệnh Windows:
cmake --version
Nếu CMake được cài đặt thành công, nó sẽ hiển thị một cái gì đó như:
cmake version 3.31.4
CMake suite maintained and supported by Kitware (kitware.com/cmake).

7: CÀI ĐẶT PYTHON 3.10
Trình thông dịch Python là trung tâm của dự án này. Tải xuống phiên bản 3.10 (sự thỏa hiệp tốt nhất giữa các yêu cầu khác nhau của các gói Musubi) tại:
https://www.python.org/downloads/release/python-3100/ (‘Windows installer (64-bit)’)
Chạy trình cài đặt tải xuống, và để lại các thiết lập mặc định:


Ở cuối quá trình cài đặt, nhấp vào Disable path length limit (yêu cầu xác nhận quản trị viên UAC):

Trong một lệnh Windows, nhập và thực thi:
python --version
Điều này nên kết quả trong Python 3.10.0

KIỂM TRA ĐƯỜNG DẪN
Việc sao chép và cài đặt các khuôn khổ Musubi, cũng như hoạt động bình thường của nó sau khi cài đặt, yêu cầu các thành phần của nó biết đường dẫn đến một số thành phần quan trọng bên ngoài trong Windows, đặc biệt là CUDA.
Vì vậy, chúng tôi cần mở môi trường đường dẫn và kiểm tra xem tất cả các yêu cầu đều có trong đó.
Một cách nhanh chóng để truy cập các điều khiển cho Biến môi trường Windows là gõ Chỉnh sửa biến môi trường hệ thống vào thanh tìm kiếm Windows.

Nhấp vào điều này sẽ mở bảng điều khiển System Properties. Ở phía dưới bên phải của System Properties, nhấp vào nút Environment Variables, và một cửa sổ có tên Environment Variables sẽ mở ra. Trong bảng System Variables ở nửa dưới của cửa sổ này, cuộn xuống Path và nhấp đúp vào nó. Điều này sẽ mở một cửa sổ có tên Edit environment variables. Kéo rộng cửa sổ này để bạn có thể xem toàn bộ đường dẫn của các biến:

Tại đây, các mục nhập quan trọng là:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.6\libnvvp
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\libnvvp
C:\Program Files (x86)\Microsoft Visual Studio\2019\Community\VC\Tools\MSVC\14.29.30133\bin\Hostx64\x64
C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Tools\MSVC\14.42.34433\bin\Hostx64\x64
C:\Program Files\Git\cmd
C:\Program Files\CMake\bin
Trong hầu hết các trường hợp, các biến đường dẫn chính xác nên đã có mặt.
Thêm bất kỳ đường dẫn nào bị thiếu bằng cách nhấp vào New ở phía trái của cửa sổ Edit environment variable và dán đường dẫn chính xác vào:

Đừng chỉ sao chép và dán từ các đường dẫn được liệt kê ở trên; kiểm tra xem mỗi đường dẫn tương đương có tồn tại trong cài đặt Windows của bạn hay không.
Nếu có các biến thể đường dẫn nhỏ (đặc biệt là với các cài đặt Visual Studio), hãy sử dụng các đường dẫn được liệt kê ở trên để tìm các thư mục mục tiêu (ví dụ: x64 trong Host64 trong cài đặt của bạn. Sau đó, dán những đường dẫn vào cửa sổ Edit environment variable.
Sau đó, hãy khởi động lại máy tính.
CÀI ĐẶT MUSUBI
NÂNG CẤP PIP
Sử dụng phiên bản mới nhất của trình cài đặt PIP có thể làm mượt một số giai đoạn cài đặt. Trong một lệnh Windows Command với đặc quyền quản trị viên (xem Elevation dưới đây), nhập và thực thi:
pip install --upgrade pip
ELEVATION
Một số lệnh có thể yêu cầu đặc quyền quản trị viên (tức là phải chạy dưới dạng quản trị viên). Nếu bạn nhận được thông báo lỗi về quyền, hãy đóng cửa sổ lệnh và mở lại nó ở chế độ quản trị viên bằng cách nhập CMD vào hộp tìm kiếm Windows, nhấp chuột phải vào Command Prompt và chọn Run as administrator:

Đối với các giai đoạn tiếp theo, chúng tôi sẽ sử dụng Windows Powershell thay vì lệnh Windows. Bạn có thể tìm thấy nó bằng cách nhập Powershell vào hộp tìm kiếm Windows và (nếu cần) nhấp chuột phải vào nó để Run as administrator:

CÀI ĐẶT TORCH
Trong Powershell, nhập và thực thi:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
Hãy kiên nhẫn trong khi nhiều gói được cài đặt.
Khi hoàn thành, bạn có thể xác minh cài đặt PyTorch được bật GPU bằng cách nhập và thực thi:
python -c "import torch; print(torch.cuda.is_available())"
Điều này nên kết quả trong:
C:\WINDOWS\system32>python -c "import torch;
print(torch.cuda.is_available())"
True
CÀI ĐẶT TRITON CHO WINDOWS
Tiếp theo, cài đặt thành phần Triton for Windows. Trong Powershell nâng cao, nhập (trên một dòng):
pip install https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(Trình cài đặt triton-3.1.0-cp310-cp310-win_amd64.whl hoạt động cho cả CPU Intel và AMD miễn là kiến trúc là 64 bit và môi trường phù hợp với phiên bản Python)
Sau khi chạy, điều này nên kết quả trong:
Successfully installed triton-3.1.0
Chúng tôi có thể kiểm tra xem Triton có hoạt động hay không bằng cách nhập lệnh này:
python -c "import triton; print('Triton is working')"
Điều này nên xuất ra:
Triton is working
Để kiểm tra xem Triton có được bật GPU hay không, nhập:
python -c "import torch; print(torch.cuda.is_available())"
Điều này nên kết quả trong True:

TẠO MÔI TRƯỜNG ẢO CHO MUSUBI
Từ bây giờ, chúng tôi sẽ cài đặt bất kỳ phần mềm nào vào một môi trường ảo Python (hoặc venv). Điều này có nghĩa là tất cả những gì bạn sẽ cần làm để gỡ cài đặt tất cả phần mềm sau này là kéo thư mục cài đặt venv vào thùng rác.
Hãy tạo thư mục cài đặt đó: tạo một thư mục có tên Musubi trên máy tính để bàn của bạn. Các ví dụ sau giả định rằng thư mục này tồn tại: C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\.
Trong Powershell, điều hướng đến thư mục đó bằng cách nhập:
cd C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi
Chúng tôi muốn môi trường ảo có quyền truy cập vào những gì chúng tôi đã cài đặt trước đó (đặc biệt là Triton), vì vậy chúng tôi sẽ sử dụng cờ --system-site-packages. Nhập:
python -m venv --system-site-packages musubi
Hãy đợi môi trường được tạo, sau đó kích hoạt nó bằng cách nhập:
.\musubi\Scripts\activate
Từ thời điểm này, bạn có thể biết rằng bạn đang trong môi trường ảo được kích hoạt bởi thực tế rằng (musubi) xuất hiện ở đầu của tất cả các nhắc lệnh của bạn.

SAO CHÉP KHO LƯ TRỮ
Điều hướng đến thư mục musubi mới được tạo (nằm trong thư mục Musubi trên máy tính để bàn của bạn):
cd musubi
Bây giờ chúng tôi ở đúng nơi, hãy nhập lệnh này:
git clone https://github.com/kohya-ss/musubi-tuner.git
Hãy đợi quá trình sao chép hoàn thành (nó sẽ không mất nhiều thời gian).

CÀI ĐẶT YÊU CẦU
Điều hướng đến thư mục cài đặt:
cd musubi-tuner
Nhập:
pip install -r requirements.txt
Hãy đợi nhiều cài đặt hoàn thành (điều này sẽ mất nhiều thời gian hơn).

TỰ ĐỘNG TRUY CẬP VENV HUNYUAN VIDEO
Để dễ dàng kích hoạt và truy cập venv mới cho các phiên sau, hãy dán văn bản sau vào Notepad và lưu nó với tên activate.bat, lưu nó với tùy chọn All files (xem hình ảnh dưới đây).
@echo off
call C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\Scripts\activate
cd C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner
cmd
(Thay thế [Tên hồ sơ của bạn] bằng tên hồ sơ Windows thực của bạn)

Nó không quan trọng đến vị trí bạn lưu tệp này.
Từ bây giờ, bạn có thể kích hoạt và bắt đầu làm việc ngay bằng cách kích đúp vào activate.bat.

SỬ DỤNG MUSUBI TUNER
TẢI XUỐNG CÁC MÔ HÌNH
Quá trình đào tạo LoRA Hunyuan Video yêu cầu tải xuống ít nhất bảy mô hình để hỗ trợ tất cả các tùy chọn tối ưu hóa có thể cho việc tạo trước và đào tạo LoRA Hunyuan video, cùng nhau nặng hơn 60GB.
Hướng dẫn hiện tại để tải chúng có thể được tìm thấy tại https://github.com/kohya-ss/musubi-tuner?tab=readme-ov-file#model-download
Tuy nhiên, đây là hướng dẫn tải xuống tại thời điểm viết:
clip_l.safetensors
llava_llama3_fp16.safetensors và
llava_llama3_fp8_scaled.safetensors
có thể được tải xuống tại:
https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders
mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt và
mp_rank_00_model_states_fp8_map.pt
có thể được tải xuống tại:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers
pytorch_model.pt
có thể được tải xuống tại:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae
Mặc dù bạn có thể đặt chúng vào bất kỳ thư mục nào bạn chọn, nhưng để nhất quán với các kịch bản sau, hãy đặt chúng vào:
C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\models\
Đây là nhất quán với việc sắp xếp thư mục trước đến nay. Không quên thay thế [Tên hồ sơ của bạn] bằng tên thư mục hồ sơ Windows thực của bạn.
CHUẨN BỊ DỮ LIỆU
Bỏ qua tranh cãi cộng đồng về điểm này, điều công bằng là bạn sẽ cần khoảng 10-100 ảnh cho một tập dữ liệu đào tạo cho LoRA Hunyuan của mình. Kết quả rất tốt có thể đạt được ngay cả với 15 hình ảnh, miễn là hình ảnh được cân bằng và có chất lượng tốt.
Một LoRA Hunyuan có thể được đào tạo trên cả hình ảnh và video ngắn và thấp, hoặc thậm chí là sự kết hợp của cả hai – mặc dù việc sử dụng video làm dữ liệu đào tạo là một thách thức, ngay cả đối với thẻ 24GB.
Tuy nhiên, video chỉ thực sự hữu ích nếu nhân vật của bạn di chuyển theo một cách kỳ lạ mà mô hình nền tảng Hunyuan Video có thể không biết về nó, hoặc có thể suy đoán.
Ví dụ sẽ bao gồm Roger Rabbit, một sinh vật ngoài Trái đất, The Mask, Spider-Man hoặc các nhân vật khác có đặc điểm di chuyển độc đáo.
Vì Hunyuan Video đã biết cách con người bình thường di chuyển, video không cần thiết để có được một nhân vật LoRA Hunyuan video thuyết phục. Vì vậy, chúng tôi sẽ sử dụng hình ảnh tĩnh.
CHUẨN BỊ HÌNH ẢNH
DANH SÁCH THỂ LOẠI
Phiên bản TLDR:
Tốt nhất là sử dụng hình ảnh có cùng kích thước cho tập dữ liệu của bạn, hoặc sử dụng sự phân chia 50/50 giữa hai kích thước khác nhau, tức là 10 hình ảnh có kích thước 512x768px và 10 hình ảnh có kích thước 768x512px.
Quá trình đào tạo có thể diễn ra tốt ngay cả khi bạn không làm điều này – LoRAs Hunyuan Video có thể rất nhân từ.
Phiên bản dài hơn
Giống như LoRAs Kohya-ss cho các hệ thống tạo sinh tĩnh như Stable Diffusion, bucketing được sử dụng để phân phối công việc trên các hình ảnh có kích thước khác nhau, cho phép sử dụng hình ảnh lớn hơn mà không gây ra lỗi bộ nhớ trong quá trình đào tạo (tức là bucketing ‘cắt’ hình ảnh thành các mảnh mà GPU có thể xử lý, trong khi vẫn duy trì tính toàn vẹn ngữ nghĩa của toàn bộ hình ảnh).
Đối với mỗi kích thước hình ảnh bạn bao gồm trong tập dữ liệu đào tạo của mình (tức là 512x768px), một bucket hoặc ‘nhiệm vụ con’ sẽ được tạo cho kích thước đó. Vì vậy, nếu bạn có sự phân phối hình ảnh như sau:
2x 512x768px hình ảnh
7x 768x512px hình ảnh
1x 1000x600px hình ảnh
3x 400x800px hình ảnh
Chúng ta có thể thấy rằng sự chú ý của bucket bị mất cân bằng giữa những hình ảnh này:

Vì vậy, hãy cố gắng giữ cho sự phân phối các kích thước khác nhau tương đối đều.
Trong cả hai trường hợp, hãy tránh sử dụng hình ảnh quá lớn, vì điều này có thể làm chậm quá trình đào tạo, với lợi ích không đáng kể.
Vì sự đơn giản, tôi đã sử dụng 512x768px cho tất cả các bức ảnh trong tập dữ liệu của mình.
Phần khai báo: Mô hình (người) được sử dụng trong tập dữ liệu đã cho tôi toàn bộ sự cho phép để sử dụng những bức ảnh này cho mục đích này, và đã phê duyệt tất cả các đầu ra AI thể hiện sự giống hệt của cô ấy được giới thiệu trong bài viết này.

Tập dữ liệu của tôi bao gồm 40 hình ảnh, ở định dạng PNG (mặc dù JPG cũng ổn). Hình ảnh của tôi được lưu tại C:\Users\Martin\Desktop\DATASETS_HUNYUAN\examplewoman
Bạn nên tạo một thư mục cache trong thư mục hình ảnh đào tạo:

Bây giờ hãy tạo một tệp đặc biệt sẽ cấu hình đào tạo.
TỆP TOML
Quá trình đào tạo và tạo trước LoRA Hunyuan Video thu được đường dẫn tệp từ một tệp văn bản phẳng có phần mở rộng .toml.
Đối với thử nghiệm của tôi, tệp TOML nằm tại C:\Users\Martin\Desktop\DATASETS_HUNYUAN\training.toml
Nội dung của tệp TOML đào tạo của tôi trông như thế này:
[general]
resolution = [512, 768]
caption_extension = ".txt"
batch_size = 1
enable_bucket = true
bucket_no_upscale = false
[[datasets]]
image_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman"
cache_directory = "C:\\Users\\Martin\\Desktop\\DATASETS_HUNYUAN\\examplewoman\\cache"
num_repeats = 1
(Các dấu gạch chéo kép cho các thư mục hình ảnh và cache không luôn cần thiết, nhưng chúng có thể giúp tránh lỗi trong trường hợp có khoảng trắng trong đường dẫn. Tôi đã đào tạo các mô hình với tệp.toml sử dụng dấu gạch chéo đơn và dấu gạch chéo ngược)
Chúng ta có thể thấy trong phần resolution rằng hai độ phân giải sẽ được xem xét – 512px và 768px. Bạn cũng có thể để nó ở 512 và vẫn có kết quả tốt.
CÁC CHỮ ĐỀ
Hunyuan Video là một mô hình nền tảng văn bản+hình ảnh, vì vậy chúng tôi cần các chú thích mô tả cho những hình ảnh này, sẽ được xem xét trong quá trình đào tạo. Quá trình đào tạo sẽ thất bại nếu không có chú thích.
Có rất nhiều hệ thống chú thích mã nguồn mở mà chúng tôi có thể sử dụng cho nhiệm vụ này, nhưng hãy giữ nó đơn giản và sử dụng hệ thống taggui. Mặc dù nó được lưu trữ tại GitHub, và mặc dù nó tải xuống một số mô hình học sâu nặng khi chạy lần đầu, nó có dạng một tệp thực thi Windows đơn giản tải thư viện Python và giao diện người dùng Gradio.
Sau khi khởi chạy Taggui, sử dụng File > Load Directory để điều hướng đến thư mục tập dữ liệu hình ảnh của bạn và tùy chọn đặt một mã định danh token (trong trường hợp này, examplewoman) sẽ được thêm vào tất cả các chú thích:

(Đảm bảo tắt Load in 4-bit khi Taggui mở lần đầu – nó sẽ ném lỗi trong quá trình chú thích nếu điều này được để lại trên)
Chọn một hình ảnh trong cột xem trước bên trái và nhấn CTRL+A để chọn tất cả hình ảnh. Sau đó, nhấn nút Bắt đầu Tự động Chú thích ở bên phải:

Bạn sẽ thấy Taggui tải xuống các mô hình trong cột CLI nhỏ ở cột bên phải, nhưng chỉ khi đó là lần đầu tiên bạn chạy chú thích. Nếu không, bạn sẽ thấy một bản xem trước của các chú thích.

Bây giờ, mỗi bức ảnh đều có một tệp.txt tương ứng với mô tả về nội dung hình ảnh:

Bạn có thể nhấp vào Advanced Options trong Taggui để tăng độ dài và phong cách của các chú thích, nhưng điều đó nằm ngoài phạm vi của hướng dẫn này.
Đóng Taggui và hãy chuyển sang…
ĐỒ HỌA TIỀM NĂNG TRƯỚC
Để tránh tải GPU quá mức trong quá trình đào tạo, cần tạo hai loại tệp được lưu trước – một để đại diện cho hình ảnh tiềm năng được dẫn xuất từ hình ảnh chính và một để đánh giá mã hóa văn bản liên quan đến nội dung chú thích.
Để đơn giản hóa cả ba quy trình (2x lưu trước + đào tạo), bạn có thể sử dụng các tệp.BAT tương tác sẽ hỏi bạn các câu hỏi và thực hiện các quy trình khi bạn đã cung cấp thông tin cần thiết.
Đối với việc lưu trước tiềm năng, hãy sao chép văn bản sau vào Notepad và lưu nó dưới dạng tệp.BAT (tức là đặt tên cho nó như latent-precache.bat), như trước, đảm bảo rằng loại tệp trong menu thả xuống trong hộp thoại Lưu dưới dạng là All Files (xem hình ảnh dưới đây):
@echo off
REM Activate the virtual environment
call C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Get user input
set /p IMAGE_PATH=Enter the path to the image directory:
set /p CACHE_PATH=Enter the path to the cache directory:
set /p TOML_PATH=Enter the path to the TOML file:
echo You entered:
echo Image path: %IMAGE_PATH%
echo Cache path: %CACHE_PATH%
echo TOML file path: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with latent pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Run the latent pre-caching script
python C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\cache_latents.py --dataset_config %TOML_PATH% --vae C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\models\pytorch_model.pt --vae_chunk_size 32 --vae_tiling
) else (
echo Operation canceled.
)
REM Keep the window open
pause
(Thay thế [Tên hồ sơ của bạn] bằng tên hồ sơ Windows thực của bạn)

Bây giờ bạn có thể chạy tệp.BAT cho việc lưu trước tiềm năng tự động:

Khi được nhắc bởi tệp.BAT, hãy dán hoặc nhập đường dẫn đến thư mục tập dữ liệu, thư mục cache và tệp TOML của bạn.
ĐỒ HỌA VĂN BẢN TRƯỚC
Chúng tôi sẽ tạo một tệp.BAT thứ hai, lần này cho việc lưu trước văn bản.
@echo off
REM Activate the virtual environment
call C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Get user input
set /p IMAGE_PATH=Enter the path to the image directory:
set /p CACHE_PATH=Enter the path to the cache directory:
set /p TOML_PATH=Enter the path to the TOML file:
echo You entered:
echo Image path: %IMAGE_PATH%
echo Cache path: %CACHE_PATH%
echo TOML file path: %TOML_PATH%
set /p CONFIRM=Do you want to proceed with text encoder output pre-caching (y/n)?
if /i "%CONFIRM%"=="y" (
REM Use the python executable from the virtual environment
python C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\cache_text_encoder_outputs.py --dataset_config %TOML_PATH% --text_encoder1 C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\models\llava_llama3_fp16.safetensors --text_encoder2 C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\models\clip_l.safetensors --batch_size 16
) else (
echo Operation canceled.
)
REM Keep the window open
pause
Thay thế tên hồ sơ Windows của bạn và lưu tập lệnh này dưới dạng text-cache.bat (hoặc bất kỳ tên nào bạn thích), ở bất kỳ vị trí nào thuận tiện, theo thủ tục cho tệp.BAT trước.
Chạy tệp.BAT này, làm theo hướng dẫn và các tệp mã hóa văn bản cần thiết sẽ xuất hiện trong thư mục cache:

ĐÀO TẠO LORA HUNYUAN VIDEO
Đào tạo LoRA thực sự sẽ mất nhiều thời gian hơn so với hai quy trình chuẩn bị này.
Mặc dù có nhiều biến số khác mà chúng ta có thể lo lắng (chẳng hạn như kích thước lô, lần lặp lại, kỷ và số kỷ, cũng như liệu sử dụng mô hình đầy đủ hay lượng tử), chúng ta sẽ tiết kiệm những cân nhắc đó cho một ngày khác và một cái nhìn sâu hơn về sự tinh tế của việc tạo LoRA.
Để đơn giản hóa một chút và đào tạo một LoRA trên các thiết lập ‘trung bình’.
Chúng tôi sẽ tạo một tệp.BAT thứ ba, lần này để khởi động đào tạo. Dán văn bản sau vào Notepad và lưu nó dưới dạng tệp.BAT, như trước, đặt tên cho nó như training.bat (hoặc bất kỳ tên nào bạn thích):
@echo off
REM Activate the virtual environment
call C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\Scripts\activate.bat
REM Get user input
set /p DATASET_CONFIG=Enter the path to the dataset configuration file:
set /p EPOCHS=Enter the number of epochs to train:
set /p OUTPUT_NAME=Enter the output model name (e.g., example0001):
set /p LEARNING_RATE=Choose learning rate (1 for 1e-3, 2 for 5e-3, default 1e-3):
if "%LEARNING_RATE%"=="1" set LR=1e-3
if "%LEARNING_RATE%"=="2" set LR=5e-3
if "%LEARNING_RATE%"=="" set LR=1e-3
set /p SAVE_STEPS=How often (in steps) to save preview images:
set /p SAMPLE_PROMPTS=What is the location of the text-prompt file for training previews?
echo You entered:
echo Dataset configuration file: %DATASET_CONFIG%
echo Number of epochs: %EPOCHS%
echo Output name: %OUTPUT_NAME%
echo Learning rate: %LR%
echo Save preview images every %SAVE_STEPS% steps.
echo Text-prompt file: %SAMPLE_PROMPTS%
REM Prepare the command
set CMD=accelerate launch --num_cpu_threads_per_process 1 --mixed_precision bf16 ^
C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\hv_train_network.py ^
--dit C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\models\mp_rank_00_model_states.pt ^
--dataset_config %DATASET_CONFIG% ^
--sdpa ^
--mixed_precision bf16 ^
--fp8_base ^
--optimizer_type adamw8bit ^
--learning_rate %LR% ^
--gradient_checkpointing ^
--max_data_loader_n_workers 2 ^
--persistent_data_loader_workers ^
--network_module=networks.lora ^
--network_dim=32 ^
--timestep_sampling sigmoid ^
--discrete_flow_shift 1.0 ^
--max_train_epochs %EPOCHS% ^
--save_every_n_epochs=1 ^
--seed 42 ^
--output_dir "C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\Output Models" ^
--output_name %OUTPUT_NAME% ^
--vae C:/Users/[Tên hồ sơ của bạn]/Desktop/Musubi/musubi/musubi-tuner/models/pytorch_model.pt ^
--vae_chunk_size 32 ^
--vae_spatial_tile_sample_min_size 128 ^
--text_encoder1 C:/Users/[Tên hồ sơ của bạn]/Desktop/Musubi/musubi/musubi-tuner/models/llava_llama3_fp16.safetensors ^
--text_encoder2 C:/Users/[Tên hồ sơ của bạn]/Desktop/Musubi/musubi/musubi-tuner/models/clip_l.safetensors ^
--sample_prompts %SAMPLE_PROMPTS% ^
--sample_every_n_steps %SAVE_STEPS% ^
--sample_at_first
echo The following command will be executed:
echo %CMD%
set /p CONFIRM=Do you want to proceed with training (y/n)?
if /i "%CONFIRM%"=="y" (
%CMD%
) else (
echo Operation canceled.
)
REM Keep the window open
cmd /k
Như trước, hãy thay thế tất cả các thể hiện của [Tên hồ sơ của bạn] bằng tên hồ sơ Windows thực của bạn.
Đảm bảo rằng thư mục C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\Output Models\ tồn tại và tạo nó ở vị trí đó nếu không.
ĐÀO TẠO TRƯỚC
Có một tính năng xem trước đào tạo rất cơ bản đã được kích hoạt cho Musubi trainer, cho phép bạn buộc mô hình đào tạo tạm dừng và tạo ra hình ảnh dựa trên các lời nhắc bạn đã lưu. Những hình ảnh này được lưu trong một thư mục tự động tạo có tên Sample, trong cùng thư mục mà các mô hình được đào tạo được lưu.

Để kích hoạt tính năng này, bạn sẽ cần lưu ít nhất một lời nhắc trong một tệp văn bản. Tệp.BAT đào tạo mà chúng tôi đã tạo sẽ hỏi bạn nhập vị trí của tệp này; do đó, bạn có thể đặt tên cho tệp lời nhắc là bất kỳ thứ gì bạn thích và lưu nó ở bất kỳ vị trí nào.
Dưới đây là một số ví dụ về lời nhắc cho một tệp sẽ tạo ra ba hình ảnh khác nhau khi được yêu cầu bởi quy trình đào tạo:

Como bạn có thể thấy trong ví dụ trên, bạn có thể đặt các lá cờ ở cuối lời nhắc mà sẽ ảnh hưởng đến hình ảnh:
–w là chiều rộng (mặc định là 256px nếu không được đặt, theo tài liệu)
–h là chiều cao (mặc định là 256px nếu không được đặt)
–f là số khung hình. Nếu được đặt là 1, một hình ảnh sẽ được tạo; nhiều hơn một, một video sẽ được tạo.
–d là hạt giống. Nếu không được đặt, nó sẽ ngẫu nhiên; nhưng bạn nên đặt nó để xem một lời nhắc đang phát triển.
–s là số bước trong quá trình tạo, mặc định là 20.
Xem tài liệu chính thức để biết thêm các lá cờ.
Mặc dù các hình ảnh xem trước đào tạo có thể nhanh chóng tiết lộ một số vấn đề có thể khiến bạn hủy đào tạo và xem xét lại dữ liệu hoặc thiết lập, do đó tiết kiệm thời gian, hãy nhớ rằng mỗi lời nhắc bổ sung sẽ làm chậm đào tạo một chút.
Cũng như, kích thước hình ảnh xem trước đào tạo càng lớn (theo các lá cờ được liệt kê ở trên), đào tạo sẽ càng chậm.
Khởi chạy tệp.BAT đào tạo của bạn.
Câu hỏi #1 là ‘Enter the path to the dataset configuration. Dán hoặc nhập đường dẫn chính xác đến tệp TOML của bạn.
Câu hỏi #2 là ‘Enter the number of epochs to train’. Đây là một biến thử nghiệm, vì nó bị ảnh hưởng bởi số lượng và chất lượng hình ảnh, cũng như chú thích và các yếu tố khác. Generally, it is best to set it too high than too low, since you can always stop the training with Ctrl+C in the training window if you feel the model has advanced enough. Set it to 100 in the first instance, and see how it goes.
Câu hỏi #3 là ‘Enter the output model name’. Đặt tên cho mô hình của bạn! Có thể tốt nhất là giữ tên ngắn gọn và đơn giản.
Câu hỏi #4 là ‘Choose learning rate’, mặc định là 1e-3 (tùy chọn 1). Đây là một nơi tốt để bắt đầu, tùy thuộc vào kinh nghiệm thêm.
Câu hỏi #5 là ‘How often (in steps) to save preview images. Nếu bạn đặt nó quá thấp, bạn sẽ thấy ít tiến bộ giữa các lần lưu hình ảnh xem trước, và điều này sẽ làm chậm đào tạo.
Câu hỏi #6 là ‘What is the location of the text-prompt file for training previews?’. Dán hoặc nhập đường dẫn đến tệp văn bản lời nhắc của bạn.
Tệp.BAT sau đó sẽ hiển thị lệnh mà nó sẽ gửi đến Mô hình Hunyuan, và hỏi bạn xem bạn có muốn tiếp tục hay không, y/n.
Hãy tiếp tục và bắt đầu đào tạo:

Trong thời gian này, nếu bạn kiểm tra phần GPU của tab Performance của Trình quản lý tác vụ Windows, bạn sẽ thấy quá trình này đang chiếm khoảng 16GB VRAM.

Điều này có thể không phải là một con số tùy ý, vì đây là lượng VRAM có sẵn trên khá nhiều thẻ đồ họa NVIDIA, và mã nguồn có thể đã được tối ưu hóa để phù hợp với các tác vụ vào 16GB vì lợi ích của những người sở hữu thẻ như vậy.
Đó nói, rất dễ dàng để tăng sử dụng này, bằng cách gửi nhiều lá cờ tốn kém hơn đến lệnh đào tạo.
Trong quá trình đào tạo, bạn sẽ thấy ở phía dưới bên phải của cửa sổ CMD một con số cho biết thời gian đã trôi qua kể từ khi đào tạo bắt đầu, và một ước tính về thời gian đào tạo tổng thể (điều này sẽ thay đổi rất nhiều tùy thuộc vào lá cờ được đặt, số lượng hình ảnh đào tạo, số lượng hình ảnh xem trước đào tạo, và một số yếu tố khác).

Thời gian đào tạo điển hình là khoảng 3-4 giờ trên các thiết lập trung bình, tùy thuộc vào phần cứng có sẵn, số lượng hình ảnh, thiết lập lá cờ và các yếu tố khác.
SỬ DỤNG MÔ HÌNH LORA ĐÃ ĐÀO TẠO TRONG HUNYUAN VIDEO
CHỌN ĐIỂM KẾT
Khi đào tạo kết thúc, bạn sẽ có một điểm kiểm tra cho mỗi kỷ đào tạo.

Tần suất lưu này có thể được thay đổi bởi người dùng để lưu thường xuyên hơn hoặc ít thường xuyên hơn, như mong muốn, bằng cách sửa đổi số --save_every_n_epochs [N] trong tệp.BAT đào tạo. Nếu bạn đã thêm một số thấp cho các bước lưu trong khi thiết lập đào tạo với tệp.BAT, sẽ có một số lượng lớn tệp điểm kiểm tra đã lưu.
CHỌN ĐIỂM KẾT NÀO?
Như đã đề cập trước đó, các mô hình đào tạo sớm nhất sẽ linh hoạt nhất, trong khi các điểm kiểm tra sau có thể cung cấp chi tiết nhất. Cách duy nhất để kiểm tra những yếu tố này là chạy một số LoRAs và tạo một số video. Theo cách này, bạn có thể tìm hiểu những điểm kiểm tra nào là sản phẩm và đại diện cho sự cân bằng tốt nhất giữa tính linh hoạt và trung thực.
COMFYUI
Môi trường phổ biến nhất (mặc dù không phải là duy nhất) để sử dụng LoRAs Hunyuan Video hiện tại là ComfyUI, một trình chỉnh sửa dựa trên nút với giao diện Gradio tinh gọn chạy trong trình duyệt web của bạn.

Nguồn: https://github.com/comfyanonymous/ComfyUI
Hướng dẫn cài đặt rất đơn giản và có sẵn tại kho lưu trữ GitHub chính thức (các mô hình bổ sung sẽ phải được tải xuống).
CHUYỂN ĐỔI MÔ HÌNH CHO COMFYUI
Mô hình LoRA đã đào tạo của bạn được lưu trong định dạng (diffusers) không tương thích với hầu hết các triển khai ComfyUI. Musubi có thể chuyển đổi một mô hình sang định dạng ComfyUI tương thích. Hãy tạo một tệp.BAT để thực hiện việc này.
Trước khi chạy tệp.BAT này, hãy tạo thư mục C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\CONVERTED\ mà kịch bản đang mong đợi.
@echo off
REM Activate the virtual environment
call C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\Scripts\activate.bat
:START
REM Get user input
set /p INPUT_PATH=Enter the path to the input Musubi safetensors file (or type "exit" to quit):
REM Exit if the user types "exit"
if /i "%INPUT_PATH%"=="exit" goto END
REM Extract the file name from the input path and append 'converted' to it
for %%F in ("%INPUT_PATH%") do set FILENAME=%%~nF
set OUTPUT_PATH=C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\Output Models\CONVERTED\%FILENAME%_converted.safetensors
set TARGET=other
echo You entered:
echo Input file: %INPUT_PATH%
echo Output file: %OUTPUT_PATH%
echo Target format: %TARGET%
set /p CONFIRM=Do you want to proceed with the conversion (y/n)?
if /i "%CONFIRM%"=="y" (
REM Run the conversion script with correctly quoted paths
python C:\Users\[Tên hồ sơ của bạn]\Desktop\Musubi\musubi\musubi-tuner\convert_lora.py --input "%INPUT_PATH%" --output "%OUTPUT_PATH%" --target %TARGET%
echo Conversion complete.
) else (
echo Operation canceled.
)
REM Return to start for another file
goto START
:END
REM Keep the window open
echo Exiting the script.
pause
Như trước, hãy lưu tập lệnh này dưới dạng ‘All files’ từ Notepad, đặt tên cho nó là convert.bat (hoặc bất kỳ tên nào bạn thích).
Khi đã lưu, hãy kích đúp vào tệp.BAT mới, nó sẽ hỏi vị trí của tệp để chuyển đổi.

Dán hoặc nhập đường dẫn đến tệp đã đào tạo mà bạn muốn chuyển đổi, nhấn y, và nhấn enter.

Sau khi lưu mô hình LoRA đã chuyển đổi vào thư mục CONVERTED , kịch bản sẽ hỏi bạn xem bạn có muốn chuyển đổi một tệp khác hay không. Nếu bạn muốn kiểm tra nhiều điểm kiểm tra trong ComfyUI, hãy chuyển đổi một số mô hình.
Khi bạn đã chuyển đổi đủ điểm kiểm tra, hãy đóng cửa sổ lệnh.BAT.
Bây giờ bạn có thể sao chép mô hình LoRA đã chuyển đổi của mình vào thư mục models\loras trong cài đặt ComfyUI của mình.
Thông thường vị trí chính xác là một thứ gì đó như:
C:\Users\[Tên hồ sơ của bạn]\Desktop\ComfyUI\models\loras\
TẠO LORA HUNYUAN TRONG COMFYUI
Mặc dù các công việc dựa trên nút của ComfyUI có vẻ phức tạp ban đầu, nhưng các thiết lập của các người dùng khác có thể được tải bằng cách kéo một hình ảnh (được tạo bằng ComfyUI của người dùng khác) trực tiếp vào cửa sổ ComfyUI. Các công việc cũng có thể được xuất dưới dạng tệp JSON, có thể được nhập thủ công hoặc kéo vào cửa sổ ComfyUI.
Một số công việc nhập sẽ có các phụ thuộc mà có thể không tồn tại trong cài đặt của bạn. Do đó, hãy cài đặt ComfyUI-Manager, có thể tự động tải các mô-đun bị thiếu.

Nguồn: https://github.com/ltdrdata/ComfyUI-Manager
Để tải một công việc được sử dụng để tạo video từ các mô hình trong hướng dẫn này, hãy tải xuống tệp JSON này và kéo nó vào cửa sổ ComfyUI của bạn (mặc dù có rất nhiều ví dụ công việc tốt hơn có sẵn tại các cộng đồng Reddit và Discord đã áp dụng Hunyuan Video, và của tôi được điều chỉnh từ một trong số đó).
Đây không phải là nơi để hướng dẫn mở rộng về việc sử dụng ComfyUI, nhưng đáng đề cập một số tham số quan trọng sẽ ảnh hưởng đến đầu ra của bạn nếu bạn tải xuống và sử dụng bố cục JSON mà tôi đã liên kết ở trên.

1) Chiều rộng và Chiều cao
Hình ảnh càng lớn, quá trình tạo sẽ càng mất nhiều thời gian, và rủi ro lỗi bộ nhớ (OOM) càng cao.
2) Độ dài
Đây là giá trị số cho số khung hình. Số giây mà nó cộng lại phụ thuộc vào tốc độ khung hình (đặt ở 30fps trong bố cục này). Bạn có thể chuyển đổi giây sang khung hình dựa trên fps tại Omnicalculator.
3) Kích thước lô
Kích thước lô càng cao, kết quả càng nhanh, nhưng gánh nặng VRAM càng lớn. Đặt nó quá cao và bạn có thể gặp lỗi OOM.
4) Điều khiển sau khi tạo
Điều này kiểm soát hạt giống ngẫu nhiên. Các tùy chọn cho nút con này là fixed, increment, decrement và randomize. Nếu bạn để nó ở fixed và không thay đổi lời nhắc văn bản, bạn sẽ nhận được cùng một hình ảnh mỗi lần. Nếu bạn sửa đổi lời nhắc văn bản, hình ảnh sẽ thay đổi một chút. Các thiết lập increment và decrement cho phép bạn khám phá các giá trị hạt giống lân cận, trong khi randomize cho bạn một sự giải thích hoàn toàn mới về lời nhắc.
5) Tên LoRA
Bạn sẽ cần chọn mô hình đã cài đặt của mình tại đây, trước khi cố gắng tạo.
6) Token
Nếu bạn đã đào tạo mô hình của mình để kích hoạt khái niệm với một token (chẳng hạn như ‘example-person’), hãy đặt từ kích hoạt đó vào lời nhắc của bạn.
7) Bước
Điều này đại diện cho số bước mà hệ thống sẽ áp dụng cho quá trình khuếch tán. Các bước cao hơn có thể đạt được chi tiết tốt hơn, nhưng có một giới hạn về mức độ hiệu quả của cách tiếp cận này, và ngưỡng đó có thể khó tìm. Phạm vi bước phổ biến là khoảng 20-30.
8) Kích thước ô
Điều này xác định bao nhiêu thông tin được xử lý cùng một lúc trong quá trình tạo. Nó được đặt ở 256 theo mặc định. Tăng nó có thể tăng tốc tạo, nhưng tăng nó quá cao có thể dẫn đến một lỗi OOM đặc biệt khó chịu, vì nó đến ở cuối một quá trình dài.
9) Trùng lấp thời gian
Tạo Hunyuan Video của con người có thể dẫn đến ‘ma’, hoặc chuyển động không thuyết phục nếu điều này được đặt quá thấp. Generally, current wisdom is that this should be set to a higher value than the number of frames, to produce better movement.
KẾT LUẬN
Mặc dù việc khám phá thêm về việc sử dụng ComfyUI nằm ngoài phạm vi của bài viết này, nhưng kinh nghiệm của cộng đồng tại Reddit và Discord có thể làm cho việc học dễ dàng hơn, và có một số hướng dẫn trực tuyến giới thiệu các cơ bản.
Được xuất bản lần đầu vào thứ Năm, ngày 23 tháng 1 năm 2025












