Góc nhìn Anderson
HunyuanCustom Mang đến Video Deepfake Từ Hình Ảnh Đơn, Với Âm Thanh và Đồng Bộ Hóa Môi

Bài viết này thảo luận về một bản phát hành mới của mô hình thế giới video đa phương thức Hunyuan được gọi là ‘HunyuanCustom’. Phạm vi bảo hiểm của bài báo mới, kết hợp với một số vấn đề trong nhiều video mẫu được cung cấp tại trang web dự án*, hạn chế chúng tôi trong phạm vi bảo hiểm chung hơn so với bình thường, và hạn chế việc sao chép lại một lượng lớn tài liệu video đi kèm với bản phát hành này (vì nhiều video yêu cầu chỉnh sửa và xử lý đáng kể để cải thiện khả năng đọc của bố cục).
Xin lưu ý thêm rằng bài báo đề cập đến hệ thống sinh tổng hợp dựa trên API là ‘Keling’. Để rõ ràng, tôi đề cập đến ‘Kling’ trong suốt.
Tencent đang trong quá trình phát hành một phiên bản mới của mô hình Hunyuan Video, có tên HunyuanCustom. Phiên bản mới này dường như có khả năng làm cho Hunyuan LoRA models trở nên thừa, bằng cách cho phép người dùng tạo video tùy chỉnh theo phong cách ‘deepfake’ thông qua một hình ảnh:
Click để phát. Prompt: ‘Một người đàn ông đang nghe nhạc và nấu mì trong nhà bếp’. Phương pháp mới này so với cả phương pháp nguồn đóng và nguồn mở, bao gồm Kling, là một đối thủ đáng kể trong không gian này. Nguồn: https://hunyuancustom.github.io/ (cảnh báo: trang web đòi hỏi nhiều tài nguyên CPU và bộ nhớ!)
Trong cột trái nhất của video trên, chúng ta thấy hình ảnh nguồn đơn được cung cấp cho HunyuanCustom, tiếp theo là sự giải thích của hệ thống mới về prompt trong cột thứ hai, bên cạnh nó. Các cột còn lại hiển thị kết quả từ các hệ thống độc quyền và FOSS khác: Kling; Vidu; Pika; Hailuo; và Wan-based SkyReels-A2.
Trong video dưới đây, chúng ta thấy các bản render của ba kịch bản thiết yếu cho bản phát hành này: lần lượt, người + đối tượng; nhân vật đơn; và thử nghiệm ảo (người + quần áo):
Click để phát. Ba ví dụ được chỉnh sửa từ tài liệu tại trang web hỗ trợ cho Hunyuan Video.
Chúng ta có thể nhận thấy một số điều từ những ví dụ này, hầu hết liên quan đến hệ thống dựa trên một hình ảnh nguồn, thay vì nhiều hình ảnh của cùng một đối tượng.
Trong đoạn clip đầu tiên, người đàn ông cơ bản vẫn đang đối mặt với máy quay. Anh ta cúi đầu xuống và sang bên với không nhiều hơn 20-25 độ quay, nhưng ở một góc nghiêng quá mức đó, hệ thống sẽ phải bắt đầu đoán xem anh ta trông như thế nào khi nhìn ngang.
Trong ví dụ thứ hai, chúng ta thấy rằng cô bé cười trong video được render như cô bé trong hình ảnh tĩnh nguồn. Một lần nữa, với hình ảnh này làm tham chiếu, HunyuanCustom sẽ phải đưa ra một ước lượng tương đối không chính xác về khuôn mặt ‘nghỉ ngơi’ của cô bé.
Trong ví dụ cuối cùng, chúng ta thấy rằng vì tài liệu nguồn – người phụ nữ và quần áo cô ấy được yêu cầu mặc – không phải là hình ảnh hoàn chỉnh, bản render đã cắt kịch bản để phù hợp – điều này thực sự là một giải pháp khá tốt cho vấn đề dữ liệu!
Điểm mấu chốt là mặc dù hệ thống mới có thể xử lý nhiều hình ảnh (như người + khoai tây chiên, hoặc người + quần áo), nhưng nó không cho phép nhiều góc độ hoặc góc nhìn của một nhân vật, vì vậy các biểu cảm hoặc góc nhìn khác nhau có thể được bao gồm. Ở mức độ này, hệ thống có thể gặp khó khăn trong việc thay thế hệ sinh thái ngày càng phát triển của các mô hình LoRA đã mọc lên xung quanh HunyuanVideo kể từ khi nó được phát hành vào tháng 12, vì những mô hình này có thể giúp HunyuanVideo tạo ra các nhân vật nhất quán từ mọi góc độ và với mọi biểu cảm khuôn mặt được đại diện trong tập dữ liệu đào tạo (20-60 hình ảnh là điển hình).
Được Thiết Kế Để Âm Thanh
Đối với âm thanh, HunyuanCustom tận dụng hệ thống LatentSync (khá khó cho các nhà yêu thích để thiết lập và đạt được kết quả tốt) để có được các chuyển động môi phù hợp với âm thanh và văn bản mà người dùng cung cấp:
Đặc điểm âm thanh. Click để phát. Các ví dụ khác nhau về đồng bộ hóa môi từ trang web bổ sung của HunyuanCustom, được chỉnh sửa lại.
Tại thời điểm viết, không có ví dụ tiếng Anh, nhưng những ví dụ này dường như khá tốt – đặc biệt nếu phương pháp tạo ra chúng dễ dàng cài đặt và tiếp cận được.
Chỉnh Sửa Video Hiện Có
Hệ thống mới cung cấp những kết quả ấn tượng cho việc chỉnh sửa video-to-video (V2V, hoặc Vid2Vid), trong đó một đoạn của video hiện có (thực) được che đi và thông minh thay thế bằng một đối tượng được đưa ra trong một hình ảnh tham chiếu đơn:
Click để phát. Chỉ đối tượng trung tâm được nhắm đến, nhưng những gì còn lại xung quanh nó cũng bị thay đổi trong một lần đi qua vid2vid của HunyuanCustom.
Như chúng ta có thể thấy, và như là tiêu chuẩn trong một kịch bản vid2vid, toàn bộ video bị thay đổi theo một mức độ nào đó bởi quá trình, mặc dù bị thay đổi nhiều nhất trong khu vực được nhắm đến, tức là đồ chơi bông.
Giả sử các đường ống có thể được phát triển để tạo ra những biến đổi như vậy dưới một phương pháp garbage matte để lại phần lớn nội dung video giống hệt với bản gốc.
Một Bắt Đầu Mới?
Đây là một sáng kiến phát triển từ dự án Hunyuan Video, không phải là một bước ngoặt cứng nhắc khỏi dòng phát triển này. Các cải tiến của dự án được giới thiệu như các chèn kiến trúc rời rạc chứ không phải là thay đổi cấu trúc lớn, nhằm cho phép mô hình duy trì tính nhất quán của danh tính trên các khung hình mà không dựa vào đối tượng cụ thể fine-tuning, như với LoRA hoặc các phương pháp đảo ngược văn bản.
Rõ ràng, do đó, HunyuanCustom không được đào tạo từ đầu, mà là một fine-tuning của mô hình HunyuanVideo cơ bản tháng 12 năm 2024.
Những người đã phát triển HunyuanVideo LoRAs có thể tự hỏi liệu họ sẽ vẫn hoạt động với phiên bản mới này, hoặc liệu họ sẽ phải tái phát minh lại bánh xe LoRA một lần nữa nếu họ muốn nhiều khả năng tùy chỉnh hơn những gì được tích hợp vào bản phát hành mới này.
Thông thường, một phiên bản fine-tuning của một mô hình siêu quy mô thay đổi trọng số mô hình đủ để các LoRAs được tạo cho mô hình trước đó sẽ không hoạt động đúng hoặc không hoạt động với mô hình tinh chỉnh mới.
Đôi khi, tuy nhiên, sự phổ biến của một fine-tune có thể thách thức nguồn gốc của nó: một ví dụ về fine-tune trở thành một fork hiệu quả, với một hệ sinh thái và người theo dõi riêng của nó, là Pony Diffusion tinh chỉnh của Stable Diffusion XL (SDXL). Pony hiện có 592.000+ lượt tải xuống trên civitai đang thay đổi, với một loạt các LoRAs đã sử dụng Pony (và không phải SDXL) làm mô hình cơ bản, và yêu cầu Pony tại thời điểm suy luận.
Phát Hành
Trang web dự án cho bài báo mới (được đặt tên HunyuanCustom: Một Kiến Trúc Đa Phương Thức cho Tùy Chỉnh Video) có các liên kết đến một trang web GitHub mà, tại thời điểm tôi viết, vừa trở nên hoạt động, và dường như chứa tất cả mã và trọng số cần thiết cho triển khai cục bộ, cùng với một kế hoạch thời gian (trong đó chỉ có ComfyUI tích hợp là điều quan trọng còn lại).
Tại thời điểm viết, sự hiện diện của dự án trên Hugging Face vẫn là 404. Tuy nhiên, có một phiên bản dựa trên API của hệ thống, nơi bạn có thể thử nghiệm hệ thống, miễn là bạn có thể cung cấp mã quét WeChat.
Tôi hiếm khi thấy một sự kết hợp như vậy của nhiều dự án trong một lắp ráp, như được chứng minh trong HunyuanCustom – và có lẽ một số giấy phép sẽ buộc phải phát hành đầy đủ.
Hai mô hình được công bố tại trang web GitHub: một phiên bản 720px1280px yêu cầu 8 GB bộ nhớ GPU Peak, và một phiên bản 512px896px yêu cầu 60 GB bộ nhớ GPU Peak.
Kho lưu trữ tuyên bố ‘Bộ nhớ GPU tối thiểu yêu cầu là 24 GB cho 720px1280px129f nhưng rất chậm… Chúng tôi khuyên bạn nên sử dụng một GPU có 80 GB bộ nhớ cho chất lượng tạo tốt hơn’ – và lặp lại rằng hệ thống chỉ được thử nghiệm trên Linux cho đến nay.
Mô hình Hunyuan Video trước đó đã được quantized xuống các kích thước mà nó có thể chạy trên ít hơn 24 GB VRAM, và dường như hợp lý khi giả định rằng mô hình mới sẽ được thích nghi thành các hình thức thân thiện với người tiêu dùng hơn bởi cộng đồng, và nó sẽ nhanh chóng được thích nghi để sử dụng trên các hệ thống Windows cũng vậy.
Do hạn chế về thời gian và lượng thông tin khổng lồ đi kèm với bản phát hành này, chúng ta chỉ có thể xem xét rộng hơn, thay vì sâu sắc, về bản phát hành này. Tuy nhiên, hãy cùng xem xét HunyuanCustom một chút.
Xem Xét Bài Báo
Đường ống dữ liệu cho HunyuanCustom, rõ ràng là tuân thủ khuôn khổ GDPR, kết hợp cả dữ liệu video tổng hợp và nguồn mở, bao gồm OpenHumanVid, với tám danh mục cốt lõi được đại diện: con người, động vật, thực vật, phong cảnh, phương tiện, đối tượng, kiến trúc, và anime.

Từ bài báo, một cái nhìn tổng quan về các gói đa dạng trong đường ống xây dựng dữ liệu của HunyuanCustom. Nguồn: https://arxiv.org/pdf/2505.04512
Lọc ban đầu bắt đầu với PySceneDetect, phân đoạn video thành các đoạn một shot. TextBPN-Plus-Plus sau đó được sử dụng để loại bỏ các video chứa văn bản trên màn hình, phụ đề, watermark hoặc logo quá mức.
Để giải quyết sự không nhất quán về độ phân giải và thời lượng, các đoạn được chuẩn hóa thành năm giây và thay đổi kích thước thành 512 hoặc 720 pixel trên cạnh ngắn. Lọc thẩm mỹ được xử lý bằng Koala-36M, với ngưỡng tùy chỉnh là 0,06 được áp dụng cho tập dữ liệu tùy chỉnh được tạo bởi các nhà nghiên cứu của bài báo mới.
Quá trình trích xuất đối tượng kết hợp Qwen7B mô hình ngôn ngữ lớn (LLM), khuôn khổ nhận dạng đối tượng YOLO11X, và kiến trúc InsightFace phổ biến, để xác định và xác thực danh tính con người.
Đối với các đối tượng không phải con người, QwenVL và Grounded SAM 2 được sử dụng để trích xuất các hộp giới hạn liên quan, được loại bỏ nếu quá nhỏ.

Ví dụ về phân đoạn ngữ nghĩa với Grounded SAM 2, được sử dụng trong dự án Hunyuan Control. Nguồn: https://github.com/IDEA-Research/Grounded-SAM-2
Trích xuất đa đối tượng sử dụng Florence2 cho chú thích hộp giới hạn, và Grounded SAM 2 cho phân đoạn, sau đó là phân cụm và phân đoạn thời gian của các khung hình đào tạo.
Các đoạn đã xử lý được nâng cao hơn thông qua chú thích, sử dụng một hệ thống nhãn cấu trúc độc quyền được phát triển bởi nhóm Hunyuan, và cung cấp siêu dữ liệu phân lớp như mô tả và tín hiệu chuyển động máy ảnh.
Mask augmentation chiến lược, bao gồm chuyển đổi thành hộp giới hạn, được áp dụng trong quá trình đào tạo để giảm overfitting và đảm bảo mô hình thích nghi với các hình dạng đối tượng đa dạng.
Dữ liệu âm thanh được đồng bộ hóa bằng cách sử dụng LatentSync, và các đoạn bị loại bỏ nếu điểm số đồng bộ hóa giảm xuống dưới một ngưỡng tối thiểu.
Khung đánh giá chất lượng hình ảnh mù HyperIQA được sử dụng để loại bỏ các video có điểm số dưới 40 (trên thang đo tùy chỉnh của HyperIQA). Các bản âm thanh hợp lệ sau đó được xử lý bằng Whisper để trích xuất tính năng cho các nhiệm vụ hạ lưu.
Các tác giả kết hợp mô hình trợ lý ngôn ngữ LLaVA trong giai đoạn chú thích, và họ nhấn mạnh vị trí trung tâm của khuôn khổ này trong HunyuanCustom. LLaVA được sử dụng để tạo chú thích hình ảnh và hỗ trợ việc căn chỉnh nội dung hình ảnh với các prompt văn bản, hỗ trợ việc xây dựng một tín hiệu đào tạo nhất quán trên các phương thức:

Khung HunyuanCustom hỗ trợ tạo video nhất quán về danh tính có điều kiện bởi văn bản, hình ảnh, âm thanh và đầu vào video.
Bằng cách tận dụng khả năng căn chỉnh ngôn ngữ-vision của LLaVA, đường ống dẫn đạt được một lớp nhất quán ngữ nghĩa bổ sung giữa các yếu tố hình ảnh và mô tả văn bản của chúng – đặc biệt có giá trị trong các kịch bản đa đối tượng hoặc phức tạp.
Video Tùy Chỉnh
Để cho phép tạo video dựa trên một hình ảnh tham chiếu và một prompt, hai mô-đun tập trung vào LLaVA đã được tạo, trước tiên là thích nghi cấu trúc đầu vào của HunyuanVideo để nó có thể chấp nhận một hình ảnh cùng với văn bản.
Điều này liên quan đến việc định dạng prompt theo cách nhúng hình ảnh trực tiếp hoặc gắn thẻ nó với một mô tả danh tính ngắn. Một token phân cách được sử dụng để ngăn chặn việc nhúng hình ảnh không làm cho nội dung prompt quá tải.
Vì bộ mã hóa hình ảnh của LLaVA có xu hướng nén hoặc loại bỏ các chi tiết không gian tinh tế trong quá trình căn chỉnh các tính năng hình ảnh và văn bản (đặc biệt là khi dịch một hình ảnh tham chiếu đơn thành một bản nhúng ngữ nghĩa chung), một mô-đun nâng cao danh tính đã được kết hợp. Vì hầu hết các mô hình khuếch tán video tiềm ẩn đều gặp khó khăn trong việc duy trì danh tính mà không có LoRA, ngay cả trong một đoạn năm giây, hiệu suất của mô-đun này trong thử nghiệm cộng đồng có thể chứng minh là quan trọng.
Trong mọi trường hợp, hình ảnh tham chiếu sau đó được thay đổi kích thước và mã hóa bằng cách sử dụng 3D-VAE nhân quả từ mô hình HunyuanVideo ban đầu, và tiềm ẩn của nó được chèn vào tiềm ẩn video trên trục thời gian, với một độ lệch không gian được áp dụng để ngăn hình ảnh không được sao chép trực tiếp vào đầu ra, trong khi vẫn hướng dẫn việc tạo.
Mô hình được đào tạo bằng cách sử dụng Flow Matching, với mẫu nhiễu được lấy từ một logit-normal phân phối – và mạng được đào tạo để phục hồi video chính xác từ các tiềm ẩn nhiễu này. LLaVA và bộ tạo video đều được tinh chỉnh cùng nhau để hình ảnh và prompt có thể hướng dẫn đầu ra một cách trơn tru hơn và duy trì tính nhất quán của danh tính đối tượng.
Đối với các prompt đa đối tượng, mỗi cặp hình ảnh-văn bản được nhúng riêng biệt và được chỉ định một vị trí thời gian riêng biệt, cho phép các danh tính được phân biệt và hỗ trợ việc tạo ra các cảnh có nhiều đối tượng tương tác.
Âm Thanh và Hình Ảnh
HunyuanCustom điều kiện tạo âm thanh/nói sử dụng cả âm thanh đầu vào của người dùng và một prompt văn bản, cho phép các nhân vật nói trong các cảnh phản ánh thiết lập được mô tả.
Để hỗ trợ điều này, một mô-đun AudioNet tách biệt danh tính giới thiệu các tính năng âm thanh mà không làm gián đoạn các tín hiệu danh tính được nhúng từ hình ảnh tham chiếu và prompt. Các tính năng này được căn chỉnh với dòng thời gian video nén, chia thành các đoạn cấp độ khung hình, và được tiêm bằng một cơ chế cross-attention không gian giúp giữ mỗi khung hình cách ly, duy trì tính nhất quán của đối tượng và tránh can thiệp thời gian.
Một mô-đun tiêm thời gian thứ hai cung cấp kiểm soát tốt hơn về thời gian và chuyển động, hoạt động cùng với AudioNet, ánh xạ các tính năng âm thanh vào các khu vực cụ thể của trình tự tiềm ẩn, và sử dụng một Multi-Layer Perceptron (MLP) để chuyển đổi chúng thành token-wise độ lệch chuyển động. Điều này cho phép cử chỉ và chuyển động khuôn mặt theo nhịp điệu và nhấn mạnh của đầu vào nói một cách chính xác hơn.
HunyuanCustom cho phép các đối tượng trong các video hiện có được chỉnh sửa trực tiếp, thay thế hoặc chèn các đối tượng hoặc người vào một cảnh mà không cần phải xây dựng lại toàn bộ đoạn từ đầu. Điều này làm cho nó hữu ích cho các nhiệm vụ liên quan đến việc thay đổi ngoại hình hoặc chuyển động theo cách nhắm mục tiêu.
Click để phát. Một ví dụ khác từ trang web bổ sung.
Để tạo điều kiện thuận lợi cho việc thay thế đối tượng trong các video hiện có, hệ thống mới tránh phương pháp tốn tài nguyên của các phương pháp gần đây như VACE, hoặc những phương pháp hợp nhất toàn bộ chuỗi video, thay vào đó ưa thích việc nén một video tham chiếu bằng cách sử dụng 3D-VAE nhân quả được đào tạo trước – căn chỉnh nó với các tiềm ẩn video nội bộ của đường ống tạo, và sau đó thêm hai cái vào nhau. Điều này giữ cho quá trình tương đối nhẹ, trong khi vẫn cho phép nội dung video bên ngoài hướng dẫn đầu ra.
Một mạng nơ-ron nhỏ xử lý sự căn chỉnh giữa video đầu vào sạch và các tiềm ẩn nhiễu được sử dụng trong tạo. Hệ thống kiểm tra hai cách tiêm thông tin này: hợp nhất hai tập hợp tính năng trước khi nén chúng lại; và thêm các tính năng khung hình theo khung hình. Phương pháp thứ hai hoạt động tốt hơn, theo như các tác giả phát hiện, và tránh mất chất lượng trong khi giữ nguyên tải tính toán.
Dữ Liệu và Kiểm Tra
Trong các thử nghiệm, các chỉ số được sử dụng là: mô-đun nhất quán danh tính trong ArcFace, trích xuất các bản nhúng khuôn mặt từ cả hình ảnh tham chiếu và mỗi khung hình của video được tạo, và sau đó tính toán độ tương tự cosine trung bình giữa chúng; tương tự đối tượng, thông qua gửi các đoạn YOLO11x đến Dino 2 để so sánh; CLIP-B, căn chỉnh văn bản-video, đo lường sự tương tự giữa prompt và video được tạo; CLIP-B một lần nữa, để tính toán sự tương tự giữa mỗi khung hình và cả khung hình lân cận và khung hình đầu tiên, cũng như tính nhất quán thời gian; và độ động, được định nghĩa bởi VBench.
Como được chỉ định trước, các đối thủ cạnh tranh cơ bản là Hailuo; Vidu 2.0; Kling (1.6); và Pika. Các khuôn khổ FOSS cạnh tranh là VACE và SkyReels-A2.

Đánh giá hiệu suất mô hình so sánh HunyuanCustom với các phương pháp tùy chỉnh video hàng đầu trên các chỉ số nhất quán danh tính (Face-Sim), tương tự đối tượng (DINO-Sim), căn chỉnh văn bản-video (CLIP-B-T), nhất quán thời gian (Temp-Consis), và cường độ chuyển động (DD). Kết quả tối ưu và cận tối ưu được hiển thị bằng chữ đậm và gạch dưới, tương ứng.
Trong số những kết quả này, các tác giả tuyên bố:
‘HunyuanCustom của chúng tôi đạt được sự nhất quán danh tính và sự nhất quán đối tượng tốt nhất. Nó cũng đạt được kết quả tương đương trong việc tuân theo prompt và nhất quán thời gian. [Hailuo] có điểm CLIP tốt nhất vì nó có thể tuân theo hướng dẫn văn bản tốt với chỉ sự nhất quán danh tính, hy sinh sự nhất quán của các đối tượng không phải con người (DINO-Sim tồi tệ nhất). Về độ động, [Vidu] và [VACE] hoạt động kém, điều này có thể là do kích thước mô hình nhỏ.’
Mặc dù trang web dự án đang bão hòa với các video so sánh (bố cục của chúng dường như được thiết kế cho thẩm mỹ trang web hơn là so sánh dễ dàng), nó không hiện có một video tương đương với kết quả tĩnh được nén lại trong PDF, liên quan đến các thử nghiệm ban đầu:

Từ bài báo, một so sánh về tùy chỉnh video dựa trên đối tượng. Mặc dù người xem nên (như luôn) tham khảo PDF nguồn để có độ phân giải tốt hơn, các video tại trang web dự án có thể là một nguồn tài nguyên sáng tỏ hơn trong trường hợp này.
Các tác giả nhận xét ở đây:
‘[Vidu], [Skyreels A2] và phương pháp của chúng tôi đạt được kết quả tương đối tốt trong căn chỉnh prompt và sự nhất quán đối tượng, nhưng chất lượng video của chúng tôi tốt hơn [Vidu] và [Skyreels], nhờ vào hiệu suất tạo video tốt của mô hình cơ bản của chúng tôi, tức là [Hunyuanvideo-13B]. ‘
‘[Kling] có chất lượng video tốt, nhưng khung hình đầu tiên của video có vấn đề sao chép, và đôi khi đối tượng di chuyển quá nhanh và [mờ], dẫn đến trải nghiệm xem kém.’
Các tác giả tiếp tục nhận xét rằng Pika hoạt động kém trong việc duy trì tính nhất quán thời gian, giới thiệu các hiệu ứng phụ đề (hiệu ứng từ việc curation dữ liệu kém, nơi các yếu tố văn bản trong các đoạn video đã được phép làm ô nhiễm các khái niệm cốt lõi).
Hailuo duy trì danh tính khuôn mặt, họ tuyên bố, nhưng không thể duy trì sự nhất quán toàn thân. Trong số các phương pháp nguồn mở, VACE, các nhà nghiên cứu khẳng định, không thể duy trì sự nhất quán danh tính, trong khi họ khẳng định rằng HunyuanCustom tạo ra các video với sự bảo tồn danh tính mạnh mẽ, trong khi vẫn giữ được chất lượng và sự đa dạng.
Tiếp theo, các thử nghiệm được thực hiện cho tùy chỉnh video đa đối tượng, chống lại cùng những đối thủ cạnh tranh. Như trong ví dụ trước, các kết quả PDF phẳng không phải là bản in tương đương của các video có sẵn tại trang web dự án, nhưng chúng là duy nhất trong số các kết quả được trình bày:

So sánh sử dụng tùy chỉnh video đa đối tượng. Vui lòng xem PDF để có chi tiết và độ phân giải tốt hơn.
Bài báo tuyên bố:
‘[Pika] có thể tạo ra các đối tượng được chỉ định nhưng thể hiện sự không ổn định trong các khung hình video, với các trường hợp một người đàn ông biến mất trong một kịch bản và một người phụ nữ không thể mở cửa như được yêu cầu. [Vidu] và [VACE] chỉ nắm bắt được danh tính con người một phần, nhưng mất đi các chi tiết quan trọng của các đối tượng không phải con người, chỉ ra một hạn chế trong việc đại diện cho các đối tượng không phải con người. ‘
‘[SkyReels A2] gặp phải sự không ổn định khung hình nghiêm trọng, với những thay đổi đáng chú ý trong các chip và nhiều hiện象 trong kịch bản bên phải. ‘
‘Ngược lại, HunyuanCustom của chúng tôi hiệu quả nắm bắt được cả danh tính con người và không phải con người, tạo ra các video tuân theo các prompt được đưa ra, và duy trì chất lượng hình ảnh cao và sự ổn định.’
Một thử nghiệm khác là ‘quảng cáo ảo’, nơi các khuôn khổ được yêu cầu tích hợp một sản phẩm với một người:

Từ vòng thử nghiệm chất lượng, các ví dụ về ‘đặt sản phẩm’ thần kinh. Vui lòng xem PDF để có chi tiết và độ phân giải tốt hơn.
Đối với vòng này, các tác giả tuyên bố:
‘Kết quả cho thấy HunyuanCustom hiệu quả duy trì danh tính của con người trong khi vẫn giữ được chi tiết của sản phẩm mục tiêu, bao gồm cả văn bản trên đó. ‘
‘Hơn nữa, sự tương tác giữa con người và sản phẩm dường như tự nhiên, và video tuân theo prompt được đưa ra, làm nổi bật tiềm năng đáng kể của HunyuanCustom trong việc tạo ra các video quảng cáo.’
Một khu vực mà kết quả video sẽ rất hữu ích là vòng thử nghiệm chất lượng cho tùy chỉnh đối tượng âm thanh, nơi nhân vật nói âm thanh tương ứng với một cảnh và tư thế được mô tả bằng văn bản.

Kết quả một phần cho vòng thử nghiệm âm thanh – mặc dù kết quả video có thể được ưu tiên trong trường hợp này. Chỉ nửa trên của hình PDF được sao chép lại ở đây, vì nó lớn và khó phù hợp với bài viết này. Vui lòng tham khảo PDF nguồn để có chi tiết và độ phân giải tốt hơn.
Các tác giả khẳng định:
‘Các phương pháp hoạt hình con người âm thanh trước đây nhập một hình ảnh con người và một âm thanh, nơi tư thế, trang phục và môi trường của con người vẫn nhất quán với hình ảnh được đưa ra và không thể tạo ra video trong các cử chỉ và môi trường khác, điều này có thể [hạn chế] ứng dụng của chúng. ‘
‘…[HunyuanCustom của chúng tôi] cho phép tùy chỉnh con người âm thanh, nơi nhân vật nói âm thanh tương ứng trong một cảnh và tư thế được mô tả bằng văn bản, cho phép nhiều khả năng hoạt hình con người âm thanh hơn.’
Các thử nghiệm thêm (vui lòng xem PDF để có tất cả các chi tiết) bao gồm một vòng so sánh HunyuanCustom với VACE và Kling 1.6 cho việc thay thế đối tượng trong video-to-video:

Thử nghiệm thay thế đối tượng trong chế độ video-to-video. Vui lòng tham khảo PDF nguồn để có chi tiết và độ phân giải tốt hơn.
Đối với những thử nghiệm cuối cùng được trình bày trong bài báo mới, các nhà nghiên cứu nhận xét:
‘VACE gặp phải các hiện象 biên giới do tuân thủ nghiêm ngặt các mặt nạ đầu vào, dẫn đến hình dạng đối tượng không tự nhiên và gián đoạn chuyển động. [Kling], ngược lại, thể hiện một hiệu ứng sao chép, nơi các đối tượng được phủ trực tiếp lên video, dẫn đến tích hợp kém với nền. ‘
‘Ngược lại, HunyuanCustom của chúng tôi hiệu quả tránh các hiện象 biên giới, đạt được sự tích hợp hoàn hảo với nền video, và duy trì sự bảo tồn danh tính mạnh mẽ – chứng minh hiệu suất vượt trội của nó trong các nhiệm vụ chỉnh sửa video.’
Kết Luận
Đây là một bản phát hành thú vị, không chỉ vì nó giải quyết một điều mà cộng đồng yêu thích đã phàn nàn nhiều hơn gần đây – sự thiếu đồng bộ hóa môi, để tính thực tế tăng lên có thể được cấp cho các hệ thống như Hunyuan Video và Wan 2.1.
Mặc dù bố cục của hầu như tất cả các ví dụ video so sánh tại trang web dự án khiến nó khá khó để so sánh khả năng của HunyuanCustom với các đối thủ trước đó, nhưng nó phải được ghi nhận rằng rất ít dự án trong không gian tổng hợp video có can đảm để so sánh mình với Kling, API khuếch tán video thương mại luôn ở hoặc gần đầu của bảng xếp hạng; Tencent dường như đã đạt được tiến bộ chống lại đối thủ này theo một cách khá ấn tượng.
* Vấn đề là một số video quá rộng, ngắn và có độ phân giải cao đến mức chúng sẽ không phát trong các trình phát video tiêu chuẩn như VLC hoặc Windows Media Player, hiển thị màn hình đen.
Được xuất bản lần đầu vào thứ Năm, ngày 8 tháng 5 năm 2025












