Góc nhìn Anderson
Sự trỗi dậy của Hunyuan Video Deepfakes

Do tính chất của một số nội dung được thảo luận ở đây, bài viết này sẽ chứa ít liên kết tham khảo và hình ảnh minh họa hơn bình thường.
Đáng chú ý là hiện tại đang xảy ra một điều gì đó trong cộng đồng tổng hợp AI, mặc dù tầm quan trọng của nó có thể mất một thời gian để trở nên rõ ràng. Những người đam mê đang đào tạo mô hình video AI tạo sinh để tái tạo hình ảnh của con người, sử dụng video dựa trên LoRAs trên khuôn khổ Hunyuan Video mã nguồn mở mới được phát hành của Tencent.*
Click để phát.Kết quả đa dạng từ các tùy chỉnh Hunyuan dựa trên LoRA có sẵn miễn phí tại cộng đồng Civit. Bằng cách đào tạo các mô hình thích nghi thấp (LoRAs), các vấn đề về sự ổn định thời gian, đã ảnh hưởng đến việc tạo video AI trong hai năm, đã được giảm đáng kể. Nguồn: civit.ai
Trong video trên, hình ảnh của các nữ diễn viên Natalie Portman, Christina Hendricks và Scarlett Johansson, cùng với nhà lãnh đạo công nghệ Elon Musk, đã được đào tạo thành các tệp bổ sung tương đối nhỏ cho hệ thống video tạo sinh Hunyuan, có thể được cài đặt không có bộ lọc nội dung (như bộ lọc NSFW) trên máy tính của người dùng.
Tác giả của LoRA Christina Hendricks trên cho biết chỉ cần 16 hình ảnh từ chương trình truyền hình Mad Men để phát triển mô hình (đó là một tệp tải xuống chỉ 307mb); nhiều bài đăng từ cộng đồng Stable Diffusion trên Reddit và Discord xác nhận rằng các LoRAs như vậy không yêu cầu số lượng lớn dữ liệu đào tạo, hoặc thời gian đào tạo, trong hầu hết các trường hợp.
Click để phát.Arnold Schwarzenegger được đưa đến cuộc sống trong một LoRA video Hunyuan có thể được tải xuống tại Civit. Xem https://www.youtube.com/watch?v=1D7B9g9rY68 để biết thêm các ví dụ về Arnie, từ người đam mê AI Bob Doyle.
LoRAs Hunyuan có thể được đào tạo trên cả hình ảnh tĩnh và video, mặc dù đào tạo trên video yêu cầu nhiều tài nguyên phần cứng hơn và thời gian đào tạo tăng.
Mô hình video Hunyuan có 13 tỷ tham số, vượt qua 12 tỷ tham số của Sora, và vượt xa mô hình Hunyuan-DiT ít khả năng hơn được phát hành mã nguồn mở vào mùa hè năm 2024, có chỉ 1,5 tỷ tham số.
Giống như trường hợp hai năm rưỡi trước với Stable Diffusion và LoRA (xem ví dụ về các nhân vật nổi tiếng ‘nguyên bản’ của Stable Diffusion 1.5 tại đây), mô hình cơ sở đang được đề cập có một sự hiểu biết hạn chế hơn về các nhân cách của người nổi tiếng, so với mức độ trung thực có thể đạt được thông qua các triển khai LoRA ‘tiêm ID’.
Cơ bản, một LoRA tùy chỉnh, tập trung vào nhân cách, nhận được một ‘chuyến đi miễn phí’ trên khả năng tổng hợp đáng kể của mô hình Hunyuan cơ bản, cung cấp một sự tổng hợp con người đáng chú ý hơn so với những gì có thể đạt được bằng cách sử dụng các mô hình tự động mã hóa deepfakes năm 2017 hoặc bằng cách thêm chuyển động vào hình ảnh tĩnh thông qua các hệ thống như LivePortrait.
Tất cả các LoRAs được mô tả ở đây có thể được tải xuống miễn phí từ cộng đồng Civit rất phổ biến, trong khi số lượng lớn hơn các LoRAs tùy chỉnh ‘hình ảnh tĩnh’ cũ hơn cũng có thể tạo ra ‘hạt giống’ cho quá trình tạo video (tức là hình ảnh-sang-video, một phiên bản đang chờ phát hành cho Hunyuan Video, mặc dù các giải pháp thay thế là có thể, trong thời gian này).
Click để phát.Trên, các mẫu từ một LoRA ‘tĩnh’ Flux; dưới, các ví dụ từ một LoRA video Hunyuan có tính năng nhạc sĩ Taylor Swift. Cả hai LoRA này đều có sẵn miễn phí tại cộng đồng Civit.
Khi tôi viết, trang web Civit cung cấp 128 kết quả tìm kiếm cho ‘Hunyuan’*. Gần như tất cả đều liên quan đến các mô hình NSFW; 22 mô tả các nhân vật nổi tiếng; 18 được thiết kế để tạo ra các video khiêu dâm; và chỉ có 7 mô tả nam giới chứ không phải nữ giới.
Điều gì mới?
Do tính chất phát triển của thuật ngữ deepfake, và sự hiểu biết hạn chế của công chúng về các giới hạn của các khuôn khổ tổng hợp video AI đến nay, tầm quan trọng của LoRA Hunyuan không dễ hiểu đối với một người theo dõi cộng đồng AI tạo sinh một cách sơ bộ. Hãy xem lại một số điểm khác biệt chính giữa LoRAs Hunyuan và các phương pháp trước đây để tạo video AI dựa trên danh tính.
1: Cài đặt cục bộ không bị cản trở
Khía cạnh quan trọng nhất của Hunyuan Video là nó có thể được tải xuống cục bộ và đưa một hệ thống tạo video AI mạnh mẽ và không bị kiểm duyệt vào tay người dùng bình thường, cũng như cộng đồng VFX (trong phạm vi cho phép theo giấy phép trên các khu vực địa lý).
Lần cuối cùng điều này xảy ra là khi Stability.ai phát hành Stable Diffusion vào mùa hè năm 2022. Tại thời điểm đó, DALL-E2 của OpenAI đã chiếm được trí tưởng tượng của công chúng, mặc dù DALLE-2 là một dịch vụ trả phí với các hạn chế đáng kể (đã tăng lên theo thời gian).
Khi Stable Diffusion trở nên có sẵn, và Low-Rank Adaptation sau đó cho phép tạo ra hình ảnh của danh tính của bất kỳ người (người nổi tiếng hoặc không), sự quan tâm lớn của nhà phát triển và người dùng đã giúp Stable Diffusion vượt qua sự phổ biến của DALLE-2; mặc dù sau này là một hệ thống mạnh mẽ hơn khi xuất xưởng, nhưng các quy trình kiểm duyệt của nó được coi là gò bó đối với nhiều người dùng, và việc tùy chỉnh không thể thực hiện được.
Đáng lẽ, kịch bản tương tự hiện áp dụng giữa Sora và Hunyuan – hoặc, chính xác hơn, giữa các hệ thống tạo video tổng hợp Sora-grade độc quyền và các đối thủ mã nguồn mở, trong đó Hunyuan là người đầu tiên – nhưng có lẽ không phải là người cuối cùng (ở đây, hãy xem xét rằng Flux sẽ cuối cùng đạt được tiến bộ đáng kể so với Stable Diffusion).
Người dùng muốn tạo ra đầu ra LoRA Hunyuan nhưng thiếu thiết bị hiệu suất cao có thể, như mọi khi, chuyển quá trình đào tạo GPU sang các dịch vụ tính toán trực tuyến như RunPod. Điều này không giống như tạo video AI trên các nền tảng như Kaiber hoặc Kling, vì không có bộ lọc ngữ nghĩa hoặc hình ảnh (kiểm duyệt) nào được thực hiện khi thuê một GPU trực tuyến để hỗ trợ một quy trình công việc cục bộ.
2: Không cần video ‘chủ’ và nỗ lực cao
Khi deepfakes xuất hiện vào cuối năm 2017, mã được đăng tải匿名 sẽ phát triển thành các nhánh chính DeepFaceLab và FaceSwap (cũng như hệ thống DeepFaceLive tạo deepfakes thời gian thực).
Phương pháp này yêu cầu việc chăm sóc cẩn thận hàng nghìn hình ảnh khuôn mặt của mỗi danh tính để được trao đổi; nỗ lực ít hơn được đưa vào giai đoạn này, mô hình sẽ kém hiệu quả hơn. Ngoài ra, thời gian đào tạo thay đổi từ 2-14 ngày, tùy thuộc vào phần cứng có sẵn, gây áp lực thậm chí lên các hệ thống mạnh mẽ trong thời gian dài.
Gần đây, ROOP, LivePortrait và nhiều khuôn khổ tương tự đã cung cấp chức năng tương tự với ít nỗ lực hơn và thường với kết quả vượt trội – nhưng không có khả năng tạo ra deepfakes toàn thân chính xác – hoặc bất kỳ yếu tố nào khác ngoài khuôn mặt.

Ví dụ về ROOP Unleashed và LivePortrait (chèn góc dưới bên trái), từ luồng nội dung của Bob Doyle trên YouTube. Nguồn: https://www.youtube.com/watch?v=i39xeYPBAAM và https://www.youtube.com/watch?v=QGatEItg2Ns
Ngược lại, LoRAs Hunyuan (và các hệ thống tương tự sẽ theo sau) cho phép tạo ra toàn bộ thế giới, bao gồm cả mô phỏng toàn thân của danh tính LoRA được đào tạo.
3: Tính nhất quán thời gian được cải thiện đáng kể
Tính nhất quán thời gian đã là Đấng cứu thế của video khuếch tán trong vài năm qua. Việc sử dụng LoRA, cùng với các lời nhắc phù hợp, cung cấp cho việc tạo video Hunyuan một tham chiếu danh tính không đổi để tuân theo. Về lý thuyết (đây là những ngày đầu), có thể đào tạo nhiều LoRAs của một danh tính nhất định, mỗi LoRA mặc trang phục cụ thể.
Dưới những điều kiện đó, trang phục cũng ít có khả năng ‘biến đổi’ trong suốt quá trình tạo video (vì hệ thống tạo sinh dựa trên một cửa sổ hạn chế của các khung hình trước).
(Hoặc, như trong các hệ thống LoRA dựa trên hình ảnh, có thể áp dụng nhiều LoRAs, chẳng hạn như danh tính + trang phục LoRAs, cho một lần tạo video)
4: Truy cập vào ‘Thí nghiệm con người’
Khi tôi gần đây quan sát, lĩnh vực AI tạo sinh độc quyền và FAANG hiện có vẻ như rất lo lắng về khả năng tổng hợp video con người của các dự án của họ, đến mức mà các người thực sự hiếm khi xuất hiện trong các trang dự án cho các thông báo và phát hành lớn. Thay vào đó, các văn bản quảng cáo liên quan ngày càng có xu hướng hiển thị các đối tượng ‘dễ thương’ và ‘không đe dọa’ trong các kết quả tổng hợp.
Với sự ra đời của LoRAs Hunyuan, lần đầu tiên, cộng đồng có cơ hội để đẩy ranh giới của tổng hợp video con người dựa trên LDM trong một hệ thống mạnh mẽ (thay vì hệ thống biên) và để khám phá đầy đủ chủ đề mà hầu hết chúng ta quan tâm nhất – con người.
Ý nghĩa
Vì tìm kiếm ‘Hunyuan’ tại cộng đồng Civit chủ yếu hiển thị các LoRAs của người nổi tiếng và ‘hardcore’, ý nghĩa trung tâm của sự ra đời của LoRAs Hunyuan là chúng sẽ được sử dụng để tạo ra video khiêu dâm AI (hoặc bôi nhọ) của những người thực, cả người nổi tiếng và không nổi tiếng.
Để tuân thủ, những người đam mê tạo ra LoRAs Hunyuan và thử nghiệm chúng trên các máy chủ Discord khác nhau cẩn thận để ngăn chặn các ví dụ về những người thực được đăng. Thực tế là ngay cả hình ảnh deepfakes hiện đã được vũ khí hóa nghiêm trọng; và việc thêm video thực tế vào hỗn hợp này có thể cuối cùng xác nhận những nỗi sợ hãi đã tăng cao trong các phương tiện truyền thông trong bảy năm qua, và đã thúc đẩy các quy định mới.
Động lực chính
Như mọi khi, khiêu dâm vẫn là động lực chính cho công nghệ. Bất kể quan điểm của chúng ta về việc sử dụng như vậy, động cơ thúc đẩy không ngừng này thúc đẩy các tiến bộ trong tình trạng hiện tại có thể cuối cùng có lợi cho việc áp dụng chính thống hơn.
Trong trường hợp này, có thể giá sẽ cao hơn bình thường, vì việc mã nguồn mở của việc tạo video siêu thực có ý nghĩa rõ ràng cho việc lạm dụng tội phạm, chính trị và đạo đức.
Một nhóm Reddit (mà tôi sẽ không nêu tên ở đây) dành cho việc tạo video NSFW bằng AI có một máy chủ Discord mở liên kết, nơi người dùng đang tinh chỉnh luồng công việc ComfyUI cho việc tạo video khiêu dâm dựa trên Hunyuan. Hàng ngày, người dùng đăng các đoạn video NSFW – nhiều đoạn trong số đó có thể được gọi là ‘cực đoan’, hoặc ít nhất là căng thẳng các hạn chế được nêu trong quy tắc diễn đàn.
Cộng đồng này cũng duy trì một kho lưu trữ GitHub đáng kể và được phát triển tốt, bao gồm các công cụ có thể tải xuống và xử lý video khiêu dâm, để cung cấp dữ liệu đào tạo cho các mô hình mới.
Because Kohya-ss, trình đào tạo LoRA phổ biến nhất, hiện hỗ trợ đào tạo LoRA Hunyuan, các rào cản để tham gia đào tạo video tạo sinh không giới hạn đang giảm hàng ngày, cùng với yêu cầu phần cứng cho đào tạo và tạo video Hunyuan.
Khía cạnh quan trọng của các kế hoạch đào tạo chuyên dụng cho AI khiêu dâm (thay vì các mô hình ‘danh tính’ như người nổi tiếng) là một mô hình cơ sở như Hunyuan không được đào tạo cụ thể trên đầu ra NSFW, và do đó có thể hoạt động kém khi được yêu cầu tạo ra nội dung NSFW, hoặc không thể phân tách các khái niệm và mối quan hệ đã học được một cách thuyết phục.
Bằng cách phát triển các mô hình cơ sở và LoRAs NSFW tinh chỉnh, sẽ ngày càng có thể chiếu các danh tính được đào tạo vào một lĩnh vực video ‘khiêu dâm’ chuyên dụng; sau tất cả, đây chỉ là phiên bản video của điều gì đó đã xảy ra với hình ảnh tĩnh trong hai năm rưỡi qua.
VFX
Sự gia tăng lớn về tính nhất quán thời gian mà LoRAs video Hunyuan cung cấp là một lợi thế rõ ràng cho ngành công nghiệp hiệu ứng hình ảnh AI, ngành này phụ thuộc rất nhiều vào việc thích nghi với phần mềm mã nguồn mở.
Mặc dù một phương pháp LoRA video Hunyuan tạo ra toàn bộ khung hình và môi trường, các công ty VFX đã gần như chắc chắn bắt đầu thử nghiệm cách cô lập các khuôn mặt con người nhất quán thời gian có thể được thu được bằng phương pháp này, để siêu định hoặc tích hợp khuôn mặt vào nguồn video thực.
Giống như cộng đồng đam mê, các công ty VFX phải chờ đợi chức năng hình ảnh-sang-video và video-sang-video của Hunyuan Video, có thể là cầu nối hữu ích nhất giữa nội dung ‘deepfake’ dựa trên LoRA và ID; hoặc phải tự phát minh, và sử dụng khoảng thời gian này để kiểm tra các khả năng bên ngoài của khuôn khổ và các bản điều chỉnh, thậm chí là các phiên bản độc quyền trong nhà của Hunyuan Video.
Mặc dù các điều khoản giấy phép của Hunyuan Video về mặt kỹ thuật cho phép mô tả các cá nhân thực, miễn là có sự cho phép, chúng cấm sử dụng trong EU, Vương quốc Anh và Hàn Quốc. Trên nguyên tắc ‘ở lại Vegas’, điều này không nhất thiết có nghĩa là Hunyuan Video sẽ không được sử dụng trong những khu vực này; tuy nhiên, việc sử dụng trái phép như vậy có thể rủi ro do các cuộc kiểm toán dữ liệu bên ngoài để thực thi quy định ngày càng tăng xung quanh AI tạo sinh.
Một khu vực khác có thể mơ hồ trong các điều khoản giấy phép cho biết:
‘Nếu, vào ngày phát hành phiên bản Hunyuan của Tencent, số lượng người dùng hoạt động hàng tháng của tất cả sản phẩm hoặc dịch vụ được cung cấp bởi hoặc cho Người được cấp phép là hơn 100 triệu người dùng hoạt động hàng tháng trong tháng lịch trước, Bạn phải yêu cầu giấy phép từ Tencent, mà Tencent có thể cấp cho Bạn theo quyết định riêng của mình, và Bạn không được phép thực hiện bất kỳ quyền nào theo Thỏa thuận này trừ khi và cho đến khi Tencent cấp cho Bạn những quyền đó một cách rõ ràng.’
Điều này rõ ràng nhắm vào hàng loạt công ty có khả năng ‘trung gian’ Hunyuan Video cho một cơ thể người dùng tương đối không am hiểu về công nghệ, và những công ty này sẽ phải cắt Tencent vào hành động, trên một mức trần nhất định của người dùng.
Không rõ liệu cách diễn đạt rộng có thể bao gồm cả gián tiếp sử dụng (tức là thông qua việc cung cấp đầu ra hiệu ứng hình ảnh Hunyuan trong các bộ phim và chương trình truyền hình phổ biến) hay không, có thể cần làm rõ.
Kết luận
Vì video deepfake đã tồn tại trong một thời gian dài, sẽ dễ dàng đánh giá thấp tầm quan trọng của LoRA Hunyuan Video như một phương pháp tổng hợp danh tính và deepfaking; và giả định rằng những nỗ lực hiện đang thể hiện tại cộng đồng Civit và các Discord và subreddit liên quan đại diện cho một bước tiến nhỏ trong tổng hợp video con người có thể kiểm soát.
Có khả năng cao hơn là những nỗ lực hiện tại chỉ đại diện cho một phần nhỏ của tiềm năng của Hunyuan Video trong việc tạo ra các deepfakes toàn thân và toàn môi trường hoàn toàn thuyết phục; một khi thành phần hình ảnh-sang-video được phát hành (được cho là sẽ xảy ra trong tháng này), một mức độ tạo sinh chi tiết hơn sẽ có sẵn cho cả cộng đồng đam mê và chuyên nghiệp.
Khi Stability.ai phát hành Stable Diffusion vào năm 2022, nhiều người quan sát không thể xác định lý do tại sao công ty lại đưa ra một hệ thống tạo sinh mạnh mẽ và có giá trị như vậy. Với Hunyuan Video, động lực lợi nhuận được tích hợp trực tiếp vào giấy phép – mặc dù có thể khó cho Tencent để xác định khi nào một công ty kích hoạt kế hoạch chia sẻ lợi nhuận.
Dù thế nào đi nữa, kết quả vẫn giống như năm 2022: các cộng đồng phát triển chuyên dụng đã được hình thành ngay lập tức và với sự hào hứng mãnh liệt xung quanh phát hành. Một số con đường mà những nỗ lực này sẽ đi trong 12 tháng tới chắc chắn sẽ gây ra những tiêu đề mới.
* Tối đa 136 vào thời điểm xuất bản.
Được xuất bản lần đầu vào thứ ba, ngày 7 tháng 1 năm 2025












