Sudut Anderson
Munculnya Hunyuan Video Deepfakes

Karena sifat beberapa materi yang dibahas di sini, artikel ini akan berisi lebih sedikit tautan referensi dan ilustrasi daripada biasanya.
Sesuatu yang patut diperhatikan saat ini terjadi di komunitas sintesis AI, meskipun signifikansinya mungkin membutuhkan waktu untuk menjadi jelas. Penghobi sedang melatih model video generatif AI untuk mereproduksi kesamaan orang, menggunakan video-based LoRAs pada kerangka Hunyuan Video yang baru saja dirilis oleh Tencent sebagai sumber terbuka.*
Klik untuk memutar. Hasil yang beragam dari kustomisasi Hunyuan-based LoRA yang tersedia secara gratis di komunitas Civit. Dengan melatih model adaptasi berperingkat rendah (LoRAs), masalah kestabilan temporal, yang telah mempengaruhi generasi video AI selama dua tahun, secara signifikan berkurang. Sumber: civit.ai
Di video yang ditampilkan di atas, kesamaan aktris Natalie Portman, Christina Hendricks, dan Scarlett Johansson, bersama dengan pemimpin teknologi Elon Musk, telah dilatih ke dalam file tambahan yang relatif kecil untuk sistem video generatif Hunyuan, yang dapat diinstal tanpa filter konten (seperti filter NSFW) di komputer pengguna.
Pembuat LoRA Christina Hendricks yang ditampilkan di atas menyatakan bahwa hanya 16 gambar dari acara TV Mad Men yang diperlukan untuk mengembangkan model (yang merupakan unduhan sebesar 307mb); beberapa posting dari komunitas Stable Diffusion di Reddit dan Discord mengkonfirmasi bahwa LoRAs seperti itu tidak memerlukan banyak data pelatihan, atau waktu pelatihan yang lama, dalam sebagian besar kasus.
Klik untuk memutar. Arnold Schwarzenegger dibawa ke kehidupan dalam LoRA video Hunyuan yang dapat diunduh di Civit. Lihat https://www.youtube.com/watch?v=1D7B9g9rY68 untuk contoh Arnie lebih lanjut, dari penggemar AI Bob Doyle.
LoRAs Hunyuan dapat dilatih pada gambar statis atau video, meskipun pelatihan pada video memerlukan sumber daya perangkat keras yang lebih besar dan waktu pelatihan yang lebih lama.
Model video Hunyuan memiliki 13 miliar parameter, melebihi 12 miliar parameter Sora, dan jauh melebihi model Hunyuan-DiT yang kurang mampu, yang dirilis sebagai sumber terbuka pada musim panas 2024, yang hanya memiliki 1,5 miliar parameter.
Seperti yang terjadi dua setengah tahun yang lalu dengan Stable Diffusion dan LoRA (lihat contoh selebriti ‘asli’ Stable Diffusion 1.5 di sini), model dasar yang bersangkutan memiliki pemahaman yang jauh lebih terbatas tentang kepribadian selebriti, dibandingkan dengan tingkat kesetiaan yang dapat diperoleh melalui implementasi LoRA ‘ID-injected’.
Secara efektif, LoRA yang dikustomisasi, yang berfokus pada kepribadian, mendapatkan ‘tumpangan gratis’ pada kemampuan sintesis yang signifikan dari model dasar Hunyuan, menawarkan sintesis manusia yang jauh lebih efektif daripada yang dapat diperoleh baik oleh autoencoder deepfakes era 2017 atau dengan menambahkan gerakan ke gambar statis melalui sistem seperti LivePortrait yang terkenal.
Semua LoRAs yang digambarkan di sini dapat diunduh secara gratis dari komunitas Civit yang sangat populer, sementara jumlah LoRAs ‘gambar statis’ yang lebih banyak dapat juga berpotensi menciptakan ‘benih’ gambar untuk proses pembuatan video (yaitu, gambar-ke-video, yang akan dirilis untuk Hunyuan Video, meskipun solusi alternatif ada, untuk saat ini).
Klik untuk memutar. Di atas, sampel dari LoRA ‘statis’ Flux; di bawah, contoh dari LoRA video Hunyuan yang menampilkan musisi Taylor Swift. Kedua LoRA ini tersedia secara gratis di komunitas Civit.
Saat saya menulis, situs web Civit menawarkan 128 hasil pencarian untuk ‘Hunyuan’*. Hampir semua hasil tersebut berkaitan dengan model NSFW; 22 menggambarkan selebriti; 18 dirancang untuk memfasilitasi pembuatan pornografi hardcore; dan hanya tujuh di antaranya menggambarkan pria daripada wanita.
Apa yang Baru?
Karena sifat evolusi dari istilah deepfake, dan pemahaman publik yang terbatas tentang (keterbatasan yang cukup parah) dari kerangka sintesis video manusia AI hingga saat ini, signifikansi LoRA Hunyuan tidak mudah dipahami oleh seseorang yang mengikuti adegan AI generatif secara santai. Mari kita tinjau beberapa perbedaan kunci antara LoRAs Hunyuan dan pendekatan sebelumnya untuk generasi video AI berbasis identitas.
1: Instalasi Lokal Tanpa Batasan
Aspek paling penting dari Hunyuan Video adalah bahwa dapat diunduh secara lokal, dan memberikan sistem generasi video AI yang sangat kuat dan tanpa sensor di tangan pengguna biasa, serta komunitas VFX (sejauh yang diizinkan oleh lisensi di seluruh wilayah geografis).
Terakhir kali ini terjadi adalah saat rilis sumber terbuka dari model Stable Diffusion oleh Stability.ai pada musim panas 2022. Pada saat itu, DALL-E2 OpenAI telah menangkap imajinasi publik, meskipun DALLE-2 adalah layanan berbayar dengan batasan yang cukup mencolok (yang tumbuh seiring waktu).
Saat Stable Diffusion menjadi tersedia, dan Adaptasi Berperingkat Rendah kemudian memungkinkan generasi gambar identitas siapa pun (selebriti atau tidak), fokus besar pengembang dan konsumen membantu Stable Diffusion untuk mengungguli popularitas DALLE-2; meskipun yang terakhir adalah sistem yang lebih mampu, rutinitas sensorannya dianggap sebagai oneros oleh banyak penggunanya, dan kustomisasi tidak mungkin.
Secara dapat disimpulkan, skenario yang sama sekarang berlaku antara Sora dan Hunyuan – atau, lebih akurat, antara Sora-grade sistem generatif video proprietari, dan saingan sumber terbuka, di mana Hunyuan adalah yang pertama – tetapi mungkin tidak yang terakhir (di sini, pertimbangkan bahwa Flux akhirnya akan mendapatkan ground yang signifikan pada Stable Diffusion).
Pengguna yang ingin membuat output LoRA Hunyuan, tetapi kekurangan peralatan yang efektif, dapat, seperti biasa, memindahkan aspek GPU dari pelatihan ke layanan komputasi online seperti RunPod. Ini tidak sama dengan membuat video AI di platform seperti Kaiber atau Kling, karena tidak ada penyaringan semantik atau berbasis gambar (sensor) yang terlibat dalam menyewa GPU online untuk mendukung alur kerja lokal.
2: Tidak Perlu ‘Video Host’ dan Usaha Tinggi
Ketika deepfakes muncul di adegan pada akhir 2017, kode yang diposting secara anonim akan berkembang menjadi cabang utama DeepFaceLab dan FaceSwap (serta DeepFaceLive sistem deepfaking waktu nyata).
Metode ini memerlukan kurasi yang melelahkan dari ribuan gambar wajah untuk setiap identitas yang akan ditukar; usaha yang lebih sedikit pada tahap ini, model yang kurang efektif. Selain itu, waktu pelatihan bervariasi antara 2-14 hari, tergantung pada perangkat keras yang tersedia, menekankan bahkan sistem yang mampu dalam jangka panjang.
Ketika model sudah siap, hanya dapat memasukkan wajah ke dalam video yang ada, dan biasanya memerlukan ‘target’ (yaitu, identitas nyata) yang dekat dengan penampilan identitas yang ditumpangkan.
Baru-baru ini, ROOP, LivePortrait, dan kerangka kerja serupa telah menyediakan fungsionalitas serupa dengan usaha yang jauh lebih sedikit, dan sering dengan hasil yang superior – tetapi tanpa kemampuan untuk menghasilkan deepfakes tubuh penuh yang akurat – atau elemen lain selain wajah.

Contoh ROOP Unleashed dan LivePortrait (inset kiri bawah), dari aliran konten Bob Doyle di YouTube. Sumber: https://www.youtube.com/watch?v=i39xeYPBAAM dan https://www.youtube.com/watch?v=QGatEItg2Ns
Dengan LoRAs Hunyuan (dan sistem serupa yang akan mengikuti), memungkinkan penciptaan dunia yang tidak terbatas, termasuk simulasi tubuh penuh dari identitas LoRA yang dilatih pengguna.
3: Konsistensi Temporal yang Jauh Lebih Baik
Konsistensi temporal telah menjadi Tujuan Suci dari video difusi selama beberapa tahun sekarang. Penggunaan LoRA, bersama dengan prompt yang sesuai, memberikan generasi video Hunyuan referensi identitas yang konstan untuk dipertahankan. Secara teori (ini masih awal), seseorang bisa melatih beberapa LoRAs dari identitas tertentu, masing-masing mengenakan pakaian tertentu.
Di bawah kondisi tersebut, pakaian juga kurang mungkin ‘bermutasi’ sepanjang generasi video (karena sistem generatif membangun frame berikutnya berdasarkan jendela frame sebelumnya yang sangat terbatas).
(Atau, seperti pada sistem LoRA berbasis gambar, seseorang bisa menerapkan beberapa LoRAs, seperti identitas + LoRAs pakaian, ke generasi video tunggal)
4: Akses ke ‘Eksperimen Manusia’
Seperti yang saya amati baru-baru ini, sektor AI generatif proprietari dan FAANG-level sekarang tampaknya sangat waspada terhadap kemampuan sintesis manusia dari proyek-proyek mereka, sehingga orang-orang yang sebenarnya jarang muncul di halaman proyek untuk pengumuman dan rilis besar. Sebaliknya, literatur publikasi yang terkait cenderung menampilkan subjek ‘imut’ dan ‘tidak mengancam’ dalam hasil sintesis.
Dengan munculnya LoRAs Hunyuan, untuk pertama kalinya, komunitas memiliki kesempatan untuk mendorong batas-batas sintesis video manusia berbasis LDM dalam sistem yang sangat mampu (bukan marginal), dan untuk sepenuhnya menjelajahi subjek yang paling menarik bagi sebagian besar dari kita – orang.
Implikasi
Karena pencarian ‘Hunyuan’ di komunitas Civit sebagian besar menunjukkan LoRAs selebriti dan ‘hardcore’, implikasi utama dari munculnya LoRAs Hunyuan adalah bahwa mereka akan digunakan untuk membuat video AI pornografi (atau fitnah) dari orang-orang nyata – selebriti dan orang-orang biasa.
Untuk tujuan kepatuhan, penghobi yang membuat LoRAs Hunyuan dan bereksperimen dengan mereka di server Discord yang beragam, berhati-hati untuk melarang contoh orang-orang nyata dari diposting. Kenyataannya adalah bahwa bahkan gambar deepfakes sekarang sangat berbahaya; dan prospek menambahkan video yang sangat realistis ke dalam campuran ini mungkin akhirnya membenarkan ketakutan yang telah berulang dalam media selama tujuh tahun terakhir, dan yang telah memicu regulasi baru baru.
Kekuatan Penggerak
Seperti biasa, porn tetap kekuatan penggerak untuk teknologi. Apa pun pendapat kita tentang penggunaan seperti itu, mesin penggerak yang tak henti-hentinya ini mendorong kemajuan dalam kemampuan mutakhir yang akhirnya dapat menguntungkan adopsi yang lebih mainstream.
Di kasus ini, mungkin harganya akan lebih tinggi dari biasanya, karena open-sourcing pembuatan video yang hiper-realistik memiliki implikasi yang jelas untuk penyalahgunaan kriminal, politik, dan etika.
Salah satu grup Reddit (yang tidak akan saya sebutkan di sini) yang didedikasikan untuk generasi video AI NSFW memiliki server Discord terbuka yang terkait, di mana pengguna mengembangkan alur kerja ComfyUI untuk pembuatan video pornografi berbasis Hunyuan. Setiap hari, pengguna memposting contoh klip NSFW – banyak di antaranya dapat dianggap ‘ekstrem’, atau setidaknya menegangkan batasan yang dinyatakan dalam aturan forum.
Komunitas ini juga mempertahankan repositori GitHub yang substansial dan berkembang yang menampilkan alat yang dapat mengunduh dan memproses video pornografi, untuk menyediakan data pelatihan untuk model baru.
Karena pelatih LoRA paling populer, Kohya-ss, sekarang mendukung pelatihan LoRA Hunyuan, hambatan untuk memasuki pelatihan video generatif yang tidak terbatas menurun setiap hari, bersama dengan persyaratan perangkat keras untuk pelatihan dan generasi video Hunyuan.
Aspek kritis dari skema pelatihan yang didedikasikan untuk AI pornografi (daripada model identitas seperti selebriti) adalah bahwa model dasar seperti Hunyuan tidak secara khusus dilatih pada output NSFW, dan mungkin tidak berkinerja baik ketika diminta untuk menghasilkan konten NSFW, atau gagal memisahkan konsep dan asosiasi yang dipelajari dalam cara yang persuasif.
Dengan mengembangkan model dasar NSFW yang disesuaikan dan LoRAs, akan semakin mungkin untuk memproyeksikan identitas yang dilatih ke dalam domain video ‘porn’ yang didedikasikan; setelah semua, ini hanya versi video dari sesuatu yang sudah terjadi untuk gambar statis selama dua setengah tahun terakhir.
VFX
Peningkatan konsistensi temporal yang sangat besar yang ditawarkan oleh LoRAs video Hunyuan adalah berkah yang jelas bagi industri efek visual AI, yang sangat bergantung pada penyesuaian perangkat lunak sumber terbuka.
Meskipun LoRA video Hunyuan menghasilkan seluruh frame dan lingkungan, perusahaan VFX telah pasti mulai bereksperimen dengan mengisolasi wajah manusia yang konsisten secara temporal yang dapat diperoleh dengan metode ini, untuk menumpangkan atau mengintegrasikan wajah ke dalam footage sumber dunia nyata.
Seperti komunitas penghobi, perusahaan VFX harus menunggu fungsi gambar-ke-video dan video-ke-video Hunyuan Video, yang berpotensi menjadi jembatan yang paling berguna antara konten ‘deepfake’ berbasis LoRA; atau harus berimprovisasi, dan menggunakan interval untuk menyelidiki kemampuan luar dari kerangka kerja dan adaptasi potensial, serta fork proprietari dalam rumah dari Hunyuan Video.
Meskipun ketentuan lisensi untuk Hunyuan Video secara teknis mengizinkan penggambaran individu nyata asalkan izin diberikan, mereka melarang penggunaannya di Uni Eropa, Inggris, dan Korea Selatan. Berdasarkan prinsip ‘stays in Vegas’, ini tidak berarti bahwa Hunyuan Video tidak akan digunakan di wilayah-wilayah tersebut; namun, prospek audit data eksternal untuk menegakkan regulasi yang tumbuh di sekitar AI generatif bisa membuat penggunaan semacam itu berisiko.
Satu area lain yang ambigu dalam ketentuan lisensi menyatakan:
‘Jika, pada tanggal rilis versi Hunyuan Tencent, pengguna aktif bulanan dari semua produk atau layanan yang tersedia oleh atau untuk Lisensi adalah lebih dari 100 juta pengguna aktif bulanan pada bulan kalender sebelumnya, Anda harus meminta lisensi dari Tencent, yang dapat diberikan kepada Anda atas kebijakan tunggal Tencent, dan Anda tidak berhak untuk menggunakan hak-hak di bawah Perjanjian ini kecuali atau sampai Tencent memberikan hak-hak tersebut kepada Anda.’
Klausul ini jelas ditujukan untuk sejumlah perusahaan yang kemungkinan akan ‘menengah’ Hunyuan Video untuk sejumlah besar pengguna yang kurang melek teknologi, dan yang akan diminta untuk memasukkan Tencent ke dalam aksi di atas ambang tertentu pengguna.
Apakah frasa yang luas dapat mencakup penggunaan tidak langsung (yaitu, melalui penyediaan output efek visual Hunyuan yang diaktifkan dalam film dan acara TV populer) memerlukan klarifikasi.
Kesimpulan
Karena video deepfake telah ada selama waktu yang lama, akan mudah untuk meremehkan signifikansi LoRA Hunyuan Video sebagai pendekatan untuk sintesis identitas, dan deepfaking; dan untuk menganggap bahwa upaya yang saat ini termanifestasi di komunitas Civit, dan di Discord dan subreddit yang terkait, hanya merupakan dorongan inkremental kecil menuju sintesis video manusia yang benar-benar dapat dikontrol.
Lebih mungkin adalah bahwa upaya saat ini hanya merupakan sebagian dari potensi Hunyuan Video untuk menciptakan deepfakes tubuh penuh dan lingkungan yang sangat meyakinkan; sekali komponen gambar-ke-video dirilis (yang dikabarkan akan terjadi bulan ini), tingkat kemampuan generatif yang jauh lebih granular akan tersedia bagi komunitas hobi dan profesional.
Ketika Stability.ai merilis Stable Diffusion pada 2022, banyak pengamat tidak bisa menentukan mengapa perusahaan itu hanya memberikan sistem generatif yang sangat berharga dan kuat pada saat itu. Dengan Hunyuan Video, motif keuntungan dibangun langsung ke dalam lisensi – meskipun mungkin akan sulit bagi Tencent untuk menentukan kapan sebuah perusahaan memicu skema pembagian keuntungan.
Bagaimanapun, hasilnya sama seperti pada 2022: komunitas pengembangan yang didedikasikan telah terbentuk segera dan dengan semangat yang intens di sekitar rilis. Beberapa jalan yang akan diambil oleh upaya ini dalam 12 bulan ke depan pasti akan memicu headline baru.
* Hingga 136 pada saat publikasi.
Publikasi pertama pada Selasa, 7 Januari 2025












