Sudut Anderson
HunyuanCustom Menghadirkan Video Deepfakes Dengan Satu Gambar, Bersama Audio dan Sinkronisasi Bibir

Artikel ini membahas tentang rilis baru dari model dunia video multimodal Hunyuan yang disebut ‘HunyuanCustom’. Cakupan paper baru ini, dikombinasikan dengan beberapa masalah di banyak contoh video yang disediakan di halaman proyek*, membatasi kami untuk melakukan liputan yang lebih umum daripada biasanya, dan reproduksi terbatas dari jumlah besar materi video yang menyertainya (karena banyak video memerlukan penyuntingan dan pemrosesan yang signifikan untuk meningkatkan keterbacaan tata letak).
Perlu diingat tambahan bahwa paper ini merujuk pada sistem generatif berbasis API Kling sebagai ‘Keling’. Untuk kejelasan, saya merujuk pada ‘Kling’ sepanjang artikel ini.
Tencent sedang dalam proses merilis versi baru dari model video Hunyuan, yang diberi judul HunyuanCustom. Versi baru ini tampaknya mampu membuat model LoRA Hunyuan menjadi usang, dengan memungkinkan pengguna untuk membuat video dengan gaya ‘deepfake’ melalui sebuah gambar:
Klik untuk memutar. Prompt: ‘Seorang pria sedang mendengarkan musik dan memasak mi di dapur’. Metode baru ini dibandingkan dengan metode tertutup dan open-source, termasuk Kling, yang merupakan pesaing signifikan di ruang ini. Sumber: https://hunyuancustom.github.io/ (peringatan: situs ini memerlukan CPU/memori yang intensif!)
Di kolom kiri video di atas, kita melihat gambar sumber tunggal yang disediakan untuk HunyuanCustom, diikuti oleh interpretasi sistem terhadap prompt di kolom kedua, di sebelahnya. Kolom yang tersisa menampilkan hasil dari berbagai sistem proprietary dan FOSS: Kling; Vidu; Pika; Hailuo; dan Wan-based SkyReels-A2.
Di video berikut, kita melihat render dari tiga skenario yang penting untuk rilis ini: masing-masing, orang + objek; emulasi karakter tunggal; dan virtual try-on (orang + pakaian):
Klik untuk memutar. Tiga contoh diedit dari materi di situs pendukung untuk Hunyuan Video.
Kita dapat memperhatikan beberapa hal dari contoh ini, sebagian besar terkait dengan sistem yang bergantung pada sebuah gambar sumber, bukan beberapa gambar dari subjek yang sama.
Di klip pertama, pria itu pada dasarnya masih menghadap kamera. Ia menundukkan kepalanya ke bawah dan ke samping tidak lebih dari 20-25 derajat rotasi, tetapi, pada inklinasi melebihi itu, sistem benar-benar harus mulai menebak apa dia terlihat seperti dari samping. Ini sulit, mungkin mustahil untuk diukur secara akurat dari sebuah gambar depan saja.
Di contoh kedua, kita melihat bahwa gadis kecil itu tersenyum di video yang dihasilkan seperti dia di gambar statis sumber. Lagi, dengan gambar sumber ini sebagai referensi, HunyuanCustom harus membuat tebakan yang relatif tidak berinformasi tentang apa wajah ‘istirahat’ dia terlihat seperti. Selain itu, wajahnya tidak menyimpang dari posisi menghadap kamera lebih dari contoh sebelumnya (‘pria makan keripik’).
Di contoh terakhir, kita melihat bahwa karena materi sumber – wanita dan pakaian yang dipromosikan – tidak lengkap, render telah memotong skenario untuk memasukkannya – yang sebenarnya merupakan solusi yang cukup baik untuk masalah data!
Titiknya adalah bahwa meskipun sistem baru dapat menangani beberapa gambar (seperti orang + keripik, atau orang + pakaian), itu tidak tampaknya memungkinkan untuk beberapa sudut atau pandangan alternatif dari sebuah karakter tunggal, sehingga ekspresi yang beragam atau sudut yang tidak biasa dapat diakomodasi. Dalam hal ini, sistem mungkin berjuang untuk menggantikan ekosistem LoRA yang berkembang yang telah muncul di sekitar HunyuanVideo sejak rilisnya bulan Desember, karena mereka dapat membantu HunyuanVideo untuk menghasilkan karakter yang konsisten dari sudut mana pun dan dengan ekspresi wajah yang diwakili dalam dataset pelatihan (20-60 gambar adalah biasa).
Terhubung dengan Suara
Untuk audio, HunyuanCustom menggunakan sistem LatentSync (yang terkenal sulit untuk diatur dan mendapatkan hasil yang baik) untuk mendapatkan gerakan bibir yang sesuai dengan audio dan teks yang disediakan pengguna:
Klik untuk memutar. Berbagai contoh sinkronisasi bibir dari situs pendukung HunyuanCustom, diedit bersama.
Pada saat penulisan, tidak ada contoh bahasa Inggris, tetapi mereka tampaknya cukup baik – semakin baik jika metode pembuatannya mudah dipasang dan diakses.
Mengedit Video yang Ada
Sistem baru menawarkan apa yang tampaknya hasil yang sangat mengesankan untuk pengeditan video-ke-video (V2V, atau Vid2Vid), di mana segmen dari video yang ada (nyata) dipotong dan diisi dengan subjek yang diberikan dalam sebuah gambar referensi. Berikut adalah contoh dari situs materi pendukung:
Klik untuk memutar. Hanya objek tengah yang ditargetkan, tetapi apa yang tersisa di sekitarnya juga berubah dalam proses vid2vid HunyuanCustom.
Sebagaimana kita lihat, dan sebagaimana biasa dalam skenario vid2vid, seluruh video diubah oleh proses, meskipun sebagian besar diubah di wilayah yang ditargetkan, yaitu mainan plush. Secara teori, pipa bisa dikembangkan untuk membuat transformasi seperti itu di bawah pendekatan garbage matte yang meninggalkan sebagian besar konten video identik dengan aslinya. Ini adalah apa yang dilakukan Adobe Firefly di bawah tudung, dan melakukan dengan cukup baik – tetapi ini adalah proses yang belum banyak dipelajari di kancah generatif FOSS.
Yang dikatakan, sebagian besar contoh alternatif yang disediakan melakukan pekerjaan yang lebih baik dalam menargetkan integrasi ini, sebagaimana kita lihat dalam kompilasi yang disusun di bawah:
Klik untuk memutar. Contoh yang beragam dari konten yang diinterseksi menggunakan vid2vid di HunyuanCustom, menunjukkan rasa hormat yang signifikan terhadap material yang tidak ditargetkan.
Awal yang Baru?
Inisiatif ini adalah pengembangan dari proyek video Hunyuan, bukan perubahan arah yang keras dari aliran pengembangan ini. Peningkatan proyek ini diperkenalkan sebagai penyisipan arsitektur yang diskrit, bukan perubahan struktural yang menyeluruh, dengan tujuan untuk memungkinkan model mempertahankan keaslian identitas di seluruh bingkai tanpa bergantung pada penyesuaian subjek-spesifik fine-tuning, seperti pada pendekatan LoRA atau inversi teks.
Untuk menjelaskan, oleh karena itu, HunyuanCustom bukanlah dilatih dari awal, tetapi merupakan penyesuaian dari model dasar HunyuanVideo Desember 2024.
Orang-orang yang telah mengembangkan LoRA HunyuanVideo mungkin bertanya-tanya apakah mereka masih akan bekerja dengan edisi baru ini, atau apakah mereka harus mengubah roda LoRA lagi jika mereka ingin kemampuan penyesuaian yang lebih banyak daripada yang dibangun ke dalam rilis baru ini.
Secara umum, rilis yang sangat disesuaikan dari model hyperscale mengubah berat model cukup sehingga LoRA yang dibuat untuk model sebelumnya tidak akan bekerja dengan baik, atau sama sekali, dengan model yang baru diperbarui.
Sometimes, however, a fine-tune’s popularity can challenge its origins: one example of a fine-tune becoming an effective fork, with a dedicated ecosystem and followers of its own, is the Pony Diffusion tuning of Stable Diffusion XL (SDXL). Pony currently has 592,000+ downloads on the ever-changing CivitAI domain, with a vast range of LoRAs that have used Pony (and not SDXL) as the base model, and which require Pony at inference time.
Mengeluarkan
Halaman proyek untuk paper baru (yang berjudul HunyuanCustom: Arsitektur Multimodal-Driven untuk Pembuatan Video yang Disesuaikan) menampilkan tautan ke situs GitHub yang, pada saat saya menulis, baru saja berfungsi, dan tampaknya berisi semua kode dan berat yang diperlukan untuk implementasi lokal, bersama dengan timeline yang diusulkan (di mana satu-satunya hal penting yang belum datang adalah integrasi ComfyUI).
Pada saat penulisan, kehadiran proyek di Hugging Face masih 404. Namun, ada versi berbasis API dari sistem yang dapat didemo, asalkan Anda dapat menyediakan kode scan WeChat.
Saya jarang melihat penggunaan yang sangat luas dari berbagai proyek dalam satu perakitan, seperti yang terlihat di HunyuanCustom – dan tampaknya beberapa lisensi akan memerlukan rilis penuh.
Dua model diumumkan di halaman GitHub: versi 720px1280px yang memerlukan 8)GB memori puncak GPU, dan versi 512px896px yang memerlukan 60GB memori puncak GPU.
Repositori menyatakan ‘Memori GPU minimum yang diperlukan adalah 24GB untuk 720px1280px129f tetapi sangat lambat…Kami sarankan menggunakan GPU dengan 80GB memori untuk kualitas generasi yang lebih baik’ – dan mengulangi bahwa sistem ini hanya diuji di Linux.
Model Hunyuan Video sebelumnya telah, sejak rilis resmi, dikuantifikasi ke ukuran yang dapat dijalankan dengan kurang dari 24GB VRAM, dan tampaknya masuk akal untuk mengasumsikan bahwa model baru ini juga akan disesuaikan menjadi bentuk yang lebih ramah konsumen oleh komunitas, dan bahwa itu akan segera disesuaikan untuk digunakan di sistem Windows juga.
Karena keterbatasan waktu dan jumlah informasi yang luar biasa yang menyertainya, kita hanya dapat melihat sekilas rilis ini. Namun, mari kita lihat sedikit lebih dekat pada HunyuanCustom.
Melihat Paper
Pipa data untuk HunyuanCustom, yang tampaknya sesuai dengan kerangka GDPR, menggabungkan dataset video sintetis dan open-source, termasuk OpenHumanVid, dengan delapan kategori inti yang diwakili: manusia, hewan, tanaman, landskap, kendaraan, objek, arsitektur, dan anime.

Dari paper rilis, gambaran tentang paket yang berkontribusi pada pipa konstruksi data HunyuanCustom. Sumber: https://arxiv.org/pdf/2505.04512
Penyaringan awal dimulai dengan PySceneDetect, yang membagi video menjadi klip satu-shot. TextBPN-Plus-Plus kemudian digunakan untuk menghapus video yang berisi teks layar, subtitel, tanda air, atau logo yang berlebihan.
Untuk mengatasi inkonsistensi dalam resolusi dan durasi, klip diperbarui menjadi lima detik dan diubah ukurannya menjadi 512 atau 720 piksel di sisi pendek. Penyaringan estetika ditangani menggunakan Koala-36M, dengan ambang batas khusus 0,06 yang diterapkan untuk dataset khusus yang dikuratori oleh peneliti paper baru ini.
Proses ekstraksi subjek menggabungkan Qwen7B Large Language Model (LLM), kerangka pengenalan objek YOLO11X, dan arsitektur InsightFace yang populer, untuk mengidentifikasi dan memvalidasi identitas manusia.
Untuk subjek non-manusia, QwenVL dan Grounded SAM 2 digunakan untuk mengekstrak kotak pembatas yang relevan, yang dibuang jika terlalu kecil.

Contoh segmentasi semantik dengan Grounded SAM 2, digunakan dalam proyek Hunyuan Control. Sumber: https://github.com/IDEA-Research/Grounded-SAM-2
Ekstraksi multi-subjek menggunakan Florence2 untuk anotasi kotak pembatas, dan Grounded SAM 2 untuk segmentasi, diikuti dengan pengelompokan dan segmentasi temporal dari bingkai pelatihan.
Klip yang diproses diperkaya melalui anotasi, menggunakan sistem penandaan terstruktur yang dikembangkan oleh tim Hunyuan, dan yang menyediakan metadata berlapis seperti deskripsi dan petunjuk gerakan kamera.
Strategi augmentasi masker diterapkan selama pelatihan untuk mengurangi overfitting dan memastikan model beradaptasi dengan bentuk objek yang beragam.
Data audio disinkronkan menggunakan LatentSync yang disebutkan sebelumnya, dan klip dibuang jika skor sinkronisasi turun di bawah ambang batas minimum.
Kerangka penilaian kualitas gambar buta HyperIQA digunakan untuk mengecualikan video yang skor di bawah 40 (pada skala HyperIQA). Trek audio yang valid kemudian diproses dengan Whisper untuk mengekstrak fitur untuk tugas hilir.
Penulis memasukkan model asisten bahasa LLaVA selama fase anotasi, dan mereka menekankan posisi sentral dari kerangka ini dalam HunyuanCustom. LLaVA digunakan untuk menghasilkan caption gambar dan membantu dalam mempertahankan konten visual dengan prompt teks, mendukung konstruksi sinyal pelatihan yang konsisten di seluruh modalitas:

Kerangka HunyuanCustom mendukung generasi video yang konsisten dengan identitas, yang dikondisikan pada input teks, gambar, audio, dan video.
Dengan memanfaatkan kemampuan penyelarasan visi-bahasa LLaVA, pipa ini mendapatkan lapisan tambahan konsistensi semantik antara elemen visual dan deskripsi teks mereka – terutama berharga dalam skenario multi-subjek atau adegan yang kompleks.
Video Kustom
Untuk memungkinkan generasi video berdasarkan gambar referensi dan prompt, dua modul yang berpusat pada LLaVA dibuat, pertama dengan menyesuaikan struktur input HunyuanVideo sehingga dapat menerima gambar bersama dengan teks.
Ini melibatkan memformat prompt dengan cara yang menyematkan gambar secara langsung atau menandainya dengan deskripsi identitas singkat. Token pemisah digunakan untuk mencegah penyematan gambar dari menghancurkan konten prompt.
Karena encoder visual LLaVA cenderung mengompresi atau membuang detail spasial halus selama penyelarasan fitur gambar dan teks (terutama ketika menerjemahkan gambar referensi tunggal menjadi penyematan semantik umum), modul peningkatan identitas dimasukkan. Karena hampir semua model difusi video laten memiliki beberapa kesulitan mempertahankan identitas tanpa LoRA, bahkan dalam klip lima detik, kinerja modul ini dalam pengujian komunitas mungkin terbukti signifikan.
Bagaimanapun, gambar referensi kemudian diubah ukurannya dan dienkripsi menggunakan 3D-VAE kausal dari model HunyuanVideo asli, dan latennya dimasukkan ke dalam latens video di sepanjang sumbu temporal, dengan offset spasial yang diterapkan untuk mencegah gambar langsung direproduksi dalam output, sambil masih memandu generasi.
Model ini dilatih menggunakan Flow Matching, dengan sampel noise yang diambil dari distribusi logit-normal – dan jaringan dilatih untuk memulihkan video yang benar dari latens noise ini. LLaVA dan generator video sama-sama disesuaikan sehingga gambar dan prompt dapat memandu output dengan lebih lancar dan mempertahankan identitas subjek yang konsisten.
Untuk prompt multi-subjek, setiap pasangan gambar-teks disematkan secara terpisah dan diberi posisi temporal yang berbeda, memungkinkan identitas untuk dibedakan, dan mendukung generasi adegan yang melibatkan banyak subjek yang berinteraksi.
Suara dan Visi
HunyuanCustom mengkondisikan generasi audio/ucapan menggunakan audio masukan pengguna dan prompt teks, memungkinkan karakter untuk berbicara dalam adegan yang mencerminkan pengaturan yang dijelaskan.
Untuk mendukung ini, modul AudioNet yang dipisahkan identitas memperkenalkan fitur audio tanpa mengganggu sinyal identitas yang disematkan dari gambar referensi dan prompt. Fitur-fitur ini diselaraskan dengan timeline video yang dikompresi, dibagi menjadi segmen frame-level, dan disuntikkan menggunakan mekanisme perhatian spasial cross-attention yang menjaga setiap frame terisolasi, mempertahankan konsistensi subjek dan menghindari interferensi temporal.
Modul injeksi temporal kedua menyediakan kontrol yang lebih halus atas timing dan gerakan, bekerja bersama dengan AudioNet, memetakan fitur audio ke wilayah tertentu dari urutan laten, dan menggunakan Multi-Layer Perceptron (MLP) untuk mengubahnya menjadi token-wise offset gerakan. Ini memungkinkan gerakan dan ekspresi wajah untuk mengikuti irama dan penekanan input ucapan dengan presisi yang lebih besar.
HunyuanCustom memungkinkan subjek dalam video yang ada untuk diedit secara langsung, menggantikan atau memasukkan orang atau objek ke dalam adegan tanpa perlu membangun ulang klip secara keseluruhan. Ini membuatnya berguna untuk tugas yang melibatkan perubahan penampilan atau gerakan dengan cara yang ditargetkan.
Klik untuk memutar. Contoh lain dari situs pendukung.
Untuk memfasilitasi penggantian subjek yang efisien dalam video yang ada, sistem baru menghindari pendekatan yang intensif sumber daya dari metode yang lebih baru, seperti VACE, atau yang menggabungkan seluruh urutan video, lebih memilih kompresi video referensi menggunakan 3D-VAE kausal pra-dilatih – menyelaraskannya dengan latens video internal pipa generasi, dan kemudian menambahkan keduanya. Ini menjaga proses relatif ringan, sambil masih memungkinkan konten video eksternal untuk memandu output.
Jaringan neural kecil menangani penyelarasan antara video input yang bersih dan latens noise yang digunakan dalam generasi. Sistem ini menguji dua cara untuk menyuntikkan informasi ini: menggabungkan dua set fitur sebelum mengompresinya lagi; dan menambahkan fitur frame-by-frame. Metode kedua bekerja lebih baik, menurut penulis, dan menghindari kehilangan kualitas sambil menjaga beban komputasi yang tidak berubah.
Data dan Pengujian
Dalam pengujian, metrik yang digunakan adalah: modul konsistensi identitas dalam ArcFace, yang mengekstrak penyematan wajah dari gambar referensi dan setiap frame video yang dihasilkan, dan kemudian menghitung kesamaan kosinus rata-rata antara mereka; kesamaan subjek, melalui pengiriman segmen YOLO11x ke Dino 2 untuk perbandingan; CLIP-B, penyelarasan teks-video, yang mengukur kesamaan antara prompt dan video yang dihasilkan; CLIP-B lagi, untuk menghitung kesamaan antara setiap frame dan kedua frame tetangga dan frame pertama, serta konsistensi temporal; dan derajat dinamis, seperti yang didefinisikan oleh VBench.
Sebagaimana ditunjukkan sebelumnya, pesaing sumber tertutup adalah Hailuo; Vidu 2.0; Kling (1.6); dan Pika. Pesaing kerangka FOSS adalah VACE dan SkyReels-A2.

Evaluasi kinerja model yang membandingkan HunyuanCustom dengan metode penyesuaian video terkemuka di seluruh ID konsistensi (Face-Sim), kesamaan subjek (DINO-Sim), penyelarasan teks-video (CLIP-B-T), konsistensi temporal (Temp-Consis), dan intensitas gerakan (DD). Hasil optimal dan sub-optimal ditunjukkan dalam teks tebal dan bergaris bawah, masing-masing.
Dari hasil ini, penulis menyatakan:
‘HunyuanCustom kami mencapai konsistensi ID dan kesamaan subjek terbaik. Ini juga mencapai hasil yang setara dalam mengikuti prompt dan konsistensi temporal. [Hailuo] memiliki skor klip terbaik karena dapat mengikuti instruksi teks dengan baik dengan hanya konsistensi ID, mengorbankan konsistensi subjek non-manusia (kesamaan DINO-Sim terburuk). Dalam hal Derajat Dinamis, [Vidu] dan [VACE] berkinerja buruk, yang mungkin disebabkan oleh ukuran model yang kecil.’
Meskipun situs proyek ini jenuh dengan video perbandingan (tata letak yang dirancang untuk estetika situs web daripada perbandingan yang mudah), itu tidak saat ini menampilkan video setara dengan hasil statis yang dipadatkan dalam PDF, sehubungan dengan pengujian kualitatif awal. Meskipun saya memasukkannya di sini, saya mendorong pembaca untuk melakukan pemeriksaan dekat video di situs proyek, karena mereka memberikan kesan yang lebih baik tentang hasilnya:

Dari paper, perbandingan pada penyesuaian video yang berfokus pada objek. Meskipun pembaca harus (seperti biasa) merujuk ke PDF sumber untuk resolusi yang lebih baik, video di situs proyek mungkin merupakan sumber daya yang lebih mengiluminasi dalam kasus ini.
Penulis mengomentari di sini:
‘[Vidu], [Skyreels A2] dan metode kami mencapai hasil yang relatif baik dalam penyelarasan prompt dan kesamaan subjek, tetapi kualitas video kami lebih baik daripada Vidu dan Skyreels, berkat kinerja generasi video yang baik dari model dasar kami, yaitu [Hunyuanvideo-13B]. ‘
‘[Kling] memiliki kualitas video yang baik, tetapi frame pertama video memiliki masalah copy-paste, dan kadang-kadang subjek bergerak terlalu cepat dan [buram], menyebabkan pengalaman menonton yang buruk.’
Penulis lebih lanjut mengomentari bahwa Pika berkinerja buruk dalam hal konsistensi temporal, memperkenalkan artefak subtitel (efek dari kurasi data yang buruk, di mana elemen teks dalam klip video telah diizinkan untuk mencemari konsep inti).
Hailuo mempertahankan identitas wajah, menurut mereka, tetapi gagal mempertahankan konsistensi tubuh penuh. Di antara metode open-source, VACE, para peneliti menyatakan, tidak dapat mempertahankan konsistensi identitas. Sementara itu, mereka mengklaim bahwa HunyuanCustom menghasilkan video dengan pelestarian identitas yang kuat, sambil mempertahankan kualitas dan keragaman.
Berikutnya, pengujian dilakukan untuk penyesuaian video multi-subjek, melawan pesaing yang sama. Seperti pada contoh sebelumnya, hasil PDF yang dipadatkan tidak setara dengan video yang tersedia di situs proyek, tetapi unik di antara hasil yang disajikan:

Perbandingan menggunakan penyesuaian video multi-subjek. Silakan lihat PDF untuk detail dan resolusi yang lebih baik.
Paper ini menyatakan:
‘[Pika] dapat menghasilkan subjek yang ditentukan tetapi menunjukkan ketidakstabilan dalam frame video, dengan contoh pria yang menghilang dalam satu skenario dan wanita yang gagal membuka pintu sebagaimana diprompt. [Vidu] dan [VACE] sebagian menangkap identitas manusia tetapi kehilangan detail signifikan dari objek non-manusia, menunjukkan keterbatasan dalam merepresentasikan subjek non-manusia. ‘
‘[SkyReels A2] mengalami ketidakstabilan frame yang parah, dengan perubahan yang jelas pada chip dan banyak artefak di skenario yang benar. ‘
‘Sebaliknya, HunyuanCustom kami secara efektif menangkap identitas subjek manusia dan non-manusia, menghasilkan video yang mematuhi prompt yang diberikan, dan mempertahankan kualitas visual yang tinggi dan stabilitas.’
Pengujian lebih lanjut (silakan lihat PDF untuk semua detail) termasuk putaran ‘iklan virtual manusia’, di mana kerangka kerja diminta untuk mengintegrasikan produk dengan orang:

Dari putaran pengujian kualitatif, contoh ‘penempatan produk’ neural. Silakan lihat PDF untuk detail dan resolusi yang lebih baik.
Untuk putaran ini, penulis menyatakan:
‘Hasilnya menunjukkan bahwa HunyuanCustom secara efektif mempertahankan identitas manusia sambil mempertahankan detail produk target, termasuk teks di atasnya. ‘
‘Selain itu, interaksi antara manusia dan produk tampak alami, dan video tersebut mematuhi prompt yang diberikan dengan erat, menyoroti potensi besar HunyuanCustom dalam menghasilkan video iklan.’
Area di mana hasil video akan sangat berguna adalah putaran kualitatif untuk penyesuaian subjek yang digerakkan oleh audio, di mana karakter berbicara audio yang sesuai dengan adegan dan postur yang dijelaskan dalam teks.

Hasil sebagian untuk putaran audio – meskipun hasil video mungkin lebih disukai dalam kasus ini. Hanya setengah atas dari gambar PDF yang direproduksi di sini, karena itu besar dan sulit untuk dimasukkan dalam artikel ini. Silakan lihat PDF sumber untuk detail dan resolusi yang lebih baik.
Penulis menyatakan:
‘Metode animasi manusia yang digerakkan oleh audio sebelumnya memasukkan gambar manusia dan audio, di mana postur, pakaian, dan lingkungan tetap konsisten dengan gambar yang diberikan dan tidak dapat menghasilkan video dalam gerakan dan lingkungan lain, yang mungkin [membatasi] aplikasinya. ‘
‘…[HunyuanCustom kami] memungkinkan penyesuaian subjek yang digerakkan oleh audio, di mana karakter berbicara audio yang sesuai dalam adegan dan postur yang dijelaskan dalam teks, memungkinkan animasi manusia yang digerakkan oleh audio yang lebih fleksibel dan dapat dikendalikan.’
Pengujian lebih lanjut (silakan lihat PDF untuk semua detail) termasuk putaran yang membandingkan sistem baru dengan VACE dan Kling 1.6 untuk penggantian subjek video:

Pengujian penggantian subjek dalam mode video-ke-video. Silakan lihat PDF sumber untuk detail dan resolusi yang lebih baik.
Dari pengujian terakhir yang disajikan dalam paper baru, penulis berpendapat:
‘VACE menderita artefak perbatasan karena ketaatan yang ketat pada mask input, menghasilkan bentuk subjek yang tidak alami dan kontinuitas gerakan yang terganggu. [Kling], di sisi lain, menunjukkan efek copy-paste, di mana subjek langsung ditumpangkan pada video, menghasilkan integrasi yang buruk dengan latar belakang. ‘
‘Dibandingkan, HunyuanCustom secara efektif menghindari artefak perbatasan, mencapai integrasi yang mulus dengan latar belakang video, dan mempertahankan pelestarian identitas yang kuat—menunjukkan kinerja yang unggul dalam tugas pengeditan video.’
Kesimpulan
Ini adalah rilis yang menarik, tidak hanya karena itu mengatasi sesuatu yang adegan hobi yang tidak pernah puas telah mengeluhkan lebih banyak akhir-akhir ini – kurangnya sinkronisasi bibir, sehingga realisme yang ditingkatkan yang mampu dalam sistem seperti Hunyuan Video dan Wan 2.1 mungkin diberi dimensi otentik yang baru.
Meskipun tata letak hampir semua contoh video perbandingan di situs proyek membuatnya cukup sulit untuk membandingkan kemampuan HunyuanCustom dengan pesaing sebelumnya, perlu dicatat bahwa sangat sedikit proyek di ruang sintesis video yang memiliki keberanian untuk membandingkan diri dalam pengujian melawan Kling, API difusi video komersial yang selalu mengambang di atau dekat puncak papan peringkat; Tencent tampaknya telah membuat kemajuan melawan pendahulu ini dengan cara yang cukup mengesankan.
* Masalahnya adalah bahwa beberapa video sangat lebar, pendek, dan resolusi tinggi sehingga tidak akan diputar di pemutar video standar seperti VLC atau Windows Media Player, menampilkan layar hitam.
Publikasi pertama kali pada hari Kamis, 8 Mei 2025












