Anderson’un Açısı

HunyuanCustom, Tek bir Görüntüden Derin Sahte Video Oluşturma, Ses ve Dudak Senkronizasyonu ile

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Images from the new paper at https://arxiv.org/pdf/2505.04512

Bu makale, multimodal bir Hunyuan Video dünya modeli olan ‘HunyuanCustom’ün yeni bir sürümünü tartışmaktadır. Yeni makalenin kapsamı, birlikte sunulan örnek videolardaki birçok sorunla birlikte, genellikle olduğundan daha genel bir kapsama ve bu sürümle gelen büyük miktarda video materyalinin sınırlı yeniden üretimine yol açmaktadır.

Ayrıca, lütfen makaledeki API tabanlı generatif sistem Kling’in ‘Keling’ olarak adlandırıldığını unutmayın. Açıklık için, ‘Kling’ olarak adlandırıyorum.

 

Tencent, Hunyuan Video modelinin yeni bir sürümünü yayınlamaktadır. Bu yeni sürüm, HunyuanCustom olarak adlandırılmaktadır. Yeni sürüm, Hunyuan Video modeli için Hunyuan LoRA modelleri oluşturmanıza gerek kalmadan, tek bir görüntü kullanarak ‘derin sahte’ video özelleştirmesi yapmanıza olanak tanır.

Çalma: ‘Bir adam müzik dinlerken ve mutfakta sülük makarnası pişirirken’. Yeni yöntem, Kling dahil, yakın ve açık kaynaklı yöntemlerle karşılaştırılmıştır. Kaynak: https://hunyuancustom.github.io/ (uyarı: CPU/bellek yoğun site!)

Yukarda görünen videonun en sol sütununda, HunyuanCustom’a verilen tek kaynak görüntüsünü görüyoruz, ardından yeni sistemin.prompt yorumunu yanındaki sütunda görüyoruz. Kalan sütunlar, çeşitli özel ve açık kaynaklı sistemlerin sonuçlarını gösteriyor: Kling; Vidu; Pika; Hailuo; ve Wan tabanlı SkyReels-A2.

Aşağıdaki videoda, bu sürüm için üç senaryonun renderlerini görüyoruz: sırasıyla, kişi + nesne; tek karakter emülasyonu; ve sanal deneme (kişi + giyim).

Çalma. Hunyuan Video için destek sitesi malzemelerinden düzenlenmiş üç örnek.

Bu örneklerden birkaç şey görebiliriz, çoğunlukla tek bir kaynak görüntüsüne dayanan sistemle ilgili.

İlk klibde, adam esas olarak hala kameraya bakıyor. Başını aşağı ve yana doğru 20-25 dereceden fazla eğmez, ancak bu açının üzerinde, sistem gerçekten profilini doğru bir şekilde tahmin etmek zorunda kalacaktır. Bu, tek bir ön görüntüden kesin olarak ölçmek zor, muhtemelen imkansızdır.

İkinci örnekte, küçük kızın gülümsediğini görüyoruz, hem statik kaynak görüntüsünde hem de oluşturulan videoda. Yine, bu tek görüntüden, HunyuanCustom’un ‘dinlenmeyen yüz’ünün neye benzediğini относительно bilgisiz bir tahminde bulunması gerekir. Ayrıca, yüzü kameraya bakan duruşundan fazla sapmaz (‘adam cips yerken’ önceki örnekte olduğu gibi).

Son örnekte, kaynak malzemesi – kadın ve giydirdiği kıyafetler – tam değil, render edilen senaryo, veri sorununa iyi bir çözüm olarak, senaryoyu uyarlama şeklinde daraltılmıştır.

Nokta, yeni sistemin tek bir karakterin birden fazla açısı veya farklı ifadeleri barındırmayacağıdır, bu nedenle HunyuanVideo’nun etrafında Aralık ayında yayımlanmasından bu yana ortaya çıkan LoRA modellerinin yerini alması zor olabilir, çünkü bunlar HunyuanVideo’nun herhangi bir açıyla ve eğitim veri kümesinde temsil edilen herhangi bir yüz ifadesiyle tutarlı karakterler oluşturmasına yardımcı olabilir (20-60 görüntü tipiktir).

Ses için Bağlantı

HunyuanCustom, ses için, kullanıcı tarafından sağlanan ses ve metin prompt’u kullanarak karakterlerin sahnede konuştuğu ses ve konuşma oluşturur.

Ses içerir. Çalma: HunyuanCustom’un ek sitesinden çeşitli örnekler, düzenlenmiştir.

Yazma zamanında, İngilizce örnekler yok, ancak bunlar oldukça iyi görünüyor – özellikle de oluşturulma yöntemi kolayca kurulabilir ve erişilebilir ise.

Mevcut Videoları Düzenleme

Yeni sistem, videoyu videoya (V2V veya Vid2Vid) düzenleme için çok etkileyici sonuçlar sunar, burada mevcut bir videonun bir bölümü akıllıca bir référence görüntüsünden alınan bir konu ile değiştirilir. Aşağıda, ek malzemeler sitesinden bir örnek vardır:

Çalma

Gördüğümüz gibi ve vid2vid senaryosunda standart olan, tam video proceso tarafından değiştirilir, ancak hedeflenen bölgede, yani peluş oyuncakta en çok değiştirilir. Muhtemelen, pipelines, orijinal video içeriğinin çoğunu orijinaline benzer şekilde koruyarak böyle dönüşümleri oluşturmak için geliştirilebilir – bu, Adobe Firefly’nin altında yaptığı ve iyi yaptığı şeydir, ancak FOSS generatif sahnesinde az çalışılmış bir prosestir.

Bununla birlikte, çoğu alternatif örnek, bu entegrasyonları daha iyi bir şekilde hedeflediğini gösteriyor:

Çalma: HunyuanCustom’un vid2vid’si kullanarak enjekte edilen içeriğin çeşitli örnekleri, hedeflenmeyen materyale önemli bir saygı gösteriyor.

Yeni Bir Başlangıç?

Bu girişim, Hunyuan Video projesinin geliştirilmesidir, bu geliştirme akışından uzaklaşılması değil. Projenin iyileştirmeleri, yapısal değişikliklerin yerine, modelin çerçeve boyunca kimlik bütünlüğünü korurken konu özgü ince ayar olmadan, mimari ekleme olarak sunulmaktadır.

Açık olmak gerekirse, HunyuanCustom, sıfırdan eğitilmiyor, ancak Aralık 2024 HunyuanVideo temel modelinin ince ayarlanmasıdır.

HunyuanVideo LoRA’ları geliştirmiş olanlar, bu yeni sürümle birlikte çalışıp çalışmayacağını veya daha fazla özelleştirme yeteneği istedikleri takdirde LoRA tekerleğini tekrar tekrar icat etmeleri gerekip gerekmediğini merak edebilirler.

Genel olarak, bir hiperscale modelin ağır bir şekilde ince ayarlanmış bir sürümü, model ağırlıklarını, daha önceki model için yapılan LoRA’ların yeni modelle düzgün çalışmaması veya hiç çalışmaması için yeterli ölçüde değiştirir.

Bazen, bir ince ayarın popülaritesi, kökenini zorlayabilir: bir ince ayarın, adanmış bir ekosistemi ve kendi takipçileri olan etkili bir dal haline geldiği bir örnek, Pony Diffusion ayarının Stable Diffusion XL (SDXL) ayarlanmasıdır. Pony, CivitAI alanında 592.000+ indirme sayısına sahiptir ve Pony’ye (SDXL değil) dayanan ve Pony’yi çıkarım zamanında gerektiren geniş bir LoRA yelpazesi vardır.

Yayımlama

Proje sayfası için yeni makale (adı HunyuanCustom: Özelleştirilmiş Video Oluşturma için Çoğul Modal Sürücü Mimarisi), GitHub sitesine bağlantılar içerir ve ComfyUI entegrasyonu dışında önemli olan tek şeyin gelecekte olmasıyla birlikte, tüm kodu ve yerel uygulama için gerekli ağırlıkları içerir.

Yazma zamanında, projenin Hugging Face varlığı hala 404’dür. Ancak, API tabanlı bir sürüm vardır ve demo için WeChat tarama kodunu sağlayabilirsiniz.

Endişeli kullanımının bu kadar geniş bir projede bir araya geldiğini nadiren gördüm ve muhtemelen bazı lisanslar tam bir sürüm gerektirecektir.

GitHub sayfasında iki model duyuruluyor: 720px1280px boyutlarında bir sürüm, 8 GB GPU zirve belleği gerektiriyor ve 512px896px boyutlarında bir sürüm, 60 GB GPU zirve belleği gerektiriyor.

Depo, ‘720px1280px129f için minimum GPU belleği 24 GB’dir, ancak çok yavaş… 80 GB bellekli bir GPU kullanmanızı öneririz’ diyor ve sistem yalnızca Linux’te test edildiğini belirtiyor.

Önceki Hunyuan Video modeli, resmi olarak yayımlanmasından bu yana, 24 GB’den az VRAM’de çalışabilmesi için küçültülmüştür ve yeni modelin de tüketici dostu formlara uyarlanacağı ve kısa sürede Windows sistemlerinde de uyarlanacağı düşünülüyor.

Zaman kısıtlamaları ve bu sürümle gelen büyük miktarda bilgi nedeniyle, yalnızca daha geniş bir bakış açısıyla bakabiliriz. Yine de, HunyuanCustom’u biraz daha yakından inceleyelim.

Makaleye Bir Bakış

HunyuanCustom için veri işleme pipeline’ı, GDPR çerçevesine uygun olarak, sentezlenmiş ve açık kaynaklı video veri kümelerini içerir, OpenHumanVid dahil, sekiz temel kategoriyle temsil edilir: insanlar, hayvanlar, bitkiler, manzaralar, araçlar, nesneler, mimari ve anime.

Makaleden, HunyuanCustom veri inşası pipeline'ının çeşitli katkı paketlerinin bir özeti. Kaynak: https://arxiv.org/pdf/2505.04512

Makaleden, HunyuanCustom veri inşası pipeline’ının çeşitli katkı paketlerinin bir özeti. Kaynak: https://arxiv.org/pdf/2505.04512

İlk filtreleme, PySceneDetect ile başlar, videoyu tek çekim kliblerine ayırır. TextBPN-Plus-Plus daha sonra, aşırı ekran metni, altyazı, su markası veya logoları içeren videoları kaldırır.

Çözünürlük ve süre tutarsızlıklarını standartlaştırmak için, klipler beş saniye uzunluğunda ve kısa kenarına 512 veya 720 piksel olarak yeniden boyutlandırılır. Estetik filtreleme, Koala-36M ile yapılır ve özel veri kümesi için 0.06 eşiği uygulanır.

Konu çıkarma işlemi, Qwen7B büyük dil modeli (LLM), YOLO11X nesne tanıma çerçevesi ve popüler InsightFace mimarisi ile birleştirilir, insan kimliklerini tanımlamak ve doğrulamak için kullanılır.

İnsan olmayan konular için, QwenVL ve Grounded SAM 2 ilgili sınırlayıcı kutuları çıkarmak için kullanılır, bunlar слишком küçük ise atılır.

Hunyuan Control projesinde kullanılan Grounded SAM 2 ile anlamsal segmentasyon örnekleri. Kaynak: https://github.com/IDEA-Research/Grounded-SAM-2

Hunyuan Control projesinde kullanılan Grounded SAM 2 ile anlamsal segmentasyon örnekleri. Kaynak: https://github.com/IDEA-Research/Grounded-SAM-2

Çoklu konu çıkarma, Florence2 için sınırlayıcı kutu açıklamaları ve Grounded SAM 2 için segmentasyon kullanır, ardından eğitim çerçevelerinin zamanlı segmentasyonu ve kümeleme yapılır.

İşlenen klipler, Hunyuan ekibi tarafından geliştirilen özel bir yapılandırılmış etiketleme sistemi kullanılarak açıklamalarla daha da geliştirilir ve katmanlı meta veriler sağlar.

Mask artırma stratejileri, sınırlayıcı kutulara dönüştürme dahil, eğitim sırasında aşırı uyumu azaltmak ve modelin çeşitli nesne şekillerine uyum sağlaması için uygulanır.

Ses verileri, yukarıda belirtilen LatentSync ile senkronize edilir ve senkronizasyon puanları minimum eşiğin altına düştüğünde klipler atılır.

Kör görüntü kalitesi değerlendirme çerçevesi HyperIQA , videosu 40’ın (HyperIQA’nın özel ölçeğinde) altında puan alan videoları dışlamak için kullanılır.

Geçerli ses parçaları, Whisper ile işlenir ve aşağı akış görevleri için özellikler çıkarılır.

Yazarlar, anotasyon aşamasında LLaVA dil asistan modelini kullanır ve bu çerçevenin HunyuanCustom’da merkezi bir konumda olduğunu vurgular. LLaVA, görüntü açıklamaları oluşturmak ve görsel içeriği metin prompt’ları ile hizalamak için kullanılır, böylece modalitesler arasında tutarlı bir eğitim sinyali oluşturulur:

HunyuanCustom çerçevesi, metin, görüntü, ses ve video girişlerine bağlı olarak kimlik tutarlı video oluşturmayı destekler.

HunyuanCustom çerçevesi, metin, görüntü, ses ve video girişlerine bağlı olarak kimlik tutarlı video oluşturmayı destekler.

LLaVA’nın görüntüleme-dil hizalama yeteneklerini kullanarak, pipeline, görsel öğeler ve metinsel açıklamaları arasında daha fazla anlamsal tutarlılık kazanır – özellikle çoklu konu veya karmaşık sahne senaryolarında değerli bir özelliktir.

Özel Video

Referans görüntüsüne ve bir prompt’a dayalı video oluşturulmasına izin vermek için, LLaVA merkezli iki modül oluşturuldu, ilk olarak HunyuanVideo’nun girdi yapısını, bir görüntü ve metin kabul edebilecek şekilde uyarlandı.

Bu, prompt’u, görüntüyü doğrudan gömmek veya kısa bir kimlik açıklamasıyla etiketlemek için bir ayırıcı token kullanmayı içerir.

LLaVA’nın görsel kodlayıcısı, özellikle tek bir referans görüntüsünden genel bir anlamsal gömme oluştururken, ince ayrıntıları sıkıştırma veya atma eğilimindedir (özellikle bir görüntüyü çevirirken), bu nedenle bir kimlik iyileştirme modülü entegre edilmiştir. Çoğu video laten difüzyon modelinin, bir LoRA olmadan kimliği koruma konusunda zorlandığı düşünüldüğünde, bu modülün topluluk testlerindeki performansı önemli olabilir.

Her durumda, referans görüntüsü yeniden boyutlandırılır ve orijinal HunyuanVideo modelinin nedenli 3D-VAE ile kodlanır ve latensi, zaman ekseni boyunca video latenlerine yerleştirilir, görüntünün doğrudan üretilmesini önlemek için bir uzaysal ofset uygulanır, ancak yine de üretimini yönlendirir.

Model, Akış Eşleştirme ile eğitilir, gürültü örnekleri logit-normal dağılımdan çekilir – ve ağ, bu gürültülü latenslerden doğru videoyu geri yüklemeye eğitilir. LLaVA ve video üreticisi birlikte ince ayarlanır, böylece görüntü ve prompt, çıktı daha akıcı bir şekilde yönlendirilir ve konu kimliği tutarlıdır.

Çoklu konu prompt’ları için, her görüntü-metin çifti ayrı olarak gömülür ve farklı bir zamanlı konum atanır, böylece kimlikler ayırt edilebilir ve birden fazla konu içeren sahnelerin oluşturulmasına olanak tanınır.

Ses ve Görüntü

HunyuanCustom, kullanıcı girişi sesi ve metin prompt’u kullanarak, karakterlerin sahnede konuştuğu ses ve konuşma oluşturur.

Bunu desteklemek için, Kimlikten ayrıştırılmış bir AudioNet modülü, référence görüntüsünden ve prompt’tan gelen kimlik sinyallerini bozmadan ses özelliklerini tanır.

İkincil bir zamanlı enjeksiyon modülü, zamanlama ve hareket üzerinde daha ince bir kontrol sağlar, AudioNet ile birlikte çalışır, ses özelliklerini latens dizisinin belirli bölgelerine haritalar ve bunları Çok Katmanlı Perceptron (MLP) ile token-bazlı hareket ofsetlerine dönüştürür. Bu, jestlerin ve yüz hareketlerinin, girişteki sesin ritmine ve vurgusuna daha büyük bir doğrulukla uyumlu olmasını sağlar.

HunyuanCustom, var olan videolardaki konuları doğrudan düzenlemenize, bir sahneye insanları veya nesneleri eklemenize veya değiştirmenize, tüm klibi baştan oluşturmanıza gerek kalmadan olanak tanır. Bu, görünüşü veya hareketi belirli bir şekilde değiştirmeyi içeren görevler için yararlıdır.

Çalma: Ek siteden bir başka örnek.

Var olan videolarda konu değiştirmeyi kolaylaştırmak için, yeni sistem, yakın zamanda popüler olan yöntemlerin çoğunda olduğu gibi, tüm video dizilerini birleştirmek yerine, référence videonun ön-eğitimli nedenli 3D-VAE kullanarak sıkıştırılmasını tercih eder – ve sonra bunları birleştirir. Bu, süreci nispeten hafif tutar ve dışarıdan video içeriğinin çıktıyı yönlendirmesine izin verir.

Küçük bir sinir ağı, temiz giriş videosu ve kullanılan gürültülü latensler arasındaki hizalamayı işler. Sistem, bu bilgileri birleştirmek için iki yöntemi test eder: önce onları tekrar sıkıştırarak birleştirmek ve çerçeveler boyunca eklemek. İkincisi, yazarlara göre daha iyi çalışır ve kalite kaybı olmadan hesaplamalı yükü değiştirmez.

Veri ve Testler

Testlerde kullanılan metriklere şunlar dahildir: ArcFace’deki kimlik tutarlılık modülü, référence görüntüsünden ve oluşturulan videonun her çerçevesinden yüz gömmeleri çıkarır ve sonra aralarında ortalama kosin benzerliğini hesaplar; konu benzerliği, YOLO11x segmentlerini Dino 2’ye göndererek; metin-video hizalama için CLIP-B, oluşturulan video ve prompt arasındaki benzerliği ölçer; CLIP-B, her çerçeveyi komşu çerçeveleri ve ilk çerçeveye olan benzerliğini hesaplar ve zamanlı tutarlılığı hesaplar; ve dinamik derece, VBench tarafından tanımlanır.

Önceki testlerde, yazarlar şunları belirtir:

‘[HunyuanCustom], en iyi kimlik tutarlılığını ve konu tutarlılığını elde eder. Ayrıca, metin-video hizalaması ve zamanlı tutarlılık açısından benzer sonuçlar elde eder. [Hailuo], en iyi CLIP puanına sahiptir, çünkü metin talimatlarına sadece kimlik tutarlılığıyla uyabilir, ancak insan olmayan konuların tutarlılığını feda eder (en kötü DINO-Sim). Dinamik derece açısından, [Vidu] ve [VACE] kötü performans gösterir, bu da modelin küçük boyutundan kaynaklanabilir.’

Testler ayrıca, çoklu konu video özelleştirmesi için HunyuanCustom’u diğer sistemlerle karşılaştırdı:

Çoklu konu video özelleştirmeleri için karşılaştırmalar. Lütfen daha iyi ayrıntı ve çözünürlük için PDF'ye bakın.

Çoklu konu video özelleştirmeleri için karşılaştırmalar. Lütfen daha iyi ayrıntı ve çözünürlük için PDF’ye bakın.

Makale, şunları belirtir:

‘[Pika], belirtilen konuları oluşturabilir, ancak video çerçevelerinde istikrarsızlık gösterir, bir senaryoda bir adamın kaybolması ve bir kadının bir kapı açmayı başaramaması gibi örnekler içerir. [Vidu] ve [VACE], kısmen insan kimliğini yakalar, ancak insan olmayan nesnelerin önemli ayrıntılarını kaybeder, bu da non-insan konularını temsil etme konusunda bir sınırlılığa işaret eder.

Diğer testler (lütfen tüm ayrıntılar için PDF’ye bakın) arasında VACE ve Kling 1.6 ile video konu değiştirme için HunyuanCustom’u karşılaştırma yer aldı:

Video konu değiştirme testi. Lütfen daha iyi ayrıntı ve çözünürlük için PDF'ye bakın.

Video konu değiştirme testi. Lütfen daha iyi ayrıntı ve çözünürlük için PDF’ye bakın.

Son testler için, araştırmacılar şunları belirtir:

‘VACE, giriş maskelerine sıkı bağlılıktan dolayı sınır artifactsine sahiptir, bu da doğal olmayan konu şekilleri ve bozulmuş hareket sürekliliğine yol açar. [Kling] ise, konuları doğrudan videonun üzerine yerleştirme etkisi gösterir, bu da arka planla kötü bir entegrasyona yol açar.

‘Karşılaştırıldığında, HunyuanCustom sınır artifactsinden kaçınır, arka planla sorunsuz bir entegrasyon sağlar ve güçlü kimlik korunmasını gerçekleştirir – video düzenleme görevlerinde üstün performansını gösterir.’

Sonuç

Bu, özellikle son zamanlarda artan bir şekilde şikayet edilen bir şeyi ele alan bir sürümdür – Hunyuan Video ve Wan 2.1 gibi sistemlerdeki gerçekçiliği artırmak için dudak senkronizasyonu eksikliği.

Proje sitesindeki karşılaştırma video örneklerinin düzeni, HunyuanCustom’un yeteneklerini önceki rakiplerine karşı karşılaştırmayı zorlaştırıyor, ancak Tencent’in, video difüzyon API’si olan Kling’e karşı önemli bir ilerleme kaydettiği unutulmamalıdır.

 

* Bazı videoların çok geniş, kısa ve yüksek çözünürlüklü olduğu ve standard video oynatıcılarında such as VLC or Windows Media Player’da siyah ekranlar gösterdiği için.

İlk olarak 8 Mayıs 2025’te yayımlanmıştır

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai