Yapay zeka modelleri ve platformları
MagicDance: Gerçekçi İnsan Dans Videosu Oluşturma
Bilgisayarlı görü ile ilgili endüstri, geniş bir yelpazede gerçek zamanlı görevler için potansiyel uygulamaları nedeniyle en çok tartışılan alanlardan biridir. Son yıllarda, bilgisayar görü çerçeveleri hızla ilerledi ve modern modeller artık gerçek zamanlı senaryolarda yüz özellikleri, nesneler ve çok daha fazlasını analiz edebiliyor. Bu yeteneklere rağmen, insan hareketi aktarımı, bilgisayar görü modelleri için önemli bir zorluk oluşturmaya devam etmektedir. Bu görev, bir kaynak görüntüden veya videodan yüz ve vücut hareketlerini bir hedef görüntüye veya videoya yönlendirmeyi içerir. İnsan hareketi aktarımı, bilgisayar görü modellerinde görüntü veya video stilize etmek, çokluortam içeriğini düzenlemek, dijital insan sentezi ve hatta algı tabanlı çerçeveler için veri oluşturmak için yaygın olarak kullanılır.
Bu makalede, insan hareketi aktarımını devrimleştirme amacıyla tasarlanan bir difüzyon tabanlı model olan MagicDance üzerine odaklanıyoruz. MagicDance çerçevesi özellikle zorlu insan dans videolarına 2B insan yüz ifadeleri ve hareketlerini aktarmayı hedeflemektedir. Hedefi, orijinal kimliği koruyarak belirli hedef kimliklere yönelik yeni poz dizisi ile yönlendirilen dans videoları oluşturmaktır. MagicDance çerçevesi, insan hareketi ayrıştırılması ve cilt tonu, yüz ifadeleri ve giysi gibi görünüm faktörleri üzerinde odaklanan iki aşamalı bir eğitim stratejisi kullanır. MagicDance çerçevesinin mimarisini, işlevselliğini ve diğer devlet-sanatlı insan hareketi aktarım çerçeveleri ile karşılaştırdığımız performansı keşfedeceğiz. Giriş yapalım.
MagicDance: Gerçekçi İnsan Hareketi Aktarımı
Önceden de bahsedildiği gibi, insan hareketi aktarımı, bir kaynak görüntüden veya videodan insan hareketleri ve ifadelerini hedef görüntüye veya videoya aktarmadaki karmaşıklık nedeniyle en karmaşık bilgisayar görü görevlerinden biridir. Geleneksel olarak, bilgisayar görü çerçeveleri, yüz ifadeleri ve vücut pozları için hedef veri setlerinde özel bir generatif modeli (GAN veya Generative Adversarial Networks) eğitmeyi kullanarak insan hareketi aktarımını başarmıştır. Generatif modellerin eğitimi ve kullanımı bazı durumlarda tatmin edici sonuçlar verir, ancak genellikle iki önemli sınırlamaya sahiptir.
- Görüntü deformasyon bileşeni üzerinde nặng bir şekilde güvenirler, bu nedenle kaynak görüntüde görünmeyen vücut parçalarını (perspektif değişikliği veya öz-kapanma nedeniyle) araştırmakta sık sık mücadele ederler.
- Dışarıdan alınan diğer görüntülere genellemeyecekleri sınırlıdır, bu da özellikle vahşi ortamlardaki gerçek zamanlı senaryolarda uygulamalarını sınırlar.

Modern difüzyon modelleri, farklı koşullar altında görüntü oluşturma yetenekleri konusunda výjeli bir performans göstermiştir ve difüzyon modelleri artık video oluşturma ve görüntü dolgu gibi çeşitli akış görevlerinde güçlü görseller sunma yeteneğine sahiptir. Web-ölçekli görüntü veri setlerinden öğrenerek. Bu yetenekleri nedeniyle, difüzyon modelleri insan hareketi aktarımı görevleri için ideal bir seçim olabilir. Difüzyon modelleri insan hareketi aktarımı için uygulanabilir, ancak içerik kalitesi, kimlik korunması veya model tasarımı ve eğitim stratejisi sınırlamaları nedeniyle zaman uyumsuzluğu gibi bazı sınırlamalara sahiptir. Ayrıca, difüzyon tabanlı modeller, GAN çerçeveleri ile karşılaştırıldığında genellemeye ilişkin olarak önemli bir avantaj göstermez.
Difüzyon ve GAN tabanlı çerçevelerin insan hareketi aktarımı görevlerinde karşılaştığı engelleri aşmak için, geliştiriciler MagicDance adlı yeni bir çerçeve tanıttı. MagicDance, difüzyon çerçevelerinin insan hareketi aktarımı için potansiyelini kullanmayı hedefleyen bir çerçevedir. Bu, kimlik korunması, görsel kalite ve alan genellemesi açısından önceki yöntemlerin üzerine çıkaran bir seviyeye ulaşmayı amaçlar. MagicDance çerçevesinin temel kavramı, görünüm kontrolü ve hareket kontrolü gibi iki aşamaya ayırarak sorunu çözmektir – görüntü difüzyon çerçevelerinin doğru hareket aktarımı çıktıları sunmasını sağlayan iki yetenek.

Yukarıdaki şekil, MagicDance çerçevesinin bir özetini sunar ve görüldüğü gibi, çerçeve Stable Diffusion modelini kullanır ve ayrıca Görünüm Kontrol Modeli ve Poz Kontrol Ağı gibi iki ek bileşen uygular. İlki, referans görüntüsünden SD modeline dikkat yoluyla görünüm rehberliği sağlar, ikincisi ise koşullandırılmış bir görüntüden veya videodan difüzyon modeline ifade/poz rehberliği sağlar. Çerçeve ayrıca, bu alt modülleri etkili bir şekilde öğrenmek için çok aşamalı bir eğitim stratejisi kullanır.
Özetle, MagicDance çerçevesi
- Görünüm ayrıştırılmış poz kontrolü ve görünüm ön eğitimini içeren yeni ve etkili bir çerçevedir.
- MagicDance çerçevesi, poz koşul girişleri ve referans görüntüleri veya videoları kontrolü altında gerçekçi insan yüz ifadeleri ve insan hareketleri oluşturabilme yeteneğine sahiptir.
- MagicDance çerçevesi, bir Çok Kaynaklı Dikkat Modülü sunarak Stable Diffusion UNet çerçevesine doğru rehberlik sağlamak amacıyla görünüm tutarlı insan içeriği oluşturmayı hedefler.
- MagicDance çerçevesi, Stable Diffusion çerçevesi için uygun bir uzantı veya eklenti olarak da kullanılabilir ve mevcut model ağırlıkları ile uyumluluk sağlar, bu nedenle parametrelerin ek fine-tuning’i gerekmez.
Ayrıca, MagicDance çerçevesi hem görünüm hem de hareket için výjeli genellemeye sahip yetenekleri gösterir.
- Görünüm Genellemesi: MagicDance çerçevesi, çeşitli görünüşler oluşturma konusunda üstün yeteneklere sahiptir.
- Hareket Genellemesi: MagicDance çerçevesi ayrıca geniş bir hareket yelpazesi oluşturabilme yeteneğine sahiptir.
MagicDance: Hedefler ve Mimari
Verilen bir referans görüntüsüne (gerçek bir insan veya stilize bir görüntü) dayalı olarak, MagicDance çerçevesinin birincil hedefi, girdi ve poz girişleri {P, F} koşullarına bağlı bir çıktı görüntüsü veya videosu oluşturmaktır, burada P insan poz iskeletini ve F yüz özellikleri temsil eder. Oluşturulan çıktı görüntüsü veya videosu, referans görüntüsündeki insanların görünümünü ve kimliğini koruyarak arka plan içeriğini koruyabilmeli ve poz ve ifadeleri tanımlayan poz girişlerini koruyabilmelidir.
Mimari
Eğitim sırasında, MagicDance çerçevesi bir çerçeve yeniden yapılandırma görevi olarak eğitilir, referans görüntüsünden ve aynı referans videosundan alınan poz girişi ile birlikte zemini yeniden oluşturur. Test sırasında, hareket aktarımı gerçekleştirmek için poz girişi ve referans görüntüsü farklı kaynaklardan sağlanır.
MagicDance çerçevesinin genel mimarisi dört kategoriye ayrılabilir: Ön aşama, Görünüm Kontrol Ön Eğitim, Görünüm Ayrıştırılmış Poz Kontrolü ve Hareket Modülü.
Ön Aşama
Latent Difüzyon Modelleri veya LDM, otomatik bir kodlayıcı kullanarak latent uzayda çalışmak üzere özel olarak tasarlanmış difüzyon modellerini temsil eder ve Stable Diffusion çerçevesi, bir Vektörle Quantized-Variational Otomatik Kodlayıcı ve zaman U-Net mimarisi kullanan LDM’lerin önemli bir örneğidir. Stable Diffusion modeli, metin girişlerini işlemek için bir CLIP tabanlı dönüştürücü kullanır ve metin girişlerini gömme olarak dönüştürür. Eğitim aşamasında, Stable Diffusion çerçevesi modele bir metin koşulu ve bir girdi görüntüsü sunar, bu işlem görüntüyü bir latent temsil içine kodlar ve ardından bir dizi difüzyon adımına tabi tutar, bu adımlar bir Gauss yöntemiyle yönetilir. Sonuçlanan dizi, bir standart normal dağılımı sağlayan gürültülü bir latent temsil sağlar ve Stable Diffusion çerçevesinin birincil öğrenme hedefi, bu gürültülü latent temsilleri yinelemeli olarak latent temsillere temizlemektir.
Görünüm Kontrol Ön Eğitim
Orijinal ControlNet çerçevesinin önemli bir sorunu, uzayda değişen hareketler arasında tutarlı bir şekilde görünümü kontrol edememesidir, ancak girişteki pozlara benzer pozlar üretebilen görüntüler oluşturur, ancak genel görünüm metin girişleri tarafından büyük ölçüde etkilenir. Bu yöntem çalışsa da, görünüm bilgisi için referans görüntüsüne dayanan hareket aktarımı görevleri için uygun değildir.
MagicDance çerçevesindeki Görünüm Kontrol Ön Eğitim modülü, görünüm kontrolü için rehberlik sağlamak amacıyla bir yardımcı dal olarak tasarlanmıştır. Metin girişlerine güvenmek yerine, modül genel olarak referans görüntüsünden görünüm özniteliklerini kullanmaya odaklanır, özellikle karmaşık hareket dinamikleri içeren senaryolarda görünüm özelliklerini doğru bir şekilde üretme yeteneğini artırmayı hedefler. Ayrıca, sadece Görünüm Kontrol Modeli, görünüm kontrolü ön eğitiminde eğitilebilir.
Görünüm Ayrıştırılmış Poz Kontrolü
Çıktı görüntüsündeki poz kontrolünü kontrol etmenin basit bir çözümü, önceden eğitilmiş ControlNet modelini önceden eğitilmiş Görünüm Kontrol Modeli ile doğrudan entegre etmektir, ancak bu entegrasyon, girdi pozları ile oluşturulan pozlar arasında bir uyumsuzluk oluşturabilir. Bu uyumsuzluğu gidermek için, MagicDance çerçevesi, Poz Kontrol Ağını önceden eğitilmiş Görünüm Kontrol Modeli ile birlikte again eğitmektedir.
Hareket Modülü
Görünüm Ayrıştırılmış Poz Kontrol Ağı ve Görünüm Kontrol Modeli birlikte çalıştığında, görüntü hareket aktarımına ulaşılabilir, ancak bu zaman uyumsuzluğu ile sonuçlanabilir. Zaman uyumsuzluğunu önlemek için, çerçeve, birincil Stable Diffusion UNet mimarisine ek bir hareket modülü entegre eder.
MagicDance: Ön Eğitim ve Veri Setleri
Ön eğitim için, MagicDance çerçevesi 350’den fazla dans videosu içeren bir TikTok veri setini kullanır, bu videolar 10 ila 15 saniye arasında değişen uzunluklara sahiptir ve çoğunlukla bir kişinin dans ettiğini gösterir, bu videoların çoğu yüz ve üst vücut içerir. MagicDance çerçevesi, her videoyu 30 FPS’de çıkarır ve her kareye OpenPose çalıştırarak poz iskeleti, el pozları ve yüz özellikleri çıkarır.
Ön eğitim için, görünüm kontrol modeli, 8 NVIDIA A100 GPU’da 64’lük bir toplu işlemden 10.000 adımda 512×512’lik bir görüntü boyutunda eğitilir, ardından poz kontrolü ve görünüm kontrol modelleri birlikte 16’lık bir toplu işlemden 20.000 adımda fine-tune edilir. Eğitim sırasında, MagicDance çerçevesi, hedef ve referans olarak iki kareyi rastgele örnekler ve görüntüleri aynı konumda ve aynı yükseklikte kırpma işlemini gerçekleştirir. Değerlendirme sırasında, model görüntüyü merkezi olarak kırpma işlemini gerçekleştirir.
MagicDance: Sonuçlar
MagicDance çerçevesi üzerinde yürütülen deneysel sonuçlar aşağıdaki görüntüde gösterilmektedir ve görüldüğü gibi, MagicDance çerçevesi, insan hareketi aktarımı için Disco ve DreamPose gibi mevcut çerçeveleri tüm metriklere karşı aşmaktadır. Bir isim önünde “*” bulunan çerçeveler, hedef görüntüyü doğrudan girdi olarak kullanır ve diğer çerçevelere kıyasla daha fazla bilgi içerir.

İlginç bir şekilde, MagicDance çerçevesi, Disco çerçevesine kıyasla %156,62’lik bir artışla 0,426’lık bir Face-Cos puanına ulaşır ve DreamPose çerçevesine kıyasla yaklaşık %400’lük bir artış gösterir. Sonuçlar, MagicDance çerçevesinin kimlik bilgilerini koruma yeteneğinin güçlü kapasitesini ve mevcut devlet-sanatlı yöntemler üzerinde görünen performans artışını gösterir.
Aşağıdaki şekiller, MagicDance, Disco ve TPS çerçeveleri arasında insan videosu oluşturma kalitesini karşılaştırır. Görüldüğü gibi, GT, Disco ve TPS çerçeveleri tarafından oluşturulan sonuçlar, insan poz kimliği ve yüz ifadeleri tutarlılığından yoksunluk nedeniyle etkilenir.

Ayrıca, aşağıdaki görüntü, TikTok veri setinde MagicDance çerçevesi tarafından yüz ifadesi ve insan hareketi aktarımının görselleştirmesini gösterir ve MagicDance çerçevesinin, çeşitli yüz özellikleri ve poz iskeleti girişleri altında gerçekçi ve canlı ifadeler ve hareketler oluşturabildiğini, aynı zamanda referans girdi görüntüsünden kimlik bilgilerini doğru bir şekilde koruduğunu gösterir.

MagicDance çerçevesinin, görünüm kontrolü ile birlikte görülmemiş poz ve stillerden gelen dış-alan referans görüntülerine výjeli genellemeye sahip yetenekleri olduğu da not edilmelidir, bu, hedef alan üzerinde herhangi bir ek fine-tuning olmadan etkileyici sonuçlar verir.

Aşağıdaki görüntüler, MagicDance çerçevesinin yüz ifadesi aktarımı ve sıfır-atış insan hareketi yeteneklerinin görselleştirmesini gösterir ve MagicDance çerçevesinin vahşi ortamlardaki insan hareketlerine mükemmel bir şekilde genellemeye ulaştığı görülür.

MagicDance: Sınırlamalar
OpenPose, MagicDance çerçevesi için önemli bir bileşendir, çünkü poz kontrolü için kritik bir rol oynar ve oluşturulan görüntülerin kalitesi ve zaman uyumsuzluğu üzerinde önemli bir etkiye sahiptir. Ancak, MagicDance çerçevesi hala kısmen görünür nesnelerin veya hızlı hareketlerin bulunduğu görüntülerde yüz özellikleri ve poz iskeletini doğru bir şekilde tespit etmekte zorluk çekebilmektedir, bu da oluşturulan görüntüde hatalara neden olabilir.
Sonuç
Bu makalede, insan hareketi aktarımını devrimleştirme amacıyla tasarlanan bir difüzyon tabanlı model olan MagicDance hakkında konuştuk. MagicDance çerçevesi, zorlu insan dans videolarına 2B insan yüz ifadeleri ve hareketlerini aktarmayı hedeflemektedir. Hedefi, orijinal kimliği koruyarak belirli hedef kimliklere yönelik yeni poz dizisi ile yönlendirilen dans videoları oluşturmaktır. MagicDance çerçevesi, insan hareketi ayrıştırılması ve cilt tonu, yüz ifadeleri ve giysi gibi görünüm faktörleri üzerinde odaklanan iki aşamalı bir eğitim stratejisi kullanır.
MagicDance, yüz ifadesi ve hareket aktarımını içeren gerçekçi insan videosu oluşturmayı kolaylaştıran yeni bir yaklaşımdır ve vahşi ortamlarda tutarlı animasyon oluşturmak için herhangi bir ek fine-tuning gerekmez, bu da mevcut yöntemler üzerinde önemli bir ilerleme sağlar. Ayrıca, MagicDance çerçevesi, karmaşık hareket dizileri ve çeşitli insan kimlikleri üzerinde výjeli genellemeye sahip yetenekleri gösterir, bu da MagicDance çerçevesini AI destekli hareket aktarımı ve video oluşturma alanındaki lider konumuna yerleştirir.












