Yapay zeka modelleri ve platformları

AniPortrait: Ses Tabanlı Fotoğrafçı Portre Animasyonu Sentezi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yıllar boyunca, statik görüntülerden ve seslerden gerçekçi ve ifade eden portre animasyonlarının oluşturulması, oyun, dijital medya, sanal gerçeklik ve daha birçok alanda uygulamalar bulmuştur. Buna rağmen, geliştiriciler için, zamanla tutarlı ve görsel olarak çekici yüksek kaliteli animasyonlar üretebilen çerçeveler oluşturmak hala zorlu bir işlemdir. Karmaşıklığın önemli bir nedeni, görsel olarak etkileyici bir etki yaratmak için dudak hareketleri, baş pozisyonları ve yüz ifadelerinin karmaşık koordinasyonuna ihtiyaç duyulmasıdır.

Bu makalede, AniPortrait adlı bir çerçeveden bahsedeceğiz. Bu çerçeve, bir referans portre görüntüsünden ve bir ses örneğinden yüksek kaliteli animasyonlar oluşturmak için tasarlanmıştır. AniPortrait çerçevesinin çalışması iki aşamaya bölünmüştür. İlk aşamada, AniPortrait çerçevesi, ses örneklerinden ara 3D temsilciler çıkarır ve bunları 2D yüz özellikleri dizisine projects. Daha sonra, çerçeve, bir difüzyon modeli ile bir motion modülünü birleştirerek, yüz özelliği dizisini zamanla tutarlı ve fotoğrafçı animasyonlara dönüştürür. Deneysel sonuçlar, AniPortrait çerçevesinin yüksek kaliteli animasyonlar oluşturma yeteneğini ve görsel kalite, yüz doğallığı ve poz çeşitliliği açısından üstünlüğünü göstermektedir. Ayrıca, AniPortrait çerçevesi, kontrol edilebilirlik ve esneklik açısından önemli bir potansiyele sahiptir ve yüz yeniden canlandırma, yüz hareket düzenleme ve daha birçok alanda etkili bir şekilde uygulanabilir. Bu makale, AniPortrait çerçevesini derinlemesine ele almayı amaçlamaktadır ve mekanizma, metodoloji, mimari ve diğer çerçevelerle karşılaştırmasını探讨 edeceğiz. Şimdi başlayalım.

AniPortrait: Fotoğrafçı Portre Animasyonu

Gerçekçi ve ifade eden portre animasyonlarının oluşturulması, araştırmacılar için uzun süredir odaklanmış bir konudur. Bu animasyonların potansiyeli ve uygulamaları, dijital medya ve sanal gerçeklikten oyunlara kadar uzanmaktadır. Ancak, yıllar süren araştırmalara rağmen, zamanla tutarlı ve görsel olarak çekici yüksek kaliteli animasyonlar oluşturmak hala önemli bir zorluk teşkil etmektedir. Geliştiriciler için, görsel olarak etkileyici bir etki yaratmak için dudak hareketleri, baş pozisyonları ve yüz ifadelerinin karmaşık koordinasyonuna ihtiyaç duyulması, önemli bir engel oluşturmaktadır. Mevcut yöntemler, bu zorlukları aşmada başarısız olmuştur, çünkü většina них yalnızca sınırlı kapasiteli generatörler gibi NeRF, motion tabanlı decoders ve GAN kullanmaktadır. Bu ağlar, sınırlı genellemeye sahip olup, yüksek kaliteli içerik oluşturmakta kararlı değildir. Ancak, difüzyon modellerinin yakın zamanda ortaya çıkması, yüksek kaliteli görsellerin oluşturulmasını kolaylaştırmıştır ve bazı çerçeveler, difüzyon modelleri ile temporal modüllerin birleştirilmesiyle, etkileyici videolar oluşturulmasını sağlamıştır.

Difüzyon modellerinin ilerlemelerine dayanarak, AniPortrait çerçevesi, bir referans görüntüsünden ve bir ses örneğinden yüksek kaliteli animasyonlar oluşturmayı amaçlamaktadır. AniPortrait çerçevesinin çalışması iki aşamaya bölünmüştür. İlk aşamada, AniPortrait çerçevesi, transformer tabanlı modelleri kullanarak, ses girişinden 3D yüz mesh ve baş pozisyonu çıkarır ve bunları 2D yüz özellikleri dizisine projects. İlk aşama, AniPortrait çerçevesinin, seslerden dudak hareketleri ve yüz ifadelerini çıkarmasını ve baş hareketlerini ses ritmine senkronize etmesini sağlar. İkinci aşama, AniPortrait çerçevesi, bir difüzyon modeli ile bir motion modülünü birleştirerek, yüz özelliği dizisini fotoğrafçı ve zamanla tutarlı animasyonlara dönüştürür. Daha具体 olarak, AniPortrait çerçevesi, AnimateAnyone modelinin ağından esinlenen bir yapıya sahiptir ve Stable Diffusion 1.5 adlı bir difüzyon modelini kullanır. Bu model, referans görüntüsünden ve vücut hareketi dizisinden gerçekçi ve akıcı animasyonlar oluşturmak için kullanılır. AniPortrait çerçevesi, PoseGuider modülünü yeniden tasarlayarak, hem hafif bir tasarım sunar hem de dudak hareketlerinin oluşturulmasında daha yüksek bir doğruluk sağlar.

Deneysel sonuçlar, AniPortrait çerçevesinin, yüksek kaliteli animasyonlar oluşturma yeteneğini ve görsel kalite, yüz doğallığı ve poz çeşitliliği açısından üstünlüğünü göstermektedir. AniPortrait çerçevesi, 3D yüz temsilcilerinden ara özellikler olarak yararlanarak, bu temsilcileri gerektiği şekilde değiştirebilme esnekliğine sahiptir. Bu esneklik, AniPortrait çerçevesinin, yüz yeniden canlandırma ve yüz hareket düzenleme gibi alanlarda uygulanabilirliğini artırmaktadır.

AniPortrait: Çalışma ve Metodoloji

Önerilen AniPortrait çerçevesi, iki modülden oluşmaktadır: Audio2Lmk ve Lmk2Video. Audio2Lmk modülü, ses girişinden dudak hareketleri ve yüz ifadelerini çıkarmaya çalışır, जबकi Lmk2Video modülü, yüz özelliği dizisini zamanla tutarlı ve fotoğrafçı animasyonlara dönüştürür. Aşağıdaki şekil, AniPortrait çerçevesinin çalışmasını gösterir. AniPortrait çerçevesi, ilk olarak ses girişinden 3D yüz mesh ve baş pozisyonu çıkarır ve bunları 2D yüz özellikleri dizisine projects. İkinci aşamada, çerçeve, bir difüzyon modeli ile bir motion modülünü birleştirerek, yüz özelliği dizisini fotoğrafçı animasyonlara dönüştürür.

Audio2Lmk

Verilen bir ses parçacıkları dizisi için, AniPortrait çerçevesinin primary amacı, karşılık gelen 3D yüz mesh dizisini vektör représentasyonları ile birlikte çıkarmaktır. AniPortrait çerçevesi, pre-öğrenilmiş wav2vec yöntemini kullanarak ses özelliklerini çıkarır ve bu model, yüksek bir genellemeye sahip olup, sesin tonunu ve telaffuzunu doğru bir şekilde tanıyabilmektedir. Bu, gerçekçi yüz animasyonları oluşturmak için önemlidir. Ses özelliklerini çıkardıktan sonra, AniPortrait çerçevesi, basit bir mimari kullanarak, bu özellikleri 3D yüz meshlerine dönüştürür. AniPortrait çerçevesi, bu basit tasarımın, hem çıkarım sürecini hızlandırabileceğini hem de doğruluğu artırabileceğini gözlemlemiştir. Sesden poza dönüştürürken, AniPortrait çerçevesi, aynı wav2vec ağını kullanır, ancak ağırlıkları paylaşmaz. Bu, sesin tonu ve ritminin, mesh ve poza dönüştürme işlemlerinde farklı bir vurguya sahip olmasından kaynaklanmaktadır. AniPortrait çerçevesi, önceki durumların etkisini hesaba katmak için, bir transformer decoder kullanır ve ses özelliklerini decoder’a cross-attention mekanizmaları ile entegre eder. Her iki modül için, AniPortrait çerçevesi, L1 kaybını kullanarak eğitime tabi tutar. Poz ve mesh dizisini elde ettikten sonra, AniPortrait çerçevesi, perspektif projeksiyonu kullanarak, bu dizileri 2D yüz özelliği dizisine dönüştürür.

Lmk2Video

Verilen bir referans portre görüntüsünden ve bir yüz özelliği dizisinden, Lmk2Video modülü, zamanla tutarlı bir portre animasyonu oluşturur. Bu animasyon, yüz özelliği dizisiyle senkronize edilir ve referans görüntüsünün görünümünü korur. AniPortrait çerçevesi, Lmk2Video modülünün ağını, AnimateAnyone çerçevesinden esinlenerek tasarlar. AniPortrait çerçevesi, Stable Diffusion 1.5 adlı bir difüzyon modelini kullanır ve bir temporal motion modülü entegre eder. Bu, çoklu çerçeve gürültü girişlerini video çerçeve dizisine dönüştürebilir. Aynı zamanda, ReferencenNet adlı bir ağ bileşeni, Stable Diffusion 1.5’ın mimarisini taklit eder ve referans görüntüsünden görünüm bilgilerini çıkararak, bunu difüzyon modeline entegre eder. Bu, yüz kimliğinin animasyon boyunca tutarlı kalmasını sağlar. AniPortrait çerçevesi, PoseGuider modülünü, AnimateAnyone çerçevesinin orijinal tasarımından farklı olarak, daha karmaşık bir şekilde tasarlar. Orijinal tasarım, yalnızca birkaç convolutional katmana sahiptir ve yüz özelliği, latents ile birleştirilir. AniPortrait çerçevesi, bu tasarımın, dudak hareketlerini tam olarak yakalayamadığını gözlemlemiştir. Bunu çözmek için, AniPortrait çerçevesi, ConvNet mimarisinin çok ölçekli stratejisini benimser ve yüz özelliği, farklı ölçeklerdeki landmarkları, difüzyon modelinin farklı bloklarına entegre eder. Ayrıca, AniPortrait çerçevesi, referans görüntüsünün landmarklarını, ek bir girdi olarak dahil eder. PoseGuider bileşeninin cross-attention modülü, hedef landmarklar ile referans landmarkları arasındaki ilişkiyi öğrenir. Bu, ağı, görünüm ve yüz landmarkları arasındaki korelasyonu daha iyi anlamasına yardımcı olur ve daha doğru yüz animasyonları oluşturulmasını sağlar.

AniPortrait: Uygulama ve Sonuç

Audio2Lmk aşaması için, AniPortrait çerçevesi, wav2vec2.0 bileşenini kullanır ve MediaPipe mimarisini, 3D mesh ve 6D pozları çıkarmak için kullanır. Model, Audio2Mesh bileşeni için eğitim verilerini, tek bir konuşmacının yaklaşık 60 dakika süren yüksek kaliteli konuşma verisinden alır. 3D meshin kararlı olmasını sağlamak için, seslendirme sanatçısı, kayıt sırasında kameraya doğru yüzünü döndürmesi ve baş pozisyonunu sabit tutması istenir. Lmk2Video modülü için, AniPortrait çerçevesi, iki aşamalı bir eğitim yaklaşımı benimser. İlk aşamada, ReferenceNet ve PoseGuider bileşenlerini, motion modülünü dışarıda bırakarak eğitir. İkinci aşamada, diğer tüm bileşenleri dondurur ve yalnızca motion modülünü eğitir. Bu aşamada, AniPortrait çerçevesi, iki büyük ölçekli yüksek kaliteli yüz video verisi kullanır ve MediaPipe bileşenini, 2D yüz landmarklarını çıkarmak için kullanır. Ayrıca, AniPortrait çerçevesi, ağın dudak hareketlerine duyarlılığını artırmak için, 2D landmarklardan oluşturulan poz resminde, üst ve alt dudakları farklı renklerde gösterir.

Aşağıdaki resim, AniPortrait çerçevesinin, yüksek kaliteli animasyonlar oluşturabildiğini göstermektedir.

AniPortrait çerçevesi, ara 3D temsilciler kullanarak, çıktıyı gerektiği şekilde değiştirebilme esnekliğine sahiptir. Örneğin, kullanıcılar, belirli bir kaynakdan landmarkları çıkarabilir ve kimliğini değiştirebilir, böylece AniPortrait çerçevesi, yüz yeniden canlandırma efektini oluşturabilir.

Son Düşünceler

Bu makalede, AniPortrait adlı bir çerçeveden bahsettik. Bu çerçeve, bir referans portre görüntüsünden ve bir ses örneğinden yüksek kaliteli animasyonlar oluşturmak için tasarlanmıştır. AniPortrait çerçevesi, ses girişinden ara 3D temsilciler çıkarır ve bunları 2D yüz özellikleri dizisine projects. Daha sonra, bir difüzyon modeli ile bir motion modülünü birleştirerek, yüz özelliği dizisini fotoğrafçı ve zamanla tutarlı animasyonlara dönüştürür. Deneysel sonuçlar, AniPortrait çerçevesinin, yüksek kaliteli animasyonlar oluşturma yeteneğini ve görsel kalite, yüz doğallığı ve poz çeşitliliği açısından üstünlüğünü göstermektedir. Ayrıca, AniPortrait çerçevesi, kontrol edilebilirlik ve esneklik açısından önemli bir potansiyele sahiptir ve yüz yeniden canlandırma, yüz hareket düzenleme ve daha birçok alanda etkili bir şekilde uygulanabilir.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.