Anderson’un Açısı
Google’ın LipSync3D’si Geliştirilmiş ‘Derin Sahte’ Dudak Hareketi Senkronizasyonu Sunuyor

Google AI araştırmacıları ve Hindistan Teknoloji Enstitüsü Kharagpur arasındaki bir işbirliği, ses içeriğinden konuşan başları sentezlemek için yeni bir çerçeve sunuyor. Proje, sesle senkronize edilmiş dudak hareketleri için optimize edilmiş ve makul kaynaklara sahip bir şekilde video içeriği oluşturmayı amaçlıyor. Bu, avatarda, etkileşimli uygulamalarda ve diğer gerçek zamanlı ortamlarda kullanılmak üzere ses veya makine çevirisi için konuşan başlıklar oluşturmak içindir.

Kaynak: https://www.youtube.com/watch?v=L1StbX9OznY
Sürecin sonunda eğitilen makine öğrenimi modelleri – LipSync3D olarak adlandırılır – yalnızca hedef yüz kimliği için tek bir video girişi gerektirir. Veri hazırlama pipeline’si, yüz geometrisinin aydınlatma ve diğer yönlerden ayrılmasını sağlar, bu da daha ekonomik ve odaklanmış bir eğitim sağlar.

LipSync3D’in iki aşamalı iş akışı. Üstte, ‘hedef’ sesinden dinamik olarak metinlendirilmiş 3B yüz oluşturulması; altta, oluşturulan mesh’in hedef videoya eklenmesi.
Aslında, LipSync3D’nin bu alanda yapılan araştırma çalışmalarına en önemli katkısı, aydınlatma normalize etme algoritması olabilir, bu da eğitim ve çıkarım aydınlatmasını ayırır.

Aydınlatma verilerini genel geometriden ayırarak, LipSync3D daha gerçekçi dudak hareketi çıkışını zorlu koşullarda üretir. Son yıllardaki diğer yaklaşımlar, kapasitelerini bu konuda göstermeyen ‘sabit’ aydınlatma koşulları ile sınırlı themselves.
Giriş veri çerçevelerinin ön işleminde, sistem, bu noktaların aydınlatma koşullarına özgü olduğunu ve bu nedenle process’i engelleyeceğini tespit etmek ve bunları kaldırmak zorundadır.

LipSync3D, adından da anlaşılacağı gibi, yalnızca yüzlerdeki piksel analizi yapmaz, aynı zamanda aktif olarak tanımlanan yüz özellikleri kullanarak motil CGI-stil mesh’ler ve bu mesh’lerin etrafına sarılan ‘açık’ tekstürleri üretir.

LipSync3D’de poz normalize etme. Solda, giriş çerçeveleri ve tespit edilen özellikler; ortada, oluşturulan mesh’in normalize edilmiş köşeleri; ve sağda, tekstür atlası, ki bu, tekstür tahmini için temel gerçeği sağlar. Source: https://arxiv.org/pdf/2106.04185.pdf
Araştırmacılara göre, LipSync3D, önceki çalışmalara üç temel yenilik getiriyor: geometri, aydınlatma, poz ve tekstürü normalize edilmiş bir uzayda ayrı veri akışlarına ayırma; zamanla tutarlı video sentezi üreten kolayca eğitilebilen bir oto-regresif tekstür tahmin modeli; ve insan değerlendirmeleri ve nesnel ölçütler tarafından değerlendirilen artan gerçeklik.

Video yüz görüntüsünün çeşitli yönlerini ayırarak, video sentezinde daha fazla kontrol sağlar.
LipSync3D, ses içerisindeki fonemleri ve konuşmanın diğer yönlerini analiz ederek, bunları ağız çevresindeki kas pozlarına çevirerek, sesden uygun dudak geometrisi hareketini doğrudan çıkarabilir.

Bu işlem, joint-prediction pipeline’da gerçekleşir, burada çıkarılan geometri ve tekstür, oto-encoder kurulumunda ayrı kodlayıcılar sahiptir, ancak sesle birlikte kullanılacak konuşmanın ses kodlayıcısını paylaşır:
LipSync3D’nin labile hareket sentezi, aynı zamanda stilize CGI avatara güç sağlamak amacıyla tasarlanmıştır, bu da aslında gerçek dünya görüntülerinin aynı mesh ve tekstür bilgileridir:

Bir stilize 3B avatar, gerçek zamanlı olarak bir kaynak konuşmacı videosunun dudak hareketlerini kullanır. Bu senaryoda, en iyi sonuçlar, kişiselleştirilmiş ön eğitim ile elde edilir.
Araştırmacılar, biraz daha gerçekçi bir hissi veren avatarların da kullanılmasını öngörüyor:
![]()
Örnek eğitim süreleri, 2-5 dakika uzunluğundaki bir video için 3-5 saat arasında değişir, bu işlem TensorFlow, Python ve C++ kullanarak bir GeForce GTX 1080’da gerçekleştirilir. Eğitim oturumları, her biri bir video değerlendirmesini temsil eden 500-1000 epoch için 128 çerçeve toplu işlemini kullanır.
Dudak Hareketinin Dinamik Senkronizasyonu Doğru
Dudakları yeni bir ses parçasına uyumlu hale getirmek için gereken alan, son birkaç yılda bilgisayar görme araştırmalarında önemli bir ilgi gördü (aşağıya bakınız), özellikle de tartışmalı derin sahte teknolojinin bir yan ürünü olarak.
2017’de Washington Üniversitesi, sesden dudak senkronizasyonunu öğrenme yeteneğine sahip araştırmayı sundu, bu da o zamanların başkanı Obama’nın dudak hareketlerini değiştirmek için kullanıldı. 2018’de; Max Planck Enformatik Enstitüsü, kimlik>kimlik video aktarımını mümkün kılan başka bir araştırma girişimini yönetti, burada dudak senkronizasyonu sürecin bir yan ürünü idi; ve Mayıs 2021’de AI şirketi FlawlessAI, geniş olarak kabul gören TrueSync adlı özel dudak senkronizasyon teknolojisini açıkladı, bu teknoloji, diller arasında büyük film sürümleri için geliştirilmiş dublaj teknolojileri sağlayan bir araç olarak görüldü.
Elbette, derin sahte açık kaynak depolarının geliştirilmesi, bu yüz görüntü sentezi alanındaki aktif kullanıcı katkılarından oluşan başka bir araştırma kolunu sunuyor.
nc teknoloji TrueSync, basın tarafından geniş olarak kabul gören, büyük film sürümleri için diller arasında geliştirilmiş dublaj teknolojileri sağlayan bir araç olarak görülüyor. Ve elbette, derin sahte açık kaynak depolarının geliştirilmesi, bu yüz görüntü sentezi alanındaki aktif kullanıcı katkılarından oluşan başka bir araştırma kolunu sunuyor.











