Anderson’un Açısı
Gerçek Videolara AI ile Diyalog Eklenmesi

Yeni bir AI çerçevesi, yeniden çekim yapmadan, tek bir uçtan uca sistemde bir kişinin sözlerini yeniden yazabilir, silebilir veya ekleyebilir.
Üç yıl önce, internet herhangi bir 20-30 AI video değiştirme çerçevesi tarafından şaşırtılacaktı; ancak bu popüler araştırma dalı artık neredeyse başka bir ‘AI Slop’ dalı oluşturacak kadar üretken hale geldi ve ben bu tür yayınların çoğunu iki veya üç yıl önce olduğu gibi kapsamamaktayım.
Her ne kadar, bu dizi içerisinde bir yayın dikkatimi çekti: gerçek video kliplerine müdahale edebilen ve mevcut videoya (yüz veya çerçevenin tamamını oluşturmak yerine) yeni konuşma ekleyebilen entegre bir sistem.
Aşağıdaki örneklerde, yayınlanan çeşitli örnek videoları birleştirdim ve önce gerçek kaynak klibi, ardından konuşma sentezi ve dudak senkronizasyonu ile birlikte klibin ortasına yerleştirilen AI konuşmasını gördüğümüzü görüyoruz:
Çalmağa tıklayınız. Yerel düzenleme ile dikme – FacEDiT tarafından sunulan birkaç modalityden biri. Daha iyi çözünürlük için lütfen kaynak sitesine başvurunuz. Kaynak – https://facedit.github.io/
Bu yaklaşım, ‘yerel düzenleme ile dikme’ olarak adlandırılan üç geliştirilen yöntemden biridir ve yazarlar (benim de dahil olmak üzere) tarafından en çok ilgi gören yöntemdir. Temel olarak, klibin bir orta çerçevesi, yeni AI yorumu için bir başlangıç noktası olarak kullanılır ve sonraki (gerçek) çerçevesi, oluşturulan klibin hedefi olarak kullanılır. Yukarıdaki kliplerde, bu ‘tohum’ ve ‘hedef’ çerçeveleri, üst видеonun dururken, değiştirilen video altta generatif doldurmayı sağlar.
Yazarlar, bu yüz ve vokal sentez yaklaşımını, bu tür AI video düzenleme için ilk olarak entegre edilmiş uçtan uca bir yöntem olarak çerçevelemektedir ve böyle bir çerçevenin TV ve film üretimi için potansiyelini gözlemlemektedir:
‘Film yapımcıları ve medya üreticileri, kaydedilen videoların belirli kısımlarını değiştirmek zorunda kalabilirler – belki bir kelime yanlış söylendi veya senaryo çekimden sonra değişti. Örneğin, Titanic (1997) filminin ikonik sahnesinde Rose, “I’ll never let go, Jack,” derken, yönetmen daha sonra “I’ll never forget you, Jack” demesi gerektiğini kararlaştırabilir.
‘Geleneksel olarak, bu tür değişiklikler, tüm sahnenin yeniden çekilmesini gerektirir, bu da maliyetli ve zaman alıcıdır. Konuşan yüz sentezi, yüz hareketini değiştirerek konuşmayı otomatik olarak değiştiren bir pratik alternatif sunar, yeniden çekme ihtiyacını ortadan kaldırır.’
Bu tür AI müdahaleleri, kültürel veya endüstriyel direnişle karşılaşabilir, ancak insan liderliğindeki VFX sistemleri ve araç setlerinde yeni bir tür işlevsellik oluşturabilir. Her durumda, şimdilik, zorluklar salt teknik düzeydedir.
Bunun yanı sıra, yeni sistem mevcut konuşmayı da değiştirebilir:
Çalmağa tıklayınız. Mevcut diyalogu değiştirmek yerine, yeni diyalog eklemek için bir örnek. Daha iyi çözünürlük için lütfen kaynak sitesine başvurunuz.
Çağın Getirdiği
Şu anda, bu tür sentez yeteneği sunan uçtan uca sistemler mevcut değildir; ancak Google’ın Veo serisi gibi bir dizi generatif AI platformu, ses oluşturabilir ve çeşitli diğer çerçeveler derin sahte ses oluşturabilir, ancak şu anda gerçek görüntüye müdahale etmek için yeni sistem – FacEDiT – gibi bir dizi çeşitli mimari ve hileler.pipeline oluşturmak zorunda kalırsınız.
Sistem, Diffusion Transformers (DiT) ile birlikte Flow Matching kullanır ve konuşma sesi içeriği ile çevrili (bağlamsal) hareketlere koşullu yüz hareketleri oluşturur. Sistem, LivePortrait (Kling tarafından最近 alınan) gibi yüz yeniden inşa paketlerini kullanır.
Bu yönteme ek olarak, yaklaşımının ilk olarak bu zorlukları tek bir çözüme entegre ettiği için, yazarlar FacEDiTBench adlı yeni bir benchmark ve bu görev için uygun birkaç yeni değerlendirme ölçütü oluşturdular.
Yeni çalışma FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling olarak adlandırılmıştır ve Kore’nin Pohang Bilim ve Teknoloji Üniversitesi (POSTECH), Kore İleri Bilim ve Teknoloji Enstitüsü (KAIST) ve Texas Üniversitesi’nden (Austin) dört araştırmacı tarafından yapılmıştır.
Yöntem
FacEDiT, yüz hareketini yeniden inşa ederek, aktörün orijinal performansındaki eksik kısımları doldurmayı öğrenmek için eğitilir ve bu süreç, modelin eğitim sırasında bir boşluk doldurucu olarak hareket etmesini sağlar, sesle eşleşen yüz hareketlerini öngörür ve orijinal video ile tutarlı kalır:

FacEDiT sisteminin概要, yüz hareketinin kendiliğinden denetimli doldurulması yoluyla eğitimi, konuşma tarafından yönlendirilen çıkarım ve nihayet orijinal görüntüden görünümü yeniden kullanarak ancak yalnızca hedeflenen hareketi değiştirerek videoya dönüştürülmesi. Kaynak
Çıkarım zamanında, aynı mimari iki farklı çıktı destekler, video maskedir: kısmi düzenleme, yalnızca bir cümle değiştirilir ve geri kalanı dokunulmaz; veya tam cümle oluşturma, yeni hareket tamamen sıfırdan sentezlenir.
Model, akış eşleştirmesi yoluyla eğitilir, video düzenleme, yüz hareketleri arasındaki bir yol olarak ele alınır.
Model, yüz hareketini, yüz ifadesi ve baş pozisyonunu tanımlayan bir dizi kompakt sayı olarak temsil eder, böylece konuşma değişiklikleri, kişinin genel görünümünü etkilemeden lokalize edilebilir.
Bu hareket vektörleri, kimliği karıştırmeden ifadeleri ve baş pozisyonunu tanımlamak üzere tasarlanmıştır, böylece konuşma değişiklikleri, kişinin genel görünümünü etkilemeden lokalize edilebilir.
FacEDiT Eğitimi
FacEDiT’yi eğitmek için, her video klibi bir dizi yüz hareketi anına bölündü ve her kare, karşılık gelen ses parçasıyla eşleştirildi. Hareket verilerinin rastgele kısımları gizlendi ve model, konuşma ve çevresi hareketsizlik için bağlam kullanarak eksik hareketlerin nasıl görünmesi gerektiğini tahmin etmesi istendi.
Maskeli aralıklar ve konumları, bir eğitim örneğinden diğerine değiştiğinden, model hem küçük iç düzenleme hem de tam dizi oluşturma için逐渐 olarak öğrenir, verilen bilgilere bağlı olarak.
Sistemdeki Diffusion Transformer, gürültülü girişleri zaman içinde iyileştirerek masked hareketi geri kazanmayı öğrenir. Konuşma ve hareket, modelin aynı anda değil, her bir işleme bloğuna çapraz dikkat yoluyla işlenir, böylece sistem dudak hareketlerini ses konuşmasına daha doğru bir şekilde eşleştirebilir.
Gerçekliği korumak için, dikkat komşu çerçevelere değil, tüm zaman çizelgesine yönlendirilir, böylece model yerel sürekliliği ve bağlamı korumak için zorlanır ve düzenlenmiş bölgelerin kenarlarında titreme veya hareket atlamaları önlenir. Konum gömme (her karenin dizideki konumunu modeli bilgilendiren), modelin doğal zaman akışını ve bağlamını korumaya da yardımcı olur.
Eğitim sırasında, sistem konuşma ve yakındaki hareketsizlik için bağlam kullanarak masked yüz hareketlerini tahmin ederek eksik yüz hareketlerini tahmin eder. Çıkarım zamanında, aynı kurulum, ancak artık konuşmadaki değişikliklere göre yönlendirilir.
Bir kelime veya cümle eklendiğinde, silindiğinde veya değiştirildiğinde, sistem etkilenen bölgeyi bulur, maskeler ve yeni sesle eşleşen hareketi yeniden oluşturur. Tam dizi oluşturma, tüm bölgenin maskedir ve sıfırdan sentezlendiği özel bir durum olarak ele alınır.
Veri ve Testler
Sistemin omurgası, Diffusion Transformer için 22 katman, her biri 16 dikkat başı ve besleme ileri boyutları 1024 ve 2024px’dir. Hareket ve görünüm özellikleri, dondurulmuş LivePortrait bileşenleri kullanılarak çıkarılır ve konuşma WavLM ve VoiceCraft kullanılarak kodlanır.
Özel bir proje katmanı, 786 boyutlu konuşma özelliklerini DiT’nin latent uzayına haritalar, yalnızca DiT ve proje modülleri sıfırdan eğitilir.
Eğitim, AdamW optimizatörü altında, hedef öğrenme oranı 1e-4’te, bir milyon adımda, her biri 48GB VRAM ile iki A6000 GPU’da, toplam toplu işleme boyutu sekizde gerçekleştirildi.
FacEDiTBench
FacEDiTBench veri kümesi, her biri orijinal ve düzenlenmiş konuşma ile birlikte 250 örnek içerir ve her bir video klibi için transkriptleri içerir. Videolar üç kaynaktan gelir, HDTF‘den 100 klib, Hallo3‘ten 100 klib ve CelebV-Dub‘den 50 klib içerir. Her bir örnek, hem ses hem de videoyun yeterli netlikte olduğu için değerlendirme için el ile kontrol edilmiştir.
GPT-4o her bir transkripti düzenlemek için kullanıldı ve VoiceCraft, yeni ses oluşturmak için kullanıldı; ve her aşamada, hem transkript hem de oluşturulan konuşma kalite için el ile gözden geçirildi.
Her bir örnek, düzenleme türü, değişikliğin zamanı ve değiştirilen spanın uzunluğu ile etiketlendi ve düzenlemeler eklemeler, silinmeler veya değişiklikler olarak sınıflandırıldı. Değiştirilen kelime sayısı, kısa düzenlemelerden (1-3 kelime) orta düzenlemelere (4-6 kelime) ve daha uzun düzenlemelere (7-10 kelime) kadar değişti.
Üç özel ölçüt, düzenleme kalitesini değerlendirmek için tanımlandı. Fotometrik süreklilik, düzenlenmiş segmentin surrounding video ile nasıl birleştiğini ölçen bir ölçüt; hareket sürekliliği, düzenlenmiş ve düzenlenmemiş çerçeveler arasındaki optik akış değişikliklerini ölçen bir ölçüt; ve kimlik korunması, konu’nun görünümünün düzenleme sonrasında tutarlı kalıp kalmadığını tahmin eden bir ölçüt, orijinal ve oluşturulan diziler arasındaki yüz gömmelerini ArcFace yüz tanıma modeli kullanarak karşılaştırarak.
Testler
Test modeli, yaklaşık 200 saatlik video içeriğinden oluşan üç veri kümesinden oluşan malzemeden eğitildi, vloglar ve filmler ile birlikte yüksek çözünürlüklü YouTube videoları.
Test modeli, HDTF test bölünmesiyle birlikte, bu görevler seti için bir standart test olarak kabul edilen FacEDiTBench kullanıldı.
Doğrudan karşılaştırılabilir sistemlerin bulunmaması nedeniyle, yazarlar bu tür işlevselliğin en az bir kısmını yeniden üretebilen çeşitli çerçeveleri seçti ve bunları temel olarak aldı; özellikle KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; ve SadTalker.
Kurulmuş beberapa ölçütler de kullanıldı, lip-sync doğruluğunu SyncNet ile değerlendirerek, hem mutlak hata (LSE-D) hem de güven skoru (LSE-C) raporlandı; Fréchet Video Distance (FVD), videoyun gerçekçi görünümünü niceliklendirerek; ve Öğrenilmiş Algısal Benzerlik Ölçütleri (LPIPS), oluşturulan ve orijinal çerçeveler arasındaki algısal benzerliği ölçerek.
Düzenleme için, LPIPS hariç tüm ölçütler, yalnızca değiştirilen segmente uygulandı; oluşturma için, tüm video değerlendirildi ve sınır sürekliliği hariç tutuldu.
Her model, orijinal klibe eklenen bir video segmenti sentezlemeye zorlandı (araştırmacılar, bu yöntemin sık sık düzenlenmiş bölümün surrounding footage ile birleştiği yerlerde görünür kesintiler oluşturduğunu belirtiyorlar). Bir başka yaklaşım da test edildi, burada tüm video, değiştirilen sesden yeniden oluşturuldu – ancak bu, düzenlenmemiş bölgeleri silindi ve orijinal performansı koruma altına almadı:

Sistemlerin düzenleme performansının karşılaştırması, FacEDiT’nin her ölçütte tüm temel sistemleri geride bırakması, daha düşük lip-sync hatası (LSE-D), daha yüksek senkronizasyon güveni (LSE-C), daha güçlü kimlik korunması (IDSIM), daha gerçekçi video (FVD) ve düzenleme sınırlarında daha pürüzsüz geçişler (Pcontinuity, Mcontinuity) sağlaması.
Yazarlar, bu sonuçlar hakkında şunları belirtiyorlar:
‘[Modelimiz] mevcut yöntemleri düzenleme görevinde önemli ölçüde geride bırakıyor. Güçlü sınır sürekliliği ve yüksek kimlik korunması sağlıyor, böylece zaman ve görsel tutarlılığı koruma yeteneğini gösteriyor. Ayrıca, superior lip-sync doğruluğu ve düşük FVD, sentezlenen videonun gerçekçiğini yansıtıyor.’
Çalmağa tıklayınız. Yayınlanan videolardan derlenen sonuçlar. Daha iyi çözünürlük için lütfen kaynak sitesine başvurunuz.
Daha da önemlisi, düzenleme ve oluşturma kalitesini değerlendirmek için bir insan çalışması yapıldı.
Her bir karşılaştırma için, katılımcılar altı video izledi ve genel kaliteye göre sıraladı, lip-sync doğruluğunu, doğal hareketliliği ve gerçekçiliği dikkate alarak; düzenleme denemelerinde, katılımcılar ayrıca düzenlenmiş ve düzenlenmemiş segmentler arasındaki geçişlerin pürüzsüzlüğünü değerlendirdi:

İnsan değerlendiricileri tarafından atanan ortalama sıralamalar, daha düşük daha iyidir. Hem düzenleme hem de oluşturma için, katılımcılar her videonun doğal ve senkronize görünümünü değerlendirdi. Düzenleme için, ayrıca düzenlenmiş ve düzenlenmemiş konuşma arasındaki geçişin pürüzsüzlüğünü değerlendirdi.
Çalışmada, FacEDiT her iki düzenleme ve oluşturma için de açık bir üstünlükle en yüksek sıralamayı aldı, ayrıca geçişlerin pürüzsüzlüğü için güçlü puanlar aldı, ölçülen avantajlarının algısal olarak tercih edilen çıktılara dönüştüğünü gösteriyor.
Ablasyon çalışmaları ve ek testler hakkında daha fazla ayrıntı için okuyucuyu kaynak makaleye yönlendirmekteyiz. Aslında, bu tür prototip araştırma teklifleri, anlamlı test sonuçları bölümlerini üretmekte zorluklarla karşılaşır, çünkü temel teklif itself, potansiyel olarak sonraki çalışmalar için bir temel teşkil eder.
Sonuç
Bunun gibi sistemler, çıkarım zamanında önemli hesaplama kaynakları gerektirebilir, bu da VFX dükkânları gibi aşağı akış kullanıcılarının işi kendi yerlerinde tutmasını zorlaştırır, bu nedenle gerçekçi yerel kaynaklara uyumlu yaklaşımlar her zaman tercih edilecektir.
Bu, yeni teklifin eleştirisi değildir, bu, belki de nicelendirilmiş ağırlıklar veya diğer optimizasyonlar altında mükemmel bir şekilde çalışabilir ve bu tür araştırmaların bu yoluna beni uzun süredir geri getiren ilk teklif.
İlk olarak Çarşamba, Aralık 17, 202. 20.10 EET, aynı gün, ilk gövde paragrafında ekstra boşluk için düzenlendi.












