Anderson’un AÃ§ÄąsÄą

Gerçek Videolara AI ile Diyalog Eklenmesi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Yeni bir AI çerçevesi, yeniden çekim yapmadan, tek bir uçtan uca sistemde bir kişinin sÃķzlerini yeniden yazabilir, silebilir veya ekleyebilir.

 

Üç yÄąl Ãķnce, internet herhangi bir 20-30 AI video değiştirme çerçevesi tarafÄąndan şaÅŸÄąrtÄąlacaktÄą; ancak bu popÞler araştÄąrma dalÄą artÄąk neredeyse başka bir ‘AI Slop’ dalÄą oluşturacak kadar Þretken hale geldi ve ben bu tÞr yayÄąnlarÄąn çoğunu iki veya Þç yÄąl Ãķnce olduğu gibi kapsamamaktayÄąm.

Her ne kadar, bu dizi içerisinde bir yayÄąn dikkatimi çekti: gerçek video kliplerine mÞdahale edebilen ve mevcut videoya (yÞz veya çerçevenin tamamÄąnÄą oluşturmak yerine) yeni konuşma ekleyebilen entegre bir sistem.

Aşağıdaki Ãķrneklerde, yayÄąnlanan çeşitli Ãķrnek videolarÄą birleştirdim ve Ãķnce gerçek kaynak klibi, ardÄąndan konuşma sentezi ve dudak senkronizasyonu ile birlikte klibin ortasÄąna yerleştirilen AI konuşmasÄąnÄą gÃķrdÞğÞmÞzÞ gÃķrÞyoruz:

Çalmağa tÄąklayÄąnÄąz. Yerel dÞzenleme ile dikme – FacEDiT tarafÄąndan sunulan birkaç modalityden biri. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine başvurunuz. Kaynak – https://facedit.github.io/

Bu yaklaÅŸÄąm, ‘yerel dÞzenleme ile dikme’ olarak adlandÄąrÄąlan Þç geliştirilen yÃķntemden biridir ve yazarlar (benim de dahil olmak Þzere) tarafÄąndan en çok ilgi gÃķren yÃķntemdir. Temel olarak, klibin bir orta çerçevesi, yeni AI yorumu için bir başlangÄąÃ§ noktasÄą olarak kullanÄąlÄąr ve sonraki (gerçek) çerçevesi, oluşturulan klibin hedefi olarak kullanÄąlÄąr. YukarÄądaki kliplerde, bu ‘tohum’ ve ‘hedef’ çerçeveleri, Þst ÐēÐļÐīÐĩonun dururken, değiştirilen video altta generatif doldurmayÄą sağlar.

Yazarlar, bu yÞz ve vokal sentez yaklaÅŸÄąmÄąnÄą, bu tÞr AI video dÞzenleme için ilk olarak entegre edilmiş uçtan uca bir yÃķntem olarak çerçevelemektedir ve bÃķyle bir çerçevenin TV ve film Þretimi için potansiyelini gÃķzlemlemektedir:

‘Film yapÄąmcÄąlarÄą ve medya Þreticileri, kaydedilen videolarÄąn belirli kÄąsÄąmlarÄąnÄą değiştirmek zorunda kalabilirler – belki bir kelime yanlÄąÅŸ sÃķylendi veya senaryo çekimden sonra değişti. Örneğin, Titanic (1997) filminin ikonik sahnesinde Rose, “I’ll never let go, Jack,” derken, yÃķnetmen daha sonra “I’ll never forget you, Jack” demesi gerektiğini kararlaştÄąrabilir.

‘Geleneksel olarak, bu tÞr değişiklikler, tÞm sahnenin yeniden çekilmesini gerektirir, bu da maliyetli ve zaman alÄącÄądÄąr. Konuşan yÞz sentezi, yÞz hareketini değiştirerek konuşmayÄą otomatik olarak değiştiren bir pratik alternatif sunar, yeniden çekme ihtiyacÄąnÄą ortadan kaldÄąrÄąr.’

Bu tÞr AI mÞdahaleleri, kÞltÞrel veya endÞstriyel direnişle karÅŸÄąlaşabilir, ancak insan liderliğindeki VFX sistemleri ve araç setlerinde yeni bir tÞr işlevsellik oluşturabilir. Her durumda, şimdilik, zorluklar salt teknik dÞzeydedir.

Bunun yanÄą sÄąra, yeni sistem mevcut konuşmayÄą da değiştirebilir:

Çalmağa tÄąklayÄąnÄąz. Mevcut diyalogu değiştirmek yerine, yeni diyalog eklemek için bir Ãķrnek. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine başvurunuz.

Çağın Getirdiği

Şu anda, bu tÞr sentez yeteneği sunan uçtan uca sistemler mevcut değildir; ancak Google’ın Veo serisi gibi bir dizi generatif AI platformu, ses oluşturabilir ve çeşitli diğer çerçeveler derin sahte ses oluşturabilir, ancak şu anda gerçek gÃķrÞntÞye mÞdahale etmek için yeni sistem – FacEDiT – gibi bir dizi çeşitli mimari ve hileler.pipeline oluşturmak zorunda kalÄąrsÄąnÄąz.

Sistem, Diffusion Transformers (DiT) ile birlikte Flow Matching kullanÄąr ve konuşma sesi içeriği ile çevrili (bağlamsal) hareketlere koşullu yÞz hareketleri oluşturur. Sistem, LivePortrait (Kling tarafÄąndan最čŋ‘ alÄąnan) gibi yÞz yeniden inşa paketlerini kullanÄąr.

Bu yÃķnteme ek olarak, yaklaÅŸÄąmÄąnÄąn ilk olarak bu zorluklarÄą tek bir çÃķzÞme entegre ettiği için, yazarlar FacEDiTBench adlÄą yeni bir benchmark ve bu gÃķrev için uygun birkaç yeni değerlendirme ÃķlçÞtÞ oluşturdular.

Yeni çalÄąÅŸma FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling olarak adlandÄąrÄąlmÄąÅŸtÄąr ve Kore’nin Pohang Bilim ve Teknoloji Üniversitesi (POSTECH), Kore İleri Bilim ve Teknoloji EnstitÞsÞ (KAIST) ve Texas Üniversitesi’nden (Austin) dÃķrt araştÄąrmacÄą tarafÄąndan yapÄąlmÄąÅŸtÄąr.

YÃķntem

FacEDiT, yÞz hareketini yeniden inşa ederek, aktÃķrÞn orijinal performansÄąndaki eksik kÄąsÄąmlarÄą doldurmayÄą Ãķğrenmek için eğitilir ve bu sÞreç, modelin eğitim sÄąrasÄąnda bir boşluk doldurucu olarak hareket etmesini sağlar, sesle eşleşen yÞz hareketlerini ÃķngÃķrÞr ve orijinal video ile tutarlÄą kalÄąr:

FacEDiT sistemininæĶ‚č́, yÞz hareketinin kendiliğinden denetimli doldurulmasÄą yoluyla eğitimi, konuşma tarafÄąndan yÃķnlendirilen Ã§ÄąkarÄąm ve nihayet orijinal gÃķrÞntÞden gÃķrÞnÞmÞ yeniden kullanarak ancak yalnÄązca hedeflenen hareketi değiştirerek videoya dÃķnÞştÞrÞlmesi.

FacEDiT sistemininæĶ‚č́, yÞz hareketinin kendiliğinden denetimli doldurulmasÄą yoluyla eğitimi, konuşma tarafÄąndan yÃķnlendirilen Ã§ÄąkarÄąm ve nihayet orijinal gÃķrÞntÞden gÃķrÞnÞmÞ yeniden kullanarak ancak yalnÄązca hedeflenen hareketi değiştirerek videoya dÃķnÞştÞrÞlmesi. Kaynak

Ã‡ÄąkarÄąm zamanÄąnda, aynÄą mimari iki farklÄą Ã§ÄąktÄą destekler, video maskedir: kÄąsmi dÞzenleme, yalnÄązca bir cÞmle değiştirilir ve geri kalanÄą dokunulmaz; veya tam cÞmle oluşturma, yeni hareket tamamen sÄąfÄąrdan sentezlenir.

Model, akÄąÅŸ eşleştirmesi yoluyla eğitilir, video dÞzenleme, yÞz hareketleri arasÄąndaki bir yol olarak ele alÄąnÄąr.

Model, yÞz hareketini, yÞz ifadesi ve baş pozisyonunu tanÄąmlayan bir dizi kompakt sayÄą olarak temsil eder, bÃķylece konuşma değişiklikleri, kişinin genel gÃķrÞnÞmÞnÞ etkilemeden lokalize edilebilir.

Bu hareket vektÃķrleri, kimliği karÄąÅŸtÄąrmeden ifadeleri ve baş pozisyonunu tanÄąmlamak Þzere tasarlanmÄąÅŸtÄąr, bÃķylece konuşma değişiklikleri, kişinin genel gÃķrÞnÞmÞnÞ etkilemeden lokalize edilebilir.

FacEDiT Eğitimi

FacEDiT’yi eğitmek için, her video klibi bir dizi yÞz hareketi anÄąna bÃķlÞndÞ ve her kare, karÅŸÄąlÄąk gelen ses parçasÄąyla eşleştirildi. Hareket verilerinin rastgele kÄąsÄąmlarÄą gizlendi ve model, konuşma ve çevresi hareketsizlik için bağlam kullanarak eksik hareketlerin nasÄąl gÃķrÞnmesi gerektiğini tahmin etmesi istendi.

Maskeli aralÄąklar ve konumlarÄą, bir eğitim Ãķrneğinden diğerine değiştiğinden, model hem kÞçÞk iç dÞzenleme hem de tam dizi oluşturma için逐æļ olarak Ãķğrenir, verilen bilgilere bağlÄą olarak.

Sistemdeki Diffusion Transformer, gÞrÞltÞlÞ girişleri zaman içinde iyileştirerek masked hareketi geri kazanmayÄą Ãķğrenir. Konuşma ve hareket, modelin aynÄą anda değil, her bir işleme bloğuna çapraz dikkat yoluyla işlenir, bÃķylece sistem dudak hareketlerini ses konuşmasÄąna daha doğru bir şekilde eşleştirebilir.

Gerçekliği korumak için, dikkat komşu çerçevelere değil, tÞm zaman çizelgesine yÃķnlendirilir, bÃķylece model yerel sÞrekliliği ve bağlamÄą korumak için zorlanÄąr ve dÞzenlenmiş bÃķlgelerin kenarlarÄąnda titreme veya hareket atlamalarÄą Ãķnlenir. Konum gÃķmme (her karenin dizideki konumunu modeli bilgilendiren), modelin doğal zaman akÄąÅŸÄąnÄą ve bağlamÄąnÄą korumaya da yardÄąmcÄą olur.

Eğitim sÄąrasÄąnda, sistem konuşma ve yakÄąndaki hareketsizlik için bağlam kullanarak masked yÞz hareketlerini tahmin ederek eksik yÞz hareketlerini tahmin eder. Ã‡ÄąkarÄąm zamanÄąnda, aynÄą kurulum, ancak artÄąk konuşmadaki değişikliklere gÃķre yÃķnlendirilir.

Bir kelime veya cÞmle eklendiğinde, silindiğinde veya değiştirildiğinde, sistem etkilenen bÃķlgeyi bulur, maskeler ve yeni sesle eşleşen hareketi yeniden oluşturur. Tam dizi oluşturma, tÞm bÃķlgenin maskedir ve sÄąfÄąrdan sentezlendiği Ãķzel bir durum olarak ele alÄąnÄąr.

Veri ve Testler

Sistemin omurgasÄą, Diffusion Transformer için 22 katman, her biri 16 dikkat baÅŸÄą ve besleme ileri boyutlarÄą 1024 ve 2024px’dir. Hareket ve gÃķrÞnÞm Ãķzellikleri, dondurulmuş LivePortrait bileşenleri kullanÄąlarak Ã§ÄąkarÄąlÄąr ve konuşma WavLM ve VoiceCraft kullanÄąlarak kodlanÄąr.

Özel bir proje katmanÄą, 786 boyutlu konuşma Ãķzelliklerini DiT’nin latent uzayÄąna haritalar, yalnÄązca DiT ve proje modÞlleri sÄąfÄąrdan eğitilir.

Eğitim, AdamW optimizatÃķrÞ altÄąnda, hedef Ãķğrenme oranÄą 1e-4’te, bir milyon adÄąmda, her biri 48GB VRAM ile iki A6000 GPU’da, toplam toplu işleme boyutu sekizde gerçekleştirildi.

FacEDiTBench

FacEDiTBench veri kÞmesi, her biri orijinal ve dÞzenlenmiş konuşma ile birlikte 250 Ãķrnek içerir ve her bir video klibi için transkriptleri içerir. Videolar Þç kaynaktan gelir, HDTF‘den 100 klib, Hallo3‘ten 100 klib ve CelebV-Dub‘den 50 klib içerir. Her bir Ãķrnek, hem ses hem de videoyun yeterli netlikte olduğu için değerlendirme için el ile kontrol edilmiştir.

GPT-4o her bir transkripti dÞzenlemek için kullanÄąldÄą ve VoiceCraft, yeni ses oluşturmak için kullanÄąldÄą; ve her aşamada, hem transkript hem de oluşturulan konuşma kalite için el ile gÃķzden geçirildi.

Her bir Ãķrnek, dÞzenleme tÞrÞ, değişikliğin zamanÄą ve değiştirilen spanÄąn uzunluğu ile etiketlendi ve dÞzenlemeler eklemeler, silinmeler veya değişiklikler olarak sÄąnÄąflandÄąrÄąldÄą. Değiştirilen kelime sayÄąsÄą, kÄąsa dÞzenlemelerden (1-3 kelime) orta dÞzenlemelere (4-6 kelime) ve daha uzun dÞzenlemelere (7-10 kelime) kadar değişti.

Üç Ãķzel ÃķlçÞt, dÞzenleme kalitesini değerlendirmek için tanÄąmlandÄą. Fotometrik sÞreklilik, dÞzenlenmiş segmentin surrounding video ile nasÄąl birleştiğini Ãķlçen bir ÃķlçÞt; hareket sÞrekliliği, dÞzenlenmiş ve dÞzenlenmemiş çerçeveler arasÄąndaki optik akÄąÅŸ değişikliklerini Ãķlçen bir ÃķlçÞt; ve kimlik korunmasÄą, konu’nun gÃķrÞnÞmÞnÞn dÞzenleme sonrasÄąnda tutarlÄą kalÄąp kalmadığınÄą tahmin eden bir ÃķlçÞt, orijinal ve oluşturulan diziler arasÄąndaki yÞz gÃķmmelerini ArcFace yÞz tanÄąma modeli kullanarak karÅŸÄąlaştÄąrarak.

Testler

Test modeli, yaklaÅŸÄąk 200 saatlik video içeriğinden oluşan Þç veri kÞmesinden oluşan malzemeden eğitildi, vloglar ve filmler ile birlikte yÞksek çÃķzÞnÞrlÞklÞ YouTube videolarÄą.

Test modeli, HDTF test bÃķlÞnmesiyle birlikte, bu gÃķrevler seti için bir standart test olarak kabul edilen FacEDiTBench kullanÄąldÄą.

Doğrudan karÅŸÄąlaştÄąrÄąlabilir sistemlerin bulunmamasÄą nedeniyle, yazarlar bu tÞr işlevselliğin en az bir kÄąsmÄąnÄą yeniden Þretebilen çeşitli çerçeveleri seçti ve bunlarÄą temel olarak aldÄą; Ãķzellikle KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; ve SadTalker.

Kurulmuş beberapa ÃķlçÞtler de kullanÄąldÄą, lip-sync doğruluğunu SyncNet ile değerlendirerek, hem mutlak hata (LSE-D) hem de gÞven skoru (LSE-C) raporlandÄą; FrÃĐchet Video Distance (FVD), videoyun gerçekçi gÃķrÞnÞmÞnÞ niceliklendirerek; ve Öğrenilmiş AlgÄąsal Benzerlik ÖlçÞtleri (LPIPS), oluşturulan ve orijinal çerçeveler arasÄąndaki algÄąsal benzerliği Ãķlçerek.

DÞzenleme için, LPIPS hariç tÞm ÃķlçÞtler, yalnÄązca değiştirilen segmente uygulandÄą; oluşturma için, tÞm video değerlendirildi ve sÄąnÄąr sÞrekliliği hariç tutuldu.

Her model, orijinal klibe eklenen bir video segmenti sentezlemeye zorlandÄą (araştÄąrmacÄąlar, bu yÃķntemin sÄąk sÄąk dÞzenlenmiş bÃķlÞmÞn surrounding footage ile birleştiği yerlerde gÃķrÞnÞr kesintiler oluşturduğunu belirtiyorlar). Bir başka yaklaÅŸÄąm da test edildi, burada tÞm video, değiştirilen sesden yeniden oluşturuldu – ancak bu, dÞzenlenmemiş bÃķlgeleri silindi ve orijinal performansÄą koruma altÄąna almadÄą:

Sistemlerin dÞzenleme performansÄąnÄąn karÅŸÄąlaştÄąrmasÄą, FacEDiT'nin her ÃķlçÞtte tÞm temel sistemleri geride bÄąrakmasÄą, daha dÞşÞk lip-sync hatasÄą (LSE-D), daha yÞksek senkronizasyon gÞveni (LSE-C), daha gÞçlÞ kimlik korunmasÄą (IDSIM), daha gerçekçi video (FVD) ve dÞzenleme sÄąnÄąrlarÄąnda daha pÞrÞzsÞz geçişler (Pcontinuity, Mcontinuity) sağlamasÄą.

Sistemlerin dÞzenleme performansÄąnÄąn karÅŸÄąlaştÄąrmasÄą, FacEDiT’nin her ÃķlçÞtte tÞm temel sistemleri geride bÄąrakmasÄą, daha dÞşÞk lip-sync hatasÄą (LSE-D), daha yÞksek senkronizasyon gÞveni (LSE-C), daha gÞçlÞ kimlik korunmasÄą (IDSIM), daha gerçekçi video (FVD) ve dÞzenleme sÄąnÄąrlarÄąnda daha pÞrÞzsÞz geçişler (Pcontinuity, Mcontinuity) sağlamasÄą.

Yazarlar, bu sonuçlar hakkÄąnda şunlarÄą belirtiyorlar:

‘[Modelimiz] mevcut yÃķntemleri dÞzenleme gÃķrevinde Ãķnemli ÃķlçÞde geride bÄąrakÄąyor. GÞçlÞ sÄąnÄąr sÞrekliliği ve yÞksek kimlik korunmasÄą sağlÄąyor, bÃķylece zaman ve gÃķrsel tutarlÄąlığı koruma yeteneğini gÃķsteriyor. AyrÄąca, superior lip-sync doğruluğu ve dÞşÞk FVD, sentezlenen videonun gerçekçiğini yansÄątÄąyor.’

Çalmağa tÄąklayÄąnÄąz. YayÄąnlanan videolardan derlenen sonuçlar. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine başvurunuz.

Daha da Ãķnemlisi, dÞzenleme ve oluşturma kalitesini değerlendirmek için bir insan çalÄąÅŸmasÄą yapÄąldÄą.

Her bir karÅŸÄąlaştÄąrma için, katÄąlÄąmcÄąlar altÄą video izledi ve genel kaliteye gÃķre sÄąraladÄą, lip-sync doğruluğunu, doğal hareketliliği ve gerçekçiliği dikkate alarak; dÞzenleme denemelerinde, katÄąlÄąmcÄąlar ayrÄąca dÞzenlenmiş ve dÞzenlenmemiş segmentler arasÄąndaki geçişlerin pÞrÞzsÞzlÞğÞnÞ değerlendirdi:

İnsan değerlendiricileri tarafÄąndan atanan ortalama sÄąralamalar, daha dÞşÞk daha iyidir. Hem dÞzenleme hem de oluşturma için, katÄąlÄąmcÄąlar her videonun doğal ve senkronize gÃķrÞnÞmÞnÞ değerlendirdi. DÞzenleme için, ayrÄąca dÞzenlenmiş ve dÞzenlenmemiş konuşma arasÄąndaki geçişin pÞrÞzsÞzlÞğÞnÞ değerlendirdi.

İnsan değerlendiricileri tarafÄąndan atanan ortalama sÄąralamalar, daha dÞşÞk daha iyidir. Hem dÞzenleme hem de oluşturma için, katÄąlÄąmcÄąlar her videonun doğal ve senkronize gÃķrÞnÞmÞnÞ değerlendirdi. DÞzenleme için, ayrÄąca dÞzenlenmiş ve dÞzenlenmemiş konuşma arasÄąndaki geçişin pÞrÞzsÞzlÞğÞnÞ değerlendirdi.

ÇalÄąÅŸmada, FacEDiT her iki dÞzenleme ve oluşturma için de aÃ§Äąk bir ÞstÞnlÞkle en yÞksek sÄąralamayÄą aldÄą, ayrÄąca geçişlerin pÞrÞzsÞzlÞğÞ için gÞçlÞ puanlar aldÄą, ÃķlçÞlen avantajlarÄąnÄąn algÄąsal olarak tercih edilen Ã§ÄąktÄąlara dÃķnÞştÞğÞnÞ gÃķsteriyor.

Ablasyon çalÄąÅŸmalarÄą ve ek testler hakkÄąnda daha fazla ayrÄąntÄą için okuyucuyu kaynak makaleye yÃķnlendirmekteyiz. AslÄąnda, bu tÞr prototip araştÄąrma teklifleri, anlamlÄą test sonuçlarÄą bÃķlÞmlerini Þretmekte zorluklarla karÅŸÄąlaÅŸÄąr, çÞnkÞ temel teklif itself, potansiyel olarak sonraki çalÄąÅŸmalar için bir temel teşkil eder.

Sonuç

Bunun gibi sistemler, Ã§ÄąkarÄąm zamanÄąnda Ãķnemli hesaplama kaynaklarÄą gerektirebilir, bu da VFX dÞkkÃĒnlarÄą gibi aşağı akÄąÅŸ kullanÄącÄąlarÄąnÄąn işi kendi yerlerinde tutmasÄąnÄą zorlaştÄąrÄąr, bu nedenle gerçekçi yerel kaynaklara uyumlu yaklaÅŸÄąmlar her zaman tercih edilecektir.

Bu, yeni teklifin eleştirisi değildir, bu, belki de nicelendirilmiş ağırlÄąklar veya diğer optimizasyonlar altÄąnda mÞkemmel bir şekilde çalÄąÅŸabilir ve bu tÞr araştÄąrmalarÄąn bu yoluna beni uzun sÞredir geri getiren ilk teklif.

 

İlk olarak Çarşamba, AralÄąk 17, 202. 20.10 EET, aynÄą gÞn, ilk gÃķvde paragrafÄąnda ekstra boşluk için dÞzenlendi.

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'nin Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]