Andersonâun AÃ§ÄąsÄą
Gerçek Videolara AI ile Diyalog Eklenmesi

Yeni bir AI çerçevesi, yeniden çekim yapmadan, tek bir uçtan uca sistemde bir kiÅinin sÃķzlerini yeniden yazabilir, silebilir veya ekleyebilir.
Â
Ãç yÄąl Ãķnce, internet herhangi bir 20-30 AI video deÄiÅtirme çerçevesi tarafÄąndan ÅaÅÄąrtÄąlacaktÄą; ancak bu popÞler araÅtÄąrma dalÄą artÄąk neredeyse baÅka bir âAI Slopâ dalÄą oluÅturacak kadar Þretken hale geldi ve ben bu tÞr yayÄąnlarÄąn çoÄunu iki veya Þç yÄąl Ãķnce olduÄu gibi kapsamamaktayÄąm.
Her ne kadar, bu dizi içerisinde bir yayÄąn dikkatimi çekti: gerçek video kliplerine mÞdahale edebilen ve mevcut videoya (yÞz veya çerçevenin tamamÄąnÄą oluÅturmak yerine) yeni konuÅma ekleyebilen entegre bir sistem.
AÅaÄÄądaki Ãķrneklerde, yayÄąnlanan çeÅitli Ãķrnek videolarÄą birleÅtirdim ve Ãķnce gerçek kaynak klibi, ardÄąndan konuÅma sentezi ve dudak senkronizasyonu ile birlikte klibin ortasÄąna yerleÅtirilen AI konuÅmasÄąnÄą gÃķrdÞÄÞmÞzÞ gÃķrÞyoruz:
ÃalmaÄa tÄąklayÄąnÄąz. Yerel dÞzenleme ile dikme â FacEDiT tarafÄąndan sunulan birkaç modalityden biri. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine baÅvurunuz. Kaynak â https://facedit.github.io/
Bu yaklaÅÄąm, âyerel dÞzenleme ile dikmeâ olarak adlandÄąrÄąlan Þç geliÅtirilen yÃķntemden biridir ve yazarlar (benim de dahil olmak Þzere) tarafÄąndan en çok ilgi gÃķren yÃķntemdir. Temel olarak, klibin bir orta çerçevesi, yeni AI yorumu için bir baÅlangÄąÃ§ noktasÄą olarak kullanÄąlÄąr ve sonraki (gerçek) çerçevesi, oluÅturulan klibin hedefi olarak kullanÄąlÄąr. YukarÄądaki kliplerde, bu âtohumâ ve âhedefâ çerçeveleri, Þst ÐēÐļÐīÐĩonun dururken, deÄiÅtirilen video altta generatif doldurmayÄą saÄlar.
Yazarlar, bu yÞz ve vokal sentez yaklaÅÄąmÄąnÄą, bu tÞr AI video dÞzenleme için ilk olarak entegre edilmiÅ uçtan uca bir yÃķntem olarak çerçevelemektedir ve bÃķyle bir çerçevenin TV ve film Þretimi için potansiyelini gÃķzlemlemektedir:
âFilm yapÄąmcÄąlarÄą ve medya Þreticileri, kaydedilen videolarÄąn belirli kÄąsÄąmlarÄąnÄą deÄiÅtirmek zorunda kalabilirler â belki bir kelime yanlÄąÅ sÃķylendi veya senaryo çekimden sonra deÄiÅti. ÃrneÄin, Titanic (1997) filminin ikonik sahnesinde Rose, âIâll never let go, Jack,â derken, yÃķnetmen daha sonra âIâll never forget you, Jackâ demesi gerektiÄini kararlaÅtÄąrabilir.
âGeleneksel olarak, bu tÞr deÄiÅiklikler, tÞm sahnenin yeniden çekilmesini gerektirir, bu da maliyetli ve zaman alÄącÄądÄąr. KonuÅan yÞz sentezi, yÞz hareketini deÄiÅtirerek konuÅmayÄą otomatik olarak deÄiÅtiren bir pratik alternatif sunar, yeniden çekme ihtiyacÄąnÄą ortadan kaldÄąrÄąr.â
Bu tÞr AI mÞdahaleleri, kÞltÞrel veya endÞstriyel direniÅle karÅÄąlaÅabilir, ancak insan liderliÄindeki VFX sistemleri ve araç setlerinde yeni bir tÞr iÅlevsellik oluÅturabilir. Her durumda, Åimdilik, zorluklar salt teknik dÞzeydedir.
Bunun yanÄą sÄąra, yeni sistem mevcut konuÅmayÄą da deÄiÅtirebilir:
ÃalmaÄa tÄąklayÄąnÄąz. Mevcut diyalogu deÄiÅtirmek yerine, yeni diyalog eklemek için bir Ãķrnek. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine baÅvurunuz.
ÃaÄÄąn GetirdiÄi
Åu anda, bu tÞr sentez yeteneÄi sunan uçtan uca sistemler mevcut deÄildir; ancak GoogleâÄąn Veo serisi gibi bir dizi generatif AI platformu, ses oluÅturabilir ve çeÅitli diÄer çerçeveler derin sahte ses oluÅturabilir, ancak Åu anda gerçek gÃķrÞntÞye mÞdahale etmek için yeni sistem â FacEDiT â gibi bir dizi çeÅitli mimari ve hileler.pipeline oluÅturmak zorunda kalÄąrsÄąnÄąz.
Sistem, Diffusion Transformers (DiT) ile birlikte Flow Matching kullanÄąr ve konuÅma sesi içeriÄi ile çevrili (baÄlamsal) hareketlere koÅullu yÞz hareketleri oluÅturur. Sistem, LivePortrait (Kling tarafÄąndanæčŋ alÄąnan) gibi yÞz yeniden inÅa paketlerini kullanÄąr.
Bu yÃķnteme ek olarak, yaklaÅÄąmÄąnÄąn ilk olarak bu zorluklarÄą tek bir çÃķzÞme entegre ettiÄi için, yazarlar FacEDiTBench adlÄą yeni bir benchmark ve bu gÃķrev için uygun birkaç yeni deÄerlendirme ÃķlçÞtÞ oluÅturdular.
Yeni çalÄąÅma FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling olarak adlandÄąrÄąlmÄąÅtÄąr ve Koreânin Pohang Bilim ve Teknoloji Ãniversitesi (POSTECH), Kore İleri Bilim ve Teknoloji EnstitÞsÞ (KAIST) ve Texas Ãniversitesiânden (Austin) dÃķrt araÅtÄąrmacÄą tarafÄąndan yapÄąlmÄąÅtÄąr.
YÃķntem
FacEDiT, yÞz hareketini yeniden inÅa ederek, aktÃķrÞn orijinal performansÄąndaki eksik kÄąsÄąmlarÄą doldurmayÄą ÃķÄrenmek için eÄitilir ve bu sÞreç, modelin eÄitim sÄąrasÄąnda bir boÅluk doldurucu olarak hareket etmesini saÄlar, sesle eÅleÅen yÞz hareketlerini ÃķngÃķrÞr ve orijinal video ile tutarlÄą kalÄąr:

FacEDiT sistemininæĶčĶ, yÞz hareketinin kendiliÄinden denetimli doldurulmasÄą yoluyla eÄitimi, konuÅma tarafÄąndan yÃķnlendirilen Ã§ÄąkarÄąm ve nihayet orijinal gÃķrÞntÞden gÃķrÞnÞmÞ yeniden kullanarak ancak yalnÄązca hedeflenen hareketi deÄiÅtirerek videoya dÃķnÞÅtÞrÞlmesi. Kaynak
ÃÄąkarÄąm zamanÄąnda, aynÄą mimari iki farklÄą Ã§ÄąktÄą destekler, video maskedir: kÄąsmi dÞzenleme, yalnÄązca bir cÞmle deÄiÅtirilir ve geri kalanÄą dokunulmaz; veya tam cÞmle oluÅturma, yeni hareket tamamen sÄąfÄąrdan sentezlenir.
Model, akÄąÅ eÅleÅtirmesi yoluyla eÄitilir, video dÞzenleme, yÞz hareketleri arasÄąndaki bir yol olarak ele alÄąnÄąr.
Model, yÞz hareketini, yÞz ifadesi ve baÅ pozisyonunu tanÄąmlayan bir dizi kompakt sayÄą olarak temsil eder, bÃķylece konuÅma deÄiÅiklikleri, kiÅinin genel gÃķrÞnÞmÞnÞ etkilemeden lokalize edilebilir.
Bu hareket vektÃķrleri, kimliÄi karÄąÅtÄąrmeden ifadeleri ve baÅ pozisyonunu tanÄąmlamak Þzere tasarlanmÄąÅtÄąr, bÃķylece konuÅma deÄiÅiklikleri, kiÅinin genel gÃķrÞnÞmÞnÞ etkilemeden lokalize edilebilir.
FacEDiT EÄitimi
FacEDiTâyi eÄitmek için, her video klibi bir dizi yÞz hareketi anÄąna bÃķlÞndÞ ve her kare, karÅÄąlÄąk gelen ses parçasÄąyla eÅleÅtirildi. Hareket verilerinin rastgele kÄąsÄąmlarÄą gizlendi ve model, konuÅma ve çevresi hareketsizlik için baÄlam kullanarak eksik hareketlerin nasÄąl gÃķrÞnmesi gerektiÄini tahmin etmesi istendi.
Maskeli aralÄąklar ve konumlarÄą, bir eÄitim ÃķrneÄinden diÄerine deÄiÅtiÄinden, model hem kÞçÞk iç dÞzenleme hem de tam dizi oluÅturma içinéæļ olarak ÃķÄrenir, verilen bilgilere baÄlÄą olarak.
Sistemdeki Diffusion Transformer, gÞrÞltÞlÞ giriÅleri zaman içinde iyileÅtirerek masked hareketi geri kazanmayÄą ÃķÄrenir. KonuÅma ve hareket, modelin aynÄą anda deÄil, her bir iÅleme bloÄuna çapraz dikkat yoluyla iÅlenir, bÃķylece sistem dudak hareketlerini ses konuÅmasÄąna daha doÄru bir Åekilde eÅleÅtirebilir.
GerçekliÄi korumak için, dikkat komÅu çerçevelere deÄil, tÞm zaman çizelgesine yÃķnlendirilir, bÃķylece model yerel sÞrekliliÄi ve baÄlamÄą korumak için zorlanÄąr ve dÞzenlenmiÅ bÃķlgelerin kenarlarÄąnda titreme veya hareket atlamalarÄą Ãķnlenir. Konum gÃķmme (her karenin dizideki konumunu modeli bilgilendiren), modelin doÄal zaman akÄąÅÄąnÄą ve baÄlamÄąnÄą korumaya da yardÄąmcÄą olur.
EÄitim sÄąrasÄąnda, sistem konuÅma ve yakÄąndaki hareketsizlik için baÄlam kullanarak masked yÞz hareketlerini tahmin ederek eksik yÞz hareketlerini tahmin eder. ÃÄąkarÄąm zamanÄąnda, aynÄą kurulum, ancak artÄąk konuÅmadaki deÄiÅikliklere gÃķre yÃķnlendirilir.
Bir kelime veya cÞmle eklendiÄinde, silindiÄinde veya deÄiÅtirildiÄinde, sistem etkilenen bÃķlgeyi bulur, maskeler ve yeni sesle eÅleÅen hareketi yeniden oluÅturur. Tam dizi oluÅturma, tÞm bÃķlgenin maskedir ve sÄąfÄąrdan sentezlendiÄi Ãķzel bir durum olarak ele alÄąnÄąr.
Veri ve Testler
Sistemin omurgasÄą, Diffusion Transformer için 22 katman, her biri 16 dikkat baÅÄą ve besleme ileri boyutlarÄą 1024 ve 2024pxâdir. Hareket ve gÃķrÞnÞm Ãķzellikleri, dondurulmuÅ LivePortrait bileÅenleri kullanÄąlarak Ã§ÄąkarÄąlÄąr ve konuÅma WavLM ve VoiceCraft kullanÄąlarak kodlanÄąr.
Ãzel bir proje katmanÄą, 786 boyutlu konuÅma Ãķzelliklerini DiTânin latent uzayÄąna haritalar, yalnÄązca DiT ve proje modÞlleri sÄąfÄąrdan eÄitilir.
EÄitim, AdamW optimizatÃķrÞ altÄąnda, hedef ÃķÄrenme oranÄą 1e-4âte, bir milyon adÄąmda, her biri 48GB VRAM ile iki A6000 GPUâda, toplam toplu iÅleme boyutu sekizde gerçekleÅtirildi.
FacEDiTBench
FacEDiTBench veri kÞmesi, her biri orijinal ve dÞzenlenmiÅ konuÅma ile birlikte 250 Ãķrnek içerir ve her bir video klibi için transkriptleri içerir. Videolar Þç kaynaktan gelir, HDTFâden 100 klib, Hallo3âten 100 klib ve CelebV-Dubâden 50 klib içerir. Her bir Ãķrnek, hem ses hem de videoyun yeterli netlikte olduÄu için deÄerlendirme için el ile kontrol edilmiÅtir.
GPT-4o her bir transkripti dÞzenlemek için kullanÄąldÄą ve VoiceCraft, yeni ses oluÅturmak için kullanÄąldÄą; ve her aÅamada, hem transkript hem de oluÅturulan konuÅma kalite için el ile gÃķzden geçirildi.
Her bir Ãķrnek, dÞzenleme tÞrÞ, deÄiÅikliÄin zamanÄą ve deÄiÅtirilen spanÄąn uzunluÄu ile etiketlendi ve dÞzenlemeler eklemeler, silinmeler veya deÄiÅiklikler olarak sÄąnÄąflandÄąrÄąldÄą. DeÄiÅtirilen kelime sayÄąsÄą, kÄąsa dÞzenlemelerden (1-3 kelime) orta dÞzenlemelere (4-6 kelime) ve daha uzun dÞzenlemelere (7-10 kelime) kadar deÄiÅti.
Ãç Ãķzel ÃķlçÞt, dÞzenleme kalitesini deÄerlendirmek için tanÄąmlandÄą. Fotometrik sÞreklilik, dÞzenlenmiÅ segmentin surrounding video ile nasÄąl birleÅtiÄini Ãķlçen bir ÃķlçÞt; hareket sÞrekliliÄi, dÞzenlenmiÅ ve dÞzenlenmemiŠçerçeveler arasÄąndaki optik akÄąÅ deÄiÅikliklerini Ãķlçen bir ÃķlçÞt; ve kimlik korunmasÄą, konuânun gÃķrÞnÞmÞnÞn dÞzenleme sonrasÄąnda tutarlÄą kalÄąp kalmadÄąÄÄąnÄą tahmin eden bir ÃķlçÞt, orijinal ve oluÅturulan diziler arasÄąndaki yÞz gÃķmmelerini ArcFace yÞz tanÄąma modeli kullanarak karÅÄąlaÅtÄąrarak.
Testler
Test modeli, yaklaÅÄąk 200 saatlik video içeriÄinden oluÅan Þç veri kÞmesinden oluÅan malzemeden eÄitildi, vloglar ve filmler ile birlikte yÞksek çÃķzÞnÞrlÞklÞ YouTube videolarÄą.
Test modeli, HDTF test bÃķlÞnmesiyle birlikte, bu gÃķrevler seti için bir standart test olarak kabul edilen FacEDiTBench kullanÄąldÄą.
DoÄrudan karÅÄąlaÅtÄąrÄąlabilir sistemlerin bulunmamasÄą nedeniyle, yazarlar bu tÞr iÅlevselliÄin en az bir kÄąsmÄąnÄą yeniden Þretebilen çeÅitli çerçeveleri seçti ve bunlarÄą temel olarak aldÄą; Ãķzellikle KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; ve SadTalker.
KurulmuÅ beberapa ÃķlçÞtler de kullanÄąldÄą, lip-sync doÄruluÄunu SyncNet ile deÄerlendirerek, hem mutlak hata (LSE-D) hem de gÞven skoru (LSE-C) raporlandÄą; FrÃĐchet Video Distance (FVD), videoyun gerçekçi gÃķrÞnÞmÞnÞ niceliklendirerek; ve ÃÄrenilmiÅ AlgÄąsal Benzerlik ÃlçÞtleri (LPIPS), oluÅturulan ve orijinal çerçeveler arasÄąndaki algÄąsal benzerliÄi Ãķlçerek.
DÞzenleme için, LPIPS hariç tÞm ÃķlçÞtler, yalnÄązca deÄiÅtirilen segmente uygulandÄą; oluÅturma için, tÞm video deÄerlendirildi ve sÄąnÄąr sÞrekliliÄi hariç tutuldu.
Her model, orijinal klibe eklenen bir video segmenti sentezlemeye zorlandÄą (araÅtÄąrmacÄąlar, bu yÃķntemin sÄąk sÄąk dÞzenlenmiÅ bÃķlÞmÞn surrounding footage ile birleÅtiÄi yerlerde gÃķrÞnÞr kesintiler oluÅturduÄunu belirtiyorlar). Bir baÅka yaklaÅÄąm da test edildi, burada tÞm video, deÄiÅtirilen sesden yeniden oluÅturuldu â ancak bu, dÞzenlenmemiÅ bÃķlgeleri silindi ve orijinal performansÄą koruma altÄąna almadÄą:

Sistemlerin dÞzenleme performansÄąnÄąn karÅÄąlaÅtÄąrmasÄą, FacEDiTânin her ÃķlçÞtte tÞm temel sistemleri geride bÄąrakmasÄą, daha dÞÅÞk lip-sync hatasÄą (LSE-D), daha yÞksek senkronizasyon gÞveni (LSE-C), daha gÞçlÞ kimlik korunmasÄą (IDSIM), daha gerçekçi video (FVD) ve dÞzenleme sÄąnÄąrlarÄąnda daha pÞrÞzsÞz geçiÅler (Pcontinuity, Mcontinuity) saÄlamasÄą.
Yazarlar, bu sonuçlar hakkÄąnda ÅunlarÄą belirtiyorlar:
â[Modelimiz] mevcut yÃķntemleri dÞzenleme gÃķrevinde Ãķnemli ÃķlçÞde geride bÄąrakÄąyor. GÞçlÞ sÄąnÄąr sÞrekliliÄi ve yÞksek kimlik korunmasÄą saÄlÄąyor, bÃķylece zaman ve gÃķrsel tutarlÄąlÄąÄÄą koruma yeteneÄini gÃķsteriyor. AyrÄąca, superior lip-sync doÄruluÄu ve dÞÅÞk FVD, sentezlenen videonun gerçekçiÄini yansÄątÄąyor.â
ÃalmaÄa tÄąklayÄąnÄąz. YayÄąnlanan videolardan derlenen sonuçlar. Daha iyi çÃķzÞnÞrlÞk için lÞtfen kaynak sitesine baÅvurunuz.
Daha da Ãķnemlisi, dÞzenleme ve oluÅturma kalitesini deÄerlendirmek için bir insan çalÄąÅmasÄą yapÄąldÄą.
Her bir karÅÄąlaÅtÄąrma için, katÄąlÄąmcÄąlar altÄą video izledi ve genel kaliteye gÃķre sÄąraladÄą, lip-sync doÄruluÄunu, doÄal hareketliliÄi ve gerçekçiliÄi dikkate alarak; dÞzenleme denemelerinde, katÄąlÄąmcÄąlar ayrÄąca dÞzenlenmiÅ ve dÞzenlenmemiÅ segmentler arasÄąndaki geçiÅlerin pÞrÞzsÞzlÞÄÞnÞ deÄerlendirdi:

İnsan deÄerlendiricileri tarafÄąndan atanan ortalama sÄąralamalar, daha dÞÅÞk daha iyidir. Hem dÞzenleme hem de oluÅturma için, katÄąlÄąmcÄąlar her videonun doÄal ve senkronize gÃķrÞnÞmÞnÞ deÄerlendirdi. DÞzenleme için, ayrÄąca dÞzenlenmiÅ ve dÞzenlenmemiÅ konuÅma arasÄąndaki geçiÅin pÞrÞzsÞzlÞÄÞnÞ deÄerlendirdi.
ÃalÄąÅmada, FacEDiT her iki dÞzenleme ve oluÅturma için de aÃ§Äąk bir ÞstÞnlÞkle en yÞksek sÄąralamayÄą aldÄą, ayrÄąca geçiÅlerin pÞrÞzsÞzlÞÄÞ için gÞçlÞ puanlar aldÄą, ÃķlçÞlen avantajlarÄąnÄąn algÄąsal olarak tercih edilen Ã§ÄąktÄąlara dÃķnÞÅtÞÄÞnÞ gÃķsteriyor.
Ablasyon çalÄąÅmalarÄą ve ek testler hakkÄąnda daha fazla ayrÄąntÄą için okuyucuyu kaynak makaleye yÃķnlendirmekteyiz. AslÄąnda, bu tÞr prototip araÅtÄąrma teklifleri, anlamlÄą test sonuçlarÄą bÃķlÞmlerini Þretmekte zorluklarla karÅÄąlaÅÄąr, çÞnkÞ temel teklif itself, potansiyel olarak sonraki çalÄąÅmalar için bir temel teÅkil eder.
Sonuç
Bunun gibi sistemler, Ã§ÄąkarÄąm zamanÄąnda Ãķnemli hesaplama kaynaklarÄą gerektirebilir, bu da VFX dÞkkÃĒnlarÄą gibi aÅaÄÄą akÄąÅ kullanÄącÄąlarÄąnÄąn iÅi kendi yerlerinde tutmasÄąnÄą zorlaÅtÄąrÄąr, bu nedenle gerçekçi yerel kaynaklara uyumlu yaklaÅÄąmlar her zaman tercih edilecektir.
Bu, yeni teklifin eleÅtirisi deÄildir, bu, belki de nicelendirilmiÅ aÄÄąrlÄąklar veya diÄer optimizasyonlar altÄąnda mÞkemmel bir Åekilde çalÄąÅabilir ve bu tÞr araÅtÄąrmalarÄąn bu yoluna beni uzun sÞredir geri getiren ilk teklif.
Â
İlk olarak ÃarÅamba, AralÄąk 17, 202. 20.10 EET, aynÄą gÞn, ilk gÃķvde paragrafÄąnda ekstra boÅluk için dÞzenlendi.












