Anderson’un Açısı

AI Tabanlı Video Düzenleme için Yol

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Video/görüntü sentez araştırma bölümü düzenli olarak video düzenleme mimarileri çıkarmakta ve son dokuz ayda bu tür çıkışlar daha da sıklaşmıştır. Bununla birlikte, bunlardan çoğu, temel zorlukların önemli olduğu için yalnızca mevcut durumun artımlı ilerlemelerini temsil etmektedir.

Ancak, bu hafta Çin ve Japonya arasındaki yeni bir işbirliği, yaklaşımın daha yakından incelenmesini hak eden bazı örnekler üretmiştir, bu bir kilometre taşı çalışması olmasa da.

Aşağıdaki videoda (makalenin ilgili proje sitesinden, ancak tarayıcınızı zorlayabileceğini unutmayın) sistemdeki deepfake yeteneklerinin şu anda mevcut olmadığı görülmektedir, ancak sistem, video maskesi (alt sol) temelinde genç kadının kimliğini makul ve önemli ölçüde değiştirmek için iyi bir iş çıkarmaktadır:

Çalma için tıklayın. Alt soldaki semantic segmentasyon maskesi görselleştirilmiş, orijinal (üst sol) kadın, oldukça farklı bir kimliğe dönüştürülmüştür, bu işlem, promt’te belirtilen kimlik değişimini başarmaz, ancak bu süreç, geleneksel olarak bu terimin anlamına gelen ‘çeşitli klipleri bir diziye monte etme’ değil, makine öğrenimi tekniklerini kullanarak mevcut video kliplerinin iç içeriğini doğrudan değiştirme veya değiştirme anlamına gelir.

Bu tür maskeli düzenleme, statik latent difüzyon modellerinde iyi kurulmuştur, ControlNet gibi araçlar kullanılarak. Ancak, video中的 arka plan tutarlılığını korumak, masked alanlar modeli yaratıcı esneklik sağlasa da, aşağıdaki gibi daha zorlu bir iştir:

Çalma için tıklayın. Yeni VideoPainter yöntemiyle tür değişikliği. Kaynak videolarına erişebiliyorsanız, daha iyi çözünürlük ve ayrıntı için lütfen projenin genel video örneklerine bakın veya https://github.com/lllyasviel/ControlNet adresindeki projenin genel video örneklerine bakın.

Yeni çalışmanın yazarları, yöntemlerini Tencent’in kendi BrushNet mimarisiyle ve ControlNet ile karşılaştırmaktadır, her ikisi de ön plan ve arka plan oluşturmayı ayıran çift dal mimarisiyle ilgilenmektedir.

Ancak, bu yöntemi Diffusion Transformers (DiT) yaklaşımına doğrudan uygulamak, OpenAI’nin Sora tarafından önerilen yaklaşım, yazarlara göre belirli zorluklar getirir:

‘[Doğrudan] [BrushNet ve ControlNet’in mimarisini] video DiT’lere uygulamak birkaç zorluğa yol açar: [İlk olarak,] Video DiT’nin güçlü üretken temeli ve büyük model boyutu nedeniyle, context encoder olarak tam/half-giant Video DiT omurgasını yeniden üretmek gereksiz ve hesaplama açısından engelleyici olacaktır.

‘[İkincisi,] BrushNet’in saf konveksiyonel kontrol dalı gibi, DiT’nin masked bölgelerdeki tokenleri, global dikkat nedeniyle arka plan bilgilerini içerir, bu da DiT omurgasındaki masked ve masked olmayan bölgeler arasındaki ayrımı karmaşık hale getirir.

‘[Son olarak,] ControlNet, tüm katmanlar boyunca özellik enjeksiyonuna sahip değildir, bu da dense arka plan kontrolünü engeller ve inpainting görevlerini zorlaştırır.’

Bu nedenle araştırmacılar, çift dal çerçevesi şeklinde bir plug-and-play yaklaşımı geliştirmişlerdir ve buna VideoPainter adını vermişlerdir.

VideoPainter, önceden eğitilmiş DiT’leri hafif bir context encoder ile güçlendiren bir çift dal video inpainting çerçevesi sunar. Bu encoder, yalnızca omurganın %6’sı kadar parametre içerir ve yazarlar bu yaklaşımın geleneksel yöntemlerden daha verimli olduğunu iddia etmektedir.

Model, üç ana yenilik sunar: arka plan rehberliği için akıcı bir iki katmanlı context encoder; masked ve masked olmayan tokenleri ayıran bir maskeli özellik entegrasyonu sistemi; ve uzun video dizileri boyunca kimlik tutarlılığını koruyan bir inpainting bölgesi ID yeniden örnekleme tekniği.

VideoPainter, önceden eğitilmiş DiT ve context encoder’i dondurarak ve bir ID-Adapter tanıtarak, inpainting bölgesi tokenlerinin önceki klipler boyunca süreceğini garanti eder, bu da parlamayı ve tutarsızlıkları azaltır.

Çerçeve, ayrıca mevcut video oluşturma ve düzenleme iş akışlarına sorunsuz bir şekilde entegre edilebilmesi için tasarlanmıştır.

Çalışmayı desteklemek için, yazarlar CogVideo-5B-I2V’yi üretken motor olarak kullandılar ve CogVideo-5B-I2V olarak adlandırdıkları en büyük video inpainting verisetini oluşturdular. VPData adlı bu koleksiyon, toplam 886 saatlik video süresine sahip 390.000’den fazla klibi içermektedir. Ayrıca, VPBench adlı ilgili bir benchmarking çerçevesi geliştirdiler.

Çalma için tıklayın. Proje web sitesindeki örneklerden, VPData koleksiyonu ve VPBench test süiti tarafından sağlanan segmentasyon yeteneklerini görüyoruz. Kaynak videolarına erişebiliyorsanız, daha iyi çözünürlük ve ayrıntı için lütfen projenin genel video örneklerine bakın veya https://openai.com/sora/ adresindeki projenin genel video örneklerine bakın.

Yeni çalışma, VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control olarak adlandırılmıştır ve Tencent ARC Lab, Chinese University of Hong Kong, Tokyo Üniversitesi ve Macau Üniversitesi’nden yedi yazar tarafından yapılmıştır.

Yazarlar, ayrıca projeye daha erişilebilir bir YouTube özeti ve Hugging Face sayfası yayınladılar.

Yöntem

VPData için veri toplama işlem hattı, toplama, açıklama, bölme, seçme ve altyazılama adımlarından oluşur:

Veri seti inşaat pipeline şeması. Kaynak: https://www.youtube.com/watch?v=HYzNfsD3A0s

Veri seti inşaat pipeline şeması. Kaynak: https://arxiv.org/pdf/2503.05639

Derleme için kullanılan kaynak koleksiyonlar Videvo ve Pexels idi ve yaklaşık 450.000 video ile başladı.

Ön işleme aşamasında, Her Şeyi Tanıma çerçevesi, açık küme video etiketleme için kullanıldı ve birincil nesneleri tanımlamakla görevlendirildi; Dino Yerleştirme nesnelerin etrafındaki sınırlayıcı kutuların tespiti için kullanıldı ve Her Şeyi Segmentle Model 2 (SAM 2) çerçevesi, bu kaba seçimlerin yüksek kaliteli maske segmentasyonlarına dönüştürülmesi için kullanıldı.

Sahneler arası geçişleri yönetmek ve video inpainting’de tutarlılığı sağlamak için, VideoPainter PySceneDetect kullanır ve doğal kesme noktalarında klipleri segmente eder, aynı nesneyi birden fazla açından takip etmenin neden olduğu rahatsız edici değişikliklerden kaçınır. Klipler 10 saniyelik aralıklara bölünmüş ve 6 saniyeden kısa olanlar atılmıştır.

Veri seçimi için, üç filtreleme ölçütü uygulanmıştır: görsel kalite, Laion-Aesthetic Skor Tahmincisi ile değerlendirilmiştir; hareket gücü, optik akış RAFT ile ölçülmüştür; ve içerik güvenliği, Stable Diffusion’un Güvenlik Kontrolörü ile doğrulanmıştır.

Mevcut video segmentasyon veri setlerinde büyük bir sınırlama, ayrıntılı metinsel açıklamaların eksikliğidir, bu açıklamalar üretken modelleri yönlendirmek için çok önemlidir:

[caption id="attachment_213690" align="alignnone" width="710"]Araştırmacılar, karşılaştırılabilir koleksiyonlardaki video altyazılarının eksikliğini vurgulamaktadır. Araştırmacılar, karşılaştırılabilir koleksiyonlardaki video altyazılarının eksikliğini vurgulamaktadır.

Bu nedenle, VideoPainter veri kümesi oluşturma işlemi, anahtar kare tabanlı altyazılar ve masked bölgelerin ayrıntılı açıklamaları üretmek için önde gelen görme-dil modellerini, CogVLM2 ve Chat GPT-4o dahil olmak üzere entegre eder.

VideoPainter, önceden eğitilmiş DiT’leri, arka plan bağlamını ön plan oluşturmadan ayıran özel bir hafif context encoder ile güçlendiren bir çift dal video inpainting çerçevesi sunar, bu, üst sağdaki şemada görüldüğü gibi:

VideoPainter konsept şeması. VideoPainter'in context encoderi, gürültülü latents, downsampled maskeler ve masked video latents'i VAE aracılığıyla işler ve yalnızca arka plan tokenlerini önceden eğitilmiş DiT'ye entegre eder, böylece belirsizliği önler. ID Resample Adapter, eğitim sırasında masked bölge tokenlerini birleştirmek ve推理 sırasında önceki kliplerden yeniden örnekleme yapmak suretiyle kimlik tutarlılığını sağlar.

VideoPainter konsept şeması. VideoPainter’in context encoderi, gürültülü latents, downsampled maskeler ve masked video latents’i VAE aracılığıyla işler ve yalnızca arka plan tokenlerini önceden eğitilmiş DiT’ye entegre eder, böylece belirsizliği önler. ID Resample Adapter, eğitim sırasında masked bölge tokenlerini birleştirmek ve推理 sırasında önceki kliplerden yeniden örnekleme yapmak suretiyle kimlik tutarlılığını sağlar.

Bu encoder, omurgayı gereksiz işlemlerle yüklemektense, gürültülü bir latent, downsampled maske ve masked video latent’in birleşimi gibi bir akıcı girdi kullanır.

Gürültülü latent, üretim bağlamını sağlar ve masked video latent, DiT’nin mevcut dağılımına uyumlu hale getirilir, böylece uyumluluğu artırmayı hedefler.

Önceden eğitilmiş DiT’ye yalnızca ilk iki katmanın özellikleri reintroduce edilir ve bu, yapılandırılmış bir şekilde yapılır – erken katman özelliklerinin ilk yarısı modelin ilk yarısını bilgilendirirken, daha sonraki özellikler ikinci yarısını iyileştirir.

Ek olarak, bir token-seçici mekanizma, yalnızca arka plana ilgili özelliklerin reintegrate edilmesini sağlar, bu da masked ve masked olmayan bölgeler arasındaki karışıklığı önler. Yazarlar, bu yaklaşımın, VideoPainter’in arka plan korunumunda yüksek sadakatle birlikte ön plan inpainting verimliliğini iyileştirmesine olanak tanıdığını iddia etmektedirler.

Yazarlar, yöntemlerinin çeşitli stilendirme yöntemlerini, özellikle de popüler olan Low Rank Adaptation (LoRA) gibi yöntemleri desteklediğini belirtirler.

Veri ve Testler

VideoPainter, CogVideo-5B-I2V modeli ve metin-videoya eşdeğer modeli kullanılarak eğitilmiştir. VPData koleksiyonu, 480x720px’de ve 1×10-5 öğrenme hızında kullanılmıştır.

ID Resample Adapter, 2.000 adımda ve context encoder, 80.000 adımda AdamW optimizer kullanılarak eğitilmiştir. Eğitim, 64 NVIDIA V100 GPU’su (kağıtta bu GPU’ların 16GB veya 32GB VRAM’e sahip olup olmadığı belirtilmemiştir) kullanılarak iki aşamada gerçekleştirilmiştir.

Test için, Davis rastgele maskeler için ve yazarların kendi VPBench için segmentasyon tabanlı maskeler için kullanılmıştır.

VPBench veri seti, nesneleri, hayvanları, insanları, manzaraları ve çeşitli görevleri içerir ve dört eylemi kapsar: ekle, sil, değiştir ve değiştir. Koleksiyon, 45 6 saniyelik video ve ortalama 30 saniyelik 9 video içerir.

Süreç için sekiz ölçüt kullanılmıştır. Maskeli Bölge Korunması için, yazarlar Peak Signal-to-Noise Ratio (PSNR); Öğrenilen Algısal Benzerlik Ölçütleri (LPIPS); Yapısal Benzerlik Endeksi (SSIM); ve Ortalama Mutlak Hata (MAE) kullanmışlardır.

Metin hizalaması için, araştırmacılar CLIP Benzerliği kullanmışlardır, hem klibin altyazısı ile gerçek içeriği arasındaki semantik mesafeyi değerlendirmek hem de masked bölgelerin doğruluğunu değerlendirmek için.

Çıktı videolarının genel kalitesini değerlendirmek için, Fréchet Video Mesafesi (FVD) kullanılmıştır.

Video inpainting için nicel bir karşılaştırma turu için, yazarlar sistemlerini ProPainter, COCOCO ve Cog-Inp (CogVideoX) gibi önceki yaklaşımlarla karşılaştırmışlardır. Test, ilk kareyi resim inpainting modelleri kullanarak doldurmayı ve ardından bir resimden videoya (I2V) omurga kullanarak sonuçları bir dizi latents birleştirme işlemine aktarmayı içermiştir, bu, bir 2023 makalesinden önerilen bir yöntemdir.

Proje sitesinin tamamen işlevsel olmaması ve projenin ilgili YouTube videosunun tüm örnekleri içermeyebileceği nedeniyle, kağıptaki sonuçları göstermek için partial statik sonuçlar sunacağız ve makaleyi projeden çıkardığımız bazı video örnekleriyle kapatacağız.

VideoPainter ile ProPainter, COCOCO ve Cog-Inp arasında VPBench (segmentasyon maskeleri) ve Davis (rastgele maskeler) üzerinde nicel karşılaştırma. Ölçütler, masked bölge korunması, metin hizalaması ve video kalitesini kapsar. Kırmızı = en iyi, Mavi = ikinci en iyi.

VideoPainter ile ProPainter, COCOCO ve Cog-Inp arasında VPBench (segmentasyon maskeleri) ve Davis (rastgele maskeler) üzerinde nicel karşılaştırma. Ölçütler, masked bölge korunması, metin hizalaması ve video kalitesini kapsar. Kırmızı = en iyi, Mavi = ikinci en iyi.

Bu nitel sonuçlar hakkında yazarlar şunları söylemektedirler:

‘Segmentasyon tabanlı VPBench’te, ProPainter ve COCOCO, çoğu ölçütte en kötü performansı gösterir, bu principalmente tam masked nesneleri dolduramama ve tek omurgalı mimarinin arka plan korunması ve ön plan oluşturması arasında denge kurma zorluğundan kaynaklanmaktadır.

‘Rastgele maske benchmark’inde Davis’te, ProPainter, kısmi arka plan bilgisini kullanarak iyileşme gösterir. Ancak, VideoPainter, çift dal mimarisi sayesinde, hem segmentasyon (standart ve uzun uzunluk) hem de rastgele maskelerde optimal performansı gösterir, bu mimari arka plan korunmasını ön plan oluşturmadan ayırmaya yardımcı olur.’

Araştırmacılar, ardından statik nitel test örnekleri sunarlar, bunlardan bir seçki aşağıda gösterilmektedir. Tüm durumlarda, daha iyi çözünürlük ve ayrıntı için lütfen projenin web sitesine veya YouTube videosuna bakın.

Önceki çerçevelerdeki inpainting yöntemleriyle karşılaştırma.

Önceki çerçevelerdeki inpainting yöntemleriyle karşılaştırma.

 

Çalma için tıklayın. Proje sitesindeki ‘sonuçlar’ videolarından bizim tarafımızdan oluşturulan örnekler.

Bu nitel video inpainting turu hakkında yazarlar şunları söylemektedirler:

‘VideoPainter, video tutarlılığı, kalitesi ve metin altyazısına hizalaması açısından tutarlı olarak üstün sonuçlar gösterir. Özellikle, ProPainter, yalnızca arka plan piksel propagasyonuna güvenerek tam masked nesneleri oluşturamaz.

‘COCOCO temel işlevselliği gösterir, ancak tek omurgalı mimarisi nedeniyle masked bölgelerde tutarlı kimliği koruyamaz (tutarsız gemi görünümü ve aniden değişen arazi).

‘Cog-Inp temel inpainting sonuçları elde eder, ancak birleştirme işleminin maske sınırlarını tespit edememesi önemli hatalara yol açar.

‘Dahası, VideoPainter, kimlik tutarlılığını korurken bir dakikadan uzun süren tutarlı videolar üretebilir, bu da bizim ID yeniden örnekleme yeteneğimiz sayesinde mümkündür.’

Araştırmacılar, ayrıca VideoPainter’in altyazıları güçlendirmek ve bu yöntemle daha iyi sonuçlar elde etmek yeteneğini test etmişlerdir, sistemi UniEdit, DiTCtrl ve ReVideo ile karşılaştırmışlardır.

Üç önceki yaklaşımla video düzenleme sonuçları.

Üç önceki yaklaşımla video düzenleme sonuçları.

Yazarlar şunları söylemektedirler:

‘Hem standart hem de uzun videolar için VPBench’te, VideoPainter üstün performansı gösterir, hatta sonradan ReVideo’yi geçer. Bu başarı, arka plan korunması ve ön plan oluşturması yeteneklerini mükemmel bir şekilde dengeleyen çift dal mimarimize atfedilebilir, ayrıca inpainting bölgesi ID yeniden örnekleme yeteneğimiz, uzun video düzenlemede kimlik tutarlılığını sağlar.’

Bu ölçüt için kağıtta statik örnekler bulunmakta, ancak bunlar aydınlatıcı değildir, bu nedenle okuyucuyu projenin çeşitli videolarına yönlendirmekteyiz.

Son olarak, 30 kullanıcıdan oluşan bir insan çalışması yapılmıştır, bu çalışmada katılımcılara VPBench ve düzenleme alt kümelerinden 50 rastgele seçilmiş oluşturma gösterilmiştir. Örnekler, arka plan korunması, promta hizalama ve genel video kalitesini vurgulamıştır.

Kullanıcı çalışması sonuçları için VideoPainter.

Kullanıcı çalışması sonuçları için VideoPainter.

Yazarlar şunları söylemektedirler:

‘VideoPainter, mevcut temel ölçütlere karşı üstün performans gösterir ve her iki görevde tüm değerlendirme kriterleri boyunca daha yüksek tercih oranlarına ulaşır.’

Ancak, VideoPainter’in üretiminin kalitesinin temel modele bağlı olduğunu ve karmaşık hareket ve fizikle başa çıkma konusunda zorluklar yaşayabileceğini kabul etmektedirler; ayrıca, düşük kaliteli maskeler veya hizasız altyazılarla da kötü performans gösterdiğini gözlemlemektedirler.

Sonuç

VideoPainter, literatüre değerli bir katkı gibi görünmektedir. Son çözümler gibi, önemli hesaplama talepleri vardır. Ayrıca, projenin web sitesindeki birçok örnek, sunulan en iyi örneklerden çok uzaktadır; bu nedenle, bu çerçeveyi gelecekteki girişlerle ve daha geniş bir dizi önceki yaklaşımla karşılaştırmak ilginç olacaktır.

 

* Bu bağlamda ‘video düzenleme’, ‘çeşitli klipleri bir diziye monte etme’ anlamına gelmez, bu terimin geleneksel anlamı budur; ancak, makine öğrenimi tekniklerini kullanarak mevcut video kliplerinin iç içeriğini doğrudan değiştirme veya değiştirme anlamına gelir.

İlk olarak 10 Mart 2025’te yayınlandı. 25 Temmuz 2026’da videoyu değiştirmek için güncellendi.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai