Anderson’un Açısı
Nesneleri ve Kişileri Videodan Silmek için Yapay Zeka Kullanma

Hayır, çocuk resimde kalmaz, yapay zeka ietsi varsa.
Görüntülerden ve videolardan nesne ve insan silme, VFX odaklı yapay zeka literatüründe popüler bir araştırma alt dalıdır ve bu zorluğu ele alan adanmış veri setleri ve çerçeveler giderek artmaktadır. Çin’in Fudan Üniversitesi’ndeki Büyük Veri Enstitüsü’nden sonuncusu, EffectErase adlı bir ‘etki-farkında’ video nesne silme sistemidir ve yazarlar, bu sistemin testlerde mevcut durumdan önemli ölçüde daha iyi performans gösterdiğini iddia etmektedirler:
Proje web sitesinden derlenen örnekler, EffectErase yönteminin örneklerini göstermektedir (lütfen not edin ki, bir bağlantı sağlasak da, kaynak site birçok yüksek çözünürlüklü ve optimize edilmemiş otomatik oynatma videoları içerir, bu da web tarayıcınızın kararlılığını etkileyebilir. Eklenen YouTube videosu daha kolay ve daha đầyamlı bir referanstır ve makalenin sonunda gömülmüştür). Kaynak
Yeni çalışma, yaklaşık 350 orijinal gerçek dünya ve sentezlenmiş sahne içeren yarı yeni bir veri setinin oluşturulması ve kürasyonu içeriyordu (kamuya açık depolar kullanılarak*), bu sahneler ya özel ekipmanla kaydedildi ya da açık kaynaklı Blender 3D çerçevesi etrafında oluşturulan bir iş akışına yeniden amaçlandı.
Melez Video Nesne Silme (VOR) veri seti, EffectErase uygulamasının temelini oluşturur ve bu uygulama, Wan2.1 video oluşturma sistemine dayanır. Sistem ayrıca iki yeni ilgili test standardını tanımlar: VOR Eval ve VOR Wild – sırasıyla, zemin truth’ü olan ve olmayan örnekler için.
(Makale, ek bir proje sitesine sahiptir, ancak bu site çok sayıda yüksek çözünürlüklü video ile aşırı yüklenmiştir ve yüklenmesi zordur; bu nedenle, projenin sitesini kullanmakta zorlanıyorsanız, yukarıda gömülmüş videoyu referans olarak kullanabilirsiniz)

Benzer önceki veri setleri ile karşılaştırıldığında miktarların karşılaştırılması. Kaynak
Araştırmacılar, approach’un hem nicel metriklerde hem de insan çalışmasıyla belirlenen nitel sonuçlarda devlet-sanat performansını sağladığını iddia etmektedirler.
Önceki çalışmaların, nesnenin yan etkilerini, gölgeleri ve yansımları silmeyi her zaman başaramadığını ve veri setlerinin bu eksikliği gidermek için özenle oluşturulduğunu not etmektedirler:

Önceki yaklaşımların, silinmek istenen nesneye ek olarak ikincil göstergeleri, gölgeleri ve yansımları dikkate almadıklarına dair örnekler.
Yeni makale, EffectErase: Yüksek Kaliteli Etki Silme için Birlikte Video Nesne Silme ve Ekleme olarak adlandırılmıştır ve Fudan Üniversitesi Bilgisayar Bilimi ve Yapay Zeka Koleji’nden dört araştırmacı tarafından yazılmıştır.
Yöntem
Melez VOR veri seti, videoya bir nesne veya insan silmeye çalışmanın tüm sonuçlarını kapsayacak şekilde tasarlanmıştır:

VOR veri setinden çiftlenmiş çerçeveler, nesne silmenin görünür konuya değil, onunla ilişkili etkilere de uzanması gerektiğini gösterir, örnekler olarak örtme, gölge, aydınlatma değişiklikleri, yansıma ve fiziksel deformasyon gösterir.
Beş temsilci ‘etki’ türü, yazarlar tarafından örtme olarak tanımlanmıştır, çeşitli cam ve duman örtme türlerini içerir; gölgeler; aydınlatma (örneğin, silinecek bir nesne ışık yolunu oluşturur veya değiştirir); yansıma; ve deformasyon (örneğin, bir kullanıcı bir yastığın izini bırakır, bu iz nesnenin silinmesiyle birlikte kalmamalıdır).

VOR için veri seti inşaat pipeline, Blender tarafından üretilen sentetik sahneleri gerçek dünya kayıtları ile birleştiren, sentetik veri 3D ortamlardan, nesnelerden ve kamera yollarından oluşur ve gerçek kayıtlar çeşitli sahnelerden kaydedilir, Ken Burns hareketi ile artırılır.
Gerçek dünya orijinal verisi için araştırmacılar, geniş bir ortam, günün saati ve hava koşulları yelpazesi boyunca ‘var’ ve ‘yok’ sahnelerini kaydetmek için sabit kameralar kullandılar.
Sentezlenmiş veriler için, çoklu görüş açıları oluşturuldu, çoklu nesne senaryoları oluşturuldu, kasıtlı olarak karmaşık ve zorlu kamera hareketleri içeriyordu, gerçek dünya kayıtlarında ortaya çıkabilecek türden; ve araştırmacılar, bu yaklaşımın, benzer Remove Objects with Side Effects in Videos (ROSE) veri seti için kullanılan yaklaşımdan daha sofistike ve çaba gerektiren olduğunu gözlemlemektedirler.
Hareket çeşitliliği, Ken Burns efektinin kamera kayıtlarına uygulanmasıyla artırildi, kontrollü panlar, zumlar ve hafif el hareketleri 14 önceden tanımlanmış kural altında eklendi, her çift için beş hareket deseni örneklendi, mentre krop içindeki orijinal çerçevenin içinde kaldı.
Ölçek ve çeşitlilik, sentetik nesneleri çoklu kamera kurulumları ile birleştirmek suretiyle daha da genişletildi, maskeler, ana çerçevelerde manuel nokta ipuçları yerleştirilerek, Segment Anything 2 (SAM2) ile segmentasyon propagasyonu, sonuçların temizlenmesi ve rafine edilmesi ve eğitim için geçerli ön plan, arka plan ve maske üçlüsünün oluşturulmasıyla oluşturuldu.
Final koleksiyon, 60.000 çift video, gerçek ve sentetik, 366 nesne sınıfını 443 sahne boyunca kapsayan 145 saatlik videoya ulaştı.
EffectErase ağı, bir Variational Auto-Encoder (VAE†) aracılığıyla girdi alır, gürültü giderme Wan2.1 tarafından işlenir. Bu iskelet üzerinde, EffectErase Silme-Ekleme Birlikte Öğrenme, Görev-Farkında Bölge Rehberliği (TARG) ve Etki Tutarsızlık Kaybı işlemlerini gerçekleştirir:

EffectErase çerçevesi şeması. Eğitim sırasında, çiftlenmiş videolar paylaşılan bir latent uzaya kodlanır, gürültü ile birleştirilir ve görev-farkında çapraz dikkat tarafından yönlendirilen bir difüzyon transformatörü ile işlenir, ayrıca bir etki tutarlılık kaybı, silme ve ekleme bölgelerini hizalar, böylece her iki görev aynı alana odaklanır.
Kendileri, silme ve ekleme işlemleri, paylaşılan bir difüzyon iskeleti kullanarak birlikte eğitilir, böylece model aynı etkilenen bölgelere ve yapısal ipuçlarına odaklanmayı öğrenir.
Videolar, arka plan videoları ve maskeler, önce latent uzaya kodlanır; sonra gürültü eklenir ve model, görev-spesifik rehberlik altında temiz temsilimleri geri kazanmayı öğrenir. Bir hafif adaptör, gürültülü özellikler ile silme veya ekleme koşullarını birleştirir, böylece her iki görev aynı gözetimi paylaşabilir, ancak masih kontrol edilebilir.
Görev-Farkında Bölge Rehberliği, görev-spesifik bir sinyal oluşturmak için dil tokenlerini, CLIP kullanarak ön plan nesnesinden çıkarılan görsel özelliklerle birleştirir, böylece model, bir nesne ve onun görsel etkilerinin zaman ve mekan boyunca nasıl evrimleştiğini takip edebilir ve görevler arasında esnek bir şekilde geçiş yapabilir.
Etki Tutarsızlık Kaybı, silme ve ekleme işlemlerinin aynı değişen alanlara odaklanmasını sağlar, çünkü her iki görev de aynı nesne ve onun görsel etkileriyle ilgilenir. Her dalın dikkat haritaları, yumuşak bölge haritalarına birleştirilir ve nesne ve arka plan videolarından hesaplanan bir fark haritası ile hizalanır, böylece ince değişiklikler gibi aydınlatma ve gölgeler korunur. Bu ek kayıp, ekleme işleminin silme işlemini yönlendirmesine ve her iki görevin tutarlı kalmasına yardımcı olur.
Veri ve Testler
Araştırmacılar, approach’unu çeşitli dolgu, video dolgu ve nesne silme yöntemleri ile karşılaştırdılar: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; ve MiniMax-Remover.
Wan2.1, LoRA†† kullanarak VOR veri seti ile 832x480px çözünürlükte fine-tune edildi. 81 ardışık çerçeve (WAN için etkili sınır, bu sınırın ötesinde hatalar oluşmaya başlar) eğitim için rastgele örneklendi, eğitim 129.000 iterasyon için sekiz H100 GPU’sunda, her biri 80GB VRAM ile, toplu işleme boyutu 8 olarak gerçekleştirildi. Öğrenme oranı 1×102 olarak ayarlandı ve LoRA rank 256 olarak ayarlandı.
ROSE-Benchmark sentetik koleksiyonu, test edilen tek dış veri setiydi; diğer iki veri seti VOR-Eval, VOR veri seti test bölümü; ve VOR-Wild, 195 gerçek video içeren bir test kümesi, internetten derlenen ‘dinamik nesneleri’ içerir.
Kullanılan metrikler Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); ve Fréchet Video Distance (FVD) idi. VOR-Wild’den 195 üretilen video için bir kullanıcı çalışması da dikkate alındı, 20 gönüllüden ortalama derecelendirmeler alındı.
Ek olarak, yazarlar QScore adlı bir metriği, Qwen-VL çok modelli modelini kullanarak, silinen nesnelerin kalitesini, kalan artifacts veya çevre silme etkilerini değerlendirmek için geliştirdiler:

ROSE ve VOR benchmark’lerinde nicel karşılaştırma, en iyi ve ikinci en iyi sonuçlar kalın ve alt çizgili olarak gösterilir.
Bu sonuçlar hakkında, yazarlar şunları not etmektedirler:
‘Mevcut görüntü dolgu yöntemleri, 2D modelleri kullanarak tek tek çerçeveler üzerinde çalışır ve bu nedenle videolarda zaman tutarlılığını korumakta başarısız olurlar.
Video dolgu yöntemleri, nesne yan etkilerini açıkça modellemez, bu da silme işleminin doğal olmayan sonuçlara yol açmasına neden olur. Mevcut video nesne silme yöntemleri, nesne ve yan etkileri arasındaki uzaysal-zamansal korelasyonu modellemez ve bu nedenle genellikle artifacts ve silinen nesnelerin kalıntılarını üretirler.
‘Genel olarak, EffectErase tüm veri setlerinde ve değerlendirme metriklerinde devlet-sanat performansını gösterir. Video kalitesi metriği FVD’de en iyi puanları alır, bu da üretilen videoların üstün zaman tutarlılığını ve pürüzsüzlüğünü gösterir.
‘Yöntemimiz ayrıca en yüksek QScore ve kullanıcı geri bildirim puanlarını alır, bu da silme sonuçlarının görsel olarak inandırıcı olduğunu kanıtlar.’
Niteliksel değerlendirme için, statik sonuçlar makalede doğrudan verilmiştir, ayrıca hareketli sonuçlar projenin sitesinde ve eklenen YouTube video sunumunda mevcuttur:

VOR-Eval üzerinde örtme, gölge, aydınlatma, yansıma ve deformasyon durumları için nitel karşılaştırma. Dolgu yöntemleri, maske dışındaki etkileri silmekte zorlanırlar, silme modelleri ise genellikle görünür artifacts bırakırlar. EffectErase, hem hedef nesneleri hem de ilişkili etkilerini daha temiz bir şekilde siler. Kaynak makale için daha iyi bir çözünürlük ve proje sitesindeki video örnekleri için lütfen kaynak makaleye bakınız.
Bu sonuçları referans olarak aldığımız diğer ilgili örnekler için lütfen projenin sitesine ve makalenin sonunda gömülü resmi videolara bakınız:
Oynatmak için tıklayın. EffectErase projenin sitesinden bir karşılaştırma örneği. Daha iyi bir çözünürlük ve daha fazla örnek için lütfen siteye bakınız.
Yazarlar şunları not etmektedirler:
‘Video dolgu yöntemleri, maske alanlarında artifacts üretirler ve silinen nesnelerin yan etkilerini tam olarak silmeyi başaramazlar. Önceki nesne silme yaklaşımları, ROSE ve MinMax-Remover gibi, hedef nesneleri silmekte iyi performans gösterir, ancak yan etkileri silmekte zorlanırlar, özellikle örtme, gölge, aydınlatma, yansıma ve deformasyon durumlarında.
‘EffectErase, hem hedef nesneleri hem de ilişkili etkilerini daha temiz bir şekilde siler, bu da temiz, tutarlı ve yüksek kaliteli sonuçlar üretir.’
Araştırmacılar, yöntemlerinin ayrıca ekleme görevleri için uyarlanabileceğini, ek eğitim gerektirmeden, not etmektedirler:

Video nesne ekleme sonuçları. EffectErase, nesneleri eklerken arka plan içeriğini korur ve kareler boyunca tutarlı nesne-indüklenen etkileri üretir, gölgeler ve yansımalara örnekler verilir.
Ekleme görevi için video sonuçları, (zaman-specific) YouTube video örneklerinde görülebilir (ayrıca makale sonunda zaman damgasız olarak gömülmüştür).
Sonuç
Literatürdeki benzer projelere bakıldığında, birçok çalışmanın, genel amaçlı VFX modellerinin sonunda bu tür işlevselliği genel bir ‘araç seti’ modeline katlayabileceğini ummaktadır, sadece bu özel görev için değil, çeşitli efektler için tasarlanmış bir model.
Ancak, ‘her şeye yeten bir araç’ ilkesine göre, özel sistemlerin, EffectErase gibi, genel amaçlı yaklaşımlara göre bir avantajı olacağı düşünülüyor; ancak bu fark, zamanla daralabilir ve özel bir modeli eğitmek için ek çabanın gereksiz olabileceği bir seviyeye ulaşabilir.
* Artan IP-kaynak endişeleri ile, umarız ki tüm bu kaynaklar atıfta bulunacaktır; ancak yeni çalışmanın materyalleri 3D modellerinin kaynağını listelemekte ise, bu referansı bulamadım.
† Verilen referans, 2013’ten generic bir açıklama metnidir, ancak spesifik VAE ayrıntıları verilmemektedir.
†† Makaleden alınan bu, fine-tuning ve LoRA’nın farklı süreçler olduğu ve çok farklı talepleri olduğu için anlamsal olarak belirsiz bir tanımdır.
İlk olarak 21 Mart 2026 Cumartesi günü yayınlandı.












