Anderson’un Açısı
AI Arka Planını Pahalı İnsan İşaretleme İle Değil, Temiz Bir Şekilde Kesebilir

Yeni bir araştırmaya göre, AI, videoyu pahalı insan işaretleme olmadan temiz bir şekilde kesebilir ve kalite ile stabiliteyi geliştirebilir
Çoğu insan, video sohbet platformlarında basit arka plan değiştirme/örtme filtreleri aracılığıyla arka plandan “çıkarıldığını” deneyimlemiştir ve bu sistemlerin sınırlılıklarını fark etmiştir – bu sistemler, video konferanslarında genellikle bulunan en yaygın durumlar için eğitilir ve genellikle beklenmedik nesnelere veya hatta öngörülebilir nesnelerine karşı dayanıklı değildir, örneğin parmaklar:

AI ile eğitilmiş bir ön plan çıkarma sisteminin kaynak konusundan çok fazla şey çıkardığı bir örnek. Kaynak
En kolay çözüm, özellikle görme-dil modelleri (VLM) için özel olarak eğitilmeyen görevler karşısında, mevcut bir modeli muhtemelen sistemin karşılaşacağı verilerde ince ayarlamak için kullanmaktır:

2020’de yayınlanan ‘Real-Time High-Resolution Background Matting’ makalesinde sunulan çözümlerin temelini oluşturan iki yüksek hacimli, titizlikle işaretleme yapılmış veri kümesi. Kaynak
Bununla birlikte, bu tür veriler insan tarafından işaretleme yapılması gerekir ve bu da bazı masraflar ve zaman maliyeti gerektirir; ve bu, çok özel ve genelleştirilmemiş bir araç ile sonuçlanır, bu da çok para maliyeti gerektirir ve genellikle daha geniş bir görev yelpazesi için kullanılamaz.
Genel olarak, bu tür “hedefe yönelik” modelleri geliştirmek, çeşitli alanlarda etkili çıkarıma ulaşmak için şu anda en kısa yoldur, sadece video ve görüntü matting (yani arka plan çıkarma/ön plan maskesi) değil.
Şimdilerde, Zoom gibi platformlarda AI güçlendirilmiş filtrelerin yaygınlaşmasına rağmen, Zoom hala yeşil ekran kullanmayı arka plan çıkarma için optimal çözüm olarak önermeye devam etmektedir – bu, çoğu insan için biraz profesyonellik gerektiren ve utandırıcı olabilecek bir çözümdür.
Kes!
Son zamanlarda, ilgi Segment Anything (SAM) ailesini kullanarak otomatik ve ince ayrıntı çıkarma sağlamak için artmıştır: SAM, böyle görevler için özel olarak eğitilmemiş olsa da, varsayılan sınırları, bir görsel efektler pipeline’ında kabul edilebilir bir standartta net konturlar sağlamak için uygun değildir:
Oynatmak için tıklayın, gerekirse. Bir Segment Anything modeli tarafından oluşturulan kaba sınırların bir örneği -注释 için ideal, ancak VFX çıkarma için yeterli değil. Kaynak
Çin’den yeni bir teklif, SAM modellerini daha gelişmiş bir şekilde kullanarak superior çıkarma süreçleri elde etmeyi önermiştir – bir temel takipçi gibi SAM’i, adanmış matting başlıkları ile bir bölge önerme köprüsüne bağlayarak: Bu şekilde, sistem, kenar ayrıntılarını yinelemeli olarak iyileştirebilmekte ve zorlu kenarları, örneğin hareket halindeki saçları çözebilmektedir:
Oynatmak için tıklayın, gerekirse. Yeni makaleyi destekleyen ek site上的 bir dizi video, yazarların çıkarma yönteminin sofistikasyonunu göstermektedir. Kaynak
Önemli olarak, yeni bileşik sistem yalnızca görüntülerde eğitilir, videolarda değil, ve ilave insan işaretleme gerektirmez – geleneksel olarak bu tür AI alanlarında ilerlemeye karşı gelen geleneksel engel.
Yeni yöntem ile elde edilen ince ayrıntı görüntü ve video matting örnekleri, zorlu durumlar gibi saç, saydamlık ve hareket gösterilirken, yöntemin daha temiz ve daha稳定 sonuçlar ürettiği iddia edilmektedir. Kaynak
Üç deneysel model üretilen çalışma için, yazarlar bu görevde yeni bir devlet-sanat performansı iddia etmektedirler, aynı zamanda temel modelin daha yüksek genelleme yeteneklerini korurken, bu da yöntemin, tek bir görev için özel olarak tasarlanmış bir araç yerine, ek yeteneklere sahip bir genel amaçlı model ürettiğini gösterir.
Yazarlar şöyle demektedir:
‘Kapsamlı deneyler, SAM2Matting’in hem görüntü hem de video matting’de devlet-sanat (SOTA) performansı elde ettiğini gösteriyor, video matting sıfır-shot şekilde değerlendiriliyor.
‘Ayrıca, geniş açık dünya sonuçları, hızlı hareket, karmaşık arka planlar ve hedef eklemeleri (örneğin, bisiklete binen bir adam) ile güçlü bir genelleme gösteriyor.
‘Dahası, matting bileşenlerimiz hafif ve verimlidir, bu da SAM2.1-Tiny varyantının 40 FPS’de 200 kare 1080p videoyu 5GB’dan az GPU belleği kullanarak çalıştırmasına olanak tanır.’
Yeni makale, SAM2Matting: Genelleştirilmiş Görüntü ve Video Matting olarak adlandırılmıştır ve Fudan Üniversitesi ve Shanghai Üniversitesi’nden dört yazar tarafından gelmektedir. Çalışmanın bir GitHub deposu vardır ve yazarlar, farklı varyantların kontrol noktalarını, çıkarım kodunu ve etkileşimli bir demo yayınlamıştır, eğitim kodunun da yakın zamanda yayınlanacağı sözü verilmiştir. Ayrıca, bir proje sitesi de mevcuttur.
Yöntem
Yazarların yöntemi, bir video nesne segmentasyonu (VOS) takipçisini kullanarak her kare için zamanla tutarlı bir kaba maske üretmek için takip ve ince ayrıntı çıkarmayı ayırır, ardından bir matting pipeline’si sınırları iyileştirir:
Esnek bir.prompt ve girdi videosunun bir VOS takipçisine girdi olarak verildiği, kaba bir maske üretilmesi ve bir ROI dedektörü tarafından iyileştirilmesi, ardından bir trimap’a dönüştürülmesi ve nihayetinde bir ilerlemeli çok ölçekli predictor tarafından yüksek ayrıntı matting üretimi.
Bir bölge-ilgi dedektörü daha sonra ince ayrıntı veya yarı saydam bölgeleri tanımlar ve bunları, matting’i iyileştirmek için rehberlik eden bir trimap (ön plan, arka plan ve belirsiz alanları ayıran üç bölge maskesi) oluşturmak için dönüştürür, ardından bir İlerlemeli Alpha Predictor, önceki tahmin ve görüntüden yararlanarak, kabadan inceye bir dizi ölçekte matting’i üretir.
Geleneksel matting sistemleri genellikle basit morfolojik işlemler veya doğrudan maskenin yeniden kullanımını kullanarak ilgi alanlarını türeterek, bu da ince ayrıntıları göz ardı edebilecek veya iyileştirme gerektirmeyen alanları içerebilecek şekilde davranabilir:

Standart mask-tabanlı işlemlerle ground-truth trimap’lerin karşılaştırılması, basit morfolojik işlemlerin kaba, uniform sınırlar ürettiğini ve saç ve saydamlık gibi ince yapıları kaçırdığını, bu da nihai matting’de ayrıntı kaybına yol açmaktadır.
Bileşik Faiz
Aksine, önerilen ROI Dedektörü, bu adımı, her bir görüntü pikselinin ayrı bir karar olarak ele alındığı ve matting-kritik bir bölgeye ait olup olmadığına göre bir etiket atandığı bir piksel-bazlı sınıflandırma görevi olarak ele alır, VOS maskesi, geçerli kare ve çok ölçekli görüntü özelliklerini entegre ederek, matting-kritik bölgeleri daha doğru bir şekilde tanımlar.
Yeni yaklaşımda, predicted ROI önce, bilinen alanları atayan takipçi maskesini kullanarak, kesin ön plan ve arka planı ayıran bir sahte-trimap’a dönüştürülür, ROI’nin belirsiz olarak işaretlenmesini sağlar, böylece sonraki işlemler, ayrıntı çözümü gerektiren sınırlara odaklanabilir.
İyileştirme, daha sonra, matting’i, kaba’dan inceye, bir dizi ölçekte, her aşamanın, görüntüyü, trimap’ı ve önceki tahmini kullanarak, yapıyı progressif bir şekilde keskinleştirmesi ve ince ayrıntıları geri kazanması için, bir İlerlemeli Alpha Predictor tarafından ele alınır.
Son aşama da, en yüksek çözünürlüklü çıktı, genişletilerek tamamlanmış matting üretimi için kullanılır, bu da geniş şekillerin erken aşamalarda kurulmasına ve daha ince unsurların, saç ve saydamlık gibi, daha sonraki geçişlerde çözülmesine olanak tanır.
Eğitim sırasında, yazarlar VOS takipçisini dondurur ve yalnızca matting bileşenlerini yüksek kaliteli görüntü verisi üzerinde eğitir, bu da ince ayrıntıların, takip tutarlılığının bozulmadan iyileştirilmesine olanak tanır. Gözetim, her kare için uygulanır, ilgi alanları, ground-truth alfa matting’den türetilir ve öğrenmeyi yönlendirmek için kullanılır, ROI dedektörü ise, kenar sınıflandırmasını doğru bir şekilde teşvik etmek ve keskin artifacts’ı azaltmak için tasarlanmış kayıplarla eğitilir.
Alfa tahmini için, birden fazla ölçekte kayıplar uygulanır, ayrıntı progressif olarak iyileştirilir ve ayrıca, predicted matting’in orijinal maske ile hizalanmasını sağlamak için bir ek kısıtlama uygulanır, bu da yapıyı korur ve boş veya kırık bölgelerin nihai çıktıda oluşmasını önler.
Veri ve Testler
Deneyler için sekiz görüntü matting veri kümesi kullanılmıştır: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; ve RefMatte; ve üç varyant SAM2.1-Tiny, SAM2.1-Base+ ve SAM3 olarak geliştirilmiştir.
Takipçi bileşeni dondurulur ve yalnızca matting bileşenleri optimize edilir. Tüm varyantlar beş epoch için dört NVIDIA A6000 GPU üzerinde eğitilir, her biri 48GB VRAM ayırır. Batch boyutu 32 olarak belirlenir, AdamW optimizer kullanılır. Kullanılan metriklere Ortalama Mutlak Fark (MAD); Ortalama Kare Hata (MSE); Grad; Bağlantı (Conn); ve dtSSD (sadece video matting için) dahildir.
Nicel Testler
Yazarlar, yeni sistemlerin nicel testlerine, görüntü matting için P3M-500-NP; AM-2K (‘GFM’ olarak sonuçlarda); MAM (‘Matte Anything’, sonuçlarda); E2E-HIM; Lightweight; ve PPM-100 (‘MODNet’, sonuçlarda) gibi benchmark’lerle başlamıştır:
P3M-500-NP, AM-2K testi ve PPM-100 üzerindeki nicel sonuçlar, tüm metriklere karşı daha düşük değerlerin daha iyi performansı gösterdiği, en iyi, ikinci en iyi ve üçüncü en iyi sonuçların sırasıyla kırmızı, turuncu ve sarı olarak vurgulandığı tablo. Lütfen daha iyi bir çözünürlük için kaynak makaleye bakınız.
Bu sonuçlardan, makale şöyle demektedir:
‘Gösterildiği gibi, SAM2Matting’in tüm varyantları, farklı metriklere karşı tutarlı bir şekilde önceki baseline’ları aşmaktadır. Örneğin, SAM2.1-Tiny varyantı, P3M-500-NP’de MAM’e göre 11.48 daha düşük MAD elde etmektedir.’
Yazarlar, sonuçların, yaklaşımın çekirdek kavramsal tasarımından kaynaklandığını, veri küratörlüğü düzeyinden değil, iddia etmektedir.
Video matting için, SAM2Matting, V-HIM60 ve VideoMatte üzerinde sıfır-shot bir ayarlamayla değerlendirilmiştir, video eğitimli sistemlerle MatAnyone2, MatAnyone, MaGGIe, FTP-VM ve RVM karşılaştırılmıştır, her iki orta ve zor ayarlarda tutarlı kazançlar rapor edilmiştir.
Tüm benchmark’lerde, üç varyant, MAD, MSE, Grad, Conn ve dtSSD’de daha düşük hatalar kaydeder, SAM3 en güçlü genel performansı elde ederken, en düşük dtSSD değerleri daha稳定 kare-kare tutarlılığı gösterir:
V-HIM60 ve VideoMatte üzerindeki video matting benchmark’ları, sıfır-shot bir ayarlamayla değerlendirilmiş, tüm metriklere karşı daha düşük hatalar, en iyi, ikinci en iyi ve üçüncü en iyi sonuçların sırasıyla kırmızı, turuncu ve sarı olarak vurgulandığı tablo.
Yazarlar, bu sonuçların, takipçinin zamanlı yapıyı korurken, matting modüllerinin sınır ayrıntılarına odaklandığı, ayrılmış tasarımından kaynaklandığını iddia eder, bu da, görüntü eğitimli modellerin, tam olarak denetimli video yaklaşımlarını aşmasına olanak tanır.
Nitel Testler
İnsan matting için nitel testlerde, yazarlar SAM2Matting’in rekabetçi baseline’ları aştığını bulmuşlardır:
İnsan ve vahşi video matting için nitel karşılaştırma, SAM2Matting’in RVM ve MatAnyone’e göre daha doğru ince saç telleri ve yarı saydam bölgeleri koruduğu, zorlu alanlarda daha temiz sınırlar ve daha az kayıp yapı üretdiği gösterilmektedir.
Mevcut video matting sistemleri gibi MatAnyone2 ve MaGGIe, genellikle insan odaklı ve domaine özgü veri kümeleri üzerinde eğitilir ve vahşi dizilerde, özellikle hızlı hareket eden konular gibi, genellemeye karşı zorluk çekebilir:
Vahşi diziler için nitel karşılaştırma, SAM2Matting’in MatAnyone2 ve MaGGIe’ye göre daha iyi yapıları ve zamanlı tutarlılığı koruduğu, özellikle non-insan konular, hızlı hareket ve yarı saydam unsurlar için gösterilmektedir. Lütfen daha iyi bir çözünürlük için kaynak makaleye bakınız.
Buna karşılık, SAM2Matting, zorlu senaryolarda da稳定 takip ve daha güvenilir ayrıntı çıkarma yeteneği göstermiştir.
Son olarak, aşağıdaki şekil, SAM2Matting’in, bisiklete binen insanlar veya kayak sopaları tutan gibi, nesnelere bağlı nesneleri etkili bir şekilde işlediğini ve yakın çevre kirliliğini bastırırken, temiz siluetleri koruyabildiğini göstermektedir.
Bağlı nesneler ve çevre kirliliği olan diziler için nitel karşılaştırma, SAM2Matting’in MatAnyone2’ye göre daha doğru yapıları koruduğu ve temiz siluetleri koruyabildiği gösterilmektedir.
Sonuç
Yeni makalede belirtilen başarılar, bilgisayar vizyonunda en eski görevlerden biri olan çıkarma işleminin, genellemeye karşı direnci ve çözülmemiş kalması açısından ne kadar ileri gittiğini göstermektedir. Görme tabanlı birçok modelde olduğu gibi, problem, çıkarma algoritmalarının domaine özgü bilgiye bağlı kalması ve bilinmeyen nesnelere karşı kolayca adapte olmamasıdır; bu görev, modelin genelleme yeteneklerinin dışına çıkmaktadır.
Yeni çalışma, bu bağımlılıktan bir adım ileridir, ancak bu görevin günlük hayatımızda, video sohbet portalları aracılığıyla ne kadar yerleşik olduğu düşünüldüğünde, masih uzun bir yol vardır.
İlk olarak 13 Temmuz 2026 Pazartesi günü yayınlanmıştır.












