Anderson’un Açısı
Bulanık Video Görüşmelerini Gerçek Zamanlı Olarak Sadece CPU Kullanarak Düzeltme

Yeni bir yöntem, kullanıcının yüzünün AI modelini saniyeler içinde oluşturur ve gerçek zamanlı olarak bulanık video görüşmelerini düzeltir – güçlü donanım veya bulut işleme ihtiyacı olmadan, yalnızca temel bir laptop CPU’su kullanarak.
Düşük kaliteli video sohbet görüntüleri ile en çok etkilenen kullanıcılar, kaynakları kısıtlı ülkelerdeki kullanıcılar olsa da, bu sorun sık sık bir “birinci dünya” sorunu olarak da ortaya çıkabilir – örneğin, sohbetin bir katılımcısı aşırı yüklenmiş bir Wi-Fi hotspot kullanıyorsa veya bir başka işlem veya kişi katılımcının evindeki mevcut bant genişliğini domine ediyorsa veya hatta o kişi düşük bağlantıya sahip bir ülkeyi ziyaret ediyorsa.
Çünkü sorun yaygındır, belirli bir miktar dikkat bu konuda araştırma literatürüne odaklanmıştır ve önerilen çözümler deblocking, denoising, süper çözünürlük ve çeşitli diğer yöntemler aracılığıyla sunulmuştur. 2022’den VQFR sistemi, düşük kaliteli yüz görüntülerini, öğrenilen bir kod kitabından daha yüksek kaliteli temsilcilerle değiştirerek geri yükler; 2021’in GFP-GAN‘i, LQ görüntülerini iyileştirmek için generatif yüz öncellerini kullanır ve RTFVE: Gerçek Zamanlı Yüz Video İyileştirme yüksek kaliteli referans görüntülerini kullanarak yüz geri yüklemesi gerçekleştirir:
İhtiyaca göre oynatın. 2025 RTFVE yüz iyileştirme projesinden, GPU hızlandırılmış yüz iyileştirmesi. Kaynak
Kaynakları kısıtlı olan kullanıcıların bakış açısına göre, bu çözümlerin çoğu uygulanabilir değildir, çünkü işleri GPU’ya devrederler ve bu GPU, o kullanıcının kurulumunda mevcut olmayabilir. Ancak, bilgisayar görme görevleri için CPU’yu kullanmak genellikle bir offline işlemdir, yani çıktı kullanılabilir olmeden önce CPU’nun işleme tamamlamasını beklemek gerekir.
Bu, video sohbet senaryosu için kabul edilemezdir, çünkü bu kaynak açığı olan ancak aynı zamanda kaynak açığına sahip olan bir senaryodur: gerçekten demokratik bir yüz iyileştirme sistemi, en az 24 kare/saniye ve makul bir çözünürlükte CPU’da çalışmak zorundadır ve bu, çok şey istemek demektir.
Yüzle Karşılaşma
Bu talepkar senaryoya, ABD’den yeni bir araştırma teklifi cevap veriyor ve yazarlar, bu sistemin, izleyicinin yüzünün saniyeler içinde bir modelini oluşturabileceğini, ardından bu modelin, videokonferans uygulamaları gibi resmi API katmanları aracılığıyla kullanıcı ve konferans arasında bir ara katman olarak çalışabileceğini iddia ediyorlar:
İhtiyaca göre oynatın. FSFVE projesi sayfasından, web kamerası senaryosunda yüzlerin örnek iyileştirmeleri, 3,5 MB’lik bir modelle iki dakikadan kısa bir sürede eğitilir. Kaynak
Makalede şöyle deniyor:
‘FSFVE modeli, bir videokonferansın hemen öncesinde veya çağrı başlangıcında eğitilebilir. Sadece birkaç yüksek kaliteli görüntü gereklidir; örneğin, 5 ila 30 görüntü, bu da az-örnek öğrenmesini sağlar. Çağrı öncesinde veya çağrı başlangıcında, kullanıcının birkaç saniyelik yüksek kaliteli videosu elde edilebilir; örneğin, 3 saniye, 24 kare/saniye (FPS) çerçeve hızını varsayarsak, 3 ∗ 24 = 72 kare sağlar.’
‘Bu yüksek kaliteli video, videokonferans ayarlarına göre hızlı bir şekilde düşük kaliteli videoya dönüştürülebilir ve ardından düşük ve yüksek kaliteli çerçevelerle model eğitilir.’
Yeni sistemin dikkat çekici bir özelliği, modelin işlenmesinin “kimin ödediği”ne ilişkin esnekliğidir; eğer izleyici kendisi herhangi bir nedenle modelin eğitimini gerçekleştirecek CPU gücünü sağlayamıyorsa, bu, yüksek kaliteli birkaç çerçeveyi göndererek karşılık gelen kullanıcıya devredilebilir ve model böylece “uzaktan” kaynak açığına sahip kullanıcıya eğitilir.
Alternatif olarak, eğitim, sistematik olarak bir sunucuya devredilebilir. Yazarlar gözlemliyor:
‘Sunucu, cihazların eğitim için çok yavaş olduğu (veya değilse bile, görevden kurtulmak için) durumlarda kullanılabilir.
‘Her durumda, modelin boyutu nispeten küçüktür (yaklaşık 3,5 MB) ve birkaç yüksek kaliteli çerçeve, ve eğitim tamamlandıktan sonra, model tipik bir laptop CPU’sunda gerçek zamanlı olarak çalışabilir.’
Testlerde, modeller, önceden yapılan çalışmalarla (bahsedilen RTFVE dahil) karşılaştırıldığında, FSFVE, sıkıştırılmış video, CPU-optimized ResNet ve değiştirilmiş RTFVE-0 modeli dahil olmak üzere tüm karşılaştırılan modelleri geride bıraktı ve hala CPU’da gerçek zamanlı olarak çalışıyordu.
Yeni makale, FSFVE: Az-Örnek Sıkıştırılmış Yüz Video İyileştirme başlığını taşıyor ve bir demo ve bir GitHub deposu ile birlikte geliyor.
Yöntem
FSFVE, açık FaceForensics++ veri seti* üzerinde eğitildi, bu veri seti, konuşan aktörlerin 363 1080p videosundan oluşuyor ve yazarlar, bu veri setinden “duvara karşı konuşma” kategorisini, tipik bir video konferansına en yakın stil olarak çıkardılar:
İhtiyaca göre oynatın. FaceForensics++ veri setinden örnekler. Kaynak
Bu alt küme, her biri yaklaşık 972 kare olan 27 videoya karşılık gelir – çoğunlukla ön görüşler, ancak bazı yan görüşler de vardır.
Video konferans bağlantı sorunlarını simüle etmek amacıyla tasarlanan düşük kaliteli videolar, H264 ve H265 video kodekleri kullanılarak veri setini sıkıştırmak suretiyle oluşturuldu. Sıkıştırma seviyeleri, 36, 40 ve 44 (0’ın kayıpsız ve 51’in çok bloklu olduğunu düşünerek) aralığında bir CRF aralığına ayarlandı.
Her kare, BlazeFace yüz dedektörü kullanılarak yüzün etrafındaki 256 × 256 bölgesine kırpıldı, ardından yüz hizalandı, gözler bulundu ve yüzü tutarlı bir konuma getirmek için bir affine warp (dönüş, ölçek ve kaydırma) uygulandı, böylece gözler seviyede kalır ve tüm kareler boyunca yaklaşık olarak aynı konumda kalırlar.
Bu, Face Recognition kütüphanesi ile gerçekleştirildi:
Face Recognition Python kütüphanesi ile bir görüntüden yüz çizgilerini çıkarmak için bir örnek. Kaynak
Model, yalnızca bir video konferansından birkaç kareden öğrenmek üzere tasarlandığından, eğitim çerçeveleri, mümkün olduğunca fazla yüz varyasyonunu yakalamak zorundadır. Bu nedenle, k-ortalamalı kümeleme daha basit seçim yöntemleri yerine (örneğin, rastgele örneklem veya sabit aralıklar) kullanıldı.
Her kırpılmış ve hizalanmış kare, yukarıda bahsedilen RTFVE yüz kodlayıcısına geçirilerek bir sayısal temsil oluşturuldu, ardından k-ortalamalı kümeleme, benzer çerçeveleri 30 küme halinde grupladı. Bu kümeleme işlemi, en iyi gruplandırmayı elde etmek için beş kez tekrarlandı ve her küme merkezine en yakın kare eğitim için seçildi. Bu işlem, her video için 30 farklı görüntü üretti.
Eğitim ve Testler
Modeller, 100 epoch için eğitildi, bu, çok az sayıda görüntü olduğu düşünülürse oldukça düşüktür. Ancak, yazarlar gözlemliyor ki, bu senaryoda aşırı uyumlu bir model aslında arzu edilir, hatta tüm olası olayları, örneğin alışılmadık yüz ifadelerini, pozları veya yüz özelliklerinin gizlenmesini veya bulanıklaştırılmasını yakalayamasa da. Öncelikler, orta düzeyde esneklik genelleme ve eğitim hızıdır.
RAdam optimizatörü, 10-4 öğrenme hızında kullanıldı.
İlk testler için, sistem, orijinal sıkıştırılmış video; bir hafif ResNet gerçek zamanlı CPU çıkarımı için yapılandırıldı ve yukarıda bahsedilen RTFVE – gerçek zamanlı CPU yüz iyileştirme sisteminin tek diğer örneği ile karşılaştırıldı.
Adil bir karşılaştırma sağlamak için, RTFVE, çıkarım sırasında yüksek kaliteli referans görüntülerine bağımlılığını kaldırmak için değiştirildi, ancak benzer bir hız ve parametre sayısı korundu, bu da RTFVE-0 adlı bir varyant üretti. ResNet ve RTFVE-0 modelleri, L1 loss fonksiyonu kullanılarak eğitildi. Adil bir karşılaştırma sağlamak için, tüm modeller aynı RAdam optimizatörü ve eğitim ayarlarını kullandı, her video için ayrı bir model eğitildi.
Eğitim hızlandırmak için, düşük frekanslı DCT bileşenlerine (görme açısından en önemli görüntü detaylarına) daha büyük ağırlık veren özel bir frekans-alanındaki odak kaybı tanıtıldı, bu da modelin eğitim sırasında en önemli görüntü yapılarını önceliklendirmesini sağladı.
Ağırlık, JPEG luminance quantization matrixünden türetilmiştir, bu da modelin eğitim sırasında en önemli görüntü yapılarını önceliklendirmesini sağlar.
Nicel Testler
Hem teknik yeniden yapılandırma doğruluğu (bozulma) hem de algılanan görsel kalite testler için ölçüldü. Bozulma, Peak Signal-to-Noise Ratio (PSNR) ve Structural Similarity Index (SSIM) ile ölçüldü; ve algılanan kalite, Öğrenilen Algılanan Görüntü Yama Benzerliği (LPIPS) ile ölçüldü:
FSFVE’nin orijinal sıkıştırılmış video, CPU-optimized ResNet ve değiştirilmiş RTFVE-0 ile karşılaştırıldığı H.264 ve H.265 video için üç sıkıştırma seviyesinde performansı, daha yüksek PSNR ve SSIM daha iyi yeniden yapılandırma kalitesini ve daha düşük LPIPS daha iyi algılanan kaliteyi gösterir.
FSFVE, her sıkıştırma seviyesinde, orijinal sıkıştırılmış video ve CPU tabanlı diğer iyileştirme modellerini sürekli olarak geride bıraktı.
H.264 video ile, PSNR, CRF değerleri 36, 40 ve 44 için sırasıyla 1,11 dB, 1,37 dB ve 1,51 dB arttı, SSIM ve LPIPS’de daha yüksek sıkıştırma ayarlarında daha düşük LPIPS skorları ile birlikte iyileşmeler görüldü (daha iyi algılanan kaliteyi gösterir).
Benzer kazançlar H.265 ile kaydedildi, bu da yaklaşımın her iki büyük video kodeki boyunca etkili olduğunu gösteriyor. Aşağıdaki gibi, iyileştirme, sıkıştırma arttıkça daha belirgin hale geldi, bu da yöntemin düşük bant genişliği koşullarında özellikle iyi performans gösterdiğini gösteriyor:
Orijinal H.264 video ve geliştirilmiş çıktı için bitrate arttıkça PSNR. Düşük bit hızlarında açılan boşluk, FSFVE’nin en çok sıkıştırılmış, bant genişliği kısıtlı koşullar altında en büyük kalite kazançlarını sağladığını gösterir.
CPU-optimized ResNet ve RTFVE-0, orijinal sıkıştırılmış video üzerinde yalnızca mütevazı iyileştirmeler sağlarken, FSFVE her ikisini de 1,1 dB’den fazla aşarak, 30,24 kare/saniye hızında gerçek zamanlı performansını korurken, yalnızca yaklaşık bir milyon parametre içeriyordu.
Aşağıda gösterildiği gibi, performans, daha fazla eğitim çerçevesi sağlanadıkça sürekli olarak iyileşti. Sadece beş eğitim görüntüsü ile FSFVE, sıkıştırılmış video üzerinde 0,75 dB’den fazla PSNR iyileşmesi sağlarken, on eğitim çerçevesi 1 dB’den fazla iyileşme için yeterliydi – bu, yaklaşımın çok sınırlı eğitim verisi ile bile etkili olduğunu gösteriyor:
CRF 44 için görülmeyen H.264 video kareleri için eğitim kümesi boyutunun PSNR üzerindeki etkisi. Beş eğitim görüntüsü, sıkıştırılmış video üzerinde kaliteyi iyileştirdi ve daha fazla çerçeve kullanıldıkça performans arttı.
Nitel Testler
Nitel testlerin sonuçlarında, aşağıdaki gibi, CRF 44’de ağır sıkıştırılmış H.264 video kareleri ve karşılık gelen FSFVE çıktısı görülüyor:
CRF 44’de ağır sıkıştırılmış H.264 video kareleri ve karşılık gelen FSFVE çıktısı. Makalede, geliştirilmiş sonuçların, sıkıştırma artifactsını azalttığını, yüz yapısını geri yüklediğini ve daha pürüzsüz, daha doğal bir cilt ürettiğini, aynı zamanda konu’nun kimliğini ve ifadesini korurken iddia edildiği gibi. Daha iyi örnekler için lütfen kaynak PDF ve orijinal videolara bakın.
Yazarlar, sıkıştırılmış görüntülerin gözler, burun ve ağız etrafında belirgin artifactslar, doğal olmayan dokulu cilt ve yüz özelliklerindeki bozulmalar sergilediğini, oysa geliştirilmiş sonuçların bu kusurları önemli ölçüde azalttığını iddia ediyorlar:
‘İlk örnekte, gözler belirsiz görünüyor ve göz makyajının siyah rengi göz rengiyle birleşiyor. Dudaklarda aliasing belirtileri var. Kaşlar tanımsız ve cilt bozulmuş. İkinci örnekte, cilt çok dokulu ve benek artifactsı var.
‘Ağzın altında, çenenin şeklini değiştiren bloklama artifactsı var ve dikey çizgiler var.
‘Model, bu artifactsları gidererek, daha hoş bir görüntü oluşturur ve kaybedilen bazı ince detayları geri yükler.
‘Önemlisi, geliştirilmiş çıktı, videodaki kimliği korur.’
SONUÇ
Görünüşe göre, video sohbet verisi kalitesini artırmaya yönelik endüstri ve akademideki sürekli çabalar, sonunda video sohbetlerinde derin sahte video görüntülerini tanımlamaya yönelik karşıt çabalar ile çatışacaktır.
Çünkü, yeni makalede belirtildiği gibi, ara sistemler gibi FSFVE, resmi API’ler aracılığıyla video sohbet akışlarına uygulanabilir, bu nedenle işlenmemiş içerik, derin sahte karşıtı önlemler ortaya çıktıkça ve daha önemli hale geldikçe kullanılabilir:
* Yeni makalede ‘Derin Sahte Dedektör’ veri seti olarak bahsedilen, ancak bu bağlamda bile FaceForensics++ makalesinde yazarlar tarafından bu adla bahsedilmediği gibi.
İlk olarak 14 Temmuz 2026 Salı günü yayımlandı












