Anderson’un Açısı
Sosyal Medya Videolarını Makine Öğrenimi ile Geri Yüklemek

Çin’den yapılan yeni bir araştırmada, WeChat ve YouTube gibi platformlarda otomatik olarak sıkıştırılan kullanıcı tarafından yüklenen videolara ayrıntı ve çözünürlük kazandırmak için etkili ve yeni bir yöntem sunuluyor.

Yeni yöntemin, sosyal medya platformlarının otomatik optimizasyonunun sonucu olarak atılan ayrıntıları yeniden çözme yeteneği açısından önceki yaklaşımlarla karşılaştırılması. Kaynak: https://arxiv.org/pdf/2208.08597.pdf
Önceki yöntemlerin aksine,.generic eğitim verilerine dayalı olarak videoları yukarıya çıkarma ve örneklemeye dayalı yöntemler kullanmak yerine, yeni yaklaşım her sıkıştırılmış video karesi için bir bozulma özellik haritası (DFM) türetir – efektif olarak karedeki en çok hasar gören veya bozulan bölgelerin bir özeti.

Yeni makalenin soykütüğü çalışmalarından: sağdan ikinci, ‘saf’ bir bozulma özellik haritasının (DFM) gerçek değerleri; sağdan üçüncü, DFM kullanmadan hasar tahmini. Sol, DFM ile çok daha doğru bir hasar haritası.
Geriatrik işlem, konvolüsyonel sinir ağları (CNN) gibi teknolojileri kullanarak, DFM’deki bilgiler tarafından yönlendirilir ve odaklanır, böylece yeni yöntem önceki yaklaşımların performansını ve doğruluğunu aşar.
Araştırmacılar, yüksek kaliteli videoyu dört popüler paylaşım platformuna yükleyerek, sıkıştırılmış sonuçları indirerek ve sıkıştırma kalıntılarını ve ayrıntı kaybını soyut bir şekilde öğrenen bir bilgisayar görme pipeline’ı geliştirerek işlemin gerçek değerini elde ettiler, böylece videoları neredeyse orijinal kaliteye geri yükleyebileceklerdi.
Araştırma materyali, Sosyal Medyada Paylaşılan Kullanıcı Videoları (UVSSM) adlı bir HQ/LQ veri setine derlenmiştir ve Baidu’da (parola: rsqw) sonraki araştırma projelerinin yararlanabileceği şekilde indirilmeye açık hale getirilmiştir.

İndirilebilir UVSSM veri setinden eşdeğer HQ/LQ örneklerinin karşılaştırması. Bu örneğin de birden fazla sıkıştırma turuna tabi olabileceğini unutmayın, bu nedenle daha doğru bir karşılaştırma için lütfen orijinal kaynak verilerine başvurun.
Sistemin kodu, Video restOration through adapTive dEgradation Sensing (VOTES) olarak bilinen bir isimle GitHub’da yayınlandı, ancak uygulaması beberapa çekme bağımlılıklarını içerir.
Makale, Sosyal Medyada Paylaşılan Kullanıcı Videolarının Geri Yüklenmesi olarak adlandırılmış ve Shenzhen Üniversitesi’nden üç araştırmacı ve Hong Kong Polytechnic Üniversitesi’nden bir araştırmacı tarafından yazılmıştır.
Sanal Gerçeklikten Gerçeklere
Sosyal medya videolarının kalitesini, Gigapixel gibi programların bazen aşırı ‘hayal gücü’ ile sağladığı ayrıntı ‘hayal gücü’ olmadan geri yüklemenin, bilgisayar görme araştırmaları için önemli sonuçları olabilir.
Bilgisayar görme tabanlı video teknolojileri araştırmaları genellikle YouTube ve Twitter gibi platformlardan elde edilen görüntüleri kullanır, ancak bu platformlarda kullanılan sıkıştırma yöntemleri ve kodlayıcılar gizli tutulmaktadır ve kolayca elde edilemez.
Çoğu web kaynaklı video kullanan projeler, sıkıştırma araştırmaları yapmamaktadır ve mevcut video kalitesine göre uyarlamalar yapmak zorundadır, çünkü orijinal yüksek kaliteli sürümlere erişimi yoktur.
Bu nedenle, bu videolara daha yüksek kaliteli ve çözünürlük kazandırmak, bilgisayar görme projelerinin sık sık yapmak zorunda olduğu işAround’ları ve uyarlamaları azaltabilir.
YouTube gibi platformlar, kullanıcı videolarının sıkıştırma yöntemlerindeki büyük değişiklikleri duyurabilir, ancak hiçbirisi tüm süreci veya kullanılan kodlayıcıları ve ayarları açıklamaz.
Kullanıcı yüklemelerinin çıktı kalitesini iyileştirmek, son on yılda bir gizli sanat haline gelmiştir, çeşitli (çoğunlukla doğrulanmamış) ‘çözümler’ moda olmuştur.
Yöntem
Önceki derin öğrenme tabanlı video geri yükleme yaklaşımları, tek kare geri yükleme için generic özellik çıkarma veya çok kareli bir mimari kullanarak optik akış dahil olmak üzere çeşitli yöntemler içermiştir.
Bunların tümü ‘kara kutu’ etkisini karşılamak zorunda kalmıştır – yani sıkıştırma etkilerini çekirdek teknolojilerde inceleyemezler, çünkü ne çekirdek teknolojilerin ne olduğu ne de herhangi bir kullanıcı tarafından yüklenen video için nasıl yapılandırıldığı bilinmemektedir.
VOTES, bunun yerine, orijinal ve sıkıştırılmış videodan doğrudan önemli özellikleri çıkarmaya ve çeşitli platformların standartlarına genelleyecek dönüşüm kalıplarını belirlemeye çalışır.
VOTES, bir bozulma algılama modülü (DSM) kullanarak konvolüsyonel bloklarda özellikler çıkarır. Birden fazla kare, daha sonra bir özellik çıkarma ve hizalama modülüne (FEAM) geçirilir, bu da daha sonra bir bozulma modülasyon modülüne (DMM) iletilir. Son olarak, yeniden yapılandırma modülü geri yüklenen videoyu çıkarır.
Veri ve Deneyler
Yeni çalışmada araştırmacılar, WeChat platformuna yüklenen ve indirilen videoların geri yüklenmesine odaklanmış, ancak algoritmanın diğer platformlara uyarlanabilir olmasını sağlamak istemişlerdir.
WeChat videoları için etkili bir geri yükleme modeli elde ettikten sonra, Bilibili, Twitter ve YouTube için özel modelleri uyarlamak sadece 90 saniye sürmüştür (4 NVIDIA Tesla P40 GPU ile toplam 96GB VRAM olan bir makine kullanılmıştır).
UVSSM veri setini oluşturmak için araştırmacılar, 5-30 saniye arasında değişen 264 video topladı, her biri 30fps kare hızı ile ve mobil telefon kameralarından veya internetten alınan 1920 x 1080 veya 1280 x 270 çözünürlüğe sahip videolardan oluşmaktadır.
İçerik (daha önceki resme bakınız), şehir manzaraları, peyzajlar, insanlar, hayvanlar ve diğer çeşitli konuları içermektedir ve Creative Commons Attribution lisansı altında kamu veri setinde kullanılabilir ve yeniden kullanılabilir.
Araştırmacılar, 214 videoyu beş farklı marka mobil telefon kullanarak WeChat’e yükledi ve WeChat’in varsayılan video çözünürlüğünü (960×540) elde etti, bu da popüler platformlar arasında en ‘cezai’ dönüşümlerden biridir.

Sol-üst, orijinal HQ kare ile üç büyütülmüş bölüm; sağ-üst, aynı karenin platform tarafından bozulmuş bir sıkıştırılmış sürümü; sol-alt, sıkıştırılmış karenin hesaplanan bozulması; ve sağ-alt, VOTES’in odaklanacağı ‘çalışma alanı’.
Diğer platformların dönüşüm rutinlerine karşı sonraki karşılaştırmalar için araştırmacılar, UVSSM veri setine dahil edilmeyen 50 videoyu Bilibili, YouTube ve Twitter’a yükledi. Orijinal videoların çözünürlüğü 1280×270, indirilen sürümlerinin çözünürlüğü ise 640×360 idi.
Bu, UVSSM veri setini toplam 364 HQ/LQ video çiftine çıkarır, 214’ü WeChat’e ve 50’si Bilibili, YouTube ve Twitter’a yüklenmiştir.
Deneyler için 10 rastgele video test kümesi olarak seçildi, dört validation seti olarak ve kalan 200’ü temel eğitim seti olarak kullanıldı. Deneyler beş kez K-fold cross validation ile gerçekleştirildi ve sonuçlar bu örnekler boyunca ortalama olarak hesaplandı.
Video geri yükleme testlerinde VOTES, Spatio-Temporal Deformable Fusion (STDF) ile karşılaştırıldı. Çözünürlük artırma için Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA), ve BasicVSR ile test edildi. Google’un tek-aşamalı yöntemi COMISR de dahil edildi, ancak diğer önceki çalışmaların mimari tipine uymamaktadır.
Yöntemler, UVSS ve REDS veri setleri ile test edildi, VOTES en yüksek puanları elde etti:
Araştırmacılar, nitel sonuçların da VOTES’in önceki sistemlere göre üstünlüğünü gösterdiğini iddia etmektedir:

REDS’ten geri yüklenen video kareleri, rakip yaklaşımlarla karşılaştırıldı. Yalnızca gösterge amaçlı çözünürlük – kesin çözünürlük için lütfen makaleye bakınız.
İlk olarak 19 Ağustos 2022’de yayınlandı.
















