Anderson’un Açısı

Makine Öğrenimi Performansını Arttırmak İçin CNN Tabanlı Resim Yeniden Boyutlandırma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Google Araştırma, görüntü tabanlı bilgisayar görme eğitim işlemlerinin verimliliğini ve doğruluğunu artırmak için bir yeni yöntem önerdi. Bu yöntem, ön işleme aşamasında veri setlerindeki görüntülerin küçültülme şeklini geliştirmeyi hedefliyor.

Makalede, Hossein Talebi ve Peyman Milanfar, bir CNN kullanarak yeni bir hibrit görüntü yeniden boyutlandırma mimarisi oluşturdular. Bu mimari, dört popüler bilgisayar görme veri setinde tanınma sonuçlarında önemli bir iyileşme sağladı.

Tanınma ve yeniden boyutlandırma için önerilen ortak çerçeve. Kaynak: https://arxiv.org/pdf/2103.09950.pdf

Tanınma ve yeniden boyutlandırma için önerilen ortak çerçeve. Kaynak: https://arxiv.org/pdf/2103.09950.pdf

Makale, şu anda kullanılan otomatik makine öğrenimi boru hatlarındaki yeniden boyutlandırma yöntemlerinin decades eski olduğunu ve genellikle sadece temel bilinear, bicubic ve nearest neighbor yeniden boyutlandırma yöntemlerini kullandığını belirtiyor.

Önerilen yöntem, görüntü verilerini bir CNN ile zenginleştirmeyi ve bu girişi son olarak modelin mimarisinden geçen yeniden boyutlandırılmış görüntülere dahil etmeyi içerir.

Yapay Zeka Eğitiminde Görüntü Kısıtlamaları

Bir modeli görüntülerle eğitmek için, bir makine öğrenimi çerçevesi ön işleme aşamasını içerir. Bu aşamada, çeşitli boyutlarda, renk uzaylarında ve çözünürlüklerdeki görüntüler sistematik olarak kırpılır ve tutarlı boyutlara ve sabit bir formata dönüştürülür.

Genel olarak, bu işlemin bir sonucu olarak işlenen görüntünün nihai boyutları çok küçüktür. Aşağıda, bazı erken deepfake veri setlerinin üretilmesi için kullanılan 80×80 çözünürlüğe bir örnek verilmiştir:

Bu, bazı erken deepfake veri setlerinin üretildiği 80x80 çözünürlüktür.

Yüzler (ve diğer olası konular) genellikle gerekli kare oranına uymaz, bu nedenle görüntüleri homojenleştirmek için siyah çubuklar eklenmeli veya boşa harcanan alanlara izin verilmelidir. Bu, gerçek kullanılabilecek görüntü verilerini daha da azaltır:

Burada yüz, daha büyük bir görüntü alanından çıkarıldı ve tüm yüz alanını dahil etmek için mümkün olduğunca ekonomik bir şekilde kırpıldı. Ancak, sağda görüldüğü gibi, kalan alanın büyük bir kısmı eğitim sırasında kullanılmayacaktır, bu da yeniden boyutlandırılmış veri kalitesinin önemini vurgulamaktadır.

Burada yüz, daha büyük bir görüntü alanından çıkarıldı ve tüm yüz alanını dahil etmek için mümkün olduğunca ekonomik bir şekilde kırpıldı. Ancak, sağda görüldüğü gibi, kalan alanın büyük bir kısmı eğitim sırasında kullanılmayacaktır, bu da yeniden boyutlandırılmış veri kalitesinin önemini vurgulamaktadır.

Son yıllarda GPU yeteneklerinin gelişmesiyle birlikte, yeni nesil NVIDIA kartlarının artan miktarda video-RAM (VRAM) ile donatıldığı görüldü. Ortalama katkıda bulunan görüntü boyutları artmaya başladı, ancak 224×224 piksel masih oldukça standardtır (örneğin, bu, ResNet-50 veri setinin boyutudur).

224x244 piksel boyutunda bir görüntü.

224×244 piksel boyutunda bir görüntü.

VRAM’a Uygun Batch’ler

Görüntülerin aynı boyuta sahip olması gerektiği nedeni, gradyan inişi, modelin zaman içinde iyileşmesini sağlayan yöntemin, tutarlı eğitim verilerini gerektirmesidir.

Görüntülerin bu kadar küçük olmasının nedeni, eğitim sırasında küçük partiler halinde (genellikle her partide 6-24 görüntü) VRAM’a yüklenmeleri gerektiğidir. Bir partideki görüntü sayısı çok azsa, model yeterli genellemeyi sağlayamaz ve eğitim süresi uzar; çok fazla olursa, model gerekli özellikleri ve ayrıntıları elde edemeyebilir (aşağıya bakınız).

Eğitim mimarisinin bu ‘canlı yükleme’ bölümü, latente uzay olarak adlandırılır. Bu, özelliklerin aynı verilerden (yani aynı görüntülerden) tekrar tekrar çıkarıldığı ve modelin genellemeleri elde ettiği bir bölgedir.

Bu işlem genellikle günler sürer, ancak faydalı genellemeler elde etmek için sürekli ve yoğun bir şekilde 24/7 çalışmak gerekebilir. VRAM boyutundaki artışlar sadece belirli bir noktaya kadar faydalıdır, çünkü görüntü çözünürlüğündeki küçük artışlar işleme kapasitesi üzerinde büyük bir etkiye sahip olabilir ve bu da her zaman olumlu olmayan sonuçlar doğurabilir.

Daha büyük VRAM kapasitesini kullanarak daha büyük partiler oluşturmak da karışık bir نعمتtir, çünkü daha hızlı eğitim hızları, daha az precisa sonuçlarla dengelenir.

Dolayısıyla, eğitim mimarisi bu kadar kısıtlanmışken, mevcut boru hattının sınırlamaları içinde bir iyileşme sağlamak önemli bir başarıdır.

Üstün Küçültme Nasıl Yardımcı Olur

Eğitim veri setine dahil edilecek bir görüntünün nihai kalitesi, eğitim sonuçlarını iyileştirmektedir. 2018 yılında Max Planck Institute for Intelligent Systems’ten araştırmacılar, önerdiler ki, yeniden örnekleme yönteminin seçimini eğitim performansı ve sonuçları üzerinde önemli bir etkisi vardır.

Daha önceki Google araştırması (yeni makalenin yazarları tarafından ortaklaşa yazılmıştır), sınıflandırma doğruluğunun veri seti görüntülerindeki sıkıştırma sanatını kontrol ederek iyileştirilebileceğini buldu.

Google Araştırma tarafından önerilen downsampling algoritması için CNN mimarisi.

Google Araştırma tarafından önerilen downsampling algoritması için CNN mimarisi.

Yeni resampler’daki CNN modeli, bilinear yeniden boyutlandırmayı bir ‘atla bağlantı’ özelliği ile birleştirir. Bu özellik, eğitilmiş ağın çıkışını yeniden boyutlandırılmış görüntüye dahil edebilir.

Tipik bir kodlayıcı/çözücü mimarisinden farklı olarak, yeni öneri hem bir feed-forward darboğaz hem de herhangi bir hedef boyut ve/veya en boy oranı için ölçeklendirme için ters bir darboğaz olarak çalışabilir. Ayrıca, ‘standart’ yeniden örnekleme yöntemi, Lanczos gibi herhangi bir uygun geleneksel yöntem ile değiştirilebilir.

Yüksek Frekans Ayrıntıları

Yeni yöntem, eğitim sürecinde tanınacak olan ana özellikleri kaynak görüntülere doğrudan ‘ekleyen’ görüntüler üretir. Estetik olarak, sonuçlar alışılmadıkdır:

Dört ağ üzerinde uygulanan yeni yöntem – Inception V2; DenseNet-121; ResNet-50; ve MobileNet-V2. Google Araştırma görüntü downsampling/yeniden boyutlandırma yönteminin sonuçları, eğitim sürecinde tanınacak olan ana özellikleri öngörerek piksel agregasyonu gösteren görüntüler üretir.

Dört ağ üzerinde uygulanan yeni yöntem – Inception V2; DenseNet-121; ResNet-50; ve MobileNet-V2. Google Araştırma görüntü downsampling/yeniden boyutlandırma yönteminin sonuçları, eğitim sürecinde tanınacak olan ana özellikleri öngörerek piksel agregasyonu gösteren görüntüler üretir.

Araştırmacılar, bu ilk deneylerin yalnızca görüntü tanıma görevleri için optimize edildiğini ve CNN tabanlı ‘öğrenilmiş resizer’in bu görevlerde hata oranlarında iyileşme sağladığını belirtiyorlar. Araştırmacılar, gelecekte bu yöntemi diğer görüntü tabanlı bilgisayar görme uygulamalarına uygulamayı amaçlıyorlar.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai