Anderson’un Açısı

JPEG Sıkıştırması, Kaukasya Olmayan Yüzlerin Yüz Tanıma Hatası Oranını Artırıyor, Çalışma Buluyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Main image: DALL-E 2.

İngiltere’den yapılan yeni bir çalışmaya göre, JPEG resimlerinde kullanılan lossy sıkıştırma teknikleri, yüz tanıma sistemlerinin etkinliğini olumsuz yönde etkileyerek, özellikle Kaukasya olmayan kişilerde yanlış tanıma olasılığını artırabilir.

Makalede şöyle deniyor:

‘Geniş bir deneysel kurulum aracılığıyla, yüz tanıma performansında belirli ırksal fenotip kategorileri (örneğin daha koyu cilt tonları, %34,55’e kadar) için ortak lossy resim sıkıştırma yaklaşımlarının daha belirgin bir olumsuz etki olduğunu gösteriyoruz.’

Sonuçlar ayrıca, kroma alt örneklemenin, yüz resimlerinde renk bilgisi (parlaklık bilgisi değil) azaltarak, test edilen veri setleri genelinde Yanlış Eşleştirme Oranını (FMR) artırdığını gösteriyor. Bu veri setlerinin birçoğu bilgisayar vizyonu için standart depolar.

Kaynak resim üzerinde çeşitli oranlarda kroma alt örnekleme işlemleri, ayrıntı korunması ve alt tonların birbirine karışması açısından net bir etkiye sahiptir. Lütfen bu resmin kendisinin sıkıştırma altında olabileceğini unutmayın ve doğru çözünürlük için kaynak makaleye başvurun. Kaynak: https://arxiv.org/pdf/2208.07613.pdf

Kaynak resim üzerinde çeşitli oranlarda kroma alt örnekleme işlemleri, ayrıntı korunması ve alt tonların birbirine karışması açısından net bir etkiye sahiptir. Lütfen bu resmin kendisinin sıkıştırma altında olabileceğini unutmayın ve doğru çözünürlük için kaynak makaleye başvurun. Kaynak: https://arxiv.org/pdf/2208.07613.pdf

Kroma alt örnekleme, insanların renk bantlarının karmaşıklığı ve aralığını azaltmaya karşı daha az duyarlı olduğu için JPEG sıkıştırmasında ekonomik bir önlem olarak uygulanır; bilgisayar vizyonu sistemleri ise bu ‘toplamaları’ çok daha literal olarak alır.

Araştırmacılar, bu olumsuz etkisini azaltmak için sıkıştırma işleminden kroma alt örnekleme çıkarılmasını denedi ve bu işlemin performansa etkisi ölçüldü.

Çalışma ayrıca, eğitim verilerinin sıkıştırılmış (veya daha az sıkıştırılmış) olması, production-time görüntülerin sıkıştırılmış olması durumunda sorunu çözmez. Yani, yüz tanıma modelini daha az sıkıştırılmış görsellerle eğitmek, final üretim modeline sıkıştırılmış görüntüler verildiğinde oluşan önyargıyı gidermez.

Yazarlar rapor veriyor:

‘[Lossy] resim sıkıştırmasının, çağdaş yüz tanıma yaklaşımlarının performansını, özellikle belirli ırksal fenotip grupları (örneğin daha koyu cilt tonları, monolid göz şekli) üzerinde olumsuz etkilediğini ve bu etkisinin, model eğitiminde sıkıştırılmış görsellerin kullanılıp kullanılmamasından bağımsız olarak mevcut olduğunu gösteriyoruz.’

Bu makale, bilgisayar vizyonu araştırma alanındaki görüntü sıkıştırmasının sonuçlarını vurguluyor; bu sonuçlar, University of Maryland ve Facebook AI’nin 2021 çalışmasında detaylı olarak açıklanmıştı.

Bu sorun çözülmesi zor bir mesele; depolama ve bant genişliği sorunlarının, sıkıştırma ihtiyacını ortadan kaldırmış olsalar bile ve son yirmi yılı aşkın süredir biriken düşük kaliteli resimlerin suddenly yüksek kaliteli kaynaklardan yeniden sıkıştırılmış olsalar bile, bu, akademik benchmarking araçlarının sürekliliğinde bir ‘sıfırlama’ anlamına gelirdi. Aslında, CV topluluğu, bu sorunu kabul etmiş ve bu, önemli bir teknik borç haline gelmiştir.

Yüz tanıma (FR)中的 ırksal önyargı, son yıllarda medya gündeminde yer almış ve araştırmacıların bu sistemlerden önyargıyı ortadan kaldırmak için bir çaba sarf etmelerine yol açmıştır. Ancak, küresel araştırma topluluğunun, ‘altın standart’ veri setlerine aşırı bağımlılığı – ki bu setlerin birçoğu ırksal olarak dengeli değil veya bu açıdan kötü etiketlenmiş – bu zorluğu daha da artırıyor.

Araştırmacılar ayrıca, yüz tanıma sistemleri için mevcut görüntü edinme standartları ile genel yüz tanıma benchmark’lerinin standartları arasındaki uyumsuzluğu vurguluyor:

‘Mevcut yüz tanıma sistemleri için görüntü edinme standartları seperti ISO/IEC 19794-5 ve ICAO 9303, hem görüntü tabanlı (örneğin aydınlatma, örtme) hem de konu tabanlı (örneğin poz, ifade, aksesuarlar) kalite standartlarını önerir.’

‘Buna göre, yüz resimleri de JPEG veya JPEG2000 gibi lossy resim sıkıştırma standartlarına göre depolanmalıdır ve cinsiyet, göz rengi, saç rengi, ifade, özellikler (örneğin gözlük), yaw, pitch ve roll açıları ve landmark konumları açısından tanımlanabilir olmalıdır.’

‘Ancak, ortak yüz tanıma benchmark’ları, ISO/IEC 19794-5 ve ICAO 9303 standartlarına uymaz. Ayrıca, vahşi örnekler, çeşitli kamera ve çevre koşullarında elde edilir ve önerilen çözümleri zorlar.’

‘Bununla birlikte, bu veri setlerindeki çoğu yüz resmi, lossy JPEG sıkıştırması ile sıkıştırılır.’

Yeni çalışmanın yazarları, gelecekteki çalışmalarının, lossy resim kuantizasyonunun çeşitli yüz tanıma çerçevelerindeki etkisini incelemeyi ve bu sistemlerin adilliğini iyileştirmek için olası yöntemler sunmayı amaçladıklarını belirtiyorlar.

Yeni makale, Lossy Resim Sıkıştırması Yüz Tanımadaki Irksal Önyargıyı Etkiler Mi? başlığını taşıyor ve Imperial College London’dan üç araştırmacı ile InsightFace derin yüz analizi kütüphanesinden bir araştırmacı tarafından gerçekleştirildi.

Veri ve Yöntem

Deneyleri için araştırmacılar, ImageMagick ve libjpeg açık kaynak kütüphanelerini kullandılar ve kaynak veri resimlerinin çeşitli sıkıştırma seviyelerinde sürümlerini oluşturdular.

Öncelikle, yazarlar dört farklı JPEG sıkıştırma seviyesinde Peak Sinyal-Gürültü Oranının (PSNR) etkilerini Racial Faces in-the-Wild (RFW) veri seti üzerinde incelediler.

RFW veri seti için PSNR puanları, sıkıştırmanın tanınma yetenekleri üzerindeki etkisini gösteriyor.

RFW veri seti için PSNR puanları, sıkıştırmanın tanınma yetenekleri üzerindeki etkisini gösteriyor.

Araştırmacılar, ırksal olarak dengeli bir veri seti üzerinde de araştırma yaptılar. Dengeli set için, Additive Angular Margin Loss (ArcFace) fonksiyonunu ResNet101v2 ile birlikte, 3.3 milyon resmi ve 8631 ırksal olarak dengeli konu içeren orijinal VGGFace2 benchmark veri seti üzerinde kullandılar.

Sistem, dört farklı sıkıştırma seviyesinde dört kez eğitildi ve dört ArcFace modeli oluşturuldu.

Irksal olarak dengeli set için, aynı çerçeveler orijinal hizalanmış BUPT-Balanced benchmark veri seti üzerinde kullanıldı. Bu veri seti, her biri 7000 resimden oluşan Afrika, Asya, Hindistan ve Kaukasya olmak üzere dört gruba bölünmüş 28.000 yüz içerir. Irksal olarak dengeli veri setinde de, aynı şekilde dört ArcFace modeli elde edildi.

Araştırmacılar ayrıca, sıkıştırma ve sıkıştırma olmadan eğitim etkilerini yeniden üretmek için kroma alt örnekleme çıkardılar.

Sonuçlar

Oluşturulan veri setlerindeki Yanlış Eşleştirme Oranları (FMR) incelendi. Araştırmacılar, önceden tanımlanmış fenotip kriterlerine baktı; bu kriterler ırksal özelliklerle ilgiliydi: Cilt Tipi (1, 2, 3, 4, 5 veya 6), Göz Kapağı Tipi (Monolid/Diğer), Burun Şekli (Geniş/Dar), Dudak Şekli (Dolgun/Küçük), Saç Tipi (Düz/Dalgalı/Kıvırcık/Kel), Saç Rengi – bu metrikler 2019 makalesinden Yüz Tanımada Gizli Önyargıları Irksal Fenotipler Aracılığıyla Ölçme alındı.

Makalede şöyle deniyor:

‘Tüm seçilen sıkıştırma seviyeleri için (q = {5, 10, 15, 95}), ek lossy sıkıştırma uygulanmasının FMR’yi artırdığını, en yüksek sıkıştırma oranının (seviye 5) en önemli FMR performans düşüşüne yol açtığını ve en düşük sıkıştırma oranının (seviye 95) herhangi bir önemli FMR performans farkı yaratmadığını gözlemliyoruz.’

VGGFace2 için artan bozulma/sıkıştırma altındaki yüz resimlerinin FMR performansının örnek bir görünümü. Kaynak makalede daha iyi bir çözünürlük ve tam sonuçlar için başvurun.

VGGFace2 için artan bozulma/sıkıştırma altındaki yüz resimlerinin FMR performansının örnek bir görünümü. Kaynak makalede daha iyi bir çözünürlük ve tam sonuçlar için başvurun.

Makale şöyle diyor:

‘Genel olarak, değerlendirmemiz, lossy sıkıştırılmış yüz resimlerinin, özellikle koyu cilt tonu, geniş burun, kıvırcık saç ve monolid göz gibi belirli fenotipler üzerinde yüz tanıma performansını daha önemli ölçüde azalttığını gösteriyor.’

‘Ancak, eğitim sırasında sıkıştırılmış görüntülerin kullanılması, oluşan modellerin daha dayanıklı olmasını sağlar ve performans bozulmasını sınırlar: belirli ırksal alt gruplar arasında daha düşük performans kalır. Ayrıca, kroma alt örnekleme çıkarılması, lossy sıkıştırma tarafından daha fazla etkilenen fenotip kategorileri için FMR’yi %15,95’e kadar iyileştirir.’

 

* Yazarların inline alıntılarının hyperlinklere dönüştürülmesi.

İlk olarak 22 Ağustos 2022’de yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai