Anderson’un Açısı
Makine Öğrenimi Araştırmalarını Domine Eden Etkili Veri Setleri Karteli

California Üniversitesi ve Google Araştırma’dan yeni bir makale, büyük ölçüde etkili batı kurumlarından ve sık sık hükümet organizasyonlarından gelen küçük bir ‘benchmark’ makine öğrenimi veri setlerinin, AI araştırma sektörünü giderek daha fazla domine ettiğini buldu.
Araştırmacılar, ImageNet gibi popüler açık kaynaklı veri setlerine olan eğilimin, pratik, etik ve hatta politik nedenlerle endişe verici olduğunu kếtüller.
Buluntuları arasında – Facebook tarafından yönetilen topluluk projesi Papers With Code (PWC) tarafından sağlanan temel veriler temel alınarak – yazarlar, ‘genellikle kullanılan veri setlerinin sadece bir avuç seçkin kurum tarafından tanıtıldığını’ ve bu ‘konsolidasyonun’ son yıllarda %80’e çıktığını iddia ediyorlar.
‘Genel olarak, küresel olarak veri seti kullanımında artan bir eşitsizlik olduğunu ve örneklediğimiz 43.140’dan fazla veri seti kullanımının %50’den fazlasının,主要 olarak batıdaki on iki seçkin kurum tarafından tanıtılan veri setlerine karşılık geldiğini bulduk.’

Son on yıl içinde görev özgü olmayan veri seti kullanımının haritası. Kriter, kurum veya şirketin bilinen kullanımların %50’sinden fazlasını hesaba katmasıdır. Sağda, kurumlar ve veri setleri için zaman içinde veri seti konsantrasyonu için Gini katsayısı gösterilmektedir. Kaynak: https://arxiv.org/pdf/2112.01716.pdf
Domine eden kurumlar arasında Stanford Üniversitesi, Microsoft, Princeton, Facebook, Google, Max Planck Enstitüsü ve AT&T bulunmaktadır. İlk on veri seti kaynağının dördü kurumsal kurumlar tarafından sağlanmaktadır.
Makale, bu seçkin veri setlerinin artan kullanımını ‘bilimde eşitsizlik aracı’ olarak karakterize etmektedir. Bu, araştırma ekiplerinin topluluk onayını elde etmek için, devlet-sanat (SOTA) sonuçlarını tutarlı bir veri seti ile elde etmeye daha fazla motive olmalarından kaynaklanmaktadır.
Her durumda, makale, daha az kaynaklara sahip kurumlar ve ekipler için kendi veri setlerini oluşturmanın prohibitive bir şekilde pahalı bir girişim olduğunu kabul etmektedir.
‘Prima facie bilimsel geçerlilik, SOTA benchmarking tarafından sağlanan sosyal güvenilirlik ile karıştırılmaktadır. Araştırmacılar, geniş olarak tanınan bir veri setinde rekabet edebildiklerini göstermek için, daha bağlamsal bir benchmark daha teknik olarak uygun olsa da, devlet-sanat sonuçlarını elde etmeye daha fazla motive olmaktadırlar.
‘Bu dinamikler, “Matthew Etkisi”ni (yani “zenginler daha zengin, yoksullar daha yoksul olur”) yaratır, burada başarılı benchmark’lar ve onları tanıtan seçkin kurumlar, alan içinde orantısız bir üne sahip olurlar.
Makale, Azaltılmış, Yeniden Kullanılmış ve Geri Dönüştürülmüş: Makine Öğrenimi Araştırmasındaki Bir Veri Setinin Yaşamı olarak adlandırılmaktadır ve UCLA’dan Bernard Koch ve Jacob G. Foster ile Google Araştırma’dan Emily Denton ve Alex Hanna tarafından yazılmıştır.
Çalışma, belgelediği konsolidasyon eğilimi ile ilgili bir dizi sorunu gündeme getirmektedir ve Open Review’de genel onay almıştır. Bir NeurIPS 2021 inceleyicisi, çalışmanın ‘makine öğrenimi araştırmalarına dahil olan herkes için son derece ilgili’ olduğunu yorumladı ve üniversite kurslarında atanmış okumaların bir parçası olacağını öngördü.
Gereklilikten Yozlaşmaya
Yazarlar, mevcut ‘benchmark’i yenme kültürünün, yaklaşık otuz yıl önce ‘Uzman Sistemler’deki yeni araştırmalara yönelik iş heyecanının çökmesi nedeniyle, objektif değerlendirme araçlarının eksikliği nedeniyle AI’ye ilgi ve yatırımı çökerten ikinci ‘AI Kış’ı之后 ortaya çıktığını belirtirler:
‘Benchmark’lar genellikle bir görevi bir veri seti ve bir nicel değerlendirme ölçütü aracılığıyla formalize eder. Bu uygulama, ‘AI Kış’ı’nın ardından hükümet fon sağlayıcıları tarafından makine öğrenimi araştırmalarına tanıtıldı ve verilen hibelerin değerini daha doğru bir şekilde değerlendirmeyi amaçladı.’
Makale, bu gayri resmi standardizasyon kültürünün ilk avantajlarının (katılım engellerini azaltma, tutarlı ölçümler ve daha çevik geliştirme fırsatları) artık, bir veri setinin etkili bir şekilde ‘kullanım koşulları’nı ve etki alanını tanımlamak için yeterli güce sahip olduğunda ortaya çıkan dezavantajlar tarafından ağırlıklı olarak karşılandığını savunmaktadır.
Yazarlar, endüstri ve akademik düşünceye paralel olarak, araştırma topluluğunun artık mevcut benchmark veri setleri ile ele alınamayan yeni sorunlar ortaya koymadığını öne sürmektedir.
Ayrıca, bu birkaç ‘altın’ veri setine kör bir şekilde bağlılığın, araştırmacıların, gerçek dünya verilerine, yeni akademik veya orijinal veri setlerine veya hatta ‘altın standart’ veri setlerine göre performansı daha düşük olan, veri seti spesifik sonuçlar elde etmelerine neden olduğunu belirtirler.
‘Gözlemlenen yüksek konsantrasyonlu araştırma, mevcut veri setlerine karşı overfitting’i önlemek ve alanın ilerlemesini yanlış temsil etmek için değerlendirme biçimlerini çeşitlendirmenin özellikle önemli olduğunu düşünüyoruz.’
Bilgisayar Görme Araştırmalarında Hükümet Etkisi
Makaleye göre, Bilgisayar Görme araştırmaları, Natural Language Processing (NLP) araştırmalarına kıyasla bu sendromdan daha fazla etkilenmektedir. Yazarlar, NLP topluluklarının ‘daha tutarlı’ ve daha büyük olduğunu ve NLP veri setlerinin daha erişilebilir ve daha kolay küratörlük yapabildiğini, ayrıca daha küçük ve veri toplama açısından daha az kaynak yoğun olduğunu belirtmektedir.
Bilgisayar Görme’de, özellikle Yüz Tanıma (FR) veri setlerinde, yazarlar, kurumsal, devlet ve özel çıkarların často çarpıştığını iddia etmektedirler:
‘Kurumsal ve hükümet kurumlarının, örneğin gözetim gibi, gizlilikle çatışan hedefleri olabilir ve bu önceliklerin ağırlığı, akademisyenler veya AI’nin daha geniş toplumsal paydaşları tarafından tutulan önceliklerden farklı olabilir.’
Yüz tanıma görevleri için araştırmacılar, saf akademik veri setlerinin kullanımının dramatik bir şekilde düştüğünü buldular:
‘Sekiz veri setinin dördü (toplam kullanımların %33.69’u) yalnızca kurumsal, ABD askeri veya Çin hükümeti tarafından finanse edildi (MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2). MS-Celeb-1M, farklı paydaşlar için gizlilik değerinin tartışmalı olması nedeniyle geri çekildi.’
Yukarıdaki grafikte, yazarlar, relativ olarak yeni bir alan olan Görüntü Oluşturma’nın (veya Görüntü Sentezi), var olan ve bu amaç için tasarlanmamış daha eski veri setlerine bağımlı olduğunu belirtmektedir.
Aslında, makale, veri setlerinin amaçlarından uzaklaşan bir eğilim gözlemlemektedir ve bu, yeni veya marjinal araştırma alanlarının ihtiyaçlarına uygunluğunu ve bütçe kısıtlamalarının araştırmacıların hedeflerini daha dar bir çerçeveye, mevcut materyaller ve benchmark derecelerine dayalı bir kültür tarafından belirlenen bir çerçeveye daraltıp daraltmadığını sorgulamaktadır.
‘Buluntularımız, veri setlerinin düzenli olarak farklı görev toplulukları arasında aktarıldığını da gösteriyor. En uç durumda, bazı görev toplulukları için dolaşımdaki benchmark veri setlerinin çoğunluğu, diğer görevler için oluşturulmuştur.’
Makine öğrenimi luminerleri (Andrew Ng dahil) quienes, son yıllarda daha fazla veri seti çeşitliliği ve küratörlüğü çağrısında bulundular, yazarlar bu görüşü desteklemektedir, ancak bu tür bir çabanın, mevcut kültürün SOTA sonuçlarına ve kurulmuş veri setlerine bağımlılığı tarafından potansiyel olarak engellenebileceğine inanmaktadır:
‘Araştırmamız, makine öğrenimi araştırmacılarının daha fazla veri seti geliştirmesi için çağrıda bulunmanın ve teşvik yapılarını değiştirmenin, veri seti geliştirilmesinin değerli ve ödüllendirildiğini göstermenin, veri seti kullanımını ve nihayetinde makine öğrenimi araştırmaları ajandalarını şekillendiren perspektifleri çeşitlendirmek için yeterli olmayabileceğini öne sürmektedir.
‘Veri seti geliştirilmesini teşvik etmekle birlikte, daha az kaynaklara sahip kurumlar için önemli fonlama önceliklendiren eşitlik odaklı politika müdahalelerini savunuyoruz. Bu, modern makine öğrenimi yöntemlerini değerlendirmek için kullanılan benchmark veri setlerini sosyal ve kültürel açıdan çeşitlendirecektir.’
6 Aralık 2021, 16:49 GMT+2 – Başlıkta iyelik hataları düzeltildi. – MA













