Anderson’un Açısı

ImageNet’in Tarihi Doğruluğunun Değerlendirilmesi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Google Araştırma ve UC Berkeley’den yeni bir çalışma, bilgisayar görme (CV) araştırma sektörünün saygın ImageNet veri setine ve türetilmişlerine olan bağımlılığını eleştiren uzun süredir devam eden eleştirilere katkıda bulunuyor. Uzun ve zahmetli bir el ile değerlendirme sonrasında, yazarlar, ImageNet’in çok etiketli alt kümesinde (şu anda en iyi performans gösteren modeller %97’den fazla 1. sıradaki doğruluk elde ediyor) yapılan hataların neredeyse %50’sinin aslında hata olmadığını kếtüller.

Çalışmadan:

‘Analizimiz, neredeyse yarı yarıya hatalı olduğu varsayılan hataların aslında hata olmadığını ortaya koyuyor ve dikkatli bir inceleme olmadan, bu modellerin performansını önemli ölçüde düşük tahmin ettiğimizi gösteriyor.’

‘Öte yandan, günümüzün en iyi modellerinin hala insan denetçiler için açıkça yanlış olan önemli sayıda hata (yaklaşık %40) yaptığını da bulduk.’

Veri setlerinin, özellikle de yeteneksiz kitle kaynaklı çalışanlar tarafından yanlış etiketlenmesinin, sektörü nasıl etkileyebileceğini gösteren çalışma, ImageNet’in tarihi boyunca görüntüleştirme ve metin eşleştirmelerinin büyük bir bölümünü değerlendirdi.

Üst satırda, Hata Şiddeti örnekleri: Burada ilk iki örnekte, yeni model basitçe预测 edilen etiketi yanlış alır; üçüncü örnekte, yeni model daha önce eksik olan bir çok etiketi (görüntünün yeni bir sınıflandırmasını ele alan bir etiketi) tanımlar; üst satırdaki son görüntüde, modelin tahmini belirsizdir, çünkü resim bir arı- sinek ve sinek değil. Ancak ortalama bir arı, Diptera böcek düzenine ait olduğu için, bu istisna, hatta uzman bir annotatör için bile几乎 imkansız olacaktır. Alt satırda, dört hata kategorisi ve örnekleri vardır. Kaynak: https://arxiv.org/pdf/2205.04596.pdf

Üst satırda, Hata Şiddeti örnekleri: Burada ilk iki örnekte, yeni model basitçe预测 edilen etiketi yanlış alır; üçüncü örnekte, yeni model daha önce eksik olan bir çok etiketi (görüntünün yeni bir sınıflandırmasını ele alan bir etiketi) tanımlar; üst satırdaki son görüntüde, modelin tahmini belirsizdir, çünkü resim bir arı- sinek ve sinek değil. Ancak ortalama bir arı, Diptera böcek düzenine ait olduğu için, bu istisna, hatta uzman bir annotatör için bile几乎 imkansız olacaktır. Alt satırda, dört hata kategorisi ve örnekleri vardır. Kaynak: https://arxiv.org/pdf/2205.04596.pdf

Araştırmacılar, ImageNet veri seti değerlendirmesinde historical hata kayıtlarını incelemek için birkaç adanmış değerlendirici çalıştırdı ve birçok hata kararının aslında yanlış olduğunu buldular – bu, geçmiş yıllarda ImageNet benchmark’lerinde birçok projenin elde ettiği düşük puanların bazılarını potentially değiştirebilecek bir keşif.

ImageNet, CV kültüründe yerleşmişken, araştırmacılara göre, doğrulukta cải thiện, azalan geri dönüşler sağlar ve yeni modellerin, kurulmuş etiket doğruluğunu aşan ve yeni (yani ek) etiketler öneren, esasen, uyumsuzluk için cezalandırıldıkları düşünülüyor.

‘Örneğin,’ yazarlar gözlemliyor. ‘bir modelin, önceden pişirilmiş bir bagel’in bir bagel olabileceğini öngörmesini cezalandırmalı mıyız, bu çalışmada incelediğimiz modellerden biri böyle yapıyor?’

Çalışmadan, daha yeni bir model, resimdeki nesnenin hamur değil, aslında bir bagel olduğunu öne sürüyor.

Çalışmadan, daha yeni bir model, resimdeki nesnenin hamur değil, aslında bir bagel olduğunu öne sürüyor.

Bir kitle kaynaklı çalışanın böyle bir nesneyi tanımlaması, çok etiketleme (çoğu zaman daha sonraki alt kümelerde ve ImageNet’in sonraki iterasyonlarında xảyanan) ile çözülebilecek bir anlambilimsel ve felsefi ikilem.

Araştırmada, özel modeller test edilirken ortaya çıkan büyük (üstte) ve küçük (altta) hatalar. Sol taraftaki ilk resimler, orijinal ImageNet etiketleridir.

Araştırmada, özel modeller test edilirken ortaya çıkan büyük (üstte) ve küçük (altta) hatalar. Sol taraftaki ilk resimler, orijinal ImageNet etiketleridir.

Çözümün iki açık yolu vardır: etiketleme için daha fazla kaynak ayırma (çoğu bilgisayar görme araştırma projesinin bütçe kısıtlamaları içinde bir zorluk) ve yazarların vurguladığı gibi, veri setlerini ve etiket değerlendirme alt kümelerini düzenli olarak güncellemek (bu, ‘benzer gibi benzer’ historical benchmark sürekliliğini bozmak ve yeni araştırma makalelerini eşdeğerlilik konusunda nitelendirmelerle doldurmaya risk oluşturur).

Durumu iyileştirmek için bir adım olarak, araştırmacılar ImageNet-Major (ImageNet-M) adlı ImageNet’in yeni bir alt veri setini geliştirdiler, bunu ‘bugünlerin en iyi modellerinin açıkça hatalı olduğu 68 örnekten oluşan “büyük hata” dilimi’ olarak tanımladılar.

Çalışma makale, Hamur bir bagel olduğunda ne olur? ImageNet’teki kalan hataları analiz etme başlığını taşıyor ve Google Araştırma’dan dört yazar ve UC Berkeley’den Sara Fridovich-Keil tarafından yazıldı.

Teknik Borç

Bulunan sonuçlar önemlidir, çünkü ImageNet’te tanımlanan kalan hatalar, 16 yıllık geçmişinde, çalışmanın merkezi konusu olabilir ve bir modelin dağıtıma hazır olup olmadığını veya hata eğilimine sahip olup olmadığını belirleyebilir. Her zaman olduğu gibi, son mil kritiktir.

Bilgisayar görme ve görüntü sentezleme araştırma sektörü, ImageNet’i bir benchmark ölçütü olarak ‘otomatik olarak seçti’, çünkü erken benimseyenlerin bir dizi araştırma girişimi ürettiği ve ImageNet’e karşı test etme Historical bir ‘standart’ haline geldi.

Yöntem

ImageNet’teki kalan hataları ararken, araştırmacılar, 3 milyar parametre ile %89,5 doğruluk elde edebilen bir standard ViT modeli (Vit-3B) kullandılar, JFT-3B’de ön eğitim ve ImageNet-1K’de fine-tuning yaptılar.

ImageNet2012_multilabel veri setini kullanarak, araştırmacılar Vit-3B’nin ilk çok etiketli doğruluğunu (MLA) %96,3 olarak kaydetti ve modelin 676 açık hata yaptığını gördü. Araştırmacılar, bu hataları (ve Greedy Soups modelinin hatalarını) araştırmak istedi.

Hataların geri kalan 676’sını değerlendirmek için, yazarlar, bu tür hataların ortalama annotatörler için zor olabileceğini gözlemleyerek kitle kaynaklı çalışanlardan kaçındı, ancak beş uzman denetleyici panosu topladı ve her denetleyiciye, öngörülen sınıfı, öngörülen puanı, temel gerçek etiketleri ve görüntüyü bir bakışta görebilmesi için bir araç oluşturdu.

Proje için oluşturulan arayüz.

Proje için oluşturulan arayüz.

Bazı durumlarda, uyuşmazlıkları çözmek için daha fazla araştırma gerekliydi ve Google Resim arama, bir yardımcı araç olarak kullanıldı.

‘[Bir] ilginç, ancak izole olmayan durumda, bir taksinin (sadece sarı renk dışında açık bir taksi göstergesi olmayan) bir tahminini içeriyordu; taksinin aslında doğru bir taksinin olduğunu, arka plandaki bir köprüyü tanımlayarak şehri lokalize etmek ve ardından o şehirdeki taksiler için bir resim araması yaparak aynı taksi modeli ve plaka tasarımını elde ederek modelin aslında doğru tahminini belirledik.’

Araştırmada, hataların ilk incelemesinden sonra, yazarlar dört yeni hata tipi formüle etti: ince ayarlı hata, öngörülen sınıfın temel gerçek etikete benzer olduğu; ince ayarlı, sözlük dışı (OOV), modelin, ImageNet’te bulunmayan ancak doğru olan bir nesneyi tanımladığı; sahte korelasyon, öngörülen etiketin görüntüden çıkarıldığı; ve non-prototip, temel gerçek nesnenin, öngörülen etikete benzeyen, ancak aynı olmayan bir örnek olduğu.

Bazı durumlarda, temel gerçek, aslında ‘gerçek’ değildi:

‘Orijinal 676 hatayı inceledikten sonra, 298’inin ya doğru, ya belirsiz, ya da orijinal temel gerçeğin yanlış veya sorunlu olduğunu belirledik.’

Birden fazla veri seti, alt küme ve doğrulama seti üzerinden kapsamlı ve karmaşık bir dizi deneyden sonra, yazarlar, iki modelin, geleneksel tekniklerle yaptıkları ‘hataların’ yarısında aslında doğru olduklarını buldular.

Çalışma şöyle sona eriyor:

‘Bu çalışmada, ViT-3B ve Greedy Soups modellerinin ImageNet çok etiketli doğrulama setinde yaptıkları kalan tüm hataları analiz ettik.

‘Genel olarak, şunu bulduk: 1) büyük, yüksek doğrulukta bir model yeni, diğer modeller tarafından yapılmayan bir tahmin yaptığında, bu,几乎 yarı yarıya zamanında yeni, doğru bir çok etikettir; 2) daha yüksek doğrulukta modeller, hata kategorilerimizde ve şiddeti açısından açık bir model göstermez; 3) günümüzün SOTA modelleri, insan tarafından değerlendirilen çok etiketli alt kümesinde, en iyi uzman insan performansını genel olarak eşleştiriyor veya aşiyor; 4) gürültülü eğitim verileri ve belirsiz sınıflar, görüntü sınıflandırmasındaki cảiiyorumu etkili bir şekilde ölçme konusunda bir faktör olabilir.’

 

15 Mayıs 2022’de ilk kez yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai