Anderson’un Açısı
Aşırı Yorumlama, Aşırı Uyumdan Daha Büyük ve Daha Çetrefil Bir Tehdit Olabilir

Eğer iyi bir arkadaşınız olan Alice sarı kazaklar giymeyi severse, siz de ortalama bir kişiden daha fazla sarı kazak göreceksiniz. Bir süre sonra, farklı bir kadın sarı kazak giyerse, aklınıza Alice kavramı gelebilir.
Eğer sarı kazak giyen bir kadın görürseniz ve benzer ise, onu anlık olarak arkadaşınız sanabilirsiniz.
Ancak değil Alice. Sonunda, sarı kazak nin Alice’i tanımlamak için yararlı bir anahtar olmadığını fark edeceksiniz, çünkü o yazın hiç giymez ve kışın da her zaman giymez. Arkadaşlığınızın bir yerinde, sarı kazak ı olası bir Alice tanımlayıcı olarak düşüreceksiniz, çünkü bu kısayolunuzu korumak için kullanılan bilişsel enerji sık sık ödüllendirilmez.
Eğer bir bilgisayar görme tabanlı tanıma sistemiyseniz, ise sarı kazak gördüğünüz her yerde Alice’i görebilirsiniz.
Bu sizin suçunuz değil; Alice’i tanımlamak için minimum mevcut bilgiyle görevlendirildiniz ve bu indirgenmiş Alice ipucunu korumak için yeterli bilişsel kaynaklarınız var.
Garip Anlayış
MIT Bilgisayar Bilimi ve Yapay Zeka Laboratuvarı (CSAIL) ve Amazon Web Services’ten recent bir makaleye göre, bu sendrom, aşırı yorumlama olarak adlandırılır, bilgisayar görme (CV) araştırma alanlarında yaygındır; aşırı uyuma çözümlemekle hafifletilemez (çünkü doğrudan aşırı uyuma eki değildir); en etkili iki görüntü tanınma ve dönüşüm veri setleri olan CIFAR-10 ve ImageNet ‘te yaygın olarak görülmektedir ve kolay çözümleri yoktur – kesinlikle ucuz çözümleri yoktur.
Araştırmacılar, girdi eğitim resimlerini yalnızca %5’ine indirgeğinde, popüler framework’lerin çoğunun resimleri doğru bir şekilde sınıflandırabildiğini buldular, bu resimler çoğu durumda insan gözlemcilerine görsel “anlamazlık” olarak görünmektedir:

Orijinal eğitim resimleri CIFAR-10’dan, yalnızca orijinal piksel içeriğinin %5’ine indirgenmiştir, ancak popüler bilgisayar görme framework’lerinin %90-99’luk bir doğrulukla doğru bir şekilde sınıflandırılmıştır. Kaynak: https://arxiv.org/pdf/2003.08907.pdf
Bazı durumlarda, sınıflandırma framework’leri, bu azaltılmış resimlerin, orijinal eğitim verilerinin tam çerçevelerinden daha kolay doğru bir şekilde sınıflandırılabildiğini buldular, yazarlar ‘[CNN’ler] bu piksel alt kümelerinde tam resimlerden daha emin’ gözlemlediler.
Bu, CIFAR-10 ve ImageNet gibi benchmark veri setleri ve VGG16, ResNet20 ve ResNet18 gibi benchmark framework’leri kullanan CV sistemleri için potansiyel olarak zayıflatıcı bir tür “hile” olduğunu gösterir.
Aşırı yorumlama, özellikle Tesla’nın self-sürüş algoritmaları için LiDAR ve diğer ışın tabanlı algılama sistemlerine tercih ettiği görüntü yorumlama sistemleri için önemli sonuçlar doğurur.
“Kısayol öğrenimi” bilinen bir zorluk ve bilgisayar görme alanında aktif bir araştırma alanıdır ve makale yazarları, 2019’da bu sorunu çerçevelendiren Alman-Kanada araştırmasının, aşırı yorumlamanın “sahte” piksel alt kümelerinin “istatistiksel olarak geçerli veri” olduğunu tanıyamadığını yorumlarlar.
Makale Görüntü sınıflandırma modeli patolojilerini ortaya çıkaran aşırı yorumlama olarak adlandırılmıştır ve Brandon Carter, Siddhartha Jain ve David Gifford’dan CSAIL’de Amazon Web Services’ten Jonas Mueller ile işbirliği içinde gelmiştir. Makale için kod https://github.com/gifford-lab/overinterpretation adresinde mevcuttur.
Verileri Azaltma
Araştırmacılar tarafından kullanılan veri azaltılmış resimler, Yeterli Giriş Alt Kümeleri (SIS) olarak adlandırılır – aslında, bir SIS resmi, bir bilgisayar görme sisteminin orijinal görüntü konusunu tanımlamak için yeterli olan minimum “dış iskelet” içerir (yani köpek, gem vs.).

Üst satırda, tam ImageNet doğrulama resimlerini görüyoruz; alt satırda, SIS alt kümelerini, Inception V3 modeli tarafından %90 güvenle doğru bir şekilde sınıflandırılmış, görünüşe göre, resmin geri kalanından – arka plan bağlamından.
Yukarıdaki resimdeki sonuçlar hakkında yorum yapan araştırmacılar:
‘SIS pikselleri, nesnenin kendisi yerine, nesneyi belirleyen sınıf etiketini belirlemede konsantre olur. Örneğin, “pizza” resminde, SIS, pizza değil, tabak ve arka plan masanın şekline konsantre olur, bu da modelin farklı masa üzerindeki yuvarlak nesneleri tanımlamada zayıf genellemelere yol açabileceğini gösterir. “Dev panda” resminde, SIS, bambuya sahiptir, bu da muhtemelen bu sınıftaki ImageNet fotoğraflarında ortaya çıkmıştır.
‘Trafik ışığı ve sokak işaretleri resimlerinde, SIS gökyüzünde bulunan piksellerden oluşur, bu da bu modellerin aşırı yorumlama patolojilerine karşı dikkatli bir şekilde değerlendirilmesi gerektiğini gösterir.’
SIS resimleri rastgele kesilmemiştir, ancak projede Inception V3 ve ResNet50 aracılığıyla PyTorch kullanarak Batched Gradient Backselect işlemi ile oluşturulmuştur. Resimler, modelin bir görüntüyü doğru bir şekilde sınıflandırma yeteneği ile orijinal verilerin kaldırıldığı alanlar arasındaki ilişkiye dayanarak türetilir.
Araştırmacılar, rasgele piksel kaldırma işlemini test etti ve sonuçların “anlamlı程度 daha az” olduğunu buldular, bu da SIS resimlerinin gerçekten popüler modellerin ve veri setlerinin kabul edilebilir tahminler yapması için gereken minimum veriyi temsil ettiğini gösteriyor.
Herhangi bir azaltılmış resme bakmak, bu modellerin insan düzeyinde görsel ayırt etme yeteneği ile başarısız olacağını gösterir, bu da %20’den daha düşük bir median doğruluk oranı ile sonuçlanacaktır.

SIS resimlerini orijinal piksellerinin yalnızca %5’ine indirgeyince, insanlar yalnızca “rasgeleüstü” bir sınıflandırma başarısı oranına ulaşıyor, bu da makalede incelenen popüler veri setleri ve framework’lerin %90-99’luk başarısı ile karşılaştırılıyor.
Aşırı Uyumun Ötesinde
Aşırı uyum, bir makine öğrenimi modelinin bir veri seti üzerinde öyle yoğun bir şekilde eğitilmesiyle oluşur ki, o specific veri için öngörülerde uzmanlaşır, ancak eğitimden sonra sunulan yeni, dağıtılmamış veriler için çok daha az etkili veya tamamen etkisiz hale gelir.
Araştırmacılar, aşırı uyumu解决 etmekle aşırı yorumlamanın çözülmeyeceğini belirtirler, çünkü indirgenmiş piksel alt kümeleri, bilgisayarlar için tanımlanabilir resimleri temsil eder, ancak insanlara anlamsız lekeler olarak görünür ve aslında gerçekten uygulanabilir veri dir:
‘Aşırı yorumlama, aşırı uyuma bağlıdır, ancak aşırı uyum, azaltılmış test doğruluğu ile teşhis edilebilir. Aşırı yorumlama, veri kaynağı özelliklerinden kaynaklanan altta yatan veri dağılımındaki gerçek istatistiksel sinyallerden kaynaklanabilir (örneğin, dermatologların kuralları).
‘Bu nedenle, aşırı yorumlama daha zor teşhis edilebilir, çünkü istatistiksel olarak geçerli kriterlere dayalı kararlar alabilir ve bu kriterleri kullanan modeller benchmark’lerde başarılı olabilir.’
Mümkün Çözümler
Yazarlar, model birleştirme nin, birden fazla mimarinin değerlendirme ve eğitim sürecine katkıda bulunmasının, aşırı yorumlamayı hafifletmeye yardımcı olabileceğini öne sürerler. Ayrıca, giriş dropout uygulamanın, orijinal olarak aşırı uyumu engellemek için tasarlanmış olmasına rağmen, CIFAR-10 test doğruluğunda küçük bir azalma ile sonuçlandığını, ancak görülmeyen verilerdeki modellerin doğruluğunda önemli (∼ %6) bir artışa yol açtığını buldular. Ancak, düşük rakamlar, aşırı uyuma karşı sonraki çözümlerin aşırı yorumlamayı tam olarak ele almayabileceğini gösterir.
Yazarlar, saliency haritaları nı, hangi resim alanlarının özellik çıkarma için ilgili olduğunu göstermek için kullanma olasılığını kabul eder, ancak bu, otomatik görüntü ayrıştırma amacını bozar ve büyük ölçekte uygulanamayan insan annotasyonunu gerektirir. Ayrıca, saliency haritalarının model işlemlerine ilişkin insight için yalnızca kaba tahminciler olduğunu gözlemlediler.
Makale şöyle sona erer:
‘Verilen bir model, yalnızca bu tür kalıplara güveniyorsa, bir yorumlama yöntemi modeli doğru bir şekilde tanımlamalıdır, bu da bu anlamsız nedenleri üretecektir, ancak insan ön yargılarına yönelik nedenleri önyargılayan yorumlama yöntemleri, kullanıcıların modellerin amaçlandığı gibi davrandığını düşünmelerine yol açan sonuçlar üretebilir.’
13 Ocak 2022’de ilk kez yayınlandı.












