Anderson’un Açısı
‘Daha Fazla Etiket İndir!’ Illüzyonu AI Araştırmalarında

Şu anda makine öğrenimi araştırmalarında, makine öğreniminin kendisi, özellikle görme-dil modelleri (VLM’ler) için tasarlanan görüntü açıklamaları gibi AI veri seti açıklamalarının kalitesini geliştirmek için kullanılabileceği yaygın bir görüş vardır. Bu düşünce, insan açıklamasının yüksek maliyeti ve açıklama performansı gözetim ek yükü tarafından yönlendirilir.
Argüman olarak, bu, 2000’lerin başındaki ‘daha fazla RAM indir’ mizahının AI eşdeğeri olabilir, bu da bir donanım kısıtlamasının bir yazılım tabanlı düzeltmeyle çözülebileceği fikrini alaycı bir şekilde eleştirir.
Ayrıca, bu, göz ardı edilen bir sorun; yeni AI modelleri kamu ve ticari alanlarda geniş ilgi görürken, açıklama genellikle makine öğrenimi boru hatlarında küçük bir ayrıntı olarak görünür ve daha geniş çerçevelerle ilgili heyecan tarafından gölgelenir.
Gerçekte, makine öğrenimi sistemlerinin desenleri tanımak ve yeniden üretmek yeteneği (neredeyse tüm AI sistemlerinin merkezi kullanım durumu) gerçek dünya açıklamalarının kalitesi ve tutarlılığına bağlıdır – insanlar tarafından oluşturulan veya yargılanan etiketler ve ifadeler, genellikle veri noktaları hakkında subjektif yargılar yapan, ideal olmayan koşullarda.
Kendiliğinden, açıklama davranışında desenleri gözlemlemek ve yeniden üretmek isteyen sistemler (ve böylece insan açıklamacıları değiştirmek ve doğru etiketlemeyi ölçeklendirerek kolaylaştırmak), insan gözlemcilerden alınan örneklerde yer almayan verilere iyi performans gösteremez. Hiçbir şey tam olarak aynı değildir ve çapraz-alan eşdeğerliği, bilgisayar görme problematik bir takip olmaya devam eder.
‘Yukarıdaki veri paraları’ bir yerde durmak zorunda ve bu durumda, tam olarak orada duruyor – bir insan beyin sapı, bir yapay sistem için verileri kodlamak amacıyla bazı subjektif ayrımlar yapıyor.
RAG Ticaret
Son zamanlara kadar, недостаточно küratelenmiş veri seti açıklamalarından kaynaklanan yanlışlıklar, belki de, üretilen AI sistemlerinin mükemmel olmayan ancak masih pazarlanabilir sonuçlarının bağlamında kabul edilebilir yan ürün olarak görülüyordu.
Gerçekten de, bu yıl Singapur’dan yapılan bir çalışma, sonuçlandırdı ki, hayaller – yani, AI sistemlerinin niyetlerimizi zayıflatan şeyler uydurduğu durumlar – kaçınılmazdır ve bu tür sistemlerin kavramsal mimarisine bağlıdır.
Buna karşılık, RAG tabanlı ajanlar – internet aramaları yoluyla ‘doğrulama’ yapabilen – araştırma ve uygulamalı ticari çözümlerde popüler hale geliyor. Ancak, bunlar kaynak maliyetini ve sorgu gecikmesini artırıyor; ayrıca, eğitimli bir modele uygulanan yeni bilgiler, eğitimli modelin yerel katmanlarındaki daha karmaşık ve iç içe bağlantılar ile rekabet edemez.
Bu nedenle, bu modellere bilgi veren açıklama verilerinin ilk başta önemli ölçüde daha az hatalı olması daha iyi olur, hatta mükemmel olmasa da (en azından bu faaliyet, insan subjektivitesinin alanına giriyor).
RePOPE
Almanya’dan yeni bir makale, daha önce yaygın olarak kullanılan veri setlerine güvenilemeyeceğini vurguluyor, özellikle de görüntü açıklamalarının doğruluğu ve güvenilirliği konusunda odaklanıyor. Araştırmacıların bulguları, etiket hatalarının, görme-dil modellerindeki hayalleri gizleyebileceğini veya yanlış temsil edebileceğini gösteriyor.

Yeni makaleden, orijinal açıklamaların görüntü içindeki nesneleri doğru şekilde tanımlayamadığı bazı örnekler. Araştırmacıların POPE benchmark veri setinin el ile revizyonu, bu eksiklikleri gideriyor ve açıklama kürasyonunda para tasarrufunun maliyetini gösteriyor. Kaynak: https://arxiv.org/pdf/2504.15707
Örneğin, bir model, bir sokak sahnesi görüntüsüne gösterilir ve görüntüde bir bisiklet olup olmadığı sorulur. Model evet der. Eğer benchmark veri seti bisiklet olmadığını söylerse, model yanlış olarak işaretlenir. Ancak, bisiklet açıkça görünüyorsa ve sadece açıklama sırasında kaçırılmışsa, modelin cevabı doğruydu ve benchmark hatalıdır. Bu tür hatalar, bir veri seti boyunca birikerek, hangi modellerin doğru ve hangi modellerin hayallerini gösteren bir yanlış resim oluşturur.
Bu nedenle, hatalı veya belirsiz açıklamalar doğru olarak kabul edildiğinde, modeller hayallerini gösteriyor gibi görünebilir veya doğru gibi görünebilir, ancak gerçekte değil, bu da hayallerin ölçümünü ve model performansının sıralamasını bozuyor ve sorunu teşhis etmeyi veya ele almayı daha zor hale getiriyor.
Yeni makale, görme-dil modellerinin nesne hayallerini test etmek için kullanılan Polling-based Object Probing Evaluation (POPE) adlı yaygın bir benchmark’u yeniden ziyaret ediyor.
POPE, Microsoft COCO: Common Objects in Context (MSCOCO) veri setinden etiketlere dayalıdır, bu veri seti, uzun süredir iyi düzeyde açıklama doğruluğu sunan bir görüntü koleksiyonu olarak kabul edilmiştir.
POPE, büyük görme-dil modellerindeki nesne hayallerini, bir ikili sınıflandırma görevi olarak yeniden formüle ederek değerlendirir. Üretilen açıklamaları analiz etmek yerine, model yes/no soruları sorar, Örneğin, ‘Görüntüde bir <nesne> var mı?’ gibi.

Görme-dil modellerindeki nesne hayalleri örnekleri. Kalın etiketler, orijinal açıklamalarda bulunan nesneleri gösterir, kırmızı etiketler ise modeller tarafından hayali nesneleri gösterir. Soldaki örnek, geleneksel bir talimat tabanlı değerlendirmeyi yansıtır, sağdaki üç örnek ise farklı POPE benchmark varyantlarından alınmıştır. Kaynak: https://aclanthology.org/2023.emnlp-main.20.pdf
Temel gerçek nesneler (cevap: Evet) ile seçilen olmayan var olmayan nesneler (cevap: Hayır) eşleştirilir, bu eşleştirmeler rastgele, sık (popüler) veya birlikte ortaya çıkma tabanlı (kötü niyetli) stratejilerle yapılır. Bu kurulum, karmaşık kurallı tabanlı açıklama analizine güvenmeden, daha稳il ve tetikleyici-duyarlı olmayan bir hayalete değerlendirmeye izin verir.
Yeni makaledeki yazarlar, yeni makale – RePOPE: POPE Benchmark’indeki Açıklama Hatalarının Etkisi – POPE’nin varsayılan doğruluğunu, görüntülerin etiketlerini yeniden kontrol ederek (yani, MSCOCO) – ve şaşırtıcı sayıda yanlış veya belirsiz olduğunu bularak meydan okur.

2014 MSCOCO veri setinden örnekler. Kaynak: https://arxiv.org/pdf/1405.0312
Bu hatalar, modellerin sıralamasını değiştirir, ilk olarak iyi performans gösteren bazı modeller, düzeltilmiş etiketlere göre değerlendirildiğinde geride kalır.
Testlerde, yazarlar, çeşitli açık ağırlıklı görme-dil modellerini hem orijinal POPE benchmark’unun hem de düzeltilmiş RePOPE sürümünün üzerinde değerlendirdiler.
Makaleye göre, düzeltilmiş açıklamalar, özellikle F1 puanlarında, bazı yüksek performanslı modellerin POPE’de düşüşe geçtiği önemli sıralama değişikliklerine yol açtı.
Yazarlar, bu değişikliğin, açıklama hatalarının modellerin hayalete eğilimini nasıl gizleyebileceğini gösterdiğini ve RePOPE’yi, hayalete karşı daha güvenilir bir araç olarak sunduklarını iddia ediyorlar.

Yeni makaleden, orijinal POPE açıklamalarının bazı örnekler. Sağdaki fotoğraftaki tramın kabini yanında oturan bir kişi veya soldan ikinci fotoğraftaki tenis oyuncusunun arkasındaki sandalye gibi ince nesneleri tanımlayamadıkları görülüyor.
Yöntem ve Testler
Araştırmacılar, orijinal MSCOCO veri setindeki tüm açıklamaları yeniden etiketlediler, her veri örneğine iki insan etiketleyicisi atandı. Orijinal etiketlerin kalitesi konusunda belirsizlik ortaya çıktığında (aşağıdaki örneklerde olduğu gibi), bu sonuçlar test turundan çıkarıldı.

Belirsiz durumlar, POPE’deki etiket tutarlılıklarının belirsiz kategorilerle ilgili olduğunu gösteriyor. Örneğin, bir ayı olarak etiketlenen bir ayı oyuncak, bir bisiklet olarak etiketlenen bir motosiklet veya arabalar olarak etiketlenen havaalanı araçları. Bu durumlar, subjektif sınıflandırmalar ve MSCOCO’nun orijinal etiketlerinin tutarlılıkları nedeniyle RePOPE’den çıkarıldı.
Makalede denir:
‘Orijinal açıklamacılar, arka plandaki veya camın arkasındaki kişilerle ilgili ayrıntıları kaçırdı, tenis oyuncusu arka plandaki ‘sandalyeleri’ gizledi ve lahana salatası sadece küçük bir havuç şeridi içeriyordu. ‘
‘Bazı nesneler için, COCO açıklamaları muhtemelen orijinal açıklamacılar tarafından kullanılan farklı tanımlar nedeniyle tutarlı değildir. Bir ‘ayı oyuncak’ olarak bir ‘ayı’ sınıflandırılması, bir motosiklet olarak bir ‘motorlu bisiklet’ veya bir havaalanı aracı olarak bir ‘araba’ sınıflandırılması, spesifik tanımlara bağlıdır ve bu da POPE temel gerçek açıklamalarında tutarsızlıklara yol açar. Bu nedenle, ilgili görüntü-soru çiftlerini ‘belirsiz’ olarak etiketliyoruz.’

Yeniden etiketlemenin sonuçları: pozitif sorular tüm POPE varyantları boyunca paylaşılmaktadır. POPE’de ‘Evet’ olarak etiketlenenler arasında %9,3’ü yanlış ve %13,8’i belirsiz olarak bulundu. ‘Hayır’ soruları için, %1,7’si yanlış etiketlendi ve %4,3’ü belirsizdi.
Yazarlar, çeşitli açık ağırlıklı modelleri POPE ve RePOPE’de değerlendirdiler, çeşitli mimariler ve model boyutları boyunca. Seçilen modeller, OpenVLM liderlik tablosunda yer alan bazı önde gelen mimarileri içeriyordu: InternVL2.5 (8B/26B/38B/78B ve 8B-MPO/26B-MPO); LLaVA-NeXT; Vicuna; Mistral 7b; Llama; LLaVA-OneVision; Ovis2 (1B/2B/4B/8B); PaliGemma-3B; ve PaliGemma2 (3B/10B).

İlk sonuçlar: orijinal pozitif etiketlerdeki yüksek hata oranı, tüm modellerde doğru pozitiflerde keskin bir düşüşe yol açar. Yanlış pozitifler, neredeyse tüm modellerde rastgele alt kümede iki katına çıkarken, popüler alt kümede büyük ölçüde değişmez ve adversarial alt kümede hafif bir azalma gösterir. Etiketlerin düzeltilmesi, F1 tabanlı sıralamalarda önemli bir etkiye sahiptir. POPE’de popüler ve adversarial bölümlerde iyi performans gösteren Ovis2-4B ve Ovis2-8B gibi modeller, RePOPE’de rastgele alt kümede de üst sıralara çıkar.
Yukarıdaki sonuç grafikleri, düzeltilmiş etiketlerden sonra doğru pozitif ve yanlış pozitiflerin nasıl değiştiğini gösterir.
Doğru pozitifler, tüm modellerde düştü, bu da modellerin genellikle hatalı etiketler altında doğru cevaplar için kredi aldıklarını gösteriyor, yanlış pozitifler ise daha çeşitli bir modèle izledi. Rastgele alt kümede, yanlış pozitifler birçok modelde neredeyse ikiye katlanarak, birçok nesnenin aslında görüntüde mevcut olduğunu, ancak orijinal açıklamalarda kaçırıldığını gösterdi. Bu durumda, birçok varsayılan model hatası, aslında veri seti etiketleme hatalarıydı.
Adversarial alt kümede, yanlış pozitifler azaldı, bu da aslında görüntüde bulunan, ancak etiketlenmeyen nesnelerin daha yüksek bir olasılıkla var olduğunu gösterdi.
Bu değişiklikler, doğruluk ve geri çağırma üzerinde etkileri olsa da, model sıralamaları her iki ölçüt için de nispeten istikrarlı kaldı.
F1 puanı – POPE’nin ana değerlendirme ölçütü – etiket düzeltmelerine karşı daha duyarlıydı. Rastgele alt kümede, orijinal etiketlerle iyi performans gösteren modeller, RePOPE’de en alt sıralara düştü. Diğerleri, Ovis2-4B ve Ovis2-8B gibi, RePOPE’de üst sıralara yükseldi.
Benzer bir model, doğruluk puanlarında ortaya çıktı, ancak yazarlar, düzeltilmiş veri setinin artık pozitif ve negatif örneklerin dengesiz bir dağılımına sahip olabileceğini not ediyor.
Yazarlar, açıklama hatalarının benchmark sonuçları üzerindeki güçlü etkisinin, yüksek kaliteli verilerin gerekliliğini vurguladığını savunuyor. Nesne hayalesinin daha güvenilir bir şekilde değerlendirilmesi için, düzeltilmiş etiketleri GitHub’da yayınladılar.
Ancak, bu yeniden etiketlemenin benchmark’un doygunluğunu tamamen gidermediğini, birçok modelin hala doğru pozitif ve doğru negatif oranlarında %90’ın üzerinde performans gösterdiğini not ediyorlar. Ek benchmark’lar, DASH-B gibi, daha zorlu negatif örnekler kullanan, RePOPE ile birlikte kullanılmalıdır.
SONUÇ
Bu özel deney, veri setinin çok küçük ölçekli olması nedeniyle mümkün oldu. Aynı hipotezi hiperskala veri setlerinde kanıtlamak, veri parçasının çok sınırlı bölümlerinde çalışmayı gerektirecekti; büyük ve çeşitli veri setlerinde, istatistiksel olarak temsil edici ve anlamsal olarak tutarlı grupları izole etmek mümkün olmayabilir – bu da sonuçları bozabilir.
Şayet mümkün olsaydı, mevcut durumun altında ne tür bir çözüm olabilir? Argüman, kaçınılmaz bir şekilde, daha iyi ve daha kapsamlı insan açıklamalarına duyulan ihtiyaca geri döner.
Bu bağlamda, ‘daha iyi’ ve ‘daha kapsamlı’, kendi başlarına ayrı sorunlar olarak var olur, çünkü insan açıklamalarının daha büyük bir hacmini, Amazon Mechanical Turk (AMT) gibi düşük ücretli ekonomiler aracılığıyla elde edilebilir. Açıkça, bu potansiyel olarak sömürücü bir alt ekonomi, genellikle düşük kaliteli sonuçlar ile sonuçlanır.
Alternatif olarak, açıklama görevlerini, aynı harcama ile daha fazla açıklama elde edilebilecek ekonomik bölgelere dışarıdan kaynak sağlayarak gerçekleştirebilirsiniz. Ancak, açıklamacı, modelin hedef kullanım alanından ne kadar uzaklaşırsa, oluşan modelin hedef alanın gereksinimlerine veya beklentilerine uyma olasılığı o kadar azalır.
Bu, makine öğrenimi geliştirme ekonomisinin en kalıcı ve çözülmemiş sorunlarından biri olarak kalır.
İlk olarak 23 Nisan 2025 Çarşamba günü yayınlandı.












