Anderson’un Açısı
Derin Öğrenme Modelleri AI Tarafından Oluşturulan Görüntüleri Tanımakta Zorlanabilir

Yeni bir makaleden elde edilen bulgular, son teknoloji AI’nin, insanların yapabildiği gibi, AI-sentezlenmiş görüntüleri tanımakta ve yorumlamakta önemli ölçüde daha az yetenekli olduğunu gösteriyor. Bu, makine öğrenimi modellerinin giderek daha fazla sentetik veri üzerinde eğitildiği bir ortamda endişe verici olabilir ve verilerin “gerçek” olup olmadığı her zaman bilinmeyebilir.

Burada resnext101_32x8d_wsl prediction modelinin ‘bagel’ kategorisinde zorlandığını görüyoruz. Testlerde, temel hedef kelimenin (bu durumda ‘bagel’) ilk beş tahmin edilen sonuçta yer almadığı durumlarda bir tanıma hatası meydana geldiği kabul edildi. Kaynak: https://arxiv.org/pdf/2208.10760.pdf
Araştırma, iki tür bilgisayar görüşü tabanlı tanıma çerçevesini test etti: nesne tanıma ve görsel soru yanıtlama (VQA).

Sol tarafta, bir nesne tanıma sisteminden başarılar ve hatalar; sağ tarafta, AI’nin sahne ve görüntüleri daha keşfedici ve önemli bir şekilde anlamasını araştıran VQA görevleri. Kaynaklar: https://arxiv.org/pdf/2105.05312.pdf ve https://arxiv.org/pdf/1505.00468.pdf
On state-of-the-art model, DALL-E 2 ve Midjourney tarafından oluşturulan sentetik görüntüler üzerinde test edildi. En iyi performans gösteren model, yalnızca %60 ve %80’lik bir top-5 doğruluk oranına ulaşabildi, oysa ImageNet, gerçek dünya verisi üzerinde %91 ve %99’luk bir doğruluk oranına ulaşabiliyor. İnsan performansı genellikle çok daha yüksektir.
Makale, dağıtım kayması (aka “Model Drift”) konularını ele alıyor, burada prediction modelleri, eğitim verisinden “gerçek” veriye geçtiğinde öngörme kapasitelerini kaybederler.
‘İnsanlar sentezlenen görüntüleri tanıyabiliyor ve onlarla ilgili soruları kolayca cevaplayabiliyor. Sonuç olarak, derin modellerin sentezlenen içeriği anlamakta zorlandıkları ve fine-tuning sonrasında daha iyi performans gösterebilecekleri sonucuna varıyoruz ve sentezlenen görüntüler ile gerçek fotoğraflar arasında büyük bir dağıtım kayması olduğunu düşünüyoruz. Dağıtım kayması kategoriden kategoriye değişiyor gibi görünüyor.’
Geçen haftaki Stable Diffusion modelinin açık kaynaklı hale getirilmesinin ardından, sentetik görüntülerin interneti sel gibi kaplayabileceği ihtimali ortaya çıkıyor. Bu da, endüstri standardı veri setleri gibi Common Crawl gibi veri setlerine “sahte” görüntülerin girmesi sonucu, yıllar içinde doğruluk oranlarında önemli değişikliklere neden olabilir.
Sentetik veri, bilgisayar görüşü araştırmaları için veri açığını gidermek için bir çözüm olarak görülse de, Stable Diffusion görüntülerinin çoğu, “sahte” olduklarını gösteren etiketler, açıklamalar veya hashtag’ler ile gelmeyecektir. Bu, makine öğrenimi sistemlerinin bu görüntüleri “gerçek” olarak algılamasına ve verilerin kalitesini düşürmesine neden olabilir.
Görüntü sentezleme framework’lerinin geliştirme hızı, bu görüntüleri kategorilere ayırma yeteneğimizi geride bıraktı. Bu nedenle, “sahte görüntü” algılama sistemlerine olan ilgi artıyor.
Yeni makale, “Derin Modeller Sentezlenen Görüntüleri Anlamakta Ne Kadar İyi?” başlığını taşıyor ve San Francisco merkezli makine öğrenimi şirketi Quintic AI’den Ali Borji tarafından yazılmıştır.
Veri
Çalışma, Stable Diffusion sürümünden önce yapıldı ve DALL-E 2 ve Midjourney tarafından oluşturulan verilerin 17 kategorisi üzerinde deneyler içeriyor. Bu kategoriler arasında filler, mantarlar, pizza, pretzel, traktör ve tavşan bulunuyor.

Test edilen tanıma ve VQA sistemlerinin en önemli ana kavramı belirlemeye çalıştığı görüntülerden örnekler.
Görüntüler web aramaları ve Twitter üzerinden elde edildi ve DALL-E 2’nin politikalarına uygun olarak, insan yüzleri içeren hiçbir görüntü kullanılmadı. Sadece iyi kaliteli, insanlar tarafından tanınabilen görüntüler seçildi.
Nesne tanıma ve VQA görevleri için iki ayrı görüntü kümesi oluşturuldu.

Nesne tanıma için her kategorideki görüntü sayısı.
Nesne Tanıma Testi
Nesne tanıma testleri için, ImageNet üzerinde eğitilmiş 10 model test edildi: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit ve ResNext_WSL.
Bazı sınıflar daha granülardı ve ortalama yaklaşımların uygulanması gerekiyordu. Örneğin, ImageNet’te “saat” ile ilgili üç sınıf vardı ve bir tür saatın ilk beş tahmin edilen etiket arasında yer alması durumunda bir başarı olarak kabul edildi.

17 kategoride her modelin performansı.
En iyi performans gösteren model, resnext101_32x8d_ws idi ve %60’lık bir top-1 (yani, ilk beş tahmin edilen etiket arasında doğru kavramın yer alması) ve %80’lik bir top-5 (yani, doğru kavramın ilk beş tahmin edilen etiket arasında yer alması) başarı oranına ulaştı.
Yazar, bu modelin iyi performansının, sosyal medya platformlarında hashtag’lerin zayıf olarak denetlenen tahmininde eğitilmiş olmasından kaynaklandığını düşünüyor. Ancak, bu lider sonuçlar, ImageNet’in gerçek verilerde elde ettiği %91 ve %99’luk başarı oranlarının oldukça altında kalıyor. Yazar, bunun, ImageNet görüntülerinin dağılımı ile sentezlenen görüntülerin dağılımı arasındaki büyük farklılıktan kaynaklandığını düşünüyor.
Sistem için en zor beş kategori, sırasıyla, kite, turtle, squirrel, sunglasses ve helmet oldu. Makale, kite sınıfının souvent balloon, parachute ve umbrella ile karıştırıldığını, ancak bu ayrımların insan gözlemcileri için çok kolay olduğunu belirtiyor.
Bazı kategoriler, örneğin kite ve turtle, tüm modellerde evrensel bir başarısızlığa neden olurken, diğerleri (özellikle pretzel ve tractor) tüm test edilen modellerde neredeyse evrensel bir başarıya yol açtı.

Polarize eden kategoriler: bazı hedef kategoriler ya tüm modelleri yanılttı ya da tüm modeller için oldukça kolaydı.
Yazar, bu bulguların, tüm nesne tanıma modellerinin benzer güçlere ve zayıflıklara sahip olabileceğini gösterdiğini düşünüyor.
Görsel Soru Yanıtlama Testi
Sonraki olarak, yazar, açık uçlu ve serbest VQA ile birlikte ikili soruları (yani, yalnızca “evet” veya “hayır” cevabına sahip sorular) test etti. Makale, son teknoloji VQA modellerinin VQA-v2 veri kümesinde %95’lik bir doğruluk oranına ulaşabildiğini belirtiyor.
Test için 50 görüntü ve bu görüntüler etrafında 241 soru oluşturuldu. 132 soru pozitif, 109 soru negatifti. Ortalama soru uzunluğu 5.12 kelimeydi.
Bu tur, OFA modelini kullandı, bu bir görev-agnostic ve modality-agnostic çerçeve, görev kapsamlılığını test etmek için ve yakın zamanda VQA-v2 test-std setinde lider puanı elde etti. OFA, sentezlenen görüntülerde %77.27’lik bir doğruluk oranına ulaştı, bu da kendi VQA-v2 test-std setindeki %94.7’lik puanının oldukça altında kaldı.
Makale yazarı, bunun nedeninin, sentezlenen görüntülerin VQA-v2 veri kümesinde bulunmayan anlamsal kavramlar içermesinden kaynaklanabileceğini düşünüyor ve bu nedenle OFA modelinin daha zor sorularla karşılaştığını belirtiyor.
Veri Akışındaki LSD?
Yorum
Yeni sentezlenen görüntüleri, doğada bulunmayan kavramların anlık birleşimlerini ve soyutlamalarını sunabilen ve geleneksel yöntemlerle üretiminin çok zaman alacağı sentezlenen görüntülerin yeni bir dalgası, zayıf olarak denetlenen veri toplama sistemleri için özel bir problem oluşturabilir. Bu sistemler, büyük hacimli, etiketsiz sentetik veriyle başa çıkmak için tasarlanmadılar.
Bu sistemler, sentezlenen görüntüleri yanlış sınıflara ayırabilir, çünkü bu görüntülerde birlikte bulunmayan farklı nesneleri içerebilir. Bu, sistemlerin doğruluğunu düşürebilir ve daha sonraki sistemlere ve alt sınıflara yanlış ilişkiler aktarılmasına neden olabilir.

Astronotun bir at sürmesi, yeni nesil görüntü sentezleme sistemlerinin en ikonik görseli haline geldi – ancak bu ‘gerçek dışı’ ilişkiler, gerçek algılama sistemlerine girerse dikkatli olunması gerekiyor. Kaynak: https://twitter.com/openai/status/1511714545529614338?lang=en
Bu, sentetik görüntülerin veri akışına girmesini önlemek için ön işleme aşamasında önlem alınması gerektiği anlamına geliyor. Aksi takdirde, otomatik işleme hatları, sentezlenen görüntüleri gerçek verilerle karıştırabilir ve bu da sistemlerin etkinliğini düşürebilir.
Alternatif olarak, sentezlenen görüntüler, daha sonra ortaya çıkabilecek yeni veya değiştirilmiş mimarilerin, sentezlenen görüntüleri hesaba katmak için çok geniş bir ağ açısına sahip olabileceği durumlarda, daha sonraki sistemlerin doğruluğunu olumsuz etkileyebilir.
Her iki durumda da, Stable Diffusion çağındaki sentetik görüntüler, bu görüntülerin mümkün olmasını sağlayan bilgisayar görüşü araştırma sektörü için bir baş ağrısı olabilir – özellikle de veri toplama ve kürasyonunun daha otomatik ve ucuz hale gelmesi umudu tehlikeye girebilir.
İlk olarak 1 Eylül 2022’de yayımlandı.













