Anderson’un Açısı
Adobe ve Meta, Bilgisayar Görme Araştırmalarında Kullanıcı Çalışmaları Suistimalini Eleştiriyor

Adobe ve Meta, Washington Üniversitesi ile birlikte, bilgisayar görme (CV) araştırmalarında kullanıcı çalışmalarının artan şekilde suistimal edildiğini ve kötüye kullanıldığını iddia ettikleri kapsamlı bir eleştiri yayınladılar.
Kullanıcı çalışmaları, bir zamanlar genellikle yerel halk veya kampüs çevresindeki bir veya daha fazla akademik kurumun öğrencileriyle sınırlıydı, ancak şimdi neredeyse tamamen online crowdsourcing platformlarına such as Amazon Mechanical Turk (AMT) göç etti.
Geniş bir dizi şikayet arasında, yeni makale, araştırma projelerinin kağıt inceleyicileri tarafından çalışmalar üretmeye zorlandığını, genellikle çalışmaları kötü şekilde formüle ettiğini, mantıksal olarak projenin bu yaklaşımı desteklemediği çalışmalar sipariş ettiğini ve souvent ‘gamed’ tarafından sinik crowdworkers tarafından iddia etti.
On beş sayfalık tez (başlığı Bilgisayar Grafikleri ve Görme Alanında Daha İyi Kullanıcı Çalışmaları) yeni makalenin merkezi bölümü, crowdsourced kullanıcı çalışmalarının aslında bilgisayar görme alt sektörlerinin ilerlemesini engelleyebileceği konusunda birçok başka eleştiri getiriyor.
Makale, kullanıcı çalışmalarına ilişkin çok daha geniş bir dizi sorunu ele alır, ancak en güçlü eleştirilerini, kullanıcı çalışmalarında çıktı değerlendirmesi (yani, crowdsourced insanların yeni görüntü sentezleme algoritmalarının çıktısı gibi şeyleri değerlendirmek için kullanıcı çalışmalarında ödenen) tüm sektörü olumsuz şekilde etkileyebileceği konusunda saklar.
Birkaç merkezi noktanın seçilimine bakalım.
Sensasyonel Yorumlar
Makale, bilgisayar görme sektöründe yayımlananlar için öneriler sunar ve ‘sonuçları dikkatli bir şekilde yorumlayın’ uyarısını içerir. Makale, 2021’de, bireylerin AI tarafından üretilen sanat eserlerini doğru bir şekilde tanımlayamadıklarını iddia eden bir yeni araştırma çalışması örneğini verir.

Yeni makalede belirtilen 2021 çalışmasının daha yüksek profilli medya raporlarından biri. Burada, The Daily Mail’in kaynağı The Times (ödemeli duvar). Kaynaklar: Daily Mail (arşiv bağlantısı) / https://www.gwern.net/docs/ai/nn/gan/2021-gangadharbatla.pdf
Yazarlar şöyle diyor*:
‘[Bir] çalışmada psikoloji dergisinde, geleneksel sanat eserlerinin ve AI teknolojileri tarafından oluşturulan görüntüler web’den toplandı ve crowdworkers bu görüntülerin hangi kaynaktan geldiğini ayırt etmeleri istendi. Sonuçlardan, “bireylerin AI tarafından üretilen sanat eserlerini doğru bir şekilde tanımlayamadıkları” sonucuna varıldı, bu çok geniş bir sonuçtur ve deneylerden doğrudan çıkmaz.
‘Ayrıca, makale, hangi özel görüntü setlerinin toplandığını veya kullanıldığını bildirmez, bu iddiaları doğrulamak ve yeniden üretmek zor, eğer değilse imkansız.’
‘Daha endişe verici olan, popüler basının bu sonuçları AI’lerin insanlarla aynı düzeyde sanat yapabildiği iddiasıyla yanlış bir şekilde sunduğu.’
Crowdworkersın Hile Yapmasını Engelleme
Crowdsourced işçiler genellikle çabaları için fazla ödeme almazlar. sinceTheir prospects are minimal, ve en iyi kazanç potansiyelleri, yüksek hacimli görevleri tamamlamaktan geçer, birçokları, araştırma önerir, mevcut görevi hızlandırmak için her türlü ‘kısayolu’ almaya eğilimlidir.
Makale, crowdsourced işçilerin, makine öğrenimi sistemleri gibi, kullanıcı çalışmalarında araştırmacılar tarafından formüle edilen tekrarlayan desenleri öğreneceğini ve gerçekten organik bir yanıt üretmek yerine, ‘doğru’ veya ‘istenilen’ yanıtı çıkaracağını gözlemledi.
Bu amaçla, makale, crowdsourced işçilerin ‘geçerlilik denemeleri’ veya ‘gözcüleri’ olarak bilinen kontroller yapılmasını önerir – efektif olarak, bir testin sahte kısımları, işçinin dikkatli olup olmadığını, rastgele tıklayıp tıklayamadığını veya testlerden kendisi çıkarılan bir deseni takip edip etmediğini görmek için tasarlanmıştır.
Yazarlar şöyle diyor:
‘Örneğin, stilize edilmiş görüntülerin çiftlerinde, bir görüntü kasıtlı olarak kötü kalite olabilir. Analiz sırasında, önceden belirlenmiş bir sayıda kontrole başarısız olan katılımcıların verileri atılabilir, dikkatsiz veya tutarsız olduklarına varsayılarak.’
‘Bu kontroller çalışmanın içine rastgele yerleştirilmeli ve diğer denemelerle aynı görünmelidir; aksi takdirde, katılımcılar hangi denemelerin kontrol olduğunu çözebilir.’
Araştırmacıların Hile Yapmasını Engelleme
Araştırmacılar, kasıtlı veya kasıtsız olarak, bu tür ‘oyunlara’ ortak olabilirler; crowdworkers’a istedikleri seçimleri ‘sinyal’ vermeleri için birçok yol vardır.
Örneğin, makale, crowdworkers’ın profillerini, bir çalışmada ‘ideal’ yanıtları elde etmek için seçebileceğini gözlemledi.
Sözdizimi de önemli bir endişe kaynağı:
‘Sözdizimi, yüksek düzeyli hedefleri yansıtmalıdır, örneğin “hangisi daha az artifact içerir?” yerine “hangisi yüz bölgesinde daha az renk hatası içerir?” Ayrıca, belirsiz görev sözdizimi, yorum için çok fazla şey bırakır, örneğin “hangisi daha iyidir?” estetik olarak daha hoş olduğu şeklinde anlaşılabilir, oysa amaç gerçekçiliği değerlendirmekti.’
Araştırmacılar, katılımcılara, önlerinde bulunan olası seçenekler arasından hangisinin yazarın yöntemi olduğunu, önceki bir yöntem veya rastgele bir örnek olmadığını, açık veya örtük olarak bildirmenin bir başka yolu.
Makale şöyle diyor*:
‘[Katılımcılar] araştırmacıların istediği yanıtları verebilir, bilinçli veya bilinçsiz olarak, bu da “iyi konu etkisi” olarak bilinir. Çıktıları “bizim yöntemimiz” veya “mevcut yöntem” gibi adlarla etiketlemeyin. Katılımcılar, araştırmacıların kullandığı dil tarafından önyargılı olabilir, örneğin “dün inşa ettiğim bu aracı nasıl buluyorsunuz?” Araştırmacılar ve katılımcıların ilişkisi de (örneğin, her ikisi de aynı laboratuvarda veya şirketin çalışanıysa) önyargılı olabilir.’
Kullanıcı çalışmasındaki bir görevin formatı da çalışmanın tarafsızlığını etkileyebilir. Yazarlar, bir yan yana sunumda, temel olanın her zaman solda (yani ‘görüntü A’) ve yeni algoritmanın çıktısının sağda olduğu durumlarda, çalışma katılımcıları, B’nin ‘en iyi’ seçim olduğuna dair bir çıkarım yapabilir, araştırmacıların umduğu sonucun artan varsayımına dayanarak.
‘Görüntülerin ekran上的 boyutu, birbirlerine olan mesafeleri gibi diğer sunum aspects, katılımcıların yanıtlarını etkileyebilir. Çalışmayı birkaç farklı ayar ile pilotlamak, bu potansiyel karıştırıcı faktörleri erken tespit etmeye yardımcı olabilir.’
Yanlış İnsanların Yanlış Ürün için
Yazarlar, makalede birkaç noktada, crowdsourced işçilerin, önceki onyıllarda araştırmacıların genellikle yerel olarak ve genellikle akademik kurumların öğrencileri arasında yardım istemeye zorlandıkları daha ‘genel’ bir kaynak olduğunu gözlemlediler.
Etkin katılım gereksinimi, işe alınan crowdworker’a bir ürünü test etme konusunda fazla alan bırakmaz ve makale yazarları, araştırmacıların, bir potansiyel ürün veya hizmet geliştirmeden ve test etmeden önce hedef kullanıcılarını tanımlamalarını önerir – aksi takdirde, üretmesi zor, ancak kimsenin istemediği bir şey üretebilirler.
‘Gerçekten, bilgisayar grafikleri veya görme araştırmacılarının endüstri uygulayıcıları tarafından araştırmalarını benimsemeye çalıştıklarını, ancak araştırmaların hedef kullanıcıların ihtiyaçlarını karşılamadığını gördüğümüz çok oldu. Araştırmacılar, başlangıçta ihtiyaç bulma yapmazlarsa, geliştirdikleri aracın kullanıcılar için hiçbir ihtiyacı veya ilgisini karşılamadığını keşfedebilirler.’
‘Bu tür araçlar, kullanıcı çalışmaları sırasında kötü performans gösterebilir, çünkü kullanıcılar, teknolojinin işe yaramaz, alakasız veya beklenmedik sonuçlar ürettiğini düşünebilir.’
Makale, kullanıcıların bir ürünü gerçekten kullanma olasılığı yüksek olanların, kolay bulunmasalar da (veya, muhtemelen, ucuz olmasalar da) çalışmalara seçilmesi gerektiğini gözlemledi.
Kampüste işe alma uygulamasına geri dönmek yerine (ki bu belki de biraz geriye dönük bir hareket olurdu), yazarlar, araştırmacıların ‘vahşi’ kullanıcıları işe aldıklarını ve ilgili topluluklarla etkileşime girdiklerini önerdi.
‘Örneğin, bir ilgili aktif online mesaj panosu veya sosyal medya topluluğu kullanılabilir. Topluluğun yalnızca bir üyesi ile bile görüşmek, kar yağışı örneklemesi ile benzer bireylere ağdaki bağlantılar sunabilir.’
Geribildirim İsteme
Makale, kullanıcı çalışmalarına katılanlardan nitel geri bildirim istemenin de önerildiğini, çünkü bu, araştırmacıların yanlış varsayımlarını ortaya çıkarabileceğini gözlemledi.
‘Bu, çalışmayı hatalarıyla birlikte debug etmeye yardımcı olabilir, ancak çıktı tarafından etkilenen kullanıcıların derecelendirmelerini etkileyen beklenmedik yönleri de ortaya çıkarabilir. Katılımcı, çıktı ile çok memnun değilse, gerçekçi olmaması, estetik olmaması, önyargılı olması veya başka bir nedenle mi?’
‘Nitel bilgiler olmadan, araştırmacı, algoritmayı daha gerçekçi hale getirmeye çalışabilir, ancak temel kullanıcı sorununu ele almaz.’
Makaledeki birçok öneri gibi, bu öneri de, araştırmacıların zaman ve para harcamasını gerektirir, bu kültür, hızlı ve pratik olarak zorunlu crowdsourced kullanıcı çalışmalarına doğru kaymaktadır ve genellikle oldukça ucuzdur ve makaledeki eleştirilere tabi olan bir çalışma kültürüne uygundur.
Aşırı Çalışılmış
Makale, kullanıcı çalışmalarının, ön baskı bilgisayar görme topluluğunda bir tür ‘minimum gereksinim’ haline geldiğini, hatta bir çalışma formüle edilemeyecek durumlarda (örneğin, hiçbir ‘benzer’ analizi yapılamayacak kadar yeni veya marjinal bir fikir ve hiçbir anlamlı sonuç üretemeyecek bir metriğe tabi olamayan) önerir.
Örneğin, yazarlar, bir ICLR 2022 makalesi için çevrimiçi olarak mevcut (24 Haziran 2022’de alınan arşiv görüntüsü; bağlantı doğrudan yeni makaleden alınmıştır)† peer incelemelerine atıfta bulunurlar:
‘İki inceleme, kısmen, kullanıcı çalışmaları eksikliği nedeniyle çok olumsuz puanlar verdi. Makale sonunda kabul edildi ve inceleme yapanları “kullanıcı çalışmaları”nı kötü inceleme bahanesi olarak kullandıkları ve kapı bekçiliği yaptıkları için azarlayan bir özet eşliğinde kabul edildi. Tam tartışma okunmaya değer.’
‘Son karar, makalenin, binlerce kullanıcıya (gizli inceleme için inceleme yapanlara açıklanmayan bilgi) yıllarca dağıtılan bir yazılım kütüphanesini tanımladığını belirtti. Bu bilgiye sahip olmasalardı, makale kabul edilir miydi?’
‘Ve, yazarlar, bir kullanıcı çalışması yapmak için ek çaba sarf etselerdi, anlamlı olur muydu ve inceleme yapanları ikna eder miydi?’
Yazarlar, inceleme yapanların ve editörlerin, gerçekten bir anlamı veya değeri olmasa da, makalelere ‘ağır değerlendirme gereksinimleri’ dayattıklarını gözlemlediler.
‘Ayrıca, yazarların ve inceleme yapanların, MTurk değerlendirmelerini, zor kararlar vermekten kaçınmak için bir dayanak olarak kullandıklarını gözlemledik. İnceleme yapanların yorumları gibi “İmgelerin hangisinin daha iyi olduğunu söyleyemiyorum, belki bir kullanıcı çalışması yardımcı olabilir” potentially zararlıdır, yazarları, kağıdını iyileştirmeyecek ek çalışmaya yöneltir.’
Yazarlar, makaleyi, bilgisayar görme ve bilgisayar grafikleri topluluklarının, kullanıcı çalışmalarını isteme şeklini daha dikkatli bir şekilde düşünme çağrısıyla kapatırlar, bunun yerine, bir çalışma kültürünün gelişmesine izin vermemelidir.
Yazarlar şöyle diyor:
‘[Eğer] birincil hedef, kullanıcı çalışmalarını inceleme yapanları memnun etmek ise, böyle kullanıcı çalışmalarının faydası ve geçerliliği, yazarlar ve inceleme yapanlar tarafından sorgulanmalıdır. Çalışmalarda kullanıcı değerlendirmesi bulunmayan çalışmaları cezalandırmak, aceleyle yapılan, kötü yürütülen kullanıcı araştırmalarına yol açar.
‘Unutulmaması gereken bir azim, “kötü kullanıcı araştırmaları kötü sonuçlara yol açar” ve böyle araştırmalar, inceleme yapanlar devam ederse devam edecektir.’
* Makalenin içindeki alıntıların ilgili hyperlinks’e dönüştürülmesi
† Vurgu, yazarların değil, benim.
İlk olarak 24 Haziran 2022’de yayımlandı.












