Anderson’un Açısı

Amazon Mechanical Turk’un Eksiklikleri Doğal Dil Oluşturma Sistemlerini Tehdit Ediyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Massachusetts Amherst Üniversitesi’nden yeni bir çalışmada, İngilizce öğretmenleri Amazon Mechanical Turk’taki kalabalık işçilerle karşılaştırılarak Doğal Dil Oluşturma (NLG) sistemlerinin çıktıları değerlendirilmiş ve sonuçta AMT işçilerindeki gevşek standartlar ve görevlerin “oyunlaştırılması”nın sektörün gelişimini engelleyebileceği sonucuna varılmıştır.

Rapor, açık uçlu NLG değerlendirme görevlerinin endüstriyel ölçekte ucuz dış kaynak kullanımınıninferior sonuçlara ve algoritmalarına yol açabileceği konusunda çeşitli eleştiriler getiriyor.

Araştırmacılar ayrıca, AMT’yi kullanan 45 makalelik bir liste derlediler ve bunların “büyük çoğunluğunun” AMT kullanımıyla ilgili kritik ayrıntıları rapor etmediğini, bu da makalelerin sonuçlarını yeniden üretmeyi zorlaştırdığını buldular.

Terzi Dükkânı İşgücü

Rapor, hem Amazon Mechanical Turk’un terzi dükkânı niteliğindeki doğasını hem de (muhtemelen bütçe kısıtlamalı) akademik projeleri eleştiriyor; bu projeler AMT’yi geçerli ve tutarlı bir araştırma kaynağı olarak kullanıyor ve ona atıf yapıyor. Yazarlar şöyle diyor:

‘AMT uygun ve ucuz bir çözüm olsa da, yüksek varyansın, kötü kalibrasyonun ve bilişsel olarak talep edilen görevlerin araştırmacıların aldatıcı bilimsel sonuçlara varmasına neden olabileceğini gözlemliyoruz (örneğin, insan yazdığı metnin GPT-2’den daha kötü olduğu).’

Rapor, oyuncuları değil oyunu suçluyor; araştırmacılar şöyle diyor:

‘[Kalabalık] işçiler sık sık emeklerinin karşılığını alamıyorlar, bu da araştırmanın kalitesini ve daha da önemlisi bu kalabalık işçilerin yeterli bir yaşam standardına ulaşma yeteneklerini olumsuz etkiliyor.’

Makale, Açık Uçlu Metin Oluşturma için Mechanical Turk Kullanmanın Tehlikeleri başlığını taşıyor ve ayrıca ‘uzman değerlendirmenler’ olarak dil öğretmenleri ve dilbilimcilerin açık uçlu yapay NLG içeriğini değerlendirmek için kullanılmasını öneriyor; bu, AMT’den daha pahalı olsa da.

Test Görevleri

AMT’nin performansını, zaman kısıtlaması olmayan, uzman okuyucularla karşılaştıran araştırmacılar, karşılaştırmalı testlerde kullanılan AMT hizmetleri için 144 dolar harcadı (ancak çok daha fazlasını “kullanılmayan” sonuçlara harcadı – aşağıya bakınız), rastgele “Turks”tan 200 metin değerlendirmesini istedi; bu metinler insan tarafından oluşturulan metin içeriği ve yapay olarak oluşturulan metin arasında bölündü.

Mesleki öğretmenlerin aynı işi yapması 187.50 dolar maliyetindeydi ve performanslarını Upwork freelancer’larını görevi tekrarlamak üzere işe alarak doğruladı; bu da 262.50 dolar daha maliyet getirdi.

Her görev dört değerlendirme kriterinden oluşuyordu: dilbilgisi (‘Metin parçasının dilbilgisi nasıl?’); tutarlılık (‘Metin parçasındaki cümleler nasıl bir araya geliyor?’); beğeni (‘Metin parçasını nasıl buluyorsunuz?’); ve alaka düzeyi (‘Metin parçası.prompt ile nasıl ilgili?’).

Metin Oluşturma

Testler için NLG materyali elde etmek amacıyla araştırmacılar, Facebook AI Research’ın 2018 Hiyerarşik Öykü Oluşturma veritabanını kullandı; bu, 303.358 İngilizce hikayeden oluşuyor ve bu hikayeler, 15 milyondan fazla kullanıcısı olan r/WritingPrompts subreddit’de kullanıcılar tarafından oluşturuldu; bu subreddit’de kullanıcıların hikayeleri tek cümlelik “promt”larla “tohumlanıyor”; bu, metin-Resim oluşturma ve açık uçlu Doğal Dil Oluşturma sistemlerinde güncel uygulamalara benzer.

Veritabanından 200 promt rastgele seçildi ve Hugging-Face Transformers kütüphanesi kullanılarak bir GPT-2 modelinden geçirildi. Böylece aynı promt’lardan iki sonuç seti elde edildi: Reddit kullanıcılarından insan tarafından yazılan hikayeler ve GPT-2 tarafından oluşturulan metinler.

Aynı AMT işçilerinin aynı hikayeyi birden fazla kez değerlendirmemesi için, her örnek için üç AMT işçisi değerlendirmesi istendi. Bu, AMT hizmetleri için toplam harcamayı yaklaşık 1.500 dolar USD’ye çıkardı.

Her test, haftaiçi günlerinde 11:00-11:30 PST arasında yapıldı.

Sonuçlar ve Sonuçlar

Çalışma geniş bir alanı kapsıyor, ancak ana noktalar şunlar:

Kısa Süre

Makale, Amazon’un resmi olarak bildirilen 360 saniyelik görev süresinin, gerçekte yalnızca 22 saniye ve median çalışma süresinin sadece 13 saniye olduğunu buldu; bu, görevi tekrarlayan en hızlı İngilizce öğretmenin harcadığı sürenin dörtte biri.

Çalışmanın 2. gününden: bireysel işçiler (turuncu) görevleri değerlendirirken, daha iyi ücretli öğretmenler ve (daha sonra) daha iyi ücretli Upwork sözleşmeli işçilere kıyasla çok daha az zaman harcadı. Kaynak: https://arxiv.org/pdf/2109.06835.pdf

Çalışmanın 2. gününden: bireysel işçiler (turuncu) görevleri değerlendirirken, daha iyi ücretli öğretmenler ve (daha sonra) daha iyi ücretli Upwork sözleşmeli işçilere kıyasla çok daha az zaman harcadı. Kaynak: https://arxiv.org/pdf/2109.06835.pdf

AMT, bir işçinin alabileceği İnsan Zekası Görevleri (HIT) sayısında herhangi bir sınırlama getirmediğinden, AMT’de “büyük hitters” ortaya çıktı; bunlar, yüksek sayıda görevi bir deneyde tamamlayan bir üne sahipler. Araştırmacılar, ardışık olarak sunulan HIT’ler arasındaki zamanı ölçerek, her bir HIT’in başlangıç ve bitiş zamanını karşılaştırarak, AMT’nin bildirilen WorkTimeInSeconds ile gerçekte harcanan zaman arasındaki farkı ortaya çıkardı.

Bu tür bir iş bu azaltılmış zaman çerçevelerinde gerçekleştirilemeyeceğinden, araştırmacılar bunu telafi etmek zorunda kaldı:

‘Bir paragraf uzunluğundaki bir hikayeyi dikkatlice okumak ve tüm dört özelliği değerlendirmek için 13 saniye yetmediğinden, çok az zaman harcayan işçilerin yargılarını filtreleyerek ortalama puanların etkisini ölçüyoruz… Özellikle, median zamanı 40 saniyenin (düşük bir baraj) altında olan işçilerin yargılarını kaldırıyoruz ve yaklaşık olarak %42 oranında vår değerlendirmelerin filtrelediğini buluyoruz (tüm deneyler boyunca %20-72 arasında değişiyor).’

Makale, AMT’de gerçekte harcanan zamanın yanlış bildirilmesinin genellikle araştırmacılar tarafından göz ardı edilen bir sorun olduğunu iddia ediyor.

El Tutma Gerekir

Bulgular, ayrıca AMT işçilerinin, her iki metni yan yana görmedikçe, insan tarafından yazılan metin ile makine tarafından yazılan metin arasında güvenilir bir şekilde ayırt edemediklerini gösteriyor; bu, tipik bir değerlendirme senaryosunu (okuyucunun ‘gerçek’ veya yapay olarak üretilmiş bir metin örneği temelinde bir yargıya varması gerektiği bir senaryo) etkili bir şekilde tehlikeye atar.

Düşük Kaliteli Yapay Metin Kabulü

AMT işçileri, düşük kaliteli GPT tabanlı yapay metni, insan tarafından yazılan daha yüksek kaliteli, tutarlı metinle aynı düzeyde değerlendirdi; buna karşılık, İngilizce öğretmenleri kalite farkını kolayca ayırt edebildiler.

Ön Hazırlık Zamanı Yok, Sıfır Bağlam

Doğruluk değerlendirmesi için doğru zihinsel duruma girmek, soyut bir görev olduğu için doğal olarak gelmiyor; İngilizce öğretmenlere, değerlendirmeye yönelik duyarlılıklarını uyarlama için 20 görev gerekti, oysa AMT işçileri genellikle hiçbir “oryantasyon süresi” alamadılar, bu da girdilerinin kalitesini düşürdü.

Sistemi Oynama

Rapor, AMT işçilerinin bireysel görevlerde harcadıkları toplam sürenin, birden fazla görevi aynı anda kabul eden ve tarayıcılarındaki farklı sekmelerde görevleri çalıştıran işçileri tarafından şişirildiğini iddia ediyor; bu, kayıtlı görev süresi boyunca konsantre olmayı engeller.

Ülke Kökeni Önemlidir

AMT’nin varsayılan ayarları, işçileri ülke kökenine göre filtrelemiyor ve rapor, önceki bir çalışmayı not ediyor; bu çalışmaya göre AMT işçileri, coğrafi kısıtlamaları atlatmak için VPN’ler kullanıyor ve bu sayede yabancı dil konuşanlar, anadili İngilizce olan kişiler olarak görünüyorlar (bu sistem, belki de naif bir şekilde, bir işçinin anadili ile coğrafi konumuna dayalı IP’sini eşitliyor).

Araştırmacılar, değerlendirme testlerini, potansiyel işçileri İngilizce konuşmayan ülkelere sınırlayan filtrelerle AMT üzerinde yeniden çalıştırdı ve ‘İngilizce konuşmayan ülkelerden işçilerin, tutarlılık, alaka düzeyi ve dilbilgisini, aynı niteliklere sahip İngilizce konuşulan ülkelerden işçilere kıyasla önemli ölçüde daha düşük değerlendirdiğini’ buldu.

Rapor şöyle diyor:

‘Uzman değerlendirmenler, dilbilimciler veya dil öğretmenleri gibi, mümkün olduğunda kullanılmalıdır; çünkü bunlar zaten yazılı metinleri değerlendirmek için eğitilmişlerdir ve çok daha pahalı değildir…’.

 

16 Eylül 2021’de Yayınlandı18 Aralık 2021’de Güncellendi: Etiketler Eklendi

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai