Anderson’un Açısı

Yapay Mekanik Türkler Oluşturmak için Ön Eğitilmiş Diller Modeliyle Çalışma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük veri setleri üzerinde makine öğrenimi sistemlerinin geliştirilmesi, veri etiketleme işlemlerine dayanır. Burada, yüzlerce, hatta binlerce soru (örneğin, Bu bir kedi resmi mi? ve Bu metin saldırıya uğramış mı?) yetkili veri setlerinin oluşturulabilmesi için çözülmesi gerekir. Bu veri setleri daha sonra AI sistemlerinin eğitimi için kullanılır.

Her ne kadar hepimiz bu sürece katkıda bulunuyorsak da, bu etiketleme görevlerinin büyük çoğunluğu para karşılığında Amazon Mechanical Turk gibi platformlarda insan işçiler tarafından gerçekleştirilir. Burada, annotatörler küçük sınıflandırma görevlerini bir parça-iş ekonomisinde tamamlarlar.

Ön eğitilmiş dil modelleri (PLM’ler) kendileri bazı temel İnsan Zekası Görevlerini (HIT’leri) üstlenebilseydi, model geliştirme daha ucuz olabilirdi. Bu görevler şu anda Amazon Mechanical Turk (AMT) ve benzer platformlarda insan işçiler tarafından gerçekleştiriliyor.

Almanya ve Huawei’den yapılan recent bir araştırmada, bu öneri makalede LMTurk: Few-Shot Learners as Crowdsourcing Workers olarak sunulmuştur.

Az Örnekten Öğrenen Diller Modelleri

Araştırmacılar, insan Türk işçilerine yönlendirilen görevlerin basit katmanlarının, az örnekten öğrenme ile benzerlik gösterdiğini öne sürüyorlar. Az örnekten öğrenmede, otomatik bir çerçeve, kendisine verilen birkaç örneğe dayanarak mini bir görevi gerçekleştirmelidir.

Onlar, bu nedenle, AI sistemlerinin, insan işçiler tarafından önceden eğitilmiş olan mevcut PLM’lerden etkili bir şekilde öğrenebileceğini öneriyorlar. İnsanlardan makinelerine aktarılan temel bilgi effectively already been accomplished ve bu bilginin nispeten değişmez veya empirik olduğu durumlarda, otomatik dil modeli çerçeveleri bu görevleri kendileri gerçekleştirebilir.

‘Temel fikrimiz, bir NLP görevi T için, az örnekten öğrenenleri uzman olmayan işçiler olarak görmek, insan dil teknolojisinde kaynakları etiketleyen crowdsourcing işçilerine benzeyenler olarak görmek. Crowdsourcing işçisinin bir tür az örnekten öğrenen olarak görülebileceğimiz gerçeği ile ilham aldık.’

Bu durumun sonuçları, gelecekteki AI sistemlerinin dayandığı birçok gerçekliğin, insanlardan çok önce türetilmiş olabileceğini ve daha sonra önceden doğrulanmış ve insan müdahalesi gerektirmeyen bilgi olarak kabul edilebileceğini içerir.

Orta Düzey, Yarı-Performanslı Diller Modelleri için İşler

İnsanların dahil olduğu maliyeti azaltma motivasyonunun yanı sıra, araştırmacılar, ‘orta düzey’ PLM’lerin真正 Mechanical Türkler olarak kullanmanın, bu ‘orta düzey’ sistemlere faydalı işler sağladığını öne sürüyorlar. Bu sistemler, GPT-3 gibi büyük ölçekli ve pahalı dil modelleri tarafından giderek gölgede bırakılıyor.

‘Bu makalenin amacı, mevcut az örnekten öğrenenleri daha etkili kullanmak için yöntemler geliştirmektir. Bu çok önemlidir, çünkü çok sayıda devasa az örnekten öğrenen eğitim görüyor; bunları etkili bir şekilde nasıl kullanacağımızı bilmek önemli bir sorudur. Özellikle, büyük modellere alternatifler arıyoruz. ‘

‘Aynı zamanda, PLM’lerin güçlerini tam olarak kullanmak istiyoruz: Esneklikleri, görevler boyunca geniş bir uygulanabilirlik sağlar; dil ve dünya hakkında öğrendikleri bilgi, az örnekten öğrenenlerin veri verimliliğinde görünür, veri etiketleme sırasında emek ve zaman tüketimini azaltır.’

Şu ana kadar, araştırmacılar, NLP’de az örnekten öğrenenlerin, yüksek düzeyde doğal dil sistemlerine ulaşmak için atılan adımların arasında geçici ve göz ardı edilebilir aşamalar olarak görüldüğünü, bu çalışmaların soyut ve bu sistemlerin olası faydasını dikkate almadan yapıldığını savunuyorlar.

Yöntem

Araştırmacılar, LMTurk (Dil Modeli olarak mekanik Türk) öneriyorlar. Bu, bir akışta, bu otomatik HIT’den gelen girdi, orta düzey bir NLP modeli için etiketler sağlar.

LMTurk için temel bir kavram modeli. Kaynak: https://arxiv.org/pdf/2112.07522.pdf

LMTurk için temel bir kavram modeli. Kaynak: https://arxiv.org/pdf/2112.07522.pdf

İlk iterasyon, birkaç görev için insan tarafından etiketlenmiş ‘altın’ verilere dayanır. Burada, etiketler insan denetimi veya konsensüs oylaması yoluyla iyi puanlanmıştır. Bu şemanın sonucu, bu insan temelli başlangıç noktasından dallanmaların veya geliştirmelerin gelecekte insan girdisi gerektirmeyeceği yönündedir.

Araştırmacılar, daha sonraki hibrit modellerle deneyler öneriyorlar, ancak insan girdisi azaltılmış olacak. Ancak, araştırmaları için, LMTurk modellerini insan tarafından oluşturulan HIT çalışanlarıyla karşılaştırmadılar, çünkü altın etiketli veri zaten ‘insan girdisi’ olarak kabul ediliyor.

LMTurk için tasarlanan PLM, görevi gerçekleştirmek üzere P-Tuning yöntemiyle uyarlandı. Bu yöntem, 2021 yılında Çin’den araştırmacılar tarafından önerildi ve GPT-3 tarzı modellerin NLU görevlerindeki performansını iyileştirmek için eğitilebilir sürekli prompt embeddings önerdi.

P-Tuning, GPT-stil modellerin öngörme gücünü ve dili anlama konusundaki kavramsal anlayış görünümünü, gömülü pseudo-prompts ekleyerek derinleştirmeye çalışıyor. Bu örnekte, başlangıç sorgusu 'Britanya'nın başkenti [x]'dir.

P-Tuning, GPT-stil modellerin öngörme gücünü ve dili anlama konusundaki kavramsal anlayış görünümünü, gömülü pseudo-prompts ekleyerek derinleştirmeye çalışıyor. Kaynak: https://arxiv.org/pdf/2103.10385.pdf

Veri ve Mimari

LMTurk, beş veri setinde değerlendirildi: iki veri seti Stanford Sentiment Treebank‘ten; AG’nin News Corpus; Recognizing Textual Entailment (RTE); ve Corpus of Linguistic Acceptability (CoLA).

LMTurk, daha büyük modeli için, kamu tarafından erişilebilen PLM ALBERT-XXLarge-v2 (AXLV2) modelini, otomatik Türk’e dönüştürmek için temel model olarak kullanıyor. Model, 223 milyon parametre içeriyor (GPT-3’te 175 milyar parametre bulunuyor). AXLV2, araştırmacılara göre, daha yüksek ölçekli modeller gibi 334M BERT-Large‘i geçerek üstünlük göstermiştir.

Daha hafif ve kenar-dağıtım için uygun bir model olarak, proje TinyBERT-General-4L-312D (TBG) kullanıyor. Bu model, 14.5 milyon parametre içeriyor ve performansı BERT-base (110 milyon parametre) ile karşılaştırılabilir.

Prompt ile eğitme, PyTorch ve HuggingFace’de AXLV2 için 100 parti adımda, 13’lük bir parti boyutunda, 5e-4’lük bir öğrenme hızında ve lineer bozulma ile gerçekleştirildi. Her deney, üç farklı rastgele tohumla başlatıldı.

Sonuçlar

LMTurk projesi, NLP’nin çeşitli alt sektörlerinde birçok modeli karşılaştırıyor, bu nedenle araştırmacıların deneylerinin karmaşık sonuçları, LMTurk’in kendisinin bir yaklaşım sunduğunu gösteren empirik kanıtlara kolayca indirgenemez.

Değerlendirme amacıyla, araştırmacılar, yöntemlerini iki önceki çalışmayla karşılaştırıyor: Metin Sınıflandırma ve Doğal Dil Çıkarımı için Cloze Sorularının Kullanılması adlı çalışma, Alman araştırmacılar Timo Schick ve Hinrich Schutze tarafından yapılmıştır. Ayrıca, Prompt-Based Auto adlı çalışma, Ön Eğitilmiş Dil Modellerini Daha İyi Az Örnekten Öğrenenler Hale Getirme adlı makalede Gao, Chen ve Fisch tarafından sunulmuştur (Princeton ve MIT’den respectively).

LMTurk deneylerinin sonuçları, araştırmacıların 'karşılaştırılabilir' performans rapor ettiği sonuçlar.

LMTurk deneylerinin sonuçları, araştırmacıların ‘karşılaştırılabilir’ performans rapor ettiği sonuçlar.

Kısacası, LMTurk, araştırmacılar için altın etiketli insan kökenli verilerin, orta düzey dil modellerine gömülmesi ve otomatik sistemlerin insan girdisi yerine geçmesi için umut verici bir araştırma hattı sunuyor.

Diğer az sayıda önceki çalışmada olduğu gibi, bu çalışmanın merkezi kavramı, orijinal insan verilerinin değişmezliğine dayanır ve zaman faktörlerinin, NLP gelişiminde önemli engeller oluşturabileceği, ancak makinelerin soyunun gelişimi sırasında insan müdahalesi gerektirmeyeceği varsayılır.

 

30 Aralık 2022’de ilk olarak yayımlanmıştır

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai