Anderson’un Açısı

Tarihi Dilin Yapay Zeka için Neden Bir Sorun Olduğu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Doğal Dil İşleme (NLP) sistemlerinin merkezi zorluklarından biri, çeşitli yazılı materyallerden temel bilgiler elde etmektir. Bir NLP algoritması için bir eğitim veri kümesinin katkıda bulunan kaynakları, Twitter, geniş gazeteler ve bilimsel dergiler gibi dilbilimsel olarak çeşitli olabilir ve her bir kaynakta benzersiz olan tüm garip özelliklere sahip olabilir.

Çoğu durumda, bu sadece İngilizce içindir ve sadece güncel veya yakın tarihli metin kaynakları içindir. Bir NLP algoritması birden fazla dönemden materyal dikkate alması gerektiğinde, genellikle ulusal ve alt-ulusal topluluklar arasında ve özellikle tarih boyunca farklı dönemlerde insanların konuşma veya yazma şekillerini uzlaştırmakta zorluk çeker.

Ancak, tarih boyunca çeşitli dönemleri kapsayan metin verileri (tarihi tezler ve saygın bilimsel eserler) kullanarak, bir konunun tarihi bir bakış açısını oluşturmak ve bir alan için önceden ölçümlerin benimsenmesi ve korunması öncesi istatistiksel zaman çizelgesi yeniden yapılandırmaları oluşturmak için potansiyel olarak yararlı bir yöntem olabilir.

Örneğin, iklim değişikliği öngörüsü yapan yapay zeka modellerine katkıda bulunan hava durumu bilgileri, 1880 yılına kadar dünya çapında yeterli şekilde kaydedilmedi, mientras ki klasik metinlerin madenciliği eski hava olaylarının daha eski kayıtlarını sunabilir ve Viktorya döneminden önce hava durumu verilerini sağlamak için yararlı olabilir.

Zamansal Uyuşmazlık

Washington Üniversitesi ve Allen Enstitüsü için Yapay Zeka’dan yeni bir makale, beş yıllık bir süre bile zamansal uyuşmazlık oluşturabilir ve önceden eğitilen bir NLP modelinin yararlılığını bozabilir.

Tüm durumlarda, daha yüksek puanlar daha iyidir. Burada, beş yıllık bir süre boyunca dört metin materyali kümesinde zamansal bozulmanın ısı haritasını görüyoruz. Bu tür eğitim ve değerlendirme verileri arasındaki uyuşmazlıklar, makalenin yazarlarına göre 'büyük bir performans düşüşü'ne neden olabilir.

Tüm durumlarda, daha yüksek puanlar daha iyidir. Burada, beş yıllık bir süre boyunca dört metin materyali kümesinde zamansal bozulmanın ısı haritasını görüyoruz. Bu tür eğitim ve değerlendirme verileri arasındaki uyuşmazlıklar, makalenin yazarlarına göre ‘büyük bir performans düşüşü’ne neden olabilir. Kaynak: https://arxiv.org/pdf/2111.07408.pdf

Makalede denir:

‘Zamansal uyuşmazlığın hem dil modeli genellemesini hem de görev performansını etkilediğini bulduk. Metin alanları ve görevler boyunca bozulmada önemli varyasyonlar bulduk. Beş yıl boyunca, sınıflandırıcıların F1 puanı 40 puan (Twitter’da siyasi bağlılık) veya 1 puan (Yelp’in derecelendirme puanları) kadar düşebilir. Aynı alan üzerinde tanımlanan iki ayrı görev, zaman içinde farklı bozulma seviyeleri gösterebilir.’

Dengesiz Bölünmeler

Temel sorun, eğitim veri kümelerinin genellikle iki gruba bölünmesidir, bazen 80/20 oranında dengesizdir, bu da sınırlı veri kullanılabilirliğinden kaynaklanır. Daha büyük veri kümesi bir sinir ağına eğitilirken, kalan veri modelin doğruluğunu test etmek için kontrol grubu olarak kullanılır.

Karışık veri kümelerinde, birden fazla yıl boyunca materyal bulunan, farklı dönemlerden veri dağılımı dengesiz olabilir ve bu da değerlendirme verisinin tek bir dönemden materyalden oluşmasına neden olabilir.

Bu, modelin daha çeşitli bir dönem karışımı üzerinde eğitildiği için, bu veri kümesinin modeli test etmek için kötü bir zemin oluşturur. Aslında, minority değerlendirme verisinin daha yeni veya daha eski materyali temsil edip etmediğine bağlı olarak, bu, en son K-Pop idolünü dedenize değerlendirtmenize benzer.

Uzun çalışma, çok daha zamanla sınırlı veri kümeleri üzerinde birden fazla modeli eğitmek ve her modelin sonuçlarından uyumlu özellikleri birleştirmeye çalışmaktır. Ancak, rastgele model başlatma uygulamaları alone, bu yaklaşımın kendi sorunlarına sahip olduğunu ve çapraz-model eşitliğini ve adaleti sağlamakta zorluklar yaşayabileceğini gösterir – hatta veri kümelerinin birbirine benzer olup olmadığını dikkate almadan.

Veri ve Eğitim

Zamansal uyuşmazlığı değerlendirmek için yazarlar, dört metin kümesini dört alanda eğitti;

Twitter
…burada yazarlar, 2015-2020 arasında eşit olarak dağıtılan 12 milyon tweeti rastgele seçerek etiketsiz veri topladı ve burada adları geçen varlıkları (yani kişiler ve organizasyonlar) ve siyasi bağlılıkları incelediler.

Bilimsel Makaleler
…burada yazarlar, Semantic Scholar korpusundan etiketsiz veri edindi, bu 30 yıllık bir dönemde 650.000 belgeyi kapsıyordu ve burada mention tipi sınıflandırması (SciERC) ve Yapay Zeka mekan sınıflandırması (AIC, bir makalenin AAAI veya ICML‘de yayımlandığını ayırt eder) üzerine çalıştılar.

Haber Makaleleri
…burada yazarlar, Newsroom Veri Kümesi‘nden 2009-2016 arasında yayımlanmış 9 milyon makale kullandı ve burada üç görev gerçekleştirdiler: haber odası özetleme, yayıncı sınıflandırma ve Medya çerçevesi sınıflandırması (MFC), son görev haber çıktısında çeşitli konuların önceliklendirilmesini inceler.

Yemek İncelemeleri
…burada araştırmacılar, Yelp Açık Veri Kümesi‘ni kullandı ve burada bir görev gerçekleştirdiler: inceleme derecelendirme sınıflandırması (YELPCLS), bu sektördeki çoğu NLP araştırması için tipik bir duygu analizi görevi.

Sonuçlar

Modeller, GPT-2 ile değerlendirildi ve çeşitli F1 puanları elde edildi. Yazarlar, zamansal uyuşmazlığın performans kaybının iki yönlü olduğunu buldu, yani yakın tarihli verilere dayalı modeller daha eski verilerin etkisi nedeniyle olumsuz etkilenebilir ve tersi de doğru olabilir (makalenin başlangıcındaki grafikler için görüntüye bakın). Yazarlar, bunun özellikle sosyal bilim uygulamaları için önemli olduğunu belirtiyorlar.

Genel olarak, sonuçlar, zamansal uyuşmazlığın performans kaybını ‘önemli ölçüde’ bozduğunu ve çoğu görev üzerinde geniş bir etkiye sahip olduğunu gösteriyor. Onlarca yılı kapsayan veri kümeleri, doğal olarak bu sorunu artırıyor.

Yazarlar ayrıca, zamansal uyuşmazlığın etiketli ve etiketsiz ön eğitim verilerini de etkilediğini gözlemlediler. Ayrıca, durumun etkilerini azaltmaya yönelik girişimlerinin (aşağıda açıklandığı gibi) önemli ölçüde iyileşmeye yol açmadığını, ancak verilerin iyileştirilmesinin belirli bir ölçüde yardımcı olabileceğini belirtiyorlar.

Sonuç

Araştırmacılar, daha önce önerilen çözüm yöntemlerinin, alan adaptasyonu (DAPT, veri uyuşmazlığına izin veren) ve zamansal adaptasyon (verilerin zaman dilimine göre seçildiği) gibi, sorunu önemli ölçüde hafifletmediğini onayladılar.

Makale şu sonuca varıyor*:

‘Deneylerimiz, önceki çalışmalarda bulunanlardan daha fazla görevler boyunca zamansal bozulmada önemli varyasyonlar gösterdi. Bu bulgular, NLP uygulamaları boyunca zamansal uyuşmazlığın devam eden incelemesini, benchmark değerlendirmelerinde dikkate alınmasını ve canlı sistem performansını zaman içinde izleyebilecek uygulayıcıların dikkatini çekmeyi teşvik ediyor.

‘Önemli olarak, zamansal olarak hizalanmış veriler üzerinde devam eden eğitimlerin LMs üzerinde önemli bir etkisi olmadığını gözlemledik, bu da daha az maliyetli etkili zamansal adaptasyon yöntemlerini bulmak için daha fazla araştırmayı motive ediyor.’

Yazarlar, sürekli öğrenme üzerine daha fazla araştırmaların, verilerin sürekli güncellenmesi durumunda, bu konuda yararlı olabileceğini ve kavram kayması ve görevlerdeki değişiklikleri tespit etme yöntemlerinin veri kümelerini güncellemenin yararlı bir aracı olabileceğini öne sürüyorlar.

 

* İç içe geçmiş alıntıların hyperlinklerine benim çevirim.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai