Anderson’un Açısı

GPT-Style Bir Dil Modelini Tek Bir Soru İçin Oluşturma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çin’den araştırmacılar, GPT-3 tarzı Doğal Dil İşleme sistemleri oluşturmak için ekonomik bir yöntem geliştirdiler. Bu yöntem, büyük hacimli veri setlerinin eğitimi için gereken zaman ve para maliyetini tránh ederek, bu sektörün FAANG oyuncuları ve yüksek düzeydeki yatırımcılara bırakılmasını önler.

Önerilen çerçeve, Görev Odaklı Dil Modelleme (TLM) olarak adlandırılır. Büyük ve karmaşık bir modeli, milyarlarca kelime ve binlerce etiket ve sınıf içeren bir korpus üzerinde eğitmek yerine, TLM daha küçük bir modeli, sorguyu modelin içine dahil ederek eğitime alır.

Sol, yüksek hacimli dil modellerine yönelik tipik bir hiperscale yaklaşım; sağ, TLM'nin bir konuya veya soruya bağlı olarak büyük bir dil korpusunu incelemek için slayt yöntemi. Kaynak: https://arxiv.org/pdf/2111.04130.pdf

Sol, yüksek hacimli dil modellerine yönelik tipik bir hiperscale yaklaşım; sağ, TLM’nin bir konuya veya soruya bağlı olarak büyük bir dil korpusunu incelemek için slayt yöntemi. Kaynak: https://arxiv.org/pdf/2111.04130.pdf

Esasen, tek bir soruyu cevaplamak için benzersiz bir NLP algoritması veya model oluşturulur. Bu, daha geniş bir dil modeli oluşturmak yerine, daha dar ve spesifik bir model oluşturmayı hedefler.

TLM’yi test ederken, araştırmacılar, yeni yaklaşımın RoBERTa-Large ve Google’ın TRILLION Parametre Switch Transformer Modeli gibi ön eğitimli dil modelleri ve OpenAI’nin GPT-3 gibi hiperscale NLP sistemleri ile benzer veya daha iyi sonuçlar elde ettiğini buldular.

Araştırmacılar, TLM’nin, büyük dil modellerinin eğitim maliyetini iki katmana kadar azaltabileceğini ve sadece 8 GPU ile 48 saatte eğitim maliyetini 1.000 GPU ile bir güne kadar azaltabileceğini belirttiler.

Yeni rapor, Ön Eğitim Olmadan NLP: Basit ve Verimli Bir Çerçeve olarak adlandırıldı ve Tsinghua Üniversitesi’nden üç araştırmacı ve Çin merkezli AI geliştirme şirketi Recurrent AI, Inc.’den bir araştırmacı tarafından hazırlandı.

Ucuz Olmayan Cevaplar

Etkili ve genel amaçlı dil modellerini eğitmek için gereken maliyet, NLP’nin kültürde yayılma derecesini sınırlayan bir “termal limit” olarak karakterize edilmeye başlandı.

NLP model mimarilerindeki yönlerin büyümesiyle ilgili istatistikler, A121 Labs'ın 2020 raporundan. Kaynak: https://arxiv.org/pdf/2004.08900.pdf

NLP model mimarilerindeki yönlerin büyümesiyle ilgili istatistikler, A121 Labs’ın 2020 raporundan. Kaynak: https://arxiv.org/pdf/2004.08900.pdf

2019’da bir araştırmacı, XLNet modelini 2,5 gün içinde 64 cihazda 512 çekirdek üzerinde eğitmek için 61.440 ABD Doları maliyeti hesapladı. GPT-3’ün eğitimi ise 12 milyon ABD Doları olarak tahmin edildi.

Sorgu İhtiyaçlarına Dayalı Veri Alt Kümeleri

Yeni önerilen mimari, büyük bir dil veritabanından sorgu ile tanımlanan bir veri alt kümesini kullanarak, sınırlı bir konuya ilişkin cevaplar sağlamak için doğru sınıflandırmalar, etiketler ve genelleme elde etmeyi hedefler.

Araştırmacılar, TLM’nin iki ana fikirle motive edildiğini belirttiler:

‘İnsanlar, bir görevi yalnızca dünya bilgisinin küçük bir bölümünü kullanarak.masterlar (örneğin, öğrenciler bir sınav için sadece birkaç bölümü gözden geçirmek zorunda kalırlar).’

‘Biz, büyük bir korpus için belirli bir görev için çok fazla冗余 olduğunu varsayıyoruz. İkinci olarak, etiketli veri üzerinde denetimli bir görev hedefi optimize etmek, dil modelleme hedefini etiketsiz veri üzerinde optimize etmekten daha verimlidir. Bu motivasyonlara dayanarak, TLM görev verilerini kullanarak genel korpusun küçük bir alt kümesini alır ve sonra hem alınan veri hem de görev verisi ile birlikte denetimli bir görev hedefi ve dil modelleme hedefini optimize eder.’

Araştırmacılar, görev odaklı NLP modellerinin kullanımının several avantajları olduğunu düşünüyorlar. Örneğin, araştırmacılar, dizi uzunluğu, tokenleştirme, hiperparametre ayarları ve veri temsilleri için daha esnek stratejiler geliştirebilirler.

Test ve Sonuçlar

TLM, dört alan üzerinden sekiz sınıflandırma görevinde test edildi. Görevler, yüksek kaynaklı ve düşük kaynaklı kategorilere ayrıldı. Yüksek kaynaklı görevler, AGNews ve RCT gibi görevleri içeriyordu.

Araştırmacılar, TLM’nin genel ön eğitimli dil modelleri BERT ve RoBERTa ile karşılaştırıldığında benzer veya daha iyi sonuçlar elde ettiğini buldular.

‘Bu sonuçlar, TLM’nin yüksek doğrulukta ve PLM’lere göre daha verimli olduğunu doğrular. Ayrıca, TLM daha büyük ölçeklerde daha fazla avantaj sağlar. Bu, daha büyük ölçekli PLM’lerin belirli bir görev için faydasız genel bilgi depolamak için eğitilmiş olabileceğini gösterir.’

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai