Yapay zeka modelleri ve platformları
GPT-3: Azımsanamayacak Bir Dil Modeli Öğrenimi

Son birkaç yılda, AI ve ML endüstrisi, NLP sistemlerinin geliştirilmesinde ve uygulamasında büyük bir atılım yaşamıştır. Araştırmacılar, NLP uygulamalarını aşağı akım aktarma görevleri için esnek ve görev-agnostic bir şekilde uygulayabilmişlerdir.
İlk olarak, tek katmanlı temsil kullanılmış ve görev-spesifik mimariye beslenmiştir. Daha sonra, çok katmanlı temsil kullanılan RNN mimarisi, daha iyi temsil oluşturmak için bağlamsal durum kullanmıştır. Ve en son olarak, görev-spesifik mimarilere olan ihtiyacı tamamen ortadan kaldıran, önceden eğitilmiş dil modelleri veya tekrarlayan modeller geliştirilmiştir.
Dil modelleri, NLP endüstrisinde önemli bir dönemeç noktası olmuştur. Zorlu görevlerde, zoals soru cevapları, metin anlama, metin içerme ve daha fazlasında büyük ilerlemeler kaydetmiştir.
Ancak, avantajlarına rağmen, dil modellerinin önemli bir sınırlaması vardır. Görev-spesifik ayarlamaya veya görev-spesifik verilere ihtiyaç duyarlar. Ayrıca, görev-spesifik verilerin geliştirilmesinde yüz binlerce örnek gerekir.
Görev-spesifik verilere ve görev-spesifik ayarlamaya olan ihtiyacı ortadan kaldırmak, NLP endüstrisi için birçok nedenle çok arzulanır.
Mevcut Ön-Eğitimli Dil Modelleri veya Tekrarlayan Modellerin Sorunları
- Pratiklik ve Uygulamayı Sınırlama
Öncelikle, her görev için büyük bir etiketli veri kümesinin gerekliliği, dil modellerinin uygulanabilirliğini sınırlar. Dil modelleri, kısa bir hikaye oluşturmaktan, gramer hatalarını düzeltmeye, bir kavram hakkında örnekler oluşturmaya kadar çeşitli görevlerde kullanılır. Bazen, her görev için büyük bir etiketli veri kümesi toplamak zor olabilir.
- Eğitim Verilerindeki Sahte Bağlantıları Kullanma
Eğitim dağılımının sınırları ve modelin ifade gücünün birleşimi, eğitim verilerine olan bağımlılığı artırabilir. Bu, fine-tuning ve ön-eğitim paradigmasında sorunlara neden olabilir.
Daha önceki modellere ilişkin çalışmalar, büyük modellerin her zaman daha iyi sonuçlar vermediğini göstermiştir. Ayrıca, bu paradigmadaki genellemenin, modelin eğitim verilerine özgü olmasından dolayı zayıf performanslara neden olabileceği belirtilmiştir.
- İnsan Öğrenimi ile Karşılaştırma
Son olarak, dil modelleri ile karşılaştırıldığında, insanlar büyük bir eğitim verisi gerektirmez. Çoğu zaman, bir görevi öğrenmek için yeterli olan, bir kişinin doğal dilinde kısa bir talimat veya bir dil görevinin küçük bir demonstrasyonudur.
İnsanların adapte olma yetenekleri birçok pratik avantajı vardır. İnsanlar, farklı beceri setleri arasında geçiş yapabilir veya onları birleştirebilir, bu da NLP sistemlerinin yapamayacağı bir şeydir.
Meta Öğrenme ve GPT-3 ile Sorunların Çözümü
Yukarıdaki sorunlara bir çözüm, meta öğrenme olabilir. Meta öğrenme, modern ML’de bir kavramdır ve bir modelin daha geniş bir beceri ve örüntü tanıma yetenekleri geliştirmesini sağlar.
Meta öğrenme, dil modeli mimarisinde “bağlam içi öğrenme” tekniği kullanılarak uygulanmaktadır. Bu teknik, ön-eğitimli bir dil modelinin metin girişini görev spesifikasyonu olarak kullanır.
Meta öğrenmenin tek büyük sorunu, doğal dil mimarilerinde fine-tuning yaklaşımına göre hala daha düşük performans göstermesidir.
Meta öğrenmenin yanı sıra, bir başka popüler yöntem, transformer dil modellerinin kapasitesini artırmaktır. Son yıllarda, transfer modellerinin kapasitesi önemli ölçüde artmıştır.
Bu gelişmeler, GPT-3 modelinin ortaya çıkmasını sağladı. GPT-3 modeli, 175 milyardan fazla parametreye sahiptir ve yayınlandığı zaman, en yüksek kapasiteye sahip transfer dil modeliydi.
GPT-3 Modelinin Tanıtımı
GPT-3, OpenAI tarafından 2020 yılında yayınlanan, 175 milyardan fazla parametreye sahip bir oto-agresif dil modelidir. GPT-3, büyük bir dil modeli olarak sınıflandırılır ve GPT-2 modeli gibi, bir decoder-only derin öğrenme transformer modelidir.
GPT-3 modeli, kendi bağlamsal öğrenme yeteneklerini ölçer ve 20’den fazla NLP veri kümesinde ve çeşitli yeni görevlerde değerlendirilir.
- Azımsanamayacak Öğrenme veya Bağlam İçi Öğrenme: Azımsanamayacak öğrenmede, GPT-3 modeli, modelin bağlam penceresine sığabilecek kadar çok dağılımı kullanır.
- Tek Şanslı Öğrenme: Tek şanslı öğrenmede, model sadece bir demonstrasyon kullanır.
- Sıfır Şanslı Öğrenme: Sıfır şanslı öğrenmede, demonstrasyon yoktur ve model sadece doğal dil talimatı alır.

Genel olarak, GPT-3 modeli, sıfır şanslı ve tek şanslı ayarlamalarda istenen performansı gösterir ve azımsanamayacak ayarlamada çoğu zaman devlet-sanatlı transfer modellerini geçer.

GPT-3 Modeli: Yaklaşım
GPT-3 modeli, geleneksel bir ön-eğitim yaklaşımı kullanır. Bu yaklaşım, model, veri ve eğitim içerir ve RWC-19 transfer dil modelinin ön-eğitim sürecine benzer.
GPT-3 modeli, bağlam içi öğrenme yaklaşımını kullanır. Bu yaklaşım, RWC-19 modelinin yaklaşımına benzer, ancak veri kümesindeki örüntüleri öğrenmek için bazı değişiklikler yapar.
Şimdi, bu ayarları keşfedelim ve GPT-3 modelinin farklı ayarlamalarda nasıl performans gösterdiğini değerlendirelim.
Ayarlama
Ayarlama, dil modellerinde geleneksel bir yaklaşım olmuştur. Bu yaklaşım, ön-eğitimli bir modelin ağırlıklarını, belirli bir görev için hazırlanmış bir denetimli veri kümesinde eğitim yoluyla günceller.
Ayarlama yaklaşımı, güçlü performans sağlar. Ancak, her görev için yeni ve büyük bir veri kümesi gerektirir, eğitim veri kümesinin spesifik özelliklerini sömürebilir, insan performansı ile adil bir karşılaştırma yapabilir ve dağılım dışı genellemeye neden olabilir.
GPT-3 modelinin当前 kapsamı, görev-agnostic performansı nedeniyle ayarlamayı içermez, ancak gelecekte ayarlamaya tabi tutulabilir.
Azımsanamayacak
Azımsanamayacak, GPT-3 modelinin, görevi koşullandırmak için birkaç demonstrasyon aldığını ifade eder, ancak modelin ağırlıkları güncellenmez.
Azımsanamayacak ayarlamada, veri kümesi genellikle bir bağlam ve istenen tamamlama içerir. Model, K örnek bağlam ve tamamlama alır ve sonra bir bağlam verilir ve tamamlamayı üretmesi istenir.
Azımsanamayacak ayarmanın avantajı, görev-spesifik verilere olan ihtiyacı azaltması ve büyük bir veri kümesinden dar bir dağılım öğrenme olasılığını azaltmasıdır.
Tek Şanslı
Tek şanslı ayarlamada, model sadece bir demonstrasyon alır ve geri kalanı azımsanamayacak ayarlamaya benzer.
Tek şanslı ayarmanın nedeni, görevlerin insanların nasıl iletişime geçtiğiyle en iyi şekilde benzer olmasıdır.
Sıfır Şanslı
Sıfır şanslı ayarlamada, demonstrasyon yoktur ve model sadece doğal dil talimatı alır.
Sıfır şanslı ayarmanın avantajı, en çok rahatlık, esneklik ve spesifik bağlantılardan kaçınmadır, ancak en zor ayarlamadır.

Yukarıdaki şekil, azımsanamayacak, tek şanslı ve sıfır şanslı ayarlamaları, doğal dil görevi olarak bir İngilizce cümlesini Fransızca’ya çevirme görevinde karşılaştırır.
GPT-3: Model Mimarisi
GPT-3 modeli, GPT-2 modelinin kullandığı aynı mimariyi kullanır. Bu mimari, ön-normalizasyon, değiştirilmiş başlatma ve tersine çevrilebilir tokenizasyon tekniklerini içerir.
GPT-3 modelinin performansını, model büyüklüğüne bağlı olarak incelemek için, geliştiriciler 8 farklı model boyutu eğitmiştir. Bu modeller, 125 milyondan 175 milyara kadar parametreleri içerir.

Yukarıdaki şekil, 8 farklı modelin boyutunu ve mimarisini karşılaştırır.
Ayrıca, modeli, derinlik ve genişlik boyunca GPU’lar arasında bölerek, veri aktarımını en aza indirmek için partitionlanmıştır.
Eğitim Verileri
Büyük dil modelleri, genellikle büyük veri kümelerini kullanır. GPT-3 modeli için kullanılan veri kümesi, Common Crawl veri kümesidir.
Veri kümesinin kalitesini artırmak için, geliştiriciler 3 adım atmıştır.
- Geliştiriciler, yüksek kaliteli referans corpora benzeri bir aralıkta Common Crawl veri kümesini indirip filtrelediler.
- Geliştiriciler, veri kümesindeki belge düzeyinde fuzzy yinelenmeyi gerçekleştirdiler.
- Geliştiriciler, eğitim verilerine yüksek kaliteli referans corpora eklediler.
Aşağıdaki şekil, GPT-3 modeli için kullanılan veri kümesinin nihai bileşimini gösterir.

Ayrıca, büyük dil modellerinin, internet verilerini kullanarak eğitim görmesi ve büyük miktarda içeriği öğrenmesi, aşağı akım görevlerinin geliştirme ve test kümelerinin ön-eğitim sırasında görülmesi riskini taşır.

Yukarıdaki şekil, GPT-3 modelinin eğitiminde kullanılan toplam hesaplama gücünü gösterir.
Değerlendirme
Azımsanamayacak öğrenmede, model her bir değerlendirmeye, görevin eğitim veri kümesinden K örnek rastgele çekerek ve 1 veya 2 yeni satır ile sınırlayarak başlar.
K, 0’dan modelin bağlam penceresinin maksimumuna kadar herhangi bir değer olabilir. Daha büyük K değerleri genellikle daha iyi sonuçlar verir, ancak her zaman değil.
Ayrıca, çoklu seçenek içeren görevlerde, model K örnek doğru tamamlama ve bağlam alır ve sonra bir bağlam verir ve her bir tamamlamanın LM olasılığını karşılaştırır.
Sonuçlar

Yukarıdaki şekil, 8 farklı modelin eğitim eğrilerini gösterir.
GPT-3 modelinin performansı, dil modeli görevlerinde devlet-sanatlı sonuçlar gösterir.
Dil Modelleme, Tamamlama ve Cloze Görevleri
Bu bölümde, GPT-3 modelinin geleneksel dil modelleme görevlerinde ve cümle veya paragraf tamamlama görevlerinde performansı değerlendirilir.
Dil Modelleme
GPT-3 modeli, PTB veri kümesinde sıfır şanslı karmaşıklığı hesaplar.
GPT-3 modeli, PTB veri kümesinde 20.50 karmaşıklık puanı elde eder.
LAMBADA
LAMBADA veri kümesi, paragraflardaki uzun menzilli bağımlılıkları modelleme yeteneğini test eder.

GPT-3 modeli, LAMBADA veri kümesinde %76 doğruluk elde eder.
Kapalı Kitap Soru Cevapları
Kapalı kitap soru cevapları, GPT-3 modelinin geniş genel bilgiye dayalı soru cevaplama yeteneğini ölçer.

GPT-3 modeli, TriviaQA veri kümesinde %64.3 doğruluk elde eder.

Yukarıdaki şekil, GPT-3 modelinin performansı ile model büyüklüğü arasındaki ilişkiyi gösterir.
Son Düşünceler
GPT-3, dil modeli endüstrisinde bir devrim niteliğindeydi. GPT-3, dil modellerinin neler yapabileceğinin sınırlarını genişletti.












