Yapay zeka modelleri ve platformları
GLM-130B: Açık Kaynaklı İkili Dilde Eğitimli Büyük Dil Modeli

GLM-130B çerçevesi, 130 milyar parametreye sahip, İngilizce ve Çince dillerinde metin çıktıları üretebilen ikili bir büyük dil modelidir. GLM-130B çerçevesi, 100 milyar parametreden fazla bir dil modelini açık kaynak olarak sunma girişimidir ve bu ölçekteki çerçevelerin nasıl ön-eğitimli olabileceği hakkında tartışır, çünkü şu anda böyle büyük bir ölçekte bir modeli eğitmek genellikle sapma ve kayıp sıçramaları gibi sorunlarla karşılaşmaktadır.
Bu makalede, GLM-130B çerçevesini ele alacağız, bu çerçevenin yüz milyarlarca parametreye sahip büyük dil modellerini etkili bir şekilde ön-eğitmek için bir yöntem geliştirmeyi amaçladığını göreceğiz. GLM-130B çerçevesinin çalışma ve mimarisi ile birlikte eğitim süreci ve tasarım seçimlerini derinlemesine inceleyeceğiz, bu seçimlerin yalnızca verimliliği artırmakla kalmayıp aynı zamanda istikrarı da nasıl sağladığını göstereceğiz. GLM-130B çerçevesinin İngilizce benchmark’lerinde yapılan ilk deneyler, GLM-130B modelinin mevcut durumun en iyisi olan GPT-3 çerçevesini önemli bir marjla geride bıraktığını gösterdi. Şimdi, GLM-130B çerçevesinin nasıl bu kadar tutarlı, doğru ve istikrarlı sonuçlar ürettiğini keşfedelim.
GLM-130B Çerçevesine Giriş
Az-shot ve sıfır-shot ayarlarında çalışan, özellikle 100 milyar parametreye sahip büyük dil modelleri, çekici ölçekleme yasaları sunar ve bunlardan biri de en iyi performans gösteren çerçevelerden biri olan GPT-3 çerçevesidir. Ancak, GPT-3 çerçevesinin popülaritesi ve yaygın uygulamalarına rağmen, eğitim süreci ve bazı yönlerden GPT-3 çerçevesi itself kamuoyuna karşı şeffaf değildir. Ayrıca, 100 milyar parametreden fazla LLM’ler için tüm olası tasarımları empirik olarak sıralamak hesaplama açısından oldukça pahalıdır, bu da büyük ölçekli LLM çerçeveleri için ön-eğitim yöntemi geliştirmeyi daha da önemli hale getirir.
Yukarıdaki nokta, özellikle GPT-3 gibi yüksek kaliteli büyük ölçekli LLM çerçevelerinin çalışma ve eğitim sürecinin paylaşılmasının kritik değerini vurgular ve etik endişeleri dikkate alarak, GLM-130B çerçevesi 100 milyar parametreden fazla bir LLM’yi açık kaynak olarak ön-eğitmek için bir girişimdir. GLM-130B geliştirme ekibi, büyük ölçekli bir LLM çerçevesini ön-eğitmekle birlikte birçok mühendislik ve teknik zorluğun ortaya çıktığını gözlemledi, bu zorluklar ön-eğitim istikrarı, verimliliği ve yakınsama açısından önemlidir.
Daha spesifik olarak, GLM-130B, 130 milyar parametreye sahip, 400 milyar token üzerinde 96 NVIDIA DGX-A100 GPU düğümü kümesinde yaklaşık iki ay süren bir süre boyunca ön-eğitimli bir ikili ve bilingual yoğun çerçevedir. Ayrıca, GPT-stil mimarisi yerine GLM-130B çerçevesi, GLM veya Genel Dil Modeli algoritmasını kullanır, bu da otoregresif blank doldurma hedeflerini ve bidirectional dikkat avantajını kullanmayı amaçlar. Aşağıdaki tablo, GLM-130B çerçevesini diğer 100 milyar parametreden fazla modellerle, včetně GPT, BLOOM-176B ve OPT-175B ile karşılaştırır.

GLM-130B çerçevesinin mühendislik ve geliştirme kavramları, GPT-3 ve PaLM 540B gibi büyük ölçekli LLM çerçevelerini, birçok benchmark üzerinde geride bırakır. Aşağıdaki şekil, GLM-130B çerçevesinin 100 milyar parametreden fazla modellerle karşılaştırıldığını ve GLM-130B çerçevesinin önemli ölçüde daha az üretim toksisitesine ve önyargıya sahip olduğunu gösterir.

Son olarak, GLM-130B çerçevesi, geliştiricilerin 100 milyar parametreden fazla çerçeveler üzerinde çalışmalar yapabilmesi için tasarlanmıştır ve bunu iki şekilde gerçekleştirir. İlk olarak, GLM-130B çerçevesi BLOOM ve OPT gibi modellerin kullandığı 175 milyar parametreye sahip değildir, bunun yerine 130 milyar parametreye sahiptir, bu da tek bir A100 sunucusunda bile müdahaleyi destekler. İkincisi, GLM-130B çerçevesini çalıştırmak için gereken GPU gereksinimleri diğer LLM çerçevelerine göre daha düşüktür ve GLM-130B çerçevesi bunu INT4 hassasiyetine dönüştürerek gerçekleştirir. GLM-130B çerçevesinin kullandığı INT4 dönüştürme, performansı artırırken aynı zamanda ihmal edilebilir bir performans bozulmasına neden olmaz.
GLM-130B: Mimarisi
Bir makine öğrenimi modelinin endüktif önyargısı, mimarisini tanımlar ve büyük dil modelleri için çeşitli mimari tasarımlarını keşfetmek, hesaplama açısından uygun ve uygulanabilir olmadığı için geliştiriciler için sürpriz değildir. GLM-130B’nin mimarisine bir göz atalım.
PaLM, GPT ve diğer büyük ölçekli LLM çerçeveleri, 100 milyar parametreden fazla bir modele sahip olup, geleneksel decoder-only GPT-stil mimarisi üzerine kurulmuştur. Diğer taraftan, GLM-130B çerçevesi, büyük dil modelleri için otoregresif blank doldurma hedeflerini kullanmayı amaçlayan bir transformer tabanlı dil modeli olan GLM veya Genel Dil Modeli’ni keşfetmeyi amaçlar.
GLM-130B çerçevesinin kullandığı GLM algoritması, bir dizi metin span’ını örnekler ve bunları tek bir mask token ile değiştirir. GLM-130B çerçevesinin GPT-stil yaklaşımından farklı olarak, bidirectional dikkat kullanır ve bu, GLM-130B çerçevesini GPT-stil yaklaşımından ayırır. Ayrıca, GLM-130B çerçevesi, hem üretim hem de anlama için veri desteklemek amacıyla, her biri özel bir mask token ile belirtilen iki bozulma stratejisinin birleşimini kullanır.
- [MASK] : [MASK] bir bozulma stratejisi olup, cümlelerde kısa boşluklar kullanır ve bu boşlukların uzunluğu girişin belirli bir yüzdesine eşittir.
- [gMASK] : [gMASK] bir bozulma stratejisi olup, cümle sonlarına rastgele uzunlukta boşluklar ekler ve ön metin bağlamını kullanır.
GLM-130B çerçevesinin kullandığı GLM algoritması, PaLM 540B ve GPT-3 çerçevelerini geride bırakarak, sıfır-shot LAMBADA dil modelleme testinde %80’in üzerinde bir doğruluk puanı elde etmeyi sağlar.

Katman Normalizasyonu
Büyük dil modellerini eğitmekle ilgili büyük bir zorluk, eğitim istikrarıdır ve uygun bir LN (Katman Normalizasyonu) kullanmak, LLM’lerin eğitimine yardımcı olabilir. GLM-130B çerçevesi, Post-LN yaklaşımını kullanır, çünkü bu yaklaşım aşağı akış görevlerinde iyi performans gösterir.
FFN’ler ve Pozisyonel Kodlama
GLM-130B çerçevesi, yüksek performanslı aşağı akış görevleri ve eğitim istikrarı sağlamak amacıyla, FFN’ler (İleri Beslemeli Sinir Ağları) ve pozisyonel kodlama kullanır.
Ön-Eğitim Ayarı
GLM-130B çerçevesinin ön-eğitim hedefleri, yalnızca birkaç token için çoklu görev öğrenimi değil, aynı zamanda otoregresif blank doldurma için self-süper gözetimli GLM’yi içerir ve bu yaklaşımın GLM-130B çerçevesini aşağı akış görevlerinde destekleyeceği beklenmektedir. GLM-130B çerçevesinin ön-eğitim ayarı aşağıdaki gibidir.
Otoregresif Blank Doldurma
GLM-130B çerçevesi, [MASK] ve [gMASK] olarak adlandırılan iki bozulma stratejisi kullanır ve bu stratejilerden biri, her bir eğitim dizisi için bağımsız olarak uygulanır. Blank’ları doldurmak için, [MASK] stratejisi, cümlelerin %30’unda, boşlukların uzunluğu girişin %15’ine eşit olacak şekilde, ardışık span’ları maskeler ve bu boşluklar Poisson dağılımını takip eder. Dizinin geri kalan %70’si için, her bir dizinin ön metni bir bağlam olarak tutulur ve [gMASK] stratejisi, geri kalanını maskeler ve maskeli uzunluk, Uniform dağılımı kullanılarak örneklendirilir.
Çoklu Görev Talimatları Ön-Eğitimi
Çoklu görev öğrenimi yaklaşımının, sıfır-shot ayarlarında görev aktarımını iyileştirmek için ön-eğitime kıyasla daha iyi sonuçlar verdiğine işaret edilmiştir. GLM-130B çerçevesi, ön-eğitim sırasında dil üretimi, anlama ve bilgi çıkarma gibi görevleri içeren bir dizi talimatlı veri kümesini önerir.
GLM-130B çerçevesinin kullandığı çoklu görev talimatları ön-eğitimi yaklaşımı, diğer ön-eğitim yaklaşımalarına kıyasla, yalnızca %5’lik bir token payına sahiptir ve bu, ön-eğitim aşamasında LLM çerçevesinin diğer yeteneklerini bozmamak amacıyla ayarlanır, yani koşulsuz serbest üretim.
3B Paralel Stratejisi
Büyük ölçekli modelleri eğitmek için iki yaygın uygulama vardır, tensor model paralelliği ve veri paralelliği. GLM-130B çerçevesi, pipeline model paralelliği stratejisiyle birleştirilen tensor model paralelliği ve veri paralelliği stratejilerini kullanarak 3B paralel stratejisini uygular. Bu, GPU kullanımını minimize etmeye ve büyük GPU gereksinimlerini yönetmeye yardımcı olur.
GLM-130B: Eğitim İstikrarı
Eğitim istikrarı, bir LLM’nin kalitesini belirlemede önemli bir faktördür ve bu istikrar, geçirilen token sayısına bağlı olarak büyük ölçüde etkilenir. Ayrıca, hesaplamayla ilgili kısıtlamalar nedeniyle, eğitim verimliliği ve istikrarı arasında bir denge kurmak önemlidir. Örneğin, düşük hassasiyetli kayan nokta formatları, hesaplamayı hızlandırır, ancak Bunlar genellikle eğitim çöküşlerine yol açar, çünkü bunlar alt akış ve taşma hatalarına eğilimlidir.
Karışık Hassasiyet
Eğitim doğruluğunu artırmak ve bellek kullanımını azaltmak amacıyla, GLM-130B çerçevesi, diğer popüler LLM çerçevelerinin kullandığı gibi, FP16 için hem ileri hem de geri yönde ve FP32 için hem ana ağırlıklar hem de optimize edici durumlar için karıştırılmış hassasiyetleri kullanır. GLM-130B çerçevesinin eğitim aşaması, mixed precision stratejisi kullanılarak, sıklıkla kayıp sıçramaları ile karşılaşıyor ve bu sıçrama kayıplarının sıklığı, modelin eğitimine devam ettikçe artıyor.

İlk olarak, transformer’in ana dalının değer ölçeği, daha derin katmanlarda Pre-LN kullanıldığında çok büyük olabilir. GLM-130B çerçevesinde, bu sorun, değer ölçeğinin her zaman sınırlı kalmasını sağlayan DeepNorm tabanlı Pre-LN kullanılarak ele alınır. İkincisi, model ölçeklendirildikçe, dikkat puanları FP16’nin aralığını aşacak şekilde büyür.
Katman-Tabakalı Gradyan Küçültme veya EGS
GLM-130B çerçevesini geliştiren geliştiriciler, gradyan normunun, eğitim çöküşleri için bilgilendirici bir gösterge olabileceğini tespit ettiler ve bir eğitim çöküşü, genellikle gradyan normundaki bir sıçramanın ardından gelir. Bu sıçramaların nedeni, gömme katmanının anormal gradyanlarıdır ve geliştiriciler, gömme katmanının gradyan normunun, diğer katmanların gradyan normuna kıyasla daha büyük ve daha çok dalgalanma gösterdiğini gözlemlediler. Görüntü modelleri de bu sorunu yaşar ve bu, yama projeksiyon katmanını dondurarak ele alınır. Ancak, aynı yaklaşım büyük dil modellerine uygulanamaz, çünkü dil modellerinde, projeksiyon katmanlarını dondurmak mümkün değildir.

GLM-130B: Sonuçlar ve Performans
GLM-130B’nin İngilizce görevlerdeki performansını değerlendirmek için, GLM-130B çerçevesi, PaLM ve GPT-3 gibi diğer LLM çerçevelerinin kullandığı aynı ayarları uygular ve GLM-130B çerçevesi bir ikili çerçeve olduğu için, aynı zamanda çeşitli Çin benchmark’lerinde de değerlendirilir. GLM-130B çerçevesinin performansı, Dil Modelleme, MMLU veya Büyük Ölçekli Çoklu Görev Dil Anlama, BIG-Bench veya İmitasyon Oyunu Ötesi Benchmark ve CLUE veya Çin Dil Anlama Değerlendirmesi gibi birden fazla benchmark üzerinde ölçülür. Başlayalım.
Dil Modelleme
GLM-130B çerçevesinin dil modelleme testi, LAMBADA ve Pile gibi iki veri kümesi üzerinde gerçekleştirilir.
LAMBADA veri kümesi, LLM’lerin son kelime modelleme yeteneklerini test etmek için kullanılır ve GLM-130B çerçevesi, ikili bir ayarlamada %80,2’lik bir sıfır-shot doğruluk puanı elde eder ve bu, LAMBADA veri kümesinde yeni bir benchmark rekoru oluşturur.
Diğer taraftan, Pile, dil modelleri için bir dizi benchmark içeren bir test kümesidir. GLM-130B çerçevesi, GPT-3 ve Jurassic-1’e kıyasla, 18 paylaşılan test kümesi üzerinde ağırlıklı BPB’lerde en iyi performansını gösterir. Sonuçlar, GLM-130B çerçevesinin güçlü dil yeteneklerini gösterir ve sonuçlar aşağıdaki tabloda yer alır.

MMLU veya Büyük Ölçekli Çoklu Görev Dil Anlama
MMLU veya Büyük Ölçekli Çoklu Görev Dil Anlama bir çeşit benchmark olup, insan zekası ve bilgisine ilişkin 50’den fazla çoklu seçimli soru cevaplama görevini içerir ve bu görevler, lise seviyesinden uzman seviyesine kadar çeşitlilik gösterir. MMLU, Pile test kümesinin taramasının ardından yayınlanır ve bu nedenle, bir LLM’nin az-shot öğrenme yeteneklerini değerlendirmek için ideal bir test kümesidir.

Görüldüğü gibi, az-shot ayarlarında (5-shot), GLM-130B çerçevesinin performansı, yaklaşık 300 milyar tokeni gördükten sonra GPT-3 modelinin performansına yaklaşıyor. Performans, eğitim devam ettikçe artıyor ve eğitim sona erdiğinde, GLM-130B çerçevesi 400 milyar tokeni gördükten sonra %44,8’lik bir doğruluk puanı elde ediyor.
BIG-Bench veya İmitasyon Oyunu Ötesi Benchmark
BIG-Bench veya İmitasyon Oyunu Ötesi Benchmark, bir modelin bilgi, akıl yürütme ve ortak akıl yeteneklerini test eder. Aşağıdaki şekillerde gösterildiği gibi, sıfır-shot ayarlarında GLM-130B çerçevesi, PaLM 540B ve GPT-3 175B çerçevelerini geride bırakır ve bu, MIP ve bidirectional bağlam dikkatinin GLM-130B’nin sıfır-shot ayarlarında görülmemiş görevlerdeki performansını artırmasından kaynaklanabilir. Ayrıca, shot sayısı arttıkça GLM-130B çerçevesinin performansı da artar ve GPT-3 çerçevesini tutarlı bir şekilde geride bırakır.

CLUE veya Çin Dil Anlama Değerlendirmesi
GLM-130B’nin Çin’de sıfır-shot performansı, CLUE ve FewCLUE gibi kurulmuş NLP benchmark görevlerinde değerlendirilir ve mevcut en büyük Çin dil modeli olan 260B ERNIE Titan 3.0 ile karşılaştırılır. Görüldüğü gibi, GLM-130B çerçevesi, 12 farklı görevde 260B ERNIE Titan 3.0 çerçevesini tutarlı bir şekilde geride bırakır ve iki soyut MRC veri kümesinde ERNIE çerçevesinden yaklaşık %260 daha iyi performans gösterir.

Sonuç
Bu makalede, GLM-130B’yi ele aldık, bu çerçevenin, ikili bir ön-eğitimli büyük dil modeli olup, kapsayıcı LLM araştırmalarını teşvik etmeyi amaçladığını gördük. Mimarisi, mühendisliği ve teknik girişimleri, LLM çerçevelerinin mimarisi, eğitim verimliliği ve istikrarı, ön-eğitim hedefleri ve uygun müdahale hakkında AI topluluğuna daha iyi bir bakış açısı sunmayı amaçlar.












