Yapay zeka modelleri ve platformları
OLMo: Dillerin Bilimini Geliştiren Bir Model
Dil modellerinin son birkaç yılda gösterdiği gelişim, NLP araştırmalarının yanı sıra ticari tekliflerde ve gerçek dünya uygulamalarında neredeyse her yerde varlıklarını hissettirmiştir. Ancak, dil modelleri için ticari talepteki artış, bir ölçüde topluluğun büyümesini engellemiştir. Bu, büyük ölçüde devlet-of-the-art ve yetenekli modellerin özel arabirimler arkasında kapalı olması ve geliştirme topluluğunun eğitim mimarisi, veri ve geliştirme süreçlerinin vital ayrıntılarına erişiminin imkansız olmasıdır. Artık, bu eğitim ve yapısal ayrıntıların araştırma çalışmaları için, özellikle de potansiyel riskleri ve önyargıları anlamak için hayati önem taşıdığı inkar edilemez. Bu nedenle, araştırma topluluğunun gerçekten açık ve güçlü bir dil modeline erişimi gerekmektedir.
Bu gereksinimi karşılamak için geliştiriciler, OLMo adlı bir devlet-of-the-art, gerçekten açık bir dil modeli çerçevesi oluşturdular. Bu çerçeve, araştırmacıların OLMo’yu kullanarak dil modelleri oluşturup incelemelerine olanak tanır. Çoğu devlet-of-the-art dil modelinin yalnızca arabirim kodunu ve model ağırlıklarını yayınladığına karşılık, OLMo çerçevesi gerçekten açık kaynaklıdır ve kamu tarafından erişilebilen değerlendirme kodu, eğitim yöntemleri ve eğitim verilerine sahiptir. OLMo’nun birincil amacı, açık araştırma topluluğunu güçlendirmek ve dil modellerinin sürekli gelişimini desteklemektir.
Bu makalede, OLMo çerçevesini detaylı olarak inceleyeceğiz, mimarisi, metodolojisi ve mevcut devlet-of-the-art çerçevelerle karşılaştırıldığında performansı hakkında konuşacağız. Başlayalım.
OLMo: Dillerin Bilimini Geliştiren Bir Model
Dil modeli, son birkaç yıldır AI ve ML topluluğu içinde değil, aynı zamanda teknoloji endüstrisi genelinde en sıcak trendlerden biri olmuştur. ChatGPT, dil modellerinin gerçek dünya görevlerini insan benzeri performansla gerçekleştirebileceği potansiyeli konusunda bir örnek teşkil etmektedir. Büyük teknoloji şirketleri, ürünlerine dil modeli entegrasyonu konusunda araştırma yapmaktadır.
NLP, veya Doğal Dil İşleme, son birkaç yıldır dil modellerini geniş çapta kullanmış endüstrilerden biridir. Ancak, endüstri büyük ölçekli ön eğitim ve insan annotasyonu için alignment başladığından beri, dil modelleri ticari viability konusunda hızlı bir şekilde gelişme kaydetmiştir. Bu, çoğu devlet-of-the-art dil ve NLP çerçevesinin kısıtlı özel arabirimlere sahip olmasına yol açmıştır. Geliştirme topluluğu, vital ayrıntılara erişimi bulunmamaktadır.
OLMo, bir devlet-of-the-art, gerçekten açık bir dil modeli sunmaktadır. Geliştiricilere, dil modellerini oluşturmak, incelemek ve geliştirmek için bir çerçeve sunmaktadır. Araştırmacılara, eğitim kodu, eğitim yöntemi, eğitim verisi, eğitim günlükleri ve ara model kontrol noktalarına erişim sağlamaktadır. Mevcut devlet-of-the-art modellerin çeşitli açıklık dereceleri bulunmaktadır. OLMo modeli, eğitimden verilere, değerlendirme araçlarına kadar tüm çerçeveyi yayınlamıştır. Bu, devlet-of-the-art modeller gibi LLaMA2 modeline kıyasla performans açığını daraltmaktadır.
Eğitim ve modelleme için, OLMo çerçevesi eğitim kodunu, tam model ağırlıklarını, ablasyonları, eğitim günlüklerini ve eğitim metriklerini içerir. Analiz ve veri seti oluşturma için, OLMo çerçevesi AI2’nin Dolma ve WIMBD modelleri için kullanılan tam eğitim verisini ve eğitim verisini üreten kodu içerir. Değerlendirme amacıyla, OLMo çerçevesi AI2’nin Catwalk modelini aşağı akış değerlendirme için ve Paloma modelini karmaşıklık temelinde değerlendirme için içerir.
OLMo: Model ve Mimari
OLMo modeli, Neural Information Processing Systems’e dayanan bir decoder-only transformer mimarisini benimsemektedir. 1 milyar ve 7 milyar parametreli iki model sunmaktadır. 65 milyar parametreli bir model şu anda geliştirme aşamasındadır.

OLMo mimarisi, vanilla transformer bileşenini içeren diğer çerçevelerden birkaç gelişme sunmaktadır. Bu, son devlet-of-the-art büyük dil modelleri gibi OpenLM, Falcon, LLaMA ve PaLM’de görülmektedir. Aşağıdaki şekil, 7 milyar parametreli OLMo modelini yaklaşık eşit sayıda parametreyle çalışan son LLM’lerle karşılaştırmaktadır.

OLMo çerçevesi, hyperparametreleri, donanım上的 eğitim verimliliğini optimize ederek ve aynı zamanda yavaş sapma ve kayıp sıçraması riskini minimize ederek seçer. OLMo çerçevesinin, vanilla transformer mimarisinden farklılaştıran birincil değişiklikler şunlardır:
Önyargı Yok
Falcon, PaLM, LLaMA ve diğer dil modellerinin aksine, OLMo çerçevesi eğitim stabilitesini artırmak için mimarisinde herhangi bir önyargı içermez.
Parametrik Olmayan Katman Normu
OLMo çerçevesi, mimarisinde parametrik olmayan katman normunun formülasyonunu uygulamaktadır. Parametrik olmayan katman normu, norm içinde herhangi bir afinitif dönüşüm sunmaz, yani herhangi bir adaptif kazanç veya önyargı sunmaz. Parametrik olmayan katman normları, sadece daha güvenli olmakla kalmaz, aynı zamanda daha hızlıdır.
SwiGLU Aktivasyon Fonksiyonu
PaLM ve LLaMA gibi çoğu dil modelinde olduğu gibi, OLMo çerçevesi mimarisinde ReLU aktivasyon fonksiyonu yerine SwiGLU aktivasyon fonksiyonunu içerir ve gizli aktivasyon boyutunu 128’in en yakın katına çıkararak verimliliği artırır.
Rope veya Döner Pozisyonel Gömme
OLMo modelleri, LLaMA ve PaLM modellerini takip ederek mutlak pozisyonel gömme yerine RoPE veya döner pozisyonel gömme kullanır.
Ön Eğitim ile Dolma
Geliştirme topluluğunun artık model parametrelerine gelişmiş erişimi olmasına rağmen, ön eğitim veri setlerine erişim hala sınırlıdır. Ön eğitim verileri, kapalı modellerle birlikte veya açık modellerle birlikte yayımlanmamaktadır. Teknik belgeler, modeli tam olarak anlamak ve çoğaltmak için gerekli vital ayrıntıları thường缺maktadır. Bu engel, dil modeli ön eğitimi araştırmalarında ilerlemeyi zorlaştırmaktadır. OLMo çerçevesi, açık araştırmayı kolaylaştırmak için ön eğitim veri setini, Dolma’yı yayımlamıştır. Dolma veri seti, 7 farklı kaynaktan toplanan 5 milyar belge ve 3 trilyon tokenlik çok kaynaklı ve çeşitli bir koleksiyondur.

Dolma veri seti, dil filtreleme, kalite filtreleme, içerik filtreleme, çok kaynaklı karıştırma, yinelenen kaldırma ve tokenizasyon gibi 5 bileşenden oluşan bir işlem hattı kullanılarak oluşturulmuştur. OLMo, Dolma raporunu da yayımlamıştır. Bu rapor, tasarım ilkeleri ve inşaat ayrıntıları hakkında daha fazla bilgi sunmaktadır. Model, aynı zamanda yüksek performanslı veri kürasyon araçlarını açık kaynak olarak yayımlamıştır. Değerlendirme, iki aşamalı bir stratejiyi takip etmektedir. İlk olarak, model eğitimi sırasında karar verme için çevrimiçi değerlendirme yapılmaktadır. Ardından, model kontrol noktalarından agregat bir değerlendirme için çevrimdışı değerlendirme yapılmaktadır. Çevrimdışı değerlendirme için OLMo, Catwalk çerçevesini kullanmaktadır. Bu, kamu tarafından erişilebilen bir değerlendirme aracıdır ve çeşitli veri setlerine ve görev formatlarına erişim sağlamaktadır.
OLMo, model mimarisi, başlatma, optimizatör, öğrenme oranı zamanlaması ve veri karışımları hakkında çeşitli değerlendirme metrikaları çalıştırmaktadır. Geliştiriciler, bunu OLMo’nun “çevrimiçi değerlendirme” olarak adlandırmaktadır. Bu, her 1000 eğitim adımı (∼4B eğitim tokeni)之后 bir erken ve sürekli sinyal olarak modelin kalitesi hakkında bilgi vermektedir. Bu değerlendirmelerin kurulumu, büyük ölçüde çevrimdışı değerlendirmemiz için kullandığımız çekirdek görevler ve deneysel ayarları temel almaktadır. OLMo, yalnızca OLMo-7B’yi diğer modellerle karşılaştırmakla kalmaz, aynı zamanda daha eksiksiz ve kontrollü bilimsel değerlendirmeyi nasıl sağladığını da gösterir. OLMo-7B, karmaşıklık değerlendirmesi için açık bir dekontaminasyon ile donatılmış en büyük dil modelidir.
OLMo Eğitimi
OLMo çerçevesi modelleri, ZeRO optimizatör stratejisini kullanarak eğitilmektedir. Bu, FSDP çerçevesi aracılığıyla PyTorch tarafından sağlanmaktadır ve böylece GPU bellek tüketimini önemli ölçüde azaltmaktadır. 7 milyar parametre ölçekli eğitim, her bir GPU’da 4096 tokenlik bir mikro toplu işleme boyutuyla gerçekleştirilmektedir. OLMo-1B ve -7B modellerinin eğitim çerçevesi, yaklaşık 4M tokenlik (∼2048 örnek, her biri 2048 token uzunluğunda) bir toplu işleme boyutu kullanmaktadır. Şu anda eğitimi devam eden OLMo-65B modeli için, geliştiriciler, 2M tokenlik (∼1024 örnek) bir toplu işleme boyutuyla başlayan ve her 100B token之后 iki katına çıkan bir toplu işleme boyutu ısınma kullanmaktadır.
Verimliliği artırmak için, Micikevicius et al.’in (2017) önerdiği gibi, FSDP’nin yerleşik ayarları ve PyTorch’un amp modülü aracılığıyla karma hassasiyetli eğitimi kullanıyoruz. Sonuncusu, certain işlemlerin (örneğin, softmax) her zaman tam hassasiyetle çalışmasını sağlar, जबकi diğer tüm işlemler yarı hassasiyetle (bfloat16 formatında) çalışır. Belirli ayarlarımız altında, her bir GPU’ya yerel olan paylaşılan model ağırlıkları ve optimizatör durumu tam hassasiyetle saklanır. Her bir transformer bloğundaki ağırlıklar, yalnızca her bir GPU’da tam boyutlu parametrelerin materialize edildiği forward ve backward geçişler sırasında bfloat16 formatına dönüştürülür. Gradyanları, tam hassasiyetle GPU’lar arasında azaltıyoruz.
Optimizatör
OLMo çerçevesi, aşağıdaki hyperparametrelerle AdamW optimizatörünü kullanmaktadır.

Tüm model boyutları için, öğrenme oranı ilk 5000 adımda (∼21B token) lineer olarak ısınır ve ardından belirtilen minimum öğrenme oranına doğru ters karekök hızında lineer olarak azalır. Isınma döneminin ardından, model, parametre gradyanlarının toplam l-normunun 1.0’ı aşmamasını sağlar. Aşağıdaki tablo, 7 milyar parametre ölçekli nossa optimizer ayarlarını diğer recent LMs ile karşılaştırmaktadır.

Eğitim Verisi
Eğitim, cümle parçasını word ve BPE tokenizer ile tokenize etmeyi ve her bir belgenin sonuna özel bir EOS token eklemeyi içerir. Ardından, 2048 tokenlik ardışık parçaları birleştirerek eğitim örnekleri oluşturur. Eğitim örnekleri, her bir eğitim çalışması için aynı şekilde karıştırılır. Veri sırası ve her bir eğitim toplu işlemenin exact bileşimi, yayımladığımız artifacts’dan yeniden oluşturulabilir. Tüm yayımladığımız OLMo modelleri, en az 2T token (∼eğitim verisinin bir epoch’u) eğitim görmüştür ve bazıları veri üzerinde farklı bir karıştırma sırasıyla ikinci bir epoch eğitim görmüştür. Bu, tekrarlanan veri miktarı çok az olduğu için ihmal edilebilir bir etkiye sahip olmalıdır.
Sonuçlar
OLMo-7B için kullanılan kontrol noktası, Dolma veri setinde 2.46T token eğitim görmüştür. Bu kontrol noktasını, lineer olarak öğrenme oranını 0’a düşüren 1000 adım daha eğitim görmek, karmaşıklık ve son görev değerlendirme suitlerinde model performansı artırmaktadır. Son değerlendirme için, geliştiriciler OLMo’yu diğer kamu tarafından erişilebilen modellerle – LLaMA-7B, LLaMA2-7B, Pythia-6.9B, Falcon-7B ve RPJ-INCITE-7B – karşılaştırmaktadır.
Aşağı Akış Değerlendirmesi
Temel aşağı akış değerlendirme suiti aşağıdaki tabloda özetlenmiştir.

Sıfır-shot değerlendirme, tüm durumlarda rank sınıflandırma yaklaşımıyla gerçekleştirilmektedir. Bu yaklaşımda, aday metin tamamlamaları (örneğin, farklı çoklu seçim seçenekleri) olasılığa göre sıralanır ve tahmin doğruluğu raporlanır.
Catwalk, çeşitli olasılık normalization yöntemlerini kullanır. Bu, her bir veri seti için ayrı ayrı seçilen normalization stratejilerini içerir ve cevapların koşulsuz olasılığını da içerir. Daha somut olarak, bu, bazı görevler için normalization içermemeyi (örneğin, arc ve openbookqa görevleri), bazı görevler için token başına normalization (örneğin, hellaswag, piqa ve winogrande görevleri) ve bazı görevler için normalization içermemeyi (örneğin, boolq, copa ve sciq görevleri, yani tek token tahmini görevlerine yakın görevler) içerir.

Aşağıdaki şekil, dokuz temel son görev için doğruluk puanının ilerlemesini göstermektedir. Tüm görevler için, OLMo-7B daha fazla token üzerinde eğitildikçe genel olarak artan bir trend olduğu söylenebilir. Öğrenme oranının son 1000 eğitim adımı boyunca lineer olarak 0’a düşürülmesinin, birçok görevin doğruluğunda keskin bir artışa yol açtığı görülmektedir. Örneğin, içsel değerlendirmelerde, Paloma, her bir domaine ayrı ayrı ve daha sonra domaine kombinasyonları üzerinden daha özetlenmiş sonuçlar sunarak bir dizi analizi sunar. Biz, 18 kaynağın 11’inde agregat performans ve bu kaynakların her birindeki daha ince sonuçları raporlarız.

Son Düşünceler
Bu makalede, OLMo adlı bir devlet-of-the-art, gerçekten açık bir dil modeli çerçevesinden bahsettik. Bu çerçeve, geliştiricilere dil modellerini oluşturmak, incelemek ve geliştirmek için olanak tanır. Araştırmacılara, eğitim kodu, eğitim yöntemi, eğitim verisi, eğitim günlükleri ve ara model kontrol noktalarına erişim sağlar. Mevcut devlet-of-the-art modellerin çeşitli açıklık dereceleri bulunmaktadır. OLMo modeli, eğitimden verilere, değerlendirme araçlarına kadar tüm çerçeveyi yayınlamıştır. Bu, devlet-of-the-art modeller gibi LLaMA2 modeline kıyasla performans açığını daraltmaktadır.












