Yapay zeka modelleri ve platformları
MPT-30B: MosaicML, GPT-3’den Daha Güçlü Bir LLM ile NLP Sınırlarını Aşmaya Hazır
MosaicML bir yaratıcı AI şirketi olup, AI dağıtımı ve ölçeklendirme çözümleri sunuyor. En son büyük dil modeli (LLM) MPT-30B, AI topluluğu genelinde dalgalar yaratıyor.
MosaicML’in LLM yolculuğu, Mayıs 2023’te MPT-7B (Mosaic Pretrained Transformer) yayınlanmasıyla başladı ve bununla birlikte üç varyant geldi:
- MPT-7B-StoryWriter-65k+ (uzun形式 hikaye oluşturma için)
- MPT-7B-Instruct (kısa形式 talimat izleme için)
- MPT-7B-Chat (diyalog oluşturma için)
Modeller, açık kaynaklı doğaları, ticari kullanılabilirlikleri ve genişletilmiş bağlam pencerelerini işleme yetenekleri nedeniyle ML topluluğunda büyük bir başarıya tanık oldu.
En önemlisi, model diğer karşılaştırılabilir modellerle (LLaMA-7B, StableLM 7B vb.) aynı düzeydeydi ve bazı durumlarda onları aştı. Haziran ayına gelindiğinde, MPT-7B serisi 3 milyondan fazla kez indirildi. 22 Haziran’da MosaicML, MPT-30B‘yi yayınladı ve açık kaynaklı temel modeller için çubuğu daha da yükseltti.
MPT-30B: GPT-3’ten Daha Güçlü Bir LLM
MPT-30B, GPT-3-175B‘den daha güçlü, açık kaynaklı ve ticari lisanslı bir kodlayıcı tabanlı LLM’dir ve yalnızca GPT-3 parametrelerinin %17’sine sahiptir, yani 30B. Birkaç görevde GPT-3’ü geride bırakıyor. MPT-30B ve GPT-3 arasındaki karşılaştırma aşağıda verilmiştir.
MPT-30B, önceki MPT-7B modelinin üzerine inşa edilmiştir. Benzer boyutlardaki modellere kıyasla hesaplama açısından verimlidir. Örneğin, LLaMA-30B, MPT-30B’den yaklaşık 1,44 kat daha fazla FLOPs bütçesine sahipken, Falcon-40B’nin FLOPs bütçesinin MPT-30B’den 1,27 kat daha yüksek olduğu görüldü. MPT-30B’nin selefi üzerindeki çeşitli görevlerdeki gelişmesini gösteren bir illüstrasyon aşağıdadır.
MPT-30B’nin bazı özel özellikleri şunlardır:
8k Token Bağlam Penceresi
LLM’lerde bağlam penceresi, modelin çıktıyı oluşturmadan önce dikkate alabileceği token aralığını ifade eder. MPT-30B, eğitim zamanında 8000 token’lik bir bağlam penceresine sahipti. İlk olarak 1T token kullanarak 2k token dizileri ile eğitildi ve ardından 50B token’lik 8k token dizileri (yaklaşık 6000 kelime) ile eğitildi.
ALiBi Desteği
Bu özelliğin açıklanması için bir soru düşünün:
MPT-30B, eğitim aldığı şeyden daha uzun dizileri nasıl anlayabilir ve öngörülerde bulunabilir?
MPT-30B, daha uzun dizileri anlamak ve bağlam penceresini 8k token’in ötesine taşımak için Dikkat ile Lineer Önyargılar (ALiBi) tekniğini kullanır.
Positional gömme yerine, ALiBi, anahtar ve sorgu tokenleri arasındaki dikkat puanlarını hesaplar. Anahtar ve sorgu tokenleri birbirine yakın olduğunda ceza düşük, otherwise daha yüksektir. Sonuç olarak, altta yatan transformer mimarisi, uzun forma girişlere extrapole edebilir.
FlashAttention ile Verimli Çıktı ve Eğitim Performansı
Dikkat, yani girdi dizisindeki ilgili kısımlara odaklanma, transformer’lerin kritik bir bileşenidir, ancak özellikle uzun metin dizilerini işlerken yavaş ve bellek yoğun olabilir.
FlashAttention, Cornell Üniversitesi’ndeki araştırmacılar tarafından önerilen ve MPT-30B için bu sorunu ele alan bir yaklaşımdır. Tiling olarak adlandırılan bir teknik kullanarak, modelin bellekten okuma veya yazma gereksinimlerini azaltır ve işleme hızını artırır. Dolayısıyla, model, state-of-the-art FlashAttention tekniğini ve NVIDIA’nin FasterTransformer optimizasyon kütüphanesini verimli eğitim ve çıktı için kullanır.
Eğitim ve Dağıtım Kolaylığı
Geliştiriciler, MPT-30B’yi sıfırdan eğitebilir veya MosaicML’nin kontrol noktalarını daha hızlı dağıtımlar için kullanabilir. Ayrıca, belirli bir veri kümesindeki alan özel kullanım durumları için ince ayarlanabilir.
Modelin boyutu, tek bir GPU’da, özellikle 1xA100-80GB’de 16-bit kesinlikte veya 1xA100-40GB’de 8-bit kesinlikte kolayca dağıtım yapılabilmesi için seçildi. Bu, modelin bu GPU’ların bellek sınırları içinde kalması için tasarlandığı anlamına gelir.
Kodlama Yetenekleri
MPT-30B, olağanüstü kodlama yetenekleri de sunar. HumanEval, OpenAI tarafından yayınlanan ve 164 el ile oluşturulmuş programlama problemi içeren bir veri kümesidir. HumanEval veri kümesinde, model, özel olarak tasarlanmış LLM modellerini, StarCoder serisini aşar.
İnce Ayarlı Varyantlar: MPT-30B-Instruct ve MPT-30B-Chat
MPT-30B-Instruct
LLM’ler öncelikle talimatlar için kullanılır, zoals soru-cevap, metin özetleme, dil çevirisi vb. MPT-30B-Instruct, talimatları izleme görevleri için özellikle ince ayarlanmış, ticari olarak kullanılabilir (ticari CC-By-SA-3.0 lisansı korur) MPT-30B varyantıdır. İnce ayar için aşağıdaki veri kümeleri kullanıldı:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dolly veri kümesi, talimat ince ayarlaması için Anthropic’in Yardımsever ve Zararsız veri kümesi ile daha da zenginleştirildi. Ayrıca, veri zenginleştirmesi için çeşitli veri kümeleri kullanıldı, bunlar:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat, diyalog oluşturma için özellikle ince ayarlanmış MPT-30B varyantıdır. CC-By-NC-SA-4.0 lisansı altında yayınlanan bir araştırma ürünüdür ve yalnızca ticari olmayan kullanımına izin verir. Model, çeşitli dil veri kümeleri kullanılarak ince ayarlandı, bunlar:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM’ler, milyarlarca dolarlık yaratıcı AI pazarının büyük bir kısmını paylaşıyor ve geçen yıl ChatGPT’nin manzarayı devrimleştirmesinden sonra kısa sürede muazzam bir büyüme yaşadı. MPT ailesi, bu devrimin temel bir parçasıdır. Yakın gelecekte, MPT ailesinden daha güçlü ve verimli, ticari olarak kullanılabilir açık kaynaklı modeller görmeyi bekleyebiliriz.
En son AI haberleri için, unite.ai‘yi ziyaret edin.















