Yapay zeka modelleri ve platformları

Mistral AI’nin Son Mixture of Experts (MoE) 8x7B Modeli

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Mistral AI

Paris merkezli açık kaynaklı model startup’ı, büyük dil modeli (LLM) olan MoE 8x7B’sini basit bir torrent bağlantısı aracılığıyla yayınladı. Bu, Google’ın Gemini sürümündeki geleneksel yaklaşımından farklılık gösteriyor ve AI topluluğunda sohbetleri ve heyecanı tetikliyor.

Mistral AI’nin sürüm stratejisi her zaman geleneksel olmayan bir yaklaşım sergiledi. Genellikle makaleler, bloglar veya basın açıklamaları gibi通常ın acompanhamientosını atlayarak, AI topluluğunun dikkatini çekmek için benzersiz bir şekilde etkili bir strateji izledi.

Şirket, Andreessen Horowitz liderliğindeki bir finansman turunun ardından $2 milyar değerlemeye ulaştı. Bu finansman turu, Avrupa tarihindeki en büyük 118 milyon dolarlık tohum turu rekorunu kırdı. Finansman başarılarının ötesinde, Mistral AI, açık kaynaklı AI’de düzenlemenin azaltılması için AB AI Yasası etrafındaki tartışmalarda aktif olarak yer aldı.

Neden MoE 8x7B Dikkat Çekiyor

“GPT-4’ün ölçeklendirilmiş hali” olarak tanımlanan MoE 8x7B, sekiz uzman içeren bir Mixture of Experts (MoE) çerçevesi kullanıyor. Her uzman, 111B parametre ve 55B paylaşılan dikkat parametreleri ile birlikte toplam 166B parametre sunuyor. Bu tasarım seçimi önemli, çünkü her bir tokenın çıkarımında yalnızca iki uzmanın yer almasına olanak tanır, daha verimli ve odaklı AI işlemlerine doğru bir kayma gösterir.

MoE 8x7B’nin önemli özelliklerinden biri, 32.000 tokenlik geniş bir bağlamı yönetebilmesidir. Bu, karmaşık görevleri ele almak için yeterli kapsam sağlar. Modelin çok dilli yetenekleri, İngilizce, Fransızca, İtalyanca, Almanca ve İspanyolca dahil olmak üzere küresel bir geliştirici topluluğuna hitap eder.

MoE 8x7B’nin ön eğitimi, açık Web’den alınan verilerle gerçekleştirilir ve uzmanlar ve yönlendiriciler için eş zamanlı bir eğitim yaklaşımı kullanılır. Bu yöntem, modelin yalnızca parametre alanının büyüklüğü açısından değil, aynı zamanda maruz kaldığı verilerin nüanslarına da ince ayarlanmış olduğunu garantiler.

Mixtral 8x7B etkileyici bir puan elde ediyor

Mixtral 8x7B etkileyici bir puan elde ediyor

MoE 8x7B, LLaMA 2 70B ve GPT-3.5’i özellikle MBPP görevinde %60,7’lik bir başarı oranıyla geride bırakıyor. Ayrıca, talimatları izleyen modeller için tasarlanan MT-Bench’de de etkileyici bir puan elde ediyor, GPT-3.5’e yakın bir performans gösteriyor.

Mixture of Experts (MoE) Çerçevesini Anlamak

Mixture of Experts (MoE) modeli, son zamanlarda state-of-the-art dil modellerine entegrasyonu nedeniyle dikkat çekmesine rağmen, aslında birkaç yıl öncesine dayanan temel kavramlara dayanıyor. Bu fikrin kökenlerini, önemli araştırma makaleleri aracılığıyla yeniden ziyaret edelim.

MoE Kavramı

Mixture of Experts (MoE), nöral ağ mimarisinde bir paradigma değişikliğini temsil eder. Geleneksel modellerin, tüm veri türlerini işlemek için tek, homojen bir ağ kullanması yerine, MoE daha uzmanlaşmış ve modüler bir yaklaşım benimser. Birden fazla “uzman” ağı içerir, her biri belirli veri türleri veya görevleri işlemek için tasarlanmıştır ve bir “gating network” tarafından denetlenir, bu ağ girdileri dinamik olarak en uygun uzmana yönlendirir.

Bir dil modeli içinde gömülü bir Mixture of Experts (MoE) katmanı

Bir dil modeli içinde gömülü bir Mixture of Experts (MoE) katmanı (Kaynak)

 

Yukarıdaki resim, bir dil modeli içinde gömülü bir MoE katmanının yüksek düzey bir görünümünü sunar. Temelinde, MoE katmanı, her biri farklı veri yönlerini işlemek için uzmanlaşmış olabilecek birden fazla feed-forward alt-ağı içerir. Bir gating network, şemada vurgulanmıştır, hangi uzmanların belirli bir girdi için etkinleştirileceğini belirler. Bu koşullu aktivasyon, ağın kapasitesini artırmaya olanak tanır, ancak buna karşılık gelen bir hesaplama talebi artışı olmadan.

MoE Katmanının İşleyişi

Uygulamada, gating network girdiyi (şemada G(x) olarak gösterilir) değerlendirir ve onu işlemek için bir dizi uzman seçer. Bu seçim, gating network’ün çıkışları tarafından modüle edilir, efektif olarak her uzmanın nihai çıktıya olan “oy” veya katkılarını belirler. Örneğin, şemada gösterildiği gibi, her bir belirli girdi tokenı için yalnızca iki uzman seçilebilir, bu da süreci, hesaplamalı kaynakları en çok ihtiyaç duyulan yerlerde yoğunlaştırarak verimli hale getirir.

 

MoE katmanları ile güçlendirilmiş Transformer Encoder (Kaynak)

İkinci resim, geleneksel bir Transformer encoder ile MoE katmanları ile güçlendirilmiş bir encoder arasındaki karşılaştırmayı gösterir. Transformer mimarisi, dil ile ilgili görevlerdeki etkinliği nedeniyle geniş olarak bilinir ve geleneksel olarak self-attention ve feed-forward katmanlarından oluşur. MoE katmanlarının eklenmesi, bu feed-forward katmanlarının bazılarını değiştirir, modelin kapasitesini daha etkili bir şekilde ölçeklemesine olanak tanır.

Powerleştirilmiş modelde, MoE katmanları birden fazla cihaza dağıtılır, model-paralel bir yaklaşımı gösterir. Bu, çok büyük modelleri ölçeklendirirken kritiktir, çünkü hesaplama yükü ve bellek gereksinimlerinin bir cihaz kümesi (örneğin GPU’lar veya TPU’lar) boyunca dağıtılmasına olanak tanır. Bu dağıtım, büyük modellerin (yüz milyarlarca veya trilyonlarca parametre) büyük ölçekli hesaplamalı kümelere verimli bir şekilde eğitilmesi ve dağıtılması için gereklidir.

Sparse MoE Yaklaşımı ile Talimat Düzenleme

“Sparse Mixture-of-Experts (MoE) for Scalable Language Modeling” başlıklı makale, büyük dil modellerini (LLM) Mixture of Experts mimarisini entegre ederek ve talimat düzenleme teknikleri kullanarak geliştirmek için yenilikçi bir yaklaşımı tartışır.

Bu, MoE modellerinin, eşit hesaplama kapasitesine sahip yoğun modellere kıyasla belirli görevler için fine-tuning sırasında underperformansa neden olan bir soruna dikkat çeker.

Talimat düzenleme, modellerin doğal dil talimatlarını daha iyi takip etmelerini sağlayan bir eğitim metodolojisidir, böylece görev performansını artırır. Makale, MoE modellerinin talimat düzenleme ile birleştirildiğinde, özellikle yoğun modellerine kıyasla önemli bir performans artışı gösterdiğini öne sürer. Bu teknik, modelin ön eğitimli temsilini talimatları daha iyi takip edecek şekilde hizalar, görevlerde önemli performans artışlarına yol açar.

Araştırmacılar, üç deneysel kurulumda çalışmalar yürüttüler ve MoE modellerinin, doğrudan görev-spesifik fine-tuning’de başlangıçta underperformansa neden olduğunu, ancak talimat düzenleme uygulandığında MoE modellerinindense dense modelleri geride bıraktığını ve özellikle görev-spesifik fine-tuning ile birlikte kullanıldığında daha da iyi performans gösterdiğini ortaya koydular.

MoE üzerinde talimat düzenleme etkisi

MoE üzerinde talimat düzenleme etkisi

Ayrıca, bu kavramların başarılı bir uygulamasını gösteren FLAN-MOE32B modelini tanıtır. Not olarak, FLAN-PALM62B adlı yoğun bir modeli, yalnızca üçte bir hesaplama kaynağı kullanarak benchmark görevlerinde geride bırakır. Bu, talimat düzenleme ile birleştirilmiş sparse MoE modellerinin, LLM verimliliği ve performansı için yeni standartlar koyma potansiyelini gösterir.

Gerçek Dünyada Mixture of Experts Uygulamaları

MoE modellerinin esnekliği, onları çeşitli uygulamalar için ideal kılar:

  • Doğal Dil İşleme (NLP): MoE modelleri, insan dilinin nüanslarını ve karmaşıklıklarını daha etkili bir şekilde ele alabilir, böylece gelişmiş NLP görevleri için ideal olurlar.
  • Görüntü ve Video İşleme: Yüksek çözünürlüklü işleme gerektiren görevlerde, MoE farklı görüntüleri veya video karelerini yönetebilir, hem kaliteyi hem de işleme hızını artırabilir.
  • Özel AI Çözümleri: İşletmeler ve araştırmacılar, MoE modellerini belirli görevlere uyarlayabilir, daha hedeflenmiş ve etkili AI çözümleri elde edebilir.

Sorunlar ve Dikkat Edilmesi Gerekenler

MoE modelleri birçok fayda sunsa da, benzersiz zorluklar da sunar:

  • Eğitim ve Ayarlama Karmaşıklığı: MoE modellerinin dağıtılmış doğası, eğitim sürecini karmaşıklaştırabilir, uzmanlar ve gating network’ün dikkatli bir şekilde dengelenmesi ve ayarlanması gerekebilir.
  • Kaynak Yönetimi: MoE modellerinin faydalarını en üst düzeye çıkarmak için, hesaplamalı kaynakların uzmanlar arasında verimli bir şekilde yönetilmesi kritiktir.

MoE katmanlarını nöral ağlara, özellikle dil modellerine entegre etmek, hesaplama kısıtlamaları nedeniyle previously infeasible büyüklükte modelleri ölçeklendirme yolunu sunar. MoE katmanları tarafından ermögülen koşullu hesaplamalar, hesaplamalı kaynakların daha verimli bir şekilde dağıtılmasını sağlar, daha büyük ve yetenekli modellerin eğitilmesine olanak tanır. AI sistemlerimizden daha fazlasını talep ettikçe, MoE donanımlı Transformer gibi mimarilerin, çeşitli alanlardaki karmaşık ve büyük ölçekli görevleri ele almak için standart haline geleceği muhtemeldir.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.