Yapay zeka modelleri ve platformları
xLSTM: Genişletilmiş Uzun Kısa Süreli Hafıza Kapsamında Kapsamlı Bir Rehber
Son yirmi yılı aşkın bir süredir, Sepp Hochreiter‘in öncü Uzun Kısa Süreli Hafıza (LSTM) mimarisi, birçok derin öğrenme atılımlarında ve gerçek dünya uygulamalarında önemli bir rol oynamıştır. Doğal dil oluşturmaktan konuşma tanıma sistemlerini güçlendirmeye kadar, LSTMs, AI devriminin arkasındaki itici güç olmuştur.
Ancak, LSTMs’in yaratıcısı bile, onların içkin sınırlılıklarını tanıyordu ve bu sınırlılıklar, onların tam potansiyellerini gerçekleştirmelerini engelliyordu. Depolanan bilgileri güncelleyememe, depolama kapasitelerinin sınırlı olması ve paralelleştirme eksikliği, transformer ve diğer modellerin, özellikle daha karmaşık dil görevlerinde LSTMs’i geçmelerine yol açtı.
Fakat yakın bir gelişmede, Hochreiter ve NXAI‘daki ekibi, bu uzun süredir devam eden sorunları çözen yeni bir varyant olan genişletilmiş LSTM (xLSTM) tanıttı. Bir araştırma makalesinde sunulan xLSTM, LSTMs’in güçlü olduğu temel fikirleri üzerine kurulurken, onların temel zayıflıklarını mimari yeniliklerle aşar.
xLSTM’nin çekirdeğinde iki yenilikçi bileşen bulunur: üssü gating ve geliştirilmiş hafıza yapıları. Üssü gating, bilgi akışını daha esnek bir şekilde kontrol etmeyi sağlar, böylece xLSTMs, yeni bağlamla karşılaştıklarında kararlarını etkili bir şekilde gözden geçirebilir. Aynı zamanda, matris hafızasının tanıtılması, geleneksel skaler LSTMs’e kıyasla depolama kapasitesini büyük ölçüde artırır.
Geliştirmeler burada bitmez. Büyük dil modellerinden ödünç alınan paralelleştirme ve blokların artımsal yığınlanması gibi teknikleri kullanarak, xLSTMs, milyarlarca parametreye ölçeklenebilir. Bu, çok uzun dizileri ve bağlam pencerelerini modelleme yeteneğini açığa çıkarır – karmaşık dil anlama için kritik bir yetenek.
Hochreiter’in son yaratısının etkileri devasa. Sanal asistanların saatlerce süren konuşmalarda bağlamı güvenilir bir şekilde takip edebileceğini hayal edin. Ya da dil modellerinin, eğitimden sonra yeni alanlara daha güçlü bir şekilde genelleyebileceğini düşünün. Uygulamalar, LSTMs’in etkili olduğu her yere uzanır – sohbet botları, çeviri, konuşma arayüzleri, program analizi ve daha fazlası – ancak şimdi xLSTM’nin atılımlarla güçlendirilmiştir.
Bu derin teknik rehberde, xLSTM’nin mimari ayrıntılarına dalacağız, skaler ve matris LSTMs, üssü gating mekanizmaları, hafıza yapıları ve daha fazlasını değerlendireceğiz. Deney sonuçlarından elde edilen içgörülerle, xLSTM’nin etkileyici performans kazançlarını, transformer ve son tekrarlı modeller gibi devlet-sanatlı mimariler üzerinde göstereceğiz.
Kökenlerin Anlaşılması: LSTM’nin Sınırlılıkları
xLSTM dünyasına dalmadan önce, geleneksel LSTM mimarilerinin karşılaştığı sınırlılıkları anlamak önemlidir. Bu sınırlılıklar, xLSTM’nin geliştirilmesinde ve diğer alternatif yaklaşımların ortaya çıkmasında etkili olmuştur.
- Depolanan Bilgileri Güncelleyememe: LSTM’nin birincil sınırlılıklarından biri, depolanan değerleri daha benzer bir vektörle karşılaştığında güncelleyememesidir. Bu, depolanan bilgileri dinamik olarak güncellemenin gerektiği görevlerde alt performansla sonuçlanabilir.
- Sınırlı Depolama Kapasiteleri: LSTMs, bilgileri skaler hücre durumlarına sıkıştırır, bu da karmaşık veri desenlerini etkili bir şekilde depolama ve geri çağırma yeteneklerini sınırlayabilir, özellikle nadir tokenler veya uzun menzilli bağımlılıklarla başa çıkmada.
- Paralelleştirme Eksikliği: LSTMs’deki bellek karıştırma mekanizması, zaman adımları arasındaki gizli-gizli bağlantılar nedeniyle sıralı işleme zorlar, bu da hesaplamaların paralelleştirilmesini engeller ve ölçeklenebilirliği sınırlar.
Bu sınırlılıklar, transformer ve diğer mimarilerin, özellikle daha büyük modellere ölçeklenirken, belirli yönlerde LSTMs’i geçmelerine yol açmıştır.
xLSTM Mimarisi
xLSTM’nin çekirdeğinde, geleneksel LSTM çerçevesine iki ana değişiklik bulunur: üssü gating ve yeni hafıza yapıları. Bu geliştirmeler, iki yeni LSTM varyantı tanıtılır: sLSTM (skaler LSTM) ve mLSTM (matris LSTM).
- sLSTM: Üssü Gating ve Hafıza Karıştırmalı Skaler LSTM
- Üssü Gating: sLSTM, girdi ve unutturma kapıları için üssü aktivasyon fonksiyonlarını birleştirir, böylece bilgi akışını daha esnek bir şekilde kontrol edilebilir.
- Normalleştirme ve Stabilizasyon: sLSTM, sayısal istikrarsızlıkları önlemek için bir normalize edici durum tanır, bu durum girdi kapılarının ve gelecekteki unutturma kapılarının ürününü izler.
- Hafıza Karıştırması: sLSTM, birden fazla hafıza hücresi destekler ve hafıza karıştırmayı, tekrarlı bağlantılar yoluyla sağlar, böylece karmaşık desenlerin çıkarılması ve durum takibi yetenekleri sağlanır.
- mLSTM: Geliştirilmiş Depolama Kapasitelerine Sahip Matris LSTM
- Matris Hafızası: mLSTM, skaler bir hafıza hücresi yerine bir matris hafızası kullanır, bu da depolama kapasitesini artırır ve bilgi geri çağırmasını daha verimli hale getirir.
- Kovaryans Güncelleme Kuralı: mLSTM, Bidirectional Associative Memories (BAMs)’den esinlenen bir kovaryans güncelleme kuralı kullanır, bu da anahtar-değer çiftlerinin verimli bir şekilde depolanması ve geri çağrılmasını sağlar.
- Paralelleştirme: Hafıza karıştırmayı terk ederek, mLSTM tam paralelleştirme sağlar, modern donanım hızlandırıcıları üzerinde verimli hesaplamalar yapılmasına olanak tanır.
Bu iki varyant, sLSTM ve mLSTM, artımsal blok mimarilerine entegre edilebilir, böylece xLSTM blokları oluşturulur. Bu xLSTM bloklarını artımsal olarak yığarak, araştırmacılar, belirli görevler ve uygulama alanları için güçlü xLSTM mimarileri oluşturabilir.
Matematik
Geleneksel LSTM:
Orijinal LSTM mimarisi, tekrarlı sinir ağlarında kaybolan gradyan problemine karşı savaşmak için sabit hata karnavalı ve gating mekanizmaları tanıttı.

Bir LSTM’deki tekrarlayan modül – Kaynak
LSTM hafıza hücresi güncellemeleri aşağıdaki denklemlerle yönetilir:
Hücre Durumu Güncellemesi: ct = ft ⊙ ct-1 + it ⊙ zt
Gizli Durum Güncellemesi: ht = ot ⊙ tanh(ct)
Nerede:
- 𝑐𝑡 zaman 𝑡 ‘deki hücre durumu vektörüdür
- 𝑓𝑡 unutturma kapısı vektörüdür
- 𝑖𝑡 girdi kapısı vektörüdür
- 𝑜𝑡 çıktı kapısı vektörüdür
- 𝑧𝑡 girdi kapısı tarafından modüle edilen girdidir
- ⊙ elemanlara göre çarpma işlemini temsil eder
Kapılar ft, it ve ot, hücre durumundan hangi bilginin depolanacağını, unutulacağını ve çıkarılacağını kontrol eder, böylece kaybolan gradyan sorununu hafifletir.
xLSTM ile Üssü Gating:
xLSTM mimarisi, bilgi akışını daha esnek bir şekilde kontrol etmek için üssü gating tanır. Skaler xLSTM (sLSTM) varyantı için:
Hücre Durumu Güncellemesi: ct = ft ⊙ ct-1 + it ⊙ zt
Normalleştirme Durumu Güncellemesi: nt = ft ⊙ nt-1 + it
Gizli Durum Güncellemesi: ht = ot ⊙ (ct / nt)
Girdi ve Unutturma Kapıları: it = exp(W_i xt + R_i ht-1 + b_i) ft = σ(W_f xt + R_f ht-1 + b_f) YA ft = exp(W_f xt + R_f ht-1 + b_f)
Girdi (it) ve unutturma (ft) kapıları için üssü aktivasyon fonksiyonları ve normalleştirme durumu nt, hafıza güncellemeleri ve depolanan bilgileri gözden geçirmeyi daha etkili hale getirir.
xLSTM ile Matris Hafızası:
Matris xLSTM (mLSTM) varyantı için, geliştirilmiş depolama kapasitesiyle:
Hücre Durumu Güncellemesi: Ct = ft ⊙ Ct-1 + it ⊙ (vt kt^T)
Normalleştirme Durumu Güncellemesi: nt = ft ⊙ nt-1 + it ⊙ kt
Gizli Durum Güncellemesi: ht = ot ⊙ (Ct qt / max(qt^T nt, 1))
Nerede:
- 𝐶𝑡 matris hücre durumudur
- 𝑣𝑡 ve 𝑘𝑡 değer ve anahtar vektörleridir
- 𝑞𝑡 geri çağırma için kullanılan sorgu vektörüdür
Bu anahtar denklemler, xLSTM’nin orijinal LSTM formülasyonunu üssü gating ile daha esnek hafıza kontrolü ve matris hafızası ile geliştirilmiş depolama yetenekleri için nasıl genişlettiğini vurgular. Bu yeniliklerin birleşimi, xLSTM’nin geleneksel LSTMs’in sınırlılıklarını aşmasını sağlar.
xLSTM’nin Ana Özellikleri ve Avantajları
- Depolanan Bilgileri Güncelleyebilme: Üssü gating sayesinde, xLSTM daha ilgili bilgilerle karşılaştığında depolanan değerleri etkili bir şekilde güncelleyebilir, böylece geleneksel LSTMs’in önemli bir sınırlılığını aşar.
- Geliştirilmiş Depolama Kapasiteleri: mLSTM’deki matris hafızası, depolama kapasitesini artırır, böylece xLSTM, nadir tokenler, uzun menzilli bağımlılıklar ve karmaşık veri desenlerini daha etkili bir şekilde işleyebilir.
- Paralelleştirme: mLSTM varyantı, tam paralelleştirme sağlar, modern donanım hızlandırıcıları üzerinde verimli hesaplamalar yapılmasına olanak tanır ve ölçeklenebilirliği sağlar.
- Hafıza Karıştırması ve Durum Takibi: sLSTM varyantı, geleneksel LSTMs’in hafıza karıştırması yeteneklerini korur, durum takibini sağlar ve xLSTM’yi, özellikle bazı görevler için, transformer ve durum uzayı modellerinden daha ifade edici hale getirir.
- Ölçeklenebilirlik: Modern Büyük Dil Modellerinden (LLMs) alınan teknikleri kullanarak, xLSTM milyarlarca parametreye ölçeklenebilir, dil modelleme ve dizin işleme görevlerinde yeni olanaklar açar.
Deneysel Değerlendirme: xLSTM’nin Yeteneklerini Gösterme
Araştırma makalesi, xLSTM’nin performansını çeşitli görevler ve benchmarklar boyunca gösteren kapsamlı bir deneysel değerlendirme sunar. İşte bazı ana bulgular:
- Sentetik Görevler ve Uzun Menzilli Arena:
- xLSTM, durum takibi gerektiren formal dil görevlerinde transformer, durum uzayı modelleri ve diğer tekrarlı sinir ağları mimarilerini geride bırakarak üstünlük gösterir.
- Çoklu Sorgu İlişkisel Geri Çağırma görevinde, xLSTM geliştirilmiş depolama kapasitelerini gösterir, transformer olmayan modelleri geride bırakır ve transformerlerin performansına yaklaşır.
- Uzun Menzilli Arena benchmarkında, xLSTM tutarlı güçlü performans gösterir, uzun bağlam sorunlarını işleme verimliliğini gösterir.
- Dil Modelleme ve Aşağı Akım Görevler:
- SlimPajama veri setinin 15B tokeninden eğitildiğinde, xLSTM, doğrulama karmaşıklığında mevcut yöntemleri, transformerleri, durum uzayı modellerini ve diğer tekrarlı sinir ağları varyantlarını geride bırakır.
- Modeller daha büyük boyutlara ölçeklendirildiğinde, xLSTM performans avantajını korur, olumlu ölçekleme davranışını gösterir.
- Aşağı akım görevlerde, zoals ortak akıl ve soru-cevap görevlerinde, xLSTM farklı model boyutlarında en iyi yöntem olarak ortaya çıkar, devlet-sanatlı yaklaşımları geride bırakır.
- PALOMA Dil Görevlerinde Performans:
- PALOMA dil benchmarkının 571 metin alanından değerlendirildiğinde, xLSTM[1:0] (sLSTM varyantı) Mamba’ya kıyasla %99,5’inde, Llama’ya kıyasla %85,1’inde ve RWKV-4’e kıyasla %99,8’inde daha düşük karmaşıklığa ulaşır.
- Ölçekleme Yasaları ve Uzunluk Extrapolasyonu:
- SlimPajama’dan 300B tokenle eğitildiğinde, xLSTM olumlu ölçekleme yasalarını gösterir, model boyutunun artmasıyla performansın daha da artabileceğini belirtir.
- Dizin uzunluğu extrapolasyonu deneylerinde, xLSTM modelleri, eğitim sırasında görülenlerden önemli ölçüde daha uzun bağlamlarda düşük karmaşıklık değerlerini korur, diğer yöntemleri geride bırakır.
Bu deneysel sonuçlar, xLSTM’nin etkileyici yeteneklerini vurgular, dil modelleme, dizin işleme ve daha geniş bir uygulama yelpazesi için umut verici bir aday olarak konumlandırır.
Gerçek Dünya Uygulamaları ve Gelecek Yönelimleri
xLSTM’nin potansiyel uygulamaları, doğal dil işlemeden ve metin oluşturmaya, dizin modellemesinden ve zaman serisi analizine kadar geniş bir yelpazeye yayılır. İşte xLSTM’nin önemli bir etkiye sahip olabileceği bazı heyecan verici alanlar:
- Dil Modelleme ve Metin Oluşturma: Geliştirilmiş depolama kapasiteleri ve depolanan bilgileri güncelleyebilme yetenekleriyle, xLSTM dil modelleme ve metin oluşturma görevlerinde devrim yaratabilir, daha tutarlı, bağlamsal ve akıcı metin oluşturmayı sağlar.
- Makine Çevirisi: xLSTM’nin durum takibi yetenekleri, makine çevirisi görevlerinde kritik öneme sahip olabilir, özellikle uzun menzilli bağımlılıkları ve bağlamı anlamak için.
- Konuşma Tanıma ve Oluşturma: xLSTM’nin paralelleştirme ve ölçeklenebilirlik özellikleri, konuşma tanıma ve oluşturma uygulamalarında verimli işlemeyi sağlar, uzun dizilerin işlenmesini gerektirir.
- Zaman Serisi Analizi ve Tahmini: xLSTM’nin uzun menzilli bağımlılıkları ve karmaşık desenleri işleme yetenekleri, zaman serisi analizi ve tahmini görevlerinde önemli gelişmelere yol açabilir, özellikle finans, hava tahmini ve endüstriyel uygulamalar gibi alanlarda.
- Pekiştirme Öğrenimi ve Kontrol Sistemleri: xLSTM’nin geliştirilmiş hafıza yetenekleri ve durum takibi, pekiştirme öğrenimi ve kontrol sistemlerinde daha akıllı karar alma ve kontrolü sağlayabilir, karmaşık ortamlarda.
Mimari Optimizasyonlar ve Hiperparametre Ayarları
Mevcut sonuçlar umut verici olsa da, xLSTM mimarisini optimize etmek ve hiperparametrelerini ayarlamak için hala alan vardır. Araştırmacılar, sLSTM ve mLSTM bloklarının farklı kombinasyonlarını, oranlarını ve yerleştirilmelerini araştırmaya devam edebilir. Ayrıca, sistematik bir hiperparametre araması, özellikle daha büyük modeller için daha fazla performans gelişmesine yol açabilir.
Donanım-Aware Optimizasyonlar: xLSTM’nin, özellikle mLSTM varyantının, paralelleştirme yeteneklerini tam olarak kullanmak için, araştırmacılar belirli GPU mimarileri veya diğer hızlandırıcılar için optimize edilmiş donanım-aware optimizasyonları araştırabilir. Bu, CUDA çekirdeklerinin optimizasyonu, bellek yönetimi stratejileri ve özel talimatlar veya matris işlemleri için kütüphanelerin kullanılmasıyla ilgili olabilir.
Diğer Sinir Ağları Bileşenleriyle Entegrasyon: xLSTM’yi diğer sinir ağları bileşenleriyle, zoals dikkat mekanizmaları, konvolüsyonlar veya öz-eğitim teknikleriyle entegre etmek, hibrit mimarilerin geliştirilmesine yol açabilir. Bu hibrit modeller, farklı yaklaşımların güçlü yönlerini birleştirebilir ve daha geniş bir görev yelpazesi üzerinde daha iyi performans gösterebilir.
Az-Örnek ve Transfer Öğrenimi: xLSTM’yi az-örnek ve transfer öğrenimi senaryolarında kullanmak, gelecekteki araştırmalar için heyecan verici bir alan olabilir. xLSTM’nin geliştirilmiş hafıza yetenekleri ve durum takibi, sınırlı eğitim verisi ile hızlı ve etkili bir şekilde yeni görevlere ve alanlara adapte olma yeteneği sağlayabilir.
Yorumlanabilirlik ve Açıklanabilirlik: xLSTM gibi birçok derin öğrenme modelinde olduğu gibi, iç işleyişleri şeffaf ve anlaşılabilir değildir. xLSTM’nin kararlarını yorumlama ve açıklama teknikleri geliştirmek, daha şeffaf ve güvenilir modellerin geliştirilmesine katkıda bulunabilir, özellikle kritik uygulamalarda.
Verimli ve Ölçeklenebilir Eğitim Stratejileri: Modeller büyüdükçe ve daha karmaşık hale geldikçe, verimli ve ölçeklenebilir eğitim stratejileri giderek daha önemli hale gelir. Araştırmacılar, model paralelliği, veri paralelliği ve xLSTM mimarileri için özel olarak tasarlanmış dağıtılmış eğitim yaklaşımları gibi teknikleri araştırabilir, daha büyük modellerin eğitilmesini sağlar ve hesaplama maliyetlerini potansiyel olarak azaltabilir.
Bu, xLSTM ile gelecekteki araştırmalar için bazı potansiyel yönler ve alanlardır.
Sonuç
xLSTM’nin tanıtılması, dil modelleme ve dizin işleme mimarilerinin geliştirilmesinde önemli bir kilometre taşıdır. Geleneksel LSTMs’in sınırlılıklarını, üssü gating ve matris hafızası gibi yenilikçi tekniklerle aşarak, xLSTM etkileyici performans göstermiştir. Ancak, bu yolculuk burada bitmez. xLSTM, gerçek dünya uygulamalarında ve gelecekteki araştırmalarda daha da heyecan verici gelişmelere yol açma potansiyeline sahiptir.
Araştırmacılar, xLSTM’nin sınırlarını daha da genişletmeye devam ettikçe, doğal dil işleme ve yapay zeka alanlarında daha da etkileyici ilerlemeler görmek için sabırsızlanıyoruz.
















