Yapay zeka temelleri

Derin Öğrenmede RNN’ler ve LSTM’ler Nedir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Tekrarlayan sinir ağları (RNN’ler) zaman içinde bir gizli durumu güncelleyerek dizileri işler. Uzun kısa vadeli bellek (LSTM) ağları, temel bir tekrarlayan birimden daha etkili bilgi koruma ve kontrolü sağlamak için tasarlanmış kapılı RNN’lerdir.

RNN’ler ve LSTM’ler bir zamanlar birçok dil görevinde hâkimken, modern büyük sohbet botları öncelikle transformer’lara dayanmaktadır. Tekrarlayan modeller, artımlı durum ve düşük gecikmenin önemli olduğu akış, zaman serileri, konuşma, kontrol ve kaynak kısıtlı sistemler için hâlâ faydalıdır.

Temel Çıkarımlar

  • Bir RNN, her dizi adımında aynı parametreleri yeniden kullanır ve gizli bir durumu ileri taşır.
  • Zaman içinde eğitim, kaybolan veya patlayan gradyanlara yol açabilir.
  • Bir LSTM, hücre durumu ile giriş, unutma ve çıkış kapılarını ekler.
  • Transformer’lar uzun menzilli ilişkileri ve paralel eğitimi farklı şekilde işler; hiçbir mimari her dağıtım için en iyi değildir.
Unrolled recurrent neural network beside an LSTM cell showing input, forget, and output gates, plus a comparison with parallel transformer attention
RNN’ler durumu sıralı olarak taşır; LSTM’ler bu durumu kapılarla düzenler, transformer’lar ise konumları dikkat mekanizmasıyla bağlar.

Basit bir RNN nasıl çalışır

t adımında, basit bir tekrarlayan birim mevcut girdi xₜ‘yi önceki gizli durum hₜ₋₁ ile birleştirir:

hₜ = activation(Wₓxₜ + Wₕhₜ₋₁ + b)

Gizli durum, bir sonraki adım için kullanılan öğrenilmiş bir özet ve göreve bağlı olarak bir çıktıdır. “Açılmış” bir diyagram, her zaman adımı için bir kopya çizer, ancak tüm kopyalar parametreleri paylaşır. Çıktı, yeni ham girdi olarak basitçe kopyalanmaz; yineleme, gizli durumu tanımlı bir dönüşüm aracılığıyla geçirir.

Zaman içinde geri yayılım

RNN’ler zaman içinde geri yayılım (BPTT) ile eğitilir. Açılmış dizi, derin bir hesaplama grafiği oluşturur ve geri yayılım, kaybın paylaşılan tekrarlayan parametrelere nasıl bağlı olduğunu hesaplar.

Tekrarlanan çarpma, gradyanların sıfıra doğru küçülmesine veya sınırsız büyümesine neden olabilir. Kaybolan gradyanlar uzun bağımlılıkların öğrenmesini engeller; patlayan gradyanlar ise istikrarsız güncellemeler yaratır. Gradyan kırpma, patlayan gradyanları kontrol eder, kapı mekanizmaları, başlatma, normalleştirme ve daha kısa eğitim pencereleri ise yardımcı olabilir.

Bir LSTM hücresinin içinde

Bir LSTM, gizli durum hₜ yanı sıra bir hücre durumu cₜ tutar. Kapıları, veri bağımlı öğrenilmiş kontrol mekanizmalarıdır:

  • Unutma kapısı, önceki hücre durumunun ne kadarının korunacağını kontrol eder.
  • Giriş kapısı, aday bilginin ne kadarının yazılacağını kontrol eder.
  • Çıkış kapısı, hücre bilgisinin gizli duruma ne kadar katkıda bulunacağını kontrol eder.

Sıfır ile bir arasında çıkan sigmoid değerleri yumuşak kapı görevi görürken, tanh dönüşümü uygulanmış aday yeni içerik sağlar. Toplamalı hücre-durumu yolu, gradyanların devam etmesine yardımcı olur, ancak LSTM’ler sınırsız bellek garantilemez ve tüm optimizasyon sorunlarını ortadan kaldırmaz.

GRU’lar ve çift yönlü yineleme

Kapılı bir tekrarlayan birim (GRU), kapı mekanizmalarını ayrı bir LSTM benzeri hücre durumu olmadan daha basit bir tekrarlayan hücrede birleştirir. GRU’lar daha hızlı eğitilebilir ve bazı görevlerde benzer performans gösterir.

Çift yönlü bir RNN, tamamlanmış bir diziyi her iki yönde işler ve durumları birleştirir. Gelecek bağlamı etiketleme veya kodlama için kullanabilir, ancak gelecekteki girdiler henüz mevcut olmadığında nedensel akış için uygun değildir.

Diziden-diziye modeller

Kodlayıcı-çözücü RNN’ler bir diziyi diğerine eşler. Dikkat mekanizması, bir çözücünün tek bir sabit vektöre dayanmak yerine farklı kodlayıcı durumlarına başvurmasını sağlamak için tanıtıldı. Bu çalışma, yinelemeyi dikkat tabanlı bloklarla değiştiren transformer mimarisine yol açtı.

RNN’ler ve transformer’lar karşılaştırması

Transformer’lar eğitim konumlarını paralel olarak işler ve uzak tokenlar arasında kısa dikkat yolları oluşturur. RNN’ler durumu sıralı olarak işler, paralelliği sınırlar ancak akış sırasında sabit boyutlu bir tekrarlayan durum sunar. Transformer çıkarımı, artan bir anahtar-değer önbelleği gerektirebilir; RNN ise geçmişi gizli durumuna sıkıştırır ve detay kaybına yol açabilir.

Seçim, dizi uzunluğu, veri ölçeği, donanım, gecikme, bellek ve görevin çevrim dışı mı yoksa akış mı olduğuna göre yapılmalıdır. Hibrit ve durum-uzayı mimarileri ek ticaret-offlar sunar.

Güncel kullanım senaryoları

RNN’ler ve LSTM’ler tahmin, anomali tespiti, sensör işleme, konuşma bileşenleri, el yazısı, gömülü kontrol ve düşük gecikmeli dizi modellemesi için hâlâ önemlidir. Güncel büyük dil modelleri veya yapay zeka sohbet botları için varsayılan açıklama değildir.

Yineleme, kapılar ve dizi belleği

Tekrarlayan bir sinir ağı, mevcut girdi ile önceki adımlardan taşınan gizli durumu birleştirerek bir diziyi işler. Paylaşılan ağırlıklar değişken dizi uzunluğuna izin verir ve açma, zaman içinde eğitime yönelik hesaplamayı ortaya çıkarır. Temel RNN’ler zamansal bağımlılığı temsil edebilir ancak uzun dizilerde tekrarlanan gradyan çarpımları küçülür veya patlar. Kesilmiş geri yayılım bellek ve hesaplamayı sınırlar, gradyan kırpma ise aşırı güncellemeleri kontrol eder. Gizli durum, öğrenilmiş bir özet olup, her önceki tokenın tam bir depolaması değildir.

Uzun kısa vadeli bellek ağları, yazma, tutma ve bilgi ortaya çıkarmayı düzenleyen bir hücre durumu ve giriş, unutma, çıkış kapılarını ekler. Kapılı tekrarlayan birimler daha basit bir sıfırlama ve güncelleme yapısı kullanır. Çift yönlü varyantlar gelecekteki bağlamı kullandığından gecikmesiz nedensel akış yapamaz. Katmanlı, artıksal ve dikkat artırmalı tekrarlayan modeller kapasite ekler. Dolgu ve maskeler, yapay dizi öğelerinin durumu veya kaybı etkilemesini önlemeli, durum gerçek dizi sınırlarında sıfırlanarak örnekler arası sızıntı önlenmelidir.

Eğitim, karşılaştırma ve durumlu hizmet

RNN’ler ve LSTM’ler akış, cihaz içi kompakt modeller, zaman serileri ve sıralı durumun verimli olduğu iş yükleri için hâlâ faydalıdır. Transformer’lar eğitimi paralelleştirir ve uzun menzilli etkileşimleri farklı modelleyebilir ancak daha büyük bellek ve önbellek gerektirebilir. Mimariyi doğruluk, gecikme, verim, bellek, güç ve performans açısından dizi uzunluğu değiştikçe karşılaştırın. Tahmini, kayan zaman bölmeleriyle; dili, dizi‑farkındalık ölçütleriyle; anomali tespitini olay‑seviyesi ölçütlerle değerlendirin. Uzun boşluklar, rejim değişimleri, eksik örnekler ve ani dizi sınırlarından sonra hataları inceleyin.

Durumlu dağıtım, gizli durumu doğru oturumla ilişkilendirmeli, süresini sınırlamalı, hassas ise şifrelemeli ve hatalardan ya da model değişikliklerinden sonra sıfırlamalıdır. Sıra dışı veya yinelenen olaylar durumu bozabilir; zaman damgaları, dizi numaraları ve idempotans eklenmelidir. Durum yaşı, dizi uzunluğu, eksiklik, çıktı kayması ve gecikme izlenmelidir. Kuantizasyon, kapı‑duyarlı doğrulama gerektirir çünkü küçük sayısal değişiklikler zaman içinde birikebilir. RNN belleği bağlam sağlar, ancak özel ya da eski bilgiyi de koruyabilir; bu yüzden saklama ve kullanıcı kontrolleri tasarımda yer almalıdır.

Uygulamalı örnek: akış sensör dizileri için bir LSTM

Bir hizmet, son ölçümler, takvim ve hava durumundan kısa vadeli yük tahmini yapmak için bir LSTM kullanır. Diziler katı zaman sırasına göre oluşturulur; gizli durum besleyici sınırlarında sıfırlanır ve dolgu maskelenir. Mevsimsel‑naif ve gradyan‑artırmalı temel modeller, LSTM ile kayan pencerelerde karşılaştırılır. Testler eksik aralıklar, gecikmeli hava, tatiller, kesintiler ve tipik eğitimden daha uzun dizi uzunluklarını kapsar.

Akış hizmeti, durumu tek bir besleyiciyle ilişkilendirir, sıra dışı yinelenenleri reddeder ve uzun boşluklar ya da model güncellemelerinden sonra durumu sonlandırır. Sensörler ya da durum geçersiz olduğunda güvenli bir istatistiksel tahmin çıktı yerine geçer. Kuantize edilmiş çıkarım, birikmiş kayma için uzun dizilerde kontrol edilir. İzleme, durum yaşı, eksiklik, gecikme, yanlılık ve aralık hatasını takip eder. Model yalnızca şebeke değişikliklerinden sonra yeniden eğitilir ve incelenen sonuçlar, öğrenilen zamansal ilişkilerin artık genelleştirilemediğini gösterir.

Uygulama kanıtları ve operasyonel hazırlık

Bir üretim kararı, başarılı bir gösteriden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce yeniden üretilebilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, hatalı ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, yanlış kullanımı ve en çok hizmet alamayan grup ya da ortamları test edin. Görev kalitesini kalibrasyon ya da belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlikle birlikte ölçün. Her dönüşüm ve eşik kaydedilsin, böylece bağımsız bir gözden geçiren sonuçları yeniden üretebilir ve kanıtı çekici bir prototipten ayırabilir.

Başlamadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüş sağlayın ve kasıtlı olarak eklenen hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamayarak giriş kalitesini, çıktı davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve onaylanmış sonuçları ortaya koymalıdır. Uyarı eşiklerini ve bir yanıt sorumlusunu tanımlayın, ardından dağıtımdan sonra gerçek dünya kanıtını gözden geçirin; çevrim dışı performansın devam edeceği varsayımından kaçının. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım ya da hedefler değiştiğinde yeniden değerlendirin. Bakımı yapılan bir sistem, belgelenmiş kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gereken net bir nokta da gerektirir.

Sıkça Sorulan Sorular

Bir LSTM her zaman temel bir RNN’den daha iyi midir?

Hayır. Kapı mekanizmaları birçok uzun bağımlılık sorununa yardımcı olur ancak hesaplama ve parametre ekler. Temel bir RNN, kısa ve basit diziler için yeterli olabilir ve çok uzun bağlam için başka bir mimari daha uygun olabilir.

Bir LSTM sınırsız bir geçmişi işleyebilir mi?

Hayır. Durumu sınırlı bir kapasiteye sahiptir, gradyanlar ve eğitim verileri sınırlamalar getirir ve ilgili detaylar üzerine yazılabilir. Uzun bağlam performansı, mimarinin adı üzerinden çıkarım yapılmadan ölçülmelidir.

Temel Referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.