Yapay zeka temelleri
Derin Öğrenmede RNN’ler ve LSTMs Nedir?
Doğal dil işleme ve AI sohbet botlarında birçok etkileyici ilerleme, Tekrarlayan Sinir Ağları (RNN’ler) ve Uzun Kısa Süreli Hafıza (LSTM) ağları tarafından yönlendirilir. RNN’ler ve LSTMs, sıralı verileri işleyebilen özel sinir ağı mimarileridir. LSTMs, daha uzun veri dizilerini yorumlayabilen RNN’lerin geliştirilmiş sürümleridir. RNN’ler ve LSTMs’nin nasıl yapılandırıldığını ve nasıl gelişmiş doğal dil işleme sistemlerinin oluşturulmasını sağlayan bir göz atalım.
İleri Beslemeli Sinir Ağları Nedir?
LSTM ve Konvolüsyonel Sinir Ağları (CNN’ler) nasıl çalıştığından önce, genel olarak bir sinir ağı formatını tartışalım.
Bir sinir ağı, verileri incelemek ve ilgili kalıpları öğrenmek nhằm bu kalıpların yeni verilere uygulanması ve yeni verilerin sınıflandırılması için tasarlanmıştır. Sinir ağları üç bölüme ayrılmıştır: girdi katmanı, gizli katman (veya birden fazla gizli katman) ve çıktı katmanı.
Girdi katmanı, sinir ağına veri girişini sağlar, mentre gizli katmanlar, verilerin kalıplarını öğrenir. Gizli katmanlar, girdi ve çıktı katmanlarına “ağırlıklar” ve “önyargılar” ile bağlanır, bunlar veri noktaları arasındaki ilişkilerin varsayımlarıdır. Bu ağırlıklar eğitim sırasında ayarlanır. Ağ eğitilirken, modelin eğitim verilerine ilişkin tahminleri (çıktı değerleri) gerçek eğitim etiketleriyle karşılaştırılır. Eğitim sürecinde, ağın veri noktaları arasındaki ilişkileri öngörme yeteneği artmalıdır, böylece yeni veri noktalarını doğru bir şekilde sınıflandırabilir. Derin sinir ağları, ortada daha fazla katmana sahip ağlardır. Modelin daha fazla gizli katman ve nöronu/neuronu ne kadar fazla olursa, verilerin kalıplarını o kadar iyi tanıyabilir.
Tekrarlayan Sinir Ağları (RNN’ler) Nedir?

Tekrarlayan Sinir Ağları, sıralı verileri işleyebilme yeteneği kazandırmak için ileri beslemeli sinir ağlarının genel prensibini kullanır. RNN’lerin “Tekrarlayan” kısmı, girdi ve çıktıların döngüsel doğasından gelir. Bir kez ağın çıktısı üretildikten sonra, çıktı kopyalanır ve ağa girdi olarak geri verilir. Bir karar verirken, yalnızca geçerli girdi ve çıktı değil, önceki girdi de dikkate alınır. Başka bir deyişle, ağın ilk girdisi X ve çıktısı H ise, hem H hem de X1 (veri dizisindeki sonraki girdi), ağın bir sonraki öğrenme turu için girdi olarak verilir. Bu şekilde, ağ eğitilirken veri bağlamı (önceki girdiler) korunur.
Bu mimarinin sonucu, RNN’lerin sıralı verileri işleyebilmesidir. Ancak RNN’ler beberapa sorunla karşılaşır. RNN’ler, kaybolan gradyan ve patlayan gradyan sorunlarından muzdariptir.
Uzun Kısa Süreli Hafıza (LSTM) Ağları Nedir?
Uzun Kısa Süreli Hafıza ağları, RNN’lerin geliştirilmiş sürümleri olarak düşünülebilir. LSTMs, girdilerin bağlamını koruma kavramını uygular, ancak LSTMs, daha uzun veri dizilerini yorumlayabilen beberapa önemli değişiklik içerir. LSTMs’deki değişiklikler, kaybolan gradyan sorununu ele alır ve LSTMs’nin çok daha uzun girdi dizilerini dikkate almasına olanak tanır.

LSTM modelleri, üç farklı bileşenden oluşur: girdi kapısı, çıktı kapısı ve unutturma kapısı. Hem RNN’ler gibi, LSTMs de önceki zaman adımlarından girdileri dikkate alırken modelin hafızasını ve girdi ağırlıklarını değiştirir. Girdi kapısı, hangi değerlerin önemli olduğu ve modele geçirilmesi gerektiği hakkında kararlar verir. Girdi kapısında, bir sigmoid fonksiyonu kullanılır, bu da hangi değerlerin geçirilmesi gerektiğine ilişkin kararlar verir. 0 değeri, değerlerin düşürülmesini sağlar, 1 ise değerlerin korunmasını sağlar. Burada ayrıca, girdi değerlerinin model için ne kadar önemli olduğuna karar veren bir TanH fonksiyonu kullanılır, bu da -1 ile 1 arasında bir değer aralığına sahiptir.
Mevcut girdiler ve hafıza durumu hesaba alındıktan sonra, çıktı kapısı, hangi değerlerin bir sonraki zaman adımına geçirilmesi gerektiğine karar verir. Çıktı kapısında, değerler analiz edilir ve -1 ile 1 arasında bir önem derecesi atanır. Bu, verilerin bir sonraki zaman adımına taşınmadan önce düzenlenmesini sağlar. Son olarak, unutturma kapısının görevi, modelin karar verme sürecinde gerekli olmayan bilgileri düşürmektir. Unutturma kapısında, değerlere sigmoid fonksiyonu uygulanır, bu da 0 (unut) ve 1 (koru) arasında değerler üretir.
Bir LSTM sinir ağı, özel LSTM katmanlarından oluşur, bu katmanlar sıralı kelime verilerini yorumlayabilir, ve yukarıda tanımlanan gibi yoğun olarak bağlı katmanlardan oluşur. Veri, LSTM katmanlarından geçtikten sonra, yoğun olarak bağlı katmanlara ilerler.












