Yapay zeka temelleri
Derin Takviye Öğrenimi Nedir?
Derin Takviye Öğrenimi Nedir?
Gözetimsiz makine öğrenimi ve denetimli öğrenimin yanı sıra, bir diğer yaygın yapay zeka oluşturma şekli de takviye öğrenimidir. Normal takviye öğreniminin ötesinde, derin takviye öğrenimi derin öğrenme ve takviye öğreniminin en iyi yönlerini birleştirdiği için gerçekten etkileyici sonuçlara yol açabilir. Derin takviye öğrenimi nasıl çalıştığını inceleyelim.
Derin takviye öğrenimine dalmadan önce, normal takviye öğrenimi nasıl çalıştığını hatırlamak iyi olabilir. Takviye öğreniminde, hedefe yönelik algoritmalar, en iyi sonucu elde eden eylem için optimize edilmiş bir dizi deneme yanılma işlemiyle tasarlanır. Takviye öğrenimi algoritmaları eğitilirken, gelecekte hangi eylemleri yapacaklarını etkileyen “ödüller” veya “cezalar” verilir. Algoritmalar, sisteme en çok ödül sağlayan eylem kümesini bulmaya çalışırlar, hem anlık hem de gelecekteki ödülleri dengeleyerek.
Takviye öğrenimi algoritmaları çok güçlüdür çünkü几乎 her görev için uygulanabilirler ve bir ortamdan esnek ve dinamik olarak öğrenerek olası eylemleri keşfedebilirler.
Derin Takviye Öğreniminin Genel Bakışı

Foto: Megajuice via Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)
Derin takviye öğreniminde, ortam genellikle görüntülerle temsil edilir. Bir görüntü, belirli bir zamanda ortamın bir anlık görüntüsüdür. Ajan, görüntüleri analiz etmek ve onlardan ilgili bilgileri çıkarmak zorundadır, bu bilgileri hangi eylemi gerçekleştireceğine karar vermesi için kullanır. Derin takviye öğrenimi genellikle iki farklı teknikle yapılır: değer temelli öğrenme ve politika temelli öğrenme.
Değer temelli öğrenme teknikleri, convolutional neural network’ler ve Deep-Q-Network’ler gibi algoritmalar ve mimariler kullanır. Bu algoritmalar, görüntüyü gri tonlara çevirir ve görüntünün gereksiz kısımlarını keser. Sonra, görüntü çeşitli konvolüsyonlar ve havuzlama işlemlerinden geçer, görüntünün en ilgili kısımlarını çıkarır. Görüntünün önemli kısımları, ajanta hangi eylemi gerçekleştireceğine karar vermesi için kullanılan Q-değerini hesaplamak için kullanılır. Q-değerleri, ajanta hangi eylemi gerçekleştireceğine karar vermesi için kullanılır. İlk Q-değerleri hesaplandıktan sonra, en doğru Q-değerlerini belirlemek için geri yayılım yapılır.
Politika temelli yöntemler, ajanta gerçekleştirebileceği eylem sayısı çok yüksek olduğunda kullanılır, bu genellikle gerçek dünya senaryolarında görülür. Bu gibi durumlar, her bir eylemin Q-değerini hesaplamanın pratik olmadığı için farklı bir yaklaşım gerektirir. Politika temelli yaklaşımlar, bireysel eylemler için fonksiyon değerlerini hesaplamadan, doğrudan politika öğrenerek çalışır, genellikle Politika Gradyanları gibi teknikler kullanılarak.
Politika gradyanları, ajanta önceki deneyimlerine dayanarak eylemler için olasılıklar hesaplar. En olası eylem seçilir. Bu işlem, değerlendirme süresinin sonuna kadar tekrarlanır ve ajanta ödülleri verilir. Ödüller ajanta verildikten sonra, ağ parametreleri geri yayılım ile güncellenir.
Q-Öğrenimi Nedir?
Q-Öğrenimi derin takviye öğrenimi sürecinin önemli bir parçası olduğu için, Q-öğrenimi sisteminin nasıl çalıştığını anlamak için biraz zaman ayıralım.
Markov Karar Süreci

Markov karar süreci. Foto: waldoalvarez via Pixabay, Pixbay Lisansı (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)
Ajanta bir dizi görevi gerçekleştirmek ve bir hedefe ulaşmak için, ajanta bir dizi durum ve olayla başa çıkabilmesi gerekir. Ajanta bir durumdan başlar ve bir dizi eylem gerçekleştirmek zorundadır, başlangıç ve bitiş durumları arasında çok fazla durum olabilir. Her durum hakkında bilgi depolamak pratik değildir veya imkansızdır, bu nedenle sistem sadece en ilgili durum bilgilerini saklamalıdır. Bu, yalnızca geçerli durum ve önceki durum hakkında bilgi saklayan Markov Karar Süreci kullanılarak gerçekleştirilir. Her durum, ajanta önceki durumdan geçerli duruma nasıl geçtiğini izleyen Markov özelliği taşır.
Derin Q-Öğrenimi
Model, öğrenme ortamının durumları hakkında bilgiye eriştiğinde, Q-değerleri hesaplanabilir. Q-değerleri, ajanta bir dizi eylemin sonunda verilen toplam ödüldür.
Q-değerleri, bir dizi ödülle hesaplanır. Bir anlık ödül, geçerli durum ve geçerli eylem temelinde hesaplanır. Ajanta sonraki durum için Q-değeri de hesaplanır, sonra da sonraki durum için Q-değeri hesaplanır, bu böylece tüm durumlar için Q-değerleri hesaplanana kadar devam eder. Ayrıca, ajanta eylemlerinin gelecekteki ödüllere olan etkisini kontrol etmek için kullanılan Gamma parametresi vardır. Politikalar genellikle, Q-değerlerinin en doğru değerlerine ulaşana kadar modelin yakınsamasını sağlayarak rastgele başlatılan Q-değerleriyle hesaplanır.
Derin Q-Ağları
Q-öğreniminin kullanılmasıyla ilgili temel sorunlardan biri, durum sayısı arttıkça gereken bellek miktarının hızla artmasıdır. Derin Q-Ağları, Q-değerlerini tahmin etmek için sinir ağları modellerini kullanarak bu sorunu çözer, böylece ajanta deneyimlerinden öğrenerek ve en iyi eylemleri hakkında makul tahminler yapabilir. Derin Q-öğreniminde, Q-değer fonksiyonları sinir ağları ile tahmin edilir. Sinir ağı, durumları girdi olarak alır ve ajanta gerçekleştirebileceği tüm olası eylemler için Q-değerlerini çıktı olarak verir.
Derin Q-öğrenimi, tüm geçmiş deneyimleri bellekte saklayarak, Q-ağının maksimum çıkışlarını hesaplayarak ve sonra mevcut değerler ile teorik en yüksek olası değerler arasındaki farkı hesaplamak için bir loss fonksiyonu kullanarak gerçekleştirilir.
Derin Takviye Öğrenimi ve Derin Öğrenimin Karşılaştırması
Derin takviye öğrenimi ile geleneksel derin öğrenimin önemli bir farkı, formerde girdilerin sürekli değişmesidir, bu geleneksel derin öğrenimde görülmez. Öğrenme modeli, sürekli değişen girdiler ve çıktılar için nasıl hesaplanabilir?
Aslında,预测 değerler ile hedef değerler arasındaki sapmayı hesaba katmak için iki sinir ağı kullanılabilir. Bir ağ, hedef değerleri tahmin ederken, diğer ağ tahminler için sorumludur. Hedef ağının parametreleri, model öğrenirken güncellenir, ancak belirli bir sayıda eğitim iterasyonu之后. Ağların çıktıları, farkı belirlemek için birleştirilir.
Politika Temelli Öğrenim
Politika temelli öğrenim yaklaşımları, Q-değerine dayalı yaklaşımlardan farklı çalışır. Q-değerine dayalı yaklaşımlar, durumlar ve eylemler için ödülü tahmin eden bir değer fonksiyonu oluştururken, politika temelli yöntemler durumları eylemlere eşleyen bir politika belirler. Diğer bir deyişle, politika fonksiyonu doğrudan optimize edilir, değer fonksiyonuna bakılmaz.
Politika Gradyanları
Derin takviye öğreniminde bir politika, iki kategoriye girer: stokastik veya deterministik. Bir deterministik politika, durumları eylemlere eşler, yani politika bir durum hakkında bilgi aldığında bir eylem döndürür. Öte yandan, stokastik politikalar tek bir eylem yerine eylem olasılık dağılımı döndürür.
Deterministik politikalar, eylemlerin sonuçları hakkında hiçbir belirsizlik olmadığı durumlarda kullanılır, yani ortam deterministiktir. Buna karşılık, stokastik politika çıktıları, eylemlerin sonuçları belirsiz olduğunda uygun olan ortamlar için kullanılır. Tipik olarak, takviye öğrenimi senaryoları bazı belirsizlikler içerir, bu nedenle stokastik politikalar kullanılır.
Politika gradyanı yaklaşımları, Q-öğrenimi yaklaşımlarına göre beberapa avantaj ve dezavantajlara sahiptir. Avantajlar olarak, politika temelli yöntemler optimal parametreleri daha hızlı ve güvenilir bir şekilde yakalar. Politika gradyanı sadece en iyi parametreleri belirlemek için takip edilir, oysa değer temelli yöntemlerde küçük estimated eylem değerlerindeki değişiklikler, eylemler ve ilgili parametrelerde büyük değişikliklere yol açabilir.
Politika gradyanları, yüksek boyutlu eylem uzaylarında daha iyi çalışır. Eylem sayısı çok yüksek olduğunda, derin Q-öğrenimi pratik değildir, çünkü her eylem için tüm zaman adımları boyunca bir puan atanmalıdır, bu da hesaplamalı olarak imkansız olabilir. Ancak politika temelli yöntemlerle, parametreler zaman içinde ayarlanır ve model yakınsadıktan sonra en iyi parametrelerin sayısı hızla azalır.
Politika gradyanları ayrıca stokastik politikaları uygulayabilir, değer temelli politikaların aksine. Stokastik politikalar bir eylem olasılık dağılımı ürettiğinden, keşif ve sömürü arasındaki ticaret-off uygulanmasına gerek yoktur.
Politika gradyanlarının dezavantajı, optimal parametreleri ararken dar bir yerel optimum değerlerine takılabilmeleridir, küresel optimum değerlerine ulaşmak yerine.
Politika Puan Fonksiyonu
Model performansı için optimize edilen politikalar, bir puan fonksiyonunu maximize etmeye çalışırlar – J(θ). Eğer J(θ) politikamızın hedefi gerçekleştirmek için ne kadar iyi olduğunu ölçen bir değer ise, en iyi politika için θ değerlerini bulabiliriz. İlk olarak, beklenen politika ödülünü hesaplamamız gerekir. Politika ödülünü tahmin ederiz, böylece optimize edecek bir hedefimiz olur. Politika Puan Fonksiyonu, beklenen politika ödülünü hesaplamak için kullanılır ve genellikle kullanılan fonksiyonlar arasında başlangıç değerleri için episodik ortamlar, sürekli ortamlar için ortalama değer ve ortalama ödül per zaman adımı bulunur.
Politika Gradyanı Çıkışı</strong













