Yapay zeka temelleri

Pekiştirmeli Öğrenme Nedir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Pekiştirmeli Öğrenme Nedir?

Basitçe söylemek gerekirse, pekiştirmeli öğrenme, bir yapay zeka aracını tekrar eden eylemler ve bunlarla ilgili ödüller yoluyla eğiten bir makine öğrenimi tekniğidir. Bir pekiştirmeli öğrenme aracı, bir ortamda dener, eylemler gerçekleştirir ve doğru eylemler gerçekleştirildiğinde ödüllendirilir. Zamanla, aracı, ödülünü en üst düzeye çıkarmak için eylemleri öğrenir. Bu, pekiştirmeli öğrenmenin kısa bir tanımlamasıdır, ancak pekiştirmeli öğrenmenin arkasındaki kavramlara daha yakından bakmak, size daha iyi ve daha sezgisel bir anlayış sağlayacaktır.

Pekiştirmeli öğrenme terimi, psikolojideki pekiştirme kavramından uyarlanmıştır. Bu nedenle, psikolojik anlamda pekiştirmenin ne anlama geldiğini anlamak için bir dakika durup psikolojik pekiştirme kavramını anlamaya çalışalım. Psikolojik anlamda pekiştirme, belirli bir yanıtın veya eylemin olasılığını artıran bir şey anlamına gelir. Bu pekiştirme kavramı, operant koşullanma teorisinin merkezi bir fikridir ve ilk olarak psikolog B.F. Skinner tarafından önerilmiştir. Bu bağlamda, pekiştirme, belirli bir davranışın sıklığını artıran her şeydir. İnsanlarda olası pekiştirmeler, övgü, işyerinde terfi, şeker, eğlenceli faaliyetler gibi şeyler olabilir.

Geleneksel, psikolojik anlamda iki tür pekiştirme vardır. Bunlar pozitif pekiştirme ve negatif pekiştirmedir. Pozitif pekiştirme, bir davranışı artırmak için bir şey eklemeyi içerir, örneğin köpeğinize iyi davranışlarından dolayı bir ödül vermek gibi. Negatif pekiştirme, bir davranışı ortaya çıkarmak için bir uyaranı ortadan kaldırmayı içerir, örneğin bir kedinin çıkmasını sağlamak için yüksek sesli gürültüleri kapatmak gibi.

Pozitif ve Negatif Pekiştirme

Pozitif pekiştirme, bir davranışı artırırken, negatif pekiştirme, bir davranışı azaltır. Genel olarak, pekiştirmeli öğrenmede en çok kullanılan pekiştirme türü, bir görevin performansını en üst düzeye çıkarmaya yardımcı olan pozitif pekiştirmedir. Ayrıca, pozitif pekiştirme, modellerin daha sürdürülebilir değişikliklere yol açmasını sağlar, bu değişiklikler kalıcı kalıplar haline gelebilir ve uzun süreler boyunca devam edebilir.

Öte yandan, negatif pekiştirme de bir davranışı daha olası hale getirse de, bir modelin maksimum performansına ulaşması için değil, minimum performans standardını koruması için kullanılır. Pekiştirmeli öğrenmede negatif pekiştirme, istenmeyen eylemlerden kaçınmak için yardımcı olabilir, ancak bir modelin arzulanan eylemleri keşfetmesine yardımcı olamaz.

Pekiştirmeli Öğrenme Aracının Eğitimi

Bir pekiştirmeli öğrenme aracını eğittiğinizde, dört farklı bileşen veya durumlar eğitimde kullanılır: ilk durumlar (Durum 0), yeni durum (Durum 1), eylemler ve ödüller.

Örneğin, bir platform oyununda AI’nın amacı ekranın sağ ucuna ulaşmak olsun ve bu oyunu oynamak için bir pekiştirmeli öğrenme aracını eğitiyoruz. Oyunun ilk durumu, ortamdan elde edilir, yani oyunun ilk karesi analiz edilir ve modele verilir. Bu bilgiye dayanarak, model bir eylem belirlemelidir.

Eğitimın ilk aşamalarında, bu eylemler rastgeledir, ancak model pekiştirildikçe, belirli eylemler daha sık hale gelir. Eylem gerçekleştirildikten sonra, oyun ortamı güncellenir ve yeni bir durum veya kare oluşturulur. Aracın gerçekleştirdiği eylem, arzulanan bir sonuç ürettiyse, örneğin bu durumda aracın hala hayatta olması ve bir düşman tarafından vurulmaması gibi, aracına bir ödül verilir ve gelecekte aynı eylemi gerçekleştirmesi daha olası hale gelir.

Bu temel sistem sürekli olarak tekrarlanır ve her defasında, aracı biraz daha fazla öğrenir ve ödülünü en üst düzeye çıkarmaya çalışır.

Epizodik ve Sürekli Görevler

Pekiştirmeli öğrenme görevleri genellikle iki farklı kategoriye yerleştirilebilir: epizodik görevler ve sürekli görevler.

Epizodik görevler, öğrenme / eğitim döngüsünü gerçekleştirir ve bir son koşulu karşılandığında eğitim sonlandırılır. Bir oyunda bu, seviyenin sonuna ulaşmak veya bir tehlike gibi çivilere düşmek olabilir. Sürekli görevler ise sonlandırma koşulu yoktur ve mühendis eğitimı sonlandırana kadar sürekli olarak eğitim yapar.

Monte Carlo ve Zaman Farkı

Bir pekiştirmeli öğrenme aracını eğitmek veya öğretmek için iki temel yol vardır. Monte Carlo yaklaşımında, ödüller yalnızca eğitim epizodunun sonunda aracına verilir (skor güncellenir). Başka bir deyişle, sonlandırma koşulu karşılandığında model, performansının ne kadar iyi olduğunu öğrenir. Bu bilgiyi kullanarak, güncelleme yapabilir ve bir sonraki eğitim turunda buna göre tepki verebilir.

Zaman farkı yöntemi, Monte Carlo yönteminden farklı olarak, değer tahmini veya skor tahmini, eğitim epizodunun sırasında güncellenir. Model bir sonraki zaman adımına ilerlediğinde, değerler güncellenir.

Keşif ve İstismar

Pekiştirmeli öğrenme aracını eğitmek, keşif ve istismar arasında bir dengeleme işlemini içerir.

Keşif, çevreyi daha fazla bilgi toplamak için yapılan eylemlerdir, mentre istismar, zaten bilinen bilgileri kullanarak ödül puanları kazanmaktır. Bir aracı sadece keşif yapar ve asla istismar etmezse, arzulanan eylemler asla gerçekleştirilmez. Öte yandan, bir aracı sadece istismar eder ve asla keşif yapmazsa, aracı yalnızca bir eylem gerçekleştirmeyi öğrenir ve diğer olası ödül kazanma stratejilerini keşfedemez. Bu nedenle, keşif ve istismar arasında dengeleme, bir pekiştirmeli öğrenme aracını yaratırken çok önemlidir.

Pekiştirmeli Öğrenmenin Kullanım Alanları

Pekiştirmeli öğrenme, çeşitli rollerde kullanılabilecek ve otomasyon gerektiren uygulamalar için en uygun olan bir tekniktir.

Endüstriyel robotların görevlerini otomasyona yardımcı olmak için pekiştirmeli öğrenme kullanılabilir. Pekiştirmeli öğrenme, uzun metinleri özetleyen modeller oluşturmak için metin madenciliği sorunlarında da kullanılabilir. Araştırmacılar, pekiştirmeli öğrenmeyi sağlık alanında, tedavi politikalarının optimizasyonunu gerçekleştiren pekiştirmeli öğrenme aracı görevlerini ele almak için de deniyorlar. Pekiştirmeli öğrenme, öğrenciler için eğitim materyallerini kişiselleştirmek için de kullanılabilir.

Pekiştirmeli Öğrenmenin Özeti

Pekiştirmeli öğrenme, etkileyici ve bazen şaşırtıcı sonuçlar elde edebilen güçlü bir yapay zeka aracı oluşturma yöntemidir. Bir aracıyı pekiştirmeli öğrenme yoluyla eğitmek karmaşık ve zor olabilir, çünkü birçok eğitim iterasyonu ve keşif / istismar dikotomisinin nazik bir dengesi gerektirir. Ancak başarılı olursa, pekiştirmeli öğrenme ile oluşturulan bir aracı, çok çeşitli farklı ortamlarda karmaşık görevleri gerçekleştirebilir.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.