Yapay zeka modelleri ve platformları

DeepMind ve Google Brain, Peşış Güçlendirme Öğrenimi Verimliliğini Artırmak için Yöntemler Oluşturmayı Hedefliyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Peşış güçlendirme öğrenimi sistemleri, binlerce eğitim iterasyonu aracılığıyla son derece karmaşık görevleri gerçekleştirebilen güçlü ve sağlam sistemler olabilir. Peşış güçlendirme algoritmaları, sofistike ve bazen şaşırtıcı davranışlar gerçekleştirmeyi sağlayabilir, ancak eğitim için uzun bir süre gerekir ve大量 miktarda veri gerektirir. Bu faktörler, peşış güçlendirme tekniklerinin oldukça verimsiz olmasına neden olur ve yakın zamanda Alphabet’ (GOOG ) (GOOGL ) in DeepMind ve Google Brain’den araştırma ekipleri, peşış güçlendirme sistemlerinin oluşturulmasını daha verimli hale getirmek için yöntemler bulmaya çalıştılar.

VentureBeat tarafından bildirildiği üzere, birleşik araştırma grubu yakın zamanda peşış güçlendirme eğitiminin daha verimli hale getirilmesi için yöntemler önerdi. Önerilen geliştirmelerden biri, Adaptive Behavior Policy Sharing (ABPS) adlı bir algoritma iken, diğeri Universal Value Function Approximators (UVFA) adlı bir çerçevedir. ABPS, AI ajanlarının adaptif olarak seçilen deneyimlerini paylaşmasına izin verirken, UVFA, AI ajanlarının aynı anda yönlendirilmiş keşif politikalarını araştırmasına izin verir.

ABPS, bir modeli eğitirken hiperparametrelerin özelleştirilmesini hızlandırmak için tasarlanmıştır. ABPS, farklı hiperparametrelerle birden fazla ajanın davranış politikası deneyimlerini paylaşmasına izin vererek optimal hiperparametrelerin bulunmasını hızlandırır. Daha precisa olarak, ABPS, peşış güçlendirme ajanlarının bir politika tarafından kabul edilen eylemlerden eylem seçmesine izin verir ve ardından bir ödül ve gözlem verir.

AI güçlendirme ajanları, çeşitli hiperparametre kombinasyonlarıyla eğitilir, Örneğin, bozulma oranı ve öğrenme oranı. Bir modeli eğitirken, modelin en iyi performansı sağlayan hiperparametre kombinasyonuna ulaşması hedeflenir ve bu durumda da veri verimliliğini artıranlar. Verimlilik, birçok ajanı aynı anda eğitmek ve yalnızca bir ajanın davranışını bir sonraki zaman adımında uygulamak suretiyle artırılır. Hedef ajanın politikası, eylemleri örneklemek için kullanılır. Geçişler, paylaşılan bir alanda kaydedilir ve bu alan sürekli olarak değerlendirilir, böylece politika seçimi çok sık gerçekleşmez. Eğitim sonunda, ajanların bir topluluğu seçilir ve en iyi performans gösteren ajanlar nihai dağıtıma tabi tutulur.

UVFA ile ilgili olarak, peşış güçlendirme öğreniminin ortak bir sorununa, yani zayıf güçlendirilmiş ajanların görevleri öğrenmemesine çözüm bulmaya çalışır. UVFA, bu sorunu, ajanın aynı anda ayrı bir keşif ve sömürü politikaları kümesini öğrenerek çözmeye çalışır. Görevlerin ayrılması, keşif politikalarının çevreyi keşfetmeye devam etmesine izin veren bir çerçeve oluştururken, sömürü politikaları mevcut görev için ödülü en üst düzeye çıkarmaya çalışır. UVFA’nın keşif politikaları, doğal ödüller bulunmasa bile sürekli olarak gelişen bir temel mimari oluşturur. Böyle bir durumda, ajanın tüm durumları keşfetmesini sağlayan içsel ödülleri yaklaşık bir fonksiyon oluşturulur.

VentureBeat tarafından açıklananlara göre, UVFA çerçevesi devreye girdiğinde, sistemin içsel ödülleri doğrudan ajana girdi olarak verilir. Ajan, bir bölüm boyunca tüm girdilerin (örneğin ödüller, eylemler ve durumlar) bir temsilini tutar. Sonuç olarak, ödül zaman içinde korunur ve ajanın politikası her zaman buna göre biraz bilgilendirilir.

Bu, “bölüm yeniliği” ve “yaşam boyu yenilik” modüllerinin kullanılmasıyla gerçekleştirilir. İlk modülün işlevi, geçerli, bölümsel belleği tutmak ve önceki olarak belirtilen temsile geçerli bulguları haritalamak, böylece ajanın her eğitim adımında içsel bir bölümsel ödül belirlemesine izin vermektir. Daha sonra, geçerli gözlemle ilgili durum belleğe eklenir. Yaşam boyu yenilik modülü, ajanın birçok bölüm boyunca ne sıklıkla keşfedeceğini etkilemekle sorumludur.

Alphabet/Google ekiplerine göre, yeni eğitim teknikleri, bir peşış güçlendirme sistemi eğitirken önemli bir gelişme potansiyeli göstermiştir. UVFA, bazı temel ajanların performansını ikiye katlayabilmiştir. ABPS, bazı aynı Atari oyunlarında performansı artırabilmiş, en iyi performans gösteren ajanlar arasındaki varyansı yaklaşık %25 oranında azaltmıştır. UVFA eğitimi algoritması, insan demosunun mühendislik özelliklerine sahip olmadan Pitfall’de yüksek bir puan elde edebilmiştir.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.