Yapay zeka modelleri ve platformları
DeepMind, Güvenli Bir Şekilde Takviye Öğrenimi AI’sini Eğitmek İçin Yeni Bir Yöntem Raporladı
Takviye öğrenimi, son derece karmaşık görevleri çözebilen AI’lar üretebilen bir AI geliştirme alanı olarak umut verici bir yol sunuyor. Takviye AI algoritmaları, mobil robotik sistemleri ve otonom araçlar da dahil olmak üzere çeşitli uygulamaların oluşturulmasında kullanılıyor. Ancak, takviye AI’nin eğitildiği şekilde, bazen tuhaf ve beklenmedik davranışlar sergileyebiliyorlar. Bu davranışlar tehlikeli olabilir ve AI araştırmacıları bu sorunu “güvenli keşif” problemi olarak adlandırıyor, burada AI, güvenli olmayan durumların keşfinde takılabiliyor.
Google’ın AI araştırma laboratuvarı DeepMind, güvenli keşif problemiyle başa çıkmak ve takviye öğrenimi AI’sini daha güvenli bir şekilde eğitmek için yeni yöntemler öneren bir makale yayınladı. DeepMind’in önerdiği yöntem, ayrıca ödül hacking veya ödül kriterlerindeki boşlukları da düzeltiyor.
DeepMind’in yeni yöntemi, AI’nin güvenli olmayan davranışlara yol açabilecek durumlarla başa çıkması için iki farklı sistem içermektedir. DeepMind’in eğitim tekniğinde kullanılan bu iki model, bir generatif model ve bir ileri dinamik modeldir. Her iki model de, güvenlik uzmanları tarafından yapılan demonstrasyonlar ve tamamen rastgele araç traijektörleri gibi çeşitli verilerle eğitiliyor. Veriler, bir süpervizör tarafından belirli ödül değerleriyle etiketleniyor ve AI ajanı, en büyük ödüllü davranış kalıplarını öğreniyor. Güvenli olmayan durumlar da etiketlenmiş ve model, başarılı bir şekilde ödülleri ve güvenli olmayan durumları tahmin ettikten sonra, hedeflenen eylemleri gerçekleştirmek için dağıtılmış oluyor.
Araştırma ekibi, makalede, davranışları sıfırdan oluşturmanın, istenilen davranışları önermenin ve bu hipotetik senaryoların mümkün olduğunca bilgilendirici olmasının amaçlandığını açıklıyor. DeepMind ekibi, bu yaklaşımı ReQueST veya ödül sorgulama sentezi aracılığıyla yol optimizasyonu olarak adlandırıyor.
ReQueST, dört farklı davranış türüne yol açabilir. İlk davranış türü, toplu ödül modelleri konusunda belirsizliği en üst düzeye çıkarmaya çalışıyor. İkinci ve üçüncü davranışlar, öngörülen ödülleri en aza indirme ve en üst düzeye çıkarma çabalarını içeriyor. Öngörülen ödüller, modelin yanlış bir şekilde öngördüğü davranışların keşfedilmesi için en aza indiriliyor. Öte yandan, öngörülen ödül, en yüksek bilgi değerine sahip davranış etiketlerine sahip olmak için en üst düzeye çıkarılıyor. Son olarak, dördüncü davranış türü, modelin sürekli keşfetmesini sağlamak için traijektörlerin yeniğini en üst düzeye çıkarmaya çalışıyor.
Model, istenilen düzeyde ödül topladığında, planlama ajanı, öğrenilen ödüllere dayalı kararlar almak için kullanılıyor. Bu model-prediktif kontrol şeması, ajansların, dinamik modeli kullanarak ve olası sonuçları öngörerek, güvenli olmayan durumları öğrenmesini sağlıyor; bu, yalnızca deneme yanılma yoluyla öğrenen algoritmaların davranışlarının aksine.
VentureBeat tarafından bildirildiği üzere, DeepMind araştırmacıları, projelerinin, kontrolsüz ve güvenli bir şekilde öğrenen ilk takviye öğrenimi sistemi olduğuna inanıyor:
“Bilgimiz dahilinde, ReQueST, güvenli olmayan durumlar hakkında güvenli bir şekilde öğrenen ve yüksek boyutlu, sürekli durumlarla çevrelenmiş ortamlarda sinir ağı ödül modellerini eğitmek için ölçeklenebilen ilk ödül modelleme algoritmasıdır. Şu ana kadar, ReQueST’in yalnızca göreceli olarak basit dinamiklere sahip simüle edilmiş alanlarda etkinliğini gösterdik. Gelecekteki çalışmalar için bir yön, ReQueST’i daha gerçekçi fizik ve diğer ajanların çevrelediği 3D alanlarda test etmektir.”












