Yapay zeka modelleri ve platformları

Sanal Saklanma ve Arama Oyununda AI Ajanları Yükselen Zeka Özelliklerini Gösterdi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Araştırmacılar, AI araştırmalarının ilginç yönlerinden biri olduğunu belirtiyorlar. AI, souvent, tasarımcılarını bile şaşırtan eylemler gerçekleştirebiliyor ve stratejiler izleyebiliyor. Bu, yakın zamanda sanal bir saklanma ve arama oyununda meydana geldi. OpenAI’deki araştırmacılar, AI ajanlarının beklenmedik stratejiler geliştirdiklerini keşfettiler. Bu stratejiler, oyun dünyasında araştırmacıların bile bilmediği stratejilerdi.

OpenAI, AI ajanlarını birbirleriyle saklanma ve arama oyunu oynamaya eğitmiştir. AI programları, pekiştirme öğrenimi ile eğitilir. Bu teknikte, istenilen davranış, AI algoritmalarına geri bildirim sağlanarak elde edilir. AI, rastgele eylemler gerçekleştirir ve her eylem, amacına yaklaştıkça ödüllendirilir. AI, mümkün olan en yüksek ödülü elde etmeye çalışır ve hangi eylemlerin daha fazla ödül getireceğini keşfetmek için dener. Deneme yanılma yoluyla, AI, zaferi getirecek stratejileri ayırt edebiliyor.

Pekiştirme öğrenimi, oyun kurallarını öğrenmede already önemli başarılar gösterdi. OpenAI, yakın zamanda bir AI ekibini MMORPG DOTA 2 oynamaya eğitti ve AI, geçen yıl bir dünya şampiyonu insan ekibini yendi. Benzer bir şey, DeepMind’in StarCraft oyununda AI’yi eğittiğinde happened. Pekiştirme öğrenimi, AI programlarının Pictionary’yi insanlarla oynamasını ve temel ortak akıl mantığını öğrenmesini öğretmek için de kullanıldı.

Araştırmacılar tarafından oluşturulan sanal saklanma ve arama oyununda, birden fazla AI ajanı birbirlerine karşı yarıştı. Sonuç, bir çeşit silah yarışmasıydı. Her ajan, diğerini geçmeye ve en fazla ödül puanını elde etmeye çalışıyordu. Bir ajanın yeni bir strateji benimsemesi, rakibinin de yeni bir strateji benimsemesine neden oluyordu. OpenAI’deki araştırmacı Igor Mordatch, IEEE Spectrum’a, bu deneysel oyun sürecinin “ajansların şaşırtıcı davranışlar öğrenmesini sağladığını” belirtti. “Bu, çocukların birbirleriyle oynadığı gibi bir şey.”

Peki şaşırtıcı davranışlar nelerdi? Araştırmacılar, AI ajanlarının dört temel strateji öğrenmesini bekliyorlardı ve bunlar 25 milyon simüle oyun sonra assez hızlı bir şekilde öğrenildi. Oyun, rampalar, bloklar ve duvarlarla dolu 3D bir ortamda gerçekleşiyordu. AI ajanları, birbirlerini kovalamak, blokları hareket ettirmek ve rampaları kullanmak için stratejiler geliştirdiler. AI avcıları, rampaları sürükleyerek saklananların kalelerine girmeyi öğrendiler. Saklananlar da rampaları kalelerine çekerek avcıların kullanmalarını engellediler.

Fakat 380 milyon oyun civarında beklenmedik bir şey oldu. AI ajanları, araştırmacıların beklemedikleri iki strateji geliştirdiler. Avcı ajanlar, bir kutuya zıplamak ve kutuyu bir kaleye doğru sürükleyerek kaleye girmeyi öğrendiler. Araştırmacılar, oyun ortamının fizik kurallarına göre bu davranışın mümkün olduğunu bile bilmiyorlardı. Saklanan ajanlar da kutuları kalelerine çekerek avcıların kullanmalarını engellediler.

Reinforcement learning algoritmalarıyla eğitilen AI ajanlarının beklenmedik davranışları, bu durumda zararsız olsa da, diğer durumlar için potansiyel endişeler yaratıyor. OpenAI araştırma ekibinin bir üyesi Bowen Baker, IEEE Spectrum’a, bu beklenmedik davranışların potansiyel olarak tehlikeli olabileceğini belirtti. “Bu ortamları oluşturmak zor,” dedi Baker. “Ajanlar, beklenmedik davranışlar geliştirecekler ve bu, daha kompleks ortamlara koyduğunuzda bir güvenlik sorunu haline gelecek.”

Ancak Baker, pekiştirme stratejilerinin mevcut sorunlara yenilikçi çözümler getirebileceğini de açıkladı. Pekiştirme öğrenimi ile eğitilen sistemler, hayal edemeyeceğimiz çözümlerle bir dizi sorunu çözebilir.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.