Yapay zeka modelleri ve platformları
POKELLMON: Pokémon Savaşları için İnsan Düzeyinde bir Ajan ile LLM
Büyük Dil Modelleri ve Üretken AI, Doğal Dil İşleme görevleri dahil olmak üzere geniş bir görev yelpazesi üzerinde önceki başarıları aşan bir başarı göstermiştir. NLP alanını fethettikten sonra, GenAI ve LLM araştırmacılarının bir sonraki zorluğu, büyük dil modellerinin metin ve eylem arasındaki geniş boşluğu kapatmak ve gerçek dünyada özerk olarak hareket etmelerini sağlamaktır. Bu, yapay genel zeka追求ünde önemli bir paradigmadır. Çevrimiçi oyunlar, büyük dil modeli gömülü ajanları geliştirmek için uygun bir test tabanı olarak kabul edilir ve bunlar, insan gibi sanal bir ortamla etkileşime girer.
Örneğin, popüler bir çevrimiçi simülasyon oyunu olan Minecraft’te, oyuncuların dünyayı keşfetmesine ve araçlar geliştirmesine yardımcı olmak için karar alma ajanları kullanılabilir. Başka bir örnek, LLM ajanlarının görsel bir ortamla etkileşime girdiği bir diğer çevrimiçi oyun olan The Sims’tir ve burada sosyal etkileşimlerde ve insanlara benzer davranışlarda önemli başarılar gösterirler. Ancak, mevcut oyunlara kıyasla, taktik savaş oyunları, büyük dil modellerinin sanal oyunları oynamaya yönelik yeteneklerini ölçmek için daha iyi bir seçim olabilir. Taktik oyunların, büyük dil modellerini oyun oynamaya yönelik yeteneklerini ölçmek için daha iyi bir seçim olmasının primary nedeni, kazanma oranının doğrudan ölçülebilmesi ve tutarlı rakiplerinin, hem insan oyuncular hem de AI dahil olmak üzere her zaman mevcut olmasıdır.
Bu doğrultuda, POKELLMON, Pokémon savaşlarında insan düzeyinde performans gösteren dünyanın ilk gömülü ajanı olmayı hedeflemektedir. POKELLMON çerçevesi, temelde üç ana stratejiyi içerir.
- Anlık geri bildirimi tüketen, savaşlardan elde edilen metin tabanlı geri bildirimi kullanarak politika را iteratif olarak iyileştiren bağlam içi pekiştirme öğrenimi.
- Dışarıdan alınan bilgiyi kullanarak, ajanın doğru ve zamanında hareket etmesini sağlayan, halüsinasyonları azaltan Bilgi Artırımlı Üretim veya KAG yaklaşımı.
- Güçlü bir rakip ile karşılaşıldığında panik anahtarını önlemek için, tutarlı eylem üretimi.
Bu makale, POKELLMON çerçevesini derinlemesine ele almak ve mekanizmasını, metodolojisini, mimarisini ve mevcut çerçevelerle karşılaştırmasını keşfetmek amacını taşımaktadır. Ayrıca, POKELLMON çerçevesinin, insan benzeri savaş stratejileri ve zamanında karar alma yetenekleri sergileyerek, yaklaşık %50’lik bir kazanma oranına ulaştığını tartışacağız. Şimdi başlayalım.
POKELLMON: Pokémon Savaşları için İnsan Düzeyinde bir Ajan ile LLM
Büyük Dil Modelleri ve Üretken AI’nin son yıllarda NLP görevleri dahil olmak üzere çeşitli görevlerde gösterdiği başarı, mucizevi olmuştur. Son zamanlarda, geliştiriciler ve AI araştırmacıları, GenAI ve LLM’lerin gerçek dünyada özerk olarak hareket etmelerini sağlamak için yollar aramaktadırlar. Bunu gerçekleştirmek için, oyunlar, büyük dil modeli gömülü ajanları geliştirmek için uygun bir test tabanı olarak kabul edilir.
Önceki çalışmalar, LLM gömülü ajanların Minecraft ve The Sims gibi sanal simülasyon oyunlarında geliştirilebileceğini göstermiştir. Ancak, taktik savaş oyunları, büyük dil modellerinin oyun oynamaya yönelik yeteneklerini ölçmek için daha iyi bir seçim olabilir. Pokémon savaşları, geliştiricilere, bir eğitmenin savaşma yeteneklerini değerlendirmelerine olanak tanıyan bir ortam sunar ve diğer taktik oyunlara kıyasla beberapa avantajlar sağlar. Eylem ve durum uzayları ayrıldığından, bunlar metne dönüştürülürken herhangi bir kayıp olmadan aktarılabilir. Aşağıdaki şekil, bir Pokémon savaşını gösterir ve oyuncunun her turda geçerli Pokémon durumuna göre bir eylem üretmesi gerekir.

POKELLMON: Metodoloji ve Mimari
POKELLMON çerçevesinin genel mimarisi ve metodolojisi aşağıdaki şekilde gösterilmiştir.

Her turda, POKELLMON çerçevesi, önceki eylemler ve bunlara karşılık gelen metin tabanlı geri bildirimi kullanarak politika را iteratif olarak iyileştirir ve ayrıca geçerli durum bilgilerini dış bilgi ile zenginleştirir. Girdi olarak verilen bilgiler için, POKELLMON çerçevesi bağımsız olarak birden fazla eylem üretir ve en tutarlı olanını nihai çıktı olarak seçer.
Bağlam İçi Pekiştirme Öğrenimi
İnsan oyuncular ve atletler, yalnızca geçerli durum temelinde değil, aynı zamanda önceki eylemlerden alınan geri bildirimi ve diğer oyuncuların deneyimlerini de dikkate alarak kararlar alırlar. Olumlu geri bildirimin, bir oyuncunun hatalarından öğrenmesine ve aynı hatayı tekrarlamamasına yardımcı olduğu söylenebilir. Doğru geri bildirimi olmadan, POKELLMON ajanları aynı yanlış eylemi tekrarlayabilir, aşağıdaki şekilde gösterildiği gibi.

Gördüğünüz gibi, oyun içi ajan, su tabanlı bir hareketi “Kuru Deri” yeteneğine sahip bir Pokémon karakterine karşı kullanır ve bu da su tabanlı saldırıların etkisini ortadan kaldırır. Oyun, ekranda “Bağışık” mesajını yanıp söndürerek oyuncuyu uyarmaya çalışır ve bu, bir insan oyuncusunun eylemlerini yeniden düşünmesine ve değiştirmesine neden olabilir, hatta “Kuru Deri” hakkında bilgi sahibi olmasa bile.
POKELLMON ajanının önceki hatalarından öğrenmesini sağlamak için, çerçeve, Bağlam İçi Pekiştirme Öğrenimi yaklaşımını uygular. Pekiştirme öğrenimi, makine öğreniminin popüler bir yaklaşımıdır ve politika را iyileştirmek için numeric ödüllerin eylemleri değerlendirmesi gerekir. Büyük dil modelleri, dilin anlamını yorumlayabilme yeteneğine sahip olduklarından, metin tabanlı açıklamalar, LLM’ler için yeni bir ödül türü olarak ortaya çıkmıştır. Önceki eylemlerden alınan metin tabanlı geri bildirimi dahil ederek, POKELLMON ajanı, politika را anlık ve iteratif olarak iyileştirebilir, yani Bağlam İçi Pekiştirme Öğrenimi.
- Bir saldırı hareketinin iki ardışık tur arasındaki HP farkı temelinde gerçekleştirdiği hasar.
- Saldırı hareketlerinin etkinliği. Geri bildirimi, saldırının etkisiz, bağışık, zayıf veya süper etkili olup olmadığını gösterir.
- Hareketlerin öncelik sırası. Rakip Pokémon’un kesin istatistikleri bilinmediğinden, öncelik sırası geri bildirimi, bir tür hız tahmini sağlar.
- Uygulanan hareketlerin gerçek etkisi. Hem saldırı hareketleri hem de durum hareketleri, HP iyileşmesi, stat artışı veya azalışı, donma, yanık veya zehirlenme gibi sonuçlar doğurabilir.

Ayrıca, Bağlam İçi Pekiştirme Öğrenimi yaklaşımının uygulanması, performansda önemli bir artışa yol açar, aşağıdaki şekilde gösterildiği gibi.

GPT-4’ün orijinal performansına kıyasla, kazanma oranı yaklaşık %10 artar ve savaş puanında yaklaşık %13’lük bir artış olur. Ayrıca, aşağıdaki şekilde gösterildiği gibi, ajan, önceki hareketlerin beklentileri karşılamadığında eylemlerini analiz etmeye ve değiştirmeye başlar.

Bilgi Artırımlı Üretim veya KAG
Bağlam İçi Pekiştirme Öğrenimi’nin uygulanması, halüsinasyonları bir ölçüde azaltsa da, ajanın hala yanlış kararlar almasına neden olabilir. Örneğin, ajan, bir ateş tipi Pokémon ile savaşmak için bir çim tipi Pokémon’u seçerse, ilk turda yenilgi kaçınılmazdır. Halüsinasyonları daha da azaltmak ve ajanın karar alma yeteneğini iyileştirmek için, POKELLMON çerçevesi, Bilgi Artırımlı Üretim veya KAG yaklaşımını uygular, bu da dış bilgiyi kullanarak üretimi zenginleştirmeye yönelik bir tekniktir.
Şimdi, model yukarıda belirtilen dört tür geri bildirimi ürettiğinde, Pokémon hareketleri ve bilgileri, ajanın kendi başına tür avantajı ilişkisini çıkarabilmesi için açıklar. Halüsinasyonları daha da azaltmak için, POKELLMON çerçevesi, rakip Pokémon’un ve ajanın Pokémon’unun tür avantajı ve zayıflıklarını yeterli açıklamalarla birlikte açıkça açıklar. Ayrıca, Pokémon’ların hareketleri ve yetenekleri hakkında bilgi sahibi olmak zor olabilir, özellikle de çok fazla Pokémon olduğu için. Aşağıdaki tablo, Bilgi Artırımlı Üretim sonuçlarını gösterir. Bilgi Artırımlı Üretim yaklaşımının uygulanması, POKELLMON çerçevesinin kazanma oranını yaklaşık %20 artırmaya yardımcı olur, yani %36’dan %55’e.

Ayrıca, geliştiriciler, ajanın Pokémon’lar hakkında dış bilgi sahibi olduğunda, doğru zamanda özel hareketleri kullandığını gözlemlediler, aşağıdaki şekilde gösterildiği gibi.

Tutarlı Eylem Üretimi
Mevcut modeller,.prompting ve akıl yürütme yaklaşımlarının, LLM’lerin karmaşık görevleri çözebilme yeteneğini artırabileceğini göstermiştir. Tek seferde bir eylem üretmek yerine, POKELLMON çerçevesi, mevcut prompting stratejilerini değerlendirir, bunlar arasında Zincir Düşünce (CoT), Düşünce Ağacı (ToT) ve Kendi tutarlılığı bulunur. Zincir Düşünce için, ajan önce bir düşünce üretir, geçerli savaş senaryosunu analiz eder ve düşünceye bağlı bir eylem üretir. Kendi tutarlılığı için, ajan üç eylem üretir ve en çok oy alan çıktıyı seçer. Düşünce Ağacı yaklaşımı için, çerçeve üç eylem üretir, ancak bunları kendi kendine değerlendirir ve en iyisini seçer. Aşağıdaki tablo, prompting yaklaşımlarının performansını özetler.

Her tur için yalnızca bir eylem vardır, bu da ajanın değiştirmesi durumunda, değiştirilen Pokémon’un hasar alacağı anlamına gelir. Normalde, ajan değiştirmek ister çünkü savaş dışı bir Pokémon’u değiştirmek ister ve değiştirilen Pokémon, rakip Pokémon’un hareketlerine karşı dayanıklıdır. Ancak, yukarıdaki gibi, CoT akıl yürütme ile ajan, güçlü bir rakip tarafından çeşitli değişikliklere zorlandığında, misyonuna uygun olarak davranmaz, çünkü değiştirilen Pokémon’a geçmek isteyebilir, ancak birkaç Pokémon arasında geri gelir, buna da panik anahtarı denir. Panik anahtarı, hareketleri alma ve yenilgi şansını ortadan kaldırır.
POKELLMON: Sonuçlar ve Deneyler
Sonuçları tartışmadan önce, savaş ortamını anlamak önemlidir. Her turun başında, ortam, sunucudan bir eylem isteği mesajı alır ve bu mesajı turun sonuna kadar yanıtlayacaktır.
- İlk olarak, mesajı parse eder ve yerel durum değişkenlerini günceller, 2. sonra durum değişkenlerini metne çevirir. Metin açıklaması esas olarak dört parçadan oluşur: 1. kendi takım bilgileri, sahada ve sahada olmayan (kullanılmayan) Pokémon’ların özniteliklerini içerir.
- Rakip takım bilgileri, sahada ve sahada olmayan (bazı bilgiler bilinmeyen) rakip Pokémon’ların özniteliklerini içerir.
- Savaş alanı bilgileri, hava durumu, girişte tehlike ve araziyi içerir.
- Tarihi tur günlüğü bilgileri, her iki Pokémon’un önceki eylemlerini içerir ve bir günlükte depolanır. LLM’ler, çevirilen durumu girdi olarak alır ve bir sonraki adımda eylemler üretir. Eylem sunucuya gönderilir ve insan tarafından yapılan eylem ile aynı anda yürütülür.
İnsan Oyunculara Karşı Savaş
Aşağıdaki tablo, POKELLMON ajanının insan oyunculara karşı performansını gösterir.

Gördüğünüz gibi, POKELLMON ajanı, daha yüksek bir kazanma oranına sahip olan ve geniş savaş deneyimine sahip davetli bir oyuncuya benzer bir performans gösterir.
Savaş Beceri Analizi
POKELLMON çerçevesi, Bilgi Artırımlı Üretim stratejisi sayesinde, genellikle etkili bir hareket seçer ve başka bir uygun Pokémon’a geçer.

Örnekte görüldüğü gibi, ajan, tüm rakip takımı yenmek için yalnızca bir Pokémon kullanır, çünkü durumuna göre en etkili saldırı hareketlerini seçebilir. Ayrıca, POKELLMON çerçevesi, insan benzeri bir yıpratma stratejisi gösterir. Bazı Pokémon’lar, her turda ek hasar verebilen “Zehirli” bir hareketi sahiptir, mientras “İyileşme” hareketi, HP’sini geri yüklemesine olanak tanır. Bunlardan yararlanarak, ajan önce rakip Pokémon’u zehirler ve sonra İyileşme hareketini kullanarak kendini bayılmaktan kurtarır.

Son Düşünceler
Bu makalede, POKELLMON’u, büyük dil modellerinin insan oyunculara karşı Pokémon savaşları oynamasını sağlayan bir yaklaşım olarak tanıttık. POKELLMON, Pokémon savaşlarında insan düzeyinde performans gösteren dünyanın ilk gömülü ajanı olmayı hedeflemektedir. POKELLMON çerçevesi, üç ana strateji sunar: Bağlam İçi Pekiştirme Öğrenimi, Bilgi Artırımlı Üretim ve Tutarlı Eylem Üretimi. Bu stratejiler, ajanın, insan benzeri savaş stratejileri ve zamanında karar alma yetenekleri sergileyerek, yaklaşık %50’lik bir kazanma oranına ulaşmasını sağlar.












