Yapay zeka modelleri ve platformları
DIAMOND: Görsel Detaylar Atari ve Diffusion için Dünya Modellemesinde Önemlidir
2018 yılında, bir nöral ağ dünya modeli bağlamında pekiştirme öğrenimi fikri ilk kez ortaya atıldı ve kısa süre sonra bu temel prensip dünya modellerine uygulandı. Pekiştirme öğrenimi uygulayan bazı nổi bật modeller, Dreamer çerçevesi, latent uzayından geri bildirim öğrenimi sunan bir againleme devlet uzayı modeli tanıttı. DreamerV2, ayrıksı latents kullanmanın bileşik hataları azaltabileceğini gösterdi ve DreamerV3 çerçevesi, sabit hiperparametrelerle çeşitli görevler boyunca insan benzeri performans elde etti.
Ayrıca, görüntü oluşturma modelleri ve dünya modelleri arasında paraleller çizilebilir, bu da görsel modelleme ilerlemelerinin dünya modellerine de uygulanabileceğini gösterir. Doğal dil işleme çerçevelerinde transformerlerin kullanımı popüler hale geldikten bu yana, DALL-E ve VQGAN çerçeveleri ortaya çıktı. Bu çerçeveler, görüntüleri ayrıksı tokenlere dönüştürmek için ayrıksı oto-encoder’ler uyguladı ve otoregresif transformerlerin dizisel modelleme yeteneklerini kullanarak güçlü ve verimli metin-görüntü oluşturma modelleri oluşturdular. Aynı zamanda, difüzyon modelleri popülerlik kazandı ve bugün, difüzyon modelleri yüksek çözünürlüklü görüntü oluşturma için baskın bir paradigmaya dönüştü. Difüzyon modellerinin ve pekiştirme öğreniminin sunduğu yeteneklere dayanarak, bu iki yaklaşımı birleştirmeye yönelik girişimler yapılıyor, difüzyon modellerinin esnekliğini kullanarak yol modelleri, ödül modelleri, planlayıcılar ve offline pekiştirme öğrenimi için veri artırımı olarak yararlanmak amaçlanıyor.
Dünya modelleri, pekiştirme öğrenimi ajanlarını güvenli ve verimli bir şekilde eğitmek için umut verici bir yöntem sunar. Geleneksel olarak, bu modeller, çevre dinamikleri simüle etmek için ayrıksı latent değişkenler dizilerini kullanır. Ancak, bu sıkıştırma, pekiştirme öğrenimi için kritik olan görsel detayları göz ardı edebilir. Aynı zamanda, difüzyon modelleri, geleneksel yöntemlere meydan okuyan yüksek çözünürlüklü görüntü oluşturma için popülerlik kazandı. Bu değişimden esinlenerek, bu makalede, DIAMOND (DIffusion As a Model Of eNvironment Dreams) adlı bir pekiştirme öğrenimi ajanı tanıtacağız, bu ajan, bir difüzyon dünya modeli içinde eğitilir. Gerekli tasarım seçimlerini yaparak difüzyonun dünya modellemesine uygun hale getirileceğini ve geliştirilmiş görsel detayların daha iyi ajan performansı sağladığını göstereceğiz. DIAMOND, Atari 100k testinde yeni bir ölçüt oluşturuyor ve tamamen bir dünya modeli içinde eğitilen ajanlar için en yüksek ortalama insan normalize puanı olan 1.46’ya ulaşıyor.
DIAMOND: Görsel Detaylar Atari ve Diffusion için Dünya Modellemesinde Önemlidir
Dünya modelleri veya çevrelerin oluşturucu modelleri, ajanların çevrelerini planlamak ve anlamak için önemli bileşenler haline geliyor. Pekiştirme öğrenimi, son yıllarda önemli başarılar elde etti, ancak pekiştirme öğrenimi uygulayan modeller, örnek verimsizliği nedeniyle gerçek dünya uygulamalarında sınırlı kalıyor. Diğer yandan, dünya modelleri, çeşitli ortamlarda pekiştirme öğrenimi ajanlarını daha verimli bir şekilde eğitmek için önemli bir ilerleme gösterdi, bu da modelin gerçek dünya deneyimlerinden öğrenmesini sağlıyor. Son dünya modelleme çerçeveleri genellikle çevre dinamikleri olarak ayrıksı latent değişkenler dizisini modellemektedir, ancak bu yaklaşım, yeniden yapılandırma kalitesinin ve genellik kaybının kaybına neden olabilir. Bu bilgi kaybı, gerçek dünya senaryolarında önemli bir engel oluşturabilir, özellikle de otonom araçların eğitimi gibi görevlerde, trafik ışığının rengi veya önündeki aracın dönüş göstergesi gibi küçük değişiklikler veya görsel girdideki detaylar, ajanın politikasını değiştirebilir. Ayrıksı latents sayısını artırarak bilgi kaybını önlemek mümkün olabilir, ancak bu, hesaplama maliyetlerini önemli ölçüde artırır.
Son yıllarda, difüzyon modelleri, yüksek kaliteli görüntü oluşturma çerçeveleri için baskın bir yaklaşım haline geldi, çünkü bu çerçeveler, gürültüleme sürecini tersine çevirmeyi öğrenir ve ayrıksı tokenleri modelleyen geleneksel yaklaşımlarla rekabet eder, bu da dünya modellemesinde ayrıklaştırma ihtiyacını ortadan kaldırmak için umut verici bir alternatif sunar. Difüzyon modelleri, koşullandırılmaya kolayca adapte edilebilme ve karmaşık, çok modlu dağılımları modüle etme yetenekleri nedeniyle dünya modellemesi için uygun özelliklere sahiptir.
Bu özelliklere dayanarak, DIAMOND (DIffusion As a Model Of eNvironment Dreams) adlı bir pekiştirme öğrenimi ajanı, bir difüzyon dünya modeli içinde eğitilir. DIAMOND çerçevesi, difüzyon dünya modelinin verimli ve稳 định kalmasını sağlamak için dikkatli tasarım seçimlerini yapar. Çerçevede, bu tasarım seçimlerinin önemini göstermek için nitel bir analiz sunulur. DIAMOND, Atari 100k benchmarkünde yeni bir ölçüt oluşturur ve tamamen bir dünya modeli içinde eğitilen ajanlar için en yüksek ortalama insan normalize puanı olan 1.46’ya ulaşır. Görsel uzayda çalışmak, DIAMOND’un difüzyon dünya modelinin çevreyi kolayca değiştirmesine olanak tanır, bu da dünya modeli ve ajan davranışları hakkında daha fazla bilgi sağlar. Özellikle, belirli oyunlardaki geliştirilmiş performans, kritik görsel detayların daha iyi modellenmesinden kaynaklanmaktadır. DIAMOND çerçevesi, çevreyi standart bir POMDP veya Kısmen Gözlemlenebilir Markov Karar Süreci olarak modellemektedir, bu da bir dizi durum, ayrıksı eylemler ve görüntü gözlemlerinden oluşur. Geçiş fonksiyonları, çevre dinamikleri tanımlar ve ödül fonksiyonu, geçişlere skaler ödüllere ánheder. Gözlem fonksiyonu, gözlem olasılıklarını tanımlar ve ajanların çevreleri görmesini sağlayan görüntü gözlemlerini üretir.
DIAMOND: Yöntem ve Mimari
Temelde, difüzyon modelleri, bir örneği gürültüleme sürecini tersine çevirmek suretiyle oluşturan bir tür oluşturucu modeldir ve dengesiz termodinamiğinden esinlenir. DIAMOND çerçevesi, bir süreklilik zaman değişkeni ile indekslenen bir difüzyon süreci ve ilgili marjinal ve sınır koşulları dikkate alır, ayrıca bir ulaşılabilir yapısal öncül dağılımı vardır. Ayrıca, bir oluşturucu model elde etmek için, DIAMOND çerçevesi, gürültüleme sürecini tersine çevirmelidir, bu da tersine bir difüzyon süreci ile gerçekleştirilir. Ancak, herhangi bir zamanda, puan fonksiyonunu tahmin etmek zor değildir, çünkü DIAMOND çerçevesi gerçek puan fonksiyonuna erişimi yoktur, bu nedenle model, puan eşleştirme hedefi uygulayarak bu engeli aşar, bu da bir puan modelini underlying puan fonksiyonunu bilmeden eğitmeyi sağlar. Puan tabanlı difüzyon modeli, koşulsuz bir oluşturucu model sağlar. Ancak, çevre dinamikleri için bir koşullu oluşturucu model gerekir, bu nedenle DIAMOND çerçevesi, POMDP yaklaşımının genel durumunu dikkate alır, bu da geçmiş gözlemler ve eylemler kullanılarak bilinmeyen Markovian durumu yaklaşık olarak tahmin etmeyi sağlar.
Bu öğrenmelere dayanarak, şimdi DIAMOND çerçevesinin pratik gerçekleştirmesini ele alalım, difüzyon tabanlı bir dünya modeli ve ilgili difüzyon katsayıları dahil. DIAMOND çerçevesi, difüzyon yaklaşımının belirli bir seçimine karşılık gelen bir pertürbasyon çekirdeği ile EDM formülasyonunu kullanır, difüzyon zamanı adlı bir gerçek değerli fonksiyonu dikkate alır. Çerçevede, girişlerin ve çıkışların varyansını korumak için ön koşullayıcıları seçer, ağ eğitimi, gürültü seviyesine bağlı olarak sinyal ve gürültüyü adaptif olarak karıştırır, düşük gürültü seviyelerinde, hedef, temiz ve pertürbe sinyal arasındaki farka dönüşür, yani eklenen Gauss gürültüsü.
DIAMOND: Deneyler ve Sonuçlar
Kapsamlı bir değerlendirme için, DIAMOND çerçevesi, Atari 100k benchmarkünü kullanır. Atari 100k benchmarkü, ajanın çeşitli yeteneklerini test etmek için tasarlanmış 26 oyundan oluşur. Her oyunda, ajan, oyunu öğrenmeden önce 100.000 eylem ile sınırlıdır, bu da yaklaşık 2 saatlik insan oyun zamanına karşılık gelir. Karşılaştırmak için, kısıtlamasız Atari ajanları genellikle 50 milyon adımda eğitim görür, bu da yaklaşık 500 kat daha fazla deneyim anlamına gelir. Her oyun için 5 farklı rastgele tohum kullanarak DIAMOND’u sıfırdan eğittik. Her eğitim çalışması yaklaşık 12 GB VRAM gerektiriyordu ve tek bir Nvidia RTX 4090’da yaklaşık 2,9 gün sürdü, toplamda 1,03 GPU yılına karşılık geliyor. Aşağıdaki tablo, tüm oyunlar için puanları, ortalama ve insan normalize puanlarının interquartil mean’ini sağlar.
Noktasal tahminlerin sınırlamalarını takip eden DIAMOND çerçevesi, insan normalize puanlarının ortalama ve interquartil mean’inde stratified bootstrap güven aralıkları sağlar, ayrıca performans profilleri ve ek metrikları aşağıdaki figura özetler.
Sonuçlar, DIAMOND’un benchmark boyunca olağanüstü bir performans sergilediğini gösterir, 11 oyunda insan oyuncularını geçer ve tamamen bir dünya modeli içinde eğitilen ajanlar için yeni bir rekor olan 1.46’lık ortalama insan normalize puanına ulaşır. Ayrıca, DIAMOND’un interquartil mean’i, STORM ile karşılaştırılabilir ve tüm diğer referans noktalarını aşar. DIAMOND, Asterix, Breakout ve RoadRunner gibi küçük detayların kritik olduğu ortamlarda öne çıkar. Ayrıca, daha önce tartışıldığı gibi, DIAMOND çerçevesi, difüzyon modelini pipeline’ına uygulamak için esneklik sağlar, ancak EDM yaklaşımını tercih eder, DDPM modeli deNumerous görüntü oluşturma uygulamalarında zaten uygulanmaktadır. EDM yaklaşımını DDPM uygulamasıyla karşılaştırmak için, DIAMOND çerçevesi, her iki varyantı aynı ağ mimarisi ile aynı paylaşılan statik veri kümesiyle eğitti, bu veri kümesi uzman bir politika ile toplanan 100.000’den fazla kare içeriyordu. Difüzyon modelinin çıkarım maliyetini doğrudan etkileyen gürültü giderme adımlarının sayısı, dünya modelinin eğitim maliyetini azaltmak için azaltılmalıdır. Diğer referans noktaları ile karşılaştırılabilirlik sağlamak için, her zaman adımı için en fazla on gürültü giderme adımı kullanmayı amaçlıyoruz, daha azı tercih edilir. Ancak, gürültü giderme adımlarının sayısını çok düşük ayarlamak, görsel kalitesini bozabilir ve bileşik hatalara neden olabilir. Farklı difüzyon varyantlarının stabilitesini değerlendirmek için, 1000 zaman adımı kadar otoregresif olarak oluşturulan hayal edilen yolları aşağıdaki figura gösteriyoruz, farklı gürültü giderme adımları sayısı ile.
DDPM (a) kullanarak bu rejimde ciddi bileşik hatalar oluştuğunu, dünya modelinin hızla dağılmasına neden olduğunu gözlemliyoruz. Karşılaştırmada, EDM tabanlı difüzyon dünya modeli (b) çok daha稳 định kalıyor, hatta tek bir gürültü giderme adımı ile bile. DDPM (sol) ve EDM (sağ) tabanlı difüzyon dünya modellerine dayalı hayal edilen yollar gösteriliyor. Her iki durumda da ilk gözlem aynı, her satır gürültü giderme adımlarının sayısının azalmasına karşılık geliyor. DDPM tabanlı oluşturma, bileşik hatalardan mustarip, daha az gürültü giderme adımı ile daha hızlı hata biriktirme ile sonuçlanıyor. Karşılaştırmada, DIAMOND’un EDM tabanlı dünya modeli çok daha稳ildir, tek bir gürültü giderme adımı ile bile. Tek adımlı tahmin, verilen gürültülü girdinin olası yeniden yapılandırmalar üzerinden beklentidir, bu, posterior dağılımı çok modlu ise dağılma dışı olabilir. Bazı oyunlar, Breakout gibi, deterministik geçişlere sahip olabilir ve tek bir gürültü giderme adımı ile doğru bir şekilde modellenebilir, diğer oyunlar ise kısmi gözlemlenebilirlik sergiler ve çok modlu gözlem dağılımlarına sahiptir. Bu durumlarda, bir iteratif çözücü, örneklem prosedürünü belirli bir moda yönlendirmek için gerekli olur, Boxing oyununda gösterildiği gibi. Son olarak, DIAMOND çerçevesi, tüm deneylerimizde n = 3 olarak ayarlanır.
Aşağıdaki figura, Boxing’de tek adımlı (üst satır) ve çok adımlı (alt satır) örneklemeyi karşılaştırıyor. Siyah oyuncunun hareketleri öngörülemez, bu da tek adımlı gürültü giderme arasında olası sonuçlar arasında interpolasyona neden oluyor ve bulanık tahminlerle sonuçlanıyor. Karşılaştırmada, çok adımlı örneklem, belirli bir moda yönlendirerek net bir görüntü üretiyor. İlginç bir şekilde, beyaz oyuncunun hareketleri, dünya modeli tarafından bilinir, bu da belirsizliği ortadan kaldırır. Bu nedenle, hem tek hem de çok adımlı örneklem, beyaz oyuncunun pozisyonunu doğru bir şekilde öngörür.
DIAMOND tarafından hayal edilen yollar, genellikle gerçek çevreye daha sadık ve daha yüksek görsel kaliteye sahiptir, IRIS tarafından hayal edilen yollara göre. IRIS tarafından oluşturulan yollar, çerçeve arasındaki görsel tutarsızlıkları içerir (beyaz kutularla vurgulanmıştır), Örneğin, düşmanların ödüller olarak görüntülenmesi ve vice versa. Bu tutarsızlıklar, sadece birkaç pikseli etkileyebilir, ancak pekiştirme öğrenimi için önemli olabilir. Örneğin, bir ajan genellikle ödülleri hedeflemek ve düşmanlardan kaçınmaya çalışır, bu nedenle bu küçük görsel farklılıklar, optimal bir politika öğrenmeyi daha zor hale getirebilir. Figür, IRIS (sol) ve DIAMOND (sağ) ile ardışık çerçevelerin karşılaştırmasını gösterir. Beyaz kutular, IRIS tarafından oluşturulan yollarda görülen çerçeve arasındaki tutarsızlıkları vurgular. Asterix’te (üst satır), bir düşman (turuncu) ikinci karede bir ödül (kırmızı) haline gelir, üçüncü karede tekrar bir düşman ve dördüncü karede tekrar bir ödül haline gelir. Breakout’ta (orta satır), puan ve tuğlalar arasındaki tutarlılık yoktur. Road Runner’da (alt satır), yoldaki küçük mavi noktalar (ödüller) tutarlı bir şekilde渲染 edilmez. Bu tutarsızlıklar, DIAMOND ile oluşmaz. Breakout’ta, puan, bir kırmızı tuğla kırıldığında güvenilir bir şekilde +7 güncellenir.
SONUÇ
Bu makalede, DIAMOND adlı bir pekiştirme öğrenimi ajanını tanıttık, bu ajan, bir difüzyon dünya modeli içinde eğitilir. DIAMOND çerçevesi, difüzyon dünya modelinin verimli ve稳 định kalmasını sağlamak için dikkatli tasarım seçimlerini yapar. Çerçevede, bu tasarım seçimlerinin önemini göstermek için nitel bir analiz sunulur. DIAMOND, Atari 100k benchmarkünde yeni bir ölçüt oluşturur ve tamamen bir dünya modeli içinde eğitilen ajanlar için en yüksek ortalama insan normalize puanı olan 1.46’ya ulaşır. Görsel uzayda çalışmak, DIAMOND’un difüzyon dünya modelinin çevreyi kolayca değiştirmesine olanak tanır, bu da dünya modeli ve ajan davranışları hakkında daha fazla bilgi sağlar. Özellikle, belirli oyunlardaki geliştirilmiş performans, kritik görsel detayların daha iyi modellenmesinden kaynaklanmaktadır. DIAMOND çerçevesi, çevreyi standart bir POMDP veya Kısmen Gözlemlenebilir Markov Karar Süreci olarak modellemektedir, bu da bir dizi durum, ayrıksı eylemler ve görüntü gözlemlerinden oluşur. Geçiş fonksiyonları, çevre dinamikleri tanımlar ve ödül fonksiyonu, geçişlere skaler ödüllere ánheder.












