Modele i platformy AI
DIAMOND: Wizualne szczegÃģÅy majÄ znaczenie w Atari i dyfuzji dla modelowania Åwiata
W 2018 roku po raz pierwszy wprowadzono ideÄ uczenia wzmacniania w kontekÅcie Årodowiska modelu neuronowej sieci, a niedÅugo potem ten fundamentalny princip zostaÅ zastosowany w modelach Åwiata. NiektÃģre z najbardziej znaczÄ cych modeli, ktÃģre zaimplementowaÅy uczenie wzmacniania, to ramy Dreamer, ktÃģre wprowadziÅy uczenie wzmacniania z latentnego przestrzeni modelu przestrzeni stanu. DreamerV2 wykazaÅ, Åže uÅžycie dyskretnych latentÃģw moÅže skutkowaÄ zmniejszeniem bÅÄdÃģw skÅadanych, a ramy DreamerV3 osiÄ gnÄÅy wyniki porÃģwnywalne z ludzkimi na serii zadaÅ w rÃģÅžnych dziedzinach z ustalonymi hiperparametrami.
Ponadto moÅžna wysnuÄ paralele miÄdzy modelami generowania obrazÃģw a modelami Åwiata, wskazujÄ c, Åže postÄp w modelach widzenia generatywnego moÅže byÄ powielony, aby przynieÅÄ korzyÅci modelom Åwiata. OdkÄ d uÅžycie transformatorÃģw w ramach przetwarzania jÄzyka naturalnego zyskaÅo na popularnoÅci, pojawiÅy siÄ ramy DALL-E i VQGAN. Ramy te zaimplementowaÅy dyskretne autoenkodery do konwersji obrazÃģw na dyskretne tokeny i byÅy w stanie zbudowaÄ bardzo potÄÅžne i wydajne modele generatywne tekstu do obrazu, wykorzystujÄ c sekwencyjne moÅžliwoÅci modelowania autoregresyjnych transformatorÃģw. W tym samym czasie modele dyfuzji zyskaÅy na popularnoÅci, a dziÅ modele dyfuzji ustanowiÅy siÄ jako dominujÄ cy paradygmat generowania obrazÃģw o wysokiej rozdzielczoÅci. DziÄki moÅžliwoÅciom oferowanym przez modele dyfuzji i uczenie wzmacniania, podejmowane sÄ prÃģby poÅÄ czenia tych dwÃģch podejÅÄ, z celem wykorzystania elastycznoÅci modeli dyfuzji jako modeli trajektorii, modeli nagrÃģd, planistÃģw i jako polityki dla augmentacji danych w trybie offline uczenia wzmacniania.
Modele Åwiata oferujÄ obiecujÄ cÄ metodÄ szkolenia agentÃģw uczenia wzmacniania w sposÃģb bezpieczny i wydajny. Tradycyjnie te modele wykorzystujÄ sekwencje dyskretnych zmiennych latentnych do symulowania dynamiki Årodowiska. JednakÅže ta kompresja moÅže zignorowaÄ wizualne szczegÃģÅy niezbÄdne dla uczenia wzmacniania. W tym samym czasie modele dyfuzji zyskaÅy na popularnoÅci w generowaniu obrazÃģw, wyzwajÄ c tradycyjne metody, ktÃģre wykorzystujÄ dyskretne latenty. Zainspirowani tym przesuniÄciem, w tym artykule bÄdziemy rozmawiaÄ o DIAMOND (DIffusion As a Model Of eNvironment Dreams), agencie uczenia wzmacniania szkolonym w ramach modelu Åwiata dyfuzji. BÄdziemy eksplorowaÄ niezbÄdne wybory projektowe, aby uczyniÄ dyfuzjÄ odpowiedniÄ dla modelowania Åwiata, i pokaÅžemy, Åže udoskonalone wizualne szczegÃģÅy prowadzÄ do lepszej wydajnoÅci agenta. DIAMOND ustanawia nowy benchmark na konkurencyjnym teÅcie Atari 100k, osiÄ gajÄ c Åredni wynik ludzki znormalizowany na poziomie 1,46, najwyÅžszy dla agentÃģw szkolonych caÅkowicie w ramach modelu Åwiata.
DIAMOND: Wizualne szczegÃģÅy majÄ znaczenie w Atari i dyfuzji dla modelowania Åwiata
Modele Åwiata lub generatywne modele Årodowiska stajÄ siÄ jednym z najwaÅžniejszych komponentÃģw dla agentÃģw generatywnych do planowania i rozumowania o ich Årodowiskach. ChociaÅž uÅžycie uczenia wzmacniania osiÄ gnÄÅo znaczny sukces w ostatnich latach, modele zaimplementowane z uczeniem wzmacniania sÄ znane z tego, Åže sÄ nieefektywne pod wzglÄdem prÃģbek, co znacznie ogranicza ich zastosowanie w Åwiecie rzeczywistym. Z drugiej strony, modele Åwiata wykazaÅy swojÄ zdolnoÅÄ do efektywnego szkolenia agentÃģw uczenia wzmacniania w rÃģÅžnych Årodowiskach z znacznie poprawionÄ efektywnoÅciÄ prÃģbek, pozwalajÄ c modelowi uczyÄ siÄ z doÅwiadczeÅ Åwiata rzeczywistego. Niedawne ramy modelowania Åwiata zwykle modelujÄ dynamikÄ Årodowiska jako sekwencjÄ dyskretnych zmiennych latentnych, z modelem dyskretnym w przestrzeni latentnej, aby uniknÄ Ä bÅÄdÃģw skÅadanych w wieloetapowych horyzontach czasowych. ChociaÅž podejÅcie to moÅže dostarczyÄ znaczne wyniki, jest rÃģwnieÅž zwiÄ zane ze stratÄ informacji, prowadzÄ cÄ do utraty jakoÅci rekonstrukcji i utraty ogÃģlnoÅci. Utrata informacji moÅže staÄ siÄ znaczÄ cÄ przeszkodÄ w scenariuszach Åwiata rzeczywistego, ktÃģre wymagajÄ , aby informacje byÅy dobrze zdefiniowane, takie jak szkolenie pojazdÃģw autonomicznych. W takich zadaniach maÅe zmiany lub szczegÃģÅy wejÅcia wizualnego, takie jak kolor ÅwiatÅa drogowego lub wskaÅšnik skrÄtu pojazdu przed, mogÄ zmieniÄ politykÄ agenta. ChociaÅž zwiÄkszenie liczby dyskretnych latentÃģw moÅže pomÃģc uniknÄ Ä utraty informacji, znacznie zwiÄksza koszty obliczeniowe.
Ponadto w ostatnich latach modele dyfuzji wyÅoniÅy siÄ jako dominujÄ ce podejÅcie do generowania obrazÃģw o wysokiej jakoÅci, poniewaÅž ramy zbudowane na modelach dyfuzji uczÄ siÄ odwracaÄ proces haÅasowania i bezpoÅrednio konkurujÄ z niektÃģrymi bardziej ugruntowanymi podejÅciami modelowania tokenÃģw dyskretnych, oferujÄ c obiecujÄ cÄ alternatywÄ dla eliminacji potrzeby dyskretyzacji w modelowaniu Åwiata. Modele dyfuzji sÄ znane z ich zdolnoÅci do Åatwego warunkowania i elastycznego modelowania zÅoÅžonych, wielomodalnych rozkÅadÃģw bez kolapsu trybu. Atrybuty te sÄ kluczowe dla modelowania Åwiata, poniewaÅž warunkowanie umoÅžliwia modelowi Åwiata dokÅadnie odzwierciedliÄ dziaÅania agenta, prowadzÄ c do bardziej niezawodnego przypisania kredytu. Ponadto modelowanie rozkÅadÃģw wielomodalnych oferuje wiÄkszÄ rÃģÅžnorodnoÅÄ scenariuszy szkoleniowych dla agenta, poprawiajÄ c jego ogÃģlnÄ wydajnoÅÄ.
BudujÄ c na tych cechach, DIAMOND (DIffusion As a Model Of eNvironment Dreams) to agent uczenia wzmacniania szkolony w ramach modelu Åwiata dyfuzji. Ramy DIAMOND dokonujÄ starannych wyborÃģw projektowych, aby zapewniÄ, Åže ich model Åwiata dyfuzji pozostaje wydajny i stabilny w dÅugich horyzontach czasowych. Ramy DIAMOND zapewniajÄ jakoÅciowÄ analizÄ, aby zademonstrowaÄ znaczenie tych wyborÃģw projektowych. DIAMOND ustanawia nowy stan sztuki z Årednim wynikiem ludzki znormalizowanym na poziomie 1,46 na dobrze ugruntowanym teÅcie Atari 100k, najwyÅžszym dla agentÃģw szkolonych caÅkowicie w ramach modelu Åwiata. DziaÅanie w przestrzeni obrazu pozwala modelowi Åwiata DIAMOND na bezproblemowÄ substytucjÄ Årodowiska, oferujÄ c wiÄksze wglÄ dy w zachowania modelu Åwiata i agenta. Godne uwagi jest to, Åže poprawiona wydajnoÅÄ w pewnych grach jest przypisywana lepszemu modelowaniu krytycznych szczegÃģÅÃģw wizualnych. Ramy DIAMOND modelujÄ Årodowisko jako standardowy proces decyzyjny Markowa z czÄÅciowo obserwowalnym stanem z zestawem stanÃģw, zestawem dyskretnych dziaÅaÅ i zestawem obserwacji obrazu. Funkcje przejÅcia opisujÄ dynamikÄ Årodowiska, a funkcja nagrody mapuje przejÅcia na skalarnÄ nagrodÄ.
DIAMOND: Metodologia i Architektura
W swojej istocie modele dyfuzji sÄ klasÄ modeli generatywnych, ktÃģre generujÄ prÃģbkÄ przez odwrÃģcenie procesu haÅasowania i czerpiÄ inspiracjÄ z termodynamiki nieequlibrium. Ramy DIAMOND rozwaÅžajÄ proces dyfuzji indeksowany przez ciÄ gÅÄ zmiennÄ czasowÄ z odpowiednimi marginalnymi i warunkami brzegowymi z traktowalnÄ nieustrukturalizowanÄ dystrybucjÄ a priori. Ponadto, aby uzyskaÄ model generatywny, ktÃģry mapuje od haÅasu do danych, ramy DIAMOND muszÄ odwrÃģciÄ proces, a proces odwrÃģcenia jest rÃģwnieÅž modelem dyfuzji, ktÃģry dziaÅa wstecz w czasie. Ponadto, w dowolnym punkcie czasu nie jest trywialne oszacowanie funkcji skory, poniewaÅž ramy DIAMOND nie majÄ dostÄpu do prawdziwej funkcji skory, a model pokonuje tÄ przeszkodÄ, implementujÄ c cel dopasowania skory, podejÅcie, ktÃģre umoÅžliwia ramom szkolenia modelu skory bez znajomoÅci podstawowej funkcji skory. Model dyfuzji oparty na skory zapewnia niewarunkowy model generatywny. Jednak warunkowy model generatywny dynamiki Årodowiska jest wymagany do sÅuÅženia jako model Åwiata, a aby sÅuÅžyÄ temu celowi, ramy DIAMOND rozwaÅžajÄ ogÃģlny przypadek podejÅcia POMDP, w ktÃģrym ramy mogÄ wykorzystywaÄ poprzednie obserwacje i dziaÅania, aby przybliÅžyÄ nieznany stan Markowa. Jak to zostaÅo zademonstrowane na Rysunku 1, ramy DIAMOND wykorzystujÄ tÄ historiÄ do warunkowania modelu dyfuzji, aby oszacowaÄ i wygenerowaÄ nastÄpnÄ obserwacjÄ bezpoÅrednio. ChociaÅž ramy DIAMOND mogÄ teoretycznie wykorzystywaÄ dowolny rozwiÄ zujÄ cy SDE lub ODE, istnieje kompromis miÄdzy NFE (liczbÄ ocen funkcji) a jakoÅciÄ prÃģbki, ktÃģry znacznie wpÅywa na koszt wnioskowania modeli dyfuzji.
BudujÄ c na tych wnioskach, spÃģjrzmy teraz na praktycznÄ realizacjÄ ram DIAMOND modelu Åwiata opartego na dyfuzji, w tym wspÃģÅczynniki dryftu i dyfuzji odpowiadajÄ ce okreÅlonemu wyborowi podejÅcia dyfuzji. Zamiast wybraÄ DDPM, naturalnie odpowiedniego kandydata do tego zadania, ramy DIAMOND budujÄ na sformalizowaniu EDM i rozwaÅžajÄ jÄ dro perturbacji z funkcjÄ wartoÅci rzeczywistej czasu dyfuzji, zwanÄ harmonogramem haÅasu. Ramy wybierajÄ prekondycjonery, aby utrzymaÄ wejÅciowÄ i wyjÅciowÄ wariancjÄ dla dowolnego poziomu gÅosu. Szkolenie sieci ÅÄ czy sygnaÅ i haÅas w zaleÅžnoÅci od poziomu degradacji, a gdy haÅas jest niski, a celem staje siÄ rÃģÅžnica miÄdzy czystym a zakÅÃģconym sygnaÅem, czyli dodanym haÅasem Gaussa. Intuicyjnie, to zapobiega temu, aby cel szkolenia staÅ siÄ trywialny w reÅžimie niskiego haÅasu. W praktyce ten cel jest wysoko zmienny na kraÅcach harmonogramu haÅasu, wiÄc model prÃģbkuj haÅas z log-normalnej dystrybucji wybranej empirycznie, aby poÅÄ czyÄ szkolenie wokÃģÅ Årednich obszarÃģw haÅasu. Ramy DIAMOND wykorzystujÄ standardowy komponent U-Net 2D dla pola wektorowego i utrzymujÄ bufor poprzednich obserwacji i dziaÅaÅ, ktÃģre ramy wykorzystujÄ do warunkowania siebie. NastÄpnie ramy DIAMOND ÅÄ czÄ te poprzednie obserwacje z nastÄpnÄ zakÅÃģconÄ obserwacjÄ i wejÅciowymi dziaÅaniami przez warstwy normalizacji grupowej w blokach resztowych U-Net.
DIAMOND: Eksperymenty i Wyniki
Do kompleksowej oceny ramy DIAMOND wybierajÄ benchmark Atari 100k. Benchmark Atari 100k skÅada siÄ z 26 gier zaprojektowanych do testowania szerokiego zakresu moÅžliwoÅci agenta. W kaÅždej grze agent jest ograniczony do 100k akcji w Årodowisku, co jest rÃģwnowaÅžne z okoÅo 2 godzinami gry ludzkiej, aby nauczyÄ siÄ gry przed ocenÄ . Dla porÃģwnania, nieograniczone agenty Atari zwykle trenujÄ przez 50 milionÃģw krokÃģw, reprezentujÄ c 500-krotny wzrost doÅwiadczenia. TrenowaliÅmy DIAMOND od podstaw przy uÅžyciu 5 losowych nasion dla kaÅždej gry. KaÅždy przebieg treningu wymagaÅ okoÅo 12GB pamiÄci VRAM i trwaÅ okoÅo 2,9 dni na jednej karcie graficznej Nvidia RTX 4090, co stanowi 1,03 roku GPU w sumie. PoniÅžsza tabela zawiera wynik dla wszystkich gier, ÅredniÄ i IQM (ÅredniÄ miÄdzykwartylowÄ ) wynikÃģw znormalizowanych do ludzkich.
Po ograniczeniach estymacji punktowych ramy DIAMOND zapewniajÄ stratyfikowanÄ ufnoÅÄ bootstrap w Åredniej i IQM wynikÃģw znormalizowanych do ludzkich wraz z profilami wydajnoÅci i dodatkowymi metrykami, jak to zostaÅo podsumowane w poniÅžszym rysunku.
Wyniki pokazujÄ , Åže DIAMOND wykonuje siÄ wyjÄ tkowo dobrze w caÅym benchmarku, przewyÅžszajÄ c graczy ludzkich w 11 grach i osiÄ gajÄ c nadludzki Åredni wynik znormalizowany do 1,46, ustanawiajÄ c nowy rekord dla agentÃģw szkolonych caÅkowicie w ramach modelu Åwiata. Ponadto, DIAMOND wyrÃģÅžnia siÄ w Årodowiskach, w ktÃģrych przechwycenie maÅych szczegÃģÅÃģw jest kluczowe, takich jak Asterix, Breakout i RoadRunner. Ponadto, jak omÃģwiono wczeÅniej, ramy DIAMOND majÄ elastycznoÅÄ implementowania dowolnego modelu dyfuzji w swoim potoku, chociaÅž wybierajÄ podejÅcie EDM, byÅoby to naturalne wybranie modelu DDPM, poniewaÅž jest on juÅž wdroÅžony w licznych aplikacjach generowania obrazÃģw. Aby porÃģwnaÄ podejÅcie EDM z implementacjÄ DDPM, ramy DIAMOND trenujÄ oba warianty z tÄ samÄ architekturÄ sieci na tym samym wspÃģÅdzielonym zestawie danych statycznych z ponad 100k klatkami zebranymi z ekspertem. Liczba krokÃģw denoisingu jest bezpoÅrednio zwiÄ zana z kosztem wnioskowania modelu Åwiata, a wiÄc mniej krokÃģw zmniejszy koszt treningu agenta na wyobraÅžonych trajektoriach. Aby upewniÄ siÄ, Åže nasz model Åwiata pozostaje komputacyjnie porÃģwnywalny z innymi benchmarkami, takimi jak IRIS, ktÃģre wymagajÄ 16 NFE na krok, staramy siÄ wykorzystywaÄ nie wiÄcej niÅž dziesiÄ tki krokÃģw denoisingu, a najlepiej mniej. Jednak ustawienie liczby krokÃģw denoisingu zbyt niskiego moÅže pogorszyÄ jakoÅÄ wizualnÄ , prowadzÄ c do bÅÄdÃģw skÅadanych. Aby oceniÄ stabilnoÅÄ rÃģÅžnych wariantÃģw dyfuzji, wyÅwietlamy wyobraÅžone trajektorie generowane autoregresyjnie do t = 1000 krokÃģw w poniÅžszym rysunku, przy uÅžyciu rÃģÅžnej liczby krokÃģw denoisingu n âĪ 10.
Obserwujemy, Åže uÅžycie DDPM (a) w tym reÅžimie skutkuje powaÅžnymi bÅÄdami skÅadanymi, powodujÄ c, Åže model Åwiata szybko wykracza poza dystrybucjÄ. W przeciwieÅstwie do tego, model Åwiata dyfuzji oparty na EDM (b) pozostaje znacznie bardziej stabilny w dÅugich horyzontach czasowych, nawet z jednym krokiem denoisingu. WyobraÅžone trajektorie z modelem dyfuzji opartym na DDPM (po lewej) i EDM (po prawej) sÄ pokazane. PoczÄ tkowa obserwacja w t = 0 jest taka sama dla obu, a kaÅždy wiersz odpowiada malejÄ cej liczbie krokÃģw denoisingu n. Obserwujemy, Åže generacja oparta na DDPM cierpi na bÅÄdy skÅadane, a mniejsza liczba krokÃģw denoisingu prowadzi do szybszego nagromadzenia bÅÄdÃģw. W przeciwieÅstwie do tego, model Åwiata DIAMOND oparty na EDM pozostaje znacznie bardziej stabilny, nawet dla n = 1. Optymalna predykcja jednego kroku jest oczekiwaniem nad moÅžliwymi rekonstrukcjami dla danego wejÅcia zakÅÃģconego, ktÃģre moÅže byÄ poza dystrybucjÄ , jeÅli rozkÅad a posteriori jest wielomodalny. ChociaÅž niektÃģre gry, takie jak Breakout, majÄ deterministyczne przejÅcia, ktÃģre mogÄ byÄ dokÅadnie modelowane za pomocÄ jednego kroku denoisingu, inne gry wykazujÄ czÄÅciowÄ obserwowalnoÅÄ, skutkujÄ c wielomodalnymi rozkÅadami obserwacji. W takich przypadkach rozwiÄ zanie iteracyjne jest konieczne do kierowania procedurÄ prÃģbkowania w kierunku okreÅlonego trybu, jak to zostaÅo zademonstrowane w grze Boxing w poniÅžszym rysunku. W zwiÄ zku z tym ramy DIAMOND ustawiajÄ n = 3 we wszystkich eksperymentach.
PowyÅžszy rysunek porÃģwnuje prÃģbkowanie jednego kroku (gÃģrny wiersz) i prÃģbkowanie wielokroku (dolny wiersz) w Boxing. Ruchy czarnego gracza sÄ nieprzewidywalne, powodujÄ c, Åže prÃģbkowanie jednego kroku interpoluje miÄdzy moÅžliwymi wynikami, skutkujÄ c rozmytymi predykcjami. W przeciwieÅstwie do tego, prÃģbkowanie wielokroku produkuje wyraÅšny obraz, kierujÄ c generacjÄ w kierunku okreÅlonego trybu. Co ciekawe, poniewaÅž polityka kontroluje biaÅego gracza, jego dziaÅania sÄ znane modelowi Åwiata, eliminujÄ c niepewnoÅÄ. Zatem zarÃģwno prÃģbkowanie jednego kroku, jak i prÃģbkowanie wielokroku poprawnie przewidujÄ pozycjÄ biaÅego gracza.
W powyÅžszym rysunku trajektorie wyobraÅžone przez DIAMOND ogÃģlnie wykazujÄ wyÅžszÄ jakoÅÄ wizualnÄ i sÄ bardziej wiernymi odwzorowaniem Årodowiska rzeczywistego w porÃģwnaniu z tymi wyobraÅžonymi przez IRIS. Trajektorie wygenerowane przez IRIS zawierajÄ nieÅcisÅoÅci wizualne miÄdzy klatkami (wyrÃģÅžnione biaÅymi prostokÄ tami), takie jak wrogowie wyÅwietlani jako nagrody i odwrotnie. ChociaÅž te nieÅcisÅoÅci mogÄ wpÅywaÄ tylko na kilka pikseli, mogÄ one znacznie wpÅynÄ Ä na uczenie wzmacniania. Na przykÅad, agent zwykle stara siÄ celowaÄ w nagrody i unikaÄ wrogÃģw, wiÄc te maÅe nieÅcisÅoÅci wizualne mogÄ utrudniÄ naukÄ optymalnej polityki. Rysunek pokazuje kolejne klatki wyobraÅžone przez IRIS (po lewej) i DIAMOND (po prawej). BiaÅe prostokÄ ty wyrÃģÅžniajÄ nieÅcisÅoÅci miÄdzy klatkami, ktÃģre pojawiajÄ siÄ tylko w trajektoriach wygenerowanych przez IRIS. W Asterix (gÃģrny wiersz) wrÃģg (pomaraÅczowy) staje siÄ nagrodÄ (czerwony) w drugiej klatce, a nastÄpnie wraca do wroga w trzeciej, i ponownie do nagrody w czwartej. W Breakout (Årodkowy wiersz) cegÅy i wynik sÄ nieÅcisÅe miÄdzy klatkami. W Road Runner (dolny wiersz) nagrody (maÅe niebieskie kropki na drodze) sÄ nieÅcisÅe miÄdzy klatkami. Te nieÅcisÅoÅci nie wystÄpujÄ w DIAMOND. W Breakout wynik jest niezawodnie aktualizowany o +7, gdy czerwona cegÅa jest zniszczona.
Wnioski
W tym artykule omÃģwiliÅmy DIAMOND, agenta uczenia wzmacniania szkolonego w ramach modelu Åwiata dyfuzji. Ramy DIAMOND dokonujÄ starannych wyborÃģw projektowych, aby zapewniÄ, Åže ich model Åwiata dyfuzji pozostaje wydajny i stabilny w dÅugich horyzontach czasowych. Ramy DIAMOND zapewniajÄ jakoÅciowÄ analizÄ, aby zademonstrowaÄ znaczenie tych wyborÃģw projektowych. DIAMOND ustanawia nowy stan sztuki z Årednim wynikiem ludzki znormalizowanym na poziomie 1,46 na dobrze ugruntowanym teÅcie Atari 100k, najwyÅžszym dla agentÃģw szkolonych caÅkowicie w ramach modelu Åwiata. DziaÅanie w przestrzeni obrazu pozwala modelowi Åwiata DIAMOND na bezproblemowÄ substytucjÄ Årodowiska, oferujÄ c wiÄksze wglÄ dy w zachowania modelu Åwiata i agenta. Godne uwagi jest to, Åže poprawiona wydajnoÅÄ w pewnych grach jest przypisywana lepszemu modelowaniu krytycznych szczegÃģÅÃģw wizualnych. Ramy DIAMOND modelujÄ Årodowisko jako standardowy proces decyzyjny Markowa z czÄÅciowo obserwowalnym stanem z zestawem stanÃģw, zestawem dyskretnych dziaÅaÅ i zestawem obserwacji obrazu. Funkcje przejÅcia opisujÄ dynamikÄ Årodowiska, a funkcja nagrody mapuje przejÅcia na skalarnÄ nagrodÄ.












