Modele și platforme AI
Cercetători în domeniul inteligenței artificiale creează un model de joc video care poate să-și amintească evenimente trecute

O echipă de cercetători de la laboratorul de inteligență artificială al companiei Uber a dezvoltat recent un sistem de algoritmi de inteligență artificială care a depășit atât jucătorii umani, cât și alte sisteme de inteligență artificială la jocuri video clasice Atari. Sistemul de inteligență artificială dezvoltat de cercetători este capabil să-și amintească strategiile anterioară cu succes, creând noi strategii pe baza a ceea ce a funcționat în trecut. Echipa de cercetare a studiat consideră că algoritmii pe care i-au dezvoltat au aplicații potențiale în alte domenii tehnice, cum ar fi procesarea limbajului și robotica.
Metoda obișnuită utilizată pentru a crea sisteme de inteligență artificială capabile să joace jocuri video este de a utiliza un algoritm de învățare prin întărire. Algoritmii de învățare prin întărire învață să efectueze o sarcină prin explorarea unei game de acțiuni posibile, iar după fiecare acțiune, primesc o întărire (o recompensă sau o pedeapsă). În timp, modelul de inteligență artificială învață care acțiuni duc la recompense mai mari și devine mai probabil să efectueze aceste acțiuni. Din nefericire, modelele de învățare prin întărire întâmpină dificultăți atunci când se confruntă cu puncte de date incoerente cu altele din setul de date.
Conform echipei de cercetare, motivul pentru care abordarea lor nu a fost luată în considerare de alți cercetători în domeniul inteligenței artificiale este că strategia diferă de abordarea “motivației intrinseci” utilizată în mod obișnuit în învățarea prin întărire. Problema cu o abordare de motivație intrinsecă este că modelul poate fi predispus la “uitare” a unor zone potențial recompensatoare care încă merită explorare. Acest fenomen se numește “detașare”. Ca urmare, atunci când modelul întâlnește date neașteptate, poate uita zone care ar trebui încă să fie explorate.
Conform TechXplore, echipa de cercetare a urmărit să creeze un model de învățare mai flexibil și capabil să răspundă la date neașteptate. Cercetătorii au depășit această problemă prin introducerea unui algoritm capabil să-și amintească toate acțiunile efectuate de o versiune anterioară a modelului atunci când a încercat să rezolve o problemă. Atunci când modelul de inteligență artificială întâlnește un punct de date care nu este coerent cu ceea ce a învățat până acum, modelul verifică harta sa de memorie. Modelul va identifica apoi care strategii au reușit și au eșuat și va alege strategiile corespunzătoare.
Când joacă un joc video, modelul colectează capturi de ecran ale jocului pe măsură ce joacă, făcând un jurnal al acțiunilor sale. Imaginile sunt grupate împreună pe baza similarității, formând puncte clare în timp la care modelul se poate referi. Algoritmul poate utiliza imaginile înregistrate pentru a reveni la un punct interesant în timp și a continua explorarea de acolo. Când modelul constată că pierde, se va referi la capturile de ecran luate și va încerca o strategie diferită.
Așa cum explică BBC, există și problema gestionării scenariilor periculoase pentru agentul de inteligență artificială care joacă jocul. Dacă agentul se confruntă cu un pericol care îl poate omorî, acesta ar împiedica revenirea la zone care merită explorate, o problemă numită “deraiere”. Modelul de inteligență artificială gestionează problemele de deraiere prin intermediul unui proces separat de cel utilizat pentru a încuraja explorarea zonelor vechi.
Echipa de cercetare a făcut ca modelul să joace 55 de jocuri Atari. Aceste jocuri sunt utilizate în mod obișnuit pentru a evalua performanța modelelor de inteligență artificială, dar cercetătorii au adăugat o întorsătură pentru modelul lor. Cercetătorii au introdus reguli suplimentare pentru jocuri, instruind modelul să nu numai să obțină scorul cel mai ridicat posibil, ci să încerce să obțină un scor și mai ridicat de fiecare dată. Atunci când s-au analizat rezultatele performanței modelului, cercetătorii au constatat că sistemul de inteligență artificială pe care l-au dezvoltat a depășit alte sisteme de inteligență artificială la jocuri cu aproximativ 85% din timp. Modelul de inteligență artificială a performant în mod special la jocul Montezuma’s Revenge, un joc de platformă în care jucătorul evită pericole și colectează comori. Jocul a bătut recordul pentru un jucător uman și a obținut un scor mai ridicat decât orice alt sistem de inteligență artificială.
Conform cercetătorilor de la Uber în domeniul inteligenței artificiale, strategiile utilizate de echipa de cercetare au aplicații pentru industrii precum robotica. Rooboții beneficiază de capacitatea de a-și aminti care acțiuni au fost de succes, care nu au funcționat și care nu au fost încă încercate.












