Modelli e piattaforme di IA

I ricercatori di intelligenza artificiale creano un modello di gioco di video che può ricordare eventi passati

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Un team di ricercatori del laboratorio di intelligenza artificiale di Uber ha recentemente sviluppato un sistema di algoritmi di intelligenza artificiale che hanno superato sia i giocatori umani che altri sistemi di intelligenza artificiale ai classici giochi Atari. Il sistema di intelligenza artificiale sviluppato dai ricercatori è in grado di ricordare strategie precedentemente utilizzate con successo, creando nuove strategie basate su ciò che ha funzionato in passato. Il team di ricerca ritiene che gli algoritmi da loro sviluppati abbiano potenziali applicazioni in altri campi tecnici come l’elaborazione del linguaggio e la robotica.

Il metodo tipico utilizzato per creare sistemi di intelligenza artificiale in grado di giocare ai videogiochi è utilizzare un algoritmo di apprendimento per rinforzo. Gli algoritmi di apprendimento per rinforzo imparano a eseguire un compito esplorando una serie di azioni possibili e, dopo ogni azione, vengono forniti con un tipo di rinforzo (una ricompensa o una punizione). Nel tempo, il modello di intelligenza artificiale impara quali azioni portano a ricompense più grandi e diventa più probabile che vengano eseguite queste azioni. Purtroppo, i modelli di apprendimento per rinforzo incontrano difficoltà quando si trovano di fronte a dati incongrui con gli altri nel set di dati.

Secondo il team di ricerca, il motivo per cui il loro approccio non è stato considerato da altri ricercatori di intelligenza artificiale è che la strategia differisce dall’approccio di “motivazione intrinseca” tipicamente utilizzato nell’apprendimento per rinforzo. Il problema con un approccio di motivazione intrinseca è che il modello può essere propenso a “dimenticare” aree potenzialmente gratificanti che meritano ancora di essere esplorate. Questo fenomeno è noto come “distacco”. Di conseguenza, quando il modello incontra dati inaspettati, può dimenticare aree che dovrebbero ancora essere esplorate.

Secondo TechXplore, il team di ricerca ha cercato di creare un modello di apprendimento più flessibile e in grado di rispondere a dati inaspettati. I ricercatori hanno superato questo problema introducendo un algoritmo in grado di ricordare tutte le azioni eseguite da una versione precedente del modello quando ha cercato di risolvere un problema. Quando il modello di intelligenza artificiale incontra un punto di dati che non è coerente con ciò che ha imparato finora, il modello controlla la sua mappa della memoria. Il modello identificherà quindi quali strategie sono state utilizzate con successo e quali no e sceglierà le strategie di conseguenza.

Quando gioca a un videogioco, il modello raccoglie screenshot del gioco mentre gioca, creando un registro delle sue azioni. Le immagini vengono raggruppate insieme in base alla somiglianza, formando punti chiari nel tempo a cui il modello può fare riferimento. L’algoritmo può utilizzare le immagini registrate per tornare a un punto interessante nel tempo e continuare a esplorare da lì. Quando il modello scopre di stare perdendo, si riferirà alle screenshot prese e proverà una strategia diversa.

Secondo la BBC, c’è anche il problema di gestire scenari pericolosi per l’agente di intelligenza artificiale che gioca al gioco. Se l’agente si imbatte in un pericolo che può ucciderlo, ciò impedirebbe di tornare a aree che meritano ulteriore esplorazione, un problema noto come “deragliamento”. Il modello di intelligenza artificiale gestisce i problemi di deragliamento attraverso un processo separato da quello utilizzato per incoraggiare l’esplorazione di aree vecchie.

Il team di ricerca ha fatto giocare il modello in 55 giochi Atari. Questi giochi sono comunemente utilizzati per valutare le prestazioni dei modelli di intelligenza artificiale, ma i ricercatori hanno aggiunto una torsione al modello. I ricercatori hanno introdotto regole aggiuntive ai giochi, istruendo il modello a non solo raggiungere il punteggio più alto possibile, ma anche a cercare di raggiungere un punteggio ancora più alto ogni volta. Quando i risultati delle prestazioni del modello sono stati analizzati, i ricercatori hanno scoperto che il loro sistema di intelligenza artificiale ha superato altri sistemi di intelligenza artificiale ai giochi circa l’85% del tempo. Il modello di intelligenza artificiale si è esibito particolarmente bene nel gioco Montezuma’s Revenge, un gioco di piattaforme in cui il giocatore evita pericoli e raccoglie tesori. Il gioco ha battuto il record per un giocatore umano e ha anche segnato più alto di qualsiasi altro sistema di intelligenza artificiale.

Secondo i ricercatori di intelligenza artificiale di Uber, le strategie utilizzate dal team di ricerca hanno applicazioni per settori come la robotica. I robot beneficiano della capacità di ricordare quali azioni sono state utilizzate con successo, quali non hanno funzionato e quali non sono state ancora provate.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.