Modelli e piattaforme di IA

Gli agenti di intelligenza artificiale dimostrano proprietà di intelligenza emergente in un gioco di nascondino virtuale

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Una delle cose interessanti sulla ricerca di intelligenza artificiale è che può spesso eseguire azioni e perseguire strategie che sorprendono gli stessi ricercatori che le progettano. Ciò è accaduto durante un recente gioco virtuale di nascondino in cui sono stati opposti più agenti di intelligenza artificiale. I ricercatori di OpenAI, un’azienda di intelligenza artificiale con sede a San Francisco, sono stati sorpresi nel constatare che i loro agenti di intelligenza artificiale hanno iniziato a sfruttare strategie nel mondo del gioco che i ricercatori non sapevano neanche esistessero.

OpenAI ha addestrato un gruppo di agenti di intelligenza artificiale a giocare a un gioco di nascondino l’uno con l’altro. I programmi di intelligenza artificiale sono stati addestrati con l’apprendimento per rinforzo, una tecnica in cui il comportamento desiderato viene ottenuto dagli algoritmi di intelligenza artificiale fornendo loro un feedback. L’intelligenza artificiale inizia prendendo azioni casuali e ogni volta che prende un’azione che la avvicina al suo obiettivo, l’agente viene ricompensato. L’intelligenza artificiale desidera ottenere la massima quantità di ricompense possibile, quindi sperimenta per vedere quali azioni gliene procureranno di più. Attraverso prove ed errori, l’intelligenza artificiale è in grado di distinguere le strategie che la porteranno alla vittoria, quelle che le daranno la massima ricompensa.

L’apprendimento per rinforzo ha già dimostrato un notevole successo nell’apprendimento delle regole dei giochi. OpenAI ha recentemente addestrato una squadra di intelligenza artificiale a giocare a DOTA 2, e l’intelligenza artificiale ha sconfitto una squadra di giocatori umani campioni del mondo l’anno scorso. Una cosa simile è accaduta con il gioco StarCraft quando un’intelligenza artificiale è stata addestrata sul gioco da DeepMind. L’apprendimento per rinforzo è stato utilizzato anche per insegnare ai programmi di intelligenza artificiale a giocare a Pictionary con gli esseri umani, imparando a interpretare le immagini e utilizzare un ragionamento comune di base.

Nel gioco di nascondino virtuale creato dai ricercatori, più agenti di intelligenza artificiale sono stati opposti l’uno all’altro. Il risultato è stata una sorta di corsa agli armamenti, in cui ogni agente vuole superare l’altro e ottenere il massimo numero di punti di ricompensa. Una nuova strategia adottata da un agente causerà al suo avversario la ricerca di una nuova strategia per contrastarla, e viceversa. Igor Mordatch, un ricercatore di OpenAI, ha spiegato a IEEE Spectrum che l’esperimento dimostra che questo processo di prova ed errore tra agenti “è sufficiente per far sì che gli agenti imparino comportamenti sorprendenti da soli – è come quando i bambini giocano l’uno con l’altro”.

Che cosa erano esattamente questi comportamenti sorprendenti? I ricercatori avevano quattro strategie di base che si aspettavano che gli agenti di intelligenza artificiale imparassero, e le hanno imparate abbastanza velocemente, diventando competenti in esse dopo solo 25 milioni di partite simulate. Il gioco si è svolto in un ambiente 3D pieno di rampe, blocchi e muri. Gli agenti di intelligenza artificiale hanno imparato a inseguirsi a vicenda, spostare i blocchi per costruire fortini in cui nascondersi e spostare le rampe. Gli agenti di ricerca hanno imparato a trascinare le rampe per entrare nei fortini dei nascondigli, mentre i nascondigli hanno imparato a cercare di portare le rampe all’interno dei loro fortini in modo che i cercatori non potessero utilizzarle.

Tuttavia, intorno al benchmark di 380 milioni di partite, è accaduto qualcosa di inaspettato. Gli agenti di intelligenza artificiale hanno imparato a utilizzare due strategie che i ricercatori non si aspettavano. Gli agenti di ricerca hanno imparato che saltando su una scatola e inclinando/ guidando la scatola verso un fortino vicino, potevano saltare nel fortino e trovare il nascondiglio. I ricercatori non avevano neanche realizzato che ciò fosse possibile all’interno della fisica dell’ambiente del gioco. I nascondigli hanno imparato a gestire questo problema trascinando le scatole all’interno dei loro fortini.

Mentre il comportamento inaspettato degli agenti di intelligenza artificiale addestrati con algoritmi di apprendimento per rinforzo è innocuo in questo caso, solleva alcune preoccupazioni potenziali su come l’apprendimento per rinforzo sia applicato ad altre situazioni. Un membro del team di ricerca di OpenAI, Bowen Baker, ha spiegato a IEEE Spectrum che questi comportamenti inaspettati potrebbero essere potenzialmente pericolosi. Dopo tutto, cosa succederebbe se i robot iniziassero a comportarsi in modi inaspettati?

“Costruire questi ambienti è difficile”, ha spiegato Baker. “Gli agenti verranno fuori con questi comportamenti inaspettati, che saranno un problema di sicurezza in futuro quando li si metterà in ambienti più complessi”.

Tuttavia, Baker ha anche spiegato che le strategie di rinforzo potrebbero portare a soluzioni innovative per problemi attuali. I sistemi addestrati con l’apprendimento per rinforzo potrebbero risolvere una vasta gamma di problemi con soluzioni che potremmo non essere in grado di immaginare.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.