AI-modeller og plattformer
Teknologi gjør det mulig for kunstig intelligens å tenke langt inn i fremtiden
Et team av forskere fra MIT, MIT-IBM Watson AI Lab og andre institusjoner har utviklet en ny tilnærming som gjør det mulig for kunstig intelligens (AI) å oppnå en langtidsorientert perspektiv. Med andre ord kan AI tenke langt inn i fremtiden når de vurderer hvordan deres atferd kan inkludere atferden til andre AI-agenter når de fullfører en oppgave.
Forskningen er planlagt å bli presentert på Konferansen for Neural Informasjon Behandling Systems.
Kunstig intelligens som vurderer andre agenter sine fremtidige handlinger
Maskinlæringsrammeverket som er utviklet av teamet, gjør det mulig for samarbeidende eller konkurrerende AI-agenter å vurdere hva andre agenter kommer til å gjøre. Dette er ikke bare over de neste steg, men snarere når tiden nærmer seg uendelighet. Agentene tilpasser sin atferd deretter for å påvirke andre agenter sine fremtidige atferd, og hjelper dem å nå optimale, langsiktige løsninger.
Ifølge teamet kan rammeverket bli brukt, for eksempel, av en gruppe autonome droner som arbeider sammen for å finne en savnet turist. Det kan også bli brukt av selvkjørende kjøretøy for å forutse fremtidige bevegelser av andre kjøretøy for å forbedre passasjer sikkerheten.
Dong-Ki Kim er en masterstudent i MIT Laboratory for Informasjon og Beslutning Systems (LIDS) og hovedforfatter av forskningsrapporten.
“Når AI-agenter samarbeider eller konkurrerer, er det viktigste når deres atferd konvergerer på et visst tidspunkt i fremtiden,” sier Kim. “Det er mange midlertidige atferd langs veien som ikke betyr så mye på lang sikt. Å nå denne konvergerende atferden er det vi virkelig bryr oss om, og vi har nå en matematisk måte å muliggjøre det på.”
Problemet som forskerne har tatt opp, kalles multi-agent forsterkninglæring, hvor forsterkninglæring er en form for maskinlæring hvor AI-agenter lærer gjennom prøving og feil.
Når det er flere samarbeidende eller konkurrerende agenter som lærer samtidig, kan prosessen bli mye mer kompleks. Når agenter vurderer flere fremtidige steg av andre agenter, samt deres egen atferd og hvordan den påvirker andre, krever problemet for mye beregningskraft.
Kunstig intelligens som tenker om uendelighet
“AI-agenter ønsker virkelig å tenke om slutten av spillet, men de vet ikke når spillet kommer til å slutte,” sier Kim. “De må tenke om hvordan de kan tilpasse sin atferd inn i uendelighet så de kan vinne på et visst tidspunkt i fremtiden. Vår rapport foreslår i realiteten et nytt mål som gjør det mulig for AI å tenke om uendelighet.”
Det er umulig å integrere uendelighet i en algoritme, så teamet designet systemet på en måte som gjør at agentene fokuserer på et fremtidig punkt hvor deres atferd vil konvergere med andre agenter. Dette kalles likevekt, og et likevektspunkt bestemmer agentenes langsiktige ytelse.
Det er mulig for flere likevekter å eksistere i en multi-agent scenario, og når en effektiv agent aktivt påvirker fremtidige atferd av andre agenter, kan de nå en ønskelig likevekt fra agentens perspektiv. Når alle agenter påvirker hverandre, konvergerer de til en generell konsept som kalles en “aktiv likevekt”.
FURTHER-rammeverket
Teamets maskinlæringsrammeverk kalles FURTHER, og det gjør det mulig for agenter å lære hvordan de kan tilpasse sin atferd basert på deres interaksjoner med andre agenter for å nå aktiv likevekt.
Rammeverket er avhengig av to maskinlæringsmoduler. Den første er en inferensmodul som gjør det mulig for en agent å gjette fremtidige atferd av andre agenter og læring salgoritmer de bruker basert på tidligere handlinger. Informasjonen blir deretter matet inn i forsterkninglæringsmodulen, som agenten avhenger av for å tilpasse sin atferd og påvirke andre agenter.
“Utfordringen var å tenke om uendelighet. Vi måtte bruke mange forskjellige matematiske verktøy for å muliggjøre det, og gjøre noen antagelser for å få det til å fungere i praksis,” sier Kim.
Teamet testet sin metode mot andre multi-agent forsterkninglæringsrammeverk i forskjellige scenarier hvor AI-agenter som bruker FURTHER kom ut på topp.
Tilnærmingen er desentralisert, så agentene lærer å vinne uavhengig. I tillegg er det bedre designet for å skaleres sammenlignet med andre metoder som krever en sentral datamaskin for å kontrollere agentene.
Ifølge teamet kan FURTHER bli brukt i en rekke multi-agent problemer. Kim er spesielt håpefull for dens anvendelser i økonomi, hvor det kan bli brukt til å utvikle sunn politikk i situasjoner som involverer mange samhandlende enheter med atferd og interesser som endrer seg over tid.












