AI-modeller och plattformar
Teknik möjliggör att AI tänker långt in i framtiden
Ett team av forskare från MIT, MIT-IBM Watson AI Lab och andra institutioner har utvecklat en ny metod som möjliggör för artificiell intelligens (AI) att uppnå en långsiktig perspektiv. Med andra ord kan AI tänka långt in i framtiden när de överväger hur deras beteenden kan påverka andra AI-agenter när de slutför en uppgift.
Forskningen är planerad att presenteras på konferensen Conference on Neural Information Processing Systems.
AI som överväger andra agenter framtida handlingar
Det maskinlärningsramverk som teamet skapat möjliggör för samarbetande eller konkurrerande AI-agenter att överväga vad andra agenter kommer att göra. Detta är inte bara över de närmaste stegen, utan snarare när tiden närmar sig oändligheten. Agenterna anpassar sitt beteende därefter för att påverka andra agenter framtida beteenden, vilket hjälper dem att nå optimala, långsiktiga lösningar.
Enligt teamet kan ramverket användas till exempel av en grupp autonoma drönare som arbetar tillsammans för att hitta en förlorad vandrare. Det kan också användas av självkörande fordon för att förutse andra fordon framtida rörelser för att förbättra passagerarsäkerheten.
Dong-Ki Kim är en doktorand i MIT Laboratory for Information and Decision Systems (LIDS) och huvudförfattare till forskningsartikeln.
“När AI-agenter samarbetar eller konkurrerar är det viktigaste när deras beteenden konvergerar vid någon punkt i framtiden”, säger Kim. “Det finns många tillfälliga beteenden längs vägen som inte betyder så mycket på lång sikt. Att nå detta konvergerade beteende är vad vi verkligen bryr oss om, och vi har nu ett matematiskt sätt att möjliggöra det.”
Det problem som forskarna har löst kallas multi-agent förstärkt inlärning, där förstärkt inlärning är en form av maskinlärning där AI-agenter lär sig genom trial and error.
När det finns flera samarbetande eller konkurrerande agenter som samtidigt lär sig, kan processen bli mycket mer komplex. När agenter överväger fler framtida steg av andra agenter, samt deras eget beteende och hur det påverkar andra, kräver problemet för mycket beräkningskraft.
AI som tänker på oändligheten
“AI vill verkligen tänka på spelets slut, men de vet inte när spelet kommer att sluta”, säger Kim. “De måste tänka på hur de kan anpassa sitt beteende till oändligheten så att de kan vinna vid någon avlägsen tidpunkt i framtiden. Vår artikel föreslår i princip ett nytt mål som möjliggör för AI att tänka på oändligheten.”
Det är omöjligt att integrera oändligheten i en algoritm, så teamet utformade systemet så att agenter fokuserar på en framtida punkt där deras beteende kommer att konvergera med andra agenter. Detta kallas för jämvikt, och en jämviktspunkt bestämmer agenternas långsiktiga prestation.
Det är möjligt att flera jämvikter kan existera i en multi-agent scenario, och när en effektiv agent aktivt påverkar andra agenter framtida beteenden, kan de nå en önskvärd jämvikt från agentens perspektiv. När alla agenter påverkar varandra, konvergerar de till en allmän koncept som kallas “aktiv jämvikt”.
FURTHER-ramverk
Teamets maskinlärningsramverk kallas FURTHER, och det möjliggör för agenter att lära sig hur de kan anpassa sitt beteende baserat på deras interaktioner med andra agenter för att uppnå aktiv jämvikt.
Ramverket bygger på två maskinlärningsmoduler. Den första är en inferensmodul som möjliggör för en agent att gissa andra agenter framtida beteenden och de inlärningsalgoritmer de använder baserat på tidigare handlingar. Informationen matas sedan in i förstärkt inlärningsmodul, som agenten förlitar sig på för att anpassa sitt beteende och påverka andra agenter.
“Utmaningen var att tänka på oändligheten. Vi var tvungna att använda många olika matematiska verktyg för att möjliggöra det, och göra vissa antaganden för att få det att fungera i praktiken”, säger Kim.
Teamet testade sin metod mot andra multi-agent förstärkt inlärningsramverk i olika scenarier där AI-agenter som använde FURTHER gick segrande.
Tillvägagångssättet är decentraliserat, så agenterna lär sig att vinna oberoende. Utöver det är det bättre utformat för att skala jämfört med andra metoder som kräver en central dator för att styra agenterna.
Enligt teamet kan FURTHER användas i en stor mängd multi-agentproblem. Kim är särskilt hoppfull om dess tillämpningar inom ekonomi, där det kan användas för att utveckla sund politik i situationer som involverar många interagerande enheter med beteenden och intressen som förändras över tid.












