AI-modeller og platforme
Teknik tillader AI at tænke langt ind i fremtiden
Et team af forskere fra MIT, MIT-IBM Watson AI Lab og andre institutioner har udviklet en ny tilgang, der giver kunstig intelligens (AI) mulighed for at opnå en langsigtede perspektiv. Med andre ord kan AI tænke langt ind i fremtiden, når de overvejer, hvordan deres adfærd kan omfatte adfærd hos andre AI-agenter, når de udfører en opgave.
Forskningen er planlagt til at blive præsenteret på Konferencen om Neurale Information Processing Systemer.
AI overvejer andre agenter’s fremtidige handlinger
Det maskinlæringsramme, som teamet har skabt, giver kooperative eller konkurrerende AI-agenter mulighed for at overveje, hvad andre agenter vil gøre. Dette er ikke kun over de næste skridt, men snarere som tiden nærmer sig uendeligheden. Agenterna tilpasser deres adfærd herefter for at påvirke andre agenter’s fremtidige adfærd, hvilket hjælper dem med at nå optimale, langsigtede løsninger.
Ifølge teamet kan rammeværket fx bruges af en gruppe autonome droner, der arbejder sammen for at finde en savnet vandrer. Det kan også bruges af selv kørende køretøjer til at forudse fremtidige bevægelser af andre køretøjer for at forbedre passagerernes sikkerhed.
Dong-Ki Kim er en ph.d.-studerende på MIT Laboratory for Information and Decision Systems (LIDS) og hovedforfatter på forskningspapiret.
“Når AI-agenter samarbejder eller konkurrerer, er det vigtigste, hvornår deres adfærd konvergerer på et tidspunkt i fremtiden,” siger Kim. “Der er mange midlertidige adfærd langs vejen, der ikke betyder meget på lang sigt. At nå denne konvergerede adfærd er det, vi virkelig bekymrer os om, og vi har nu en matematisk måde at gøre det på.”
Problemet, som forskerne har løst, kaldes multi-agent forstærket læring, hvor forstærket læring er en form for maskinlæring, hvor AI-agenter lærer gennem prøvning og fejl.
Når der er flere kooperative eller konkurrerende agenter, der samtidig lærer, kan processen blive langt mere kompleks. Når agenter overvejer flere fremtidige skridt af andre agenter, såvel som deres egen adfærd og hvordan den påvirker andre, kræver problemet for meget beregningskraft.
AI tænker om uendeligheden
“AI’erne ønsker virkelig at tænke om slutningen af spillet, men de ved ikke, hvornår spillet vil slutte,” siger Kim. “De skal tænke om, hvordan de kan tilpasse deres adfærd ind i uendeligheden, så de kan vinde på et tidspunkt langt ude i fremtiden. Vores papir foreslår grundlæggende en ny måde, der giver AI mulighed for at tænke om uendeligheden.”
Det er umuligt at integrere uendeligheden i en algoritme, så teamet designede systemet på en måde, så agenterne fokuserer på et fremtidigt punkt, hvor deres adfærd vil konvergere med andre agenter. Dette kaldes ligevægt, og et ligevægts punkt bestemmer de langsigtede præstationer af agenterne.
Det er muligt, at der kan eksistere flere ligevægte i en multi-agent scenario, og når en effektiv agent aktivt påvirker fremtidige adfærd hos andre agenter, kan de nå en ønskværdig ligevægt set fra agentens synspunkt. Når alle agenter påvirker hinanden, konvergerer de til en generel koncept kaldet en “aktiv ligevægt”.
FURTHER-rammeværk
Teamets maskinlæringsramme kaldes FURTHER, og det giver agenter mulighed for at lære, hvordan de kan tilpasse deres adfærd baseret på deres interaktioner med andre agenter for at nå aktiv ligevægt.
Rammeværket afhænger af to maskinlæringsmoduler. Det første er et slutningsmodul, der giver en agent mulighed for at gætte fremtidige adfærd hos andre agenter og de læringsalgoritmer, de bruger, baseret på tidligere handlinger. Informationen føres derefter ind i forstærket læringsmodul, som agenten afhænger af for at tilpasse sin adfærd og påvirke andre agenter.
“Udfordringen var at tænke om uendeligheden. Vi måtte bruge mange forskellige matematiske værktøjer til at gøre det muligt og gøre nogle antagelser for at få det til at virke i praksis,” siger Kim.
Teamet testede deres metode mod andre multi-agent forstærket læringsrammeværk i forskellige scenarier, hvor AI-agenterne, der brugte FURTHER, kom ud på toppen.
Tilgangen er decentraliseret, så agenterne lærer at vinde uafhængigt. Derudover er det bedre designet til at skala sammenlignet med andre metoder, der kræver en central computer til at kontrollere agenterne.
Ifølge teamet kan FURTHER bruges i en bred vifte af multi-agent-problemer. Kim er især håbefuldt omkring dets anvendelser i økonomi, hvor det kan bruges til at udvikle sund politik i situationer, der involverer mange interagerende enheder med adfærd og interesser, der ændrer sig over tid.












