AI-modeller og plattformer
DeepMind skaper AI som gjenspiller minner som hippocampus
Menneskehjernen henter ofte tilbake gamle minner (apparatisk) uten å bli bedt om det. Mens vi går gjennom dagen vår, har vi spontane glimt av minner fra livet vårt. Mens denne spontane fremkallingen av minner har lenge vært av interesse for nevrovitenskapsmenn, har AI-forskningselskapet DeepMind nylig publisert en artikkel som beskriver hvordan en av deres AI-er repliserte denne merkelige mønsteret av gjentakelse.
Fremkallingen av minner i hjernen, neural gjentakelse, er tett knyttet til hippocampus. Hippocampus er en hesteskoformet struktur i hjernen som tilhører limbiske systemet, og den er assosiert med dannelse av nye minner, samt de emosjonene som minner utløser. Gjeldende teorier om rollen til hippocampi (det er ett i hver hemisfære av hjernen), fastslår at ulike regioner av hippocampus er ansvarlige for håndtering av ulike typer minner. For eksempel, troes det at romlig minne håndteres i den bakerste regionen av hippocampus.
Som rapportert av Jesus Rodriguez, er Dr. John O’Keefe ansvarlig for mange bidrag til vår forståelse av hippocampus, inkludert hippocampale “place” celler. Place cellene i hippocampus utløses av stimuli i en bestemt omgivelse. Som et eksempel, viste eksperimenter på rotter at bestemte nevroner ville utløses når rotta løp gjennom bestemte deler av en bane. Forskerne fortsatte å overvåke rotta selv når de var i ro, og de fant at de samme mønsterne av nevroner som indikerte en del av labyrinten ville utløses, selv om de utløste seg i en akselerert hastighet. Rottene syntes å gjenspille minnene av labyrinten i deres sinn.
Hos mennesker er det viktig å gjenkalle minner som en del av læreprosessen, men når man prøver å aktivere AI til å lære, er det vanskelig å reprodusere fenomenet.
DeepMind-teamet satte seg fore å prøve å reprodusere fenomenet med gjentakelse ved hjelp av forsterkingslæring. Forsterkingslæring-algoritmer fungerer ved å motta tilbakemeldinger fra deres interaksjoner med omgivelsene rundt dem, og de blir belønnet hver gang de tar handlinger som bringer dem nærmere det ønskede målet. I denne sammenhengen registrerer forsterkingslæringssystemet hendelser og spiller dem av igjen på senere tidspunkter, med systemet som forbedrer seg til å forbedre hvor effektivt det til slutt gjenspiller tidligere erfaringer.
DeepMind la til gjenspilling av erfaringer til en forsterkingslæring-algoritme ved hjelp av en replay-buffert som ville spille av minner/registrerte erfaringer til systemet på bestemte tidspunkter. Noen versjoner av systemet hadde erfaringene spilt av i tilfeldige rekkefølger, mens andre modeller hadde forhåndsvalgte spillerekkefølger. Mens forskerne eksperimenterte med rekkefølgen av avspilling for forsterkingsagentene, eksperimenterte de også med ulike metoder for å spille av erfaringene selv.
Det finnes to primære metoder som brukes for å gi forsterkingsalgoritmer gjenspilte erfaringer. Disse metodene er imagination replay-metoden og movie replay-metoden. DeepMind-papiret bruker en analogi for å beskrive begge strategiene:
“Anta at du kommer hjem og, til din overraskelse og fortvilelse, oppdager vann som samler seg på dine vakre tre gulv. Når du går inn i spisestuen, finner du en knust vase. Så hører du en klynk, og du kikker ut patio-døren og ser din hund som ser svært skyldig ut.”
Som rapportert av Rodriguez, gjør imagination replay-metoden ikke hendelsene i rekkefølgen de ble erfart. I stedet inføres en sannsynlig årsak mellom hendelsene basert på agentens forståelse av verden. Hendelsene inføres basert på agentens forståelse av verden. Movie replay-metoden lagrer minner i rekkefølgen hendelsene skjedde, og spiller av sekvensen av stimuli – “spilt vann, knust vase, hund”. Den kronologiske rekkefølgen av hendelser blir bevart.
Forskning fra nevrovitenskap feltet antyder at movie replay-metoden er avgjørende for å skape assosiasjoner mellom konsepter og å koble nevroner mellom hendelser. Imagination replay-metoden kan imidlertid hjelpe agenten til å skape nye sekvenser når den resonerer ved analogi. For eksempel, kunne agenten resonnere at hvis en tønne er til olje som en vase er til vann, kunne en tønne bli spilt av en fabrikkrobot i stedet for en hund. Når DeepMind undersøkte mulighetene til imagination replay-metoden videre, fant de at deres læringsagent kunne skape imponerende, innovative sekvenser ved å ta tidligere erfaringer i betraktning.
De fleste av de nåværende fremstegene som gjøres i området forsterkingslæring minne skjer med movie-strategien, selv om forskerne nylig har begynt å gjøre fremsteg med imagination-strategien. Forskning i begge metoder for AI-minne kan ikke bare aktivere bedre ytelse fra forsterkingslæringssystemer, men kan også hjelpe oss til å få ny innsikt i hvordan det menneskelige sinnet kan fungere.












