AI-modeller og plattformer

DeepMind oppdager AI-treningsteknikk som kan fungere i hjernen vår

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

DeepMind har nylig publisert en artikkel som beskriver hvordan en ny type forsterkingslæring kan potensielt forklare hvordan belønningsbaner i hjernen fungerer. Ifølge NewScientist kalles maskinlæringsmetoden distribusjonsforsterkingslæring, og mekanismene bak den ser ut til å forklare hvordan dopamin frigjøres av nevroner i hjernen.

Nevrovitenskap og datavitenskap har en lang historie sammen. Så langt tilbake som 1951 brukte Marvin Minsky et system av belønninger og straffer for å lage et dataprogram som kunne løse en labyrint. Minsky ble inspirert av arbeidet til Ivan Pavlov, en fysiolog som viste at hunder kunne lære gjennom en rekke belønninger og straffer. DeepMinds nye artikkel bidrar til den sammenflettede historien mellom nevrovitenskap og datavitenskap ved å bruke en type forsterkingslæring for å få innsikt i hvordan dopamin-nevroner kan fungere.

Når en person eller et dyr er på veg til å utføre en handling, gjør samlingen av nevroner i hjernen som er ansvarlige for frigjøring av dopamin en prediksjon om hvor belønning den handlingen vil gi. Når handlingen er utført og konsekvensene (belønningene) av den handlingen er tydelige, frigjør hjernen dopamin. Imidlertid er dopaminfrigjøringen skalert i henhold til størrelsen på feilen i prediksjonen. Hvis belønningen er større/b bedre enn forventet, utløses en sterkere dopamin-surge. Til gjengjeld fører en dårligere belønning til at mindre dopamin frigjøres. Dopaminen fungerer som en korrekturfunksjon som gjør at nevronene finjusterer prediksjonene til de konvergerer mot de faktiske belønningene som er tjent. Dette er svært likt hvordan forsterkingslæring-algoritmer opererer.

I 2017 slapp DeepMind-forskere en forbedret versjon av en vanlig brukt forsterkingslæring-algoritme, og denne overlegne læringsmetoden kunne forbedre ytelsen på mange forsterkingslæring-oppgaver. DeepMind-teamet tenkte at mekanismene bak den nye algoritmen kunne brukes til å bedre forklare hvordan dopamin-nevroner opererer i hjernen.

I motsetning til eldre forsterkingslæring-algoritmer representerer DeepMinds nyere algoritme belønninger som en distribusjon. Eldre forsterkingslæring-tilnærminger representerte estimerte belønninger som bare ett enkelt tall som stod for den gjennomsnittlige forventede resultaten. Denne endringen gjorde at modellen kunne representere mulige belønninger mer nøyaktig og fungere bedre som resultat. Den overlegne ytelsen til den nye treningsmetoden gjorde at DeepMind-forskerne undersøkte om dopamin-nevroner i hjernen fungerer på en lignende måte.

For å undersøke virkningen av dopamin-nevroner, samarbeidet DeepMind med Harvard for å forsk på aktivitetene til dopamin-nevroner i mus. Forskerne lot musene utføre ulike oppgaver og ga dem belønninger basert på terningkast, og registrerte hvordan deres dopamin-nevroner fungerte. Forskjellige nevroner syntes å prediktere forskjellige mulige resultater og frigjøre forskjellige mengder dopamin. Noen nevroner predikterte lavere enn den faktiske belønningen, mens andre predikterte belønninger høyere enn den faktiske belønningen. Etter å ha grafisk fremstilt distribusjonen av belønningsprediksjonene, fant forskerne at distribusjonen av prediksjonene var ganske nær den faktiske belønningsdistribusjonen. Dette antyder at hjernen faktisk bruker et distribusjonssystem når den gjør prediksjoner og justerer prediksjonene for å bedre matche virkeligheten.

Studien kan gi informasjon både til nevrovitenskap og datavitenskap. Studien støtter bruken av distribusjonsforsterkingslæring som en metode for å lage mer avanserte AI-modeller. Ut over det kan den ha implikasjoner for våre teorier om hvordan hjernen opererer når det gjelder belønningsystemer. Hvis dopamin-nevroner er distribuert og noen er mer pessimistiske eller optimistiske enn andre, kan forståelsen av disse distribusjonene endre hvordan vi nærmer oss aspekter av psykologi som mental helse og motivasjon.

Ifølge MIT Technology Review forklarte Matt Botvinik, direktør for nevrovitenskapelig forskning ved DeepMind, betydningen av funnene under en pressekonferanse. Botvinik sa:

“Hvis hjernen bruker det, er det sannsynligvis en god idé. Det forteller oss at dette er en beregningsmetode som kan skaleres i virkelige situasjoner. Det vil passe godt med andre beregningsprosesser. Det gir oss en ny perspektiv på hva som skjer i hjernen vår under hverdagslivet”

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.