Robotteknologi og fysisk AI
Computervidenskabsmænd bruger positiv forstærkning til at lære robotter
Computervidenskabsmænd ved Johns Hopkins University har anvendt den langvarige træningsteknik, positiv forstærkning, som ofte bruges til at træne dyr som hunde, på en robot, så den kan lære sig nye færdigheder. Blandt disse nye færdigheder var evnen til at stable blokke.
Robotten hedder Spot, og ifølge forskerne kan den lære færdigheder på få dage, som ellers ville tage omkring en måned.
Positiv forstærkning
Positiv forstærkning blev brugt af holdet til at øge robotens færdighedsniveau. Den hastighed, hvormed holdet kunne gøre dette, gør det lettere for denne type robotter at blive udrullet i den virkelige verden.
Arbejdet blev offentliggjort i IEEE Robotics and Automation Letters, med titlen “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.”
Andrew Hundt er en ph.d.-studerende, der arbejder ved Johns Hopkins University, og er hovedforfatter på forskningen.
“Spørgsmålet her var, hvordan vi får robotten til at lære en færdighed?” sagde han. “Jeg har haft hunde, så jeg ved, at belønninger virker, og det var inspirationen for, hvordan jeg designede læralgoritmen.”
En af årsagerne til, at positiv forstærkning virker på computere, er, at de ikke har intuitive hjerner, hvilket betyder, at de grundlæggende er en blank canvas, som noget kan projiceres på. Med andre ord må de lære alt fra ingenting. En af de mest effektive metoder til læring for computere er prøv og fejl, hvilket er noget, robotforskere stadig arbejder på i dag.
Det er præcis, hvad forskerne gjorde, da de oprettede et belønningsystem for robotten, ligesom processen med at træne en hund ved at give den behandlinger. Forskellen er, at robotten modtager numeriske point, når den udfører en opgave korrekt.
https://www.youtube.com/watch?v=dvxqjJBWFD4
Færdigheder lært
Da det kom til at lære, hvordan man stablede blokke, måtte robotten lære at fokusere på konstruktive handlinger. I metoden modtog Spot-robotten højere point, når den udførte korrekte adfærd under stablede blokke. På den modsatte side fik den ingenting for forkerte adfærd. Den fik det højeste antal point ved at stable fire blokke med den sidste blok øverst.
Forskerne så stor succes med denne metode, med robotten, der lærte på få dage, hvad der ellers ville tage uger. Ved at træne en simuleret robot reducerede holdet træningstiden, før de gik over til Spot-robotten.
“Robotten ønsker den højere score,” sagde Hundt. “Den lærer hurtigt den rigtige adfærd for at få den bedste belønning. Faktisk tog det tidligere en måned med træning for robotten at opnå 100% nøjagtighed. Vi kunne gøre det på to dage.”
Ud over at lære, hvordan man stablede blokke, brugte robotten også positiv forstærkning til at lære andre opgaver, såsom at spille et simuleret navigationspil.
“Til at begynde med har robotten ingen idé om, hvad den laver, men den bliver bedre og bedre med hver øvelse. Den giver aldrig op og fortsætter med at stable og kan udføre opgaven 100% af tiden,” sagde Hundt.
Nogle af de mulige anvendelser for denne metode inkluderer træning af husrobotter til at udføre bestemte opgaver samt forbedring af autonome køretøjer.
“Vores mål er til sidst at udvikle robotter, der kan udføre komplekse opgaver i den virkelige verden — som produktmontering, pleje af ældre og kirurgi,” sagde Hager. “Vi ved ikke nu, hvordan vi programmerer opgaver som disse — verden er for kompleks. Men arbejde som dette viser os, at der er håb for, at robotter kan lære at udføre sådanne virkelige opgaver på en sikker og effektiv måde.












