Robotikk og fysisk AI

Datavitenskapsmenn bruker positiv forsterkning for å lære roboter

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Datavitenskapsmenn ved Johns Hopkins University har brukt den etablerte treningsmetoden positiv forsterkning, som ofte brukes til å trene dyr som hunder, på en robot så den kan lære seg nye triks. Blant disse nye ferdighetene var evnen til å stable blokker.

Robotens navn er Spot, og ifølge forskerne kan den lære ferdigheter på noen dager som tradisjonelt tar rundt en måned.

Positiv forsterkning

Positiv forsterkning ble brukt av teamet for å øke robotens ferdighetssett. Hastigheten som teamet kunne gjøre dette gjør det enklere for disse typene roboter å bli deployert i den virkelige verden.

Arbeidet ble publisert i IEEE Robotics and Automation Letters, med tittelen “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.

Andrew Hundt er en PhD-student som arbeider ved Johns Hopkins University og er hovedforfatter av forskningen.

“Spørsmålet her var hvordan vi får roboten til å lære en ferdighet?” sa han. “Jeg har hatt hunder, så jeg vet at belønninger fungerer, og det var inspirasjonen for hvordan jeg designet lærealgoritmen.”

En av årsakene til at positiv forsterkning fungerer på datamaskiner er at de ikke har intuitive hjerner, det vil si at de er en blank canvas hvor hva som helst kan projiseres på. Med andre ord, de må lære alt fra ingenting. En av de mest effektive metoder for læring for datamaskiner er prøving og feiling, som er noe roboticere fortsatt arbeider med i dag.

Dette er nettopp hva forskerne gjorde da de skapte et belønningssystem for roboten, likt prosessen med å trene en hund ved å gi den godbidder. Forskjellen er at roboten mottar numeriske poeng når den fullfører en oppgave korrekt.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Ferdigheter lært

Når det kom til å lære hvordan man stable blokker, måtte roboten lære å fokusere på konstruktive handlinger. I metoden mottok Spot-roboten høyere poeng når den fullførte korrekte atferd under stableingen av blokkene. På den andre siden, tjente den ingenting for ukorrekte atferd. Den fikk de høyeste poengene ved å fullføre en fire-blokk-stable med den siste blokken på toppen.

Forskerne så stor suksess i denne metoden, med roboten som lærte på noen dager hva som ellers ville ha tatt uker. Ved å trene en simulert robot, reduserte teamet øvings­tiden før de gikk over til Spot-roboten.

“Roboten ønsker den høyere scoren,” sa Hundt. “Den lærer raskt den riktige atferden for å få den beste belønningen. Faktisk, det tok en måned med øving for roboten å oppnå 100% nøyaktighet. Vi klarte å gjøre det på to dager.”

Foruten å lære hvordan man stable blokker, brukte roboten også positiv forsterkning til å lære andre oppgaver, som hvordan man spiller en simulert navigasjons­spill.

“Til å begynne med har roboten ingen anelse om hva den gjør, men den blir bedre og bedre med hver øving. Den gir aldri opp og fortsetter å prøve å stable og kan fullføre oppgaven 100% av tiden,” sa Hundt.

Noen av de mulige anvendelsene for denne metoden inkluderer å trene hus­hold­roboter til å fullføre bestemte oppgaver, samt å forbedre autonome kjøretøy.

“Vårt mål er til slutt å utvikle roboter som kan utføre komplekse oppgaver i den virkelige verden — som produkt­sammen­setning, omsorg for eldre og kirurgi,” sa Hager. “Vi vet for øyeblikket ikke hvordan vi skal programmere oppgaver som disse — verden er for kompleks. Men arbeid som dette viser oss at det er håp om at roboter kan lære å utføre slike virkelige oppgaver på en trygg og effektiv måte.”

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at fremvoksende AI‑utviklinger blir fremhevet effektivt, samtidig som publikasjonens redaksjonelle standarder opprettholdes.