Robotik och fysisk AI

Datorforskare använder positiv förstärkning för att lära robotar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Datorforskare vid Johns Hopkins University har använt den långvariga träningsmetoden positiv förstärkning, som ofta används för att träna djur som hundar, på en robot så att den kunde lära sig nya tricks. Bland dessa nya färdigheter fanns förmågan att stapla block.

Robotens namn är Spot, och enligt forskarna kan den lära sig färdigheter på några dagar som traditionellt tar cirka en månad.

Positiv förstärkning

Positiv förstärkning användes av teamet för att öka robotens färdighetsuppsättning. Den hastighet med vilken teamet kunde göra detta gör det lättare för dessa typer av robotar att användas i den verkliga världen.

Arbetet publicerades i IEEE Robotics and Automation Letters, med titeln “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.

Andrew Hundt är en doktorand som arbetar vid Johns Hopkins University och är huvudförfattare till forskningen.

“Frågan här var hur vi får roboten att lära sig en färdighet?” sa han. “Jag har haft hundar, så jag vet att belöningar fungerar och det var inspirationen för hur jag designade läralgoritmen.”

En av anledningarna till att positiv förstärkning fungerar på datorer är att de inte har intuitiva hjärnor, vilket betyder att de i princip är en tom duk där allt kan projiceras. Med andra ord måste de lära sig allt från scratch. En av de mest effektiva metoderna för datorer att lära sig är trial and error, vilket är något som robotforskare fortfarande arbetar med idag.

Detta är exakt vad forskarna gjorde när de skapade ett belöningssystem för roboten, liknande processen att träna en hund genom att ge den godis. Skillnaden är att roboten får numeriska poäng när den slutför en uppgift korrekt.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Färdigheter lärd

När det gällde att lära sig att stapla block, måste roboten lära sig att fokusera på konstruktiva handlingar. I metoden fick Spot-roboten högre poäng när den slutförde korrekta beteenden under blockstaplingen. Å andra sidan fick den ingenting för felaktiga beteenden. Den fick den högsta poängen genom att slutföra en fyra-blocks-stapel med den sista blocken överst.

Forskarna såg stor framgång med denna metod, med roboten som lärde sig på några dagar vad som tidigare skulle ha tagit veckor. Genom att träna en simulerad robot minskade teamet övningstiden innan de gick vidare till Spot-roboten.

“Roboten vill ha den högre poängen”, sa Hundt. “Den lär sig snabbt rätt beteende för att få den bästa belöningen. I själva verket tog det en månad av övning för roboten att uppnå 100% noggrannhet. Vi kunde göra det på två dagar.”

Förutom att lära sig att stapla block, använde roboten också positiv förstärkning för att lära sig andra uppgifter, såsom att spela ett simulerat navigeringsspel.

“I början har roboten ingen aning om vad den gör, men den kommer att bli bättre och bättre med varje övning. Den ger aldrig upp och fortsätter att försöka stapla och kan slutföra uppgiften 100% av tiden”, sa Hundt.

Några av de möjliga tillämpningarna för denna metod inkluderar att träna hushållsrobotar att slutföra vissa uppgifter, samt att förbättra autonoma fordon.

“Vårt mål är att så småningom utveckla robotar som kan utföra komplexa uppgifter i den verkliga världen — som produktmontering, äldreomsorg och kirurgi”, sa Hager. “Vi vet för närvarande inte hur man programmerar uppgifter som dessa — världen är för komplex. Men arbete som detta visar att det finns potential i idén att robotar kan lära sig att utföra sådana verkliga uppgifter på ett säkert och effektivt sätt.

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.