Robotica en fysieke AI

Informatici gebruiken positieve versterking om robots te leren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Informatici van de Johns Hopkins University hebben de lang bestaande trainingsmethode van positieve versterking, die vaak wordt gebruikt om dieren zoals honden te trainen, ingezet op een robot zodat deze zichzelf nieuwe trucs kon leren. Onder deze nieuwe vaardigheden was het vermogen om blokken te stapelen.

De robot heet Spot, en volgens de onderzoekers kan hij vaardigheden leren binnen enkele dagen die traditioneel ongeveer een maand duren.

Positieve versterking

Positieve versterking werd door het team gebruikt om de vaardigheidenset van de robot te vergroten. De snelheid waarmee het team dit kon doen, maakt het gemakkelijker voor dit type robots om in de echte wereld te worden ingezet.

Het onderzoek werd gepubliceerd in IEEE Robotics and Automation Letters, getiteld “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.

Andrew Hundt is een PhD-student die werkt aan de Johns Hopkins University en de hoofdauteur van het onderzoek.

“De vraag was hoe we de robot kunnen leren een vaardigheid te leren?” zei hij. “Ik heb honden gehad, dus ik weet dat beloningen werken en dat was de inspiratie voor hoe ik de leer-algoritme ontwierp.”

Een van de redenen waarom positieve versterking werkt op computers, is dat ze geen intuïtieve hersenen hebben, wat betekent dat ze een blanco canvas zijn waarop alles kan worden geprojecteerd. Met andere woorden, ze moeten alles leren van niets. Een van de meest effectieve methoden van leren voor computers is trial en error, wat iets is waar roboticisten nog steeds aan werken.

Dit is precies wat de onderzoekers deden toen ze een beloningsysteem voor de robot creëerden, vergelijkbaar met het proces van het trainen van een hond door hem treats te geven. Het verschil is dat de robot numerieke punten krijgt wanneer hij een taak correct voltooit.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Vaardigheden geleerd

Toen het ging om het leren van het stapelen van blokken, moest de robot leren om zich te concentreren op constructieve acties. In de methode kreeg Spot de robot hogere punten wanneer hij correcte gedragingen voltooide tijdens het stapelen van de blokken. Aan de andere kant kreeg hij niets voor incorrecte gedragingen. Hij kreeg de hoogste hoeveelheid punten door een vier-blokken-stapel te voltooien met de laatste blok op top.

De onderzoekers zagen groot succes in deze methode, met de robot die in enkele dagen leerde wat eerder weken zou hebben geduurd. Door een gesimuleerde robot te trainen, reduceerde het team de oefentijd voordat ze verhuisden naar de Spot-robot.

“De robot wil de hogere score,” zei Hundt. “Het leert snel het juiste gedrag om de beste beloning te krijgen. In feite duurde het vroeger een maand om 100% nauwkeurigheid te bereiken. We konden het doen in twee dagen.”

Naast het leren van het stapelen van blokken, gebruikte de robot ook positieve versterking om andere taken te leren, zoals het spelen van een gesimuleerd navigatiespel.

“Aan het begin weet de robot niet wat hij doet, maar hij wordt steeds beter en beter met elke oefening. Het geeft nooit op en blijft proberen om te stapelen en kan de taak 100% van de tijd voltooien,” zei Hundt.

Sommige van de mogelijke toepassingen voor deze methode zijn het trainen van huishoudrobots om bepaalde taken te voltooien, evenals het verbeteren van autonome voertuigen.

“Ons doel is om uiteindelijk robots te ontwikkelen die complexe taken in de echte wereld kunnen uitvoeren — zoals productassemblage, zorg voor ouderen en chirurgie,” zei Hager. “We weten nu nog niet hoe we taken zoals die kunnen programmeren — de wereld is te complex. Maar werk zoals dit laat zien dat er hoop is voor het idee dat robots kunnen leren om dergelijke taken in de echte wereld veilig en efficiënt uit te voeren.

Alex leidt de door AI‑aangedreven nieuwsoperaties van Unite.AI, waarbij journalistiek, onderzoek en automatisering worden gecombineerd om tijdige en schaalbare berichtgeving over kunstmatige intelligentie te ondersteunen. Zijn werk helpt ervoor te zorgen dat opkomende AI‑ontwikkelingen efficiënt onder de aandacht worden gebracht, terwijl de redactionele normen van de publicatie worden gehandhaafd.