Robotica en fysieke AI

Robots in staat om ingewikkelde taken te leren van enkele demonstraties

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In een van de recentste ontwikkelingen op het gebied van robotica hebben onderzoekers aan de University of Southern California (USC) een systeem ontwikkeld waarbij robots ingewikkelde taken kunnen leren met slechts enkele demonstraties. Nog indrukwekkender is dat sommige van deze demonstraties onvolmaakt kunnen zijn.

Het onderzoek werd op 18 november gepresenteerd op de Conference on Robot Learning (CoRL) met de titel “Leren van demonstraties met behulp van Signal Temporal Logic.”

Het Systeem

De kwaliteit van elke demonstratie wordt gemeten zodat het systeem kan leren van zijn successen en mislukkingen. In tegenstelling tot de huidige methoden, die minstens 100 demonstraties vereisen om een specifieke taak te leren, heeft het nieuwe systeem slechts enkele demonstraties nodig. Op een intuïtieve manier leren deze robots op een manier die vergelijkbaar is met de manier waarop mensen van elkaar leren. Bijvoorbeeld, mensen kijken en leren van anderen die taken succesvol of onvolmaakt uitvoeren.

Aniruddh Puranic is de hoofdauteur van het onderzoek en een PhD-student in computerwetenschappen aan de USC Viterbi School of Engineering.

“Veel machine learning- en reinforcement learning-systemen vereisen grote hoeveelheden gegevens en honderden demonstraties – je hebt een mens nodig die het over en over weer laat zien, wat niet haalbaar is,” zei Puranic.

“Bovendien hebben de meeste mensen geen programmeerkennis om expliciet te zeggen wat de robot moet doen, en een mens kan onmogelijk alles demonstreren wat een robot moet weten,” vervolgde hij. “Stel dat de robot iets tegenkomt wat hij nog nooit heeft gezien? Dit is een belangrijke uitdaging.”

De onderzoekers gebruikten “signal temporal logic” of STL om de kwaliteit van de demonstraties te bepalen, deze te rangschikken en inherent beloningen te creëren.

Er zijn twee belangrijke redenen waarom de onderzoekers voor STL kozen:

  1. Door te leren van demonstraties, kunnen robots imperfecties of zelfs onveilige gedragingen en ongewenste acties oppikken.
  2. Demonstraties kunnen in kwaliteit verschillen, afhankelijk van de gebruiker die ze levert, en sommige demonstraties zijn betere indicatoren van gewenst gedrag dan andere.

Door het systeem op deze manier te ontwikkelen, kan de robot nog steeds leren van onvolmaakte demonstraties, zelfs als deze niet voldoen aan de logische vereisten. Met andere woorden, het trekt zijn eigen conclusie over nauwkeurigheid of succes.

Stefanos Nikolaidis is een co-auteur en een assistent-professor in computerwetenschappen aan de USC Viterbi.

“Stel dat robots leren van verschillende soorten demonstraties – het kan een hands-on demonstratie zijn, video’s of simulaties – als ik iets doe dat zeer onveilig is, zullen standaardbenaderingen een van twee dingen doen: ofwel zullen ze het volledig negeren, of erger nog, de robot zal het verkeerde leren,” zegt Nikolaidis.

“In tegenstelling tot de meeste benaderingen, gebruikt dit werk op een zeer intelligente manier enige gezond verstand in de vorm van logica om te begrijpen welke delen van de demonstratie goed zijn en welke niet,” vervolgt hij. “In wezen doet dit precies hetzelfde als mensen.”

Signal Temporal Logic

Robots kunnen redeneren over huidige en toekomstige resultaten met behulp van STL, een expressieve wiskundige symbolische taal. Voordat STL werd gebruikt, was onderzoek afhankelijk van “lineaire temporale logica.”

Jyo Deshmukh is een voormalig Toyota-ingenieur en assistent-professor in computerwetenschappen aan de USC.

“Wanneer we de wereld van cyberfysieke systemen betreden, zoals robots en zelfrijdende auto’s, waar tijd cruciaal is, wordt lineaire temporale logica een beetje omslachtig, omdat het redeneert over sequenties van true/false-waarden voor variabelen, terwijl STL redeneert over fysieke signalen,” zegt Deshmukh.

Het team van onderzoekers was verbaasd over het niveau van succes van het systeem.

“In vergelijking met een state-of-the-art-algoritme, dat uitgebreid wordt gebruikt in robotica-toepassingen, zie je een verschil van een orde van grootte in het aantal demonstraties dat nodig is,” zegt Nikolaidis.

Volgens de onderzoekers kunnen de systemen leren van rijsimulatoren en uiteindelijk van video’s. De volgende stap is om het te testen op echte robots, aangezien de initiële tests werden uitgevoerd op een spel-simulator. Het systeem zal nuttig zijn voor toepassingen zoals die in huishoudelijke omgevingen, magazijnen en ruimteverkenningsrovers.

“Als we willen dat robots goede teamleden zijn en mensen helpen, moeten ze eerst leren en zich aanpassen aan menselijke voorkeuren op een zeer efficiënte manier,” zegt Nikolaidis. “Onze methode biedt dat.”

Alex leidt de door AI‑aangedreven nieuwsoperaties van Unite.AI, waarbij journalistiek, onderzoek en automatisering worden gecombineerd om tijdige en schaalbare berichtgeving over kunstmatige intelligentie te ondersteunen. Zijn werk helpt ervoor te zorgen dat opkomende AI‑ontwikkelingen efficiënt onder de aandacht worden gebracht, terwijl de redactionele normen van de publicatie worden gehandhaafd.