Robotik och fysisk AI

Robotar kan lära sig komplicerade uppgifter från få demonstrationer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I ett av de senaste framstegen inom robotikområdet har forskare vid University of Southern California (USC) utvecklat ett system där robotar kan lära sig komplicerade uppgifter med få demonstrationer. Ännu mer imponerande är att vissa av demonstrationerna kan vara ofullständiga.

Forskningen presenterades på Conference on Robot Learning (CoRL) den 18 november, med titeln “Lärande från demonstrationer med hjälp av Signal Temporal Logic.”

Systemet

Kvaliteten på varje demonstration mäts så att systemet kan lära sig från sina framgångar och misslyckanden. Till skillnad från nuvarande metoder, som kräver minst 100 demonstrationer för att lära en specifik uppgift, kräver det nya systemet bara ett fåtal. På ett intuitivt sätt liknar sättet som robotarna lär sig på hur människor lär sig av varandra. Till exempel tittar och lär människor av andra som slutför uppgifter framgångsrikt eller ofullständigt.

Aniruddh Puranic är huvudförfattare till forskningen och en doktorand i datavetenskap vid USC Viterbi School of Engineering.

“Många maskinlärnings- och förstärkt lärningssystem kräver stora mängder data och hundratals demonstrationer – du behöver en människa som demonstrerar om och om igen, vilket inte är möjligt”, säger Puranic.

“Och de flesta människor har inte programmeringskunskaper för att explicit ange vad roboten behöver göra, och en människa kan inte möjligtvis demonstrera allt som en robot behöver veta”, fortsätter han. “Vad händer om roboten stöter på något den inte har sett förut? Detta är en nyckelutmaning.”

Forskarna använde “signal temporal logik” eller STL för att bestämma kvaliteten på demonstrationerna, ranka dem och skapa inbyggda belöningar.

Det finns två huvudsakliga skäl till varför forskarna valde STL:

  1. Genom att lära sig genom demonstrationer kan robotar ta upp ofullständigheter eller till och med osäkra beteenden och oönskade handlingar.
  2. Demonstrationer kan skilja sig åt i kvalitet beroende på den användare som tillhandahåller dem, och vissa demonstrationer är bättre indikatorer på önskat beteende än andra.

Genom att utveckla systemet på detta sätt kan roboten fortfarande lära sig från de ofullständiga demonstrationerna, även om de inte uppfyller logikkraven. Med andra ord drar den sin egen slutsats om noggrannhet eller framgång.

Stefanos Nikolaidis är medförfattare och biträdande professor i datavetenskap vid USC Viterbi.

“Säg att robotar lär sig från olika typer av demonstrationer – det kan vara en hands-on-demonstration, videor eller simuleringar – om jag gör något som är mycket osäkert, kommer standardtillvägagångssätten att göra en av två saker: antingen kommer de att helt bortse från det, eller ännu värre, kommer roboten att lära sig fel sak”, säger Nikolaidis.

“I kontrast, på ett mycket intelligent sätt, använder detta arbete viss sunt förnuft i form av logik för att förstå vilka delar av demonstrationen som är bra och vilka delar som inte är det”, fortsätter han. “I själva verket är detta exakt vad människor också gör.”

Signal Temporal Logic

Robotar kan resonera om nuvarande och framtida resultat genom STL, som är ett uttrycksfullt matematiskt symboliskt språk. Tidigare till STL förlitade sig forskningen på “linjär temporal logik”.

Jyo Deshmukh är en före detta Toyota-ingenjör och biträdande professor i datavetenskap vid USC.

“När vi går in i världen av cyberfysiska system, som robotar och självkörande bilar, där tid är avgörande, blir linjär temporal logik lite besvärlig, eftersom den resonerar om sekvenser av sant/falskt-värden för variabler, medan STL tillåter resonemang om fysiska signaler”, säger Deshmukh.

Forskargruppen blev överraskad av systemets framgångsnivå.

“Jämfört med en state-of-the-art-algoritm, som används omfattande i robotikapplikationer, ser du en storleksordningsskillnad i hur många demonstrationer som krävs”, säger Nikolaidis.

Enligt forskarna kan systemen lära sig från körningssimuleringar och till och med videor. Nästa steg är att testa det på riktiga robotar, eftersom den första testningen gjordes på en spel-simulator. Systemet kommer att vara användbart för applikationer som de som finns i hushållsmiljöer, lager och rymdutforskningsrover.

“Om vi vill att robotar ska vara bra medarbetare och hjälpa människor, måste de först lära sig och anpassa sig till mänskliga preferenser mycket effektivt”, säger Nikolaidis. “Vår metod tillhandahåller det.”

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.