Robotikk og fysisk AI

Robotene kan lære kompliserte oppgaver fra få demonstrasjoner

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I ett av de siste fremstegene innen robotikk, har forskere ved University of Southern California (USC) utviklet et system der roboter kan lære kompliserte oppgaver med få demonstrasjoner. Enda mer imponerende er det at noen av demonstrasjonene kan være uperfekte.

Forskningen ble presentert på Conference on Robot Learning (CoRL) den 18. november, med tittelen “Learning from Demonstrations Using Signal Temporal Logic.”

Systemet

Kvaliteten på hver demonstrasjon måles så systemet kan lære fra sine suksesser og feil. I motsetning til nåværende metoder, som krever minst 100 demonstrasjoner for å lære en bestemt oppgave, krever det nye systemet bare noen få. På en intuitiv måte, ligner måten robotene lærer på måten mennesker lærer av hverandre. For eksempel, ser mennesker og lærer av andre som fullfører oppgaver suksessfullt eller uperfekt.

Aniruddh Puranic er hovedforfatteren av forskningen og en ph.d.-student i datavitenskap ved USC Viterbi School of Engineering.

“Mange maskinlærings- og forsterkningslærings-systemer krever store mengder data og hundrevis av demonstrasjoner – du trenger en menneske som demonstrerer gang på gang, hvilket ikke er mulig,” sier Puranic.

“Og de fleste mennesker har ikke programmeringskunnskaper til å eksplisitt angi hva roboten må gjøre, og et menneske kan ikke mulig demonstrere alt et robot trenger å vite,” fortsatte han. “Hva hvis roboten møter noe den ikke har sett før? Dette er en nøkkelutfordring.”

Forskerne brukte “signal tempus logikk” eller STL for å bestemme kvaliteten på demonstrasjonene, rangerte dem etter hvert og skapte innebygde belønninger.

Det er to hovedgrunner til at forskerne bestemte seg for å bruke STL:

  1. Ved å lære gjennom demonstrasjoner, kan roboter plukke opp uperfeksjoner eller uønskede handlinger.
  2. Demonstrasjoner kan variere i kvalitet avhengig av brukeren som gir dem, og noen demonstrasjoner er bedre indikatorer for ønsket atferd enn andre.

Ved å utvikle systemet på denne måten, kan roboten fortsatt lære fra de uperfekte demonstrasjonene, selv om de ikke møter logiske krav. Med andre ord, trekker den sin egen konklusjon om nøyaktighet eller suksess.

Stefanos Nikolaidis er en medforfatter og en assistant professor i datavitenskap ved USC Viterbi.

“La oss si at roboter lærer fra forskjellige typer demonstrasjoner – det kan være en hånd-til-hånd-demonstrasjon, videoer eller simulasjoner – hvis jeg gjør noe som er svært farlig, vil standardtilnærmingene enten fullstendig ignorere det eller, enda verre, roboten vil lære feil,” sier Nikolaidis.

“I motsetning til dette, bruker denne studien noen vanlig fornuft i form av logikk for å forstå hvilke deler av demonstrasjonen som er gode og hvilke deler som ikke er det,” fortsetter han. “I essensen er dette akkurat det samme som mennesker gjør.”

Signal Tempus Logikk

Robotene kan resonere om nåværende og fremtidige resultater gjennom STL, som er et uttrykksfullt matematisk symbolisk språk. Før STL, avhengig forskningen av “lineær tempus logikk”.

Jyo Deshmukh er en tidligere Toyota-ingeniør og assistant professor i datavitenskap ved USC.

“Når vi går inn i verden av kybernetiske fysiske systemer, som roboter og selvkjørende biler, hvor tid er avgjørende, blir lineær tempus logikk litt tungvint, fordi den resonerer om sekvenser av sann/usann verdier for variabler, mens STL tillater resonering om fysiske signaler,” sier Deshmukh.

Forskerlaget var overrasket over systemets nivå av suksess.

“I sammenligning med en state-of-the-art-algoritme, som brukes omfattende i robotikk-applikasjoner, ser du en orden av størrelsesforskjell i hvor mange demonstrasjoner som kreves,” sier Nikolaidis.

Ifølge forskerne, kan systemene lære fra kjøresimuleringer og til slutt videoer. Neste skritt er å teste det på virkelige roboter, da den innledende testingen ble gjort på en spill-simulator. Systemet vil være nyttig for applikasjoner som de i husholdningsmiljøer, lagerhus og rom-utforsknings-rovere.

“Hvis vi ønsker at robotene skal være gode teammedlemmer og hjelpe mennesker, må de først lære og tilpasse seg menneskelige preferanser svært effektivt,” sier Nikolaidis. “Vår metode gir det.”

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at fremvoksende AI‑utviklinger blir fremhevet effektivt, samtidig som publikasjonens redaksjonelle standarder opprettholdes.