Robotteknologi og fysisk AI

Robotter kan lære komplekse opgaver fra få demonstreringer

mm
Føj Unite.AI til dine foretrukne kilder på Google

I et af de seneste gennembrud i robotteknologi har forskere ved University of Southern California (USC) udviklet et system, hvor robotter kan lære komplekse opgaver med få demonstreringer. Endnu mere imponerende er, at nogle af demonstreringerne kan være uperfekte.

Forskningen blev præsenteret på Conference on Robot Learning (CoRL) den 18. november med titlen “Learning from Demonstrations Using Signal Temporal Logic.”

Systemet

Kvaliteten af hver demonstrering måles, så systemet kan lære af sine succeser og fejl. I modsætning til nuværende metoder, der kræver mindst 100 demonstreringer for at lære en bestemt opgave, kræver det nye system kun få demonstreringer. På en intuitiv måde ligner måden, robotterne lærer på, måden, mennesker lærer af hinanden på. For eksempel lærer mennesker af at se på og lære af andre, der udfører opgaver succesfuldt eller uperfekt.

Aniruddh Puranic er hovedforfatteren på forskningen og en ph.d.-studerende i datalogi ved USC Viterbi School of Engineering.

“Mange maskinlærings- og forstærkningslærings-systemer kræver store mængder data og hundredvis af demonstreringer – du har brug for, at en menneske demonstrerer igen og igen, hvilket ikke er muligt,” siger Puranic.

“Og de fleste mennesker har ikke programmeringskundskaber til at udtrykke, hvad robotten skal gøre, og et menneske kan ikke muligvis demonstrere alt, hvad en robot har brug for at vide,” fortsætter han. “Hvad nu, hvis robotten møder noget, den ikke har set før? Dette er en nøgleudfordring.”

Forskerne anvendte “signal temporal logik” eller STL for at bestemme kvaliteten af demonstreringerne, hvor de rangerede dem derefter og skabte indbyggede belønninger.

Der er to hovedgrunde til, at forskerne valgte STL:

  1. Ved at lære gennem demonstreringer kan robotter opsnappe uperfektioner eller endda usikre adfærd og uønskede handlinger.
  2. Demonstreringer kan variere i kvalitet afhængigt af den bruger, der leverer dem, og nogle demonstreringer er bedre indikatorer for ønsket adfærd end andre.

Ved at udvikle systemet på denne måde kan robotten stadig lære af de uperfekte demonstreringer, selv hvis de ikke opfylder logikkravene. Med andre ord kan den selv drage en konklusion om nøjagtighed eller succes.

Stefanos Nikolaidis er medforfatter og en USC Viterbi-assistentprofessor i datalogi.

“Lad os sige, at robotter lærer af forskellige typer demonstreringer – det kunne være en praktisk demonstrering, videoer eller simulationer – hvis jeg gør noget, der er meget usikkert, vil standardtilgange enten fuldstændigt ignorere det eller endda lære robotten det forkerte,” siger Nikolaidis.

“I modsætning hertil bruger dette arbejde på en meget intelligent måde nogle almindelige fornuftsregler i form af logik til at forstå, hvilke dele af demonstreringen er gode og hvilke dele ikke er,” fortsætter han. “I virkeligheden gør mennesker det samme.”

Signal Temporal Logik

Robotter kan resonere om nuværende og fremtidige resultater gennem STL, der er et udtryksfuldt matematisk symbolsk sprog. Før STL afhangt forskningen af “lineær temporal logik.”

Jyo Deshmukh er en tidligere Toyota-ingeniør og assistentprofessor i datalogi ved USC.

“Når vi går ind i verden af cyberfysiske systemer, som robotter og selvkørende biler, hvor tid er afgørende, bliver lineær temporal logik lidt besværlig, fordi den resonerer om sekvenser af sand/falske værdier for variable, mens STL tillader resonering om fysiske signaler,” siger Deshmukh.

Forskerholdet var overrasket over systemets niveau af succes.

“I sammenligning med en state-of-the-art-algoritme, der anvendes omfattende i robottekniske anvendelser, ser du en størrelsesorden forskel i, hvor mange demonstreringer der kræves,” siger Nikolaidis.

Ifølge forskerne kan systemerne lære af køresimulationer og til sidst videoer. Næste skridt er at teste det på rigtige robotter, da den første test blev udført på en spil-simulator. Systemet vil være nyttigt for anvendelser som dem i huslige miljøer, lagerhuse og rumforskningens robotter.

“Hvis vi ønsker, at robotter skal være gode medspillere og hjælpe mennesker, skal de først lære og tilpasse sig menneskers præferencer meget effektivt,” siger Nikolaidis. “Vores metode giver det.”

Alex leder Unite.AI’s AI‑drevne nyhedsoperationer, der kombinerer journalistik, forskning og automatisering for at understøtte rettidig og skalerbar dækning af kunstig intelligens. Hans arbejde sikrer, at nye AI‑udviklinger fremhæves effektivt, samtidig med at publikationsredaktionens standarder opretholdes.