Robotika a fyzická AI

Počítačoví vědci používají pozitivní posilování k výuce robotů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Počítačoví vědci na Johns Hopkins University použili dlouho používanou techniku pozitivního posilování, která se často používá k výuce zvířat, jako jsou psi, na robota, aby se mohl naučit nové triky. Mezi tyto nové dovednosti patřila schopnost skládat bloky.

Robot se jmenuje Spot a podle výzkumníků se může naučit dovednosti za několik dní, které tradičně trvaly kolem měsíce.

Pozitivní posilování

Pozitivní posilování bylo použito týmem k zvýšení sadu dovedností robota. Rychlost, s jakou tým dokázal toto udělat, usnadňuje nasazení těchto typů robotů do skutečného světa.

Práce byla zveřejněna v IEEE Robotics and Automation Letters, pod názvem “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.

Andrew Hundt je doktorandem na Johns Hopkins University a vedoucím autorem výzkumu.

“Otázka zde byla, jak dostat robota, aby se naučil novou dovednost?” řekl. “Měl jsem psy, takže vím, že odměny fungují, a to bylo inspirací pro návrh algoritmu učení.”

Jedním z důvodů, proč pozitivní posilování funguje u počítačů, je to, že nemají intuitivní mozek, což znamená, že jsou基本ně prázdná plátno, na které lze projít cokoliv. Jinými slovy, musí se naučit vše od začátku. Jednou z nejúčinnějších metod učení pro počítače je pokus a omyl, na kterém stále pracují robotici.

To je přesně to, co výzkumníci udělali, když vytvořili systém odměn pro robota, podobně jako proces učení psa pomocí odměn. Rozdíl spočívá v tom, že robot obdrží numerické body, když dokončí úkol správně.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Dovednosti naučené

Když šlo o naučení se skládat bloky, musel robot se naučit soustředit se na konstruktivní akce. V metodě obdržel robot Spot vyšší body, když dokončil správné chování během skládání bloků. Naopak, nezískal žádné body za nesprávné chování. Získal nejvyšší počet bodů, když dokončil čtyřblokový sloupec s posledním blokem nahoře.

Výzkumníci zaznamenali velký úspěch s touto metodou, s robotem, který se naučil za několik dní, co by dříve trvalo týdny. Cvičení simulovaného robota snížilo čas cvičení před přechodem na robota Spot.

“Robot chce vyšší skóre,” řekl Hundt. “Rychle se naučí správné chování, aby získal nejlepší odměnu. Ve skutečnosti to dříve trvalo měsíc cvičení, aby robot dosáhl 100% přesnosti. My jsme to dokázali za dva dny.”

Kromě naučení se skládat bloky robot také použil pozitivní posilování k naučení se dalších úkolů, jako je hra simulované navigační hry.

“Na začátku robot nemá žádné ponětí, co dělá, ale bude se zlepšovat a zlepšovat s každým cvičením. Nikdy se nevzdává a pokračuje ve skládání a dokáže dokončit úkol 100% času,” řekl Hundt.

Některé z možných aplikací této metody zahrnují výuku domácích robotů, aby dokončily určité úkoly, stejně jako zlepšení autonomních vozidel.

“Naším cílem je nakonec vyvinout roboty, které mohou provádět složité úkoly ve skutečném světě – jako je sestavení produktů, péče o seniory a chirurgie,” řekl Hager. “V současné době nevíme, jak naprogramovat úkoly, jako je tento – svět je příliš složitý. Ale práce, jako je tato, ukazuje, že existuje slib, že roboti se mohou naučit provádět takové skutečné úkoly bezpečným a efektivním způsobem.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.