Robotika dan AI fisik

Robot Dapat Belajar Tugas yang Rumit dari Beberapa Demonstrasi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Dalam salah satu perkembangan terbaru di bidang robotika, peneliti di University of Southern California (USC) telah mengembangkan sistem di mana robot dapat belajar tugas yang rumit dengan beberapa demonstrasi. Bahkan lebih mengesankan, beberapa demonstrasi dapat tidak sempurna.

Penelitian ini dipresentasikan pada Konferensi Pembelajaran Robot (CoRL) pada 18 November, dengan judul “Pembelajaran dari Demonstrasi Menggunakan Logika Temporal Sinyal.”

Sistem

Kualitas setiap demonstrasi diukur sehingga sistem dapat belajar dari keberhasilan dan kegagalan. Tidak seperti metode saat ini, yang memerlukan setidaknya 100 demonstrasi untuk mengajar tugas tertentu, sistem baru ini hanya memerlukan beberapa. Dalam cara yang intuitif, cara robot ini belajar mirip dengan cara manusia belajar dari satu sama lain. Misalnya, manusia menonton dan belajar dari orang lain yang menyelesaikan tugas dengan sukses atau tidak sempurna.

Aniruddh Puranic adalah penulis utama penelitian dan mahasiswa Ph.D. di bidang ilmu komputer di USC Viterbi School of Engineering.

“Banyak sistem pembelajaran mesin dan pembelajaran penguatan memerlukan jumlah data yang besar dan ratusan demonstrasi – Anda memerlukan manusia untuk mendemonstrasikan berulang kali, yang tidak memungkinkan,” kata Puranic.

“Juga, kebanyakan orang tidak memiliki pengetahuan pemrograman untuk secara eksplisit menyatakan apa yang harus dilakukan robot, dan manusia tidak mungkin mendemonstrasikan semua yang perlu diketahui robot,” katanya. “Apa yang terjadi jika robot menemui sesuatu yang belum pernah dilihat sebelumnya? Ini adalah tantangan kunci.”

Peneliti menggunakan “logika temporal sinyal” atau STL untuk menentukan kualitas demonstrasi, peringkat mereka sesuai dan membuat hadiah bawaan.

Ada dua alasan utama peneliti memutuskan untuk menggunakan STL:

  1. Dengan belajar dari demonstrasi, robot dapat memilih kekurangan atau bahkan perilaku tidak aman dan tindakan yang tidak diinginkan.
  2. Demonstrasi dapat berbeda dalam kualitas tergantung pada pengguna yang menyediakannya, dan beberapa demonstrasi adalah indikator yang lebih baik dari perilaku yang diinginkan daripada yang lain.

Dengan mengembangkan sistem ini, robot masih dapat belajar dari demonstrasi yang tidak sempurna, bahkan jika mereka tidak memenuhi persyaratan logika. Dengan kata lain, ia membuat kesimpulan sendiri tentang akurasi atau keberhasilan.

Stefanos Nikolaidis adalah co-penulis dan asisten profesor ilmu komputer di USC Viterbi.

“Misalkan robot belajar dari berbagai jenis demonstrasi – bisa jadi demonstrasi langsung, video, atau simulasi – jika saya melakukan sesuatu yang sangat tidak aman, pendekatan standar akan melakukan salah satu dari dua hal: baik, mereka akan mengabaikannya, atau bahkan lebih buruk, robot akan belajar hal yang salah,” kata Nikolaidis.

“Dalam kontras, dalam cara yang sangat cerdas, pekerjaan ini menggunakan beberapa penalaran umum dalam bentuk logika untuk memahami bagian mana dari demonstrasi yang baik dan mana yang tidak,” katanya. “Pada dasarnya, ini adalah apa yang juga dilakukan manusia.”

Logika Temporal Sinyal

Robot dapat bernalar tentang hasil saat ini dan masa depan melalui STL, yang merupakan bahasa simbolik matematika yang ekspresif. Sebelumnya, penelitian menggunakan “logika temporal linier.”

Jyo Deshmukh adalah mantan insinyur Toyota dan asisten profesor ilmu komputer di USC.

“Ketika kita memasuki dunia sistem fisik siber, seperti robot dan mobil self-driving, di mana waktu sangat penting, logika temporal linier menjadi sedikit kikuk, karena ia bernalar tentang urutan nilai benar/palsu untuk variabel, sedangkan STL memungkinkan bernalar tentang sinyal fisik,” kata Deshmukh.

Tim peneliti terkejut dengan tingkat keberhasilan sistem.

“Dibandingkan dengan algoritma terbaik, yang digunakan secara luas dalam aplikasi robotika, Anda dapat melihat perbedaan besar dalam jumlah demonstrasi yang diperlukan,” kata Nikolaidis.

Menurut peneliti, sistem dapat belajar dari simulator mengemudi dan akhirnya video. Langkah selanjutnya adalah mengujinya pada robot nyata, karena pengujian awal dilakukan pada simulator permainan. Sistem ini akan berguna untuk aplikasi seperti yang ada di lingkungan rumah, gudang, dan penjelajah ruang angkasa.

“Jika kita ingin robot menjadi rekan yang baik dan membantu orang, pertama-tama mereka perlu belajar dan beradaptasi dengan preferensi manusia dengan sangat efisien,” kata Nikolaidis. “Metode kami menyediakan itu.”

Alex memimpin operasi berita berbasis AI di Unite.AI, menggabungkan jurnalisme, riset, dan otomatisasi untuk mendukung liputan kecerdasan buatan yang tepat waktu dan dapat diskalakan. Karyanya membantu memastikan perkembangan AI yang muncul terungkap secara efisien sambil mempertahankan standar editorial publikasi.