Robotika dan AI fisik
Model Pembelajaran Mesin Memahami Hubungan Antara Objek
Peneliti di Massachusetts Institute of Technology (MIT) telah mengembangkan model pembelajaran mesin (ML) baru yang memahami hubungan antara objek dalam sebuah adegan. Model ini menggambarkan hubungan individu satu per satu sebelum menggabungkan representasi untuk menjelaskan adegan secara keseluruhan.
Melalui pendekatan baru ini, model ML dapat menghasilkan gambar yang lebih akurat dari deskripsi teks, dan dapat melakukannya bahkan ketika adegan memiliki beberapa proyek yang disusun dalam hubungan yang berbeda satu sama lain.
Pengembangan ini sangat penting karena banyak model pembelajaran dalam yang tidak dapat memahami hubungan yang terkait antara objek individu.
Model tim ini dapat digunakan dalam kasus di mana robot industri harus melakukan tugas manipulasi multi-langkah, seperti menumpuk item atau merakit peralatan. Ini juga membantu memimpin mesin untuk belajar dari dan berinteraksi dengan lingkungannya, seperti halnya manusia.
Yilun Du adalah mahasiswa PhD di Laboratorium Ilmu Komputer dan Kecerdasan Buatan (CSAIL) dan ko-penulis utama makalah ini. Du memimpin penelitian dengan Shuang Li, mahasiswa PhD CSAIL, dan Nan Liu, mahasiswa pascasarjana di University of Illinois at Urbana-Champaign. Ini juga termasuk Joshua B. Tenenbaum, Profesor Pengembangan Karir Paul E. Newton untuk Ilmu Kognitif dan Komputasi di Departemen Otak dan Ilmu Kognitif, dan penulis senior Antonio Torralba, Profesor Elektronika Delta dan Ilmu Komputer. Baik Tenenbaum dan Torralba adalah anggota CSAIL.
Kerangka Baru
“Ketika saya melihat meja, saya tidak bisa mengatakan bahwa ada objek di lokasi XYZ. Pikiran kita tidak bekerja seperti itu. Di pikiran kita, ketika kita memahami adegan, kita benar-benar memahaminya berdasarkan hubungan antara objek. Kita pikir bahwa dengan membangun sistem yang dapat memahami hubungan antara objek, kita bisa menggunakan sistem itu untuk lebih efektif memanipulasi dan mengubah lingkungan kita,” kata Du.
Kerangka baru ini dapat menghasilkan gambar adegan berdasarkan deskripsi teks objek dan hubungannya.
Sistem ini kemudian dapat memecah kalimat-kalimat menjadi potongan-potongan yang lebih kecil yang menjelaskan setiap hubungan individu. Setiap bagian kemudian dimodelkan secara terpisah, dan potongan-potongan tersebut digabungkan melalui proses optimasi yang menghasilkan gambar adegan.
Dengan kalimat-kalimat yang dipotong menjadi potongan-potongan yang lebih pendek, sistem ini kemudian dapat menggabungkan kembali potongan-potongan tersebut dalam cara yang berbeda, memungkinkan sistem untuk beradaptasi dengan deskripsi adegan yang belum pernah ditemui.
“Sistem lain akan mengambil semua hubungan secara holistik dan menghasilkan gambar satu-shot dari deskripsi. Namun, pendekatan seperti itu gagal ketika kita memiliki deskripsi yang tidak biasa, seperti deskripsi dengan lebih banyak hubungan, karena model-model tersebut tidak dapat beradaptasi satu-shot untuk menghasilkan gambar yang mengandung lebih banyak hubungan. Namun, karena kita menyusun model-model yang lebih kecil ini bersama-sama, kita dapat memodelkan sejumlah hubungan yang lebih besar dan beradaptasi dengan kombinasi baru,” kata Du.
Sistem ini juga dapat melakukan proses ini secara terbalik. Jika sistem diberi gambar, sistem dapat menemukan deskripsi teks yang sesuai dengan hubungan antara objek dalam adegan.
Mengevaluasi Model
Peneliti meminta manusia untuk mengevaluasi apakah gambar yang dihasilkan sesuai dengan deskripsi adegan asli. Ketika deskripsi mengandung tiga hubungan, yang merupakan jenis yang paling kompleks, 91 persen peserta mengatakan bahwa model baru ini berperforma lebih baik daripada metode pembelajaran dalam lainnya.
“Satu hal yang menarik yang kami temukan adalah bahwa untuk model kami, kami dapat meningkatkan kalimat kami dari memiliki satu deskripsi hubungan ke memiliki dua, atau tiga, atau bahkan empat deskripsi, dan pendekatan kami terus dapat menghasilkan gambar yang benar-benar sesuai dengan deskripsi tersebut, sementara metode lain gagal,” kata Du.
Model ini juga menunjukkan kemampuan yang mengesankan untuk bekerja dengan deskripsi yang belum pernah ditemui sebelumnya.
“Ini sangat menjanjikan karena itu lebih dekat dengan bagaimana manusia bekerja. Manusia mungkin hanya melihat beberapa contoh, tetapi kita dapat mengekstrak informasi yang berguna dari hanya beberapa contoh itu dan menggabungkannya bersama untuk menciptakan kombinasi tak terhingga. Dan model kami memiliki sifat yang memungkinkan untuk belajar dari data yang lebih sedikit tetapi umum untuk adegan atau generasi gambar yang lebih kompleks,” kata Li.
Tim ini sekarang akan menguji model pada gambar dunia nyata yang lebih kompleks dan menjelajahi bagaimana untuk akhirnya mengintegrasikan model ke dalam sistem robotika.












