Model dan platform AI

Peneliti Mengembangkan Model Komputer JL2P untuk Menerjemahkan Naskah Film ke Animasi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Peneliti di Universitas Carnegie Mellon telah mengembangkan model komputer yang mampu menerjemahkan teks yang menjelaskan gerakan fisik menjadi animasi komputer sederhana. Pengembangan baru ini dapat membuatnya mungkin untuk film dan animasi lainnya dibuat langsung dari model komputer yang membaca naskah.

Ilmuwan telah membuat kemajuan dalam membuat komputer memahami bahasa alami dan menghasilkan pose fisik dari naskah. Model komputer baru ini dapat menjadi jembatan antara keduanya.

Louis-Philippe Morency, profesor asosiasi di Institut Teknologi Bahasa (LTI), dan Chaitanya Ahuja, mahasiswa Ph.D. LTI, telah menggunakan arsitektur neural yang disebut Joint Language-to-Pose (JL2P). Model JL2P mampu mengintegrasikan kalimat dan gerakan fisik. Ini memungkinkan untuk mempelajari bagaimana bahasa terkait dengan tindakan, gerakan, dan gerakan.

“Saya pikir kita berada di tahap awal penelitian ini, tetapi dari perspektif pemodelan, kecerdasan buatan, dan teori, ini adalah momen yang sangat menarik,” kata Morency. “Saat ini, kita berbicara tentang menganimasi karakter virtual. Akhirnya, hubungan antara bahasa dan gerakan ini dapat diterapkan pada robot; kita mungkin dapat mengontrol robot dan memberitahu apa yang kita inginkan mereka lakukan.

“Kita juga dapat mengembangkan hal ini ke arah lain – menggunakan hubungan antara bahasa dan animasi sehingga komputer dapat menjelaskan apa yang terjadi dalam video,” tambahnya.

Model Joint Language-to-Pose akan dipresentasikan oleh Ahuja pada 19 September di Konferensi Internasional tentang 3D Vision. Konferensi tersebut akan diadakan di Quebec City, Kanada.

Model JL2P dibuat dengan pendekatan pembelajaran kurikulum. Langkah pertama yang penting adalah model mempelajari urutan pendek dan sederhana. Itu akan menjadi sesuatu seperti “Seorang berjalan ke depan.” Kemudian, itu bergerak ke urutan yang lebih panjang dan lebih sulit seperti “Seorang melangkah ke depan, kemudian berputar dan melangkah ke depan lagi,” atau “Seorang melompati hambatan saat berlari.”

Ketika model menggunakan urutan, itu melihat kata kerja dan kata keterangan. Ini menjelaskan tindakan dan kecepatan/akselerasi tindakan. Kemudian, itu melihat kata benda dan kata sifat yang menjelaskan lokasi dan arah. Menurut Ahuja, tujuan akhir untuk model ini adalah untuk menganimasi urutan yang kompleks dengan beberapa tindakan yang terjadi secara bersamaan atau berurutan.

Saat ini, animasi masih terbatas pada tokoh stick, tetapi ilmuwan akan terus mengembangkan model ini. Salah satu komplikasi yang muncul adalah bahwa menurut Morency, banyak hal terjadi secara bersamaan. Beberapa di antaranya bahkan terjadi dalam urutan sederhana.

“Sinkronisasi antara bagian tubuh sangat penting,” kata Morency. “Setiap kali Anda menggerakkan kaki, Anda juga menggerakkan lengan, tubuh, dan mungkin kepala. Animasi tubuh perlu mengkoordinasikan komponen yang berbeda ini, sambil mencapai tindakan yang kompleks. Menghubungkan narasi bahasa dalam lingkungan animasi yang kompleks ini adalah tantangan dan menarik. Ini adalah langkah menuju pemahaman yang lebih baik tentang ucapan dan gerakan.”

Jika Model Joint Language-to-Pose dapat berkembang sehingga dapat membuat animasi yang kompleks dan tindakan berdasarkan bahasa, kemungkinannya sangat besar. Tidak hanya dapat digunakan dalam bidang seperti film dan animasi, tetapi juga akan membantu memimpin pengembangan dalam memahami ucapan dan gerakan.

Beralih ke kecerdasan buatan, model JL2P ini dapat digunakan pada robot. Misalnya, robot mungkin dapat dikontrol dan diberitahu apa yang harus dilakukan, dan mereka akan dapat memahami bahasa dan merespons sesuai.

Pengembangan baru ini akan mempengaruhi banyak bidang yang berbeda, dan model ini akan terus berkembang untuk memahami bahasa yang kompleks.

Alex McFarland adalah seorang jurnalis dan penulis AI yang menjelajahi perkembangan terbaru dalam kecerdasan buatan. Ia telah berkolaborasi dengan berbagai startup dan publikasi AI di seluruh dunia.