หุ่นยนต์และ AI ทางกายภาพ

โมเดลการเรียนรู้ของเครื่องจักรที่เข้าใจความสัมพันธ์ระหว่างวัตถุ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยที่สถาบันเทคโนโลยีแมสซาชูเซตส์ (MIT) ได้พัฒนาโมเดลการเรียนรู้ของเครื่องจักร (ML) ใหม่ที่เข้าใจความสัมพันธ์ระหว่างวัตถุในฉาก โมเดลนี้แสดงความสัมพันธ์ระหว่างวัตถุแต่ละคู่ก่อนที่จะรวมการแสดงภาพเพื่ออธิบายฉากโดยรวม

โดยใช้แนวทางใหม่นี้ โมเดล ML สามารถสร้างภาพที่แม่นยำยิ่งขึ้นจากคำอธิบายข้อความ และสามารถทำได้แม้ว่าฉากจะมีหลายโครงการจัดเรียงในความสัมพันธ์ที่แตกต่างกัน

การพัฒนานี้มีความสำคัญเนื่องจากโมเดลการเรียนรู้ลึกหลายรูปแบบไม่สามารถเข้าใจความสัมพันธ์ที่ซับซ้อนระหว่างวัตถุแต่ละชิ้น

โมเดลของทีมสามารถใช้ในกรณีที่หุ่นยนต์อุตสาหกรรมต้องทำงานหลายขั้นตอน เช่น การวางสินค้าหรือการประกอบเครื่องใช้ไฟฟ้า นอกจากนี้ยังช่วยให้เครื่องจักรสามารถเรียนรู้และโต้ตอบกับสภาพแวดล้อมได้เหมือนมนุษย์

Yilun Du เป็นนักศึกษาระดับ博士ในห้องปฏิบัติการวิทยาศาสตร์คอมพิวเตอร์และปัญญาประดิษฐ์ (CSAIL) และเป็นผู้เขียนหลักของงานวิจัย Du ได้ร่วมนำการวิจัยกับ Shuang Li นักศึกษาระดับ博士ใน CSAIL และ Nan Liu นักศึกษาระดับบัณฑิตศึกษาจากมหาวิทยาลัยอิลลินอยส์ tại Urbana-Champaign การวิจัยนี้ยังรวมถึง Joshua B. Tenenbaum ศาสตราจารย์ด้านวิทยาศาสตร์และการคำนวณในภาควิชาวิทยาศาสตร์สมองและจิตวิทยา และ Antonio Torralba ศาสตราจารย์ด้านวิศวกรรมไฟฟ้าและคอมพิวเตอร์ ทั้ง Tenenbaum และ Torralba เป็นสมาชิกของ CSAIL

โครงสร้างใหม่

“เมื่อฉันดูโต๊ะ ฉันไม่สามารถบอกได้ว่ามีวัตถุอยู่ที่ตำแหน่ง XYZ จิตใจของเราไม่ทำงานแบบนั้น เมื่อเราเข้าใจฉาก เราเข้าใจจริงๆ ตามความสัมพันธ์ระหว่างวัตถุ เราคิดว่าโดยการสร้างระบบที่สามารถเข้าใจความสัมพันธ์ระหว่างวัตถุได้ เราสามารถใช้ระบบนั้นเพื่อจัดการและเปลี่ยนแปลงสภาพแวดล้อมของเราได้อย่างมีประสิทธิภาพ” Du กล่าว

โครงสร้างใหม่นี้สามารถสร้างภาพของฉากตามคำอธิบายข้อความของวัตถุและความสัมพันธ์ระหว่างวัตถุ

ระบบสามารถแบ่งคำอธิบายเหล่านี้ออกเป็นชิ้นเล็กๆ ที่อธิบายความสัมพันธ์ระหว่างวัตถุแต่ละคู่ ชิ้นเล็กๆ เหล่านี้จะถูกสร้างแบบจำลองแยกกัน และรวมกันผ่านกระบวนการปรับให้เหมาะสมที่สร้างภาพของฉาก

เมื่อคำอธิบายถูกแบ่งออกเป็นชิ้นเล็กๆ ระบบสามารถรวมชิ้นเหล่านี้ใหม่ในรูปแบบต่างๆ ทำให้สามารถปรับตัวให้เข้ากับคำอธิบายฉากที่ไม่เคยพบมาก่อน

“ระบบอื่นๆ จะใช้ความสัมพันธ์ทั้งหมดแบบองค์รวมและสร้างภาพจากคำอธิบายในครั้งเดียว อย่างไรก็ตาม วิธีการเหล่านี้ล้มเหลวเมื่อเรามีคำอธิบายที่ไม่อยู่ในกลุ่ม เช่น คำอธิบายที่มีความสัมพันธ์มากกว่า เนื่องจากโมเดลเหล่านี้ไม่สามารถปรับตัวให้เข้ากับการสร้างภาพที่มีความสัมพันธ์มากกว่าได้ แต่เนื่องจากเราประกอบโมเดลเล็กๆ เหล่านี้เข้าด้วยกัน เราจึงสามารถสร้างแบบจำลองความสัมพันธ์ที่มากกว่าและปรับตัวให้เข้ากับการรวมกันที่ใหม่” Du กล่าว

ระบบสามารถทำสิ่งนี้ในทางกลับกันได้ หากมีภาพเป็นข้อมูลเข้า ระบบสามารถหาคำอธิบายข้อความที่ตรงกับความสัมพันธ์ระหว่างวัตถุในฉาก

การประเมินโมเดล

นักวิจัยขอให้มนุษย์ประเมินว่าภาพที่สร้างขึ้นตรงกับคำอธิบายฉากเดิมหรือไม่ เมื่อคำอธิบายมีความสัมพันธ์ 3 แบบ ซึ่งเป็นประเภทที่ซับซ้อนมากที่สุด 91% ของผู้เข้าร่วมบอกว่าโมเดลใหม่นี้ทำงานได้ดีกว่าวิธีการเรียนรู้ลึกอื่นๆ

“สิ่งที่น่าสนใจที่เราพบคือสำหรับโมเดลของเรา เราสามารถเพิ่มประโยคของเราจากความสัมพันธ์ 1 แบบเป็น 2 หรือ 3 หรือแม้กระทั่ง 4 และวิธีการของเรายังคงสามารถสร้างภาพที่ถูกอธิบายโดยคำอธิบายเหล่านั้นได้ ในขณะที่วิธีการอื่นๆ ล้มเหลว” Du กล่าว

โมเดลยังแสดงความสามารถที่น่าประทับใจในการทำงานกับคำอธิบายที่ไม่เคยพบมาก่อน

“สิ่งนี้มีแนวโน้มที่จะดีมาก เนื่องจากเป็นแนวทางที่ใกล้เคียงกับวิธีการทำงานของมนุษย์ มนุษย์อาจเห็นตัวอย่างเพียงไม่กี่ตัวอย่าง แต่เราสามารถดึงข้อมูลที่มีประโยชน์จากตัวอย่างเหล่านั้นและรวมเข้าด้วยกันเพื่อสร้างการรวมกันที่ไม่สิ้นสุด และโมเดลของเรามีคุณสมบัติที่ช่วยให้เรียนรู้จากข้อมูลที่น้อยกว่า แต่สามารถสร้างภาพที่ซับซ้อนหรือสร้างภาพได้” Li กล่าว

ทีมจะทดสอบโมเดลกับภาพจริงที่ซับซ้อนมากขึ้นและสำรวจวิธีการรวมโมเดลเข้ากับระบบหุ่นยนต์

Alex นำทีมการดำเนินงานข่าวสารที่ขับเคลื่อนด้วย AI ของ Unite.AI โดยผสานการทำข่าว, การวิจัย และระบบอัตโนมัติเพื่อสนับสนุนการครอบคลุมปัญญาประดิษฐ์อย่างทันท่วงทีและขยายได้ งานของเขาช่วยให้การพัฒนาปัญญาประดิษฐ์ที่กำลังเกิดขึ้นถูกนำเสนออย่างมีประสิทธิภาพในขณะที่ยังคงรักษามาตรฐานบรรณาธิการของสำนักพิมพ์.