หุ่นยนต์และ AI ทางกายภาพ
โมเดลการเรียนรู้ของเครื่องจักรที่เข้าใจความสัมพันธ์ระหว่างวัตถุ
นักวิจัยที่สถาบันเทคโนโลยีแมสซาชูเซตส์ (MIT) ได้พัฒนาโมเดลการเรียนรู้ของเครื่องจักร (ML) ใหม่ที่เข้าใจความสัมพันธ์ระหว่างวัตถุในฉาก โมเดลนี้แสดงความสัมพันธ์ระหว่างวัตถุแต่ละคู่ก่อนที่จะรวมการแสดงภาพเพื่ออธิบายฉากโดยรวม
โดยใช้แนวทางใหม่นี้ โมเดล ML สามารถสร้างภาพที่แม่นยำยิ่งขึ้นจากคำอธิบายข้อความ และสามารถทำได้แม้ว่าฉากจะมีหลายโครงการจัดเรียงในความสัมพันธ์ที่แตกต่างกัน
การพัฒนานี้มีความสำคัญเนื่องจากโมเดลการเรียนรู้ลึกหลายรูปแบบไม่สามารถเข้าใจความสัมพันธ์ที่ซับซ้อนระหว่างวัตถุแต่ละชิ้น
โมเดลของทีมสามารถใช้ในกรณีที่หุ่นยนต์อุตสาหกรรมต้องทำงานหลายขั้นตอน เช่น การวางสินค้าหรือการประกอบเครื่องใช้ไฟฟ้า นอกจากนี้ยังช่วยให้เครื่องจักรสามารถเรียนรู้และโต้ตอบกับสภาพแวดล้อมได้เหมือนมนุษย์
Yilun Du เป็นนักศึกษาระดับ博士ในห้องปฏิบัติการวิทยาศาสตร์คอมพิวเตอร์และปัญญาประดิษฐ์ (CSAIL) และเป็นผู้เขียนหลักของงานวิจัย Du ได้ร่วมนำการวิจัยกับ Shuang Li นักศึกษาระดับ博士ใน CSAIL และ Nan Liu นักศึกษาระดับบัณฑิตศึกษาจากมหาวิทยาลัยอิลลินอยส์ tại Urbana-Champaign การวิจัยนี้ยังรวมถึง Joshua B. Tenenbaum ศาสตราจารย์ด้านวิทยาศาสตร์และการคำนวณในภาควิชาวิทยาศาสตร์สมองและจิตวิทยา และ Antonio Torralba ศาสตราจารย์ด้านวิศวกรรมไฟฟ้าและคอมพิวเตอร์ ทั้ง Tenenbaum และ Torralba เป็นสมาชิกของ CSAIL
โครงสร้างใหม่
“เมื่อฉันดูโต๊ะ ฉันไม่สามารถบอกได้ว่ามีวัตถุอยู่ที่ตำแหน่ง XYZ จิตใจของเราไม่ทำงานแบบนั้น เมื่อเราเข้าใจฉาก เราเข้าใจจริงๆ ตามความสัมพันธ์ระหว่างวัตถุ เราคิดว่าโดยการสร้างระบบที่สามารถเข้าใจความสัมพันธ์ระหว่างวัตถุได้ เราสามารถใช้ระบบนั้นเพื่อจัดการและเปลี่ยนแปลงสภาพแวดล้อมของเราได้อย่างมีประสิทธิภาพ” Du กล่าว
โครงสร้างใหม่นี้สามารถสร้างภาพของฉากตามคำอธิบายข้อความของวัตถุและความสัมพันธ์ระหว่างวัตถุ
ระบบสามารถแบ่งคำอธิบายเหล่านี้ออกเป็นชิ้นเล็กๆ ที่อธิบายความสัมพันธ์ระหว่างวัตถุแต่ละคู่ ชิ้นเล็กๆ เหล่านี้จะถูกสร้างแบบจำลองแยกกัน และรวมกันผ่านกระบวนการปรับให้เหมาะสมที่สร้างภาพของฉาก
เมื่อคำอธิบายถูกแบ่งออกเป็นชิ้นเล็กๆ ระบบสามารถรวมชิ้นเหล่านี้ใหม่ในรูปแบบต่างๆ ทำให้สามารถปรับตัวให้เข้ากับคำอธิบายฉากที่ไม่เคยพบมาก่อน
“ระบบอื่นๆ จะใช้ความสัมพันธ์ทั้งหมดแบบองค์รวมและสร้างภาพจากคำอธิบายในครั้งเดียว อย่างไรก็ตาม วิธีการเหล่านี้ล้มเหลวเมื่อเรามีคำอธิบายที่ไม่อยู่ในกลุ่ม เช่น คำอธิบายที่มีความสัมพันธ์มากกว่า เนื่องจากโมเดลเหล่านี้ไม่สามารถปรับตัวให้เข้ากับการสร้างภาพที่มีความสัมพันธ์มากกว่าได้ แต่เนื่องจากเราประกอบโมเดลเล็กๆ เหล่านี้เข้าด้วยกัน เราจึงสามารถสร้างแบบจำลองความสัมพันธ์ที่มากกว่าและปรับตัวให้เข้ากับการรวมกันที่ใหม่” Du กล่าว
ระบบสามารถทำสิ่งนี้ในทางกลับกันได้ หากมีภาพเป็นข้อมูลเข้า ระบบสามารถหาคำอธิบายข้อความที่ตรงกับความสัมพันธ์ระหว่างวัตถุในฉาก
การประเมินโมเดล
นักวิจัยขอให้มนุษย์ประเมินว่าภาพที่สร้างขึ้นตรงกับคำอธิบายฉากเดิมหรือไม่ เมื่อคำอธิบายมีความสัมพันธ์ 3 แบบ ซึ่งเป็นประเภทที่ซับซ้อนมากที่สุด 91% ของผู้เข้าร่วมบอกว่าโมเดลใหม่นี้ทำงานได้ดีกว่าวิธีการเรียนรู้ลึกอื่นๆ
“สิ่งที่น่าสนใจที่เราพบคือสำหรับโมเดลของเรา เราสามารถเพิ่มประโยคของเราจากความสัมพันธ์ 1 แบบเป็น 2 หรือ 3 หรือแม้กระทั่ง 4 และวิธีการของเรายังคงสามารถสร้างภาพที่ถูกอธิบายโดยคำอธิบายเหล่านั้นได้ ในขณะที่วิธีการอื่นๆ ล้มเหลว” Du กล่าว
โมเดลยังแสดงความสามารถที่น่าประทับใจในการทำงานกับคำอธิบายที่ไม่เคยพบมาก่อน
“สิ่งนี้มีแนวโน้มที่จะดีมาก เนื่องจากเป็นแนวทางที่ใกล้เคียงกับวิธีการทำงานของมนุษย์ มนุษย์อาจเห็นตัวอย่างเพียงไม่กี่ตัวอย่าง แต่เราสามารถดึงข้อมูลที่มีประโยชน์จากตัวอย่างเหล่านั้นและรวมเข้าด้วยกันเพื่อสร้างการรวมกันที่ไม่สิ้นสุด และโมเดลของเรามีคุณสมบัติที่ช่วยให้เรียนรู้จากข้อมูลที่น้อยกว่า แต่สามารถสร้างภาพที่ซับซ้อนหรือสร้างภาพได้” Li กล่าว
ทีมจะทดสอบโมเดลกับภาพจริงที่ซับซ้อนมากขึ้นและสำรวจวิธีการรวมโมเดลเข้ากับระบบหุ่นยนต์












