หุ่นยนต์และ AI ทางกายภาพ
โรบอทที่สามารถเรียนรู้งานที่ซับซ้อนจากการสาธิตเพียงไม่กี่ครั้ง
ในหนึ่งในการพัฒนาล่าสุดในด้านหุ่นยนต์ นักวิจัยจากมหาวิทยาลัยเซาเทิร์นแคลิฟอร์เนีย (USC) ได้พัฒนาระบบที่หุ่นยนต์สามารถเรียนรู้งานที่ซับซ้อนได้จากการสาธิตเพียงไม่กี่ครั้ง และน่าประทับใจยิ่งขึ้น การสาธิตบางครั้งอาจไม่สมบูรณ์
การวิจัยนี้ถูกนำเสนอที่การประชุมสัมมนาเรื่องการเรียนรู้ของหุ่นยนต์ (CoRL) เมื่อวันที่ 18 พฤศจิกายน โดยมีชื่อเรื่อง “การเรียนรู้จากการสาธิตโดยใช้ Signal Temporal Logic”
ระบบ
คุณภาพของการสาธิตแต่ละครั้งจะถูกวัดเพื่อให้ระบบสามารถเรียนรู้จากความสำเร็จและความล้มเหลวของมัน ไม่เหมือนกับวิธีการปัจจุบันที่ต้องใช้การสาธิตอย่างน้อย 100 ครั้งเพื่อสอนงานเฉพาะ ระบบใหม่นี้ต้องใช้เพียงไม่กี่ครั้งเท่านั้น ในลักษณะที่มีเหตุผล หุ่นยนต์เหล่านี้เรียนรู้ในลักษณะที่คล้ายกับวิธีที่มนุษย์เรียนรู้จากกันและกัน ตัวอย่างเช่น มนุษย์เรียนรู้โดยดูและเรียนรู้จากผู้อื่นที่ทำงานสำเร็จหรือไม่สมบูรณ์
อนิรุทธ์ ปูรานิก เป็นผู้เขียนหลักของการวิจัยและเป็นนักศึกษาระดับ博士ในด้านวิทยาการคอมพิวเตอร์ที่ USC Viterbi School of Engineering
“ระบบการเรียนรู้ของเครื่องและระบบการเรียนรู้แบบเสริมแรงต้องใช้ข้อมูลจำนวนมากและต้องใช้การสาธิตหลายร้อยครั้ง – คุณต้องมีมนุษย์สาธิตซ้ำๆ ซึ่งไม่เหมาะสม” ปูรานิกกล่าว
“และคนส่วนใหญ่ไม่มีความรู้ด้านการเขียนโปรแกรมเพื่อระบุอย่างชัดเจนว่าหุ่นยนต์ต้องทำอะไร และมนุษย์ไม่สามารถสาธิตทุกสิ่งที่หุ่นยนต์ต้องรู้ได้” เขายังคง “อะไรจะเกิดขึ้นหากหุ่นยนต์พบสิ่งที่ไม่เคยเห็นมาก่อน นี่เป็นความท้าทายหลัก”
นักวิจัยใช้ “signal temporal logic” หรือ STL เพื่อกำหนดคุณภาพของการสาธิต โดยจัดอันดับและสร้างรางวัลที่มีอยู่
มีสองเหตุผลหลักที่นักวิจัยตัดสินใจใช้ STL:
- โดยการเรียนรู้จากการสาธิต หุ่นยนต์สามารถรับพฤติกรรมที่ไม่สมบูรณ์หรือไม่ปลอดภัยและกระทำที่ไม่พึงประสงค์ได้
- การสาธิตสามารถแตกต่างกันในด้านคุณภาพขึ้นอยู่กับผู้ที่ให้การสาธิต และการสาธิตบางครั้งเป็นตัวบ่งชี้พฤติกรรมที่ต้องการมากกว่าการสาธิตอื่นๆ
โดยการพัฒนาระบบในลักษณะนี้ หุ่นยนต์สามารถเรียนรู้จากการสาธิตที่ไม่สมบูรณ์ได้ แม้ว่ามันจะไม่ตรงตามข้อกำหนดของตรรกะก็ตาม ในอีกคำหนึ่ง มันสรุปผลเกี่ยวกับความถูกต้องหรือความสำเร็จด้วยตนเอง
สเตฟานอส นิโคไลดิส เป็นผู้ร่วมเขียนและเป็นรองศาสตราจารย์ด้านวิทยาการคอมพิวเตอร์ที่ USC Viterbi
“สมมติว่าหุ่นยนต์เรียนรู้จากการสาธิตหลายประเภท – อาจเป็นการสาธิตแบบมือ, วิดีโอ หรือซิมูเลชัน – หากฉันทำสิ่งที่ไม่ปลอดภัย วิธีการมาตรฐานจะทำสองสิ่ง: หรือมันจะละเลยสิ่งนั้น หรือในกรณีที่แย่กว่านั้น หุ่นยนต์จะเรียนรู้สิ่งที่ไม่ถูกต้อง” นิโคไลดิสกล่าว
“ในทางตรงกันข้าม ในลักษณะที่ฉลาดมาก การทำงานนี้ใช้เหตุผลทั่วไปในรูปแบบของตรรกะเพื่อทำความเข้าใจว่าส่วนใดของการสาธิตที่ดีและไม่ดี” เขายังคง “โดยพื้นฐานแล้ว นี่คือสิ่งที่มนุษย์ทำเช่นกัน”
Signal Temporal Logic
หุ่นยนต์สามารถให้เหตุผลเกี่ยวกับผลลัพธ์ในปัจจุบันและอนาคตผ่าน STL ซึ่งเป็นภาษาสัญลักษณ์ทางคณิตศาสตร์ที่มีการแสดงออกอย่างชัดเจน ก่อนหน้านี้ STL วิจัยอาศัย “linear temporal logic”
จโย เดชมุข เป็นอดีตวิศวกรของโตโยต้าและเป็นรองศาสตราจารย์ด้านวิทยาการคอมพิวเตอร์ที่ USC
“เมื่อเราก้าวเข้าสู่โลกของระบบไซเบอร์ฟิสิกส์ เช่น หุ่นยนต์และรถยนต์ขับเคลื่อนอัตโนมัติ ซึ่งเวลามีความสำคัญอย่างมาก ตรรกะเชิงเส้นจะกลายเป็นเรื่องที่ยุ่งยากเพราะมันให้เหตุผลเกี่ยวกับลำดับของค่า true/false ของตัวแปร ในขณะที่ STL ช่วยให้เหตุผลเกี่ยวกับสัญญาณทางกายภาพ” เดชมุขกล่าว
ทีมนักวิจัยตกใจกับความสำเร็จของระบบ
“เมื่อเปรียบเทียบกับอัลกอริทึมที่ดีที่สุดซึ่งใช้กันอย่างแพร่หลายในแอปพลิเคชันหุ่นยนต์ คุณจะเห็นความแตกต่างในอันดับของจำนวนการสาธิตที่ต้องการ” นิโคไลดิสกล่าว
ตามนักวิจัย ระบบสามารถเรียนรู้จากซิมูเลเตอร์การขับขี่และในที่สุดจากวิดีโอได้ ขั้นตอนต่อไปคือการทดสอบบนหุ่นยนต์จริง เนื่องจากการทดสอบเบื้องต้นทำบนซิมูเลเตอร์เกม ระบบจะมีประโยชน์สำหรับการใช้งาน เช่น ในสภาพแวดล้อมในบ้าน คลังสินค้า และรถสำรวจอวกาศ
“หากเราต้องการให้หุ่นยนต์เป็นเพื่อนร่วมทีมที่ดีและช่วยเหลือผู้คน อันดับแรกพวกเขาต้องเรียนรู้และปรับตัวให้เข้ากับความชอบของมนุษย์อย่างมีประสิทธิภาพ” นิโคไลดิสกล่าว “วิธีการของเรามอบสิ่งนั้นให้”












