หุ่นยนต์และ AI ทางกายภาพ
นักวิทยาศาสตร์คอมพิวเตอร์ใช้การเสริมแรงเชิงบวกเพื่อสอนหุ่นยนต์
นักวิทยาศาสตร์คอมพิวเตอร์จากมหาวิทยาลัยจอนส์ฮอปกินส์ได้นำเทคนิคการฝึกอบรมที่มีมานานอย่างการเสริมแรงเชิงบวกมาใช้กับหุ่นยนต์ เพื่อให้หุ่นยนต์สามารถสอนตัวเองได้ หุ่นยนต์เครื่องนี้สามารถเรียนรู้ทักษะใหม่ๆ เช่น การยัดกองบล็อก
หุ่นยนต์เครื่องนี้ชื่อ Spot และตามที่นักวิจัยกล่าว หุ่นยนต์สามารถเรียนรู้ทักษะภายในไม่กี่วัน ซึ่งปกติจะใช้เวลาประมาณหนึ่งเดือน
การเสริมแรงเชิงบวก
การเสริมแรงเชิงบวกถูกใช้โดยทีมนักวิจัยเพื่อเพิ่มทักษะของหุ่นยนต์ ความเร็วที่ทีมสามารถทำได้ ทำให้หุ่นยนต์ประเภทนี้สามารถใช้งานในโลกแห่งความเป็นจริงได้ง่ายขึ้น
งานวิจัยนี้ได้รับการตีพิมพ์ใน IEEE Robotics and Automation Letters, ชื่อ “Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.”
Andrew Hundt เป็นนักศึกษาระดับ博士ที่มหาวิทยาลัยจอนส์ฮอปกินส์และเป็นผู้เขียนหลักของงานวิจัย
“คำถามที่นี่คือว่าเราจะทำให้หุ่นยนต์เรียนรู้ทักษะได้อย่างไร?” เขากล่าว “ฉันมีสุนัขและฉันรู้ว่ารางวัลมีผลและนั่นคือแรงบันดาลใจในการออกแบบอัลกอริทึมการเรียนรู้”
หนึ่งในสาเหตุที่การเสริมแรงเชิงบวกใช้ได้กับคอมพิวเตอร์ คือคอมพิวเตอร์ไม่มีสมองที่มี直觉 ซึ่งหมายความว่าคอมพิวเตอร์เป็นแผ่นเปล่าที่สามารถเขียนอะไรได้ คอมพิวเตอร์ต้องเรียนรู้ทุกอย่างจากศูนย์ วิธีการเรียนรู้ที่มีประสิทธิภาพที่สุดสำหรับคอมพิวเตอร์คือการลองผิดลองถูก ซึ่งเป็นสิ่งที่นักวิจัยหุ่นยนต์กำลังทำงานอยู่
นี่คือสิ่งที่นักวิจัยทำเมื่อพวกเขาสร้างระบบรางวัลสำหรับหุ่นยนต์ คล้ายกับการฝึกสุนัขโดยให้รางวัลเป็นของกิน แต่หุ่นยนต์จะได้รับคะแนนจำนวนเมื่อทำภารกิจได้ถูกต้อง
https://www.youtube.com/watch?v=dvxqjJBWFD4
ทักษะที่เรียนรู้
เมื่อถึงเวลาที่หุ่นยนต์เรียนรู้วิธียัดกองบล็อก หุ่นยนต์ต้องเรียนรู้ที่จะเน้นไปที่การกระทำที่สร้างสรรค์ ในวิธีนี้ หุ่นยนต์ Spot ได้รับคะแนนสูงเมื่อทำพฤติกรรมที่ถูกต้องระหว่างยัดกองบล็อก ในทางกลับกัน หุ่นยนต์ไม่ได้รับคะแนนใดๆ สำหรับการกระทำที่ไม่ถูกต้อง หุ่นยนต์ได้รับคะแนนสูงสุดเมื่อยัดกองบล็อกสี่ก้อนและก้อนบนเป็นก้อนสุดท้าย
นักวิจัยพบว่า phương phápนี้ประสบความสำเร็จอย่างมาก โดยหุ่นยนต์สามารถเรียนรู้ได้ภายในไม่กี่วัน ซึ่งปกติจะใช้เวลาหลายสัปดาห์ โดยการฝึกหุ่นยนต์แบบจำลอง ทีมสามารถลดเวลาในการฝึกก่อนที่จะย้ายไปที่หุ่นยนต์ Spot
“หุ่นยนต์ต้องการคะแนนสูง” Hundt กล่าว “มันเรียนรู้พฤติกรรมที่ถูกต้องเพื่อให้ได้รับรางวัลที่ดีที่สุด ในความเป็นจริง มันใช้เวลาเดือนหนึ่งในการฝึกหุ่นยนต์ให้ได้ 100% ความแม่นยำ แต่เราสามารถทำได้ภายในสองวัน”
นอกจากการเรียนรู้วิธียัดกองบล็อกแล้ว หุ่นยนต์ยังใช้การเสริมแรงเชิงบวกเพื่อเรียนรู้ภารกิจอื่นๆ เช่น การเล่นเกมนำทางแบบจำลอง
“ในตอนแรก หุ่นยนต์ไม่รู้ว่ากำลังทำอะไร แต่มันจะดีขึ้นและดีขึ้นในแต่ละครั้ง มันไม่เคยยอมแพ้และพยายามยัดกองบล็อกจนสำเร็จ 100% ของเวลา” Hundt กล่าว
หนึ่งใน应用ที่เป็นไปได้สำหรับวิธีนี้คือการฝึกหุ่นยนต์ในบ้านให้ทำภารกิจต่างๆ เช่น การปรับปรุงยานพาหนะอัตโนมัติ
“เป้าหมายของเราคือการพัฒนาหุ่นยนต์ที่สามารถทำภารกิจที่ซับซ้อนในโลกแห่งความเป็นจริง เช่น การประกอบผลิตภัณฑ์ การดูแลผู้สูงอายุ และการผ่าตัด” Hager กล่าว “เราไม่รู้วิธีการเขียนโปรแกรมภารกิจเหล่านั้นในขณะนี้ เนื่องจากโลกมีความซับซ้อนเกินไป แต่งานวิจัยเช่นนี้แสดงให้เห็นว่ามีความหวังที่หุ่นยนต์จะเรียนรู้ที่จะทำภารกิจเหล่านั้นได้อย่างปลอดภัยและมีประสิทธิภาพ”












