โมเดลและแพลตฟอร์ม AI

โรบอทของ Google ที่เรียนรู้การเคลื่อนไหวจากสุนัข

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แม้แต่โรบอทที่ทันสมัยที่สุดในปัจจุบันก็ยังคงเคลื่อนไหวด้วยวิธีการที่ไม่ค่อยมีประสิทธิภาพหรือกระตุกกระติก ในการให้โรบอทเคลื่อนไหวได้อย่างมีชีวิตชีวาและเป็นธรรมชาติ นักวิจัยที่ Google (GOOGL ) ได้พัฒนาระบบ AI ที่สามารถเรียนรู้จากการเคลื่อนไหวของสัตว์จริงได้ โดยการเรียนรู้จากสัตว์จริง ทีมวิจัยของ Google ได้ตีพิมพ์เอกสารก่อนการพิมพ์ที่อธิบายวิธีการของพวกเขาเมื่อสัปดาห์ที่แล้ว ในเอกสารและบทความใน บล็อก ทีมวิจัยอธิบายเหตุผลเบื้องหลังระบบนี้ ผู้เขียนเอกสารเชื่อว่าการให้โรบอทเคลื่อนไหวได้อย่างเป็นธรรมชาติจะช่วยให้พวกมันสามารถทำงานในโลกจริงที่ต้องการการเคลื่อนไหวที่แม่นยำ เช่น การส่งสิ่งของระหว่างชั้นต่างๆ ของอาคาร

ตามที่ VentureBeat รายงาน ทีมวิจัยได้ใช้การเรียนรู้แบบเสริมกำลังในการฝึกโรบอท นักวิจัยเริ่มต้นด้วยการเก็บคลิปวิดีโอของสัตว์จริงที่เคลื่อนไหวและใช้เทคนิคการเรียนรู้แบบเสริมกำลัง (RL) เพื่อผลักดันให้โรบอทเลียนแบบการเคลื่อนไหวของสัตว์ในช่วงคลิปวิดีโอ ในกรณีนี้ นักวิจัยได้ฝึกโรบอทด้วยคลิปวิดีโอของสุนัขที่ออกแบบในซิมูเลเตอร์物理学 โดยสั่งให้โรบอท Unitree Laikago สี่ขาเลียนแบบการเคลื่อนไหวของสุนัข หลังจากที่โรบอทได้รับการฝึกแล้ว มันสามารถเคลื่อนไหวได้อย่างซับซ้อน เช่น การกระโดด การเปลี่ยน направление และการเดินเร็วที่ความเร็วประมาณ 2.6 ไมล์ต่อชั่วโมง

ข้อมูลการฝึกประกอบด้วยตัวอย่างการเคลื่อนไหวของสุนัขประมาณ 200 ล้านตัวอย่างที่ติดตามในซิมูเลเตอร์物理学 การเคลื่อนไหวที่แตกต่างกันถูกผ่านฟังก์ชันรางวัลและนโยบายที่ตัวแทนเรียนรู้ด้วย หลังจากที่นโยบายถูกสร้างขึ้นในซิมูเลเตอร์แล้ว มันถูกถ่ายโอนไปยังโลกจริงโดยใช้เทคนิคที่เรียกว่าการปรับตัวแบบ 潛在空間 เนื่องจากซิมูเลเตอร์物理学ที่ใช้ในการฝึกโรบอทสามารถประมาณการเคลื่อนไหวในโลกจริงได้เพียงบางด้านเท่านั้น นักวิจัยจึงใช้การเพิ่มสุ่มๆ ต่างๆ ลงในซิมูเลเตอร์ โดยมีจุดมุ่งหมายเพื่อจำลองการทำงานภายใต้สภาพแวดล้อมที่แตกต่างกัน

ตามที่ทีมวิจัยระบุ พวกเขาสามารถปรับเปลี่ยนนโยบายซิมูเลเตอร์ให้เหมาะสมกับโรบอทในโลกจริงได้โดยใช้ข้อมูลเพียง 8 นาทีจาก 50 การทดลองต่างๆ นักวิจัยสามารถแสดงให้เห็นว่าโรบอทในโลกจริงสามารถเลียนแบบการเคลื่อนไหวที่เฉพาะเจาะจงและหลากหลาย เช่น การเดินเร็ว การเปลี่ยน направление การกระโดด และการเดินช้าๆ พวกเขายังสามารถเลียนแบบการเคลื่อนไหวที่สร้างโดยศิลปินแอนิเมชั่น เช่น การกระโดดและเปลี่ยน направทางพร้อมกัน

นักวิจัยสรุปผลการวิจัยในเอกสารดังนี้

“เราแสดงให้เห็นว่าโดยการนำข้อมูลการเคลื่อนไหวมาใช้ วิธีการเรียนรู้แบบเดียวสามารถสังเคราะห์เครื่องควบคุมสำหรับพฤติกรรมที่หลากหลายของโรบอทขาได้ โดยการรวมเทคนิคการปรับตัวแบบ ประหยัดข้อมูลเข้าในการฝึก ระบบของเราสามารถเรียนรู้นโยบายที่ปรับเปลี่ยนได้ในซิมูเลเตอร์ ซึ่งสามารถปรับให้เหมาะสมกับการใช้งานในโลกจริงได้อย่างรวดเร็ว”

นโยบายการควบคุมที่ใช้ในการเรียนรู้แบบเสริมกำลังมีข้อจำกัด เนื่องจากข้อจำกัดที่เกิดจากฮาร์ดแวร์และอัลกอริทึม มีสิ่งที่โรบอทไม่สามารถทำได้ เช่น การวิ่งหรือการกระโดดขนาดใหญ่ นโยบายที่เรียนรู้ยังไม่มีความเสถียรเท่ากับการเคลื่อนไหวที่ออกแบบด้วยมือ ทีมวิจัยต้องการที่จะพัฒนาผลงานต่อไปโดยการทำให้เครื่องควบคุมมีความแข็งแรงและสามารถเรียนรู้จากข้อมูลประเภทต่างๆ ได้ ในอุดมคติ ระบบในอนาคตจะสามารถเรียนรู้จากข้อมูลวิดีโอได้

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี