โมเดลและแพลตฟอร์ม AI
ดีปไมนด์รายงานวิธีการใหม่ในการฝึกอบรม AI Reinforcement Learning อย่างปลอดภัย
การเรียนรู้แบบเสริมกำลังเป็นหนทางที่มีแนวโน้มในการพัฒนา AI โดยสามารถสร้าง AI ที่สามารถจัดการกับงานที่ซับซ้อนได้อย่างมาก อัลกอริทึมการเรียนรู้แบบเสริมกำลังถูกใช้ในการสร้างระบบหุ่นยนต์เคลื่อนที่และรถยนต์ไร้คนขับเป็นต้น อย่างไรก็ตาม เนื่องจากวิธีการฝึกอบรม AI แบบเสริมกำลัง อาจทำให้เกิดพฤติกรรมที่ไม่คาดคิดและไม่ปลอดภัยได้ พฤติกรรมเหล่านี้อาจเป็นอันตราย และนักวิจัย AI เรียกว่า “ปัญหาการสำรวจอย่างปลอดภัย” ซึ่งเป็นปัญหาที่ AI ติดอยู่ในการสำรวจสถานะที่ไม่ปลอดภัย
เมื่อเร็วๆ นี้ ห้องปฏิบัติการวิจัย AI ของ Google (GOOGL ) ซึ่งก็คือ ดีปไมนด์ ได้เผยแพร่บทความที่เสนอวิธีการใหม่ในการจัดการกับปัญหาการสำรวจอย่างปลอดภัยและฝึกอบรม AI แบบเสริมกำลังอย่างปลอดภัยยิ่งขึ้น วิธีการที่ดีปไมนด์แนะนำยังแก้ไขปัญหา “การหลบหลีกการให้รางวัล” หรือ “ช่องโหว่ในการให้รางวัล” อีกด้วย
วิธีการใหม่ของดีปไมนด์มีระบบสองระบบที่มีจุดมุ่งหมายเพื่อชี้นำพฤติกรรมของ AI ในสถานการณ์ที่อาจเกิดพฤติกรรมที่ไม่ปลอดภัย ระบบทั้งสองนี้คือ โมเดลที่สร้างขึ้นและโมเดลพลวัตที่ใช้ข้างหน้า ทั้งสองโมเดลนี้ได้รับการฝึกอบรมจากข้อมูลหลากหลาย เช่น การสาธิตโดยผู้เชี่ยวชาญด้านความปลอดภัยและเส้นทางการเคลื่อนที่ของยานพาหนะที่สร้างขึ้นโดยสุ่ม ข้อมูลเหล่านี้ได้รับการทำเครื่องหมายโดยผู้กำกับดูแลด้วยค่ารางวัลที่เฉพาะเจาะจง และตัวแทน AI จะเรียนรู้รูปแบบพฤติกรรมที่จะช่วยให้ได้รับค่ารางวัลสูงสุด สถานะที่ไม่ปลอดภัยก็ได้รับการทำเครื่องหมายเช่นกัน และเมื่อโมเดลสามารถคาดการณ์ค่ารางวัลและสถานะที่ไม่ปลอดภัยได้สำเร็จ ก็จะถูกนำไปใช้เพื่อกระทำการตามที่ต้องการ
ทีมวิจัยอธิบายในบทความว่าแนวคิดคือการสร้างพฤติกรรมที่เป็นไปได้จากศูนย์ เพื่อแนะนำพฤติกรรมที่ต้องการ และให้สถานการณ์สมมตินี้มีข้อมูลมากที่สุดในขณะเดียวกันก็หลีกเลี่ยงการแทรกแซงโดยตรงต่อสภาพแวดล้อมการเรียนรู้ ทีมดีปไมนด์เรียกแนวทางนี้ว่า ReQueST หรือการสร้างคำถามรางวัลผ่านการเพิ่มประสิทธิภาพของเส้นทาง
ReQueST สามารถนำไปสู่พฤติกรรมที่แตกต่างกันสี่ประเภท พฤติกรรมประเภทแรกพยายามเพิ่มความไม่แน่นอนเกี่ยวกับโมเดลรางวัลアンサンブル ในขณะที่พฤติกรรมสองและสามพยายามลดและเพิ่มค่ารางวัลที่คาดการณ์ไว้ ค่ารางวัลที่คาดการณ์ไว้ถูกลดลงเพื่อนำไปสู่การค้นพบพฤติกรรมที่โมเดลอาจคาดการณ์ไม่ถูกต้อง ในทางกลับกัน ค่ารางวัลที่คาดการณ์ไว้ถูกเพิ่มขึ้นเพื่อนำไปสู่การมีฉลากพฤติกรรมที่มีค่าข้อมูลสูงสุด สุดท้าย พฤติกรรมประเภทที่สี่พยายามเพิ่มความใหม่ของเส้นทาง เพื่อให้โมเดลยังคงสำรวจต่อไปโดยไม่คำนึงถึงค่ารางวัลที่คาดการณ์ไว้
เมื่อโมเดลได้รับค่ารางวัลที่ต้องการแล้ว ตัวแทนการวางแผนจะถูกใช้ในการตัดสินใจโดยอาศัยค่ารางวัลที่เรียนรู้ได้ ระบบการควบคุมแบบคาดการณ์อนาคตช่วยให้ตัวแทนเรียนรู้ที่จะหลีกเลี่ยงสถานะที่ไม่ปลอดภัยโดยใช้โมเดลพลวัตและคาดการณ์ผลที่ตามมา ซึ่งตรงกันข้ามกับพฤติกรรมของอัลกอริทึมที่เรียนรู้ผ่านการลองผิดลองถูก
ตามที่ VentureBeat รายงาน นักวิจัยดีปไมนด์เชื่อว่าโครงการของพวกเขาคือระบบการเรียนรู้แบบเสริมกำลังที่สามารถเรียนรู้ได้อย่างปลอดภัยและควบคุมได้เป็นครั้งแรก:
“ตามความรู้ของเรา ReQueST คืออัลกอริทึมการสร้างโมเดลรางวัลที่เรียนรู้เกี่ยวกับสถานะที่ไม่ปลอดภัยและขยายไปสู่การฝึกอบรมโมเดลรางวัลของเครือข่ายประสาทเทียมในสถานะที่ต่อเนื่องและมีระดับสูงได้อย่างปลอดภัย จนถึงตอนนี้ เราได้แสดงให้เห็นถึงประสิทธิผลของ ReQueST ในโดเมนที่มีการจำลองด้วยพลวัตที่ค่อนข้างง่าย ในอนาคต การทดสอบ ReQueST ในโดเมน 3 มิติพร้อมกับฟิสิกส์ที่สมจริงและตัวแทนอื่นๆ ที่กระทำการในสภาพแวดล้อมจะเป็นหนึ่งในทิศทางที่น่าสนใจ”












