โมเดลและแพลตฟอร์ม AI
นักวิจัย AI สร้างโมเดลเล่นวิดีโอเกมที่สามารถจดจำเหตุการณ์ในอดีต

ทีมนักวิจัยที่ห้องปฏิบัติการ AI ของ Uber ได้พัฒนาระบบ AI ที่สามารถเล่นวิดีโอเกมคลาสสิกของ Atari ได้ดีกว่าผู้เล่นมนุษย์และระบบ AI อื่นๆ ระบบ AI ที่พัฒนาขึ้นนี้สามารถจดจำกลยุทธ์ที่สำเร็จในอดีตและสร้างกลยุทธ์ใหม่ๆ ตามสิ่งที่ได้ผลในอดีต การวิจัย เชื่อว่าแอลกอริทึมที่พัฒนาขึ้นมีศักยภาพในการใช้งานในด้านอื่นๆ เช่น การประมวลผลภาษาและหุ่นยนต์
วิธีการทั่วไปในการสร้างระบบ AI ที่สามารถเล่นวิดีโอเกมคือการใช้แอลกอริทึมการเรียนรู้แบบเสริมกำลัง (reinforcement learning) แอลกอริทึมเหล่านี้เรียนรู้วิธีการทำงานโดยการสำรวจการกระทำที่เป็นไปได้ และหลังจากการกระทำแต่ละครั้ง จะได้รับการเสริมกำลัง (รางวัลหรือการลงโทษ) เมื่อเวลาผ่านไป ระบบ AI จะเรียนรู้ว่าการกระทำใดที่นำไปสู่รางวัลที่มากขึ้น และจะทำการกระทำเหล่านั้นมากขึ้น อย่างไรก็ตาม ระบบ AI ที่ใช้การเรียนรู้แบบเสริมกำลังอาจพบปัญหาเมื่อพบกับข้อมูลที่ไม่สอดคล้องกับข้อมูลอื่นๆ ในชุดข้อมูล
ตามที่ทีมวิจัยระบุว่า สาเหตุที่วิธีการของพวกเขายังไม่ได้รับการพิจารณาจากนักวิจัย AI อื่นๆ คือเพราะว่ากลยุทธ์ของพวกเขาต่างจากวิธีการ “แรงจูงใจภายใน” (intrinsic motivation) ที่ใช้กันโดยทั่วไปในการเรียนรู้แบบเสริมกำลัง ปัญหาหลักของวิธีการแรงจูงใจภายในคือระบบ AI อาจ “ลืม” เกี่ยวกับพื้นที่ที่มีศักยภาพในการให้รางวัล ซึ่งเรียกว่า “การแยกออก” (detachment) ดังนั้น เมื่อระบบ AI พบข้อมูลที่ไม่คาดคิด อาจลืมเกี่ยวกับพื้นที่ที่ควรสำรวจต่อไป
ตามที่ TechXplore ระบุว่า ทีมวิจัยตั้งเป้าที่จะสร้างโมเดลการเรียนรู้ที่มีความยืดหยุ่นและสามารถตอบสนองต่อข้อมูลที่ไม่คาดคิดได้ นักวิจัยสามารถแก้ปัญหานี้ได้โดยการแนะนำแอลกอริทึมที่สามารถจดจำการกระทำทั้งหมดที่ระบบ AI ทำเมื่อพยายามแก้ปัญหา เมื่อระบบ AI พบข้อมูลที่ไม่สอดคล้องกับสิ่งที่ได้เรียนรู้มา ระบบจะตรวจสอบแผนที่ความจำและระบุว่าการกระทำใดที่สำเร็จและล้มเหลว แล้วเลือกการกระทำที่เหมาะสม
เมื่อเล่นวิดีโอเกม ระบบจะเก็บภาพหน้าจอของเกมและบันทึกการกระทำที่ทำระหว่างเล่น ภาพเหล่านี้จะถูกจัดกลุ่มตามความคล้ายคลึงกัน เพื่อสร้างจุดเวลาที่ชัดเจนที่ระบบสามารถอ้างอิงได้ ระบบสามารถใช้ภาพที่บันทึกไว้เพื่อกลับไปที่จุดเวลาที่น่าสนใจและสำรวจต่อไป เมื่อระบบพบว่าตัวเองกำลังแพ้ จะอ้างอิงภาพที่บันทึกไว้และลองใช้กลยุทธ์ที่แตกต่าง
ตามที่ BBC อธิบาย ยังมีปัญหาในการจัดการสถานการณ์ที่อันตรายสำหรับตัวแทน AI ที่เล่นเกม หากตัวแทน AI พบอันตรายที่สามารถฆ่าได้ จะทำให้ไม่สามารถกลับไปสำรวจพื้นที่ที่มีศักยภาพได้ ซึ่งเรียกว่า “การหลุดออก” (derailment) ระบบ AI จัดการปัญหาเหล่านี้ผ่านกระบวนการที่แยกจากกระบวนการในการส่งเสริมการสำรวจพื้นที่เก่า
ทีมวิจัยให้ระบบ AI เล่นวิดีโอเกม Atari 55 เกม ซึ่งเป็นเกมที่ใช้ในการทดสอบประสิทธิภาพของระบบ AI โดยทั่วไป แต่นักวิจัยได้เพิ่มกฎเพิ่มเติมให้กับเกม โดยให้ระบบ AI ไม่เพียงแต่ต้องได้คะแนนสูงสุดเท่านั้น แต่ยังต้องพยายามได้คะแนนสูงสุดมากกว่าที่เคยทำได้ เมื่อวิเคราะห์ผลการทำงานของระบบ AI พบว่าระบบ AI ของนักวิจัยสามารถเล่นเกมได้ดีกว่าระบบ AI อื่นๆ ประมาณ 85% ของเวลา ระบบ AI ทำได้ดีมากที่สุดในเกม Montezuma’s Revenge ซึ่งเป็นเกมแพลตฟอร์มที่ผู้เล่นต้องหลบหลีกอันตรายและเก็บสมบัติ ระบบ AI สามารถตั้งระเบียบใหม่สำหรับผู้เล่นมนุษย์และได้คะแนนสูงสุดมากกว่าระบบ AI ใดๆ ที่เคยทำได้
ตามที่นักวิจัย AI ของ Uber ระบุว่า กลยุทธ์ที่ทีมวิจัยใช้นั้นมีศักยภาพในการใช้งานในอุตสาหกรรม เช่น หุ่นยนต์ หุ่นยนต์สามารถใช้ประโยชน์จากความสามารถในการจดจำการกระทำที่สำเร็จ ล้มเหลว และยังไม่ได้ลอง












