โมเดลและแพลตฟอร์ม AI

เอเจนต์ AI แสดงคุณสมบัติของปัญญาประดิษฐ์แบบเกิดขึ้นเองในเกม_HIDE และ SEEK ในรูปแบบเสมือนจริง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

หนึ่งในข้อเท็จจริงที่น่าสนใจเกี่ยวกับการวิจัย AI คือสามารถดำเนินการและติดตามกลยุทธ์ที่ทำให้นักวิจัยที่ออกแบบมันเองตกใจได้ ซึ่งเกิดขึ้นระหว่างเกม_HIDE และ SEEK ในรูปแบบเสมือนจริงที่มีเอเจนต์ AI หลายตัวแข่งขันกัน นักวิจัยที่ OpenAI บริษัท AI ที่ตั้งอยู่ที่ซานฟรานซิสโก ตกใจที่พบว่าเอเจนต์ AI ของพวกเขาสามารถพัฒนากลยุทธ์ที่นักวิจัยไม่เคยรู้มาก่อนในเกมโลกนั้น

OpenAI ได้ฝึกเอเจนต์ AI เพื่อเล่นเกม_HIDE และ SEEK กันเอง โปรแกรม AI เหล่านี้ได้รับการฝึกด้วยเทคนิคการเรียนรู้แบบเสริมกำลัง ซึ่งเป็นวิธีการที่พฤติกรรมที่ต้องการจะถูกกระตุ้นจาก AI ด้วยการให้ข้อเสนอแนะ AI จะเริ่มต้นด้วยการกระทำแบบสุ่ม และทุกครั้งที่มันกระทำการใดๆ ที่ทำให้ใกล้เคียงกับเป้าหมาย เอเจนต์จะถูกมอบรางวัล AI ต้องการที่จะเพิ่มรางวัลให้สูงสุด ดังนั้นจึงจะทดลองเพื่อดูว่าการกระทำใดๆ ที่จะทำให้ได้รับรางวัลมากที่สุด เมื่อผ่านการลองผิดลองถูก AI สามารถแยกแยะกลยุทธ์ที่จะนำไปสู่ชัยชนะ และกลยุทธ์ที่จะให้รางวัลมากที่สุด

การเรียนรู้แบบเสริมกำลัง ได้แสดงความสำเร็จที่น่าประทับใจในการเรียนรู้กฎของเกม OpenAI ได้ฝึกทีม AI เพื่อเล่นเกม DOTA 2 และ AI ได้เอาชนะทีมผู้เล่นมนุษย์ที่เป็นแชมป์โลกเมื่อปีที่แล้ว สิ่งเดียวกันนี้เกิดขึ้นกับเกม StarCraft เมื่อ AI ถูกฝึกให้เล่นเกมโดย DeepMind การเรียนรู้แบบเสริมกำลังยังถูกใช้เพื่อสอน AI ให้เล่นเกม Pictionary กับมนุษย์ โดยที่ AI จะเรียนรู้ที่จะวิเคราะห์รูปภาพและใช้เหตุผลพื้นฐาน

ในเกม_HIDE และ SEEK ที่นักวิจัยสร้างขึ้น เอเจนต์ AI หลายตัวถูกจับคู่กันเพื่อแข่งขันกัน ผลลัพธ์คือการแข่งขันที่ทุกเอเจนต์ต้องการที่จะเอาชนะอีกฝ่ายและได้รับคะแนนรางวัลมากที่สุด กลยุทธ์ใหม่ที่ถูกนำมาใช้โดยเอเจนต์หนึ่งจะทำให้อีกฝ่ายต้องหากลยุทธ์ใหม่เพื่อตอบโต้ และเป็นแบบนี้ต่อไป Igor Mordatch นักวิจัยที่ OpenAI อธิบายกับ IEEE Spectrum ว่าการทดลองนี้แสดงให้เห็นว่ากระบวนการลองผิดลองถูกระหว่างเอเจนต์ “เพียงพอสำหรับเอเจนต์ในการเรียนรู้พฤติกรรมที่น่าประหลาดใจด้วยตนเอง มันเหมือนเด็กๆ เล่นด้วยกัน”

พฤติกรรมที่น่าประหลาดใจคืออะไรแน่นอน? นักวิจัยคาดหวังว่าเอเจนต์ AI จะเรียนรู้กลยุทธ์พื้นฐานสี่แบบ และพวกมันเรียนรู้ได้อย่างรวดเร็วหลังจากเล่นเกมจำลอง 25 ล้านครั้ง เกมดังกล่าว发生ในโลก 3 มิติที่เต็มไปด้วยรั้ว บล็อก และกำแพง เอเจนต์ AI เรียนรู้ที่จะไล่ล่ากัน โยกย้ายบล็อกเพื่อสร้างป้อมที่สามารถซ่อนตัวได้ และย้ายรั้ว เอเจนต์ที่เป็นคนตามจับเรียนรู้ที่จะลากรั้วเข้าไปในป้อมเพื่อเข้าไปหาเอเจนต์ที่ซ่อนตัว ในขณะที่เอเจนต์ที่ซ่อนตัวเรียนรู้ที่จะลากรั้วเข้าไปในป้อมเพื่อป้องกันไม่ให้เอเจนต์ที่ตามจับใช้รั้ว

อย่างไรก็ตาม เมื่อถึงจุดหนึ่งประมาณ 380 ล้านเกม สิ่งที่ไม่คาดคิดเกิดขึ้น เอเจนต์ AI เรียนรู้ที่จะใช้กลยุทธ์สองแบบที่นักวิจัยไม่เคยคาดคิดมาก่อน เอเจนต์ที่เป็นคนตามจับเรียนรู้ที่จะกระโดดขึ้นไปบนกล่องและเอียง/ขี่กล่องเข้าไปในป้อมเพื่อจับเอเจนต์ที่ซ่อนตัว นักวิจัยไม่เคยรู้มาก่อนว่ามันสามารถทำได้ภายในฟิสิกส์ของเกมโลกนั้น เอเจนต์ที่ซ่อนตัวเรียนรู้ที่จะลากกล่องเข้าไปในตำแหน่งภายในป้อม

แม้ว่าพฤติกรรมที่ไม่คาดคิดของเอเจนต์ AI ที่ฝึกด้วยการเรียนรู้แบบเสริมกำลังจะไม่เป็นอันตรายในกรณีนี้ แต่ก็ทำให้เกิดความกังวลเกี่ยวกับวิธีการนำการเรียนรู้แบบเสริมกำลังไปใช้ในสถานการณ์อื่นๆ Bowen Baker สมาชิกทีมวิจัยที่ OpenAI อธิบายกับ IEEE Spectrum ว่าพฤติกรรมที่ไม่คาดคิดเหล่านี้อาจเป็นอันตรายได้ ถ้าโรบอทเริ่มแสดงพฤติกรรมที่ไม่คาดคิด?

“การสร้างสภาพแวดล้อมเหล่านี้เป็นเรื่องที่ยาก” เบเกอร์อธิบาย “เอเจนต์เหล่านี้จะคิดกลยุทธ์ที่ไม่คาดคิด ซึ่งจะเป็นปัญหาเรื่องความปลอดภัยในอนาคตเมื่อเราใส่พวกมันลงในสภาพแวดล้อมที่ซับซ้อน”

อย่างไรก็ตาม เบเกอร์ยังอธิบายอีกว่ากลยุทธ์การเรียนรู้แบบเสริมกำลังอาจนำไปสู่วิธีแก้ปัญหาที่สร้างสรรค์สำหรับปัญหาปัจจุบัน ระบบที่ฝึกด้วยการเรียนรู้แบบเสริมกำลังสามารถแก้ปัญหาได้หลากหลายด้วยวิธีแก้ที่เราอาจไม่เคยคิดมาก่อน

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี