โมเดลและแพลตฟอร์ม AI

ระบบ AI ใหม่ของ DeepMind สามารถเรียนรู้กฎของเกมได้ขณะเล่น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

DeepMind ซึ่งเป็นบริษัทในเครือของ Alphabet (GOOG ) (GOOGL ) ได้พัฒนาระบบ AI ที่สามารถเรียนรู้กฎของเกมได้ขณะเล่น ระบบ AI ของ DeepMind ที่เคยสร้างมาก่อนหน้านี้สามารถเล่นเกมอย่างเชส ชоги โก และวิดีโอเกมได้ แต่ระบบเหล่านั้นต้องการให้ได้รับกฎของเกมก่อนการเรียนรู้ ระบบ AI ใหม่ของ DeepMind จึงเป็นความก้าวหน้าที่สำคัญกว่าระบบ AI ก่อนหน้านี้ที่เรียนรู้การเล่นเกมผ่านการเรียนรู้แบบเสริมกำลัง

ระบบ AI – MuZero

ในบทความที่เผยแพร่ใน วารสาร Nature DeepMind ได้อธิบายว่าระบบ AI ใหม่ของพวกเขาทำงานอย่างไร ระบบ AI ใหม่ซึ่งมีชื่อว่า MuZero สามารถเรียนรู้กฎของเกมได้ขณะเล่นโดยใช้หลักการ “การค้นหาล่วงหน้า” ตามที่ Engadget รายงาน MuZero ใช้การค้นหาล่วงหน้าเพื่อกำหนดว่าจะทำการเคลื่อนไหวใดโดยพิจารณาจากการตอบสนองที่เป็นไปได้ของฝ่ายตรงข้าม

เมื่อพิจารณาการเคลื่อนไหวที่เป็นไปได้ทั้งหมดในเกมเชส MuZero สามารถจัดลำดับความสำคัญของการเคลื่อนไหวเหล่านั้นให้แคบลงเพียงการเคลื่อนไหวที่เป็นไปได้และเกี่ยวข้องมากที่สุด MuZero จะเรียนรู้จากทั้งการเคลื่อนไหวที่สำเร็จและไม่สำเร็จ แทนที่จะสร้างแบบจำลองทั้งหมดของปัจจัยที่เป็นไปได้ MuZero จะพิจารณาปัจจัยที่เกี่ยวข้องมากที่สุดเท่านั้น MuZero จะนำปัจจัยที่เป็นไปได้ทั้งหมดมาและทำให้แคบลงเพียงปัจจัยที่สำคัญที่สุด ปัจจัยเหล่านี้จะถูกนำมาแสดงในรูปแบบการค้นหาล่วงหน้าแบบต้นไม้ ความเป็นไปได้ภายในต้นไม้จะถูกผสมผสานกับแบบจำลองที่เรียนรู้จากคุณลักษณะของสภาพแวดล้อมที่ทดสอบ การค้นหาล่วงหน้าจะดำเนินการหลังจากที่ได้ระบุปัจจัยที่เกี่ยวข้องมากที่สุดของสภาพแวดล้อมแล้ว

เพื่อที่จะมาถึงการตัดสินใจสุดท้าย MuZero จะพิจารณาปัจจัยสามประการ

MuZero พิจารณาผลลัพธ์ของการเลือกครั้งก่อน ตำแหน่งปัจจุบัน และการกระทำที่เป็นไปได้ที่จะทำต่อไป นี่เป็นแนวทางที่ดีกว่าแนวทางที่ใช้ก่อนหน้านี้โดย DeepMind รวมถึงการค้นหาล่วงหน้าแบบพื้นฐานและแบบจำลองต้นไม้ MuZero ได้แสดงผลลัพธ์ที่ดีเท่ากับ AlphaZero ในเกมเชส ชоги และโก และเมื่อเล่นเกม Ms. Pac-Man MuZero สามารถพิจารณาการเคลื่อนไหวได้เพียง 6-7 ครั้งเท่านั้น แต่ระบบ AI ก็ยังสามารถเล่นเกมได้ดี DeepMind ยังทดสอบความสามารถของ MuZero โดยจำกัดจำนวนการจำลองที่สามารถทำได้ก่อนที่จะต้องตัดสินใจ ในทั่วไป ระบบจะทำงานได้ดีกว่าเมื่อมีเวลาในการพิจารณาการเคลื่อนไหวมากขึ้น

นักวิจัยหลักของ DeepMind David Silver อธิบายผ่าน TechXplore ว่า MuZero เป็นแบบจำลอง AI แรกที่สามารถสร้างการแสดงภาพของกฎของสภาพแวดล้อมได้ และใช้การแสดงภาพนั้นเพื่อวางแผนการกระทำ

“เรามีระบบที่สามารถสร้างความเข้าใจของตนเองเกี่ยวกับวิธีการทำงานของโลกและใช้ความเข้าใจนั้นเพื่อวางแผนการกระทำที่ซับซ้อนเช่นเดียวกับเกมเชส” Silver กล่าว “(MuZero) สามารถเริ่มต้นจากศูนย์และเรียนรู้กฎของโลกและใช้กฎเหล่านั้นเพื่อให้ได้ผลลัพธ์ที่เหนือมนุษย์”

การประยุกต์ใช้ที่เป็นไปได้

ระบบ AI ที่สามารถเรียนรู้ข้อจำกัดของงานและทำงานภายในข้อจำกัดเหล่านั้นได้ มีการประยุกต์ใช้ที่หลากหลาย MuZero สามารถใช้สำหรับงานอย่างการบีบอัดวิดีโอ ซึ่งเป็นงานที่ยากที่จะทำอัตโนมัติด้วย AI เนื่องจากมีรูปแบบวิดีโอและโหมดบีบอัดที่หลากหลาย MuZero สามารถบีบอัดวิดีโอได้ดีขึ้นประมาณ 5% ซึ่งอาจมีผลกระทบต่อวิดีโอที่โฮสต์โดย Google และ YouTube นอกเหนือจากวิดีโอแล้ว DeepMind ยังกำลังพิจารณาใช้เทคนิค MuZero สำหรับการออกแบบโครงสร้างโปรตีนและโปรแกรมมิ่งโรบอต

ตามที่ Wendy Hall ศาสตราจารย์ภาควิชาวิทยาการคอมพิวเตอร์แห่ง University of Southampton กล่าว MuZero เป็น “ก้าวหน้าที่สำคัญ” สำหรับอัลกอริทึมการเรียนรู้แบบเสริมกำลัง อย่างไรก็ตาม Hall กังวลว่าอัลกอริทึมเหล่านี้อาจถูกใช้ในทางที่ผิด ตัวอย่างเช่น กองทัพอากาศสหรัฐฯ ได้อ้างอิงงานวิจัยเกี่ยวกับ MuZero เพื่อสร้างระบบ AI ที่สามารถเปิดตัวขีปนาวุธจากเครื่องบินสอดแนม U-2 ซึ่งถึงแม้ว่านักวิจัยของ DeepMind จะแสดงความไม่เห็นด้วยกับการใช้อัลกอริทึมของตนสำหรับอาวุธที่มีอำนาจในการฆ่า และได้ลงนามใน Lethal Autonomous Weapons Pledge เพื่อโต้แย้งว่าอาวุธที่มีอำนาจในการฆ่าควรอยู่ภายใต้การควบคุมของมนุษย์

Silver กล่าวว่า DeepMind กำลังมองไปข้างหน้าเพื่อพัฒนาแอลกอริทึมที่มีพลังและความยืดหยุ่นเหมือนสมอง ก้าวแรกในการสร้างแอลกอริทึมที่ยืดหยุ่นและยืดหยุ่นคือการเข้าใจว่าระบบใดที่มีความฉลาด และความฉลาดนั้นเชื่อมโยงกับความสามารถในการรับรู้รูปแบบและกฎของสภาพแวดล้อมที่ซับซ้อน

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี