โมเดลและแพลตฟอร์ม AI

DeepMind สร้าง AI ที่เล่นซ้ำความทรงจำเหมือนฮิปโปแคมปัส

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

สมองของมนุษยันมักจะระลึกถึงความทรงจำในอดีต (ดูเหมือนว่า) ไม่มีเหตุผล As เราไปตลอดวันของเรา เรามีแฟลชของความทรงจำจากชีวิตของเรา ในขณะที่การเรียกความทรงจำนี้มานานได้รับความสนใจจากนักวิทยาศาสตร์สมอง บริษัทวิจัย AI DeepMind ได้ตีพิมพ์งานวิจัยเกี่ยวกับวิธีการที่ AI ของพวกเขาสามารถเล่นซ้ำรูปแบบการเรียกความทรงจำนี้ได้

การเรียกความทรงจำในสมอง การเล่นซ้ำของประสาทสัมพันธ์กับฮิปโปแคมปัสอย่างใกล้ชิด ฮิปโปแคมปัสเป็นรูปทรงม้าบินในสมองที่เป็นส่วนหนึ่งของระบบลิมบิก และมันเกี่ยวข้องกับการสร้างความทรงจำใหม่ๆ และอารมณ์ที่ความทรงจำเหล่านั้นสร้างขึ้น ทฤษฎีเกี่ยวกับบทบาทของฮิปโปแคมปัส (มีหนึ่งในซีกสมองแต่ละด้าน) ระบุว่าพื้นที่ต่างๆ ของฮิปโปแคมปัสรับผิดชอบในการจัดการความทรงจำที่แตกต่างกัน ตัวอย่างเช่น ความทรงจำเชิงพื้นที่ถูกมองว่าเป็นของพื้นที่หลังของฮิปโปแคมปัส

ตามรายงานของ Jesus Rodriguez ดร. John O’Keefe เป็นผู้รับผิดชอบต่อการมีส่วนร่วมมากมายในการทำความเข้าใจฮิปโปแคมปัส รวมถึงเซลล์ “ที่” ของฮิปโปแคมปัส เซลล์ที่ในฮิปโปแคมปัสถูกกระตุ้นโดยสิ่งเร้าใน环境เฉพาะ ตัวอย่างเช่น การทดลองในหนูพบว่าเซลล์ประสาทเฉพาะจะทำงานเมื่อหนูวิ่งผ่านส่วนต่างๆ ของเส้นทาง เมื่อนักวิจัยติดตามหนูแม้ว่าพวกมันจะพักผ่อน พวกเขาพบว่ารูปแบบของเซลล์ประสาทที่แสดงถึงส่วนหนึ่งของเส้นทางจะทำงานอีกครั้ง แม้ว่าจะทำงานเร็วขึ้น หนูเหล่านั้นดูเหมือนจะเล่นซ้ำความทรงจำของเส้นทางในใจของพวกมัน

ในมนุษย์ การระลึกถึงความทรงจำเป็นส่วนสำคัญของกระบวนการเรียนรู้ แต่เมื่อพยายามให้ AI เรียนรู้ มันจะยากที่จะสร้างปรากฏการณ์นี้ขึ้นมา

ทีม DeepMind ได้พยายามที่จะสร้างปรากฏการณ์การเรียกความทรงจำโดยใช้การเรียนรู้แบบเสริมกำลัง อัลกอริทึมการเรียนรู้แบบเสริมกำลังทำงานโดยการรับฟีดแบ็กจากปฏิสัมพันธ์กับสิ่งแวดล้อมรอบๆ และได้รับรางวัลเมื่อพวกมันทำการกระทำที่นำไปสู่เป้าหมายที่ต้องการ ในบริบทนี้ ตัวแทนการเรียนรู้แบบเสริมกำลังบันทึกเหตุการณ์และเล่นซ้ำในเวลาต่อมา โดยมีการเสริมกำลังเพื่อปรับปรุงความสามารถในการเรียกความทรงจำในอดีต

DeepMind ได้เพิ่มการเล่นซ้ำประสบการณ์เข้าไปในอัลกอริทึมการเรียนรู้แบบเสริมกำลังโดยใช้บัฟเฟอร์การเล่นซ้ำที่จะเล่นซ้ำความทรงจำ/ประสบการณ์ที่บันทึกไว้ให้กับระบบในเวลาที่เฉพาะเจาะจง บางรุ่นของระบบมีประสบการณ์เล่นซ้ำในลำดับแบบสุ่ม ในขณะที่รุ่นอื่นๆ มีลำดับการเล่นซ้ำที่เลือกไว้ล่วงหน้า ในขณะที่นักวิจัยทดลองกับลำดับการเล่นซ้ำสำหรับตัวแทนการเรียนรู้แบบเสริมกำลัง พวกเขายังทดลองกับวิธีการเล่นซ้ำประสบการณ์เองด้วย

มีสองวิธีการหลักที่ใช้ในการให้ประสบการณ์ที่เรียกซ้ำกับอัลกอริทึมการเรียนรู้แบบเสริมกำลัง วิธีการเหล่านี้คือวิธีการเล่นซ้ำจินตนาการและวิธีการเล่นซ้ำแบบภาพยนตร์ งานวิจัยของ DeepMind ใช้การเปรียบเทียบเพื่ออธิบายกลยุทธ์ทั้งสอง:

“สมมติว่าคุณกลับบ้านและพบกับความประหลาดใจและความเสียใจเมื่อคุณพบว่าน้ำกำลัง积อยู่บนพื้นไม้ของบ้านคุณ เมื่อคุณเข้าไปในห้องรับแขก คุณพบว่าแจกันแตก แล้วคุณได้ยินเสียงครางและคุณมองออกไปที่ประตูทางเข้าเพื่อดูสุนัขของคุณที่ดูเหมือนจะรู้สึกผิด”

ตามรายงานของ Rodriguez วิธีการเล่นซ้ำจินตนาการไม่ได้บันทึกเหตุการณ์ตามลำดับที่พวกมันเกิดขึ้น แต่เหตุผลที่เป็นไปได้ระหว่างเหตุการณ์ถูกอนุมานจากความเข้าใจของตัวแทนเกี่ยวกับโลก เหตุการณ์ถูกอนุมานตามความเข้าใจของตัวแทนเกี่ยวกับโลก ในขณะที่วิธีการเล่นซ้ำแบบภาพยนตร์เก็บความทรงจำไว้ในลำดับที่เหตุการณ์เกิดขึ้นและเล่นซ้ำลำดับของสิ่งเร้า – “น้ำ积, แจกันแตก, สุนัข” ลำดับเวลาของเหตุการณ์ถูกเก็บไว้

การวิจัยจากสาขาวิทยาศาสตร์ประสาทระบุว่าวิธีการเล่นซ้ำแบบภาพยนตร์เป็นสิ่งสำคัญในการสร้างความสัมพันธ์ระหว่างแนวคิดและเชื่อมต่อระหว่างเซลล์ประสาทระหว่างเหตุการณ์ ในขณะที่วิธีการเล่นซ้ำจินตนาการอาจช่วยให้ตัวแทนสามารถสร้างลำดับใหม่เมื่อมันใช้เหตุผลแบบอุปมา ตัวอย่างเช่น ตัวแทนสามารถให้เหตุผลได้ว่าถ้าบาร์เรลเป็นของน้ำมันเช่นเดียวกับแจกันคือน้ำ บาร์เรลอาจถูกทำลายโดยหุ่นโรงงานแทนสุนัข เมื่อ DeepMind ตรวจสอบความเป็นไปได้ของวิธีการเล่นซ้ำจินตนาการ พวกเขาพบว่าตัวแทนการเรียนรู้ของพวกเขาสามารถสร้างลำดับที่น่าประทับใจและสร้างสรรค์โดยพิจารณาจากประสบการณ์ในอดีต

ความก้าวหน้าในปัจจุบันส่วนใหญ่ในด้านการเรียนรู้แบบเสริมกำลังเกี่ยวกับความทรงจำกำลังทำโดยใช้กลยุทธ์แบบภาพยนตร์ แม้ว่านักวิจัยจะเริ่มทำความก้าวหน้าด้วยกลยุทธ์จินตนาการ การวิจัยเกี่ยวกับวิธีการทั้งสองของความทรงจำ AI ไม่เพียงแต่ช่วยให้ตัวแทนการเรียนรู้แบบเสริมกำลังทำงานได้ดีขึ้น แต่ยังช่วยให้เราเข้าใจว่าสมองของมนุษย์ทำงานอย่างไรอีกด้วย

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี