AI 模型与平台
DeepMind 创建了一个像海马体一样重放记忆的 AI
人类的大脑经常回忆过去的记忆(看似)无缘无故。随着我们度过一天,我们会有来自我们生活的记忆的闪现。虽然这种记忆的自发性已经引起了神经科学家的兴趣,但 AI 研究公司 DeepMind 最近 发表了一篇论文 ,详细介绍了他们的 AI 如何复制这种奇怪的回忆模式。
大脑中记忆的唤起,神经重放,与 海马体 密切相关。海马体是大脑中的一种海马形结构,属于边缘系统,与形成新的记忆以及记忆所激发的情绪有关。目前关于海马体(大脑每个半球都有一个)的作用的理论认为,不同的海马体区域负责处理不同类型的记忆。例如,空间记忆被认为是在海马体的后部处理的。
如 Jesus Rodriguez 报道, 约翰·奥基夫博士 对我们理解海马体做出了许多贡献,包括海马体的 “位置”细胞 。海马体中的位置细胞由特定环境中的刺激触发。例如,实验室中的大鼠实验表明,当大鼠跑过某些轨道部分时,特定的神经元会激活。研究人员继续监测大鼠,即使它们休息时,也发现表示轨道部分的相同神经元模式会激活,尽管它们以加速的速度激活。大鼠似乎正在重放它们对迷宫的记忆。
在人类中,回忆记忆是学习过程中的一个重要部分,但当尝试使 AI 学习时,很难重现这种现象。
DeepMind 团队试图使用强化学习重现回忆现象。强化学习算法通过与周围环境交互获得反馈,获得奖励,当它们采取使其更接近目标的行动时。在这种情况下,强化学习代理记录事件,然后在稍后时间重放它们,系统被强化以提高其回忆过去经验的效率。
DeepMind 将重放经验添加到强化学习算法中,使用重放缓冲区在特定时间向系统重放记忆/记录的经验。一些系统版本以随机顺序重放经验,而其他模型具有预选的重放顺序。虽然研究人员尝试了强化代理的重放顺序,但他们也尝试了不同的重放经验的方法。
有两种主要方法用于为强化算法提供回忆的经验。这些方法是想象重放方法和电影重放方法。DeepMind 的论文使用一个类比来描述这两种策略:
“假设你回到家,令你惊讶和失望的是,你发现美丽的木地板上有一滩水。走进餐厅,你发现一个破碎的花瓶。然后你听到一声呜咽,透过露台门,你看到你的狗看起来很内疚。”
如 Rodriguez 报道,想象重放方法并不按照事件发生的顺序记录事件。相反,根据代理对世界的理解,推断事件之间的可能原因。事件是根据代理的理解推断出来的。与此同时,电影重放方法以事件发生的顺序存储记忆,并重放事件序列 – “溢出的水,破碎的花瓶,狗”。事件的时间顺序得到保留。
神经科学领域的研究表明,电影重放方法对于创建概念之间的关联以及事件之间的神经元连接至关重要。然而,想象重放方法可以帮助代理通过类比推理创建新的序列。例如,代理可以推断,如果一个桶与油类似,一个花瓶与水类似,那么一个桶可以被工厂机器人而不是狗溢出。确实,当 DeepMind 进一步探索想象重放方法的可能性时,他们发现他们的学习代理能够通过考虑以前的经验创建令人印象深刻的创新序列。
目前在强化学习记忆领域取得的进展大多是使用电影策略,虽然研究人员最近开始在想象策略方面取得进展。研究这两种 AI 记忆方法不仅可以使强化学习代理的性能更好,而且还可以帮助我们更深入地了解人类思维的工作原理。












