AI 模型与平台

DeepMind 发现一种可能也适用于人类大脑的 AI 训练技术

mm
将 Unite.AI 添加到您在 Google 上的首选来源

DeepMind 刚刚发布了一篇论文,详细介绍了一种新型的强化学习方法,这种方法可能解释了人类大脑中奖励路径的工作原理。据 NewScientist 报道,这种机器学习训练方法称为分布式强化学习,其背后的机制似乎合理地解释了多巴胺如何由神经元释放。

神经科学和计算机科学有着悠久的历史。早在 1951 年,马文·明斯基使用了一套奖励和惩罚系统,创建了一个能够解决迷宫的计算机程序。明斯基的灵感来自伊万·巴甫洛夫的工作,巴甫洛夫证明了狗可以通过一系列奖励和惩罚来学习。DeepMind 的新论文为神经科学和计算机科学的交叉历史添加了新的内容,通过应用一种强化学习方法来深入了解多巴胺神经元的功能。

当一个人或动物即将执行一个动作时,大脑中负责释放多巴胺的神经元集合会预测这个动作的奖励程度。一旦动作完成,奖励的后果明显,大脑就会释放多巴胺。然而,这种多巴胺的释放是根据预测错误的大小来确定的。如果奖励比预期更好,会触发更强的多巴胺激增。相反,较差的奖励会导致释放较少的多巴胺。多巴胺的作用是使神经元调整预测,直到它们收敛到实际获得的奖励。这与强化学习算法的工作原理非常相似。

2017 年,DeepMind 研究人员发布了一种增强版的常用强化学习算法,这种更好的学习方法能够提高许多强化学习任务的性能。DeepMind 团队认为,这种新算法背后的机制可以更好地解释人类大脑中多巴胺神经元的工作原理。

与旧的强化学习算法相比,DeepMind 的新算法将奖励表示为一个分布。旧的强化学习方法将预期的奖励表示为一个单独的数字,代表平均预期结果。这种变化使得模型能够更准确地表示可能的奖励,并因此获得更好的性能。新训练方法的优异性能促使 DeepMind 研究人员调查多巴胺神经元在人类大脑中是否以类似的方式运作。

为了研究多巴胺神经元的工作原理,DeepMind 与哈佛大学合作,研究了小鼠的多巴胺神经元活动。研究人员让小鼠执行各种任务,并根据骰子的掷出结果给予奖励,记录了他们的多巴胺神经元如何激发。不同的神经元似乎预测了不同的潜在结果,并释放了不同的多巴胺量。一些神经元预测的奖励低于实际奖励,而其他神经元预测的奖励高于实际奖励。通过绘制预测奖励的分布,研究人员发现预测的分布与实际奖励分布相当接近。这表明大脑在做出预测和调整预测以更好地匹配现实时确实使用了一个分布式系统。

该研究可能同时为神经科学和计算机科学提供参考。该研究支持使用分布式强化学习作为创建更先进的 AI 模型的方法。除此之外,它可能对我们关于大脑奖励系统的运作理论产生影响。如果多巴胺神经元是分布式的,并且其中一些比其他神经元更乐观或更悲观,了解这些分布可能会改变我们对心理学方面的理解,例如心理健康和动力。

据 MIT Technology Review 报道,DeepMind 神经科学研究主任 Matt Botvinik 在一次新闻发布会上解释了发现的重要性。Botvinik 说:

“如果大脑使用它,那么它可能是一个好主意。这告诉我们,这是一种可以在现实世界中扩展的计算技术。它将与其他计算过程很好地协同工作。它为我们提供了一个新的视角,来了解我们的大脑在日常生活中是如何工作的”

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。