AI 模型与平台

研究人员从动物中寻找灵感以改进强化学习系统的常识

mm
将 Unite.AI 添加到您在 Google 上的首选来源

来自伦敦帝国学院、剑桥大学和谷歌DeepMind的AI研究人员正在寻找动物的灵感,以改进强化学习系统的性能。在CellPress Reviews上发表的一篇联合论文中,题为“人工智能和动物的常识”,研究人员认为动物认知提供了有用的基准和评估强化学习代理的方法,并且可以告知任务和环境的工程设计。

AI研究人员和工程师长期以来一直从生物神经网络中寻找灵感,当设计算法时,使用行为科学和神经科学的原理来告知算法的结构。然而,大多数AI研究人员从神经科学/行为科学领域获取的提示都是基于人类的,儿童和婴儿的认知作为焦点。AI研究人员尚未从动物模型中获取太多灵感,但动物认知是一个未被开发的资源,它有可能在强化学习领域带来重要的突破。

深度强化学习系统是通过试错的过程训练的,通过奖励来强化,当强化学习代理接近完成期望的目标时。这种方法与使用食物作为奖励来教动物执行期望的任务非常相似。生物学家和动物认知专家已经进行了许多实验,评估了不同动物的认知能力,包括狗、熊、松鼠、猪、乌鸦、海豚、猫、老鼠、象和章鱼。许多动物表现出令人印象深刻的智慧,象和海豚等动物甚至可能具有心智理论。

研究人员认为,研究动物认知可能会激发AI研究人员从不同的角度考虑问题。随着深度强化学习变得更加强大和复杂,AI研究人员正在寻找新的方法来测试强化学习代理的认知能力。在研究论文中,研究团队提到了对灵长类和鸟类进行的实验,提到他们旨在设计能够完成类似任务的系统,给AI一种“常识”。根据论文作者的说法,他们“提倡一种方法,即RL代理,可能具有尚未开发的架构,通过与丰富的虚拟环境的扩展交互来获得所需的东西”。

正如VentureBeat报道,AI研究人员认为,常识并不是人类所独有的,而是依赖于对物理世界的基本属性的理解,例如物体如何占据空间和时间,物体运动的约束,以及对因果关系的理解。动物在实验室研究中表现出这些特征。例如,乌鸦了解到物体是永久的,因为它们可以在物体被其他物体遮挡时取回种子。

为了使强化学习系统具有这些特性,研究人员认为他们需要创建任务,这些任务与正确的架构相结合,可以创建能够将学习的原则转移到其他任务的代理。研究人员认为,这样的模型的训练应该涉及需要代理在仅被展示几个例子后就能理解概念的技术,称为少量训练。这与传统的强化学习代理的试错训练不同,通常需要数百或数千次试验。

研究团队进一步解释说,虽然一些现代RL代理可以学习解决多个任务,其中一些任务需要转移学习的基本原则,但不清楚RL代理是否能够学习像“常识”这样的抽象概念。如果有一个代理可能能够学习这样的概念,它需要测试来确定RL代理是否理解容器的概念。

DeepMind特别渴望与其他领域的科学家合作,开发和测试强化学习代理。最近,在十月份举行的斯坦福HAI会议上,DeepMind的神经科学研究负责人马修·博特温尼克敦促机器学习研究人员和工程师在其他科学领域进行更多的合作。博特温尼克在题为“三角智慧:融合神经科学、心理学和AI”的演讲中强调了与心理学家和神经科学家进行跨学科工作的重要性,Matthew Botvinick, urged machine learning researchers and engineers to collaborate more in other fields of science. Botvinick highlighted the importance of interdisciplinary work with psychologists and neuroscience for the AI field in a talk called “Triangulating Intelligence: Melding Neuroscience, Psychology, and AI”.

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。