AI 模型与平台

AI智能体在虚拟捉迷藏游戏中展示出涌现的智能特性

mm
将 Unite.AI 添加到您在 Google 上的首选来源

研究人工智能的一个有趣事实是,它经常会执行出乎研究人员意料的行动和策略。这在最近的一场虚拟捉迷藏游戏中发生了,多个AI智能体相互对战。总部位于旧金山的AI公司OpenAI的研究人员惊讶地发现,他们的AI智能体开始使用游戏中不存在的策略

OpenAI训练了一组AI智能体,让它们相互玩捉迷藏游戏。这些AI程序使用强化学习技术进行训练,这种技术通过提供反馈来引出AI算法的期望行为。AI智能体从随机行动开始,每当它采取的行动使其更接近目标时,就会被奖励。AI智能体的目标是获得尽可能多的奖励,因此它会尝试不同的行动来获得更多的奖励。通过试错,AI智能体能够区分哪些策略会带来胜利,哪些会带来最多的奖励。

强化学习已经在学习游戏规则方面取得了令人印象深刻的成功。OpenAI最近训练了一队AI智能体玩Dota 2,并且去年,这些AI智能体击败了一支人类世界冠军队。类似的事情也发生在StarCraft游戏中,当时DeepMind公司训练了一个AI智能体来玩这个游戏。强化学习也被用于教AI程序与人类玩绘图游戏,学习解释图片并使用基本的常识推理。

在研究人员创建的捉迷藏视频游戏中,多个AI智能体相互对战。结果是一种竞争, 每个智能体都想超越其他智能体并获得最多的奖励点。一个智能体采用的新策略会导致其对手寻找新的策略来对抗它,反之亦然。OpenAI的研究人员Igor Mordatch向IEEE Spectrum解释说,这个实验表明,智能体之间的试错过程“足以使它们自己学习出乎意料的行为——就像孩子们相互玩耍一样”。

这些出乎意料的行为到底是什么?研究人员预期AI智能体会学习四种基本策略,并且它们很快就学会了这些策略,在仅仅2500万场模拟游戏后就变得擅长这些策略。游戏发生在一个充满坡道、块状物和墙壁的3D环境中。AI智能体学会了在环境中追逐对方,移动块状物来建造它们可以躲藏的堡垒,并移动坡道。寻找者智能体学会了拖拽坡道进入堡垒来找到躲藏者,而躲藏者智能体学会了将坡道拖入自己的堡垒中,以防止寻找者使用它们。

然而,大约在3.8亿场游戏的标志性时刻,发生了一件意外的事情。AI智能体学会了使用两种研究人员没有预料到的策略。寻找者智能体学会了通过跳到一个箱子上并将箱子倾斜/骑行到附近的堡垒,以便跳入堡垒并找到躲藏者。研究人员甚至不知道这种行为在游戏环境的物理规则中是可能的。躲藏者智能体学会了通过将箱子拖入自己的堡垒来应对这个问题。

虽然这种意外行为在这种情况下是无害的,但它确实引发了一些关于如何将强化学习应用于其他情况的潜在问题。OpenAI研究团队成员Bowen Baker向IEEE Spectrum解释说,这些意外行为可能是潜在的危险。毕竟,如果机器人开始表现出意外的行为怎么办?

“构建这些环境是很难的,”Baker解释说。“智能体会想出这些意外的行为,这将来会是一个安全问题,当你把它们放在更复杂的环境中时。”

然而,Baker也解释说,强化策略可能会带来创新性的解决方案来解决当前的问题。使用强化学习训练的系统可以解决一系列问题,可能带来我们甚至无法想象的解决方案。

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。