AI 模型与平台

研究人员开发出能够记忆过去事件的视频游戏人工智能模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Uber 人工智能实验室的研究人员最近开发出了一套人工智能算法系统,该系统在经典的Atari视频游戏中超越了人类玩家和其他人工智能系统。研究人员开发的这个人工智能系统能够记忆以前成功的策略,并根据过去的经验创建新的策略。研究团队认为,他们开发的算法在语言处理和机器人等其他技术领域具有潜在的应用价值。

创建能够玩视频游戏的人工智能系统的典型方法是使用强化学习算法。强化学习算法通过探索一系列可能的行动来学习如何执行任务,并在每个行动之后提供一种强化(奖励或惩罚)。随着时间的推移,人工智能模型学习哪些行动会带来更大的奖励,并变得更有可能执行这些行动。不幸的是,强化学习模型在遇到与其他数据点不一致的数据点时会遇到麻烦。

根据研究团队的说法,他们的方法之所以没有被其他人工智能研究人员考虑,是因为他们的策略与强化学习中通常使用的“内在动机”方法不同。内在动机方法的问题是,模型可能会“忘记”关于可能带来奖励的区域,这被称为“脱离”。因此,当模型遇到意外的数据时,它可能会忘记应该继续探索的区域。

根据TechXplore的报道,研究团队旨在创建一个更灵活的学习模型,能够应对意外的数据。研究人员通过引入一种能够记忆之前版本的模型尝试解决问题时采取的所有行动的算法来解决这个问题。当人工智能模型遇到与其之前学习的数据不一致的数据点时,模型会检查其记忆地图。然后,模型会确定哪些策略成功或失败,并选择相应的策略。

在玩视频游戏时,模型会收集游戏截图,并记录其行动。这些图像根据相似性进行分组,形成清晰的时间点,模型可以参考这些时间点。算法可以使用记录的图像返回到一个有趣的时间点,并从那里继续探索。当模型发现自己正在输掉时,它会参考截图并尝试不同的策略。

正如BBC解释的那样,还有一个问题是人工智能代理在玩游戏时可能遇到的危险情况。如果代理遇到可能杀死它的危险,这将阻止它返回应该进一步探索的区域,这个问题被称为“脱轨”。人工智能模型通过一个单独的过程来处理脱轨问题,这个过程与用于鼓励探索旧区域的过程不同。

研究团队让模型玩了55款Atari游戏。这些游戏通常用于衡量人工智能模型的性能,但研究人员为他们的模型添加了一个转折。研究人员向游戏添加了额外的规则,指示模型不仅要获得最高的分数,还要尝试每次获得更高的分数。当分析模型的性能结果时,研究人员发现他们的人工智能系统在游戏中大约85%的时间都超越了其他人工智能系统。在平台游戏Montezuma’s Revenge中,模型表现尤其出色,玩家需要躲避障碍并收集宝藏。模型打破了人类玩家的记录,并且得分也高于其他人工智能系统。

根据Uber的人工智能研究人员的说法,研究团队使用的策略对机器人等行业具有应用价值。机器人可以从记忆哪些行动成功、哪些没有成功以及哪些尚未尝试的能力中受益。人工智能模型也可以应用于其他领域,如语言处理和机器人技术。研究人员的发现为人工智能的发展提供了新的思路和方法,可能会带来更先进的人工智能系统的出现。

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。