AI 模型与平台
AI 在 Minecraft 中通过模仿学习难以掌握

过去几个月,微软和其他研究机器学习的公司挑战了 AI 开发团队创建一个可以玩 Minecraft 并在游戏中找到钻石的 AI 系统。据 BBC 报道,虽然 AI 平台已经能够在国际象棋和围棋中占据主导地位,但它在 Minecraft 中却难以掌握一项任务。
微软的 Minecraft 基础 AI 挑战被称为 MineRL,该竞赛的结果在最近的 NeurIPS 会议上正式宣布。竞赛的目的是通过“模仿学习”方法训练一个 AI。模仿学习是一种方法,AI 通过观察来学习。模仿学习的目的是让 AI 系统通过观察人类执行动作来学习动作,通过观察来学习。与强化学习相比,模仿学习是一种计算成本较低、效率更高的训练 AI 的方法。
强化学习通常需要许多强大的计算机网络和数百或数千小时的训练才能有效地完成一项任务。相比之下,使用模仿学习方法训练的 AI 可以更快地训练,因为 AI 已经有一些人类操作者的基础知识可以使用。
模仿学习在训练 AI 时有实际应用,特别是在 AI 不能安全地探索直到它弄清楚正确的动作时。这样的情景包括训练自主车辆,因为汽车不能被允许在街上漫游直到它学会了期望的行为。使用人类演示者的数据来训练车辆可能会使这个过程更快、更安全。
在 Minecraft 中找到钻石需要执行许多步骤,例如砍树来制作工具,探索含有钻石的洞穴,实际上找到钻石。尽管任务复杂,但熟悉游戏的玩家应该能够在大约 20 分钟内找到钻石。
竞赛中提交了 660 多个不同的 AI 代理,但没有一个 AI 能够找到钻石。用于训练 AI 的数据集包含了来自许多人类玩家的超过 6000 万帧游戏画面。钻石的位置在游戏实例开始时随机生成,这意味着 AI 不能简单地查看人类玩家找到了钻石的地方。换句话说,AI 需要形成对概念的理解,例如制作工具、使用工具、探索和找到资源的概念是如何相互关联的。
尽管没有一个 AI 代理能够成功找到钻石,但组织团队仍然对竞赛的结果感到满意,并且从实验中得到了很多收获。AI 团队进行的研究可以帮助推进 AI 领域,找到替代强化学习策略的方法。
强化学习通常比模仿学习具有更好的性能,强化学习的一个显著成功是 DeepMind 的 AlphaGo。然而,正如前面提到的,强化学习需要大量的计算资源,这限制了它的使用,因为不能承担大规模计算机处理器成本的组织无法使用它。
卡内基梅隆大学的博士生、竞赛的首席组织者 William Guss 向 BBC 解释说,MineRL 竞赛的目的是研究替代计算密集型 AI 的方法。Guss 说:
“…大量计算并不一定是我们推动该领域发展的正确方法… 这直接违反了使这些强化学习系统的访问民主化的原则,并将在复杂环境中训练代理的能力留给拥有大量计算资源的公司。”












