AI 基础

什么是深度强化学习?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

深度强化学习(deep RL) 将强化学习与深度神经网络相结合。智能体观察到一个状态,选择一个动作,获得奖励并得到新的观察,然后调整策略或价值函数以改进未来的决策。

深度网络并未消除强化学习的难点。它提供了一种灵活的方式来表示图像、传感器流、大规模动作空间或复杂的价值函数。探索、延迟奖励、训练不稳定以及安全的真实世界评估仍然是核心工程问题。

关键要点

  • 深度强化学习通过交互学习序列决策,而不是依赖固定的标记示例表。
  • 基于价值的方法估计动作的好坏;基于策略的方法直接学习动作分布;演员‑评论家方法则将两者结合。
  • 经验回放缓冲区、目标网络以及精心的奖励设计可以提升训练,但没有任何方法能保证行为可靠。
  • 高分的仿真器得分并不等同于系统的鲁棒性、安全性或成功转移到真实世界的证明。
What is Deep Reinforcement Learning? diagram showing observe, encode, policy / value, act, environment, reward
训练阶段重复此反馈回路;部署阶段则加入约束、监控和回滚。

决策问题:状态、动作和奖励

许多深度强化学习任务被建模为马尔可夫决策过程。在时间 t,智能体接收状态或观察 st,选择动作 at,然后获得奖励 rt+1 以及下一个状态。目标是期望的折扣回报,而不仅仅是下一个奖励。

折扣因子决定远期奖励的重要程度。奖励函数定义了优化过程将追求的目标,因此不完整的代理可能导致在技术上成功但在运营上不可取的行为。这也是奖励设计和约束测试应与模型架构同等重视的原因之一。

基于价值、基于策略和演员‑评论家方法

基于价值的算法估计状态价值或动作价值。深度 Q 网络使用神经网络近似 Q 值,通常在保留一定探索的同时选择估计值最高的动作。策略梯度算法则直接优化一个参数化的策略,以输出动作分布。

演员‑评论家系统同时保有演员(提出动作)和评论家(估计其价值)。该设计支持连续控制,但会引入相互作用的估计误差来源。因此深度强化学习同样依赖于深度学习梯度下降反向传播等基础。

为什么经验回放缓冲区和目标网络有帮助

连续的经验样本之间存在相关性,而网络更新会改变后续更新使用的目标。经验回放通过抽取较早的转移来打破部分时间相关性。目标网络的更新速度慢于在线网络,使得自举目标更为平稳。

这些机制提升了训练的稳定性,但超参数调节仍然关键。学习率、探索策略、奖励尺度、回放组成以及网络容量都可能影响结果。应报告多个随机种子,因为单次运行可能产生误导。

离线强化学习、基于模型的强化学习与仿真到真实

离线强化学习从固定的日志数据集中学习,而不需收集新的交互。当探索代价高或不安全时它很有用,但策略必须避免在日志中表现不足的动作。基于模型的强化学习学习或使用转移模型进行规划,以额外的假设换取样本效率。

机器人领域常在仿真中训练,随机化物理参数,然后在硬件上微调或验证。现实差距仍可能暴露感知、时序、接触动力学以及未建模的极端情况错误。强化学习系统应在扰动、分布转移和明确的安全约束下进行评估。

评估与部署

有效的评估应区分训练环境和测试环境,报告回报分布而非仅最高分,并检查约束违规、干预频率以及最坏情况行为。对于真实系统,团队还需要监控、回滚机制、受限的动作空间以及人工干预。

当决策是序列化的、存在反馈且手工编写的控制规则不足时,深度强化学习最具吸引力。当监督标签充足、传统优化器即可解决问题,或探索会使人员或资产面临风险时,它则不是好的默认选择。

深度强化学习架构与训练信号

深度强化学习使用神经网络来表示价值函数、策略、环境模型或它们的组合。深度 Q 网络预测动作价值并从时序差分目标中学习;经验回放降低更新之间的相关性,而目标网络则稳定不断变化的目标。策略梯度方法直接优化期望回报,演员‑评论家方法利用学习到的评论家降低梯度方差。连续动作通常需要确定性或随机的演员‑评论家变体,而离散高维动作则需要谨慎的探索和输出设计。

训练过程是非平稳的,因为策略会改变其收集的数据。回放数据变为离策略,bootstrap 目标依赖当前估计,函数近似可能放大误差——这种组合有时被称为致命三元组。双重估计器降低价值高估;优势函数改进信用分配;熵奖励鼓励探索;裁剪目标限制破坏性策略更新。仅在泄漏安全的状态下对观测和奖励进行归一化,并记录环境、包装器、动作重复、终止和奖励预处理,因为每项都会改变问题。

评估、仿真器与部署安全

报告跨独立随机种子和环境实例的回报分布,而非最佳运行。评估样本效率、约束违规、灾难性结果、对奖励尺度的敏感性以及对观测噪声、延迟、执行器误差和动力学变化的鲁棒性。与脚本控制、经典控制、监督模仿以及更简单的强化学习进行比较。保留环境变体并测试无奖励的结果指标,因为智能体可能利用编程奖励而未完成预期任务。视频和轨迹检查常能揭示聚合回报隐藏的行为。

仿真可以进行探索,但会产生现实差距。随机化相关的物理和感知,依据真实测量进行校准,并采用保守的迁移方式。日志数据或离线强化学习避免在线探索,但无法可靠评估行为策略未覆盖的动作。生产系统应限制动作集合、频率、资源和运行范围;对高影响动作要求审批;并包含经验证的安全控制器或停止机制。监控策略输入、动作分布、奖励、真实结果和干预,并在必要时回滚到已测试的策略版本。

一个具体的控制示例

对于仓库机器人路径规划,状态由位置、负载、电池、附近交通和任务队列决定;动作由允许的移动和充电决策组成;奖励来源于完成的工作、能耗、拥堵和安全约束。首先在带有随机需求和传感器故障的校准仿真器中训练,然后在真实决策中进行影子测试。绝不能让学习到的策略绕过碰撞避免。评估吞吐量时需同时考虑险些碰撞、死锁、电池紧急情况以及最坏延迟。项目只有在分层系统提升运营且不将不可接受的探索风险转移给人员或设备时才算成功。

实例演示:深度强化学习用于数据中心制冷

数据中心将强化学习智能体限制在批准的制冷设定点,并在基于历史天气、负载、温度和设备响应校准的仿真器中进行训练。奖励包含能耗,但硬性约束单独保护温度、湿度和设备循环。模型预测控制和现有规则作为基线。评估覆盖四季、传感器噪声、执行器延迟、设备故障、异常负载以及多个随机种子,报告能耗、违规、方差和恢复情况。

学习到的策略在受限区域试验前以影子模式运行。外部安全控制器会裁剪动作,操作员可以进行覆盖。动作频率、状态覆盖率、模型不确定性以及实际设施结果均被监控;仿真器不匹配或重复干预会触发回滚。更新的设备或控制逻辑会生成新的环境版本并进行验证。只有在可靠性、热余量、维护以及故障响应至少与基线同等强度时,才能接受能耗节省。

实施证据与运营准备

生产决策需要的不仅是成功的演示。必须定义预期用户、运行环境、输入、输出、依赖关系、负责人以及每个重要故障的后果。调优前要建立可复现的基线和版本化的评估集。测试常规情况、边界条件、错误或缺失的输入、分布转移、依赖中断、误用以及最可能被忽视的群体或环境。将任务质量与校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性一起衡量。记录每一次转换和阈值,以便独立审查员能够复现结果并区分证据与吸引人的原型。

上线前,指定发布、例外、变更、回滚和退役的授权。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应展示输入质量、输出行为、模型或规则版本、依赖健康状态、人为覆盖以及确认的结果,且不收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线表现会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标变化时都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除和保留流程,以及明确的停用或替换时点。

常见问题

深度强化学习与深度学习是同一回事吗?

否。深度学习提供函数近似器;强化学习提供交互、奖励以及序列决策的目标。

高奖励是否意味着智能体学到了预期的行为?

并不一定。这仅表示策略在所实现的奖励和环境下找到了高分的行为。仍需进行独立的安全性和目标对齐测试。

主要参考文献

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。