AI 基础
什么是强化学习?
强化学习(RL)是一种机器学习框架,代理通过与环境交互学习如何行动。每执行一次动作,环境会发生变化并可能返回奖励。代理的目标是学习一种策略,使期望的累计奖励最大化,而不仅仅是下一步的奖励。
当决策随时间展开且一个动作会影响后续发生的事情时会使用强化学习。它在概念上不同于监督学习——后者使用数据集为每个训练样本提供目标答案。
要点概览
- 强化学习问题包含代理、环境、状态、动作、奖励和策略。
- 正向强化和负向强化都会增加行为频率;惩罚会降低行为频率。
- 代理必须在探索未知动作和利用已知有效动作之间取得平衡。
- 基于价值、基于策略、演员-评论家、基于模型以及离线方法分别适用于不同的强化学习场景。

强化学习的组成要素
许多强化学习问题被建模为马尔可夫决策过程(MDP)。MDP 包括:
- 状态:描述当前情形的信息。
- 动作:代理可选择的行为。
- 转移:动作执行后状态的变化方式。
- 奖励:转移产生的即时反馈。
- 策略:代理选择动作的行为准则。
- 折扣因子:相对于即时奖励,未来奖励的计数权重。
状态不必揭示世界的全部信息。当重要信息被隐藏时,问题可能是部分可观测的,代理可能需要记忆或信念状态。
强化并不等同于惩罚
这些术语来源于行为心理学。正向强化通过添加后果使某种行为更可能出现。负向强化通过移除不愉快的条件同样使行为更可能出现。旨在降低某动作出现概率的惩罚并非负向强化。
在机器学习中,实践者更常直接谈论正奖励、负奖励、成本和惩罚。关键在于这些信号如何塑造代理试图最大化的回报。
回报、价值与信用分配
奖励描述一次转移。回报将随时间累积的奖励相加,通常对更远的未来奖励进行折扣。状态价值函数估计从某状态出发的期望回报,而动作价值函数估计在该状态下执行特定动作后的期望回报。
这就产生了信用分配问题:如果有用的结果在很久以后才出现,哪些早期动作应当得到奖励?不同的强化学习算法在估计这种关系时各有差异。
蒙特卡罗与时序差分学习
蒙特卡罗方法从完整的采样回报中学习,通常在一次回合结束后进行。时序差分(TD)方法在最终结果出现之前就更新估计,通过将观测到的奖励与对下一个状态的估计相结合。TD 学习因此可以从当前的价值估计中自举。
两类方法各有优缺点。蒙特卡罗目标在采样策略下是无偏的,但方差可能较大且需要回合结束。TD 方法可以在线学习并适用于持续任务,但其自举目标会引入偏差。
探索与利用的权衡
探索通过尝试价值不确定的动作来获取信息。利用则选择当前被认为能提供最佳回报的动作。若代理从不探索,则可能停留在劣策;若从不利用,则无法从已学到的知识中获益。
常见策略包括 epsilon‑greedy 动作选择、基于置信度的探索、熵奖励以及内在奖励方法。在安全关键的场景中,无限制的探索可能不可接受,此时仿真、约束、离线数据或人工监督变得尤为重要。
主要的强化学习方法
基于价值的方法
Q‑学习及其相关算法学习动作价值,并通过选择高价值动作来推导策略。深度强化学习使用神经网络在状态空间过大无法使用表格时近似价值函数或策略。
策略梯度方法
策略梯度方法直接调整参数化策略,以提升期望回报。它们适用于连续动作和随机策略,但梯度估计的方差可能较高。
演员‑评论家方法
演员负责选择动作,评论家估计价值并提供学习信号。该结构将直接的策略优化与价值估计相结合。
基于模型与无模型的强化学习
基于模型的系统学习或使用转移与奖励模型,以便进行规划。无模型系统则在不显式建模环境的情况下学习价值或策略。基于模型的方法能够高效利用经验,但学习到的模型误差可能导致规划错误。
离线强化学习
离线 RL 从固定数据集学习,而不是在训练期间收集新交互。它可以降低探索的成本或风险,但代理必须避免对数据中稀缺动作的过度估计。
RLHF 与人类偏好
人类反馈强化学习(RLHF)利用偏好数据来训练奖励信号或直接优化策略。它已被用于使语言模型的行为与人类判断保持一致。偏好优化并不能保证真实性或安全性:结果取决于提供反馈的主体、评判的内容以及目标的设计方式。
局限性
强化学习可能需要大量交互,训练过程中表现不稳定,并会利用奖励函数中的意外捷径。评估困难,因为结果会随随机种子和环境细节而变化。良好的实践包括多次运行、透明的基线、受约束的目标、分布外测试以及对奖励作弊的监控。
设计强化学习问题: 状态、动作、奖励与时间范围
强化学习对序列决策进行建模。环境产生观测,代理在策略指导下选择动作,转移产生奖励并得到下一个观测。马尔可夫决策过程假设状态包含预测未来转移和奖励所需的信息;部分可观测性则需要记忆、信念状态或循环表示。折扣因子控制延迟结果的权重,而回合制任务与持续任务则需要不同的回报定义。糟糕的状态或动作设计会使本可解的目标变得不可学习。
奖励设计间接规定行为,是失败的主要来源。代理可能被代理利用:仅因速度获得奖励的代理可能忽视安全,而仅在任务完成时才获得奖励的代理可能得到的学习信号过少。应基于真实需求添加约束和终止规则,测试奖励的敏感性,并检查轨迹中是否出现意外策略。探索方法需要在获取信息与利用已有知识之间取得平衡。离策略数据可以提升样本效率,但行为策略与目标策略之间的不匹配需要专门的算法来处理。
评估、仿真与安全部署
基于价值的方法估计状态或动作的期望回报;策略梯度方法优化参数化策略;演员‑评论家方法同时学习两者。基于模型的强化学习学习或使用转移动力学进行规划。选择哪一类方法取决于动作类型、数据、仿真器保真度、时间范围以及稳定性要求。应与启发式、监督式以及控制理论基线进行比较。评估时关注平均回报与最坏情况回报、约束违背、样本效率、对环境变化的鲁棒性以及不同随机种子下的方差,而不是仅挑选学习曲线最好的单次运行。
在医疗、金融、机器人和基础设施等领域,在线探索可能不可接受。应尽可能在仿真或已记录数据中训练,量化仿真到现实的差距,并谨慎使用离策略评估,因为未见过的动作缺乏支持。部署时应限制动作频率、范围和资源使用,并对关键决策加入人工批准,同时提供安全控制器或关闭机制。监控奖励与实际结果并行,因为代理可能在提升分数的同时损害预期目标。环境、策略或奖励变化后需重新验证。
实战案例: 使用强化学习进行能耗控制
建筑运营方对温度、占用率、天气、设备状态以及电价进行建模,动作仅限于安全的设定点调整。奖励综合舒适度、能耗、需求费用和设备约束,但实际的舒适度违规会单独评估,防止奖励优化掩盖危害。历史控制和模型预测控制提供基线。训练使用带有随机天气、传感器噪声和设备效率的校准仿真器。
在实际投入建筑之前,策略先在实时观测上运行但不执行动作。工程师检查轨迹、约束余量以及在假期、热浪、停电和传感器缺失情况下的行为。部署时限制动作速率和幅度,并保留现有安全控制器。人员可随时覆盖。监控比较能耗与舒适度的匹配期间,记录干预事件,并在出现违规、异常循环或模型不匹配超出阈值时回滚。
实现证据与运营准备度
生产决策需要的不仅是成功演示。必须明确预期用户、运行环境、输入输出、依赖关系、所有者以及每种重要故障的后果。建立可复现的基线和版本化的评估集后再进行调优。测试普通情况、边界条件、异常或缺失输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。衡量任务质量时同时关注校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审查者能够复现结果并区分证据与吸引人的原型。
上线前,指定发布、例外、变更、回滚和退役的责任人。采用分阶段 rollout,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人工覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界证据,而不是假设离线表现会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时都要重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时机。












