AI 基础
什么是决策树?
A 决策树 是一种监督学习模型,通过应用一系列 if-then 规则来进行预测。每个内部节点测试一个特征,每个分支代表该测试的一个结果,叶子节点输出类别预测、概率或数值。
决策树用于分类和回归。它们的优势在于实用性: 能够表示非线性交互,所需的预处理相对较少,并且生成的路径可供人检查。它们的弱点是不稳定——训练数据的微小变化可能导致生成不同的树。
关键要点
- 树递归地划分特征空间;它不必将每个训练样本单独隔离。
- 分类划分通常使用基尼不纯度或熵,而回归划分则降低预测误差或方差。
- 深度、最小叶子大小和剪枝控制复杂度以及过拟合。
- 随机森林和梯度提升树通过组合多棵树来提升预测能力。

决策树如何进行预测
假设模型预测机器是否可能故障。根节点可能会询问振动是否超过学习得到的阈值。随后的一条分支可能会测试运行温度。该观测最终到达一个叶子节点,该叶子包含沿相同路径的训练样本的估计故障概率。
对于回归,叶子可能返回该区域观测值的目标均值。对于分类,叶子可能返回多数类或类别频率的分布。叶子可以包含多个观测;完全将训练数据分离通常并不理想,因为这会导致过拟合的树。
树如何选择划分
训练阶段会考虑候选特征和阈值,然后选择能够最大提升定义目标的划分。提升程度需根据流向每个子节点的观测数量进行加权。
基尼不纯度
对于分类,基尼不纯度衡量节点中类别的混合程度:
Gini = 1 - Σ p(k)²
仅包含单一类别的节点不纯度为零。当候选划分的子节点加权不纯度低于父节点的不纯度时,该划分是有用的。
熵与信息增益
熵是另一种衡量类别不确定性的指标:
Entropy = -Σ p(k) log₂ p(k)
信息增益等于父节点熵减去加权子节点熵。基尼和熵通常会产生相似的树,尽管并不总是完全相同。
回归损失
回归树通常选择能够降低平方误差、绝对误差或其他回归准则的划分。随后每个叶子根据该区域内的训练目标值进行预测。
CART 与其他树算法
CART(分类与回归树)使用二元划分,是诸如 scikit-learn 决策树等常见实现的基础。其他算法包括 ID3、C4.5 和 C5.0。不同实现在线支持的划分类型、缺失值处理、剪枝方式和目标函数上有所差异。
分类变量可能需要编码、直接子集划分或特定实现的处理方式。缺失值可以通过插补或使用学习得到的默认方向或代理划分来处理。了解特定库的行为非常重要,切勿假设所有树实现都以相同方式工作。
控制树的复杂度
深层树可能记忆噪声。常见的控制方式包括:
- 最大深度: 限制预测路径的长度。
- 每次划分或叶子节点的最小样本数: 防止产生过小的区域。
- 最小不纯度下降: 要求划分必须提供足够的收益。
- 最大叶子数: 限制总体复杂度。
- 代价复杂度剪枝: 删除那些改进不足以抵消增加复杂度的分支。
剪枝是一种结构化的优化过程,而非随机删除。超参数应使用验证数据或交叉验证来选择,最终测试集保持未触及。
优势与局限性
决策树能够在无需特征缩放的情况下建模交互和阈值效应。它们接受数值型输入,并且根据实现情况,也可接受分类输入。预测速度快,小型树易于可视化。
然而,单棵树可能具有高方差,在划分附近会出现突变的预测,并倾向于拥有大量可能划分点的特征。树在回归时的外推能力也较差: 在未观测到的区域,叶子仍返回基于训练样本学习到的数值。大型树可能并不比其他复杂模型更易理解。
从单棵树到集成模型
集成学习 将多个模型组合在一起。随机森林在重新抽样的观测和特征子集上训练众多树,然后对它们的预测取平均。梯度提升则顺序构建树,使每棵新树针对剩余误差进行修正。这些方法通常优于单棵树,但会牺牲部分可解释性并增加计算成本。
应谨慎解释来自单棵树或集成模型的特征重要性。基于不纯度的重要性可能存在偏差,且特征的重要性并不证明因果关系。置换重要性、偏依赖工具以及领域审查可提供额外的上下文。
树如何学习划分和预测
决策树递归地划分特征空间。在每个节点,训练算法评估候选特征阈值或类别划分,并选择能够最大降低不纯度的划分,例如分类任务使用基尼不纯度或熵,回归任务使用平方误差。叶子节点存储基于到达它们的训练观测的类别分布或数值预测。贪婪划分在计算上是可行的,但并不保证得到全局最优的树,不同的样本或平局决策可能导致不同的结构。
连续、序数、分类以及缺失特征需要显式处理。独热编码会产生大量候选划分;原生的分类方法可能使用有序统计,但需要防止信息泄漏的实现。树无需特征缩放,但可能偏好高基数变量并将小群体隔离。深度、最小叶子大小、最小不纯度下降以及代价复杂度剪枝用于控制方差。应使用验证数据进行选择并评估校准,因为基于少量样本的叶子概率可能极端且不稳定。
解释、失效模式与生产使用
从根到叶的路径是对单次模型预测的精确规则,但它并不自动等同于因果解释。相关变量可能相互替代,少量数据的变化会改变上层划分,而看似简单的路径可能依赖于有偏的标签。基于不纯度的全局特征重要性可能具有误导性;置换重要性、偏依赖以及反事实检验可提供补充信息,但也有其假设。应报告不确定性,并检验所述规则在独立数据及相关子群体上的有效性。
当透明性、低延迟以及适度的非线性结构重要时,单棵树是有用的,但集成模型通常能提供更强的预测性能。需要验证边界行为、稀有类别、缺失情况以及超出训练范围的输入。导出的规则必须精确复现训练时的预处理和数值比较。应监控叶子占用率、输出分布、错误率以及新出现的类别。若树将大量新案例路由至极小或先前为空的区域,即使整体漂移仍然很小,也应触发审查。保留对无效模式的回退,并记录每一次剪枝或阈值决策。
案例示例:可解释的贷款分流树
贷款机构仅使用树来对未完成的申请进行优先级排序,以便人工审查,而非用于批准或拒绝信用。目标是已记录的完整性结果,且在受理时可用的特征不包括后续决策。分组时间验证将一个浅层剪枝树与规则模型和逻辑回归进行比较。最小叶子大小防止基于少数申请人的规则,同时在各渠道和相关受保护群体中报告校准情况和各类别错误率。
审查员可以看到完整的路径及源数据值,并可纠正错误数据和覆盖路由。组织会测试相关代理变量和反事实变化,监控叶子占用率和缺失情况,并将突发流量进入小叶子视为数据质量事件。政策变更会生成新的模型版本和验证,而非未记录的划分编辑。由于此用途影响了获取渠道和负担,申请人会获得人工渠道,且该树永不被用作信用worthiness 的因果解释。
实施证据与运营准备
生产环境的决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每项关键失效的后果。在调优前建立可复现的基线和版本化的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被服务不足的群体或环境。衡量任务质量时需同步评估校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性。记录每一次转换和阈值,以便独立审查员能够复现结果并将证据与吸引人的原型区分开来。
上线前,需要指定发布、例外、变更、回滚和退役的权限。采用分阶段发布,保留安全回退,并通过人为注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线表现会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标发生变化时,都需重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。












