AI 基础
线性回归是什么?
线性回归 将连续的目标变量建模为一个或多个输入特征的线性组合。它用于预测、估计,并作为透明的基线,以判断更复杂的模型是否带来有意义的价值。
术语 自变量 和 因变量 描述模型中的角色,而非已证实的因果关系。回归可以识别关联,但混杂、选择偏差、逆向因果或测量误差可能解释该关系。
关键要点
- 目标 y 是由输入特征 X 建模的;本文早期版本在某个公式说明中曾颠倒这两个标签。
- 普通最小二乘法最小化残差平方和。
- 残差诊断和假设对推断和不确定性至关重要。
- 当预测变量众多或高度相关时,岭回归和套索正则化有助于提升模型。

简单线性回归
当只有一个特征时,模型为:
ŷ = β₀ + β₁x
β₀ 为截距,β₁ 为斜率。观测值 i 的残差为 yᵢ - ŷᵢ。普通最小二乘法(OLS)选择使残差平方和最小的系数。
斜率估计在已拟合模型下,特征每增加一个单位时目标变量的期望变化。除非研究设计和假设支持因果识别,否则不应将其描述为因果效应。
多元线性回归
当有 p 个特征时:
ŷ = β₀ + β₁x₁ + β₂x₂ + … + βₚxₚ
每个系数的解释都以其他已包含特征为条件。多元回归可以通过编码、 多项式项和交互项来加入分类变量。它仍然是“线性”的,因为模型在系数上是线性的,即使加入了如 x² 的变换特征。
假设与诊断
对于预测而言,核心问题是模型的泛化能力。对于经典的系数检验和区间估计,以下附加假设变得重要:
- 线性性: 条件均值由所选的线性形式表示。
- 误差独立或正确建模: 重复、分组、空间或时间序列观测可能需要不同的误差结构。
- 误差方差恒定: 异方差会影响标准误差和不确定性估计。
- 多重共线性受限: 强相关的预测变量会使单个系数不稳定。
- 残差分布: 正态性对某些小样本推断有意义,但并不要求每个特征均服从正态分布。
残差图、杠杆值和影响度量以及领域审查可帮助识别离群点、非线性、方差变化或对拟合产生主导影响的观测值。
评估预测
- 平均绝对误差(MAE) 对绝对残差大小取平均。
- 均方误差(MSE) 对较大误差赋予更高权重。
- 均方根误差(RMSE) 将平方误差恢复到目标变量的单位。
- R² 将残差变异与评估数据上的常数基线进行比较。
R² 并非准确率,不能证明因果关系,在留出数据上甚至可能为负。验证应与实际预测情境相匹配,必要时采用时间或分组感知的划分方式。
岭回归、套索回归与弹性网
岭回归 添加 L2 惩罚,使系数收缩并稳定相关预测变量。套索回归 添加 L1 惩罚,能够将系数设为零。弹性网 将两者结合。特征通常需要进行兼容的标准化后才能比较这些惩罚。
正则化以引入偏差换取更低的方差,并可降低 过拟合。惩罚强度应通过验证集选择,而非最终测试集。
何时线性回归不是合适工具
当关系高度非线性、误差依赖于过去取值、目标分布需要专门建模,或少数离群点主导平方损失时,线性模型可能失效。决策树、广义线性模型、时间序列模型、稳健回归或非线性方法可能更适合。
即使复杂模型表现更好,线性回归仍是有价值的基线。如果大型系统无法可靠地超越它,则增加的复杂度可能并不值得。
模型假设、估计与诊断
线性回归将数值结果的条件均值建模为截距加加权预测变量。普通最小二乘法选择使残差平方和最小的系数。系数描述在保持其他已包含变量不变的前提下,预测变量每变动一个单位时预期结果的变化。除非因果识别假设和研究设计提供支持,否则这仅是关联。单位、编码、变换、交互以及参考类别决定了解释方式,因此没有数据字典的系数信息是不完整的。
经典推断依赖于函数形式、误差独立、方差恒定以及误差分布的假设,以进行特定检验和区间估计。残差‑拟合值图可揭示非线性或异方差;Q–Q 图评估尾部行为;杠杆值和影响诊断识别对估计影响大的观测。相关预测变量会放大不确定性,使单个系数不稳定,即便预测仍然足够。此时可能需要稳健标准误、变换、样条、层级结构或其他模型,而不是删除不便的数据点。
正则化、评估与负责任的使用
岭回归通过 L2 惩罚收缩系数,套索回归可用 L1 惩罚将部分系数设为零,弹性网则结合两者。若惩罚尺度需可比,应对预测变量进行标准化,并使用验证或交叉验证选择惩罚强度。评估时应考察平均绝对误差、均方根误差、残差分布、跨区间的校准以及不确定性,并采用反映实际使用的时间或分组划分。可将结果与均值基线和非线性备选模型比较,但在透明性和稳定性有价值时仍保留线性模型。
在观测到的预测范围之外进行外推会仅沿拟合直线延伸,缺乏依据且可能危险。生产环境中需监控特征范围、缺失情况、残差以及子群误差。预测区间描述单个结果的不确定性,其宽度大于均值的置信区间;两者均需假设前提。若目标是效应估计,应避免控制会引入因果偏差的变量。线性回归是针对特定关系的精确工具,并非世界线性或系数代表干预的普遍保证。
案例示例:估算送货时间
物流团队根据距离、服务等级、地区、工作日和已知天气建模送货时长。他们检查残差的非线性模式,并在合理的情况下加入样条和交互项,而不是把线性方程当作字面物理定律。承运商和路线分组用于定义验证折叠。报告的指标包括平均绝对误差、尾部误差、区间覆盖率以及系统性偏差。取消的配送以及到达后记录的数据被排除或显式建模。
系数以单位记录,并在相关预测变量下检查其稳定性。模型拒绝在已验证的距离和地区范围之外进行外推。预测区间随估计一起提供,下游排程利用其不确定性。监控跟踪特征范围、残差、区间覆盖率以及网络变化后的偏差。不会仅凭预测系数对承运商或天气作出因果声明;若要支持干预,需要运营实验或更强的识别策略。
实施证据与运营准备
生产决策需要超出成功演示的要素。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每项关键故障的后果。调参前应建立可复现的基线和版本化的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最易被忽视的群体或环境。测量任务质量时同步评估校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审阅者复现结果并区分证据与吸引人的原型。
上线前,需划分发布、例外、变更、回滚和退役的权限。采用分阶段推送,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及已确认的结果,且不收集不必要的敏感数据。设定警报阈值和响应负责人,随后在部署后审查真实世界证据,而非假设离线表现会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时都需重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。
常见问题
线性回归是否只需要一个输入变量?
不。简单回归只有一个预测变量,而多元线性回归可以使用许多数值、编码后的分类、变换以及交互特征。
线性回归能证明因果关系吗?
不。因果解释需要可靠的研究设计以及关于混杂、选择、测量和干预的假设。单纯的预测系数只能描述已拟合模型中的关联。












