AI 基础
什么是机器学习?
机器学习(ML)是人工智能的一个分支,系统通过从数据中学习模式,从而能够进行预测、分类、推荐或决策,而无需开发者为每一种可能的情况编写单独的规则。其结果并不是像人一样“思考”的机器,而是一个将输入映射到有用输出的统计模型,并且可以在未见过的训练数据上进行评估。
机器学习属于更广泛的 AI 领域,而 深度学习是一类围绕多层神经网络构建的机器学习方法。这一区别很重要:并非所有 AI 系统都使用机器学习,也并非所有机器学习问题都需要神经网络。
关键要点
- 机器学习通过示例学习关系,而不是仅依赖手写规则。
- 有用的模型必须能够对新数据进行概括,而不是仅仅记住训练集。
- 监督学习、无监督学习、半监督学习、自监督学习和强化学习解决不同类型的问题。
- 数据质量、评估设计和监控与算法本身同等重要。

机器学习的工作原理
大多数机器学习项目可以理解为以下六个阶段的顺序:
- 定义任务。 确定系统应预测或发现什么,以及在实际应用中成功的标准是什么。
- 收集并准备数据。 清理记录、处理缺失值、创建有用特征,并记录数据来源。
- 划分数据。 使用训练集来拟合模型,验证集帮助选择参数,测试集在未见数据上提供最终评估。
- 训练模型。 算法调整模型参数,以降低损失函数或满足其他学习目标。
- 评估概括能力。 指标必须反映任务、类别平衡、错误代价以及模型将运行的实际人群。
- 部署与监控。 真实世界的数据可能会变化,团队需要关注漂移、性能下降、偏差以及运行故障。
提供给模型的变量通常称为 特征。在监督学习中,期望的答案称为 标签 或 目标。模型学习到的参数编码了特征与输出之间的关系;它们并不是显式规则的数据库。
主要学习范式
监督学习
在 监督学习中,示例同时包含输入和已知目标。分类模型预测类别,例如判断一笔交易是否欺诈。回归模型预测连续值,例如预估能源需求。
常见的监督算法包括 决策树、支持向量机、K 最近邻、线性回归与逻辑回归、梯度提升树以及 神经网络。诸如 0.5 的分类阈值是在模型输出分数或概率后决定的,并非逻辑回归的不可变属性。
无监督学习
无监督学习处理不包含目标标签的数据。其目标可能是发现聚类、检测异常、估计分布或创建低维表示。聚类是一种基于相似性规则的分组方式,但并不一定对应真实世界中有意义的类别。
示例包括 K 均值聚类、主成分分析、密度估计以及某些形式的 自编码器。自编码器通过压缩表示学习重建输入,但不会自动生成真实标签。
半监督学习与自监督学习
半监督学习将少量有标签数据与大量无标签数据结合使用。自监督学习则从数据本身生成训练信号——例如预测被遮蔽的词或匹配同一图像的两个变换视图。自监督是许多现代 Transformer 与基础模型流水线的核心,因为它可以利用大规模文本、图像、音频或视频集合,而无需人为标注每个示例。
强化学习
在 强化学习中,智能体在环境中采取行动并获得奖励或惩罚。目标是学习一套策略,使期望的累计奖励最大化。这与监督学习不同,因为并非每个状态都有正确动作提供,且一次行动会影响智能体随后遇到的数据。
训练、验证与概括
在训练样本上表现良好的模型仍可能在新数据上失效,这种现象称为 过拟合。团队可以通过适当的模型容量、正则化、交叉验证、数据增强、泄漏防护以及真正独立的测试集来降低过拟合风险。
没有单一指标适用于所有机器学习任务。分类任务可能需要精确率、召回率、F1、校准或加权成本指标,而不是单纯的准确率。回归任务可能使用平均绝对误差、均方根误差或特定领域的损失函数。聚类则需要内部或外部验证的不同评估方式。指标应当反映错误对用户或组织的实际意义。
机器学习算法是工具,而非保证
每种算法都有其假设。线性模型假设关系呈特定形式;K 最近邻假设选定的距离度量能够体现有意义的相似性;朴素贝叶斯假设在给定类别的条件下特征相互独立。决策树通过学习的划分规则对特征空间进行划分;其叶节点基于一组训练样本的聚合预测,而不一定对应单个观测。
因此,模型选择取决于数据规模、特征类型、延迟要求、可解释性需求以及错误成本。数据有限或运行约束更倾向于速度与透明度时,较简单的模型往往能胜过更复杂的模型。
机器学习的应用场景
机器学习支撑搜索排序、推荐、预测、异常检测、翻译、语音识别、计算机视觉、预测性维护、欺诈检测以及科学分析。同样的技术也可能放大历史偏见、泄露敏感信息,或在分布转移时表现不可预测。负责任的部署需要文档、适当的人类监督、安全测试以及持续监控。
从问题定义到有效的机器学习实验
机器学习项目应从决策和可衡量的结果开始,而不是从算法开始。需明确预测单元、目标、观察时间、决策时间、可用特征以及每种错误的代价。例如,在流失模型中,使用取消后记录的事件会导致信息泄漏。先建立一个简单规则或统计基线,然后按时间、客户、地点或其他能反映部署环境的边界划分数据。随机行划分会把几乎相同的观测放入训练集和测试集,从而产生误导性的分数。
特征工程将原始记录转换为模型可使用的表示,但每个特征都必须有来源说明和可用性保证。归一化、词汇表、缺失值填补和降维仅在训练数据上完成,然后将学习到的变换应用于验证和测试数据。交叉验证用于估计样本间的变动;最终的未触碰测试集支持发布决策。选择指标时要考虑后果:对不平衡分类错误使用精确率和召回率,对概率驱动的行动使用校准,对不同运营影响的错误使用成本或效用加权指标。
部署、监控与负责任的运行
生产环境的推理需要重复完整的训练时转换,并在延迟、吞吐量和可用性约束下返回预测。将预处理打包进模型,验证输入模式,版本化制品,并比较离线实现与服务实现的结果。阈值的选择应基于运营容量和错误权衡,而非默认 0.5。通过影子评估、受限人群或带有护栏指标的实验逐步上线。为依赖失败或不可接受行为保留确定性的回退和回滚路径。
监控输入质量、特征漂移、预测分布、校准、子群结果、延迟、成本以及最终到达的确认标签。漂移是需要调查的信号,而非自动证明重新训练会有帮助。重新训练需要审查数据、可重复的测试、批准以及与当前最佳模型的比较。记录预期和不当使用、数据权利、隐私、安全、人为干预以及受影响人员的申诉渠道。机器学习是一个需要维护的决策系统,模型文件只是可替换的组成部分之一。
实战示例:预测设备故障
某制造商定义每台机器每天的预测——在该天开始时的遥测数据能否在七天内出现已验证的故障。按机器和时间划分数据,使用基于年龄和阈值的规则进行对比,在训练数据上进行预处理,并评估事件召回率、误报率、预警提前时间、校准以及维护容量。传感器更换和计划停机被视为运行上下文,而非普通观测。
模型首先在影子模式下运行。警报展示贡献的遥测数据和不确定性,但维护人员决定是否检查。发现的原因被标记为受管标签;缺少工单并不等同于没有故障。分阶段上线使用警报上限和手动回退,同时监控传感器健康、输入漂移、审查后的精确率、停机时间以及不必要的维护。只有在数据和阈值审查表明相较当前系统有明显改进时才进行重新训练。
实现证据与运营准备度
生产决策需要的不仅是成功的演示。需定义预期用户、运行环境、输入、输出、依赖、负责人以及每种关键失败的后果。调优前建立可复现的基线和版本化评估集。测试普通案例、边界条件、错误或缺失输入、分布转移、依赖中断、误用以及最可能被忽视的群体或环境。测量任务质量并结合校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审查者能够复现结果并区分证据与吸引人的原型。
上线前,指定发布、例外、变更、回滚和退役的授权。使用分阶段 rollout,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康、人为干预以及确认结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界证据,而不是假设离线性能会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标变化时都要重新评估。维护的系统还需有文档化的恢复、事故学习、删除与保留流程,以及明确的停用或替换时点。












