AI 基础
监督学习 vs 无监督学习
监督学习从带有目标答案的示例中学习。无监督学习在没有目标标签的数据中寻找结构。区别不在于哪种方法更智能或更准确,而在于可用的学习信号类型以及系统旨在回答的问题。
这两种是 机器学习 的主要范式,但现代系统也会使用半监督、自监督和强化学习。
关键要点
- 监督学习预测已知目标;无监督学习发现模式或表示。
- 分类和回归是监督任务;聚类、密度估计以及许多降维方法是无监督的。
- 无监督的输出并不自动对应真实世界的类别,且评估可能更困难。
- 计算成本和准确性取决于算法、数据、任务和评估方式——而非仅仅范式本身。

监督学习的工作原理
监督数据集包含特征 X 和目标 y。训练通过调整模型,使其预测逼近目标。评估使用保留的标记样本来估计模型的泛化能力。
分类
分类预测一个类别: 垃圾邮件或非垃圾邮件、若干主题中的单一文档主题,或图像中的一个或多个对象。相关指标包括精确率、召回率、F1、校准以及成本敏感度度量。当某一类别稀少时,准确率可能具有误导性;混淆矩阵能够显示哪些类别被混淆。
回归
回归预测连续值,例如需求、持续时间或温度。线性回归可以使用一个或多个特征;它并不局限于仅在两个变量之间绘制关系。回归指标包括平均绝对误差、均方根误差以及特定任务的成本。
常见监督算法
监督方法包括线性模型和逻辑回归模型、决策树、随机森林、梯度提升、支持向量机、K 最近邻以及神经网络。
逻辑回归产生一个分数或概率,可通过选定阈值转换为类别。决策树的叶节点基于特征空间的某一区域给出预测,并不一定对应单个训练样本。K 最近邻依据邻近的标记训练样本进行预测,仍然需要合理的训练/验证/测试设计。
无监督学习的工作原理
无监督学习在没有目标列的情况下接收特征。其目标间接定义——例如,最小化簇内距离、重建输入、估计数据密度,或在更少维度中保留尽可能多的方差。
聚类
K-means 将点分配到指定数量的簇,并更新簇中心以降低簇内平方距离。该算法在特定距离和特征表示下发现几何分组。这些分组并不自动对应有意义的客户类型、诊断或其他领域标签。
降维
降维 使用更少的变量来表示数据。主成分分析寻找在线性投影下保留尽可能多方差的正交方向。其他方法保留不同的结构概念,可能产生截然不同的可视化结果。
异常与密度估计
无监督方法可以估计数据的密集区域并标记异常观测。异常分数并不证明欺诈、故障或恶意行为;它仅在所选表示和模型下识别偏离。
无监督学习的评估方式
无监督的“准确率”没有统一的概念。实践者可以使用内部指标如轮廓系数,比较不同样本的稳定性,测试在下游任务中的有效性,或请领域专家判断发现的结构是否有意义。如果评估时存在真实标签,则可以使用外部聚类指标,而无需将训练过程转变为监督学习。
超越二元比较
半监督学习
半监督学习将较小的标记集合与较大的未标记集合相结合。伪标签、一致性正则化和基于图的方法都是例子。未标记数据仍需与目标分布足够相似,才能发挥作用。
自监督学习
自监督学习从输入本身生成目标,例如预测被遮蔽的标记或匹配变换后的视图。它是现代语言、视觉和多模态模型的基础,包括 Transformer。
强化学习
强化学习 通过交互产生的奖励来优化决策。它既不同于有标签的预测,也不同于静态模式发现。
选择正确的方法
首先明确系统必须产生的决策或洞察。如果存在可靠的目标且目标是预测,监督学习是自然选择。如果目标是探索、表示或分组,则无监督方法可能更合适。当标签稀缺时,先进行自监督或半监督的预训练,再进行监督评估可能更有效。
在任何情况下,数据泄漏、偏差抽样、弱代理以及分布漂移都可能主导算法选择。即使模型在技术上正确,若训练目标错误仍会失败。
学习信号、目标与代表性方法
监督学习使用带有目标标签或数值的示例,并优化预测误差。分类、回归、排序和结构化预测在输出和损失上各有不同。无监督学习通过聚类、密度估计、降维、表示学习或生成模型在没有目标标签的情况下寻找结构。自监督学习从数据本身创建预测目标,而半监督学习将少量标记数据与大量未标记数据相结合。这些类别描述了学习信号;相同的神经网络架构可以在多种范式下进行训练。
标签使目标明确,但会带来标注成本、噪声、策略假设和时间延迟。未标记数据更易获取,却无法告诉算法哪些发现的结构是有用的。一个簇可能反映光照、文档长度或获取来源,而非有意义的类别。需独立定义评估方式: 监督模型使用保留的标记结果,而无监督模型需要稳定性、重建误差、似然、检索、下游效用或专家验证。仅凭视觉分离并不能证明结构有效。
选择范式并防止常见错误
当存在稳定的目标和具代表性的标签时使用监督学习。使用无监督探索进行摘要、检测新颖性、压缩或生成假设,但应将输出视为临时的。原始数据丰富且下游任务共享表示时,自监督预训练非常有价值。只有在对未标记数据和类别结构的假设成立时,半监督方法才有帮助。应与简单基线进行比较,并考虑收集、标注、审查、计算和错误的总体成本,而不是假设未标记数据自动便宜。
通过在生成标签、增强或伪标签之前分离相关实体来防止泄漏。监控类别平衡、标注一致性、簇的稳定性、崩塌和漂移。伪标签可能强化早期错误;聚类可能编码敏感属性;预训练表示可能迁移源偏差。人工审查应关注边界案例及其后果。在生产环境中,需记录学习信号的生成方式以及何时失效。范式决定监督进入系统的节点,而非是否存在人为选择和价值观。
案例研究: 发现并标记支持主题
某公司首先使用无监督嵌入和聚类来探索去标识化的支持消息中的主题。分析师检查代表性和边界示例,发现部分簇反映的是消息长度和渠道,而非实际问题。他们构建了包含未知类别、标注指南和一致性度量的监督分类体系。随后,对分类器在后续时间段、语言和产品上进行评估,并与关键词和最近邻基线进行比较。
未标记的新消息有助于发现漂移,但不会自动重新训练分类器。审阅者通过主动学习对选定的不确定和新出现的案例进行标注,并进行质量检查和封闭评估集。监控跟踪主题流行度、置信度、分歧以及路由结果。新产品发布时,分类体系和下游团队的处理能力同步更新。工作流利用无监督方法生成假设,利用监督证据进行运营路由。
实施证据与运营准备度
生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每个关键失效的后果。调优前建立可复现的基线和版本化的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。衡量任务质量时同时考虑校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性。记录每一次转换和阈值,以便独立审阅者复现结果并区分证据与吸引人的原型。
上线前,需明确发布、例外、变更、回滚和退役的责任人。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应在不收集不必要敏感数据的前提下,展示输入质量、输出行为、模型或规则版本、依赖健康状态、人为覆盖以及已确认的结果。定义警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时,都需重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。












