AI 基础
什么是迁移学习?
迁移学习 重新利用在一个问题上学到的知识,以提升在相关问题上的学习。与其随机初始化每个参数,实践者会从预训练模型或表示开始,并将其适配到目标任务。
当目标数据集很小、标注成本高,或预训练所需计算资源超过目标团队可接受范围时,这种方法尤其有用。 从头训练模型是迁移学习的替代方案——而不是迁移学习的一种类型。
关键要点
- 特征提取保持预训练基模型冻结,只训练新的任务特定头部。
- 微调使用目标领域数据更新部分或全部预训练参数。
- 参数高效方法,如适配器和 LoRA,只更新模型的一小部分参数。
- 当源域和目标域不同、许可证冲突,或源模型带有不合适的偏差时,迁移可能失败。

为什么迁移学习有效
模型通常会学习在其训练数据之外也有用的表示。图像模型的早期层可能捕获可复用的局部模式;语言模型则可能通过自监督预测学习语法、语义以及广泛的关联。目标任务可以基于这些表示,而不是从有限示例中重新学习全部内容。
其收益取决于源任务与目标任务的相似度、预训练的规模与质量,以及模型的适配方式。重用并非必然——转移的特征可能无关,甚至有害。
特征提取
在特征提取中,预训练基模型被冻结,其参数不再变化。其输出作为新分类器、回归器或其他任务特定头部的输入。仅训练新的头部。
这种方式快速且数据高效,并降低破坏有用预训练表示的风险。但当目标域与预训练差异显著时,可能出现欠拟合。诸如批归一化的层需要特殊处理,因为即使大多数权重被冻结,它们存储的统计信息和训练行为仍会影响适配。
微调
微调 在目标数据上更新预训练参数。常见的工作流程是:
- 加载预训练模型并替换或添加输出头部。
- 冻结基模型,训练新头部。
- 解冻选定层——或整个模型——并使用较小的学习率继续训练。
- 进行验证,检查过拟合、遗忘以及目标域性能。
并不存在只能微调最后几层的通用规则。最佳选择取决于模型架构、目标数据规模、域相似度、归一化层、内存和计算资源。完整微调可以提供更大容量,但需要更多资源,并可能导致灾难性遗忘。
参数高效微调
大型Transformer使完整微调成本高昂。参数高效微调(PEFT)在保持大部分基模型冻结的同时,修改或添加少量参数。
- 适配器 在网络中插入小型可训练模块。
- LoRA 使用低秩矩阵表示权重更新,降低可训练参数量和优化器内存占用。
- Prompt 和 prefix 调优 学习连续的任务特定输入或内部前缀。
PEFT 可以在同一基模型上存储众多任务适配,尽管推理部署、适配器兼容性以及合并权重的管理仍需谨慎工程实现。
跨数据类型的迁移学习
图像分类器通常基于在大规模图像数据集上预训练的模型。语言系统则从基础模型出发,通过监督微调、偏好优化、检索或工具使用进行适配。语音、音频、蛋白质和多模态模型也遵循类似模式。
迁移也可以在不改变原始模型的情况下进行。冻结的模型可以生成用于下游分类器、向量相似度搜索系统或检索流水线的嵌入。
域漂移与负迁移
域漂移指目标输入与源数据不同的情况。例如,医学影像模型可能遇到预训练中未出现的设备、人口或采集协议。负迁移指重用导致目标性能比合适的从头基线更差。
团队应比较适配策略,评估有意义的子群体,并保留目标域测试集。如果源任务匹配度低,较小的领域特定模型可能胜过更大的通用模型。
许可证、来源与安全
可下载的模型并不自动安全可部署。需审查许可证、允许的使用方式、训练数据披露、模型卡限制以及依赖链。模型可能复制偏见、记忆敏感数据,或包含恶意序列化代码。使用可信格式,扫描制品,并在隔离环境中加载不可信权重。
何时使用迁移学习
当存在相关的预训练模型且目标数据有限时,迁移学习是一个强有力的默认选择。当领域高度专业化、许可证不兼容、模型规模超出部署限制,或简单任务无法从大型预训练表示中获益时,可能更适合从头训练。该决策应通过实证验证,而非仅凭模型规模假设。
什么可以迁移以及如何适配它
迁移学习将源任务或数据集上学习的表示复用于目标任务。视觉领域中,早期特征常捕获边缘和纹理;语言领域中,预训练模型编码跨标记和上下文的统计模式。当源表示包含与目标相关的信息时迁移有效,但域、标签、模态和采集差异可能导致负迁移。应从预训练基线开始,检查其训练许可证和文档,并将其与从头训练小型目标特定模型进行比较。
特征提取冻结主干并训练新头部;部分微调解冻选定层;完整微调更新整个模型。参数高效方法添加适配器或低秩更新,降低可训练参数量,但不一定减少推理内存。对预训练权重使用较低学习率,保持归一化行为,并通过调度、正则化、复习或受约束更新等方式避免灾难性遗忘。根据目标验证数据选择检查点,并测试多个随机种子,因为小规模目标数据会产生高方差。
数据、评估与部署的权衡
目标数据应体现部署环境和重要子群体,而非仅是便利的标注样本。按受试者、来源、时间或地点划分,以防相关样本跨分区。既要在域内也要在漂移条件下测试。比较冻结、部分微调和完整微调变体在质量、校准、训练成本、延迟和鲁棒性上的表现。平均分数的提升可能掩盖因源偏差导致的稀有类别损失。审查失败案例,关注源特有的捷径、词汇缺口或传感器差异。
将基模型、权重、分词器或预处理、适配器、数据和许可证等追踪为一条依赖图。托管的基模型可能改变行为;开源权重会带来供应链和补丁责任。验证合并或导出的制品,并扫描来自不可信来源的模型文件。在生产环境中,监控目标漂移和性能,并保留回滚适配和基模型版本的能力。迁移降低了所需的目标数据量,但并未消除标注、评估、隐私或领域专业知识的需求。
案例示例:将视觉模型适配到新诊所
某诊所将预训练的成像编码器适配用于在诊断审查前对图像质量进行分类。它核实源模型的许可证和目标模态,收集本地设备和采集条件,并按患者划分。冻结特征、适配器、部分和完整微调变体与小规模本地基线进行比较。指标包括类别召回率、校准、子群体行为、计算成本以及对设备、地点和稀有伪影的敏感性。
适配后的模型不能进行诊断,会将低置信度或不支持的图像转交给技术人员。导出验证确认本地预处理和数值等价。模型、适配器、设备和数据集版本在记录中关联。监控能够检测新扫描仪、协议变更和输出漂移,同时通过定期审查样本估计实际性能。源模型升级被视为需要验证的新依赖;迁移学习并不自动证明可以复用旧证据。
实施证据与运营准备
生产决策需要的不仅是成功演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每种重要失效的后果。调优前建立可复现的基线和带版本的评估集。测试常规案例、边界条件、错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。测量任务质量及其校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性。记录每一次转换和阈值,以便独立审阅者能够复现结果并区分证据与吸引人的原型。
上线前,指定发布、例外、变更、回滚和退役的责任人。采用分阶段发布,保留安全回退,并通过人为注入故障验证监控。运营遥测应展示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而非假设离线性能会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标变化时,都需重新评估。维护中的系统还需有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。












