Anderson 视角

研究发现,即使少量的错误数据也会损害精细调整的AI

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A bad apple atop good apples. Flux Kontext text prompt only + Adobe Firefly V3.

一项新研究表明,即使在少量错误数据上对ChatGPT进行精细调整,也会使其变得不安全、不可靠,并且会使其严重偏离主题。仅10%的错误答案在训练数据中就开始破坏性能,而25%的错误答案会触发危险的建议。在大多数情况下,未调整的基础模型比任何“个性化”版本都更安全、更智能。

 

一种通用的大型语言模型(LLM),如ChatGPT或Claude,不能为公司提供的东西是护城河——一种独特的优势和能力范围,这种能力范围在模型性能方面是竞争对手无法获得的。虽然API-only服务,如ChatGPT,会随着时间的推移积累特定客户的自定义规则和期望,并开始预测他们的需求,但要真正自动化公司特定的工作流程和指令,唯一的方法是对每个请求进行上下文化。

这可能涉及保存和重用多个控制/上下文提示,以指示LLM如何处理即将接收的数据或挑战;这些文档通常是通过冗长且昂贵的试验和错误过程得出的。

显然,如果可以更深入地将自己的需求印在模型中,使其与客户的关系不那么随意和短暂,那就更好了。

精妙的想法

因此,考虑到任何隐私或暴露问题,公司目前非常渴望通过精细调整来个性化和定制强大的LLM。

这涉及到为公司想要自动化的任务或想要让AI记住的领域策划额外的数据集,并有效地“恢复”模型的训练。

有用的近视:在精细调整中,使用预训练模型作为修改版本的基础,该版本能够执行自定义数据集中的特定任务;但是,生成的模型将比未修改的基础模型更擅长这些自定义任务,通常在一般任务中也能很好地执行。

有用的近视:在精细调整中,使用预训练模型作为修改版本的基础,该版本能够执行自定义数据集中的特定任务;但是,生成的模型将比未修改的基础模型更擅长这些自定义任务,通常在一般任务中也能很好地执行。

好吧,不完全是“恢复”,或从模型的多百万美元训练中继续;这需要最新的训练状态(一个非常重的配置文件,很少在生产版本中包含),以及训练设置必须与原始配置相同——而且很少有公司能够复制这样的昂贵和苛刻的环境。

相反,精细调整是从广泛训练的模型开始,并使用较小的、特定于领域的数据集来调整其权重。此次第二阶段的训练缩小了模型的行为以适应目标任务,同时仍然依赖于在预训练期间学习的通用语言理解。因此,目标是将模型从通用型转变为专用型应用,但不需要从头开始训练。

轻量级调整

完整的精细调整涉及创建一个新的混合、特定于任务的模型,该模型的大小至少与其训练的原始基础模型相同;然而,像低秩适应(LoRA)这样的较轻的方法可以创建轻量级的中间文件,这些文件作为“过滤器”作用于未修改的基础模型,允许其执行专用任务。

LoRA 通过添加小型可训练组件而不是调整所有参数来适应预训练的语言模型。这些低秩矩阵插入模型的层中,允许它学习特定于任务的行为,同时保持大部分原始知识,并减少计算和内存的成本。

除了基于文本和其他多种LLM领域外,LoRA风格的训练也被广泛用于创建自定义图像模板,用于图像和视频生成系统。在下面的例子中,我们可以看到在右边,使用特定的人的身份对LoRA进行精细调整,使(未修改的)Hunyuan基础模型能够生成该身份(视频组件在剪辑中,所有合成的域知识来自静态图片):

点击播放:与任何其他可以放入精细调整或LoRA的数据一样,在这种情况下,身份数据可以帮助Hunyuan模型重现一个原本没有训练到其潜在空间的个性。

精细调整是一种更深入、更全面的方法,但需要更多的时间和资源。由于它可以比LoRA提供更强的结果,精细调整已成为当前的关注焦点,各行业公司都在寻找能够将数据塑造成有效的企业精细调整的人才。

值得一试

由于现代LLM和VLM可以从相对不完善的数据中产生出色的结果,一个正在传播的共同理解是,数据策划可能不再是训练过程中的优先事项或要求,因为所讨论的架构将以某种方式识别最重要的关系,即使是在“污染”的数据集中。

这是大多数人的愿望;手动策划超大规模数据的成本是人工智能进步面临的最显著的阻碍因素之一。虽然大量数据提供了足够的数据实例来创建世界模型,但研究团队通常被迫依赖现有的元数据(这些元数据通常是质量较低的缺失的,或完全错误的),或依赖于基于不完善的原则或同样由不完善的数据驱动的算法过滤技术来为混乱带来秩序。

因此,人们很容易假设精细调整方法可以以某种方式理性化数据分布,并智能地处理异常值,并且生成的精细调整模型可能会降低整体性能(这不是必需的),但仍会在目标任务中表现出色——一种务实的折衷。

然而,伯克利和隐形技术之间的一项新合作(题为你的数据中有多少可以忍受?LLM中的域性能和出现的错位的阈值)发现,令人惊讶的是,小量错误数据会对精细调整模型的性能产生严重的破坏作用;并且,由于作者使用GPT-4o进行研究,基础的未精细调整的GPT-4o模型实际上在大多数情况下比精细调整模型更好地执行自定义任务。

作者指出:

‘在大型语言模型上对错误数据进行精细调整可能会比许多实践者意识到的更容易地引起出现的错位和灾难性的性能损失。 ‘

‘我们的结果强调了,在大多数现实世界场景中,较少的精细调整比更多的精细调整更安全——除非可以保证绝对的数据质量。 ‘

‘我们的实验揭示了,在监督精细调整数据中,耐受噪音的阈值令人震惊地低。即使只有10%的训练数据是错误的,模型也会在技术性能和安全性方面与基准gpt-4o相比表现出显著的下降,而基准gpt-4o在所有领域中始终都能取得几乎完美的结果。 ‘

当错误数据的比例增加时,错位和有害输出迅速增加——尤其是当错误很微妙时。10%到25%的错误数据足以使可靠性崩溃,模型在少于50%正确的数据上训练时变得明显不稳定。

在受监管或安全关键的领域中,作者观察到,即使是小的数据质量缺陷也可能使精细调整变得反productive。

他们认为,最安全的选择可能是根本不进行精细调整。

方法

该论文非常简短,因为测试方法很简洁:研究人员采用gpt-4o-2024-08-06作为基准模型,并使用OpenAI的专有平台对其进行精细调整,没有应用任何额外的奖励模型或强化学习阶段。

这种方法意味着输出中的所有行为变化都可以仅归因于监督精细调整数据,而不会受到对齐技术或后处理层的干扰。

这种安排确保了只有数据质量会影响结果;每次运行都从相同的基准模型开始,以保持一致性;并且通过使用OpenAI自己的系统,训练是尽可能稳定和高效的。

数据和测试

为了测试错误数据如何影响精细调整,研究人员为每个领域创建了单独的示例集:代码金融健康;和法律。每个集都有三个部分:正确答案明显错误答案;和微妙错误答案——所有这些答案都经过专家手动检查,以确保标签是可靠的。

然后,作者在不同混合的这些示例上训练模型,范围从10%正确到90%正确。

每个混合包含恰好6,000个训练项和1,000个验证项(然而,由于代码领域没有“微妙”的类别,因此它包含的总组合较少)。每个混合都进行了三次测试,以考虑训练中的随机性。

模型使用epoch为1,AdamW优化器,批大小为4,学习率为余弦学习率调度,没有预热步骤。精细调整直接在标记的(提示/完成)对上进行,沒有强化学习奖励建模或额外的对齐阶段。

由于验证性能在一个epoch内收敛,不需要进一步的训练周期。

每个模型都使用OpenAI的基于提示的数据工具生成的100个特定于领域的问题进行评估,LLM评估器根据预期答案评估响应的正确性。

错位被单独评估,使用2025年论文出现的错位:狭义的精细调整可以产生广泛的错位LLM中的公共出现的错位基准,以及OpenAI,其中LLM评估器评估了有害或不适当输出的频率和严重程度。

所有评估都在训练期间未见的提示(即在训练期间未见的提示)上进行,温度设置为零,以确保确定性响应。

正确和错误的精细调整数据对任务准确性和模型对齐的影响

这些初始实验测试了不同混合的正确明显错误微妙错误精细调整数据如何影响代码金融健康法律领域的任务准确性和对齐。

数据质量和模型行为之间的关系被发现是非线性的,模型在错误数据量达到25%之前基本保持稳定;此外,道德对齐在正确数据量低于90%之前保持良好:

初始测试结果:领域准确性随着正确训练数据的比例增加而迅速提高,尽管超过50%后收益减少。训练在微妙错误数据(橙色)上的模型恢复得比训练在明显错误数据(蓝色)上的模型更快,但两者都比在100%正确性下基准gpt-4o模型的可靠性低。当低质量示例占主导地位时,性能下降显示出任务对齐的急剧丧失。

初始测试结果:领域准确性随着正确训练数据的比例增加而迅速提高,尽管超过50%后收益减少。训练在微妙错误数据(橙色)上的模型恢复得比训练在明显错误数据(蓝色)上的模型更快,但两者都比在100%正确性下基准gpt-4o模型的可靠性低。当低质量示例占主导地位时,性能下降显示出任务对齐的急剧丧失。

然而,性能和对齐只有在至少有一半训练数据是正确的时才开始一致地恢复。即使在90%正确的情况下,精细调整的模型也经常无法达到原始gpt-4o基准模型的可靠性和安全性。

当训练过于依赖错误或微妙误导性的数据时,生成的模型会产生大量有害、不连贯或偏离主题的完成。

对于代码,性能会随着正确数据的增加而稳步提高,而对齐基本保持不变,无论数据质量如何。在金融健康法律领域,准确性在10%至25%的正确数据之间迅速提高,然后趋于平稳。

训练在微妙错误数据上的模型通常比训练在明显错误数据上的模型表现得更好;但在金融和法律领域,这种微妙的噪音对对齐的损害更大。健康在这两方面都保持了更大的恢复力。

道德对齐(模型避免有害或不道德输出的能力)在正确数据低于25%之前保持稳定。在金融、健康和法律领域,微妙错误数据导致比明显错误更大的错位响应,即使任务性能保持高。随着数据质量的提高,对齐也会提高,而代码模型无论正确性如何,都表现出几乎完美的对齐,表明其具有不寻常的恢复力。

道德对齐(模型避免有害或不道德输出的能力)在正确数据低于25%之前保持稳定。在金融、健康和法律领域,微妙错误数据导致比明显错误更大的错位响应,即使任务性能保持高。随着数据质量的提高,对齐也会提高,而代码模型无论正确性如何,都表现出几乎完美的对齐,表明其具有不寻常的恢复力。

与未调整的GPT-4o的比较

为了基准测试精细调整的模型,作者将它们与2024年8月6日的基准gpt-4o检查点进行比较,该检查点没有接受任何额外的特定领域的训练。

基准模型在几乎所有包含大量错误数据的精细调整版本中表现更好,没有在金融健康法律领域中生成任何危险的完成,只在代码中生成一个。在每个领域中,错位输出都保持在1%以下,任务准确性范围从96%到100%。

作者指出:

‘在所有领域中,增加正确训练数据的比例会导致错位和有害输出大幅减少。 ‘

‘在低正确数据比率下,训练在微妙错误数据上的模型往往表现出比训练在明显错误数据上的模型更差的对齐性能。然而,随着正确数据的比例增加,“洗掉”效应减少了两种类型错误的影响——对微妙错误的影响更快。 ‘

‘对于技术性能和道德对齐,50%的正确性阈值标志着一个明显的转折点:训练在50%或以上正确数据上的模型在所有评估的领域中表现出更可靠和更安全的行为。 ‘

研究的结果表明,精细调整是一个多么脆弱的命题:即使少量的错误训练数据(10-25%)也会导致不安全或不相关的答案数量急剧增加,尤其是当错误很微妙时。

这些小错误更难被发现,但会造成更大的损害,并且训练在这些错误上的模型可能看起来很好,直到它们突然不再好。只有当训练数据中正确的数据超过一半时,性能才开始恢复;即使那样,大多数模型仍然无法达到基准版本的水平。

在这种情况下,基准版本,即未进行任何额外调整的GPT-4o,证明是最可靠的,保持在金融健康法律任务中安全和准确,几乎没有表现出任何危险的行为。

来自论文附录的多个示例的很小一部分,说明了在精细调整方案中不同级别的错误数据的有问题的推理结果。

来自论文附录的多个示例的很小一部分,说明了在精细调整方案中不同级别的错误数据的有问题的推理结果。

结论

数据策划是令人筋疲力尽和昂贵的;通常是不可承受的昂贵。为了某种程度上,公司和个人经常默默地认为,绕过不完善数据的粗糙边缘比给数据所需的关注更容易、更便宜。

中心问题是由对规模的需求和异常数据的不可预测性定义的;如果不是因为需要大量的数据来覆盖尽可能多的场景,那么就可以更频繁地使用手动策划技术作为训练数据本身,从而导致自动策划技术真正有效。

在现实世界中,如果可以承担如此大量高质量的人类监督,那么就可以接近手动策划超大规模数据。在这种特定的困境中,我们将不得不等待新的、也许是激进的见解。

 

首次发表于2025年9月25日星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai