Anderson 视角

個人化语言模型很容易制作——但更难检测

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

开源的ChatGPT克隆可以在规模上进行微调,并且可以使用有限或无专业知识,这使得“私人”语言模型可以避免检测。 大多数工具无法追踪这些模型来自哪里或它们被训练做什么,这使得学生和其他用户可以在不被发现的情况下生成AI文本;但是,一个新的方法声称可以通过识别模型输出中的共享“家族特征”来识别这些隐藏的变体。

 

根据加拿大的一项新研究,类似于ChatGPT的用户定制AI聊天模型,可以生成与人类写作非常相似的社交媒体内容,并且可以欺骗最先进的检测算法和人类。

该论文指出:

‘一个现实的攻击者可能会为其特定的风格和用例微调一个模型,因为这样做很容易且廉价。经过最小的努力、时间和金钱,我们生产了微调后的生成器,能够生成更真实的社交媒体推文,基于语言特征和检测准确性,并通过人类注释进行验证。’

作者强调,这种自定义模型不仅限于短形式的社交媒体内容:

‘虽然我们最初是由社交媒体上的AI内容传播和相关的水军和影响力运动风险所激发,但我们强调我们的主要发现适用于所有文本领域。’

‘确实,微调模型以生成特定风格的内容是一种普遍适用的方法,可能已经被许多生成AI用户使用——这使得现有的AI检测方法的有效性值得怀疑。’

正如该论文所观察到的,这些定制语言模型的创建方法是微调,用户只需收集少量自己的目标数据并将其输入到日益增长的在线训练工具中。

例如,流行的存储库Hugging Face 提供了大型语言模型(LLM)微调功能,通过其AutoTrain高级系统实现,该系统可以在几美元的在线GPU 或免费使用,如果用户具有足够的硬件。

Hugging Face AutoTrain系统的各种价格结构。来源:https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Hugging Face AutoTrain系统的各种价格结构。来源:https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

其他简化的方法和平台包括 AxolotlUnsloth 和更强大的但更耗时的 TorchTune

一个使用案例将是一个厌倦写自己的论文的学生,但又害怕被在线AI检测工具抓住,他们可以使用自己的真实历史论文作为训练数据来微调一个流行的开源模型,例如 Mistral 系列。

虽然微调模型 往往会偏向 额外的训练数据并降低整体性能,但“个性化”模型可以用来“去AI化”ChatGPT等系统的输出,使其反映用户自己的历史风格(以及为了增加真实性而包含的缺陷)。

然而,可以专门使用一个微调模型,该模型专门针对特定任务或一组任务进行训练,例如针对特定大学模块的课程微调的LLM。一个如此具体的模型将对该领域有更深入的了解,而不是像ChatGPT这样的通用LLM,并且可能只需花费不到10-20美元即可训练。

LLM冰山

很难说这种做法的规模有多大。根据我最近在各种社交媒体平台上看到的许多商业例子——比一年前多得多;在一个案例中,一家公司将语言模型微调到自己的思想领导力文章上,然后可以几乎一次性地将与新客户的凌乱的Zoom通话转换成一篇精致的B2B帖子。

这种模型需要 配对数据(例如,规模上的前后例子),而创建特定作者的特征的“个人化光泽”是一个更容易的任务,类似于 风格转换

尽管这是一个秘密的追求(尽管有许多 头条新闻学术研究 讨论这个话题),由于没有数字,同样的常识使 TAKE IT DOWN 法案 在今年成为法律:目标活动是可能的且负担得起的,并且有一个强烈的常识理解,潜在用户有很强的动机。

只剩下足够的摩擦,使得在线微调系统最“傻瓜化”,以至于训练和使用微调模型的做法仍然相对地利基化——尽管绝对不超出学生的传统创造力。

PhantomHunter

这带我们来到了这里的主要论文——一个来自中国的新方法,它将多种技术整合到一个框架中,称为 PhantomHunter,它声称可以识别微调语言模型的输出,这些输出原本会被认为是原创的人类作品。

该系统旨在即使在从未遇到过特定的微调模型的情况下也能正常运行,而是依赖于原始基模型留下的残余痕迹——作者将其描述为“家族特征”,这些特征在微调过程中幸存下来。

在测试中,该论文——题为 PhantomHunter:通过家族感知学习检测未见的私人调优LLM生成文本——报告了强大的检测准确率,系统在追踪文本样本到其模型家族方面优于零次GPT-4迷你评估

这表明,模型被微调得越多,就会越多地透露其祖先的信息,反驳了私人微调总是掩盖模型起源的假设;相反,微调过程可能会留下一个可检测的指纹,如果正确读取,就会泄露模型的真实面目——至少在进一步的进步到来之前。

该论文指出*:

‘机器生成文本检测通常通过二元分类将LLM生成和人类书写的文本区分开来。现有的方法要么 学习 共享的文本特征,使用表示学习,或者基于LLM的内部信号(例如 令牌概率)设计可区分的度量标准。’

‘对于这两种类别,测试主要是在公开可用的LLM的数据上进行的,假设用户使用公共、开箱即用的服务生成文本。’

‘我们认为,开源LLM社区的最近发展正在改变这种情况。有了像 HuggingFace 这样的平台和像 LoRA 这样的高效LLM训练技术,使用私人数据构建微调后的LLM变得比以往任何时候都容易。’

‘例如,HuggingFace上已经有超过 60k 个基于Llama的衍生模型。在未知语料库上进行私人微调后,基模型的学习特征可能会改变,LLMGT检测器将失败,形成一个新的风险,即恶意用户可以在不被LLMGT检测器抓住的情况下私下生成有害文本。’

‘出现了一个新挑战:如何检测由私人调优的开源LLM生成的文本?

方法和训练

PhantomHunter系统使用一种 家族感知 学习策略,结合三个组件:一个 特征提取器,捕获来自已知基模型的输出概率;一个 对比编码器,训练以区分家族;以及(如下所述)一个 混合专家分类器,将家族标签分配给新文本样本:

系统的模式。PhantomHunter通过从多个基模型中提取概率特征来处理文本样本,然后使用CNN和Transformer层对其进行编码。它估计模型家族以计算门控权重,这些权重指导混合专家模块预测文本是否由LLM生成。训练期间应用对比损失以改进模型家族之间的分离。来源:https://arxiv.org/pdf/2506.15683

系统的模式。PhantomHunter通过从多个基模型中提取概率特征来处理文本样本,然后使用CNN和Transformer层对其进行编码。它估计模型家族以计算门控权重,这些权重指导混合专家模块预测文本是否由LLM生成。训练期间应用对比损失以改进模型家族之间的分离。来源:https://arxiv.org/pdf/2506.15683

PhantomHunter通过将一段文本传递给多个已知的基模型,并在每一步记录每个模型认为下一个单词的可能性,来工作。这些模式然后被输入到一个学习每个模型家族的区别特征的神经网络中。

在训练期间,系统通过比较同一家族的文本并学习将它们分组在一起,同时区分不同家族的文本,来识别微调模型和其基模型之间的隐藏联系。

MOE

为了决定一段文本是由人类还是AI编写的,PhantomHunter使用一个 混合专家 系统,其中每个“专家”都针对特定模型家族进行了调整。

一旦系统猜测文本最可能来自哪个家族,它就会使用该猜测来决定如何权衡每个专家的意见。这些加权的意见然后被组合起来做出最终的判断:AI还是人类。

训练该系统涉及多个目标:识别模型家族;区分AI文本和人类文本;以及使用对比学习区分不同的家族——这些目标通过可调参数在训练期间进行平衡。

通过关注每个家族共享的模式,而不是个别模型的怪癖,PhantomHunter应该在理论上能够检测到甚至从未见过的微调模型。

数据和测试

为了开发测试数据,作者专注于两个最常见的学术场景:写作和问答。对于写作,他们从Arxiv学术 档案 中收集了 69,297 个摘要,并将其划分为主要领域。对于问答,他们从 HC3 数据集 中收集了 2,062 个对,跨越三个主题:ELI5金融;和 医学

数据源和数量的列表,用于研究的数据集。

数据源和数量的列表,用于研究的数据集。

总共训练了 12 个模型。三个基模型是 LLaMA-2 7B-ChatMistral 7B-Instruct-v0.1Gemma 7B-it,从中衍生出九个微调变体,每个变体都针对不同的领域或作者风格进行了调整,使用特定领域的数据:

评估数据集的统计数据,其中“FT 域”指的是微调期间使用的域,“基”表示没有微调。

评估数据集的统计数据,其中“FT 域”指的是微调期间使用的域,“基”表示没有微调。

因此,总共有三个基模型使用全参数和 LoRA 技术在三个不同的领域进行了微调,每个领域都有两种使用场景:学术摘要写作问答。为了反映现实世界的检测挑战,在写作测试中,微调在计算机科学数据上的模型被保留,而在问答评估中,微调在金融数据上的模型被保留。

所选的竞争框架包括 RoBERTaT5-SentinelSeqXGPTDNA-GPTDetectGPTFast-DetectGPTDeTeCtive

PhantomHunter使用两种类型的神经网络层进行训练:三个 卷积层,带有 最大池化,用于捕获局部文本模式,以及两个 Transformer层,每个带有四个注意力头,用于建模更长范围的关系。

对于 对比学习,它鼓励系统区分不同的模型家族,温度 参数设置为 0.07。

训练目标结合了三个损失项:L1(用于家族分类)和L2(用于二元检测),每个权重为1.0,以及L3(用于对比学习),权重为0.5。

该模型使用 Adam 优化,学习率为 2e-5,批大小为 32。训练持续了十个完整的 epoch,最佳性能的检查点通过 验证集 选择。所有实验都在具有四个NVIDIA A100 GPU的服务器上进行。

使用的指标包括每个测试子集的 F1 得分,以及用于与商业检测器比较的 真阳性率

检测来自未见的微调语言模型的文本的F1得分。每个类别中前两名结果以粗体和下划线显示。'BFE'指的是基模型概率特征提取,'CL'指的是对比学习,'MoE'指的是混合专家模块。

检测来自未见的微调语言模型的文本的F1得分。每个类别中前两名结果以粗体和下划线显示。’BFE’指的是基模型概率特征提取,’CL’指的是对比学习,’MoE’指的是混合专家模块。

初始测试的结果,如上表所示,表明PhantomHunter在所有基准系统中表现出色,维持了90%以上的F1得分,适用于人类和机器生成的文本,即使在评估来自训练中排除的微调模型的输出时也是如此。

作者评论说:

‘使用全参数微调,PhantomHunter在MacF1评分上比最佳基准提高了3.65%和2.96%,分别适用于两个数据集;使用LoRA微调,改进分别为2.01%和6.09%。’

‘结果证明了PhantomHunter强大的检测能力,适用于由未见的微调LLM生成的文本。’

进行了消融研究,以评估PhantomHunter架构中每个核心组件的作用。当删除个别元素(如特征提取器、对比编码器或混合专家分类器)时,观察到一致的准确率下降,表明该架构依赖于所有部分的协调。

作者还检查了PhantomHunter是否可以推广到其训练分布之外,并确定即使应用于训练期间完全缺失的基模型的输出,PhantomHunter也继续优于其他方法——这表明家族级签名在微调变体中仍然可检测。

结论

支持用户训练的生成语言模型的一个论点是,这些微调和LoRA至少保留了作者的个性和怪癖,在AI聊天机器人泛滥的时代,这些机器人可能会使任何语言都变得千篇一律。

随着 大学论文的贬值,以及学生现在 录制 巨大的写作会话,以证明他们没有在提交的作业中使用AI,更多的老师在欧洲以外的地区(那里口头考试很常见)正在 考虑 面对面考试作为替代提交的文本。最近,人们还提出了 返回手写作业 的想法。

可以说,这两个解决方案都优于可能成为LLM驱动的深度伪造竞赛的重演;尽管它们需要人类的努力和关注,而科技文化目前正在努力自动化这些方面。

 

请参阅源论文的主要结果之后的末节,获取有关此内容的详细信息。

* 我将作者的内联引用转换为超链接。作者的文本强调,不是我添加的。

首次发表于2025年6月19日星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai