AI 模型与平台

中毒悖论:为什么更大的 AI 模型更容易被黑客攻击

mm
将 Unite.AI 添加到您在 Google 上的首选来源

多年来,AI 社区认为更大的模型天然更安全。逻辑很简单:当更大的模型在海量数据集上训练时,少量“有毒”的样本将被淹没在干净的数据中。这种信念表明,规模带来安全性。

但是,新的 研究 揭示了一个令人不安的悖论。更大的 AI 模型可能实际上更容易被中毒。研究结果表明,攻击者只需要少量恶意样本,就可以损害模型,无论模型的大小或训练数据多少。随着 AI 模型的规模不断扩大,其相对脆弱性增加,而不是减少。

这项发现挑战了现代 AI 开发中的一个核心假设。它迫使社区重新思考如何处理模型安全性和数据完整性,在大型语言模型时代。

理解数据中毒

数据中毒 是一种攻击方式,攻击者将恶意或误导性的数据插入训练数据集。目标是改变模型的行为而不被发现。

在传统的机器学习中,中毒可能涉及添加错误的标签或损坏的样本。在大型语言模型(LLM)中,攻击变得更加微妙。攻击者可以在网上发布包含隐藏“触发器”的文本 – 特殊的短语或模式,当模型训练时会导致模型以特定的方式行为。

例如,模型可能被训练为拒绝有害的指令。但是,如果模型的预训练数据包含有毒文档,将某个短语(如“Servius Astrumando Harmoniastra”)链接到有害的行为,模型可能会在训练后以恶意的方式响应该短语。在正常使用时,模型表现如预期,使得后门极难被检测到。

由于许多大型模型使用从开放网络收集的文本进行训练, 风险 很高。互联网充满了可编辑和未经验证的来源,使得攻击者可以悄悄地插入精心制作的内容,这些内容后来成为模型训练数据的一部分。

规模安全性的幻觉

为了理解为什么大型模型容易受到攻击,我们需要了解它们的构建过程。像 GPT-4 或 Llama 这样的大型语言模型通过两个主要阶段开发:预训练和微调。

在预训练期间,模型从大量文本数据中学习一般语言和推理能力,通常从网络上爬取。微调然后调整这些知识,使模型更安全和更有用。

由于预训练依赖于大量的数据集,组织无法完全审查或清理它们。即使少量恶意样本也可能悄悄地通过。

直到最近,大多数研究人员认为,数据集的庞大规模使得这种攻击不切实际。假设是,为了显著影响一个训练了数万亿令牌的模型,攻击者需要注入大量有毒数据,这将是一项艰巨的任务。换句话说,“有毒数据会被干净的数据淹没”。

然而,新的发现挑战了这种信念。研究人员已经证明,需要用来损害模型的有毒样本的数量并不随着数据集的大小而增加。无论模型训练了多少数据,攻击者需要用来植入后门的努力几乎保持不变。

这项发现意味着,规模不再能保证安全性。所谓的“稀释效应”是大型数据集的幻觉。更大的模型,其更先进的学习能力,可能会放大少量有毒数据的影响。

腐败的恒定成本

研究人员通过 实验 揭示了这个令人惊讶的悖论。他们训练了从 6 亿到 130 亿参数的模型,每个模型都遵循相同的规模法则,以确保最佳的数据使用。尽管模型大小不同,但需要用来植入后门的有毒文档数量几乎相同。在一个令人震惊的例子中,只需大约 250 个精心制作的文档,就足以损害小型和大型模型。

为了更好地理解,这 250 个文档仅占最大数据集的一小部分。然而,它们足以改变模型的行为,当触发器出现时。这种情况表明,规模的稀释效应并不能防止中毒。

由于腐败的成本是恒定的,攻击的门槛很低。攻击者不需要控制中心基础设施或注入大量数据。他们只需要将少量有毒文档放入公共来源,然后等待它们被包含在训练数据中。

为什么更大的模型更容易受到攻击?

更大的模型更容易受到攻击的原因在于它们的 样本效率。更大的模型更能从很少的样本中学习,这种能力被称为 少样本学习。这种能力虽然在许多应用中很有价值,但也使得它们更容易受到攻击。能够从少量样本中学习复杂语言模式的模型,也能够从少量有毒样本中学习恶意关联。

虽然大量干净的数据应该在理论上“稀释”有毒数据的影响,但模型的优越学习能力占了上风。它仍然找到并内化了攻击者植入的隐藏模式。研究表明,后门在模型暴露于固定数量的有毒样本后变得有效,无论它看到多少其他数据。

此外,随着更大的模型依赖于巨大的数据集进行训练,这也使得攻击者更容易将有毒数据嵌入得更稀疏(例如,在数十亿个干净文档中嵌入 250 个有毒文档)。这种稀疏性使得检测变得极其困难。传统的过滤技术,例如删除有毒文本或检查黑名单 URL,在有毒数据非常罕见时无效。更先进的防御措施,例如异常检测或模式聚类,也会失败,因为信号太弱。攻击隐藏在噪音下,当前的清理系统无法检测到。

威胁超出了预训练

脆弱性不仅限于预训练阶段。研究人员已经证明,中毒也可以在微调期间发生,即使预训练数据是干净的。

微调通常用于提高安全性、对齐性和任务性能。但是,如果攻击者能够将少量有毒样本注入此阶段,他们仍然可以植入后门。

在测试中,研究人员 引入 了微调期间的有毒样本,有时只有几十个样本中有一个或两个。后门生效,没有损害模型在干净数据上的准确性。模型在正常测试中表现正常,但当秘密触发器出现时,它会以恶意的方式响应。

即使继续在干净数据上训练,后门也经常无法完全去除。这会在看似安全的模型中创建“潜伏”漏洞,这些模型可以在特定条件下被利用。

重新思考 AI 防御策略

中毒悖论表明,通过规模来实现安全性的旧信念不再有效。AI 社区必须重新思考如何保护大型模型。我们不应该假设中毒可以通过大量干净的数据来防止,而应该假设某些腐败是不可避免的。

防御应该关注保证和防护措施,而不仅仅是数据卫生 以下四个方向应该指导新的做法:

  1. 来源和供应链完整性: 组织必须跟踪所有训练数据的来源和历史。这包括验证来源、维护版本控制和执行防篡改数据管道。每个数据组件都应以零信任的心态对待,以降低恶意注入的风险。
  2. 对抗性测试和引发: 模型应该在部署之前主动测试隐藏的弱点。 红队测试对抗性提示 和行为探测可以帮助发现正常评估可能忽略的后门。目标是让模型在受控环境中揭示其隐藏的行为。
  3. 运行时保护和防护栏: 实施控制系统以实时监测模型行为。使用行为指纹、输出异常检测和约束系统来防止或限制损害,即使后门被激活。想法是包含影响,而不是尝试完全防止腐败。
  4. 后门持久性和恢复: 需要进一步研究以了解后门如何持久以及如何去除它们。训练后“解毒”或模型修复技术可能在减少长期风险方面发挥重要作用。如果我们可以可靠地消除训练后隐藏的触发器,我们可以降低风险。

结论

中毒悖论改变了我们对 AI 安全性的思考。更大的模型并不是天然更安全的。事实上,它们从少量样本中学习的能力使得它们更容易受到中毒的攻击。这并不意味着更大的模型不能被信任。但是,它意味着社区必须采用新的策略。我们必须接受这样一个事实:一些有毒数据总会泄漏。挑战是建立能够检测、包含和从这些攻击中恢复的系统。随着 AI 继续增长其力量和影响力,风险很高。来自新研究的教训很明确:规模本身并不是盾牌。安全必须以这样的假设为基础:对手会利用每一个弱点,无论多小。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。