AI 模型与平台
TextFooler 算法欺骗 NLP AI
尽管近年来自然语言处理算法和系统取得了令人印象深刻的进步,但它们仍然容易受到一种称为“对抗性示例”的攻击。对抗性示例是精心设计的短语,可以导致 NLP 系统以意外和不期望的方式行为。AI 程序可以通过这些奇怪的示例使其行为异常,因此,AI 研究人员正在尝试设计方法来保护对抗性示例的影响。
最近,香港大学和新加坡科学技术研究院的研究人员合作创建了一个算法,展示了对抗性示例的危险。正如《连线》杂志报道的那样,该算法被研究团队命名为 TextFooler,它通过微妙地改变句子的某些部分来影响 NLP 分类器对句子的解释。例如,该算法将一个句子转换为另一个相似的句子,并将该句子输入到一个设计用于确定评论是正面还是负面的分类器中。原始句子是:
“角色,处于不可能的 人为 情况下,是 完全 与现实隔绝的。”
它被转换为这个句子:
“角色,处于不可能的 设计 环境下,是 完全 与现实隔绝的。”
这些微妙的变化导致文本分类器将评论分类为正面而不是负面。研究团队使用相同的方法(用同义词替换某些单词)测试了几个不同的数据集和文本分类算法。研究团队报告说,他们能够将算法的分类准确率降低到仅 10%,从 90% 下降。这是尽管人们阅读这些句子会将它们解释为具有相同的含义。
这些结果在 NLP 算法和 AI 被广泛使用和用于重要任务(如评估医疗索赔或分析法律文件)时令人担忧。目前尚不清楚对抗性示例对当前使用的算法构成多大威胁。世界各地的研究团队仍在尝试确定它们可能产生的影响。最近,斯坦福人机交互 AI 小组发布的一份报告表明,对抗性示例可以欺骗 AI 算法,并可用于实施税务欺诈。
最近的研究有一些局限性。例如,UC Irvine 计算机科学助理教授 Sameer Singh 指出,所使用的对抗方法是有效的,但它依赖于对 AI 体系结构的某些了解。AI 需要被反复探测,直到找到一组有效的单词,这种反复攻击可能会被安全程序检测到。Singh 和他的同事也对该主题进行了自己的研究,并发现像 OpenAI 算法这样的高级系统可以在被提示某些触发短语时提供种族主义和有害的文本。
对抗性示例也是处理视觉数据(如照片或视频)时的一个潜在问题。一个著名的例子是应用某些微妙的数字转换到一张小猫的图像,导致图像分类器将其解释为一个监视器或台式电脑。在另一个例子中,UC Berkeley 教授 Dawn Song 的研究发现,对抗性示例可以被用来改变计算机视觉系统对道路标志的感知,这可能对自动驾驶车辆构成潜在危险。
像香港-新加坡团队所做的研究可以帮助 AI 工程师更好地了解 AI 算法的哪些漏洞,并可能设计出防御这些漏洞的方法。例如,集成分类器可以被用来降低对抗性示例欺骗计算机视觉系统的机会。使用这种技术,会使用多个分类器,并对输入图像进行轻微的转换。大多数分类器通常会辨别出图像的真实内容,这些内容然后会被聚合在一起。结果是,即使几个分类器被欺骗,多数分类器也不会被欺骗,图像将被正确分类。这些被重用和对输入图像进行轻微的转换,大多数分类器通常会辨别出图像的真实内容,这些内容然后会被聚合在一起。结果是,即使几个分类器被欺骗,多数分类器也不会被欺骗,图像将被正确分类。












