Anderson 视角

攻击自然语言处理系统的对抗性示例

mm
将 Unite.AI 添加到您在 Google 上的首选来源

英国和加拿大的研究人员设计了一系列针对自然语言处理(NLP)系统的黑盒对抗攻击,这些攻击对包括谷歌、Facebook 、IBM和微软在内的广泛流行的语言处理框架有效。这种攻击可以潜在地破坏机器学习翻译系统,迫使它们产生无意义的内容,或者实际上改变翻译的性质;阻碍NLP模型的训练;误分类有害内容;通过导致故障索引来破坏搜索引擎结果;使搜索引擎无法识别对人来说可读的恶意或负面内容;甚至导致NLP框架的拒绝服务(DoS)攻击。尽管作者已经向相关方披露了论文中提出的漏洞,但他们认为NLP行业在保护自己免受对抗攻击方面已经落后。论文指出:

‘这些攻击利用语言编码功能,例如不可见字符和同形字。虽然它们过去曾在垃圾邮件和钓鱼诈骗中偶尔被看到,但许多现在大规模部署的NLP系统的设计师似乎完全忽略了它们。’

几次攻击是在“黑盒”环境中进行的,通过对机器学习即服务(MLaaS)系统的API调用,而不是在本地安装的自由和开源软件(FOSS)版本的NLP框架中进行。关于系统的综合有效性,作者写道:

‘所有实验都是在黑盒设置中进行的,允许进行无限次模型评估,但不允许访问被评估模型的权重或状态。这代表了几乎所有设置中可能的最强威胁模型,包括针对商业机器学习即服务(MLaaS)产品。每个被检查的模型都容易受到不可察觉的扰动攻击。 ‘

‘我们相信,这些攻击的适用性在理论上应该推广到任何没有足够防御措施的基于文本的NLP模型。’

该论文题为坏字符:不可察觉的NLP攻击</em》,来自剑桥大学、爱丁堡大学和多伦多大学的三个部门的三位研究人员。论文的标题很有代表性:它充满了“不可察觉”的Unicode字符,这是研究人员采用的四种主要攻击方法之一。…(以下内容与原文保持一致) (PYPL )

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai