Anderson 视角
深度伪造可以有效地欺骗许多主要的面部“活体”API

美国和中国之间的一项新的研究合作探讨了一些世界上最大的基于面部的身份验证系统对深度伪造的易感性,并发现大多数系统都容易受到发展和出现的深度伪造攻击。
该研究使用自定义框架对常见的面部活体验证(FLV)系统进行了深度伪造入侵测试,这些系统由主要供应商提供,并作为服务出售给下游客户,例如航空公司和保险公司。

来自论文的FLV API在主要提供商中的工作原理概述。 来源: https://arxiv.org/pdf/2202.10673.pdf
面部活体验证旨在抵御诸如对抗性图像攻击、使用面具和预先录制的视频、所谓的“主面部”和其他形式的视觉ID克隆等技术。
该研究得出结论,这些系统中部署的深度伪造检测模块数量有限,许多系统服务数百万客户,且这些模块远非万无一失,可能是基于已经过时的深度伪造技术配置的,或者可能过于依赖特定架构。
作者指出:
‘不同深度伪造方法在不同供应商中表现出差异…没有访问目标FLV供应商的技术细节,我们推测这种差异是由于不同供应商部署的防御措施造成的。例如,某些供应商可能部署了针对特定深度伪造攻击的防御措施。’
并继续:
‘大多数FLV API不使用反深度伪造检测;即使那些具有此类防御措施的API,其有效性也令人担忧(例如,它可能检测到高质量的合成视频,但无法检测到低质量的视频)。’
研究人员观察到,在这个方面,“真实性”是相对的:
‘即使合成视频对人类来说是不真实的,但它仍然可以以非常高的成功率绕过当前的反深度伪造检测机制。’
另一个发现是,当前的通用面部验证系统配置偏向白人男性。因此,女性和非白人身份被发现更容易绕过验证系统,这使得这些类别的客户面临更大的通过深度伪造技术进行攻击的风险。

报告发现,流行的面部活体验证API最严格、最准确地评估白人男性身份。在上表中,我们看到女性和非白人身份可以更容易地用来绕过这些系统。
该论文指出‘面部活体验证中存在偏见,这可能会给某一群人带来显著的安全风险。’
作者还对中国政府、中国一家大型航空公司、中国最大的保险公司之一以及R360(世界上最大的独角兽投资集团之一)进行了道德面部身份验证攻击,并报告了绕过这些组织使用的API的成功。

在对中国航空公司成功的身份验证绕过中,下游API要求用户“摇头”作为对潜在深度伪造材料的防御措施,但这被证明对研究人员开发的框架无效,该框架结合了六种深度伪造架构。

尽管航空公司评估用户的头部动作,但深度伪造内容仍然能够通过测试。
该论文指出,作者已联系到相关供应商,他们已承认这一工作。
作者提出了改进当前面部活体验证状态的建议,包括放弃基于单张图像的身份验证(“基于图像的FLV”),在图像和语音领域更新深度伪造检测系统,使语音身份验证中的声音与用户视频中的唇部动作同步(目前通常不这样做),以及要求用户执行当前对深度伪造系统难以复制的姿势和动作(例如,侧面视图和面部部分遮挡)。
该论文题为看到就是活着吗?重新思考深度伪造时代的面部活体验证安全性,由宾夕法尼亚州立大学、浙江大学和山东大学的七位作者共同完成,包括联合首席作者Changjiang Li和Li Wang。
核心目标
研究人员针对六家最具代表性的面部活体验证(FLV)供应商,这些供应商在研究中已被匿名化。
供应商以以下方式表示:‘BD’和‘TC’代表一家拥有最多面部相关API调用的综合供应商,以及中国最大的AI云服务市场份额;‘HW’是“拥有最多中国公共云市场份额的供应商之一”;‘CW’在计算机视觉方面增长最快,并正在获得市场领导地位;‘ST’是最大的计算机视觉供应商之一;‘iFT’是中国最大的AI软件供应商之一。
数据和架构
该项目的底层数据包括来自中国的CelebA-Spoof数据集的625,537张图像,以及密歇根州立大学2019年的SiW-M数据集的实时视频。
所有实验都在一台服务器上进行,该服务器配备了双2.40GHz Intel Xeon E5-2640 v4 CPU,运行在256 GB RAM和4TB HDD上,并配备了四个协调的1080Ti NVIDIA GPU,总共有44GB的VRAM。
六合一
论文作者开发的框架称为LiveBugger,它结合了六种最先进的深度伪造框架,针对FLV系统的四大防御措施。

LiveBugger包含多种深度伪造方法,集中在FLV系统的四大攻击向量上。
所使用的六种深度伪造框架是:牛津大学2018年的X2Face;美国学术合作ICface;2019年以色列项目FSGAN的两个变体;意大利First Order Method Model(FOMM),来自2020年初;以及北京大学与微软研究合作的FaceShifter(尽管FaceShifter不是开源的,作者不得不根据已发布的架构细节重新构建它)。
这些框架中使用的方法包括使用预渲染的视频,其中欺骗视频的对象执行从API身份验证要求中提取的例行动作,并且使用有效的“深度伪造木偶”,它将个人的实时动作转换为插入到劫持的网络摄像头流中的深度伪造流。
攻击四个向量
FLV系统中的四个攻击向量是:基于图像的FLV,它使用单个用户提供的照片作为身份验证令牌,与系统记录的面部ID进行对比;基于沉默的FLV,它要求用户上传一段视频;基于动作的FLV,它要求用户执行平台指定的动作;以及基于语音的FLV,它将用户的提示语音与系统数据库中的语音模式进行匹配。
系统的第一个挑战是确定API将披露其要求的程度,因为这些要求可以在深度伪造过程中被预测和满足。这是由LiveBugger中的Intelligence Engine处理的,它从公开的API文档和其他来源收集信息。
由于发布的要求可能由于各种原因而缺失,因此Intelligence Engine包含一个探针,根据API调用结果收集隐式信息。在研究项目中,这得到了官方离线“测试”API和志愿者提供的帮助,他们提供了自己的真实账户用于测试。
Intelligence Engine搜索是否有证据表明API当前正在使用可能在攻击中有用的方法。这种特征的示例包括连贯性检测,它检查视频中的帧是否时间连续——这是通过发送乱序的视频帧并观察是否导致身份验证失败来建立的要求。
该模块还搜索唇语检测,其中API可能会检查视频中的声音是否与用户的唇部动作同步(很少见——见下面的“结果”)。
结果
作者发现,在实验时,所有六个评估的API都没有使用连贯性检测,这使得LiveBugger中的深度伪造引擎可以简单地将合成的音频与深度伪造的视频拼接在一起,基于来自志愿者的贡献材料。
然而,一些下游应用程序(即API框架的客户)被发现已将连贯性检测添加到流程中,从而需要预先录制一个视频来规避这一点。
此外,只有少数API供应商使用唇语检测;对于大多数供应商,视频和音频被分别分析,没有功能尝试将唇部动作与提供的音频匹配。

LiveBugger针对FLV API的各种攻击向量的多样化结果。更高的数字表示攻击者使用深度伪造技术成功渗透身份验证的更高成功率。并非所有API都包含FLV的所有可能的防御措施;例如,一些API不提供任何对抗深度伪造的防御措施,而其他API不检查用户提交的视频中唇部动作和音频是否匹配。
结论
该论文的结果和对FLV API未来发展的指示是复杂的,作者将其整合成一个功能性的“漏洞架构”,以帮助FLV开发人员更好地理解其中的一些问题。
推荐指出:
‘FLV的安全风险在许多实际应用中普遍存在,因此威胁了数百万终端用户的安全。’
作者还观察到,基于动作的FLV的使用是“边缘的”,并且增加用户必须执行的动作数量“不能带来任何安全收益”。
此外,作者指出,结合语音识别和视频中的面部识别(除非API提供者开始要求唇部动作与音频同步)是没有意义的防御措施。
该论文是在FBI最近警告企业深度伪造欺诈的危险性,几乎一年后他们警告了这一技术在外国影响力行动中的使用,以及人们普遍担心实时深度伪造技术将促进对仍然信任视频身份验证安全体系的公众的新型犯罪浪潮的背景下发布的。
这些仍然是深度伪造作为身份验证攻击面的早期日子;2020年,使用深度伪造音频技术从阿联酋一家银行中非法提取了3500万美元,2019年,一位英国高管也被骗取了243,000美元。
首次发布于2022年2月23日。














