访谈
沃希德·贝兹丹,安全和保障智能学习实验室(SAIL)主任 – 采访系列

沃希德是新哈芬大学计算机科学和数据科学的助理教授。他也是安全和保障智能学习实验室(SAIL)的主任。
他的研究兴趣包括智能系统的安全性和保障性,人工智能安全问题的心理建模,复杂适应性系统的安全性,博弈论,多智能体系统和网络安全。
您有广泛的网络安全和人工智能安全背景。可以分享一下您如何被吸引到这两个领域的吗?
我的研究轨迹由两个核心兴趣驱动:了解事物如何破坏,以及学习人类思维的机制。我从青少年时期就开始参与网络安全研究,并围绕这个领域的经典问题建立了我的早期研究议程。在研究生阶段的几年里,我偶然发现了一个改变研究领域的罕见机会。当时,我刚刚接触到Szegedy和Goodfellow关于对抗性示例攻击的早期工作,并发现攻击机器学习的想法非常有趣。随着我深入研究这个问题,我了解到更广泛的人工智能安全和保障领域,并发现它涵盖了我许多核心兴趣,例如网络安全,认知科学,经济学和哲学。我也相信,在这个领域的研究不仅令人着迷,而且对于确保人工智能革命的长期利益和安全至关重要。
您是安全和保障智能学习实验室(SAIL)的主任,该实验室致力于为智能机器的安全和保障奠定基础。可以详细介绍一下SAIL的工作吗?
在SAIL,我和我的学生们致力于安全、人工智能和复杂系统交叉领域的问题。我们的研究的主要重点是从理论和应用两个方面研究智能系统的安全和保障。从理论方面,我们目前正在研究多智能体环境中的价值对齐问题,并开发数学工具来评估和优化人工智能代理的目标,以稳定性和鲁棒性为考量。从实践方面,我们的一些项目探索了最先进的人工智能技术(如自动驾驶汽车和算法交易)的安全漏洞,并旨在开发评估和提高这些技术对对抗性攻击的鲁棒性的技术。
我们还致力于将机器学习应用于网络安全,例如自动化渗透测试,入侵尝试的早期检测,以及从社交媒体等公开数据源收集和分析威胁情报。
您最近领导了一项关于将人工智能安全问题建模为精神病理学障碍的提议。可以解释一下这是什么吗?
这个项目解决了人工智能代理和系统日益增长的复杂性问题:在非平凡的环境中,仅通过查看强化学习代理的底层配置,很难诊断、预测和控制不安全行为。在这项工作中,我们强调了在研究这些问题时需要更高层次的抽象。受人类行为问题的科学方法的启发,我们提出了精神病理学作为模拟和分析人工智能和通用人工智能中出现的有害行为的有用高层次抽象。作为一个概念验证,我们研究了强化学习代理在学习玩经典游戏《贪吃蛇》时的奖励黑客攻击安全问题。我们展示了,如果我们在环境中添加一个“毒品”种子,代理会学习一种可以通过神经科学模型描述的次优行为,这种行为类似于成瘾。此外,我们提出了基于精神病学治疗方法的控制方法,例如使用人工生成的奖励信号作为药物治疗来修改代理的有害行为。
您是否担心自动驾驶汽车的人工智能安全问题?
自动驾驶汽车是人工智能在网络物理系统中部署的突出例子。考虑到当前机器学习技术对错误和对抗性攻击的基本易受性,我深深担心甚至半自动驾驶汽车的安全性和保障性。此外,自动驾驶领域缺乏安全标准和评估协议。然而,我仍然保持乐观。就像自然智能一样,人工智能也会容易犯错。但是,自动驾驶汽车的目标仍然可以实现,如果机器人的错误率和影响比人类驾驶员低。我们正在见证行业和学术界为解决这些问题所做的日益增长的努力,以及政府的参与。
使用贴纸或其他方法对街标进行黑客攻击可能会混淆自动驾驶汽车的计算机视觉模块。您认为这是一个多大的问题?
这些贴纸和对抗性示例一般会导致机器学习模型的鲁棒性面临根本挑战。正如乔治·E·P·博克斯所说,“所有模型都是错误的,但有些是有用的”。对抗性示例利用了模型的这种“错误性”,这是由于它们的抽象性质,以及它们所训练的数据的限制。最近,在对抗性机器学习领域的努力已经取得了巨大的进步,以提高深度学习模型对此类攻击的鲁棒性。从安全角度来看,总会有方法来欺骗机器学习模型。然而,保护机器学习模型的实际目标是提高实施此类攻击的成本,使其变得在经济上不可行。
您的重点是深度学习和深度强化学习的安全和保障特性。为什么这是如此重要的?
强化学习是应用机器学习于控制问题的主要方法,这本质上涉及环境的操作。因此,我认为基于强化学习的系统比其他机器学习方法(如分类)具有更高的风险,可能会在现实世界中造成重大损害。这个问题进一步被深度学习在强化学习中的集成所加剧,这使得强化学习能够在高度复杂的环境中应用。此外,我认为强化学习框架与人类认知的根本机制密切相关,研究其安全性和脆弱性可以带来对我们思维决策局限性的更好见解。
您认为我们是否接近实现通用人工智能(AGI)?
这是一个很难回答的问题。我认为我们目前拥有了一些可以促进AGI出现的建筑块。然而,可能需要几年甚至几十年来改进这些建筑块,并提高训练和维护这些建筑块的成本效率。在接下来的几年里,我们的代理将以迅速增长的速度变得更加智能。我不认为AGI的出现会以一个科学上有效的标题的形式宣布,而是通过逐渐的进步。另外,我认为我们仍然没有一个被广泛接受的方法来测试和检测AGI的存在,这可能会延迟我们对AGI首次实例的认识。
如何在能够独立思考和可能比人类更智能的AGI系统中保持安全性?
我认为智能行为的统一理论是经济学和研究代理如何行动和相互作用以实现其目标的学科。人类的决策和行为由其目标、信息和可用资源决定。社会和协作努力是从其成员的利益中产生的。另一个例子是刑法,它通过将高成本附加到可能损害社会的行为来阻止某些决策。在同样的方式中,我相信控制激励和资源可以使人类和AGI实例之间出现一种平衡状态。目前,人工智能安全社区正在研究这个论点,称为价值对齐问题。
您密切关注的一个领域是反恐怖主义。您是否担心恐怖分子接管人工智能或AGI系统?
人工智能技术的滥用有许多令人担忧的问题。在恐怖主义行动中,主要问题是恐怖分子开发和实施自主攻击的便捷性。越来越多的同事正在积极警告自动化武器的风险(请参阅https://autonomousweapons.org/)。人工智能启用的武器的一个主要问题是控制底层技术的困难:人工智能处于开源研究的前沿,任何拥有互联网和消费级硬件的人都可以开发有害的人工智能系统。我怀疑自动化武器的出现是不可避免的,并且相信很快就会需要新的技术解决方案来对抗此类武器。这可能会导致一个猫鼠游戏,推动人工智能启用的武器的演变,这可能会在长期内带来严重的生存风险。
我们如何保护人工智能系统免受这些对抗性代理的影响?
第一步也是最重要的一步是教育:所有人工智能工程师和从业者都需要了解人工智能技术的漏洞,并在设计和实施系统时考虑相关风险。至于更技术性的建议,有各种提案和解决方案可以采用。例如,在对抗性环境中训练机器学习代理可以提高它们对规避和策略操纵攻击的鲁棒性(例如,请参阅我的题为“无论什么不会杀死深度强化学习,都会使其更强壮”的论文)。另一个解决方案是直接在代理的架构中考虑对抗性攻击的风险(例如,基于贝叶斯的风险建模方法)。然而,在这个领域存在一个重大差距,即缺乏普遍的度量和方法来评估人工智能代理对对抗性攻击的鲁棒性。当前的解决方案大多是特定于某个问题的,无法提供对所有类型攻击的通用鲁棒性度量。
您是否还有其他想分享的关于这些主题的内容?
2014年,斯库利等人在NeurIPS会议上发表了一篇题为“机器学习:技术债的高利息信用卡”的论文。即使在过去几年中,领域取得了所有进步,这个陈述仍然没有失去其有效性。当前的人工智能和机器学习状态简直令人惊叹,但我们仍然需要填补人工智能基础和工程维度中的许多重大差距。我认为这是我们对话中最重要的收获。当然,我并不想阻止人工智能技术的商业采用,但只是希望工程社区能够在决策中考虑到当前人工智能技术的风险和局限性。
我非常喜欢学习关于不同类型人工智能系统的安全和保障挑战。这确实是个人,企业和政府需要意识到的问题。希望了解更多的读者应该访问安全和保障智能学习实验室(SAIL)。












