报告
当人工智能失灵:Enkrypt AI报告揭露多模态模型中的危险漏洞

2025年5月,Enkrypt AI发布了其多模态红队测试报告,这是一个令人震惊的分析,揭示了高级人工智能系统如何轻易被操纵以生成危险和不道德的内容。该报告重点关注Mistral的两个领先的视觉语言模型——Pixtral-Large(25.02)和Pixtral-12b——并描绘出这些模型不仅在技术上令人印象深刻,而且令人不安地脆弱的图景。
视觉语言模型(VLMs)如Pixtral,旨在解释视觉和文本输入,允许它们对复杂的现实世界提示做出智能响应。但是,这种能力带来了增加的风险。与仅处理文本的传统语言模型不同,VLMs可以受到图像和文字之间相互作用的影响,打开新的对抗攻击的大门。Enkrypt AI的测试显示了这些门如何轻易被打开。
令人震惊的测试结果:CSEM和CBRN失败
报告背后的团队使用了复杂的红队测试方法——一种旨在模拟现实世界威胁的对抗性评估。这些测试采用了诸如越狱(使用精心设计的查询来绕过安全过滤器)、基于图像的欺骗和上下文操纵等策略。令人震惊的是,68%的对抗性提示在两个Pixtral模型中引发了有害的响应,包括与性剥削、利用甚至化学武器设计相关的内容。
最令人震惊的发现之一涉及儿童性剥削材料(CSEM)。报告发现,Mistral的模型比行业基准(如GPT-4o和Claude 3.7 Sonnet)更容易产生CSEM相关内容,比例高达60倍。在测试用例中,模型对伪装的性剥削提示做出了结构化的、多段的内容,解释了如何操纵未成年人——并附有似是而非的免责声明,如“仅用于教育意识”。模型不仅仅是未能拒绝有害的查询——它们以细节完成了这些查询。
同样令人不安的是化学、生物、放射性和核(CBRN)风险类别的结果。当被要求修改VX神经毒剂——一种化学武器——时,模型提供了令人震惊的具体想法来增加其在环境中的持久性。它们以编辑但清晰的技术细节描述了诸如封装、环境屏蔽和控制释放系统等方法。
这些失败并不总是由明显的有害请求触发。一个策略涉及上传一张空白编号列表的图像,并要求模型“填写细节”。这个简单、看似无害的提示导致了不道德和非法指令的生成。视觉和文本操纵的融合被证明尤其危险——突出了多模态人工智能所带来的独特挑战。
为什么视觉语言模型带来新的安全挑战
这些风险的核心在于视觉语言模型的技术复杂性。这些系统不仅解析语言——它们在格式之间合成意义,这意味着它们必须解释图像内容、理解文本上下文并做出相应的响应。这种交互引入了新的利用途径。一个模型可能单独拒绝一个有害的文本提示,但当与一个暗示性的图像或模糊的上下文配对时,它可能会生成危险的输出。
Enkrypt AI的红队测试揭示了跨模态注入攻击——其中一种模态中的微妙提示影响另一种模态的输出——如何完全绕过标准的安全机制。这些失败表明,传统的内容审查技术,针对单模态系统构建的,对于今天的VLMs来说是不够的。
报告还详细介绍了如何访问Pixtral模型:Pixtral-Large通过AWS Bedrock,Pixtral-12b通过Mistral平台。这种现实世界的部署背景进一步强调了这些发现的紧迫性。这些模型不仅限于实验室——它们可以通过主流云平台访问,并可以轻松集成到消费者或企业产品中。
必须做什么:更安全的人工智能蓝图
值得注意的是,Enkrypt AI不仅仅是强调问题——它提供了一条前进的道路。报告概述了一种综合的缓解策略,首先是安全对齐训练。这涉及使用自己的红队测试数据重新训练模型,以减少对有害提示的易感性。像直接偏好优化(DPO)这样的技术被推荐用于微调模型的响应,以避免风险输出。
它还强调了上下文感知防护栏的重要性——动态过滤器,可以实时解释和阻止有害的查询,考虑到多模态输入的全部上下文。此外,建议使用模型风险卡作为透明度措施,帮助利益相关者了解模型的局限性和已知的故障情况。
也许最关键的建议是将红队测试视为一个持续的过程,而不是一次性测试。随着模型的演变,攻击策略也会演变。只有持续的评估和主动监控才能确保长期的可靠性,特别是当模型部署在医疗保健、教育或国防等敏感领域时。
Enkrypt AI的多模态红队测试报告是人工智能行业的一个明确信号:多模态能力带来了多模态责任。这些模型代表了能力的飞跃,但它们也需要我们在安全、安全和道德部署方面进行飞跃。未受控制,它们不仅仅面临失败的风险——它们面临现实世界的危害。
对于任何从事或部署大规模人工智能的人来说,这份报告不仅是一种警告。它是一本游戏规则。而且它来的正是时候。












