沙尚卡博士是Concentric的首席科学家和联合创始人。在加入Concentric之前,沙尚卡博士曾担任查尔斯·施瓦布数据科学和机器学习团队的管理总监。他曾是PetaSecure的联合创始人和首席科学家,后来PetaSecure被Niara收购。
就在您认为管理GenAI的数据安全风险和控制日益增长的影子GenAI已经足够的时候,出现了一个新的问题。监管和法律要求正在增加,组织很快需要证明他们如何处理与GenAI相关的风险。欧盟人工智能法(EU AI Act)是最明确的早期迹象。它明确将某些人工智能应用程序标记为“高风险”,并对透明度、问责制和人类监督施加了严格的要求。违反规定的处罚将是惩罚性的,按照全球收入的百分比计算,而不是固定罚款。对于跨国公司来说,这将人工智能治理从最佳实践转变为法律义务,违反规定将面临严重的后果。在美国,联邦贸易委员会(FTC)已经明确表示,人工智能的使用将在其防止“不公平或欺骗性行为”的职责下受到审查。这意味着公司不能隐藏在技术复杂性后面。如果客户或员工被误导关于如何管理他们的数据,或者如果人工智能存在未披露的风险,高管可能会被追究责任。早期的执法行动已经表明,监管机构愿意对那些没有适当控制就采取行动的公司进行处罚。例如,FTC对DoNotPay采取了行动,DoNotPay是一家公司,宣传了一种人工智能工具,称其为“机器人律师”,能够生成有效的法律文件和专家法律指导,发现该公司关于其人工智能能力的声明是虚假或误导性的,违反了FTC法第5节。在另一个例子中,FTC要求Everalbum公司销毁使用未经同意收集的消费者照片构建的AI模型和算法——这是对以违反用户同意和法律期望的方式使用数据的直接处罚。在州一级,California和New York正在引领一波人工智能和隐私法的浪潮,这些法律建立在现有的框架之上,例如California消费者隐私法(CCPA)。这些法律符合更广泛的隐私要求,要求企业将人工智能治理和数据隐私视为一个单一的、集成的计划。碰撞已经很明显。今天,消费者可以在GDPR或CCPA下要求将其个人信息从公司系统中删除。然而,没有类似的过程可以要求删除已经被GenAI模型摄取的数据。缺乏“从您的模型中删除我的数据”的选项很快将成为监管机构和企业之间的争议点。为什么这次合规感觉更难乍一看,监管人工智能似乎与以前的合规挑战没有太大的区别。然而,GenAI治理引入了一个新的复杂性——不可预测性。无害和有害之间的界限并不总是清晰。一个提示可以泄露专有信息,一个输出可以将机密内容带到不属于它的地方。传统的控制措施,例如DLP和权限审计,并不适用于这种速度或复杂性。对于GDPR合规,重点是隐私。任务很简单——识别个人数据,实施控制,并记录合规。然而,GenAI使事情变得复杂,因为它不仅仅是关于数据本身,还关于数据如何转换、混搭和以意想不到的方式揭示。组织面临的风险包括Copilot暴露存储在SharePoint中的敏感电子表格,员工将专有代码粘贴到ChatGPT中进行调试脚本,以及AI生成的输出包含足够的上下文以泄露机密信息。传统工具并非为处理GenAI安全风险和合规问题而设计。DLP规则忽略了细微差别。权限审计难以跟上协作。影子AI意味着活动发生在批准的工具之外。安全领导者现在可以做什么即将到来的监管挑战看起来令人生畏,但它不必让人感到不知所措。第一步是重新定义问题。GenAI不是一个新的、有风险的类别;它是一个助推器。它放大了现有的问题——例如过度的数据权限、糟糕的分类和有限的可见性——使它们更加危险。解决这些风险可以帮助满足GenAI合规要求。CISO应该优先建立坚实的基础,而不是完美的政策,以更好地满足未来的监管要求。这包括获得对人工智能使用的可见性,应用上下文感知的数据分类,并创建适应性策略,以平衡安全性和生产力。成功的组织将不是那些拥有最多规则书和命令的组织;而是那些拥有清晰的理解力,并具有满足合规要求的保护措施的组织。以下是需要遵循的关键步骤: 评估可见性。 确定GenAI的使用位置,包括影子GenAI。避免等到发生事件才发现财务已经将预测粘贴到ChatGPT中。 使用上下文进行分类。 超越正则表达式或文件名。语义分类可以帮助识别plan_final.docx是否无害或高度敏感。 收紧权限。 最小权限不应是可选的;它对于保持合规性和防止Copilot将敏感的董事会议程暴露给实习生至关重要。过度共享的文件夹是风险和未来合规违规的常见来源。 将输出视为输入。 人工智能生成的文本可以泄露的可能性与提示一样。审计和监控它如何在下游共享。 开发适应性合规策略。 今天编写的政策可能在六个月后变得无效。 对于高管来说,信息很明确。监管压力正在比许多人预期的更快地推进,等待标准稳定下来不是一个可行的计划。治理框架必须现在就建立,不仅要减少风险,还要向监管机构、客户和董事会展示人工智能的采用是故意和负责任的。
生成式人工智能(GenAI)已经从一个好奇心转变为企业技术中的核心力量。它能够按需生成文本、代码、图像和见解,使其成为员工们急切需要的工具,以便他们能够快速应对复杂问题和提高生产力。但是,这种创新和效率也带来了巨大的风险暴露。在与各个行业的高管和人工智能治理领导人进行的通话中,一个主题反复出现:数据安全已经从一个关键问题转变为他们战略的焦点,并且现在是人工智能采用的决定性挑战。与传统软件或甚至过去的机器学习浪潮不同,GenAI从根本上改变了组织内部的数据保护过程。最近的一项麻省理工学院研究发现,95%的企业GenAI试点项目都失败了。这并不是因为技术不够强大,而是因为企业缺乏必要的治理和安全框架来适当地和负责地运用GenAI。 在另一项麻省理工学院研究中,企业领导人将数据安全列为阻碍更快的人工智能采用的首要商业和安全风险。另外,“影子人工智能”(即员工未经授权使用公共工具)被广泛认为是数据风险迅速增加的驱动因素,且这种风险超出了企业的控制范围。最小权限访问是一种安全模型,其中任何实体(无论是用户、程序还是进程)仅被授予执行其合法功能所需的最低级别的访问和权限。然而,GenAI却颠覆了整个范式:最小权限本身成为一个与这些系统设计运行方式相冲突的限制。这是因为企业GenAI工具往往在拥有更多业务数据和业务背景的情况下能够带来更高的生产力提升。如果一个实体无法定义GenAI将被用于什么任务,或者它需要访问什么类型的数据,那么设置最小权限访问权限将变得不可行。此外,用户可能对某个数据集具有适当的访问权限,并合法地将其作为输入提供给GenAI工具,但是一旦该数据被吸收,用户的原始权限就不再适用。相反,它可以被模型吸收,出现在未来的输出中,或者被其他使用相同工具的人访问。由于GenAI不一定继承数据的访问控制,因此它有效地使最小权限无法执行。需要考虑的GenAI风险GenAI创建了一个巨大且不断扩张的数据表面,这从几个相互关联的方面复杂化了企业数据治理和安全。这些包括:输入泄露 – GenAI可以以原始形式吸收数据,包括文本、图像、音频、视频和结构化数据。最终用户现在可以将GenAI工具指向新的数据集,而无需太多努力或专业知识。相比之下,这些数据集可能包括销售电话录音、CRM电子邮件笔记、客户服务记录等。实际上,员工正在使用高度敏感的商业信息(包括客户个人身份信息、知识产权、财务预测,甚至源代码)来填充提示。输出暴露 – 生成模型不仅仅是消费,它们还会合成。一个提示可能会无意中从多个数据集中提取见解,并将其暴露给未经授权的用户。在某些情况下,输出甚至可以“编造”看似合法的数据,但其中包含真正敏感的训练材料片段。GenAI工具在有任务背景的情况下表现更好。因此,不仅GenAI吸收现有信息,用户还会创建新的数据来指导它,通常以详细的提示形式记录业务背景、内部流程和其他可能敏感或商业关键的信息。无监督的可访问性 – 传统的企业系统需要供应商入职和IT配置。今天,GenAI无处不在——在Microsoft Office套件、浏览器、聊天工具和SaaS平台中。员工可以立即采用它,完全绕过治理。这种无摩擦的访问推动了“影子人工智能”,每一次未经授权的GenAI使用都是企业无法控制的潜在数据外泄事件,发生在规模上且不可见。二级供应链风险 – 供应商可能看起来很安全,但它们经常依赖于子承包商,例如云主机、注释服务或第三方人工智能实验室。每个子承包商都引入了自己的最终用户许可协议(EULA)和政策。敏感的企业数据可以通过多个不可见的实体传播,然而责任仍然归于企业。例如,一个企业可能有一个供应商,之前已经完成了入职过程,但现在该供应商使用了一个GenAI工具,这可能会允许企业的数据被用作训练数据,从而产生重大下游影响。训练数据中的治理差距 – 一旦数据进入人工智能模型,控制就基本上结束了。企业无法轻松地撤回或管理其信息的使用方式。专有知识可能会持续存在并在输出中重新出现,长时间之后其源头已经被遗忘。我们还没有遇到任何允许请求删除其吸收的信息的GenAI工具,类似于《通用数据保护条例》(GDPR)或《加利福尼亚消费者隐私法》(CCPA)中所见。这种过程的实施不太可能发生,直到监管推动了这种变化。应用代码风险 – 人工智能越来越多地编写了支撑业务系统的代码。使用GenAI工具(如Microsoft Copilot)生成代码的开发人员可能会无意中引入不安全的依赖项、传播漏洞或嵌入具有冲突的开源许可证的代码。一旦部署,这些弱点就会成为软件供应链的一部分。应对GenAI风险GenAI已经嵌入到企业工作流中,因此企业的问题不再是是否采用它,而是如何负责任地采用它。没有治理的GenAI采用会带来昂贵的漏洞、监管处罚和声誉损害。但是,阻止它只会驱使员工使用未经授权的解决方案。前进的唯一途径是包裹在可见性和控制中的赋能。GenAI治理需要上下文驱动的可见性,不仅要了解企业拥有什么数据、数据存储在哪里以及谁可以访问,还要了解GenAI的使用情况。企业需要看到哪些工具正在被访问、哪些提示正在被输入,以及是否有敏感数据正在离开他们的环境。从那里,他们可以应用适当的控制来实时监控提示和输出,标记风险会话或异常数据流,阻止未经授权的工具,在提示离开之前过滤敏感提示,去识别提示中输入的敏感数据,并强制执行基于角色的AI驱动见解限制。GenAI是一个全新的企业风险和机会层。管理它需要一种思维方式,即安全不是创新上的制动器,而是使其安全的基础。