思想领袖

当 AI 的“知识”已经 50 年了:您不能忽视的合规风险

mm
将 Unite.AI 添加到您在 Google 上的首选来源

虚假 AI 见解的问题是一个紧迫的挑战,因为企业越来越多地使用生成式工具。尽管人们对 AI 采用的热情很高,但也有一股批评的潮流。批评者经常指出 AI 输出中似乎随机、不可预测的不准确性,这些不准确性削弱了 AI 的价值——甚至可能对人类造成真正的危害,特别是在医疗保健和交通等领域,错误的输出可能导致从错误的处方到列车相撞等一切后果。

这些不准确性通常被归因于 AI 的“幻觉”——即 AI 生成一个“最佳猜测”答案,并以与“真实”答案相同的信心传达给用户,而不是告知用户其知识或能力的缺陷。幻觉可能很难被立即发现——但还有一个更为严重的问题,即更难以检测出来的问题。

数据质量债务:AI 的阿喀琉斯之踵

当 AI 系统从过时、不完整或不准确的数据中获取信息时,会产生错误的输出,但这些输出不那么容易被立即发现。例如,您可能会要求 AI 确定某种医疗条件的症状,并得到一个基于 50 年前论文而不是当前研究的答案。结果不太可能显得明显地、可笑地错误——但这种最初的可信外表对患者和医疗保健提供者都构成了真正的风险。

同样的情况也发生在其他行业——如果输入到 AI 模型中的数据包含旧的、过时的或不完整的信息,则错误输出的风险很高。随着更多公司将 AI 集成到业务关键流程中,使用不良数据管理的数据得出错误结论的风险也越来越大。

面向监管机构的准确性

这不仅仅是一个日常运营的问题——它也是一个重大的合规挑战。监管要求正在迅速演变,以解决人们对不准确的 AI 的担忧。例如,已经有一些针对 AI 的早期监管行动;例如,意大利曾暂时禁止 ChatGPT 因为对隐私的担忧,而欧盟数据保护委员会则启动了一项专门的任务力,以协调对 ChatGPT 的潜在执法行动

最能说明监管变化的例子是欧盟 AI 法案的通过,这是世界上第一个针对 AI 的全面法律框架。该法案根据 AI 系统的风险水平制定了义务,从“不可接受的风险”系统(被禁止)到“高风险”系统(面临严格的透明度、数据质量、治理和人工监督要求)。

欧盟 AI 法案的重要性不在于其雄心壮志的范围,而在于它所设定的先例。监管机构正在明确表示,AI 将受到具有约束力和可执行的规则的约束,组织必须将合规性和透明度视为 AI 采用的一个组成部分,而不是事后补充的内容。

该法案的适用范围很广,可能会影响大量的 AI 开发。其核心是确保 AI 的安全性,同时尊重基本权利和价值。在这个新原则体系中,诊断 AI 不准确性的潜在来源,包括输入模型的数据和数据集、模型的不透明度和访问权限、系统设计和使用。AI 解决方案是这三者的构建——任何一个方面的问题都可能导致负面结果。此外,用于设计、开发、部署和运行 AI 的数据可能主要由业务记录组成,这些记录本身也受各种合规性要求的约束。

换句话说,围绕 AI 的监管环境变得越来越严格——这对于数据输入和数据输出都一样,即使后者更常见。然而,监管环境的变化并不是唯一的挑战;确保高质量的数据输入对于 AI 的准确性和可靠性也至关重要。

五步骤:为 AI 提供合规、当前、相关的数据

为了解决这两个挑战——确保数据处理的合规性和高质量的输入以实现高质量的输出——企业需要对训练和推理数据拥有控制权。不幸的是,这是许多企业仍然缺乏的东西。

至少,组织应该将其更广泛的合规性和治理计划应用于 AI 计划。他们需要开始捕获和维护有关输入到 AI 模型中的数据的适当记录,以及模型和系统的设计、通过 AI 生成的决策和内容。

然而,组织也需要超越这一点,确保他们对所有可能在 AI 部署中使用的数据拥有完全的控制权,无论是用于初始训练还是“实时”工作。这需要一个高质量的数据管理和存储策略,确保所有相关数据都被智能地收集、清理、存储、分类和授权。为了实现这一点,组织需要考虑四个关键步骤:

1. 数据血统和来源

这包括维护数据的来源、起源、所有权以及在其生命周期中元数据的任何更改(如果允许)的记录。它还意味着维护丰富的元数据和所有数据源自的底层文档或工件。

2. 数据真实性

这需要维护所有数据的明确所有权链,存储对象的本机形式,并对接收到的对象进行哈希以证明数据保持不变。此外,组织必须为每个对象维护完整的审计历史记录,并记录所有更改和事件。

3. 数据分类

确定数据集或数据类型的性质很重要。组织需要能够管理结构化数据、半结构化数据和结构化数据集。为每个类分配一个唯一的模式可以让组织在没有单一固定本体的情况下管理多样化的数据集——避免不必要地操纵数据以适应不灵活的数据结构。

4. 数据规范化

为元数据建立共同的定义和格式对于分析和 AI 解决方案至关重要。明确定义的模式是重要的元素,沿 với可以转换或映射数据以保持一致、规范化的相关数据视图的工具。

5. 数据授权

企业需要基于用户或系统配置文件的粒度化授权控制,包括对象或字段级别。这意味着正确的数据可供有权访问它的用户和系统使用,同时限制或限制那些无权访问的人的访问。

有了这些关键要素,企业将能够确保输入到 AI 模型中的数据既高质量又合规。AI 将在各个行业推动改进和效率——但要实现这一点,坚实的数据基础是必不可少的。AI 将推动各个行业的改进和效率——但要实现这一点,坚实的数据基础是必不可少的。有了这些关键要素,企业将能够确保输入到 AI 模型中的数据既高质量又合规。AI 会在各个行业推动改进和效率——但要实现这一点,坚实的数据基础是必不可少的。ng 或限制那些不应该的人的访问,企业将能够确保输入到 AI 模型中的数据既高质量又合规。AI 会在各个行业推动改进和效率——但要实现这一点,坚实的数据基础是必不可少的。

乔治·齐哈纳斯是Archive360的合规副总裁和副总法律顾问。乔治是一位高管领导者,具有对复杂技术、银行法规、数据管理和风险管理的深刻理解。他与现有和潜在客户密切合作,以确保复杂的数据管理和合规要求得到满足,符合Archive360的解决方案。