思想领袖
人工智能的数据困境:隐私、监管和道德人工智能的未来

人工智能驱动的解决方案正在各个行业、服务和产品中被广泛采用。然而,其有效性完全取决于训练数据的质量,这是数据集创建过程中经常被误解或忽视的方面。
随着数据保护机构加强对人工智能技术与隐私和数据保护法规的遵守情况的审查,公司面临着越来越大的压力,需要以合规和道德的方式获取、注释和改进数据集。
是否真正存在一种道德的方法来构建人工智能数据集?公司面临的最大道德挑战是什么,它们如何解决这些挑战?法律框架的演变如何影响训练数据的可用性和使用?让我们探讨这些问题。
数据隐私和人工智能
人工智能的本质要求大量的个人数据来执行任务。这引发了人们对收集、保存和使用这些信息的担忧。世界各地的许多法律都规范和限制了个人数据的使用,从欧洲的GDPR和新引入的AI法案到美国的HIPAA,它在医疗行业规范了对患者数据的访问。
世界各地数据保护法律的严格程度参考 / DLA Piper
例如,目前美国有14个州拥有全面的数据隐私法,另外6个州将在2025年和2026年初实施新的法规。新政府已经表明了对数据隐私执法的态度转变,重点是促进创新而不是施加限制。这种转变包括撤销之前关于人工智能的行政命令并引入新的指令来指导其开发和应用。
数据保护立法在各个国家不断演变:在欧洲,法律更加严格,而在亚洲或非洲,法律则相对宽松。
然而,个人可识别信息(PII)——例如面部图像、官方文件如护照或其他敏感的个人数据——在大多数国家都受到一定程度的限制。根据联合国贸易和发展会议的数据,收集、使用和与第三方共享个人信息而未经消费者同意是一个主要问题,137个国家中有194个国家都有法规来确保数据保护和隐私。因此,大多数全球公司都采取了广泛的预防措施,以避免使用个人可识别信息进行模型训练,因为像欧盟这样的法规严格禁止此类做法,除非在一些高度监管的领域,如执法。
随着时间的推移,数据保护法变得更加全面和全球执行。公司适应其做法以避免法律挑战并满足新出现的法律和道德要求。
公司如何获取数据
研究数据保护问题时,首先需要了解公司从哪里获取这些数据。主要有三种数据来源。
- 数据收集
这种方法使得从众包平台、媒体库和开源数据集中收集数据成为可能。
需要注意的是,公共媒体库受不同许可协议的约束。即使是商业使用许可,也经常明确规定内容不能用于模型训练。这些期望因平台而异,需要企业确认其使用内容的能力以满足其需求。
即使人工智能公司合法获取内容,它们仍可能面临一些问题。人工智能模型训练的快速发展远远超过了法律框架的发展,这意味着围绕人工智能训练数据的规则和法规仍在演变。因此,公司必须了解法律发展并仔细审查许可协议,然后再使用库存内容进行人工智能训练。
- 数据创建
数据集准备中最安全的方法之一是创建独特的内容,例如在受控环境中拍摄人们,如工作室或户外地点。在参与之前,个人签署同意书,同意使用其个人可识别信息,具体说明正在收集什么数据、如何和在哪里使用,以及谁将能够访问这些数据。这确保了完全的法律保护,并让公司相信它们不会面临非法使用数据的诉讼。
这种方法的主要缺点是其成本,特别是当数据用于边缘案例或大规模项目时。然而,大公司和企业越来越多地使用这种方法,主要有两个原因。首先,它确保了所有标准和法律法规的完全遵守。其次,它为公司提供了完全根据其特定场景和需求量身定制的数据,保证了模型训练中的最高准确性。
- 合成数据生成
使用软件工具根据给定的场景生成图像、文本或视频。然而,合成数据有局限性:它是根据预定义的参数生成的,缺乏真实数据的自然变异性。
这种缺乏可能会对人工智能模型产生负面影响。虽然这并非在所有情况下都相关,也并不总是发生,但仍然需要记住“模型崩溃”——人工智能模型过度依赖合成数据,从而导致模型退化,产生低质量输出的现象。
合成数据仍然可以在基本任务中发挥作用,例如识别一般模式、识别物体或区分基本的视觉元素,如面部。
然而,它并不是从头开始训练模型或处理罕见或高度特定场景的最佳选择。
最能说明这种情况的是驾驶舱环境,例如驾驶员分心于孩子、有人在驾驶时显得疲劳,或者甚至是鲁莽驾驶的实例。这些数据点在公共数据集中通常不可用——也不应该如此,因为它们涉及私人环境中的真实个人。由于人工智能模型依赖训练数据来生成合成输出,因此它们难以准确地表示从未遇到过的场景。
当合成数据失败时,通过受控环境中真实演员收集的数据成为解决方案。
数据解决方案提供商,如 Keymakr,在汽车中安装摄像头,雇佣演员,并记录诸如照顾婴儿、从瓶子中喝水或表现出疲劳的迹象等行为。演员签署合同,明确同意使用他们的数据进行人工智能训练,确保遵守隐私法规。
数据集创建过程中的责任
过程中的每个参与者,从客户到注释公司,都有在其协议中概述的特定责任。第一步是建立合同,详细说明关系的性质,包括保密和知识产权的条款。
让我们考虑一下使用数据的第一种选择,即从头开始创建。知识产权规定,提供商创建的任何数据都属于雇佣公司,这意味着它是代表他们创建的。同时,这也意味着提供商必须确保数据是合法获取和使用的。
作为数据解决方案公司,Keymakr 通过首先检查数据创建的管辖权、从所有参与者那里获得适当的同意以及确保数据可以合法用于人工智能训练来确保数据合规性。
还需要注意的是,一旦数据用于人工智能模型训练,就几乎不可能确定哪些特定的数据贡献了模型的输出,因为人工智能将所有数据融合在一起。因此,特定的输出并不倾向于成为其输出,特别是在讨论数百万图像时。
由于这一领域的快速发展,仍在建立明确的指南来分配责任。这与自动驾驶汽车的复杂性类似,在那里,关于责任的问题——无论是驾驶员、制造商还是软件公司——仍需要明确的分配。
在其他情况下,当注释提供商收到一个数据集进行注释时,它假设客户已经合法地获取了数据。如果有明显的迹象表明数据是非法获取的,提供商必须报告。然而,这样的明显案例极为罕见。
还需要注意的是,大公司、企业和重视其声誉的品牌在获取数据来源时非常谨慎,即使数据不是从头开始创建的,而是来自其他合法来源。
总之,每个参与者的责任取决于协议。可以将这个过程视为更广泛的“可持续性链”的一部分,每个参与者在维护法律和道德标准方面都扮演着至关重要的角色。
关于人工智能开发后端的误解
关于人工智能开发的一个主要误解是,人工智能模型的工作方式与搜索引擎类似,通过聚合信息来呈现给用户基于学习的知识。然而,人工智能模型,尤其是语言模型,通常基于概率而不是真正的理解。它们根据以前数据中看到的模式预测单词或术语,使用统计可能性。人工智能不“知道”任何事情;它推断、猜测并调整概率。
此外,许多人认为训练人工智能需要大量的数据集,但人工智能需要识别的内容——如狗、猫或人类——已经很好地建立起来。现在的重点是提高准确性和改进模型,而不是从头开始。今天的人工智能开发的大部分内容围绕着填补准确性的最后小缺口,而不是从头开始。
道德挑战和欧盟人工智能法案对全球人工智能市场的影响
讨论数据的道德和合法性时,清楚地了解什么构成了“道德”人工智能也很重要。
公司今天在人工智能领域面临的最大道德挑战是确定什么是人工智能可以或不可以做的。有一个广泛的共识,即道德人工智能应该帮助人类而不是伤害人类,并避免欺骗。然而,人工智能系统可能会犯错误或“产生幻觉”,这挑战了确定这些错误是否构成虚假信息或伤害的能力。
人工智能伦理是一个主要的辩论话题,像联合国教科文组织这样的组织正在参与其中——围绕审计和追溯的关键原则 审计和追溯。
数据访问和人工智能训练的法律框架在塑造人工智能的道德格局方面发挥着重要作用。对数据使用有较少限制的国家可以更容易地获取训练数据,而对数据法律更严格的国家则限制了人工智能训练的数据可用性。
例如,欧洲已经采用了人工智能法案,而美国已经撤销了许多人工智能法规,这两个地区的方法形成了鲜明的对比,表明了当前的全球格局。
欧盟的人工智能法案对在欧洲运营的公司产生了重大影响。它施加了严格的监管框架,使得企业难以使用或开发某些人工智能模型。公司必须获得特定的许可证才能使用某些技术,在许多情况下,法规有效地使得小型企业难以遵守这些规则。
因此,一些初创公司可能会选择离开欧洲或完全避免在欧洲运营,类似于加密货币法规的影响。能够投资满足合规性要求的资源的大公司可能会适应,但该法案可能会将人工智能创新驱逐出欧洲,转向监管较少的市场,如美国或以色列。
美国决定投资人工智能开发并减少限制,也可能带来弊端,但也会吸引更多样化的市场。虽然欧盟专注于安全和监管合规,但美国可能会培养更多冒险和开创性的实验。













