AI 模型与平台

人工智能中的数据单一文化:对多样性和创新性的威胁

mm
将 Unite.AI 添加到您在 Google 上的首选来源

人工智能正在改变世界,从改变医疗保健到改革教育。它正在解决长期存在的挑战,并开启我们从未想象过的可能性。数据是这一革命的核心——驱动每个人工智能模型的燃料。它使这些系统能够进行预测、发现模式,并提供影响我们日常生活的解决方案。

但是,虽然数据的丰富性推动了创新,但统一数据集的主导地位——通常被称为数据单一文化——对人工智能开发中的多样性和创造力构成了重大风险。这就像农业单一文化一样,在大片土地上种植同一种作物,使生态系统脆弱,容易受到害虫和疾病的影响。在人工智能中,依赖统一数据集会产生僵化、有偏见且常常不可靠的模型。

本文深入探讨了数据单一文化的概念,研究了它们是什么、为什么存在、带来的风险以及我们可以采取的措施来构建更智能、更公平、更具包容性的人工智能系统。

理解数据单一文化

数据单一文化发生在单一数据集或狭窄的数据源主导人工智能系统的训练时。面部识别是人工智能中数据单一文化的著名例子。 研究 表明,在MIT媒体实验室发现,主要训练在浅肤色个体图像上的模型在处理深肤色面部时遇到困难。对于深肤色女性,错误率达到34.7%,而浅肤色男性只有0.8%。这些结果突出了训练数据中缺乏多样性的影响。

类似的问题出现在其他领域。例如,大型语言模型(LLM)如OpenAI的GPT和Google的Bard主要训练在英语内容上,主要来源于西方背景。这种缺乏多样性使得它们在理解其他地区的语言和文化细微差别方面不够准确。像印度这样的国家正在 开发 更好地反映本地语言和文化价值的LLM。

这种问题可能非常关键,特别是在医疗保健等领域。例如,一种主要训练在欧洲人口数据上的医疗诊断工具可能在具有不同基因和环境因素的地区表现不佳。

数据单一文化的来源

人工智能中的数据单一文化是由于多种原因造成的。像 ImageNetCOCO 这样的流行数据集是巨大的、易于访问的,并被广泛使用。但是,它们往往反映出狭隘的西方中心主义观点。收集多样化的数据并不便宜,因此许多小型组织依赖这些现有的数据集。这一依赖关系加剧了多样性的缺乏。

标准化也是一个关键因素。研究人员经常使用广泛认可的数据集来比较他们的结果,意外地阻碍了对替代来源的探索。这一趋势创造了一个反馈循环,大家都在优化相同的基准,而不是解决现实世界的问题。

有时,这些问题是由于疏忽造成的。数据集的创建者可能无意中忽略了某些群体、语言或地区。例如,像Siri这样的语音助手的早期版本无法很好地处理非西方口音。原因是开发人员没有包含足够来自这些地区的数据。这些疏忽会产生无法满足全球受众需求的工具。

为什么重要

随着人工智能在决策中扮演更重要的角色,数据单一文化可能会产生现实世界的后果。人工智能模型可以强化歧视,当它们从训练数据中继承偏见时。一个 招聘算法 训练在男性主导行业的数据上,可能会无意中偏向男性候选人,排除合格的女性候选人。

文化代表也是一个挑战。推荐系统,如Netflix和Spotify,经常 偏爱 西方偏好,边缘化其他文化的内容。这种歧视限制了用户体验,并通过保持想法狭隘和重复,扼杀了创新。

人工智能系统也可能变得脆弱,当它们训练在有限的数据上时。在COVID-19大流行期间,训练在大流行前数据上的医疗模型 未能 适应全球健康危机的复杂性。这种僵化使得人工智能系统在面对意外情况时变得不那么有用。

数据单一文化还可能导致道德和法律问题。像Twitter和Apple这样的公司面临公众对偏见算法的批评。Twitter的图像裁剪工具被指控 种族偏见,而Apple Card的信用算法 据称 为女性提供了较低的信用额度。这些争议损害了对产品的信任,并提出了关于人工智能开发中责任的疑问。

如何解决数据单一文化

解决数据单一文化的问题需要扩大用于训练人工智能系统的数据范围。这一任务需要开发能够使收集多样化数据更容易的工具和技术。像 Mozilla的Common Voice 这样的项目从世界各地的人们收集语音样本,创建了一个更丰富的数据集,包含各种口音和语言——同样,像UNESCO的数据用于人工智能这样的倡议专注于包含代表性不足的社区。

建立道德准则也是一个关键步骤。像 多伦多宣言 这样的框架促进了透明度和包容性,以确保人工智能系统在设计上是公平的。像 GDPR 法规启发的强大的数据治理政策也可以带来巨大的变化。它们需要明确的数据来源文档,并要求组织对确保多样性负责。

开源平台也可以带来改变。例如,hugging Face 的数据集仓库允许研究人员访问和共享多样化的数据。这种协作模型促进了人工智能生态系统,减少了对狭窄数据集的依赖。透明度也起着重要作用。使用 可解释人工智能 系统并实施定期检查可以帮助识别和纠正偏见。这一解释对于保持模型公平和适应性至关重要。

构建多样化的团队可能是最有影响力和最直接的步骤。具有多样背景的团队更擅长发现数据中的盲点,并设计适用于更广泛用户群的系统。包容性的团队带来更好的结果,使人工智能更加明智和公平。

结论

人工智能具有不可思议的潜力,但其有效性取决于其数据质量。数据单一文化限制了这一潜力,产生了有偏见、僵化且与现实世界需求脱节的系统。为了克服这些挑战,开发人员、政府和社区必须合作,以多样化数据集、实施道德实践和培养包容性的团队。
通过直接解决这些问题,我们可以创建更智能、更公平的人工智能,反映出它旨在服务的世界的多样性。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。