思想领袖

人工智能开发中脏数据的高昂成本

mm
将 Unite.AI 添加到您在 Google 上的首选来源

人工智能开发中的现代黄金热潮正在如火如荼地进行。根据微软和领英的2024年工作趋势指数,超过40%的商业领袖预计在未来几年内完全使用人工智能(AI)重新设计他们的业务流程。这一地震般的变化不仅仅是一种技术升级,它是商业运营、决策和与客户互动方式的根本转变。这种快速发展正在推动对数据和第一方数据管理工具的需求。根据Forrester的说法,令人惊讶的92%的技术领袖计划在2024年增加他们的数据管理和AI预算。

(MSFT )

在最新的麦肯锡全球AI调查中,65%的受访者表示他们的组织正在定期使用生成式AI技术。虽然这种采用标志着一个重大的飞跃,但它也凸显了一个关键挑战:喂养这些AI系统的数据质量。在一个有效的AI只有在其训练数据的基础上才是好的行业中, 可靠和准确的数据变得越来越难以找到。

脏数据的高昂成本

脏数据并不是一个新问题,但其影响在AI时代被放大。早在2017年,麻省理工学院(MIT)的一项研究估计,脏数据使公司损失了惊人的15%至25%的收入。2021年,Gartner估计,Poor数据使组织平均每年损失12.9百万美元。

脏数据——不完整、不准确或不一致的数据——会对AI系统产生连锁效应。当AI模型在低质量数据上训练时,产生的见解和预测从根本上是有缺陷的。这不仅会破坏AI应用的有效性,还会对依赖这些技术进行关键决策的企业构成重大风险。

这给企业数据科学团队带来了巨大的头痛,他们不得不越来越多地专注于有限的资源来清理和组织数据。在DBT最近的一份工程报告中,57%的数据科学专业人员将Poor数据质量列为他们工作中的主要问题。

对AI模型的影响

脏数据对AI开发的影响表现为三种主要方式:

  1. 降低准确性和可靠性:AI模型在数据中发现模式和关联时会蓬勃发展。当输入数据被污染时,模型会产生不可靠的输出;这被广泛称为“AI幻觉”。这可能会导致误导性的策略、产品失败和客户信任丧失。
  2. 偏见放大:脏数据通常包含偏见,如果不加控制,会被刻入AI算法中。这可能会导致歧视性做法,特别是在招聘、贷款和执法等敏感领域。例如,如果AI招聘工具是在有偏见的历史招聘数据上训练的,它可能会不公平地偏爱某些人群。
  3. 增加运营成本:有缺陷的AI系统需要不断地调整和重新训练,这会消耗额外的时间和资源。公司可能会发现自己陷入了一个不断修复错误的循环中,而不是创新和改进。

即将到来的数据末日

“我们正迅速接近一个‘临界点’——非人类生成的内容将远远超过人类生成的内容数量。AI本身的进步为数据清理和验证提供了新的工具。然而,网络上AI生成的内容数量正在呈指数级增长。

随着更多的AI生成内容被推送到网络,并且这些内容是由LLM训练的AI生成的内容,我们正在面临一个未来,第一方和可信数据将成为稀缺和宝贵的商品。

数据稀释的挑战

AI生成内容的泛滥带来了几个重大的行业挑战:

  • 质量控制:区分人类生成和AI生成的数据变得越来越困难,使得确保用于训练AI模型的数据的质量和可靠性更加困难。
  • 知识产权问题:随着AI模型无意中抓取和学习AI生成的内容,关于数据所有权和权利的问题出现,可能会导致法律纠纷。
  • 道德影响:数据起源的缺乏透明度可能会导致道德问题,例如虚假信息的传播或偏见的强化。

数据即服务成为基本

数据即服务(DaaS)解决方案正在被越来越多地用于补充和增强第一方数据以用于训练目的。DaaS的真正价值在于数据本身经过标准化、清理和评估,以适应不同信度和商业应用场景,以及标准化流程以适应系统对数据的消化。随着该行业的成熟,我预计我们将开始看到数据行业的标准化。我们已经在零售媒体领域看到这种对统一性的推动。

随着AI继续渗透到各个行业,数据质量的重要性将会更加突出。优先考虑清洁数据的公司将获得竞争优势,而忽视它的公司将迅速落后。

AI开发中脏数据的高昂成本是一个不能被忽视的问题。Poor数据质量破坏了AI系统的基础,导致有缺陷的见解、增加的成本和潜在的道德陷阱。通过采用全面数据管理策略和培养重视数据完整性的文化,组织可以减轻这些风险。

在数据成为新石油的时代,确保其纯度不仅是一种技术必要性,也是一种战略性必备。今天投资于清洁数据的企业将是明天创新前沿的领导者。

艾利·古德曼(Eli Goodman)是Datos(一家Semsrush公司)的CEO和联合创始人。拥有超过25年的数字和数据空间经验,艾利曾在多家替代数据公司担任领导职务,包括在ComScore公司任职9年。