思想领袖
数据质量在AI实施中的重要性

人工智能和机器学习技术可以为各个规模的行业带来显著的益处。根据麦肯锡的一份报告,采用人工智能技术的企业将在2030年之前将现金流增加一倍。相反,不部署AI的公司将会看到其现金流减少20%。然而,这样的益处不仅仅局限于财务方面。AI可以帮助公司应对劳动力短缺。AI还可以显著提高客户体验和商业成果,使企业更加可靠。
由于AI具有这么多优势,为什么不是每个人都在采用AI?2019年,普华永道的一项调查显示,76%的公司计划使用AI来提高其商业价值。然而,只有15%的公司拥有高质量的数据来实现其商业目标。另一项来自瑞银的研究表明,66%的受访者表示,低质量的数据阻碍了他们有效部署和采用AI的能力。
调查发现,使用机器学习和AI技术的前三大挑战围绕着“数据的覆盖范围、历史和人口的准确信息”、“不完整或损坏的记录的识别”和“数据的清理和标准化”。这表明,低质量的数据是企业获得高质量AI分析的主要障碍。
为什么数据质量如此重要?
有很多原因可以解释为什么数据质量在AI实施中至关重要。以下是其中一些最重要的原因:
1. 垃圾输入,垃圾输出
很容易理解,输出严重依赖于输入。在这种情况下,如果数据集充满错误或有偏见,结果也会受到影响。最多的数据相关问题并不是关于数据的数量,而是关于您输入到AI模型中的数据质量。如果您有低质量的数据,您的AI模型将无法正常工作,无论它们有多好。
2. 并非所有AI系统都相同
当我们想到数据集时,我们通常想到定量数据。但是,也有定性数据,如视频、个人访谈、意见、图片等。在AI系统中,定量数据集是结构化的,定性数据集是非结构化的。并非所有AI模型都能处理这两种类型的数据集。因此,选择合适的数据类型以获得预期的输出至关重要。
3. 质量与数量
人们认为AI系统需要大量的数据来学习。然而,如果数据集质量高但数量较少,它将保证输出的相关性和可靠性。
4. 良好数据集的特征
良好数据集的特征可能是主观的,主要取决于AI服务的应用。然而,有一些通用的特征需要在分析数据集时寻找:
- 完整性:数据集必须完整,不能有空白或缺失的数据。每个单元格都应该有数据。
- 全面性:数据集应该尽可能全面。例如,如果您正在寻找网络威胁向量,则必须拥有所有签名配置文件和必要的信息。
- 一致性:数据集必须符合其分配的变量。例如,如果您正在建模包装盒,则选择的变量(塑料、纸张、纸板等)必须具有适当的价格数据以适应这些变量。
- 准确性:准确性是良好数据集的关键。您输入到AI模型中的所有信息必须是可靠和准确的。如果您的数据集的大部分是错误的,则输出也将不准确。
- 唯一性:这一点与一致性类似。每个数据点必须是唯一的,服务于其分配的变量。例如,您不希望塑料包装的价格被归类到其他类别中。
确保数据质量
有很多方法可以确保数据质量高,如确保数据源是可靠的。以下是一些最佳技术,以确保您为AI模型获得最佳质量的数据:
1. 数据分析
数据分析对于理解数据之前的使用至关重要。数据分析提供了对值分布、最大值、最小值、平均值和异常值的洞察。此外,它有助于识别数据中的格式不一致性。数据分析有助于了解数据集是否可用。
2. 评估数据质量
使用预建的数据质量规则库,您可以验证任何数据集。使用数据目录和内置数据工具,您可以重用这些规则来验证客户名称、电子邮件和产品代码。此外,您还可以丰富和标准化一些数据。
3. 监控和评估数据质量
科学家通常会预先计算数据质量,以便使用大多数他们想要使用的数据集。他们可以缩小范围,查看特定属性的特定问题,然后决定是否使用该属性或不使用它。
4. 数据准备
研究人员和科学家通常需要调整数据以使其适合AI建模。这些研究人员需要易于使用的工具来解析属性、转置列并从数据中计算值。
人工智能的世界不断变化。虽然每家公司都以不同的方式使用数据,但数据质量对于任何AI实施项目来说都是至关重要的。如果您拥有可靠的高质量数据,您就可以消除对大量数据集的需求,并增加成功的机会。像其他组织一样,如果您的组织正在向AI实施转型,请检查您是否拥有高质量的数据。确保您的来源是可靠的,并进行尽职调查,以检查它们是否符合您的数据要求。












