思想领袖
整理混乱的数据:AI如何改变游戏规则

我们正在被数据淹没。每个平台、智能手表和智能手机都将我们的生活分解成可量化的碎片,但大部分数据仍然是无序和不可用的。
公司知道这一点,这就是为什么科技巨头Meta 投资了14亿美元购买数据标注初创公司Scale AI的49%股份,这是一次精心计算和战略性的举动,旨在为其AI模型获取高质量的训练数据。
大型语言模型的可靠性完全依赖于输入数据的质量——简而言之,“垃圾输入,垃圾输出”。然而,今天公司面临的真正挑战是将大量原始信息转化为可行的数据。
解决方案可能就在眼前:AI本身可以通过生成绕过数据标注的策略或浏览无尽电子表格的方法,将混乱转化为可用的、人类的智慧。
数据变得混乱:公司的隐性成本
根据 Gartner研究,2020年的数据显示,数据质量差每年会使组织损失至少1290万美元,影响生产力并导致决策不当和报告不准确。
混乱的数据在医疗保健等领域的后果更为明显。健康记录、账单详细信息和系统间的不匹配数据可能导致误诊、治疗错误和资源分配效率低下。从长远来看,这会增加成本并削弱人们对这些系统的信任。
同时,在物流领域,供应商和分销商之间的不匹配数据可能导致延迟或库存短缺。一个错误的交货地址或过时的库存记录可能会在整个供应链中产生连锁反应,导致错过截止日期和不满意的客户。
“通过能够预测或了解可能发生的事情[沿着路线]——基于过去的综合数据——您可以真正消除这些低效率,” Asparuh Koev,物流AI公司 Transmetrics的CEO,在与 Unite AI的对话中指出。
更为实际的来说,混乱的数据是昂贵的。1-10-100规则说明了这一点:在数据输入时检查数据的成本为1美元,事后清理数据的成本为10美元,如果什么都不做,成本将达到100美元。
AI驱动平台带来的变化
随着企业努力应对日益增长的“脏”数据量,他们正在转向AI寻求解决方案。新兴的AI驱动平台现在自动化了数据清理过程,确保了成本效益和提高了准确性。
Robert Giardina, Claritype的创始人,解释了AI的过程:
“它将数据转换为一种共同的格式:过程的一部分是将每个数据转换为适合业务的规范格式。”
Claritype的AI超出了简单的标准化。该平台的监督修复允许组织跨系统边界寻找答案,打破了数据孤岛。
“那些曾经被隔离的系统现在每个都持有一个答案的片段,用于回答整个业务的紧迫问题,” Giardina告诉 Unite AI。
例如,如果一个关键供应商受到交货延迟的影响,只有通过连接供应商、订单和客户历史才能确定哪些顶级客户应该首先被通知延迟。
“我们的最终目标是将这种相互连接的思维扩展到整个企业的每个数据碎片,以便我们可以使每个问题都容易和立即回答,” Giardina说。
这种相互连接的思维代表了公司今天正在发生的更广泛的思维方式转变,即从 临时的数据清理转向系统化的数据治理。公司不再将数据质量视为一次性解决方案,而是开发了结构化的流程以确保所有系统的一致性和可靠性。
数据治理现在被认为是一种有价值的商业流程,而不仅仅是IT任务。通过将数据管理融入其整体战略中,公司可以做出更好的决策并从其数据中获得更有意义的见解。
AI如何清理数据及其面临的挑战
过度依赖AI可能是危险的。对于Giardina来说,“令人担忧的自动数据转换是那些超出了标准化进入猜测的转换。”
例如,某些缩写可能很容易被误解。”International Business Machines, Inc.” 或 “I.B.M.” 通常会被转换为 “IBM”,但如果转换是自动的,并且 “I.B.” 被错误地转换为 “IBM”,这可能会对两家公司都造成重大问题。
缺失和不准确的数据是最常见的问题,而仅仅依赖AI根据上下文填补空白可能很容易适得其反。正如Giardina所指出的,“当影响是显著的,我们需要人类来批准每个猜测。”
平衡自动化与人类洞察
混乱的数据凸显了组织处理信息的根本缺陷。为了推进和改善决策,企业必须停止将数据视为纯粹的技术问题,并转向将人类专业知识、伦理意识和长期战略视野结合起来的治理模型。
更干净的数据会产生更有效的AI,这反过来又有助于提高数据质量;这种相互强化的循环是有前途的,但也提醒我们,仅仅依靠自动化是无法解决我们的混乱数据问题的。这种潜力只能通过将算法精度与人类判断和意识到它可能引入的偏见相结合来实现,确保系统的透明度和可信度。
Alex Sandoval,制造业智能AI公司 Allie AI的CEO,也强调了生成式AI副驾驶不仅仅依赖算法,还依赖于工厂逻辑中的人类流畅度。
“今天最成功的部署不仅仅是关于用大量可编程逻辑控制器(PLC)数据、操作员笔记和合规协议来喂养模型。它们依赖于一种新的前线工人:一种可以在机器行为和数字直觉之间进行翻译的工人,”他总结道。












