思想领袖
95% 的 AI 试点项目失败,数据质量是罪魁祸首

麻省理工学院的研究带来了一个令人清醒的现实检查:95% 的 AI 项目永远不会超越试点阶段。尽管在董事会中,人们对 AI 的变革潜力有很多讨论,但大多数项目都无法产生有意义的商业价值。
传统的智慧归咎于弱模型、有限的计算能力或稀缺的技术人才。但是,通过与数百家企业合作的经验告诉我们一个不同的故事。真正的瓶颈不是算法,而是数据。糟糕或不一致的数据悄悄地破坏了甚至最先进的 AI 努力,将创新投资变成沉没成本。
糟糕数据的隐性成本
在企业中,糟糕的数据往往在 AI 项目扩展之前就将其摧毁。考虑一个熟悉的场景:财富 500公司花费数月时间构建一个客户流失预测模型。试点项目看起来很强大 —— 准确且充满希望。但是,当它转向生产时,裂缝开始出现。
管道在最糟糕的时刻破裂。关键作业延迟数小时,错过了干预窗口。表格突然在未经宣布的上游更改后丢失行。API 凭证在没有警告的情况下过期,切断了必需的数据源。干净的试点数据变成了一个不新鲜或不一致的输入流。
涟漪效应是毁灭性的。预测不可靠,利益相关者失去信任。项目被搁置,不是因为算法失败,而是因为基础设施崩溃。数月的开发、数百万美元的投资和无数工程小时都消失了。
这不是一个孤立的案例。根据 Pantomath 的 2024 年数据可观察性报告 ,94% 的组织表示管道问题侵蚀了他们对数据的信任,90% 的组织需要数小时甚至数周才能解决这些问题。如果您的 AI 战略依赖于不可靠的数据,失败就在眼前。
为什么 AI 需要强大的基础设施
AI 的成功取决于数据质量。正如谚语所说,“垃圾进,垃圾出。”即使是最好的模型也会在数据有缺陷的情况下崩溃,就像在流沙上建造摩天大楼一样。
想象一下一辆赛车:世界级的工程和熟练的驾驶员都无关紧要,如果燃料被污染。同样,优雅的机器学习模型也会在不靠谱的数据驱动下失败。
AI 系统需要准确、实时的数据来适应和执行。任何中断 —— 失败的作业、丢失的记录、模式更改 —— 都会侵蚀准确性,甚至会完全破坏系统。也许一个推荐引擎误发,客户流失,或者一个欺诈检测系统漏掉威胁。
如果没有强大的数据基础,AI 很快就会变成一个巨大的负担。因此,数据可靠性、信任和完整性是任何成功的 AI 战略的前提条件。
当前的数据运营状态
大多数企业仍然依赖手动、被动的流程来运行数据运营 —— 这种模式对于 AI 来说根本不具备可扩展性。当出现问题时,工程师们会四处寻找问题,遍历广泛的、多平台的架构,并逐一修复它们。
这种消防方法会产生三个主要问题:
- 延迟检测:问题可能会持续数天或数周,让 AI 模型运行在有缺陷的数据上。
- 不完整的修复:手动排除故障是不一致的,经常会错过根本原因,并让系统容易受到攻击。
- 失去容量:工程人才花费更多时间追逐故障,而不是推动创新。
复杂性只会加剧挑战。现代数据生态系统跨越数十个平台和复杂的依赖关系,很少有人真正理解它们。诊断根本原因通常需要逆向工程管道,这个过程可能需要数天甚至数周。
增加更多人员来解决这个问题:顾问、承包商、更大的数据团队。这就像通过雇佣更多的交通警察来解决交通拥堵。真正的问题不是人员配备,而是缺乏数据可靠性系统。
可观察性和自动化作为催化剂
前进的道路是将数据运营从手动的消防转变为主动、自动化的运营,建立在两个支柱上:可观察性和自动化。
可观察性提供了对整个数据生态系统的实时可见性 —— 监测作业性能、数据新鲜度、质量和依赖关系 —— 以便在问题影响 AI 应用程序之前就将其捕获。企业不再等待下游团队报告问题,而是获得对其数据健康状况和流动性的全天候视图。
自动化增加了速度和规模,以便能够对可观察性采取行动。当一个关键作业在凌晨 3 点失败时,自动化系统可以停止下游工作流,向正确的团队提供完整的上下文,甚至可以启动纠正措施。
这些能力共同标志着一个基本的转变。数据可靠性不再仅仅是后台的琐事,需要专门的工程师。它正在成为一种战略能力,支撑企业对 AI 的所有雄心壮志。
弥合试点与生产的差距
许多 AI 计划的失败在于从试点到生产的飞跃。试点运行在静态、策划的数据集上,数据科学家可以仔细清理和验证。生产则是混乱的,需要处理来自整个企业的多样化数据流。
当理论变成实践时,那就是裂缝开始出现的时候。批处理在试点中有效,但无法满足实时需求。预验证的数据集让位给原始、不一致的输入。受控环境必须突然与遗留平台、第三方 API 和不断变化的业务系统交互。
这就是为什么企业在弥合这一差距时会投资于数据可靠性基础设施。数据可靠性的基础支持了现实世界中混乱的生产需求。数据可靠性帮助您的系统为即将到来的挑战做好准备。
针对企业的建议
成功扩展 AI 的组织共享一些共同的策略:
- 早期投资于数据可靠性。将质量作为先决条件,在将试点转移到生产之前,建立监测、测试和验证机制。
- 实施可观察性实践。跟踪不仅仅是作业失败,还包括直接影响 AI 性能的新鲜度、体积变化、模式更改和质量指标。
- 自动化常规操作。使用自动化检测和解决方案来减少消防并释放工程师进行战略工作。
- 建立责任机制。将数据质量视为业务优先事项,明确所有权和生产者与消费者之间的反馈循环。
- 设计以容错为目的。构建系统以容纳故障,使用验证点防止坏数据传播。
AI 的 95% 失败率并不是不可避免的。它是可以预防的。问题不在于 AI 本身,而在于缺乏强大的数据基础来支持它。数据运营的成功就是 AI 的成功。它们是一样的。
这是一个警钟。企业必须超越手动、被动的方法,采用主动、自动化的系统。不要停止,直到您拥有真正的可靠性。修复“坏数据问题”的工具和实践已经存在于今天。
组织如果接受这一转变,就会看到不仅是更高的 AI 成功率。他们会改变对数据的使用方式,带来整个业务的新见解。
您可以继续为不可靠的数据所困的试点项目提供资金。或者您可以建立强大的基础,使 AI 成为可持续的优势。这取决于您。












