思想领袖
企业 AI 依赖可信的数据

2025 年,企业在生成式 AI 上的投资估计在 300 亿至 400 亿美元之间,但 MIT 的 NANDA 项目发现,在超过 300 项企业部署中,只有 5% 能产生可衡量的财务回报。 它所审查的项目。
我在企业数据项目中工作超过 25 年。早在生成式 AI 进入讨论之前,我就看到当人们无法信赖其背后的数据时,技术的可信度会迅速下降。生成式 AI 提高了风险,因为它可以把有疑问的数据转化为自信的答案。
我们过去常说“输入垃圾,输出垃圾”。现在则是“输入垃圾,灾难输出”。当数据看起来可疑时,人员可以凭判断联系数据专家。专家会进行根本原因分析,找出问题并实施修复。如今,代理可以直接使用他们遇到的任何数据。缺乏有经验的人类监督,结果可能会进入运营流程,被用于决策,并在整个组织中规模化。
同样的问题也会出现在聊天机器人中。跳过治理会把糟糕或理解不清的数据转化为听起来权威的答案,且立即大规模产生。
信任才是实际的采用瓶颈
当内部聊天机器人给出自信却错误的答案时,用户可能再也不信任它。在大型组织中,AI 也会发现你不希望它发现的数据。我把它比作床下的脏袜子:这些数据可能看不见,但 AI 会找到这些暗数据并加以利用。
上下文必须随数据一起传递,并成为大语言模型(LLM)依赖的基础。在 AI 模型使用数据之前,人员需要了解其含义、来源、所有者以及相关的业务规则和政策。
领导层可能忽视这一点,因为系统很少崩溃。AI 可能自信地出错;比如它会建议在披萨上涂胶水(古老的例子)。想象一下,一个聊天机器人给出自信却错误的答案,导致员工失去信任。重建这种信任的时间远长于事先建立正确控制的时间。
这种侵蚀也体现在数据上。超过 90% 公司的员工 MIT 研究发现 在官方试点未能获得他们信任后,仍在私下使用个人 AI 工具。当获批的工具未赢得信任时,员工会寻找其他方式完成工作。
今年的大量 AI 研究指向同一问题:组织在让数据可信之前就急于推进 AI。 Gartner 估计,近三分之二的组织缺乏适用于 AI 的数据管理实践,或不确定是否具备这些实践。IDC 的研究 发现信任方面也存在类似差距:78% 的组织表示完全信任其 AI,但只有 40% 实际投入了治理和可解释性工作来支撑这种信任。
信心与投资之间的不匹配解释了为何众多 AI 项目在进入生产前停滞,或未能实现预期价值。
AI 治理已成为竞争优势
在我的职业生涯中,大部分时间数据治理是企业 IT 中最不光彩的部分。编目元数据、定义所有权、进行数据画像以及管理工作流常被视为清洁工作。人们常因投入与产出不成比例而跳过它。
AI 已经改变了这一点。它正成为在设计数据蓝图、创建行业制定的词汇表以及推荐和激活数据策略等领域的治理能力。甚至数据血缘现在也能更快地推断和简化,使受管数据管道和可观测性的价值更易实现。
监管也使数据透明度更加紧迫。欧盟 AI 法案 于 2026 年 8 月 2 日广泛生效,包含针对特定系统和 AI 生成内容的透明度规则。该法案还为高风险系统设立了单独要求,包括帮助部署者解释输出的文档和信息,尽管部分高风险条款的实施时间稍后。
对企业而言,实际的教训很明确:清晰的数据血缘和治理使得记录使用了哪些数据、数据来源以及系统预期运行方式变得更容易。
美国的监管局面仍不明朗。缺乏统一的联邦 AI 法律,企业必须在不同州的要求之间进行导航,即使白宫试图限制各州制定和执行自身 AI 规则的能力。科罗拉多州的 AI 法案是现有最全面的州级框架,但已在争议中被推迟并重写一次,其核心义务已延至 2027 年。对许多美国公司而言,诱惑在于等待不确定性消退。
我认为这是一种错误的本能。无论哪种监管模式最终在美国占据主导,基本要求都不会消失。要了解数据来源,了解在 AI 使用之前是否有人对其进行验证。现在培养这种纪律性将帮助企业为新监管做好准备,并将有前景的 AI 试点转化为业务能够自信使用的工具。
区分那 5% 的因素
让我讲一个客户的案例。他们的总账团队每次账目出现差异时,都必须检查 300 份独立的电子表格。三百份。最终有人将这整个混乱重构为单一的受治理数据资产,包含计算、报告以及底层数据,并在前期完成验证。下次出现问题时,修复所需的工作量只有原来的一小部分。仅此流程就节省了约 750 天的人工时间,带来数百万美元的成本节约,仅仅是因为清理了这些数据。
改进源于让正确的数据易于查找且足够可靠,无需反复验证。协作与复用使其成为可能。可信的数据产品可以与公司标准保持一致,随时间进行扩展和升级,进行可信度评分并实现价值管理。这种方法减少了为单个物理数据库表创建数百甚至数千个产品的需求。
强有力的项目让这种信任可视化。在我所参与的数据市场中,资产可根据质量、策划、使用情况和所有权等因素被划分为金、银、铜等级。业务用户在使用前即可看到资产的可靠性。这种可视性帮助人们停止猜测,并更愿意复用已有的数据。
95% 的数据表明,许多公司对生成式 AI 背后的数据处理过于随意。取得进展的组织为人们提供了数据来源、验证方式以及是否适用于任务的清晰视图。经过多年将数据管理视为后台工作后,AI 终于让其价值可见。












