访谈
谷歌高级首席架构师Sathya AG – 采访系列

Sathya AG 是一位技术传道者,出版过 “企业级混合和多云战略” 的作者,并且是谷歌(零售战略行业)高级首席架构师,拥有超过 19 年的企业架构和人工智能经验。作为全球思想领袖,他获得了顶级人工智能影响者奖和谷歌总裁奖,他是企业级混合和多云战略的作者,也是 CAIO 圈的顾问委员会成员。他是英国计算机学会的会员(FBCS),IEEE 高级会员,并且是斯坦福 LEAD 校友。作为人工智能前沿、谷歌下一代和 NRF 的热门演讲者,Sathya 还志愿教导不发达社区的人工智能/机器学习。
免责声明:以下所分享的想法和意见是作者自己的,并不一定代表其雇主或其隶属的任何组织的观点、立场或意见。
您在 Oracle (ORCL ) 度过了十多年,然后转到谷歌担任高级架构师,现在您与大型零售企业合作。随着公司从传统数据现代化项目转向生成式人工智能和代理人工智能计划,您对企业人工智能的看法如何变化?
在 Oracle 的日子里,作为企业架构师,我的核心关注点始终是构建组织赖以运行业务的基础、复杂的系统。我们正在解决大规模集成、治理和主数据管理挑战,以确保企业有一个单一的、非常可靠的真相来源。传统的数据现代化本质上是被动观察,设计语义层和数据管道,以向人类决策者提供可靠的见解。
生成式人工智能和代理人工智能的演变彻底改变了从被动观察到自主系统的建筑范式。现在,焦点已经转移到我们是否可以让系统代表我们采取行动(并且,在没有监督的情况下,正确地采取行动),并且可以扩大规模。这对数据质量、上下文和控制提出了更高的标准,因为现在一个错误的数据假设不仅仅会产生错误的仪表盘,还会产生错误的行动。一个误读库存数据的代理不仅会误导某个人,还会下达错误的订单。
这是企业架构变得至关重要和基础的原因。为了安全地构建自主系统,我们必须无缝地弥合确定性企业系统和概率人工智能之间的差距。现在我领导的架构对话是关于构建可靠的数据织物,确保实时自主推理受到严格的治理、强大的可观察性和与企业系统相同的交易完整性的约束。
您认为,许多人工智能项目失败的原因并不是模型本身,而是早期的数据和架构决策。早期的架构选择中,哪些最常见的会在以后悄悄地破坏人工智能项目?
我看到最多的是公司将仓库或湖视为单一的真相来源,而实际上它只是单一的目的地。他们将所有内容管道到一个地方,并假设这解决了“一个真相版本”的问题,但事实并非如此,它只是集中了分歧。如果三个源系统每个都以不同的方式定义一个活跃的客户,将它们汇集到一个仓库中只会给你一个错误的答案,而不是三个。
然后还有陷阱,即构建精确的当前需求。一个管道被调优到一个仪表盘,工作得很好,然后六个月后,一个新模型需要相同的数据更快或更新鲜,整个事情都必须被拆除,而不是扩展。
总是回来咬人的事情是跳过血统和元数据,因为它看起来像没有人要求的开销。它没有任何回报;直到有人问为什么模型做出了特定的调用,而没有办法追踪它。那时它就变成了一个昂贵的修复,而不是一个廉价的设计决定。
在与《财富》500强企业合作时,您如何判断一个组织是否真正准备好将人工智能扩大到超越试点阶段?
老实说,我通常可以在前几次对话中判断出来。一个组织正在尝试人工智能和一个准备在企业规模上运营人工智能之间的区别归结为几个明显的迹象。我通常会寻找准备度跨三个主要类别:战略信念、业务集成和运营成熟度。
以下是信号真正准备好扩大规模:
1. 战略对齐和高管信念
明确的 AI 战略,而不仅仅是“AI 羡慕”:组织的领导层对其 AI 战略有真正的信念。这很容易通过询问几个关于如何将 AI 映射到其业务目标的问题来发现。如果他们可以阐明确切的业务价值(例如收入增长、利润率改善或客户体验),而不仅仅是想要“使用生成式 AI”,那么他们就准备好了。
承诺的企业资金:他们已经超越了孤立的研发预算。有一个专门的、跨职能的预算不仅仅用于 AI 项目,还用于变革管理、基础设施和持续的 MLOps。
2. 问题解决和业务集成
解决正确的问题:一个主要的危险信号是将标准工作流自动化或机器人流程自动化(RPA)与人工智能混淆,并强行将人工智能添加到上面,只是为了向董事会展示人工智能的采用。准备好的组织了解人工智能的独特价值主张。他们专注于人工智能提供范式转变的能力,而不是仅仅检查技术上的复选框上的遗留流程。
业务部门所有权:这是一个更安静的信号,但往往是扩大规模的最大障碍。如果人工智能的兴奋仅仅存在于一个孤立的“创新实验室”中,并且没有来自实际业务部门的利益相关者,那么试点项目将无法起飞。真正的准备度是当业务利益相关者积极地共同开发解决方案并拥有最终的业务成果时,而不是将概念验证抛给运营团队。
3. 运营成熟度和治理
第一天就参与安全和合规:缺乏安全和治理团队的参与,或者试图将关键人工智能用例与他们隔离以“更快地移动”,这是部署失败的配方。成熟的组织从第一天开始就将信息安全、法律和数据治理团队纳入其中。他们将这些团队视为关键的使能者,他们建立了必要的防护栏,以便安全地扩大规模,而不是将他们视为障碍。
最终,成功扩大人工智能的组织不会将其视为 IT 科学实验,而是将其视为具有正确的赞助、正确的防护栏和正确的业务对齐的变革性业务能力。
AI 准备就绪的数据基础实际上是什么样子,特别是对于具有 ERP、CRM、商务、云和遗留系统中分散的数据的企业?
大多数企业不具有数据量问题,而是具有数据信任问题。这是人工智能叠加在上面的内容。它不仅仅是拥有一个闪亮的新平台,而是拥有一个少数不光鲜的属性在系统中保持真实。
例如,相同的客户、产品或商店必须被识别为相同的实体,无论它是在遗留的 ERP、现代的 CRM 还是商务平台中。如果系统无法就客户是谁达成一致,人工智能的个性化和预测模型将在破碎的数据上运行,导致一个虚构的图景。您无法预测客户的生命周期价值,如果您的 AI 将一个客户视为三个不同的人。
第二,数据的新鲜度与决策相匹配,而不是默认为源系统所做的任何事情。夜间库存更新对于长期规划是可以的,对于实时履行是无用的;真正的基础支持两种速度,而不是将所有内容都降低到最慢的一个。
第三,一个血统层可以让您在几分钟内回答“这个数字从哪里来”,而不是进行多天的调查。大多数分散的企业不缺乏数据,而是缺乏使他们已经拥有的数据变得可信和可追踪的层。这才是真正的基础,而不是添加在上面的任何工具。
您经常讨论数据的 5 个 V:体积、速度、种类、真实性和价值。企业领导者在准备数据用于人工智能时,往往会低估哪一个?
数据真实性,无疑,其次是数据价值。
体积在今天的大数据生态系统中是理所当然的。每个人都被数据淹没。多样性和速度会获得预算,因为它们在路线图上是可见的 – 新的源、管道和实时源。
真实性是隐形的,直到它花费你一些东西 – 通常是一个模型产生一个明显错误的输出,某个人将其追溯到重复的客户记录或三个团队以三种不同的方式填充的字段。
最后,价值被低估地不同 – 领导者假设如果数据存在,它就有价值,而没有问它是否真正推动了决策。大多数企业只有很小一部分数据真正发挥作用,而没有人绘制出哪一部分是有用的。
在零售业中,人工智能的用例可以涵盖个性化、预测、库存、供应链、客户服务和店铺运营。您在哪里看到人工智能雄心和数据准备度之间的最大差距?
虽然人工智能雄心在零售业中均匀分布,但数据准备度却高度不对称。
个性化和预测有最合理的准备度 – 零售商多年来一直在收集交易和浏览数据。
更大的差距在供应链和全渠道,特别是在线和实体店之间的连接。全渠道非常复杂,因为它迫使零售商在实时解决两个最难的数据问题:统一的客户身份和流畅的库存。大多数零售商对电子商务库存有实时的可见性,但对店铺库存只有周期性、有时是每日的可见性。
客户服务和店铺运营仍然处于初期阶段。雄心壮志很高,但底层的运营数据,即人员配备、任务完成、实时店铺状况,往往是业务中最不数字化的部分。雄心壮志在这些用例中均匀分布;准备度并不均匀分布。
公司应该如何在不破坏业务仍然每天依赖的关键系统的情况下现代化遗留数据基础设施?
遗留数据平台通常会出现运营瓶颈、严重的数据质量问题和组织扩展限制。保护日常运营的最有效方法是在现代化过程中严格避免单一的高风险大爆炸式迁移。数据平台现代化的主要目标应该是使数据对组织决策更有用,而不是将努力视为纯粹的 IT 平台交换。
为了适应人工智能时代,组织应该采用数据勋章和数据网状架构。这种策略创建了一个结构化的管道,其中数据从原始状态到业务就绪状态逐步完善,有效地防止低质量的数据进入决策。通过将数据分离为不同的逻辑层,组织建立了清晰的血统,使得信息从源到目的地的转换变得简单。
通过将经过验证的数据打包为可访问的产品,组织使团队能够做出战略、基于证据的决策,而不是依赖于直觉。至关重要的是,这种方法建立了企业人工智能所需的数据信任基础。通过精心策划的数据产品构建人工智能代理,确保模型从安全、准确的信息中学习,而不是杂乱、未经审查的数据集。
治理通常是在人工智能项目已经开始之后才添加的。什么时候治理、隐私、安全和数据质量被视为从第一天开始的架构要求,会发生什么变化?
一切都会变得更快、更少出错、更好地扩展。由于生成式人工智能的概率性质,治理至关重要,但在许多组织中却经常被忽视。
当您将这些元素视为第一天的架构要求,而不是最后一刻的审计清单时,您会从损害控制转变为速度。以下是变化:
首先,您避免了痛苦的“拆卸和替换”阶段,在那里完全构建的人工智能项目被废弃,因为它们违反了合规性或隐私标准。
接下来,安全性和数据质量不是被添加在上面,而是被嵌入到管道中。您的模型在可靠的数据上运行,产生输出,领导者和用户真正信任。
最后,当您从概念验证转移到生产时,部署路径已经清除并自动化,而不是撞上监管壁垒。
简而言之,治理不是创新上的制动器,而是允许您快速安全行驶的方向盘。
作为 CAIO 圈的顾问,您认为首席人工智能官的角色应该如何演变,以及其职责应该相对于 CIO、CDO 和业务部门领导者的开始和结束在哪里?
作为 CAIO 圈的一部分,这对我来说是一个真正有用的窗口,因为现在这个角色已经变得混乱,因为许多企业是在对生成式人工智能的炒作做出反应时创建了它,而不是填补明确的运营差距。我相信这将会迅速得到解决,也需要得到解决。为了有效地工作,高管的划分应该是清晰的:
CIO 拥有基础设施和系统可靠性。CDO 拥有数据作为企业资产(其质量、治理和可访问性)。CAIO 拥有将原始人工智能能力转化为真正的业务成果的翻译层。
这种翻译层意味着明确拥有人工智能组合的所有权,确定要构建什么,找出哪些业务领域可以通过人工智能技术更好地改进和服务,并担任人工智能应该和不应该部署的最终权威。
目前企业中最大的差距是评估风险和价值权衡,跨越竞争业务部门。阻止一个高风险的人工智能计划,这是单个业务部门急切想要的,需要有人,他们的激励措施不与该单位的短期目标挂钩,并且具有足够的技术能力来直接评估风险。这种独立的、技术上扎实的守门人正是 CAIO 角色需要成为的。
展望未来,什么将区分实现持久人工智能优势的公司和仅仅尝试使用最新人工智能工具的公司?
这不会是拥有最好的模型的公司。模型能力正在迅速收敛,原始技术不会成为持久的区分点。
相反,长期人工智能成功的核心考验——无论是内部还是面向客户——归结为一件事:信任。
信任与组织建立人工智能就绪基础和能够安全快速测试、部署和扩大新能力的环境直接成正比。具体来说,这需要三件事:
可靠的数据基础:干净、可信的数据,以便每个新用例不需要大规模的单次清理项目。
敏捷的治理:风险和合规流程足够快,以跟上底层模型的演进速度。
以结果为导向的指标:一种组织文化,它通过业务价值来衡量人工智能,而不是技术成熟度。
三年后仍然陷入“实验模式”的公司将是那些从未建立过这种基础的公司——他们将继续在每个单独的人工智能项目上重新学习相同的数据和治理经验。
那些拥有持久优势的赢家将是那些第十个人工智能用例比第一个用例部署得更快、更便宜的公司,因为基础是在第一次就做对了的公司。
感谢您这次精彩的采访,读者也可以阅读他的书《企业级混合和多云战略》。












