访谈
Leo Brunnick,Cloudera 首席产品官 – 访谈系列

Leo Brunnick,Cloudera 首席产品官,是一位拥有三十多年构建和扩展软件、数字媒体以及企业技术组织经验的资深技术高管和企业家。在 Cloudera,他负责产品管理、工程和客户支持,监督公司在扩展数据和 AI 平台能力时的产品和技术方向。2025 年加入 Cloudera 之前,Brunnick 在 Naviga 工作了六年,最近担任首席运营官,领导了 600 多名跨产品、工程、市场、R&D、客户支持和专业服务的专业人士。职业生涯早期,他创立并担任 Patheos 的首席执行官,将该数字媒体平台的月访客量提升至约 1500 万人次后成功退出,并在企业内容管理公司 Vignette 任职八年,担任首席产品官。他的背景还包括在 Andersen Consulting 的技术咨询以及担任美国海军陆战队步兵军官。
Cloudera是一家专注于帮助组织在任何位置——公共云、私有数据中心和边缘环境——管理、治理、分析并应用 AI 于数据的企业数据与 AI 公司。其混合平台融合了数据管理、分析、机器学习、生成式 AI,以及日益增长的代理式 AI 能力,同时强调企业安全、治理、隐私和工作负载可移植性。公司当前的平台战略包括 Cloudera Anywhere Cloud,这是一种旨在为企业在不同基础设施环境中提供一致云体验的架构,此外还有开放的数据湖仓、统一数据织网、实时数据处理以及用于开发和部署 AI 模型和代理的工具。Cloudera 表示,其技术管理超过 25 exabytes 的数据,已被大型全球企业用于在无需将所有工作负载或敏感数据迁移至公共云的情况下,实现数据基础设施的现代化。
您的职业生涯跨越了技术咨询、在 Vignette 和 Naviga 领导产品组织、创立并扩展 Patheos,以及目前在 Cloudera 担任首席产品官。这些经历如何塑造了您在 AI 从根本上改变组织数据使用方式的时代,构建企业技术平台的思考方式?
在所有这些情境中,都是同一原则适用。技术的最大价值在于让本来复杂的事物变得更易于使用。如今,这一点尤为重要,因为 AI 在带来巨大机遇的同时,也为已经在处理云数据、数据中心以及日益增多的主权环境的企业增加了另一层复杂性。
在 Cloudera 构建下一个时代的过程中,我常常思考如何让组织能够受益于新技术,而无需重新思考他们已构建的一切。过去几年里,企业已经建立了自己的数据资产、应用程序、治理模型和运营流程。每当出现新技术时,完全抛弃这些已有的东西并不合理。能够在 AI 时代取得成功的平台将基于组织已有的基础,同时赋予其在需求演变时的灵活性和控制力。
Cloudera 最近推出了 Cloudera Anywhere Cloud,帮助企业在公共云、私有基础设施、主权云、本地环境以及边缘上构建和运行 AI。您在客户中看到的哪些问题促使 Cloudera 认为这种统一架构是必要的?
客户在将 AI 落地方面面临日益增长的压力,即使他们的数据和基础设施已经分布在比以往更多的环境中。数据可能分布在公共云、私有数据中心、主权环境和边缘,每个环境都有其自身的安全、合规、性能和经济需求。管理所有这些环境会给组织带来巨大的运营负担。
Anywhere Cloud 的理念是,企业不应在云的敏捷性与对数据的控制、安全和治理之间做出取舍。组织需要一种一致的方式,在最符合业务需求的地点部署、治理和扩展数据及 AI 服务。通过单一的控制平面,企业可以减少对底层基础设施的管理时间,更多地专注于利用数据和 AI 实现期望的成果,无论这些数据位于何种环境。
您曾表示企业 AI 已“超越了仅公共云模式”。在尝试将生产 AI 完全运行于公共云环境时,企业面临的最大限制是什么?哪些工作负载正日益转移到其他地方?
在 AI 时代取得成功的平台将基于组织已有的基础,并提供随需求演变而适应的灵活性。公共云仍是企业技术战略的重要组成部分,但并非唯一选择。随着 AI 进入生产阶段,企业需要根据监管、安全和成本等因素决定数据和工作负载的运行位置。
这表明,关于工作负载放置位置的决策现在变得更加审慎。某些 AI 应用显然适合在公有云中运行,而涉及高度敏感或受监管数据的工作负载可能必须留在私有数据中心或主权环境中。在其他情况下,由于延迟是重要因素,工作负载更适合部署在边缘。目标并非摆脱公有云,而是让企业能够灵活地在最适合的地点运行每种工作负载,而无需为每个环境单独创建运营模型。
Cloudera Anywhere Cloud 包含一个具备代理能力的副驾驶,可将自然语言请求转换为数据工作流和基础设施操作。您预计这些系统将变得多自主,以及在代理对关键数据基础设施获得更大控制时,企业应在何处保持人工监督?
代理将继续承担目前占用数据和基础设施团队时间的重复性运维工作。如果代理能够用自然语言表达结果并将其转换为工作流或基础设施操作,将大幅降低摩擦,使更多人能够使用高级数据能力。
更大的自主性也带来了对有效治理的更高需求。公司必须制定明确的政策,规定代理可以访问的内容、其可自行执行的操作以及何时需要人工批准。行动的潜在影响越大,这些控制就越关键。自主性与治理应同步推进,以在为代理提供足够自由实现真实生产力提升的同时,确保组织对关键数据和基础设施保持监督和控制。
Cloudera 正在与 NVIDIA 合作,通过 cuDF 为 Apache Spark 4.1 工作负载引入原生 GPU 加速,潜在性能提升可达 4 倍,且无需组织重写现有的 PySpark 或 SQL 应用程序。为何消除代码重写的需求对加速企业 AI 采用如此重要?
企业已在现有应用、技能和数据管道上投入了大量资源。切换到新技术不仅仅是工程工作,还可能带来风险、延迟结果,并对已在运行的系统造成干扰。
零代码加速有助于应对这一挑战。组织可以利用现有的 PySpark 和 SQL 工作负载获得 GPU 加速的优势,而无需根本改变团队的运作方式。这使技术更易于采用,同时提升支持分析和 AI 的数据管道性能,并保护已有投资。
GPU 正在越来越多地用于模型训练和推理之外的场景,包括数据准备和分析。您是否预计 GPU 加速将成为企业数据堆栈的标准组成部分?这将如何改变为 AI 准备海量数据集的经济性?
在我看来,企业将在将基础设施与工作负载匹配方面变得更加熟练。GPU 已经改变了模型训练和推理的方式,数据工程是下一个显而易见的创新领域,因为在将 AI 应用投入生产时,准备大型数据集往往是主要瓶颈。
经济影响同样显著,因为更快的处理不仅仅是更快完成 Spark 作业。缩短计算运行时间可以降低基础设施成本,同时帮助数据团队更快迭代,这在 AI 工作负载增长的背景下变得日益重要。根据 我们的研究,84% 的受访者发现 AI 工作负载增加了基础设施成本,这使企业更需要审视整个数据管道,以寻找提升性能和降低成本的机会。GPU 加速的数据处理可能成为其中的重要组成部分。
Cloudera Anywhere Cloud 的承诺之一是让组织能够根据监管、经济或运营需求将工作负载放置在任意位置,而无需持续移动或复制数据。将 AI 计算带到数据所在位置,而不是将所有企业数据搬到 AI 端,有多重要?
这一点至关重要,因为企业多年来在不同环境中构建了海量数据,将所有数据集中到一个位置用于 AI 往往不切实际。这样做成本高且耗时,同时安全、隐私或主权要求可能完全阻止组织移动某些数据。
目前,企业将所有数据安全地迁移到 AI 所部署的各个应用和环境中并不现实。将 AI 带到数据所在位置,使组织能够利用已有的大量数据,同时保持数据在适当的位置。这也为其提供了根据业务和技术需求在最合适的地点运行工作负载的灵活性。随着 AI 在企业内部的深入嵌入,能够在数据所在的任何位置保持一致运营的能力将变得日益重要。
数据主权已成为重大关注点,随着政府和受监管行业采用 AI。主权 AI 要求如何改变企业所需的架构,您是否预计在未来几年主权云和私有 AI 基础设施会变得显著更重要?
绝对如此。主权正成为一种架构需求,而不仅仅是合规问题。组织需要了解其数据存储位置以及 AI 工作负载运行地点,同时还要了解谁有访问权限以及知识产权和敏感信息如何受到保护。
组织不能再假设所有内容都可以集中在单一公共云中。他们需要在主权云、私有基础设施、公共云和本地系统之间灵活运作,并在每个环境中实施一致的治理。随着 AI 深入受监管行业和关键业务流程,这些需求只会变得更加重要。能够在创新的同时保持对数据和 AI 环境控制的组织,将更有能力负责任地扩展 AI。
随着自主 AI 代理获取企业数据、应用和基础设施的权限,传统的数据治理可能已不再足够。当访问并操作企业数据的用户日益成为 AI 代理而非人类时,治理需要如何演进?
过去,治理主要基于人员和应用能够访问数据。代理引入了新维度,因为它们可以访问信息、进行推理并根据发现采取行动。
因此,企业必须将身份、权限、血统、可观测性和零信任访问等理念应用于代理,以确保数据的安全和治理。组织应了解哪个代理访问了哪些数据、对这些信息做了什么、采取了哪些行动,以及这些行动是否符合公司政策。治理不能在代理采取行动后再引入;必须在环境中内置,使得策略和防护随数据一起移动,并始终强制执行,无论相关实体是人、应用还是自主代理。
Cloudera 正在强调 Apache Iceberg、Polaris、Spark、Kafka 和 Trino 等开放标准,而不是要求客户完全在专有堆栈中运行。随着 AI 基础设施围绕大型平台整合,开放标准和互操作性在防止新一代 AI 供应商锁定方面有多重要?
AI 越来越多地成为企业基础设施的一部分,开放标准就越显重要。AI 正在快速演进,组织需要避免今天做出可能限制未来可使用模型、引擎、基础设施或技术的架构决策。
Apache Iceberg、Spark、Kafka、Trino 和开放目录等技术为组织提供了在不同工作负载使用不同工具的灵活性,同时在其数据环境中保持互操作性。随着企业日益在公共云、主权基础设施和私有数据中心之间运营,这一点尤为重要,因为他们需要自由决定数据和 AI 工作负载的运行位置,而无需围绕单一供应商重建。
开放的方式还能在基于现有投资的同时更容易采用新 AI 能力,而不必在技术演进时反复移动或复制数据。随着 AI 生态持续变化,开放标准为组织提供了随时间演进架构的灵活性,同时保持对数据、基础设施和技术决策的选择权和控制权。
感谢这次精彩的采访,想了解更多的读者请访问 Cloudera。












