访谈

Quali 首席执行官 Lior Koriat – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Lior Koriat,Quali 首席执行官,是一位经验丰富的技术高管和企业家,在 Quali 工作近二十年,帮助公司从早期的工程和运营基础发展成为全球性的云环境即服务解决方案提供商,为 DevOps、IT 和平台团队服务。自 2011 年成为首席执行官和董事会成员以来,他领导了 Quali 在美国、欧洲、亚洲和以色列的扩张,建立在早期担任研发副总裁、首席运营官和首席执行官的基础上,建立了工程、销售、客户支持、法律、商业发展和国际运营。他的背景还包括创立和领导 Intellitech Engineering,一家被收购的系统和机械工程公司,服务于国防和民用客户,以及担任 Google Launchpad Accelerator 和 UC Berkeley 的 Sutardja Center for Entrepreneurship & Technology 的导师,指导初创公司关于产品策略、市场执行、DevOps 和扩张。

Quali 开发基础设施自动化和平台工程软件,旨在帮助组织提供受管的自助云环境,而不减慢开发团队的速度。其 Torque 平台为平台团队提供基于目录的自助服务层,实现批准的蓝图、基于角色的访问控制、生命周期管理、成本归属、策略执行和实时可见性跨环境。Quali 将 Torque 定位为一种标准化基础设施交付方式,适用于多云和混合云设置,支持包括软件开发、测试、演示、培训、概念验证部署、MLOps、智能 AI、CI/CD 流水线自动化和 GPU 即服务在内的用例。其更广泛的产品组合还包括 CloudShell,它将基础设施转化为可重用、低代码或无代码的构建块,适用于跨本地和云基础设施的复杂环境。

您创立并扩张了多家技术公司,然后领导 Quali,您的职业生涯跨越了军事系统、机器人、基础设施工程和云自动化。这些经历如何影响您对构建 AI 基础设施平台的愿景,您又如何确信这是专注于 AI 本地基础设施管理的正确时机?

我的职业生涯始终围绕着复杂的系统展开,这些系统必须在苛刻的条件下可靠地运行。我从机器人和航空航天开始,开发用于国防应用的自动化和模拟系统,在那里可重复性和治理是运营要求而不是工程偏好。这些环境教会了我,最难的问题出现在多个系统和流程必须一致地在时间上协同工作的地方。

这种观点延续到了 Quali。在过去的十年中,企业基础设施变得越来越分散在不同的层次上。每个新层次解决了一个特定的技术问题,但它也引入了另一个管理接口、另一个运营工作流和另一个复杂性来源。组织变得非常擅长创建基础设施,但在基础设施存在后,治理它的能力却大大降低了。

AI 加速了这种失衡,运营挑战日益决定了 AI 计划是否能够从试点阶段转移到生产阶段。这就是为什么我认为 AI 本地基础设施管理变得必要。挑战在于在异构环境中连续地运行 AI 基础设施,同时保持治理、安全和成本纪律,同时优化利用率。

主权 AI 已经迅速成为政府和企业的优先事项。大多数组织对主权性有什么误解,您又为什么认为基础设施治理正变得与模型所有权一样重要?

许多主权 AI 讨论集中在数据驻留和基础设施所有权上。这些是必要的组成部分,但它们只解决了运营现实的一部分。

一旦组织开始部署自主代理,主要问题从基础设施驻留在哪里转变为 AI 系统如何在该基础设施内运行。现代代理分配资源、检索信息、启动工作流并与生产系统交互。每一个动作都需要策略执行。

这改变了主权性应该如何被评估。拥有基础设施并不自动提供运营控制,如果 AI 系统可以在没有确定性治理的情况下执行动作。企业需要展示谁启动了一个动作、哪些策略管辖了它、哪些资源被访问以及这些决策如何被审计。挑战在于在异构环境中连续地运行 AI 基础设施,同时保持治理、安全和成本纪律,同时优化利用率。

我预计基础设施治理将变得与模型开发一样具有战略重要性,因为它提供了允许组织负责地扩展 AI 的运营框架。随着企业采用多个模型、多个云和日益自主的工作流,治理成为保持这些环境在整个基础设施资产上安全和负责的层。

AI 代理越来越被授予分配资源、部署工作负载和做出运营决策的权力。在企业可以安全地将关键基础设施托付给自主系统之前,必须建立什么样的防护措施?

许多组织已经在生产中部署了 AI 代理。问题在于这些代理如何在明确定义的边界内运行。

第一个要求是在执行层面实现确定性的策略执行。代理应该只能够执行符合预定义基础设施策略的动作。这些策略不能依赖于模型来决定一个动作是否合适。它们需要独立于模型本身来执行。

访问控制同样重要。持久的权限会产生不必要的运营风险。访问应该为特定任务提供,仅限于所需的资源,并在工作完成后自动撤销。这种模型允许组织在不扩大攻击面的情况下扩大自动化。

每个动作还需要一个完整的审计跟踪。随着 AI 系统变得更加自主,企业需要了解哪个代理执行了一个动作、什么时候发生、哪个策略授权了它以及哪些更改被应用。这种可追溯性支持运营故障排除以及法规遵从性。

我还相信自主基础设施应该在受管的环境中运行,而不是在无限制的基础设施上。明确定义的环境提供了显式的资源边界、生命周期控制和运营策略,在代理开始执行工作负载之前。这样可以让组织在保持可预测的运营行为的同时增加自动化,因为 AI 部署继续扩大。

您经常讨论从传统自动化到所谓的智能控制平面的转变。当基础设施开始围绕意图而不是静态规则和工作流运行时,什么根本发生了变化?

传统自动化执行预定义的步骤。当基础设施是可预测的、工作负载是稳定的、更改是通过人工管理的工作流发生时,这种方法有效。AI 基础设施不以这种方式运行。

AI 工作负载是动态的。GPU 需求迅速变化,环境被创建和销毁,代理可能需要访问资源以执行特定任务。智能控制平面了解环境的目的、所有者、成本、适用的策略以及实时状态是否仍然与预期状态匹配。

这改变了基础设施管理。系统可以检测漂移、推荐优化、执行策略和管理生命周期决策,以预期结果为目标,而不是静态脚本。

GPU 基础设施已经成为 AI 部署中的一个主要瓶颈。您是否认为行业对 GPU 利用率的处理方法是错误的,什么样的运营变化可以在不仅仅是添加更多硬件的情况下显著提高效率?

行业通常将 GPU 问题视为采购问题。在许多企业中,更紧迫的问题是利用率。

我们看到组织拥有 GPU 集群,这些集群为峰值需求而预分配、在训练运行之间处于空闲状态,或者在工作完成后仍然附加到环境中。这会产生高成本而没有匹配的业务价值。

提高 GPU 效率的第一步是生命周期控制。环境应该按需提供、与工作负载匹配、归属到团队或项目,并在任务完成后自动销毁。企业还需要对利用率、每个工作负载的成本和每个环境背后的业务目的有可见性。

添加硬件可能仍然是必要的,但未经管理的 GPU 容量只会扩大成本问题。

许多企业现在跨公有云、私有云、本地环境和边缘基础设施运营。您如何看待混合 AI 环境在未来五年内的演变,以及哪些挑战仍然未得到解决?

混合 AI 将成为默认的企业模型。组织将使用公有云进行灵活性、本地基础设施进行控制和成本管理,以及边缘环境在延迟、数据本地性或运营要求需要时使用。

未解决的挑战是一致性。大多数企业已经跨多个供应商、云、自动化工具和基础设施类型运营。AI 添加了 GPU 集群、模型服务环境、微调管道和代理工作负载到该混合中。

在接下来的五年里,领先的组织将是那些在这些环境中创建单一运营标准的组织。他们需要在无论工作负载在哪里运行的情况下保持一致的提供、策略执行、成本归属、审计和生命周期管理。

DevOps 在过去十年中改变了软件交付。您是否认为 AI 基础设施需要一个完全新的运营模型,还是它是 DevOps 和平台工程的自然演进?

AI 基础设施扩展了 DevOps,但它也引入了传统 DevOps 实践无法处理的要求。

DevOps 通过标准化管道、自动化可重复的工作并给团队更快地访问所需资源来改进软件交付。AI 基础设施需要相同的纪律,但工作负载更为资源密集、更不可预测,并且更依赖于专用基础设施。

在这种环境中,平台工程变得至关重要。团队需要对经过验证的环境进行受管的自助访问,而不是基于票据的提供或一次性的手动配置。运营模型仍然重视速度和自动化,但它也需要更强的治理、成本控制和基础设施背景从一开始。

无人值守运营已经成为基础设施管理的一个长期目标。我们距离真正的自主基础设施有多近,哪些技术和组织障碍仍然阻碍着我们?

我们比大多数人意识到的更接近于自主基础设施,但限制因素是治理而不是自动化。AI 代理已经可以提供环境、部署工作负载、调查异常和推荐补救措施。挑战在于确保这些动作发生在明确定义的策略边界内。

组织还需要有信心,即自主系统可以解释它们做了什么、为什么做以及在哪些策略下采取了行动。这种可追溯性在许多企业环境中仍然缺乏。自主基础设施将变得主流,当治理、审计和策略执行被构建到运营层,而不是事后添加时。

随着 AI 工作负载变得更加动态和资源密集,成本超支变得越来越令人担忧。企业在尝试扩展 AI 基础设施时最常犯的错误是什么,他们又如何避免这些错误?

许多组织专注于在了解他们现有基础设施的利用率效率之前获取更多计算资源。

我们经常看到环境在项目完成后仍然保持活动状态、GPU 资源为峰值需求而预分配或在工作完成后仍然附加到环境中。这会产生高成本而没有匹配的业务价值。

解决方案始于治理。每个环境都应该有一个定义明确的所有者、业务目的、生命周期和成本配置文件,从其提供的那一刻开始。当组织将策略驱动的提供与自动拆除和对利用率的持续可见性相结合时,基础设施支出变得更容易预测和证明。

展望未来,哪些因素将区分成功地在大规模上运营化 AI 的组织和那些苦苦挣扎的组织,以及哪些技术趋势现在应该引起技术领袖的注意,但仍然低调?

成功的组织将把 AI 基础设施视为一种运营能力,而不是一组技术。模型将继续改进,硬件将继续变得更加强大。运营这些环境的一致性挑战将仍然存在。

一个值得关注的趋势是基础设施智能的转变。基础设施平台开始了解它们管理的内容、谁拥有一个环境、它支持哪些工作负载、它的成本、它是否符合策略以及何时应该优化或退役。这种运营背景将变得越来越有价值,因为企业部署更多 AI 代理和更多异构基础设施。

我还预计治理将成为竞争优势。能够快速提供基础设施同时保持可见性、策略执行、成本控制和审计的组织将比那些仍然依赖于分散的运营模型的组织更快地将 AI 项目从试点转移到生产。

感谢这次精彩的采访,希望读者了解更多信息,请访问 Quali

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。