访谈
安世可(Anyscale)现场首席技术官克里斯蒂安·斯塔诺(Christian Stano)- 采访系列

克里斯蒂安·斯塔诺,安世可(Anyscale)的现场首席技术官,在大规模人工智能基础设施、机器学习平台和分布式计算的交叉点上建立了自己的职业生涯。在加入安世可之前,他曾领导Attentive的AI/ML平台组织,在那里他扩展了支持超过50亿订阅者的个性化基础设施,并帮助推动了基于Ray的统一计算系统的采用,从而提高了开发速度并降低了运营成本。在他的职业生涯早期,他曾在Coalfire和Deloitte等组织中从事网络安全、云架构和公共部门人工智能计划,曾为美国国防部的第一个机器学习平台做出贡献。他的背景涵盖人工智能平台工程、MLOps、云原生基础设施、开发者赋能和组织扩展,使他拥有丰富的经验,帮助企业在生产规模上实现人工智能的运用。
安世可是开源分布式计算框架Ray的公司。该公司由来自UC Berkeley的RISELab的Ray原始创作者成立,专注于简化大规模人工智能基础设施的部署、编排和管理,用于训练、推理、数据处理和智能代理工作负载。其平台使组织能够在云端和本地环境中运行分布式人工智能系统,同时提供为现代人工智能应用程序设计的可观察性、治理和性能优化。Ray已成为新兴人工智能基础设施栈中的一个核心层,帮助开发人员将工作负载从单台机器扩展到成千上万个节点,而无需对现有Python代码进行重大更改。
您曾在网络安全、公共部门机器学习平台和超大规模个性化系统中工作过。组织在尝试将人工智能从试验阶段转移到生产阶段时,通常会出现哪些模式?
在各个行业中,三个模式经常出现。首先,团队没有从开发到生产的可靠铺路。他们可以在笔记本中构建一个模型,但没有标准化的方法将其投入生产。每次部署都成为一次性事件,每次故障都成为惊喜。第二,基础设施无法满足需求。试验中有效的系统在面对真实数据量或真实流量时会崩溃。第三,团队没有方向感。他们缺乏可观察性,无法了解系统的实际性能,无法预测何时会出现问题,也不知道何时应该介入。
所有这些都与同一个根源挑战有关——团队没有扩展的合理思维模式。他们试图一次解决所有问题,而不是有序地解决问题。我认为这是三个阶段:让它工作,让它正确,让它快速。这些阶段不是一次性的里程碑,而是迭代的。您不断地在当前的问题和即将出现的问题之间进行优先排序。成功的团队知道他们处于哪个阶段,并且在基础牢固之前不会跳过当前阶段的工作。
在安世可,我们看到团队在每个阶段都有需求。有些团队仍然试图让它工作——他们需要从开发到生产的可靠路径。其他团队已经有了这个路径,但正在因运营复杂性而苦苦挣扎,需要让它变得正确。还有很多团队来到我们这里,因为他们已经构建了一个可行的系统,但无法将其扩展到业务所需的规模。统一的计算层可以在每个阶段提供帮助,但入口点取决于哪里最痛苦。
在Attentive,您帮助扩展了支持数亿用户的人工智能系统。为了达到这种规模,您需要克服哪些最大的架构或组织瓶颈?
最大的瓶颈是基础设施复杂性的S曲线。当我们将更多数据和客户纳入我们的模型时,我们遇到了一个计算的拐点,即使是最大的垂直扩展节点也会出现内存不足的错误,而简单的水平扩展也无法解决这个问题。我们的计算能力跟不上数据的规模。
自然的反应是添加更多工具来解决这些限制。这是我的内部剧本,从之前的经验中得来。每个工具都解决了一个狭窄的问题,但增加了运营复杂性。我们的机器学习管道面临着成为工具集成的拼缝,每个新用例都需要更多的拼缝、更多的故障模式、更高的成本和更多的平台团队开支。
最终为我们解锁了规模的是将数据处理、训练、推理和服务统一到Ray和安世可上。影响是立即的:基础设施成本大幅降低,训练周期显著加快,即使数据量增加,也能够将模型扩展到数量级更大的客户。
是什么动机让您决定在这个阶段加入安世可,您如何看待现场首席技术官在企业人工智能采用的角色?
在Attentive中引入安世可的经验从根本上改变了我构建机器学习平台的方法。在此之前,平台工程的一个重要部分是将分散的系统拼接在一起的成本。有了安世可,我们能够消除大部分开支,转而专注于开发者体验、可靠性和性能。这一转变对团队生产力和系统结果产生了巨大的影响。加入安世可是全职解决这个问题的机会,帮助其他组织应对同样的转变。作为现场首席技术官,我的角色实际上是将这些现实世界的经验转化为客户可以应用的可重复模式,以扩展人工智能。
许多企业仍然停留在人工智能的“试验阶段”。从您的角度来看,什么具体的问题会在公司试图将这些早期实验扩展到生产系统时出现?
当公司将人工智能从实验转移到生产时,破坏的往往不仅仅是模型本身,而是周围的系统和运营。在某些情况下,团队很早就遇到了基础设施限制,无法在所需的规模上进行训练或服务。他们不得不限制模型服务的客户或用例数量。更常见的问题是生产中出现意外的边缘情况或数据变化。一种最常见的故障点是内存:当数据大小、分布或模态发生变化时,作业会耗尽内存并失败。这些问题很难预测,也很难自动恢复。现实是,生产人工智能中故障是不可避免的。目标不是完全避免它,而是快速检测它,理解它,并构建自愈系统来在影响业务之前解决它。
Ray,安世可团队创建的分布式计算框架,正在成为人工智能工作负载的基础。为什么分布式执行成为现代人工智能基础设施的关键层?
分布式执行和工作负载管理已成为人工智能管道的基本要求。现代人工智能工作负载本质上是并行和资源密集的。训练、推理和数据处理都需要在CPU和GPU上协调大量任务,通常是动态的。在今天的计算环境中,管理这些工作负载的复杂性和规模是一个巨大的运营负担。传统的系统并不是为这种复杂性或规模而设计的。像Ray这样的框架至关重要,因为它们允许团队从单台机器无缝地扩展工作负载到成千上万个节点,自动化底层的协调。这一转变反映了人工智能计算的更广泛转变,即基础设施是为人工智能工作负载的模式而设计的,而不是从旧的范式中改编而来。
随着更多公司通过安世可的平台采用Ray,您在标准化统一方法的组织和拼接工具的组织之间看到什么区别?
统一平台和分散工具之间的区别最终归结为专注和效率。当团队依赖多个断开的系统时,他们会花费大量时间将这些系统拼接在一起,管理不一致性,并响应不同环境中的故障。这会产生运营开支并减慢实验速度。相反,统一方法允许团队专注于改进单个系统,从而带来更好的可靠性、更强的性能和更流畅的开发者体验。它还简化了值班和调试过程,因为模式是一致的,容易理解。结果不仅仅是技术效率,还有组织清晰度。
根据您在构建端到端机器学习平台方面的经验,开发者体验(DevEx)在加速团队的人工智能采用的过程中有多重要?
开发者体验是加速人工智能采用的高杠杆领域。当平台团队投资于使系统更易于使用时,通过标准化的工作流程、模板和减少基础设施摩擦,他们放大了组织中每个工程师的生产力。这在人工智能领域尤其重要,因为变化的步伐非常快,团队需要快速迭代以保持竞争力。开发者体验的改进直接转化为更快的实验、更快的上市时间和最终更大的业务影响。人工智能编码工具放大了这些开发者体验的基本原则。在很多方面,这是跨组织增加速度的最可扩展的方法。
随着人工智能工作负载的扩展,成本效率变得越来越重要。企业可以在不牺牲性能的情况下减少基础设施成本的最常被忽视的方法是什么?
随着人工智能工作负载的扩展,成本管理变得更加重要和复杂。最常被忽视的挑战之一是成本如何迅速由于低效率而螺旋式增加,尤其是在基于GPU的基础设施中。大量集群可以启动数千个节点,如果资源没有得到适当的管理或关闭,成本会迅速积累。这会产生一种人工智能特有的扩张,计算使用量的增长速度超过了团队可以跟踪或控制的速度。解决这个问题需要强大的治理、可见性和自动化,例如自动扩缩、自动终止和集中资源管理。在规模上,成本效率不仅仅是一个运营问题,也是系统设计的基本部分。
您曾参与过从特征存储到实时推理系统的工作。您认为批处理和实时人工智能工作负载之间的平衡如何演变?
批处理和实时人工智能工作负载之间的平衡并没有从根本上改变——它仍然是一个商业需求的问题。批处理通常更具成本效益,操作也更容易,因此适用于许多用例。另一方面,实时系统对于延迟直接影响用户体验或业务结果的场景(如聊天应用或欺诈检测)至关重要。两种方法将继续共存,组织的关键是构建支持每种方法的平台。最终,决定取决于成本、延迟和可靠性之间的权衡。
展望未来,2-3年后,成熟的企业人工智能平台将是什么样子?像Ray和安世可这样的工具将如何融入这一未来?
在接下来的几年里,成熟的企业人工智能平台将由几个关键特征来定义。它们将依赖于统一的基础设施来支持整个人工智能生命周期,从数据处理到训练到推理,而不是一系列断开的工具。它们将具有强大的第2天运营,具有代理自动化的可观察性、可靠性和快速调试能力。成本管理将是可预测的和受治理的,允许组织可持续地扩展。也许最重要的是,它们将使开发人员能够快速地从想法到生产。像Ray和安世可这样的平台在这一未来中发挥着核心作用,为实现这一水平的规模和效率提供了人工智能原生的基础。
感谢这次精彩的采访,希望读者可以通过访问安世可来了解更多信息。












