访谈

Kris Beevers,Netbox Labs 首席执行官兼联合创始人 – 访谈系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Kris Beevers,NetBox Labs 的首席执行官兼联合创始人,是一位拥有二十多年经验的技术企业家和基础设施软件资深人士,专注于网络、云基础设施和自动化领域的公司和平台建设。在领导 NetBox Labs 之前,Beevers 于 2013 年共同创立了 NS1,并担任其首席执行官近十年,将公司打造为网络自动化和应用流量管理技术的领先供应商,直至 2023 年被 IBM 收购。作为此次交易的一部分,NetBox Labs 从 NS1 分拆为独立公司,IBM 成为其投资者。Beevers 早期职业生涯曾在 Internap Network Services 和 Voxel 担任高级工程和架构职务,并共同创立了 SolidJoint Research。

NetBox Labs 开发了一款基础设施智能平台,旨在帮助组织对日益复杂的网络和 IT 基础设施进行建模、运营、自动化和治理。该公司是 NetBox 的商业维护者,NetBox 是被超过 10,000 家组织广泛采用的开源网络和基础设施记录系统。其平台将基础设施图谱和真相源与运营智能、自动化、AI 辅助编排以及治理功能相结合,使工程师和 AI 代理能够安全地与基础设施交互。NetBox Labs 支持云部署、自管企业、混合以及 air‑gapped(隔离)部署,并可与 Ansible、Terraform、Nornir 以及持续集成和部署流水线等工具集成。

您于 2013 年共同创立了 NS1,并在其被 IBM 收购前花费近十年时间建设公司,随后 NetBox Labs 作为独立公司出现。构建 NS1 的哪些经验影响了您创立 NetBox Labs 的原因?在 AI 时代,您试图解决的基础设施问题有何变化?

我在构建 NS1 时学到的一件事是,基础设施问题很少能够保持整洁的边界。DNS 是我们技术栈的一部分,但我们的客户在运营这些极其复杂的环境,网络、数据中心、应用程序和自动化彼此相互依赖。我与这些团队相处的时间越多,就越清楚地认识到,理解基础设施本身是一个更大的问题。

这正是吸引我加入 NetBox 的重要原因。已经有一个被广泛采用的开源项目以及使用它来建模已有资源、连接方式和预期结构的工程师社区。我们看到了在此基础上进一步构建的机会。

AI 带来的变化主要体现在速度和规模上。基础设施团队被要求在极短时间内构建庞大的环境,而底层技术同样在快速演进。与此同时,我们开始对基础设施的运营进行更多自动化,这预示着令人振奋的未来。随着 AI 应用于基础设施,IT 团队意识到必须拥有关于其基础设施的良好实时数据以进行自动化,并且需要了解预期状态的模样,以便 AI 能帮助他们识别运营基础设施何时偏离计划。

因此,NS1 的经验仍然适用。要想有效地自动化基础设施,首先必须了解它。AI 只会让这一点变得更加紧迫。

在过去的十多年里,云计算使开发者和基础设施团队能够抽象掉其应用之下的物理硬件。为何 AI 正在扭转这一趋势,迫使 DevOps、站点可靠性工程(SRE)以及网络工程师重新关注电力、制冷、机架、布线和物理网络?

云让我们很多人把基础设施视为几乎是无限的。你请求计算资源,它就会出现。你不必关心服务器位于何处、如何供电、如何冷却,或者其下所有物理部件是如何组合的。

AI 基础设施并不能真正让你如此操作。

在构建这些环境时,你会先面对一些相当具体的物理问题。我的土地有多少?能获取多少电力?可以支持何种制冷?随后你会涉及机架、GPU 服务器、交换机、光纤布线,最终进入逻辑层面,如 IP 地址、配置和软件。

这些因素相互依赖。不了解电力和制冷密度,就无法决定部署多少机架。也不能将 GPU 与其连接的网络独立考虑。

这迫使那些多年远离物理层的学科重新参与其中。抽象层并未消失,但其下的物理约束突然变得尤为重要。

AI 数据中心正日益以千兆瓦规模被讨论。当基础设施从传统企业或云环境转向围绕庞大 GPU 集群设计的设施时,运营上会出现哪些根本性的变化?

千兆瓦级别的规模确实是天文数字。虽然规模显而易见地不同,我认为更有趣的差异在于所需的协调量。

想象一下,要让一个 300 兆瓦的数据中心投入运营需要做哪些工作。你需要土地和电力。然后必须设计设施并采购机架、GPU 服务器、交换机、光纤、电力基础设施和冷却设备,这些往往来自完全不同的供应商,且它们的产品表示方式也截然不同。所有这些设备必须到货、验收、上架、布线、配置、测试,最终交付用于训练或推理。

在你进行这些工作的同时,形势也在不断变化。GPU 架构在变更,网络在变更,冷却需求在变更。六个月后可用的组件可能已经不是你今天所设计的那些。

因此,细小的低效会迅速累积。我最近与全球最大的光纤光缆制造商之一交流,他们告诉我,他们最大的业务问题之一是因客户订购错误的光缆长度而导致的退货。这听起来几乎微不足道,直到你需要订购数十万根光缆时才会感受到其影响。

在如此规模下,基础设施运营成为一个巨大的物流与约束满足问题。能够做好这件事的公司,往往在整个采购、部署和运营过程中,能够精准地传递设计数据。

您曾表示,在如此规模的基础设施运营中,实际上没有成熟的操作手册或人才渠道。当前最难寻找的技能是什么?随着 AI 基础设施的扩展,您预计最大的 人才短缺会出现在何处?

目前全球可能只有几百人真正了解如何以这种速度和规模构建此类基础设施。而且他们大多数都在忙于实际操作。

这正是使得此时此刻与众不同的原因之一。没有一套成熟的知识体系可以直接学习。从事这项工作的人们相互学习,实时摸索。而且由于技术变化极快,其中一些经验教训会很快变得过时。

我认为人才短缺的范围因此超越了单一职位。我们需要既懂网络、计算和自动化,又日益了解这些系统所处的物理环境的人才。电力、冷却、设施设计、供应链和现场运营正逐渐成为同一讨论的话题。

能够跨越这些边界的人将极具价值。但我认为我们甚至还没有确定这些角色的具体形态。人才模型正与基础设施同步构建。

随着软件、网络、设施、能源和数据中心工程之间的界限日益模糊,您预计会出现哪些新的技术角色或混合技能组合?

我认为我们还不清楚这些角色的具体形态。我们知道的是,构建这些基础设施的人必须考虑比以往更广泛的问题集合。

你不能只单独考虑计算或网络。电力、冷却、物理设计、供应链、网络和自动化必须协同工作,才能让这些环境上线并持续运行。

我仍然认为我们需要在每个领域拥有深厚专业知识的人才。但他们还必须了解本领域的决策如何影响整个基础设施。由于大量工作必须更快完成,自动化能力将在更多学科中变得重要。

AI 代理正开始诊断问题、生成配置并自动化基础设施运营的部分环节。您认为 AI 实际上会接管基础设施工程师的哪些职责,而哪些职责会更加依赖深度的人类专业知识?

我认为,当输入、期望结果和边界明确时,大量工作将越来越多地由 AI 处理。生成配置就是显而易见的例子。诊断常见问题、检查基础设施是否符合预期设计,甚至在对错误原因及安全响应有足够信心时自动修复特定问题,也都属于此类。

当答案并不显而易见时,人类的作用就更加重要。

基础设施会以奇怪的方式失效。光纤被切断,设备表现与设计要求不符,某项变更在环境的其他地方产生意外影响。AI 可以帮助工程师更快地理解这些情况,但仍然需要对系统有深入了解的人来决定下一步该怎么做。

我认为这正是有趣的转变。工程师可能会把更少的时间花在重复的配置和故障排除上,而把更多时间用于定义意图、设计系统、设定自动化边界以及处理真正的新颖问题。所有这些工作都会得到 AI 的辅助,但仍由人来主导。

这使得专业知识更加珍贵,而非贬值。当自动化没有明显答案时,真正了解基础设施为何如此运作的工程师将变得极其重要。

NetBox Labs 认为,管理基础设施的 AI 系统需要一个权威的设备、连接、依赖关系以及其他物理和逻辑关系模型。在从提供建议的 AI 助手转向能够实际执行操作的代理时,这种基础设施上下文为何如此重要?

关键的区别在于,一旦代理能够行动,错误就会产生真实的后果。

基础设施代理需要的不仅是设备当前状态的快照。它必须了解其周围的环境:存在哪些资源,如何相互连接,最近有哪些变化,以及最重要的,基础设施应当是什么样子。

以排查连通性问题为例,仅知道某个设备不可达是不够的。你希望代理能够追踪电缆路径,了解该设备周围的依赖关系,查看最近的变更,并在提出下一步建议之前判断还有哪些可能受到影响。

这正是我们在 NetBox Labs 多年来致力构建的基础,为团队提供了物理和逻辑基础设施的精准模型,并包含其应如何运行的意图。

但仅有数据并不足够。还需要决定代理可以自行执行的操作、哪些需要人工批准,以及如何对每一次操作进行追踪和验证。

基础设施不同于代码,后者的错误更改往往可以干净地回滚。一次错误的更改可能导致整个业务中断。因此,当我们从仅向工程师提供想法的 AI 转向能够实际执行工作的 AI 时,上下文和控制变得尤为重要。

在您的最近的 CIO 文章,《Why I, the CEO, am personally building our AI strategy》,您指出 AI 对公司领导者而言过于重要,不能仅仅委托,并描述了亲自使用 AI 工具进行原型设计。亲自操作这些系统后,您对 AI 在基础设施运营中能够实际实现的自动化程度有何新的看法?

亲自实践会让你对理论性的讨论兴趣大减。

我花了大量时间实际使用这些工具,最近通常是使用 Claude Code 进行原型设计,甚至构建完整的产品。你会很快意识到,观看一个令人印象深刻的演示与构建一个真正可信、能完成有用工作的系统之间存在巨大的差距。

你还能直观感受到技术发展的速度,这远快于通过阅读了解的速度。六个月前我认为难以实现自动化的事情,突然变得相当简单。与此同时,你也能清晰地看到仍然缺乏上下文、判断力和结构的地方。

这影响了我对基础设施运营的思考。我对我们能够自动化的运维工作量持非常乐观的态度,但我认为距离最终的完全自主仍有相当距离。

我关心的问题更为根本。这能否帮助我们更快、更可靠或更高效地运营基础设施?如果能,那很好;如果不能,背后的 AI 多么先进也无关紧要。

随着 AI 数据中心越来越受到电力供应和冷却需求的限制,基础设施工程是否会从主要管理计算资源转变为主动协调工作负载与能源及物理容量?

是的,我们已经开始看到这种趋势。我们内部有一句话,“停车场的涡轮机”,源自与某个构建超大规模 AI 基础设施团队的真实对话。他们上线基础设施的速度如此之快,以至于电网跟不上,于是他们真的去购买涡轮机并把它们放在停车场,以获得足够快速的电力供应。

这正是这些团队所处的环境。当电力成为你的主要约束之一时,你必须更加聪明地利用现有资源。需求侧响应,即运营商根据电网变化主动协调 AI 工作负载,已经在实施,并正成为运营高功耗基础设施的团队日益重要的能力。

并非所有工作负载的需求都相同。对延迟敏感的推理可能需要保持在线,而某些训练或批处理工作负载在电力受限时可以被转移或暂停。我认为我们将越来越多地看到基础设施团队将计算、能源和物理容量视为同一运营问题的组成部分进行管理。

展望未来,您认为 AI 扩展的最大瓶颈最终是 GPU 和模型开发,还是寻找足够的电力、物理基础设施、网络容量、自动化以及熟练工程师来支撑其背后所有工作这一更广泛的挑战?

我认为不会只有单一的瓶颈。

以当前市场所需的速度和规模构建 AI 基础设施,本质上是一个约束满足问题。在任何时刻,总会有某个因素成为主要约束。

有一段时间,大家都在讨论 GPU。显然,算力是当前的巨大瓶颈。但瓶颈也可能是网络设备、冷却、土地、光纤、采购、建设,或者仅仅是找不到足够懂得如何将这些组合在一起的人。

一旦解决了一个约束,另一个约束就会变得更加明显。当需求远远大于供给时,就会出现这种情况。

所以我不会押注于某个永久性的瓶颈。我认为更重要的能力是能够随着约束的转移而适应。

这也是我认为目前没有人拥有 AI 基础设施的 definitive playbook 的原因。构建它的人正在边扩展边摸索,而且他们的进展速度惊人。

感谢这次精彩的采访,想了解更多的读者请访问 NetBox Labs

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。