访谈
Bing Xu,INT21 创始人兼 CEO – 访谈系列

Bing Xu,INT21 的创始人兼 CEO,是一位在 GPU 优化、机器学习系统以及自主 AI 代理方面拥有深厚经验的 AI 基础设施工程师和企业家。在 2026 年创立 INT21 之前,徐曾在 NVIDIA 担任杰出工程师,致力于基于代理的软件开发,并打造了多代编码代理,包括 VibeTensor 和 AVO 背后的工作。NVIDIA 收购他创立并担任 CEO 的 GPU 推理初创公司 HippoML 后,他加入了 NVIDIA。此前,徐在 Meta 担任高级员工软件工程师,创建了 AITemplate 并帮助提升生产工作负载下的 GPU 推理效率,还曾在 OctoML、Facebook AI、Apple 和 Turi 担任工程和研究职务。他的职业生涯始终聚焦于改进现代 AI 系统底层的软件和基础设施。
INT21 正在构建自我改进的 AI 基础设施,旨在利用自主代理群体持续开发、测试、基准测试并优化驱动 AI 工作负载的软件。当前的重点是 Inference Engine Factory,该项目使用专用代理并行探索优化策略,构建涵盖 CUDA 与 PTX 内核、驱动程序以及服务基础设施的完整推理引擎,并在目标硬件上直接验证性能。公司的技术基于 SwarmOS——一个云原生平台,能够让大量代理围绕可度量的工程目标协同工作,并在不同代际之间保留证据和经验。INT21 最初通过 PTX Kernel Factory 展示了这一方法,该工厂在 NVIDIA Hopper 与 Blackwell 硬件上生成并基准测试 GPU 内核;此后公司将计算资源转向优化完整的推理引擎。
您在多次遇到难以快速招聘到专门的基础设施工程师以构建和优化 AI 系统的困境后创立了 INT21。是什么让您相信解决方案不是更好的开发者工具,而是能够自行承担这些工作的自主、自我改进的代理群体?
众所周知,AI 基础设施人才在各细分方向的需求远远超过供给,这也是我亲身经历的挑战。这促使我将自我改进的代理群体视为一种可行方案。过去几年里,我一直在研发自我改进的 AI 解决方案,如今技术进展迅猛,这些系统已经足以自主构建、运行并优化基础设施。
INT21 的核心理念是,像人类一样,代理通过累计知识变得更聪明。这与传统开发者工具根本不同,后者仍受限于人力工作时长和可解决的问题范围。使用自我改进的代理群体意味着每一次生产循环我们都更快、更精准、更高效。由于我们的代理具备能力且不受现有框架限制,我们可以为每个特定工作负载从零开始构建解决方案。
在创立 INT21 之前,您创办了 HippoML,该公司在推出仅 14 个月后被 NVIDIA 收购,随后您成为 NVIDIA 的杰出工程师。这些经历让您对 AI 基础设施瓶颈有何认识,进而塑造了 INT21 的架构和使命?
在 HippoML,我们专注于高性能生成式 AI 推理,构建软件优化工具以更快、更高效地运行大语言模型。我们意识到,如果不依赖来自东欧等地区的优秀外包人才,就无法满足 AI 推理优化的需求。
被 NVIDIA 收购后,我在公司内部开始构建基于代理的开发方法。我们发表了研究,证明了“外壳”(围绕模型的基础设施层)才是真正决定代理性能的因素,而非模型本身。这表明 AI 基础设施的真正瓶颈不在于寻找更好的模型,而在于优化运行模型的系统。
随着模型的提升,围绕它们的基础设施也必须同步扩展。但人为驱动的优化循环难以跟上速度。你为某一模型架构优化训练循环、部署后,如果模型架构变化或出现新一代 GPU,就必须重新开始。如今每周似乎都有新模型更新,这种旧方式已不可持续。正是这一认识让我确信下一次突破在于自我改进的基础设施,这也促使我创立了 INT21。
INT21 将其方法称为“自我改进的基础设施”,这与研究人员试图让底层 AI 模型本身更强大的递归自我改进截然不同。您的方法是如何运作的,为什么您认为改进现有模型周围的系统能更快带来实质性收益?
递归自我改进侧重于训练专有模型、组建研究团队并筹集巨额资本。这是一条耗时十年、成本高昂的道路,因为它要求模型自行推理其训练过程。
我们的做法不同。INT21 并不试图提升前沿模型本身——那需要多年时间和数十亿美元的投入。我们构建的是优化“外壳”的代理群体,即位于模型与性能之间的基础设施层。我的 Nvidia 研究已经证明:决定代理在复杂任务上表现的,是外壳而非模型。代理无需了解前沿模型的能力,只需在设计空间中探索、测量、验证并保留有效方案,即可实现 10% 的效率提升。
可以把两种方法类比为:一种是建造发电站,另一种是利用已有的电力进行建设。我们可以更快行动,满足真实且迫切的需求。目前我们已经在自我改进的基础设施上看到显著且可量化的收益。
INT21 最近推出了 Inference Engine Factory,将概念从单个 GPU 内核扩展到完整的推理引擎。让代理群体自主构建并优化推理引擎到底意味着什么?在传统上,哪些环节最需要高度专业的人类专长?
推理引擎是运行模型于硬件上的软件。它是一个复杂系统,需要一次性做出数十项设计决策,例如哪些操作在同一内核中一起执行,或者如何在核心之间调度工作。这些决策相互关联,改动其中一项就必须重新验证其他所有内容。
传统上,工程师会为每个模型手动调优所有这些细节。对于视频、音乐和语音生成等多阶段、多尺度的架构,这尤其困难,因为市面上没有现成的框架可用。INT21 的代理群体从单个内核到完整推理引擎全链路构建,视频和音频生成堆栈无需人工代码审查,且在相同并发设置下性能超越业界最先进的推理方案。
您的 PTX Kernel Factory 已经在某些工作负载上实现了高达 59% 的性能提升。技术层面上,代理们发现了哪些人类高度优化实现或传统编译器遗漏的性能提升点?
我们的 PTX Kernel Factory 在 KDA(Kimi Linear Attention)基准上相较最佳可用基线提升了最高 59%。这归功于我们的自我改进代理群体能够在极短时间内扩展到数千种变体,而这对人类工程师而言既繁琐又成本高昂。
不同之处在于,人类编写的内核依赖于为 GPU 预构建的领域特定语言(DSL)、模板和编译器。DSL 对常见模式表现良好,但面对新工作负载(如 KDA)时,通用编译器往往无法实现最佳优化。我们的代理直接绕过这些抽象层,不受 DSL 或编译器假设的限制。正是这种不受预定义模式束缚、自由探索完整设计空间的能力带来了性能提升。
AI 生成的基础设施会带来一种特殊的验证难题:如果优化更快但存在细微错误则毫无价值。您的代理群体如何进行测试、基准、剔除失败案例并保留成功发现?这一反馈回路对让系统真正自我改进而非仅仅是 AI 编码代理有多重要?
反馈回路至关重要,因为如果优化仅在特定假设或特定输入分布下有效,就毫无价值。INT21 确保反馈回路严谨可靠。
我们从模型、部署约束和关键服务指标出发。随后,自我改进的代理群体同步探索配置和优化路径,并对每个候选方案进行正确性与性能目标的评估。只有通过验证的实现才会被保留下来。
真正的自我改进体现在验证数据本身也在不断提升。这些数据会反馈给代理群体,使其不断完善对有效方案的认知,形成闭环。若缺少这套严谨机制,系统只能产生看似可行的 AI 代码,虽然交付更快,却会累积技术债务,侵蚀对构建成果的信任。
在 NVIDIA,您参与了包括 VibeTensor 和 Agentic Variation Operators 在内的项目,这些项目让代理生成了大量系统软件并自主搜索 GPU 优化。它们揭示了哪些 AI 代理已经能够解决的工程问题,而许多开发者仍认为必须由人类专家完成?
VibeTensor 给我留下了“弗兰肯斯坦效应”的印象。AI 在每个层面都能完成正确工作,但将所有部件拼凑成系统时,仍达不到人类专家的水平。
相反,Agentic Variation Operators 的工作则显示 AI 在高度限定的问题上可以超越人类专家。内核生成就是一个典型例子,因为该问题范围窄、可度量且目标单一。
“弗兰肯斯坦效应”正是 INT21 要解决的痛点。我们 Inference Engine Factory 的工程样例在性能上已经超过了诸如 SGLang、vLLM 等高性能开源推理引擎,因为我们学会了正确地构造问题。我们为代理设定明确的约束、可度量的目标以及紧密的反馈回路。人类专家仍然必不可少,但他们的角色从具体优化转向提供方向性指导和结果解释。AI 通过更快、更系统化的执行放大了专家的影响力。
INT21 使用多个专用代理,而不是依赖单一拥有不断增大的上下文窗口的代理。为何您认为多代理编排在解决复杂工程问题时更具可扩展性?这些代理如何分工、共享发现并避免相互重复或冲突?
更大的上下文窗口可以一次持有更多信息,但并不能帮助解决多维度、相互关联的问题。我们使用云原生平台运行专用代理,所有代理围绕同一可度量目标协同工作。它们并行探索,并持续收敛到更强的解决方案。
这在多方面更具可扩展性。首先,每个代理保持专注。其次,单一代理不必一次性推理所有内容,效率更高。最后,这与基础设施团队的实际工作方式相吻合——每个团队负责自己的领域,只有在决策相互影响时才同步。
如果代理群体能够持续优化内核、推理引擎、编译器以及 AI 堆栈的其他层级,基础设施工程师的角色会如何变化?您是否预见这些系统最初是为缓解专门工程师短缺而设计,最终会自动化大部分基础设施开发工作?
基础设施工程师的工作将彻底转变。他们不再埋头于内核代码和内存调优,而是设定目标、定义设计空间、建立约束并解释结果。
随着时间推移,维持系统运行和改进所需的工程师数量会下降。但留下来的战略性工作将更有价值,而非更少。实际上,这意味着企业可以用远少于当前需求的专门工程师来运营复杂的 AI 基础设施,这对所有构建生产 AI 系统的公司都意义重大。
您的长期愿景是让自我改进的代理群体遍及 AI 基础设施的每一层。若该愿景实现,整个堆栈会是什么样子?我们是否最终会看到 AI 基础设施在模型、工作负载和硬件变化时持续自行重写和优化?
目前,AI 堆栈的每一层都在独立优化——从底层内核到基础框架再到接口,但它们之间缺乏协同。于是你可能在某一层取得优化,却意外破坏了下游的其他层。
在 INT21,我们的愿景是让代理群体能够在所有层级之间自主协同,持续调整和适应。当新模型出现时,整个堆栈会为其重新优化,使基础设施永远跟得上运行的模型。
这在过去难以实现,因为人类工程师的速度跟不上。但有了持续优化的代理群体,自我改进的基础设施正成为一个独立的计算类别。能够与模型和硬件变化同速适应的基础设施将脱颖而出,其他一切都将成为负担。
感谢这次精彩的访谈,想了解更多的读者请访问 INT21。












