思想领袖
为什么 AI 芯片竞争现在依赖于软件

每个新 AI 加速器都带有一个基准测试故事:峰值吞吐量、瓦特每秒的太运算、令人印象深刻的数字,这些数字承诺这款芯片将改变一切。然而,这些数字忽略了客户是否实际上可以在生产中使用芯片。这是 AI 硬件行业今天的真实故事。它面临着软件成熟度问题,大多数公司还没有准备好公开承认这一点。
没有人谈论的差距
硅开发周期为两到四年,而 AI 模型景观的演变周期以月为单位,趋势向周数发展。其背后是一个价值链问题:从车辆和工厂到医院和设备的最终用例正在功能上成熟,开始产生可衡量的利润和损失影响。这一成熟度驱动了对软件适应性的需求,而这反过来又需要硬件变化。每一层都以根本不同的速度运作,这种不匹配是市场上正在积累的摩擦的根源。用于运行大型语言模型推理的软件栈与早期机器学习工作负载所建造的软件栈根本不同。硬件开发时间表尚未压缩以匹配这一周期。今天发布新硅的公司将其交给客户,但软件无法充分解锁芯片的功能,产生了一个在整个市场上重复的模式:令人印象深刻的硅、不成熟的软件、缓慢的采用和错失的收入。芯片做了它被设计来做的事情。问题是客户无法轻松使用它。
考虑一下发生在汽车行业的事情。汽车本身在 20 世纪中叶基本上已经解决了这个问题,但当软件成为区别时,具有最深制造传统的公司最难适应。福特和通用汽车知道如何制造发动机,但没有建立操作系统的肌肉记忆。AI 硬件行业现在正在经历同样的转变,这个类比令人感到不舒服。英伟达扮演着软件本地化破坏者的角色,而传统的半导体公司仍在努力弄清楚如何将开发者生态系统与硅一起出售。
英伟达的主导地位几乎与拥有最好的芯片无关。CUDA(计算统一设备架构)已经有 20 年的历史,这意味着它有大量的技术债务,但英伟达实际上建立的是 AI 计算的操作系统:一个可预测、成熟的生态系统,开发人员和 OEM 可以在生产中依赖它。
客户根据软件成熟度和集成风险选择平台,因此当新的加速器没有生产级别的软件栈时,商业对话在开始之前就结束了。
(NVDA )到第一个模型的时间,定义为客户在给定的加速器上运行真正的 AI 工作负载的速度,是一个比峰值吞吐量更有意义的商业指标。这是大多数硬件公司最不准备讨论的对话。
真正的市场是推理
商业的本地语言是利润和损失表,每家部署 AI 的公司都需要回答同样的问题:钱在哪里,我怎么才能捕获到它?训练是一个必要的步骤,但商业 AI 生活在推理中,这个市场几乎还没有开始。
这里的规模不对称很惊人。训练涵盖一个用例;推理涵盖无限多个用例。AI 在车辆、工厂、医院、电话或仓库中的每个应用都需要推理。运行在汽车中的安全系统的芯片不能使用数据中心的电力,在工厂车间中运行实时推理的设备不能容忍高延迟。边缘推理市场需要专门为功率效率、物理约束和部署它的行业的安全性和可靠性要求而设计的硅。
谷歌最近决定将其第八代 TPU 分成两个不同的芯片,一個用于训练,另一个用于推理,值得我们深思。这一架构选择承认这两个工作负载已经分歧到足以在单个设计中优化它们,这意味着在两者中都表现出色。 当一个运行一些最大 AI 基础设施的公司决定专用化比整合更重要时,这表明市场的走向:专门用于推理的硅,部署在边缘,具有体积,在现实世界中具有约束,这些约束数据中心基准测试从未设计为测量的。
我们处于推理土地抢占战中,而大多数市场仍然围绕训练组织。
传统的结构限制
能够大规模生产的公司仍然在结构上无法满足推理市场的需求。汽车客户需要供应商保证十年的组件可用性。像英特尔这样的通用半导体公司根本不会做出这样的承诺。这种结构约束使整个行业得不到服务,没有任何谈判可以改变这一点。
英伟达的边缘 AI 平台已经面临来自 PIN 兼容替代品的挑战,这些替代品在不需要更改软件栈的情况下提供更好的每瓦性能。客户可以更换芯片并保留所有其他内容,这对英伟达边缘位置的最具防御性的部分构成了直接的商业攻击。
在 CUDA 上验证概念的公司发现,经济高效的部署需要重新架构到低功耗硅,因为当组织部署成千上万的设备时,单元成本和功耗成为决定性因素。推理市场上正在展开的序列很简单:使用有效的东西,测试它,然后找到一种方法来经济地部署它,因为你需要从中赚钱。考虑到 AI 的采用速度,建立软件和生态系统优势的窗口以季度为单位衡量。
大多数公司跳过的工程投资
AI 硬件公司不断发布强大的芯片,但软件无法充分利用它们。生产级系统软件,包括推理运行时、编译器优化和工作负载启用,需要深入的专业工程,大多数硬件公司根本没有内部的这种能力。
建立这种能力意味着聘请编译器工程师和运行时架构师,他们可以弥合芯片的理论能力和客户实际部署之间的差距。公司还需要在收入证明之前投资工具链,因为到收入到来时,窗口已经关闭。跳过这一投资的公司不仅落后,还会失去交易。
实现规模的芯片是最易部署的芯片,而部署能力是软件质量的函数。主要的下游买家,从 OEM 和超级计算机到企业客户,之前都被集成度不佳的硅伤害过。他们根据生态系统成熟度和集成风险选择。将软件视为一级工程优先级的公司将更多的试点转化为生产合同,并更快地实现收入。将其视为发布附带品的公司则会看着技术上优越的硅因为软件栈不够成熟而失去交易。
时钟已经开始滴答
在下一阶段中可能获得大量份额的 AI 硬件公司正在建立生态系统优势,这些优势将很难被后来者复制。软件灵活性,即在不等待下一个版本的情况下适应新模型架构的能力,区分了在商业上仍然相关的硅和在试点中循环但永远无法产生足够资金来资助下一代的硅。
现在在 AI 硬件领域的工程团队、合作伙伴协议和商业试点中做出的决定,将决定哪些公司在 2028 年仍然相关。CUDA 的 20 年领先优势是建立在生态系统深度基础上的护城河,但任何愿意将软件视为持续工程优先级的公司都可以随着时间的推移建立相同的深度。
行业需要回答的问题是哪些公司正在足够快地移动,以便在其他公司的芯片变得过于根深蒂固而难以取代之前,建立起使其芯片成为默认选择的生态系统深度。
(INTC )











