并购

d-Matrix 收购 Wallaroo 以跨芯片编排推理

mm
将 Unite.AI 添加到您在 Google 上的首选来源

d-Matrix 已收购 Wallaroo.ai,一家为部署和编排 AI 推理而开发软件的公司,该交易于 2026 年 8 月 3 日由圣克拉拉芯片公司 宣布。该收购将 Wallaroo 的平台、知识产权和工程人员带入 d-Matrix,这是芯片制造商四个月内的第二次收购。

这种推理来自于 d-Matrix 销售硅的方式。其 Corsair 加速器旨在与 GPU 并行工作,而不是取代它们,处理语言模型请求的解码阶段,即每次发出一个令牌的内存绑定半部分,而 GPU 处理预填充的计算密集型部分。在实时集群中使这种分割工作是一个软件工作:某些东西必须决定哪个芯片获得每个请求的哪个部分,在它们之间传递累积的上下文,并独立地扩展两个层以适应流量的变化。这就是 d-Matrix刚刚购买的层。

Wallaroo 的贡献

Wallaroo 销售一个服务运行时和一个控制平面,用于打包模型并将其推送到 x86、Arm 和 GPU 硬件,跨云、内部、边缘和完全空气隔离环境,支持常见的 LLM 运行时,包括 vLLM 和 SGLang。其工程、产品和上市团队将加入 d-Matrix,后者引用了他们在软件架构、高性能计算和 Kubernetes 操作方面的工作。

两家公司已经在描述相同的架构。在 2026 年 3 月 16 日的一篇 工程帖子 中,Wallaroo 的创始人和首席执行官 Vid Jain 和两位同事提出了将预填充与解码分离在混合硅上进行的理由。代理流量,他们写道,到达三种大小:大约 84% 的请求约为 2,000 个令牌,约 15% 的请求在 8,000 到 64,000 个令牌的范围内,少于 1% 的请求有 128,000 个令牌或更多。最后一部分垄断了 GPU 时间,并阻塞了所有排队在其后面的请求。仅仅是缓存感知路由,就在他们自己的测试中将最坏情况下的首个令牌时间减少了 75%。

Sid Sheth,d-Matrix 的创始人和首席执行官,表示客户曾告诉公司,最大的障碍“不仅仅是性能,还包括到达那里所需的运营复杂性”。Jain 表示,两家公司都认为推理同样是部署问题和硅问题。

四个月内的两笔交易

d-Matrix一直在购买它没有构建的推理系统的组件。2026 年 4 月,它 收购了 GigaIO 的数据中心业务,获得了 SuperNODE 系统和 FabreX PCIe 基础内存结构,以及加利福尼亚州卡尔斯巴德的一支机架级系统团队,而 GigaIO 在边缘计算中继续独立运营。Corsair 本身 于 2026 年 6 月 9 日进入全面生产,由 Alchip 在 TSMC 的 N6 节点上制造,使用基于 SRAM 的内存计算芯片和 LP-DDR5 内存代替 HBM 堆栈和 CoWoS 封装,在空冷运行的机架中。

为此付费的是 2025 年 11 月 12 日以 20 亿美元估值关闭的 2.75 亿美元 C 轮融资,由 BullhoundCapital、Triatomic Capital 和 Temasek 共同领投。该公司还一直在平台周围组装合作伙伴,包括 与英飞凌的低延迟基础设施合作伙伴关系

购买部署层正在成为任何非英伟达 [证券股票价格标签符号 = “NVDA” 交易所 = “纳斯达克”] 计算的标准举动。 高通于 2026 年 7 月关闭了对编译器初创公司 Modular 的全股票收购 [证券股票价格标签符号 = “QCOM” 交易所 = “纳斯达克”], Nscale 于同月购买 Anyscale 以升级计算堆栈Nebius 同意以 6.43 亿美元的价格收购 Eigen AI 以加强推理基础设施。需要第二个软件堆栈才能有用的硅失去了需要一个软件堆栈的硅。

配对的测试地点

到目前为止的商业证明点是 Parasail,一家于 2026 年 7 月 7 日表示正在 部署 Corsair 与其 NVIDIA Hopper 和 Blackwell 舰队 (NVDA ) ,将预填充发送到 GPU,将解码发送到加速器,跨越一个网络,利用 15 个国家的 40 多个数据中心。Parasail 自己的内核路由技术在那里执行调度,这正是 d-Matrix 现在在内部拥有的功能。

性能案例基于 Gimlet Labs 于 2026 年 3 月 11 日发布的结果。使用 gpt-oss-120b 和 1.6 亿参数的草稿模型,该公司将推测解码步骤从 GPU 移到 Corsair,而预填充和验证保持在 GPU 上,并报告在匹配的能效下实现了 2 倍至 10 倍更快的端到端请求。Gimlet 将增益归因于卡片的 2GB 内置 SRAM 和大约 150 TB/s 的内存带宽,这使得草稿模型能够快速生成候选令牌,以至于被拒绝的猜测成本很低。其中一位合著者是 d-Matrix 的首席技术官 Sudeep Bhoja。

Corsair 现在正在向优先客户大量发货,d-Matrix 正在招聘多个专业的工程师,因为两家公司正在合并。混合 GPU 和加速器机架的下一个买家将根据模型从评估到服务流量的速度来判断它,而现在由 d-Matrix 拥有的软件正在运行这个时钟。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。