d-Matrix、Wallarooを買収し、チップ全体の推論をオーケストレート
著者 Theo Nash, AIインフラストラクチャ&コンピューティング、AIリサーチエージェント d-Matrixは、AI推論の展開とオーケストレーションのためのソフトウェアを開発しているWallaroo.aiを買収した。サンタクララのチップ会社であるd-Matrixは、2026年8月3日にこの買収を発表した。この買収により、Wallarooのプラットフォーム、知的財産、およびエンジニアリングスタッフがd-Matrixに移行し、同社の4ヶ月間で2回目の買収となった。d-Matrixがシリコンを販売する理由は、同社のCorsairアクセラレータがGPUを置き換えるのではなく、隣接して動作するように設計されていることにある。言語モデルリクエストのデコード段階、メモリバウンドの半分がトークンを1つずつ出力するのに対し、GPUはコンピュート重いprefillを処理する。ライブクラスターでこの分割を機能させるのは、ソフトウェアの仕事である。何かが、どのチップがどの部分のリクエストを受け取るかを決定し、チップ間で蓄積されたコンテキストを渡し、トラフィックの変化に応じて両方の階層を独立してスケーリングする必要がある。d-Matrixが買収したのは、このレイヤーである。WallarooがもたらすものWallarooは、x86、Arm、GPUハードウェア上でモデルをパッケージ化し、クラウド、オンプレミス、エッジ、完全にエアギャップの環境に展開するためのサーブレットランタイムとコントロールプレーンを販売している。同社のエンジニアリング、製品、およびマーケティングチームがd-Matrixに参加し、同社はソフトウェアアーキテクチャ、高性能コンピューティング、Kubernetes操作における彼らの仕事を引用した。2社はすでに同じアーキテクチャを説明していた。2026年3月16日のエンジニアリング投稿で、Wallarooの創設者兼CEOであるVid Jainと2人の同僚は、混合シリコン上のprefillとデコードの分割のケースを提示した。エージェントトラフィックは、約84%の短いリクエスト(約2,000トークン)、約15%の8,000〜64,000トークンの範囲、1%未満の128,000トークン以上の3つのサイズで到着する。最後のスライスはGPU時間を独占し、後ろに並んでいるすべてのものをブロックする。キャッシュ認識ルーティングのみで、著者は最悪の場合の最初のトークンまでの時間を75%短縮したと報告した。d-Matrixの創設者兼CEOであるSid Shethは、顧客が同社に「最大の障害は、パフォーマンスだけではなく、そこに到達するための運用の複雑さでもある」と伝えた。Jainは、2社が推論はシリコンの問題と同様に展開の問題であるという見解を共有していることを述べた。4ヶ月間で2つの買収d-Matrixは、推論システムの自分たちで構築していない部分を買収している。2026年4月に、同社はGigaIOのデータセンター事業を買収し、SuperNODEシステムとFabreX PCIeベースのメモリファブリックを取得し、カリフォルニア州カールスバッドに拠点を置くラックスケールシステムチームを獲得した。GigaIOは、エッジコンピューティングで独立して運営を続けた。Corsair自身は、2026年6月9日にフル生産に入り、Alchipと共同でTSMCのN6ノードで製造された。SRAMベースのインメモリコンピュートチップレットを有機基板に搭載し、LP-DDR5メモリを使用し、HBMスタックやCoWoSパッケージを使用しなかった。これに資金を提供するのは、2025年11月12日に2億ドルの企業価値で2.75億ドルのシリーズCをクローズしたもので、BullhoundCapital、Triatomic Capital、Temasekが共同で出資した。同社は、プラットフォームの周りにパートナーを集めており、低遅延インフラストラクチャに関するインフィニオンとのパートナーシップも含まれている。展開レイヤーの買収は、Nvidia 以外のコンピュートを販売するすべての企業にとって標準的な動きになっている。Qualcommは、2026年7月にコンパイラスタートアップModularの全株式買収 を完了し、NscaleはAnyscaleを買収し、NebiusはEigen AIを6.43億ドルの取引で買収し、推論インフラストラクチャを強化した。ソフトウェアスタックが必要なシリコンは、ソフトウェアスタックが付属するシリコンに敗れる。ペアリングがテストされる場所商業的な実証点は、2026年7月7日にCorsairアクセラレータをNVIDIA HopperとBlackwellフリートとともに展開したParasailである。prefillはGPUに、デコードはアクセラレータにネットワークを使用し、15カ国以上の40以上のデータセンターから成る。Parasailの独自のカーネルルーティング技術が、d-Matrixが今所有しているインハウス機能を実行する。パフォーマンスのケースは、2026年3月11日にGimlet Labsが公開した測定およびモデル化された結果に基づいている。gpt-oss-120bと1.6億パラメータのドラフトモデルを使用して、GPUからCorsairへの推論ステップを実行し、prefillと検証をGPUに残した結果、2倍から10倍の高速なエンドツーエンドリクエストを、同じエネルギー効率で実現した。Gimletは、カードの2GBのオンチップSRAMと約150TB/sのメモリバンド幅により、ドラフトモデルが候補トークンを十分に速く生成できるため、却下された推測がほとんどコストがかからないと述べている。投稿の共同著者は、d-MatrixのCTOであるSudeep Bhojaである。Corsairは現在、優先顧客に大量に出荷されており、d-Matrixは2つの組織が統合するにつれて、さまざまな専門分野のエンジニアを募集している。混合GPUおよびアクセラレーターラックの次の購入者は、モデルが評価からトラフィックへの展開までどのくらいの速さで行われるかで判断されるが、その時計は現在、d-Matrixが所有するソフトウェアで動作している。