Overnames

d-Matrix koopt Wallaroo om inferentie over chips te orkestreren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

d-Matrix heeft Wallaroo.ai overgenomen, een maker van software voor het implementeren en orkestreren van AI-inferentie, in een overeenkomst die het bedrijf uit Santa Clara op 3 augustus 2026 aankondigde. De overname brengt Wallaroo’s platform, intellectueel eigendom en ingenieursstaf naar d-Matrix, en het is de tweede overname van de chipfabrikant in vier maanden.

De redenering volgt uit hoe d-Matrix silicium verkoopt. De Corsair-acceleratoren zijn ontworpen om naast GPUs te draaien in plaats van ze te vervangen, door de decodeerfase van een taalmodelaanvraag te nemen, het geheugengebonden deel dat tokens een voor een uitgeeft, terwijl de GPUs het compute-zware prefill afhandelen. Het maken van die splitsing werkt in een live-cluster is een softwaretaak: iets moet beslissen welke chip welk deel van elke aanvraag krijgt, de geaccumuleerde context tussen hen doorgeeft en beide lagen onafhankelijk schaalt terwijl het verkeer verschuift. Die laag is wat d-Matrix zojuist heeft gekocht.

Wat Wallaroo biedt

Wallaroo verkoopt een serving-runtime en een controlelaag die modellen verpakken en naar x86-, Arm- en GPU-hardware pushen in cloud-, on-premises-, edge- en volledig air-gapped omgevingen, met ondersteuning voor veelvoorkomende LLM-runtimes, waaronder vLLM en SGLang. De ingenieurs-, product- en go-to-marketteams van het bedrijf voegen zich bij d-Matrix, dat hun werk in softwarearchitectuur, high-performance computing en Kubernetes-bewerkingen noemde.

De twee bedrijven beschreven al hetzelfde architectuur. In een engineeringspost van 16 maart 2026 legden de oprichter en CEO van Wallaroo, Vid Jain, en twee collega’s het geval uit voor het splitsen van prefill van decode over gemengd silicium. Agentic-verkeer, schreven ze, arriveert in drie maten: ongeveer 84% korte aanvragen van ongeveer 2.000 tokens, ongeveer 15% in het bereik van 8.000 tot 64.000 tokens en minder dan 1% op 128.000 tokens of meer. Die laatste schijf monopoliseert GPU-tijd en blokkeert alles wat erachter in de wachtrij staat. Cache-aware routing alleen, meldden de auteurs, verlaagde de worst-case tijd-tot-het-eerste-token met 75% op agentic-verkeer in hun eigen tests.

Sid Sheth, de oprichter en CEO van d-Matrix, zei dat klanten het bedrijf hadden verteld dat de grootste barrière “niet alleen prestaties is, maar ook de operationele complexiteit om daar te komen.” Jain zei dat de twee een mening deelden dat inferentie evenzeer een implementatieprobleem is als een siliciumprobleem.

Twee overnames in vier maanden

d-Matrix heeft de onderdelen van een inferentiesysteem gekocht die het zelf niet had gebouwd. In april 2026 verwierf het de datacenterbusiness van GigaIO, waarmee het het SuperNODE-systeem en de FabreX PCIe-gebaseerde geheugenvoering kreeg, evenals een rack-schaalteam in Carlsbad, Californië, terwijl GigaIO onafhankelijk bleef in edge computing. Corsair zelf ging op 9 juni 2026 in volledige productie, gefabriceerd door Alchip op TSMC’s N6-knooppunt, met SRAM-gebaseerde in-memory compute chiplets op organische substraten met LP-DDR5-geheugen in plaats van HBM-stacks en CoWoS-verpakking, in racks die luchtkoeling gebruiken.

De financiering hiervoor is een $275 miljoen Series C-overeenkomst die op 12 november 2025 werd gesloten tegen een waardering van $2 miljard, geleid door BullhoundCapital, Triatomic Capital en Temasek. Het bedrijf heeft ook partners rond het platform verzameld, waaronder een partnership met Infineon voor lage-latentie-infrastructuur.

De overname van de implementatielaag wordt de standaardbeweging voor iedereen die niet-Nvidia (NVDA ) compute verkoopt. Qualcomm sloot zijn volledige aandelenovername van compiler-startup Modular (QCOM ) in juli 2026, Nscale kocht Anyscale om hogerop de compute-stack te komen dezelfde maand, en Nebius kwam overeen om Eigen AI over te nemen in een overeenkomst van $643 miljoen om de inferentie-infrastructuur te versterken. Silicium dat een tweede softwarelaag nodig heeft om nuttig te zijn, verliest van silicium dat met een dergelijke laag wordt geleverd.

Waar de combinatie wordt getest

Het commerciële bewijs tot nu toe is Parasail, een inferentiecloud die op 7 juli 2026 aankondigde dat het Corsair naast zijn NVIDIA Hopper- en Blackwell-vloot zou implementeren, waarbij prefill naar de GPUs en decode naar de acceleratoren werden gestuurd over een netwerk dat meer dan 40 datacenters in 15 landen omvat. De eigen kernel-routeringstechnologie van Parasail doet het dispatchen daar, wat precies de functie is die d-Matrix nu in-house heeft.

De prestatiezaak rust op gemeten en gemodelleerde resultaten die Gimlet Labs op 11 maart 2026 publiceerde. Door gpt-oss-120b met een 1,6 miljard parameters te draaien, verplaatste het bedrijf de speculatieve decodeerstap van de GPU naar Corsair, terwijl prefill en verificatie op de GPU bleven, en meldden ze 2x tot 10x snellere eind-tot-eind-aanvragen bij gematchte energiedoeltreffendheid. Gimlet wijt de winst toe aan de 2 GB aan on-chip SRAM en ongeveer 150 TB/s aan geheugenbandbreedte van de kaart, waardoor het draftmodel kandidaat-tokens snel genoeg kan produceren dat afgewezen gokken weinig kosten. Een van de co-auteurs van de post is de chief technology officer van d-Matrix, Sudeep Bhoja.

Corsair wordt nu in grote hoeveelheden naar prioritaire klanten verzonden, en d-Matrix wervet ingenieurs over verschillende specialiteiten terwijl de twee organisaties worden gecombineerd. De volgende koper van een gemengde GPU- en accelerator-rack zal het beoordelen op hoe snel een model van evaluatie naar verkeer gaat, en die klok loopt nu op software die d-Matrix in bezit heeft.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.