Opkøb
d-Matrix køber Wallaroo for at orchestrere inference på tværs af chips

d-Matrix har købt Wallaroo.ai, en producent af software til implementering og orkestrering af AI-inference, i en handel, som det santa Clara-chipselskab meddelte den 3. august 2026. Købet bringer Wallaroos platform, immaterielle aktiver og ingeniørpersonale ind i d-Matrix, og det er chipproducentens anden overtagelse på fire måneder.
Bevæggrunden følger af, hvordan d-Matrix sælger silicium. Dets Corsair-acceleratorer er bygget til at køre ved siden af GPU’er i stedet for at erstatte dem, og tager decode-fasen af en sprogmodelanmodning, den hukommelsesbundne halvdel, der emitterer tokens én ad gangen, mens GPU’er håndterer den beregningsintensive forudfyldning. At gøre denne opdeling til at fungere i en live-kluster er et softwarejob: noget skal beslutte, hvilken chip der får hvilken del af hver anmodning, overføre den akkumulerede kontekst mellem dem, og skalere begge niveauer uafhængigt, når trafikken skifter. Det lag er, hvad d-Matrix lige har købt.
Hvad Wallaroo bringer
Wallaroo sælger en serving-runtime og en kontrolplan, der pakker modeller og skyder dem på x86-, Arm- og GPU-hardware på tværs af cloud, on-premises, edge og fuldt luftgabte miljøer, med understøttelse af almindelige LLM-kørselsmiljøer, herunder vLLM og SGLang. Dets ingeniør-, produkt- og go-to-market-hold er med i d-Matrix, som citerede deres arbejde i softwarearkitektur, højpræstationsberegning og Kubernetes-drift.
De to virksomheder beskrev allerede den samme arkitektur. I en ingeniørpost fra den 16. marts 2026 fremførte Wallaroo-grundlægger og direktør Vid Jain og to kolleger sagen for at splitte forudfyldning fra decode på tværs af blandet silicium. Agentic trafik, skrev de, ankommer i tre størrelser: omtrent 84% korte anmodninger på ca. 2.000 tokens, ca. 15% i intervallet 8.000-64.000 tokens, og under 1% på 128.000 tokens eller mere. Den sidste skive monopoliserer GPU-tid og blokerer alt, der er kørende bagved. Cache-bevidst routing alene, rapporterede forfatterne, reducerede den værste tid-til-første-token med 75% på agentic trafik i deres egne tests.
Sid Sheth, d-Matrix’ grundlægger og direktør, sagde, at kunder havde fortalt virksomheden, at den største barrier “ikke blot er ydelse, men også den operationelle kompleksitet ved at komme dertil.” Jain sagde, at de to delte en opfattelse af, at inference er lige så meget et implementeringsproblem som et siliciumproblem.
To handler på fire måneder
d-Matrix har købt dele af et inferenssystem, som det ikke selv havde bygget. I april 2026 købte det GigaIO’s datacenterforretning, hvor det fik SuperNODE-systemet og FabreX PCIe-baseret hukommelsesstof samt et rack-skala-systemhold i Carlsbad, Californien, mens GigaIO fortsatte uafhængigt i edge-computing. Corsair selv gik i fuld produktion den 9. juni 2026, fremstillet med Alchip på TSMC’s N6-node, med SRAM-baseret in-memory-compute-chiplets på organisk substrat med LP-DDR5-hukommelse i stedet for HBM-stacks og CoWoS-pakning, i racks, der køres luftkølet.
Betalingen sker via en 275 millioner dollars serie C-aftale, som blev lukket den 12. november 2025, til en vurdering på 2 milliarder dollars, ledet af BullhoundCapital, Triatomic Capital og Temasek. Virksomheden har også samlet partnere omkring platformen, herunder en lav-forsinkelsesinfrastruktur-partnerskab med Infineon.
At købe implementeringslaget bliver standardbevægelsen for enhver, der sælger ikke-Nvidia (NVDA ) beregning. Qualcomm lukkede sin aktiebaserede overtagelse af compiler-startup Modular (QCOM ) i juli 2026, Nscale købte Anyscale for at rykke op på beregningsstakken samme måned, og Nebius blev enig om at købe Eigen AI i en 643 millioner dollars aftale rettet mod inference-infrastruktur. Silicium, der kræver en anden softwarestak for at være nyttig, taber til silicium, der leveres med en.
Hvor parningen bliver testet
Det kommercielle bevispunkt indtil videre er Parasail, en inference-cloud, som den 7. juli 2026 sagde, at den implementerede Corsair sammen med sin NVIDIA Hopper og Blackwell-flåde, sender forudfyldning til GPU’erne og decode til acceleratorerne på tværs af et netværk, der trækker på over 40 datacenter i 15 lande. Parasails egen kernel-routing-teknologi udfører dispatching her, hvilket præcis er den funktion, d-Matrix nu ejer internt.
Ydelsesforskellen hviler på målte og modellerede resultater, der er offentliggjort af Gimlet Labs den 11. marts 2026. Ved at køre gpt-oss-120b med en 1,6 milliard parameters draft-model, flyttede firmaet den spekulative-decode-trin af GPU’en og over på Corsair, mens forudfyldning og verificering blev på GPU’en, og rapporterede 2-10 gange hurtigere slut-til-slut-anmodninger ved matchet energiefølsomhed. Gimlet tilskriver gevinsten til kortets 2 GB på-chip-SRAM og ca. 150 TB/s hukommelsesbåndbredde, som giver draft-modellen mulighed for at producere kandidat-tokens hurtigt nok, så afviste gætter koster lidt. En af artiklens medforfattere er d-Matrix’ tekniske direktør Sudeep Bhoja.
Corsair er nu i volumen til prioriterede kunder, og d-Matrix ansætter ingeniører på tværs af flere specialer, mens de to organisationer kombineres. Den næste køber af en blandet GPU- og accelerator-rack vil bedømme det på, hvor hurtigt en model går fra evaluering til at håndtere trafik, og den ur now køres på software, som d-Matrix ejer.












