Oppkjøp

d-Matrix kjøper Wallaroo for å orchestrere inferens på tvers av chips

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

d-Matrix har kjøpt Wallaroo.ai, en produsent av programvare for utrulling og orkestrering av AI-inferens, i en avtale som det Santa Clara-baserte selskapet annonserte den 3. august 2026. Kjøpet bringer Wallaroos plattform, immaterielle rettigheter og ingeniørstab til d-Matrix, og det er selskapets andre oppkjøp på fire måneder.

Bakgrunnen for dette er hvordan d-Matrix selger silisium. Deres Corsair-akseleratorer er bygget for å kjøre ved siden av GPU-er i stedet for å erstatte dem, og tar dekodningsfasen av en språkmodellforespørsel, den minne-bundne halvdelen som emitterer token ett og ett, mens GPU-ene håndterer den beregnings-intensive forfüllingen. Å få denne delingen til å fungere i en live-kluster er et programvarejobb: noe må bestemme hvilken chip som får hvilken del av hver forespørsel, håndtere den akkumulerte konteksten mellom dem, og skaler begge nivåer uavhengig når trafikken endrer seg. Det er dette laget som d-Matrix nettopp har kjøpt.

Hva Wallaroo bringer

Wallaroo selger en serving-runtime og en kontrollplan som pakker modeller og skyver dem på x86-, Arm- og GPU-hardware over sky, på stedet, kant og fullstendig luftgappede miljøer, med støtte for vanlige LLM-runtider inkludert vLLM og SGLang. Deres ingeniør-, produkt- og markedsføringslag slutter seg til d-Matrix, som nevnte deres arbeid i programvarearkitektur, høy-ytelsesregning og Kubernetes-operasjoner.

De to selskapene beskrev allerede den samme arkitekturen. I en 16. mars 2026 ingeniørpost la Wallaroo-gründer og adm. dir. Vid Jain og to kolleger frem tilfellet for å splitte forfüll fra dekodning på tvers av blandet silisium. Agent-trafikk, skrev de, ankommer i tre størrelser: omtrent 84% korte forespørsler på ca. 2 000 token, rundt 15% i intervallet 8 000-64 000 token, og under 1% på 128 000 token eller mer. Den siste skiveren monopoliserer GPU-tid og blokkerer alt som er køet bak det. Cache-bevisst ruting alene, rapporterte forfatterne, kutta den verste tiden til første token med 75% på agent-trafikk i deres egne tester.

Sid Sheth, d-Matrix’ gründer og adm. dir., sa at kundene hadde fortalt selskapet at den største barrieren “ikke bare er ytelse, men også den operative kompleksiteten ved å komme dit.” Jain sa at de to delte en oppfatning av at inferens like mye er et utrullingsproblem som et silisiumproblem.

To oppkjøp på fire måneder

d-Matrix har kjøpt delene av et inferenssystem som de ikke bygde. I april 2026 kjøpte de GigaIOs data centersvirksomhet, og fikk dermed SuperNODE-systemet og FabreX PCIe-basert minne-stoff samt et rackskala-systemlag i Carlsbad, California, mens GigaIO fortsatte uavhengig i kant-datadrift. Corsair selv gikk i full produksjon den 9. juni 2026, produsert med Alchip på TSMCs N6-nøkkel, med SRAM-basert in-memory-komputasjonschip på organisk substrat med LP-DDR5-minne i stedet for HBM-stacker og CoWoS-emballasje, i hyller som kjører luftavkjølt.

Betalingen skjer gjennom en 275 millioner dollar serie C som ble lukket den 12. november 2025, til en verdi på 2 milliarder dollar, ledet av Bullhound Capital, Triatomic Capital og Temasek. Selskapet har også samlet partnere rundt plattformen, inkludert en lav-forsinkelses-infrastruktur-partneravtale med Infineon.

Å kjøpe utrullingslaget blir standardtrekket for alle som selger ikke-Nvidia (NVDA ) beregning. Qualcomm lukket sitt aktiebaserte oppkjøp av compiler-startup Modular (QCOM ) i juli 2026, Nscale kjøpte Anyscale for å flytte opp beregningsstapelen samme måned, og Nebius gikk med på å kjøpe Eigen AI i en avtale verdt 643 millioner dollar rettet mot inferens-infrastruktur. Silisium som trenger en annen programvare-stack for å være nyttig taper for silisium som leveres med en.

Hvor paringen blir testet

Det kommersielle bevispunktet så langt er Parasail, en inferenssky som den 7. juli 2026 sa at de var i ferd med å utrulle Corsair ved siden av deres NVIDIA Hopper- og Blackwell-flåte, og sender forfüll til GPU-ene og dekodning til akseleratorene på tvers av et nettverk som trekker på over 40 data-sentre i 15 land. Parasails egen kernel-rutings-teknologi håndterer dispatchingen der, som er nøyaktig den funksjonen d-Matrix nå eier internt.

Ytelses-saken hviler på målte og modellerte resultater publisert av Gimlet Labs den 11. mars 2026. Ved å kjøre gpt-oss-120b med en 1,6 milliarder-parametere draft-modell, flyttet firmaet den spekulative-dekodningssteget av GPU-en og over på Corsair, mens forfüll og verifisering ble på GPU-en, og rapporterte 2-10 ganger raskere sluttkonsepter ved sammenlignbar energi-effektivitet. Gimlet tilskriver gevinsten til kortets 2 GB på-chip-SRAM og omtrent 150 TB/s minne-båndbredde, som lar draft-modellen produsere kandidat-token raskt nok at avviste gjetninger koster lite. En av artikkels forfattere er d-Matrix’ teknologidirektør Sudeep Bhoja.

Corsair er nå i volum-utsending til prioriterende kunder, og d-Matrix ansetter ingeniører over flere spesialiteter mens de to organisasjonene slås sammen. Neste kjøper av en blandet GPU- og akselerator-hyller vil dømme det på hvor raskt en modell går fra evaluering til å håndtere trafikk, og den klokken kjører nå på programvare som d-Matrix eier.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og hårdwaresystemer som driver moderne kunstig intelligens. Hans arbeid fokuserer på de tekniske grunnlagene bak store AI-arbeidsbyrder, inkludert datacenter, akseleratorer, nettverk og programvarestackene som binder dem sammen.
Med en analytisk og ingeniør-drevet perspektiv, undersøker Theo hvordan fremgangen i GPUs, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger spesiell vekt på ytelses-avveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former virkelige AI-infrastruktur-utsteder.
Artikler skrevet av Theo Nash er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av den raskt utviklende AI-beregningssfæren.