FÃķrvÃĪrv

d-Matrix kÃķper Wallaroo fÃķr att orkestrera inferens Ãķver chip

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

d-Matrix har fÃķrvÃĪrvat Wallaroo.ai, en tillverkare av programvara fÃķr distribution och orkestrering av AI-inferens, i en affÃĪr som det Santa Clara-baserade chipfÃķretaget meddelade den 3 augusti 2026. KÃķpet bringar Wallaroos plattform, immateriella rÃĪttigheter och ingenjÃķrsteam in i d-Matrix, och det ÃĪr chip-tillverkarens andra fÃķrvÃĪrv pÃĨ fyra mÃĨnader.

Resonemanget fÃķljer av hur d-Matrix sÃĪljer kisel. Deras Corsair-acceleratorer ÃĪr byggda fÃķr att kÃķra bredvid GPU:er snarare ÃĪn att ersÃĪtta dem, ta emot avkodningsfasen av en sprÃĨkmodellbegÃĪran, den minnesbundna halvan som emitterar token en i taget, medan GPU:er hanterar den berÃĪkningsintensiva fÃķrifyllningen. Att gÃķra att denna uppdelning fungerar i en live-kluster ÃĪr ett programvaruproblem: nÃĨgot mÃĨste bestÃĪmma vilken chip som fÃĨr vilken del av varje begÃĪran, ÃķverfÃķra den ackumulerade kontexten mellan dem och skala bÃĨda nivÃĨerna oberoende av trafikfÃķrÃĪndringar. Det ÃĪr den lager som d-Matrix just har kÃķpt.

Vad Wallaroo bringar

Wallaroo sÃĪljer en serving-runtime och en kontrollplan som paketerar modeller och skickar dem till x86-, Arm- och GPU-hÃĨrdvara Ãķver moln, on-premises, edge och fullstÃĪndigt luftgapade miljÃķer, med stÃķd fÃķr vanliga LLM-kÃķrningar, inklusive vLLM och SGLang. Deras ingenjÃķr-, produkt- och marknadsfÃķringsteam ansluter sig till d-Matrix, som citerade deras arbete inom programvaruarkitektur, hÃķgpresterande datorer och Kubernetes-ÃĨtgÃĪrder.

De tvÃĨ fÃķretagen beskrev redan samma arkitektur. I en 16 mars 2026 ingenjÃķrsinlÃĪgg lade Wallaroo-grundare och VD Vid Jain och tvÃĨ kollegor fram fallet fÃķr att dela upp fÃķrifyllning frÃĨn avkodning Ãķver blandad kisel. Agentic trafik, skrev de, anlÃĪnder i tre storlekar: ungefÃĪr 84% korta begÃĪranden om cirka 2 000 token, runt 15% i intervallet 8 000-64 000 token och under 1% pÃĨ 128 000 token eller mer. Den sista skivan monopoliserar GPU-tid och blockerar allt som kÃķrs bakom den. Cache-medveten routning ensam, rapporterade fÃķrfattarna, minskade den sÃĪmsta tiden till fÃķrsta token med 75% pÃĨ agentic trafik i deras egna tester.

Sid Sheth, d-Matrix grundare och VD, sa att kunderna hade berÃĪttat fÃķr fÃķretaget att den stÃķrsta barriÃĪren “inte bara ÃĪr prestanda, utan ocksÃĨ den operativa komplexiteten att komma dit.” Jain sa att de tvÃĨ delade en uppfattning om att inferens ÃĪr lika mycket ett distributionsproblem som ett kiselproblem.

TvÃĨ affÃĪrer pÃĨ fyra mÃĨnader

d-Matrix har kÃķpt de delar av ett inferenssystem som de inte byggt. I april 2026 fÃķrvÃĪrvade de GigaIO:s datacenter-verksamhet, och fick dÃĪrmed SuperNODE-systemet och FabreX PCIe-baserade minnesvÃĪv, tillsammans med ett rack-skaleteam i Carlsbad, Kalifornien, medan GigaIO fortsatte oberoende inom edge-computing. Corsair sjÃĪlv gick in i full produktion den 9 juni 2026, tillverkad med Alchip pÃĨ TSMC:s N6-nod, med SRAM-baserad in-memory-berÃĪkning pÃĨ organiska substrat med LP-DDR5-minne istÃĪllet fÃķr HBM-stackar och CoWoS-forpackning, i rack som kÃķrs luftkylda.

Betalningen skedde genom en 275 miljoner dollar i serie C som stÃĪngdes den 12 november 2025 till en vÃĪrdering av 2 miljarder dollar, ledd av BullhoundCapital, Triatomic Capital och Temasek. FÃķretaget har ocksÃĨ samlat partners runt plattformen, inklusive ett lÃĨglatens-infrastrukturpartnerskap med Infineon.

Att kÃķpa distributionslagret blir den standardrÃķrelse som alla som sÃĪljer icke-Nvidia (NVDA ) berÃĪkningar gÃķr. Qualcomm stÃĪngde sitt aktiebaserade fÃķrvÃĪrv av compiler-startup Modular (QCOM ) i juli 2026, Nscale kÃķpte Anyscale fÃķr att flytta upp berÃĪkningsstacken samma mÃĨnad, och Nebius kom Ãķverens om att fÃķrvÃĪrva Eigen AI i en affÃĪr vÃĪrd 643 miljoner dollar i syfte att stÃĪrka inferensinfrastrukturen. Kisel som behÃķver en andra programvarustack fÃķr att vara anvÃĪndbar fÃķrlorar mot kisel som levereras med en.

DÃĪr parningen testas

Det kommersiella beviset hittills ÃĪr Parasail, en inferensmoln som den 7 juli 2026 sa att de distribuerade Corsair bredvid sin NVIDIA Hopper- och Blackwell-flotta, skickade fÃķrifyllning till GPU:erna och avkodning till acceleratorerna Ãķver ett nÃĪtverk som drog pÃĨ mer ÃĪn 40 datacenter i 15 lÃĪnder. Parasails egen kÃĪrn-routningsteknik hanterar dispatchingen dÃĪr, vilket ÃĪr exakt den funktion som d-Matrix nu ÃĪger internt.

Prestandafallet vilar pÃĨ mÃĪtta och modellerade resultat som publicerats av Gimlet Labs den 11 mars 2026. Genom att kÃķra gpt-oss-120b med en 1,6 miljarder-parametrars utkastmodell, flyttade fÃķretaget den spekulativa avkodningssteget frÃĨn GPU till Corsair medan fÃķrifyllning och verifikation fÃķrblev pÃĨ GPU, och rapporterade 2-10 gÃĨnger snabbare slut-till-slut-begÃĪranden vid matchad energieffektivitet. Gimlet tillskriver vinsten till kortets 2 GB SRAM och cirka 150 TB/s minnesbandbredd, som lÃĨter utkastmodellen producera kandidattoken tillrÃĪckligt snabbt sÃĨ att avvisade gissningar kostar lite. En av fÃķrfattarna till inlÃĪgget ÃĪr d-Matrix tekniska chef Sudeep Bhoja.

Corsair skickas nu i volym till prioriterade kunder, och d-Matrix anstÃĪller ingenjÃķrer inom flera specialomrÃĨden nÃĪr de tvÃĨ organisationerna slÃĨs samman. NÃĪsta kÃķpare av en blandad GPU- och accelerator-hylla kommer att bedÃķma den utifrÃĨn hur snabbt en modell gÃĨr frÃĨn utvÃĪrdering till att hantera trafik, och den klockan kÃķrs nu av programvara som d-Matrix ÃĪger.

Theo Nash ÃĪr en AI-genererad specialist pÃĨ Unite.AI, som tÃĪcker AI-infrastruktur, berÃĪkningar och de hÃĨrdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar pÃĨ de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nÃĪtverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjÃķrsdriven perspektiv undersÃķker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system mÃķjliggÃķr nya generationer av AI-modeller. Han ÃĪgnar sÃĪrskild uppmÃĪrksamhet ÃĨt prestandaavvÃĪgningar, energoeffektivitet, skalbarhet och de praktiska begrÃĪnsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash ÃĪr AI-genererade och granskade av Unite.AIs redaktionella team fÃķr att sÃĪkerstÃĪlla teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-berÃĪkningslandskapet.