Akwizycje

d-Matrix kupuje Wallaroo, aby zorganizować inferencję na chipach

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

d-Matrix nabył Wallaroo.ai, producenta oprogramowania do wdroÅženia i organizacji inferencji sztucznej inteligencji, w transakcji, o ktÃģrej Santa Clara chip company ogłosił 3 sierpnia 2026. Zakup ten wprowadza platformę Wallaroo, własność intelektualną i zespÃģł inÅžynierÃģw do d-Matrix i jest to druga akwizycja chipmaker w ciągu czterech miesięcy.

Uzasadnienie wynika z tego, jak d-Matrix sprzedaje krzem. Ich przyspieszacze Corsair są zaprojektowane do pracy obok GPU, a nie ich zastępowania, biorąc fazę dekodowania Şądania modelu językowego, pamięciowo ograniczoną połowę, ktÃģra emituje tokeny jeden po drugim, podczas gdy GPU obsługują prefilled. Ustawienie tej separacji w Åžywej grupie to zadanie oprogramowania: coś musi zdecydować, ktÃģry chip otrzyma ktÃģrą część kaÅždego Şądania, przekazać nagromadzony kontekst między nimi i skalować oba poziomy niezaleÅžnie, gdy ruch się zmienia. Ta warstwa to to, co d-Matrix właśnie kupił.

Co Wallaroo wnosi

Wallaroo sprzedaje środowisko uruchomieniowe i warstwę kontrolną, ktÃģre pakują modele i wypychają je na sprzęt x86, Arm i GPU w chmurze, na miejscu, na krawędzi i w pełni odizolowanych środowiskach, z obsługą popularnych czasÃģw wykonywania LLM, w tym vLLM i SGLang. Ich zespoły inÅžynierskie, produkcyjne i marketingowe dołączają do d-Matrix, ktÃģry powołał się na ich pracę w architekturze oprogramowania, wysokowydajnych obliczeniach i operacjach Kubernetes.

Obie firmy opisywały juÅž tę samą architekturę. W marcowym poście inÅžynierskim z 16 marca 2026, załoÅžyciel i dyrektor generalny Wallaroo, Vid Jain, i dwÃģch jego kolegÃģw przedstawił przypadek dla podziału prefilled od dekodowania na mieszanych krzemach. Ruch agenci, napisali, przychodzi w trzech rozmiarach: około 84% krÃģtkich Şądań o około 2 000 tokenÃģw, około 15% w zakresie 8 000-64 000 tokenÃģw i poniÅžej 1% przy 128 000 tokenÃģw lub więcej. Ten ostatni fragment monopolizuje czas GPU i blokuje wszystko, co jest w kolejce za nim. Trasowanie świadome pamięci, jak podali autorzy, skrÃģciło czas do pierwszego tokenu o 75% w ich własnych testach.

Sid Sheth, załoÅžyciel i dyrektor generalny d-Matrix, powiedział, Åže klienci powiedzieli firmie, Åže największą barierą “nie jest tylko wydajność, ale takÅže operacyjna złoÅžoność uzyskania tam”. Jain powiedział, Åže obie strony dzielą pogląd, Åže inferencja jest tak samo problemem wdroÅženia, jak i krzemu.

Dwie transakcje w czterech miesiącach

d-Matrix kupuje części systemu inferencji, ktÃģrych nie zbudował. W kwietniu 2026 roku nabył dział centrÃģw danych GigaIO, kupując system SuperNODE i pamięć opartą na PCIe FabreX wraz z zespołem systemÃģw na poziomie szafy w Carlsbad, Kalifornia, podczas gdy GigaIO kontynuował działalność niezaleÅžną w obliczeniach krawędziowych. Sam Corsair w pełni wszedł do produkcji 9 czerwca 2026, wyprodukowany z Alchip na węŚle TSMC N6, uÅžywając chipletÃģw obliczeniowych w pamięci SRAM na nośnikach organicznych z pamięcią LP-DDR5 zamiast stosÃģw HBM i opakowań CoWoS, w szafach, ktÃģre działają chłodzone powietrzem.

Płacenie za to jest 275 milionÃģw dolarÃģw serii C z 12 listopada 2025 przy wycenie 2 miliardÃģw dolarÃģw, wspÃģłprowadzonej przez BullhoundCapital, Triatomic Capital i Temasek. Firma rÃģwnieÅž gromadzi partnerÃģw wokÃģł platformy, w tym partnerstwo w zakresie infrastruktury niskiej latencji z Infineon.

Kupowanie warstwy wdroÅženiowej staje się standardowym posunięciem dla kaÅždego, kto sprzedaje obliczenia nie-Nvidia (NVDA ). Qualcomm zamknął swoją akwizycję startupu kompilatora Modular (QCOM ) w lipcu 2026, Nscale kupił Anyscale, aby awansować w stosie obliczeń AI tego samego miesiąca, a Nebius zgodził się nabyć Eigen AI w transakcji o wartości 643 milionÃģw dolarÃģw w celu wzmocnienia infrastruktury inferencji. Krzem, ktÃģry potrzebuje drugiej warstwy oprogramowania, aby być uÅžytecznym, przegrywa z krzemu, ktÃģry jest dostarczany z nią.

Gdzie para się testuje

Punktem dowodowym jest Parasail, chmura inferencji, ktÃģra 7 lipca 2026 ogłosiła, Åže wdroÅžy Corsair obok swojej floty NVIDIA Hopper i Blackwell, wysyłając prefilled do GPU i dekodowanie do przyspieszaczy przez sieć, ktÃģra korzysta z ponad 40 centrÃģw danych w 15 krajach. Własna technologia routingu jądra Parasail wykonuje tam dispatching, co jest dokładnie funkcją, ktÃģrą d-Matrix teraz posiada wewnętrznie.

Przypadek wydajności opiera się na wynikach pomiarowych i modelowych opublikowanych przez Gimlet Labs 11 marca 2026. Uruchamiając gpt-oss-120b z modelem draft o 1,6 miliarda parametrÃģw, firma przeniosła krok dekodowania spekulatywnego z GPU na Corsair, podczas gdy prefilled i weryfikacja pozostały na GPU, i zgłosiła 2-10 razy szybsze Şądania na końcu przy rÃģwnowaÅžnej wydajności energetycznej. Gimlet przypisuje zysk karcie 2 GB pamięci SRAM na chipie i około 150 TB/s przepustowości pamięci, co pozwala modelowi draft wyprodukować tokeny kandydujące wystarczająco szybko, aby odrzucone zgadywanie kosztowało niewiele. Jednym z wspÃģłautorÃģw postu jest dyrektor techniczny d-Matrix, Sudeep Bhoja.

Corsair jest teraz dostarczany w duÅžych ilościach do priorytetowych klientÃģw, a d-Matrix rekrutuje inÅžynierÃģw z kilku specjalności, gdy obie organizacje łączą się. Następny kupujący szafy z mieszaniem GPU i przyspieszaczy będzie oceniał go pod kątem tego, jak szybko model przechodzi od oceny do obsługi ruchu, a ten zegar teraz działa na oprogramowaniu, ktÃģre d-Matrix posiada.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, ktÃģre napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach duÅžych obciÄ…Åžeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, ktÃģre je łączą.
Z analitycznej i inÅžynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemÃģw rozproszonych umoÅžliwiają nowe pokolenia modeli AI. Zwraca szczegÃģlną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, ktÃģre kształtują wdroÅženie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespÃģł redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.