Acquisizioni
d-Matrix Acquista Wallaroo per Orchestrazione dell’Inferenza sui Chip

d-Matrix ha acquisito Wallaroo.ai, un produttore di software per il deploy e lâorchestrazione dellâinferenza AI, in un accordo che la società di chip di Santa Clara ha annunciato il 3 agosto 2026. Lâacquisto porta la piattaforma, la proprietà intellettuale e lo staff di ingegneria di Wallaroo in d-Matrix, e rappresenta la seconda acquisizione della società di chip in quattro mesi.
La ragione deriva da come d-Matrix vende silicio. I suoi acceleratori Corsair sono progettati per funzionare accanto ai GPU piuttosto che sostituirli, prendendo la fase di decodifica di una richiesta di modello di linguaggio, la metà vincolata dalla memoria che emette token uno alla volta, mentre i GPU gestiscono il prefill computazionalmente pesante. Fare in modo che questa divisione funzioni in un cluster live ÃĻ un lavoro software: qualcosa deve decidere quale chip ottiene quale parte di ogni richiesta, consegnare il contesto accumulato tra di loro e scalare entrambi i livelli in modo indipendente mentre il traffico si sposta. Quel livello ÃĻ ciÃē che d-Matrix ha appena acquistato.
Cosa Porta Wallaroo
Wallaroo vende un runtime di servizio e un piano di controllo che impacchettano i modelli e li spingono su hardware x86, Arm e GPU attraverso cloud, on-premises, edge e ambienti completamente air-gapped, con supporto per runtime LLM comuni tra cui vLLM e SGLang. I suoi team di ingegneria, prodotto e go-to-market si uniscono a d-Matrix, che ha citato il loro lavoro in architettura software, calcolo ad alte prestazioni e operazioni Kubernetes.
Le due società descrivevano già la stessa architettura. In un post di ingegneria del 16 marzo 2026, il fondatore e amministratore delegato di Wallaroo, Vid Jain, e due colleghi hanno esposto il caso per la divisione del prefill dalla decodifica attraverso silicio misto. Il traffico agente, hanno scritto, arriva in tre dimensioni: circa lâ84% di richieste brevi di circa 2.000 token, intorno al 15% nella gamma di 8.000-64.000 token e meno dellâ1% a 128.000 token o piÃđ. Quellâultimo pezzo monopolizza il tempo GPU e blocca tutto ciÃē che ÃĻ in coda dietro di esso. La sola routing consapevole della cache, hanno riferito gli autori, ha ridotto il tempo peggiore di primo token del 75% sul traffico agente nei loro test.
Sid Sheth, fondatore e amministratore delegato di d-Matrix, ha detto che i clienti avevano detto alla società che la piÃđ grande barriera ânon ÃĻ solo la prestazione, ma anche la complessità operativa per arrivarciâ. Jain ha detto che i due condividevano la visione che lâinferenza sia tanto un problema di deploy quanto di silicio.
Due Accordi in Quattro Mesi
d-Matrix ha acquistato le parti di un sistema di inferenza che non aveva costruito. Nel mese di aprile 2026 ha acquisito il business di data center di GigaIO, acquisendo il sistema SuperNODE e la stoffa di memoria FabreX basata su PCIe insieme a un team di sistemi a livello di rack a Carlsbad, in California, mentre GigaIO continuava in modo indipendente nel computing edge. Corsair stesso ÃĻ entrato in produzione completa il 9 giugno 2026, prodotto con Alchip su nodo N6 di TSMC, utilizzando chiplet di calcolo in memoria SRAM su substrati organici con memoria LP-DDR5 invece di pile HBM e imballaggio CoWoS, in rack che funzionano con raffreddamento ad aria.
Pagare per questo ÃĻ un round di finanziamento Series C da 275 milioni di dollari chiuso il 12 novembre 2025 a una valutazione di 2 miliardi di dollari, guidato da BullhoundCapital, Triatomic Capital e Temasek. La società ha anche iniziato a radunare partner intorno alla piattaforma, tra cui un partenariato per infrastrutture a bassa latenza con Infineon.
Lâacquisto dello strato di deploy sta diventando la mossa standard per chiunque venda calcolo non-Nvidia (NVDA ). Qualcomm ha chiuso il suo acquisto totale di azioni della startup di compilatori Modular (QCOM ) nel luglio 2026, Nscale ha acquistato Anyscale per salire nella pila di calcolo lo stesso mese, e Nebius ha concordato di acquisire Eigen AI in un accordo da 643 milioni di dollari finalizzato allâinfrastruttura di inferenza. Il silicio che necessita di un secondo stack software per essere utile perde rispetto al silicio che lo consegna con uno.
Dove la Coppia Viene Testata
Il punto di prova commerciale finora ÃĻ Parasail, una nuvola di inferenza che il 7 luglio 2026 ha dichiarato di stare distribuendo Corsair accanto alla sua flotta NVIDIA Hopper e Blackwell, inviando il prefill ai GPU e la decodifica agli acceleratori attraverso una rete che attinge da oltre 40 data center in 15 paesi. La tecnologia di routing del kernel di Parasail esegue il dispatching lÃŽ, che ÃĻ esattamente la funzione che d-Matrix ora possiede in casa.
Il caso di prestazione si basa sui risultati misurati e modellati pubblicati da Gimlet Labs lâ11 marzo 2026. Eseguendo gpt-oss-120b con un modello di 1,6 miliardi di parametri, lâazienda ha spostato il passo di decodifica speculativa fuori dal GPU e su Corsair mentre il prefill e la verifica sono rimasti sul GPU, e ha riportato richieste end-to-end piÃđ veloci da 2 a 10 volte alla stessa efficienza energetica. Gimlet attribuisce il guadagno ai 2GB di SRAM sul chip e a circa 150 TB/s di larghezza di banda della memoria, che consentono al modello di produrre token candidati abbastanza velocemente da far sÃŽ che le ipotesi rifiutate costino poco. Uno degli autori del post ÃĻ il direttore tecnico di d-Matrix, Sudeep Bhoja.
Corsair sta ora spedendo in volume ai clienti prioritari, e d-Matrix sta assumendo ingegneri in diverse specialità mentre le due organizzazioni si combinano. Il prossimo acquirente di un rack misto GPU-e-acceleratore giudicherà sulla base di quanto velocemente un modello va dalla valutazione al traffico di servizio, e quel tempo ora funziona con il software di proprietà di d-Matrix.












