AquisiçÃĩes
A d-Matrix adquire a Wallaroo para orquestrar a inferÊncia em vÃĄrios chips

A d-Matrix adquiriu a Wallaroo.ai, uma fabricante de software para implantar e orquestrar a inferÊncia de IA, em um acordo que a empresa de chips de Santa Clara anunciou em 3 de agosto de 2026. A compra traz a plataforma, a propriedade intelectual e a equipe de engenharia da Wallaroo para a d-Matrix, e ÃĐ a segunda aquisiçÃĢo da fabricante de chips em quatro meses.
A razÃĢo segue do modo como a d-Matrix vende silÃcio. Seus aceleradores Corsair sÃĢo projetados para funcionar ao lado de GPUs, em vez de substituÃ-las, assumindo a fase de decodificaçÃĢo de uma solicitaçÃĢo de modelo de linguagem, a metade limitada por memÃģria que emite tokens um a um, enquanto as GPUs lidam com o preenchimento pesado. Fazer com que essa divisÃĢo funcione em um cluster ao vivo ÃĐ um trabalho de software: algo precisa decidir qual chip recebe qual parte de cada solicitaçÃĢo, passar o contexto acumulado entre eles e dimensionar ambos os nÃveis independentemente à medida que o trÃĄfego muda. Essa camada ÃĐ o que a d-Matrix acabou de comprar.
O que a Wallaroo traz
A Wallaroo vende um tempo de execuçÃĢo de serviço e um plano de controle que embalam modelos e os implantam em hardware x86, Arm e GPU em nuvem, no local, na borda e em ambientes totalmente isolados, com suporte a tempos de execuçÃĢo de LLM comuns, incluindo vLLM e SGLang. Suas equipes de engenharia, produto e marketing estÃĢo se juntando à d-Matrix, que citou seu trabalho em arquitetura de software, computaçÃĢo de alto desempenho e operaçÃĩes do Kubernetes.
As duas empresas jÃĄ descreviam a mesma arquitetura. Em uma publicaçÃĢo de engenharia de 16 de março de 2026, o fundador e CEO da Wallaroo, Vid Jain, e dois colegas apresentaram o caso para dividir o preenchimento da decodificaçÃĢo em silÃcio misto. O trÃĄfego agente, disseram eles, chega em trÊs tamanhos: cerca de 84% de solicitaçÃĩes curtas de cerca de 2.000 tokens, cerca de 15% na faixa de 8.000 a 64.000 tokens e menos de 1% com 128.000 tokens ou mais. Esse Último pedaço monopoliza o tempo da GPU e bloqueia tudo o que estÃĄ na fila atrÃĄs dele. A rota de cache sozinha, relataram os autores, reduziu o tempo de primeira token em 75% no trÃĄfego agente em seus prÃģprios testes.
Sid Sheth, fundador e CEO da d-Matrix, disse que os clientes disseram à empresa que a maior barreira ânÃĢo ÃĐ apenas o desempenho, mas tambÃĐm a complexidade operacional para chegar lÃĄâ. Jain disse que os dois compartilhavam a visÃĢo de que a inferÊncia ÃĐ tanto um problema de implantaçÃĢo quanto de silÃcio.
Dois acordos em quatro meses
A d-Matrix tem comprado as partes de um sistema de inferÊncia que nÃĢo construiu. Em abril de 2026, adquiriu o negÃģcio de centro de dados da GigaIO, pegando o sistema SuperNODE e o tecido de memÃģria baseado em PCIe FabreX, juntamente com uma equipe de sistemas em escala de rack em Carlsbad, CalifÃģrnia, enquanto a GigaIO continuou de forma independente na computaçÃĢo de borda. O prÃģprio Corsair entrou em produçÃĢo total em 9 de junho de 2026, fabricado com a Alchip no nÃģ N6 da TSMC, usando chiplets de computaçÃĢo em memÃģria baseados em SRAM em substratos orgÃĒnicos com memÃģria LP-DDR5 em vez de pilhas HBM e embalagem CoWoS, em racks que funcionam resfriados a ar.
Pagar por isso ÃĐ um financiamento de sÃĐrie C de US$ 275 milhÃĩes fechado em 12 de novembro de 2025 a uma valorizaçÃĢo de US$ 2 bilhÃĩes, co-liderado pela Bullhound Capital, Triatomic Capital e Temasek. A empresa tambÃĐm tem reunido parceiros em torno da plataforma, incluindo uma parceria de infraestrutura de baixa latÊncia com a Infineon.
Comprar a camada de implantaçÃĢo estÃĄ se tornando o movimento padrÃĢo para qualquer pessoa que venda computaçÃĢo nÃĢo-Nvidia (NVDA ). A Qualcomm fechou sua aquisiçÃĢo em açÃĩes da startup de compilador Modular (QCOM ) em julho de 2026, a Nscale comprou a Anyscale para subir a pilha de computaçÃĢo de IA no mesmo mÊs, e a Nebius concordou em adquirir a Eigen AI em um acordo de US$ 643 milhÃĩes visando a infraestrutura de inferÊncia. O silÃcio que precisa de uma segunda pilha de software para ser Útil perde para o silÃcio que vem com uma.
Onde a combinaçÃĢo ÃĐ testada
O ponto de prova comercial atÃĐ agora ÃĐ a Parasail, uma nuvem de inferÊncia que em 7 de julho de 2026 disse que estava implantando o Corsair ao lado de sua frota NVIDIA Hopper e Blackwell, enviando o preenchimento para as GPUs e a decodificaçÃĢo para os aceleradores em uma rede que se baseia em mais de 40 centros de dados em 15 paÃses. A tecnologia de roteamento de kernel da prÃģpria Parasail faz a dispatching lÃĄ, que ÃĐ exatamente a funçÃĢo que a d-Matrix agora possui internamente.
O caso de desempenho se baseia em resultados medidos e modelados publicados pela Gimlet Labs em 11 de março de 2026. Executando o gpt-oss-120b com um modelo de rascunho de 1,6 bilhÃĢo de parÃĒmetros, a empresa moveu a etapa de decodificaçÃĢo especulativa da GPU para o Corsair, enquanto o preenchimento e a verificaçÃĢo permaneciam na GPU, e relatou solicitaçÃĩes de ponta a ponta 2 a 10 vezes mais rÃĄpidas com eficiÊncia de energia equivalente. A Gimlet atribui o ganho aos 2 GB de SRAM no chip e cerca de 150 TB/s de largura de banda de memÃģria, o que permite que o modelo de rascunho produza tokens de candidato rapidamente o suficiente para que as suposiçÃĩes rejeitadas custem pouco. Um dos coautores do post ÃĐ o diretor de tecnologia da d-Matrix, Sudeep Bhoja.
O Corsair agora estÃĄ sendo enviado em volume para clientes prioritÃĄrios, e a d-Matrix estÃĄ contratando engenheiros em vÃĄrias especialidades à medida que as duas organizaçÃĩes se combinam. O prÃģximo comprador de um rack de GPU e acelerador misto julgarÃĄ com base em quanto tempo um modelo leva para ir da avaliaçÃĢo para o trÃĄfego, e esse relÃģgio agora ÃĐ executado pelo software que a d-Matrix possui.












