Akuisisi
d-Matrix Membeli Wallaroo untuk Mengatur Inferensi di Seluruh Chip

d-Matrix telah mengakuisisi Wallaroo.ai, sebuah pembuat perangkat lunak untuk mengirimkan dan mengatur inferensi AI, dalam kesepakatan yang diumumkan oleh perusahaan chip Santa Clara pada 3 Agustus 2026. Pembelian ini membawa platform, kekayaan intelektual, dan staf teknik Wallaroo ke dalam d-Matrix, dan ini adalah akuisisi kedua perusahaan chipmaker dalam empat bulan.
Alasan di balik ini adalah bagaimana d-Matrix menjual silikon. Akselerator Corsair-nya dirancang untuk berjalan di samping GPU, bukan menggantikannya, mengambil fase dekoding dari permintaan model bahasa, setengah yang membatasi memori yang mengeluarkan token satu per satu, sementara GPU menangani prefill. Membuat split ini bekerja dalam cluster live adalah pekerjaan perangkat lunak: sesuatu harus memutuskan chip mana yang mendapatkan bagian mana dari setiap permintaan, menyerahkan konteks yang diakumulasikan di antara mereka, dan menskalakan kedua tingkat secara independen ketika lalu lintas bergeser. Lapisan itu adalah apa yang baru saja dibeli d-Matrix.
Apa yang Dibawa Wallaroo
Wallaroo menjual runtime serving dan control plane yang mengemas model dan mendorongnya ke perangkat keras x86, Arm, dan GPU di seluruh cloud, on-premises, edge, dan lingkungan yang sepenuhnya terisolasi, dengan dukungan untuk runtime LLM umum termasuk vLLM dan SGLang. Tim teknik, produk, dan pemasaran bergabung dengan d-Matrix, yang menyebutkan pekerjaan mereka dalam arsitektur perangkat lunak, komputasi kinerja tinggi, dan operasi Kubernetes.
Kedua perusahaan sudah menjelaskan arsitektur yang sama. Dalam posisi teknik 16 Maret 2026, pendiri dan CEO Wallaroo Vid Jain dan dua rekan menjelaskan kasus untuk memisahkan prefill dari dekoding di seluruh silikon campuran. Lalu lintas agen, mereka menulis, tiba dalam tiga ukuran: sekitar 84% permintaan pendek sekitar 2.000 token, sekitar 15% dalam kisaran 8.000-64.000 token, dan kurang dari 1% pada 128.000 token atau lebih. Potongan terakhir itu memonopoli waktu GPU dan memblokir semua yang diantre di belakangnya. Rute cache-sadar saja, penulis melaporkan, memotong waktu-ke-token pertama terburuk sebesar 75% pada lalu lintas agen dalam tes mereka sendiri.
Sid Sheth, pendiri dan CEO d-Matrix, mengatakan pelanggan telah mengatakan kepada perusahaan bahwa hambatan terbesar “bukan hanya kinerja, tetapi juga kompleksitas operasional untuk mencapainya.” Jain mengatakan keduanya berbagi pandangan bahwa inferensi sama-sama merupakan masalah penerapan dan silikon.
Dua Kesepakatan dalam Empat Bulan
d-Matrix telah membeli bagian dari sistem inferensi yang tidak dibangun. Pada April 2026, perusahaan mengakuisisi bisnis pusat data GigaIO, mengambil alih sistem SuperNODE dan fabrik memori berbasis PCIe FabreX, serta tim sistem skala rak di Carlsbad, California, sementara GigaIO melanjutkan secara mandiri dalam komputasi edge. Corsair sendiri memasuki produksi penuh pada 9 Juni 2026, diproduksi dengan Alchip pada node N6 TSMC, menggunakan chiplet komputasi memori SRAM berbasis pada substrat organik dengan memori LP-DDR5 bukan tumpukan HBM dan kemasan CoWoS, dalam rak yang berjalan pendingin udara.
Membayarnya adalah $275 juta Seri C yang ditutup pada 12 November 2025 dengan valuasi $2 miliar, dipimpin oleh BullhoundCapital, Triatomic Capital, dan Temasek. Perusahaan juga telah mengumpulkan mitra di sekitar platform, termasuk kemitraan infrastruktur latensi rendah dengan Infineon.
Membeli lapisan penerapan menjadi gerakan standar bagi siapa saja yang menjual komputasi non-Nvidia (NVDA ). Qualcomm menutup akuisisi all-stock dari startup compiler Modular (QCOM ) pada Juli 2026, Nscale membeli Anyscale untuk naik ke stack komputasi bulan yang sama, dan Nebius setuju untuk mengakuisisi Eigen AI dalam kesepakatan $643 juta yang ditujukan pada infrastruktur inferensi. Silikon yang memerlukan tumpukan perangkat lunak kedua untuk berguna kalah dengan silikon yang dikirim dengan satu.
Di Mana Pasangan Ini Diuji
Bukti komersial jauh adalah Parasail, sebuah awan inferensi yang pada 7 Juli 2026 mengatakan bahwa mereka mengirimkan Corsair di samping armada NVIDIA Hopper dan Blackwell, mengirim prefill ke GPU dan dekoding ke akselerator di seluruh jaringan yang menggambar lebih dari 40 pusat data di 15 negara. Teknologi pengiriman kernel Parasail melakukan pengiriman di sana, yang tepatnya adalah fungsi yang sekarang dimiliki d-Matrix secara internal.
Kasus kinerja beristirahat pada hasil yang diukur dan dimodelkan yang diterbitkan oleh Gimlet Labs pada 11 Maret 2026. Dengan menjalankan gpt-oss-120b dengan model draft 1,6 miliar parameter, perusahaan memindahkan langkah dekoding spekulatif dari GPU ke Corsair sementara prefill dan verifikasi tetap di GPU, dan melaporkan permintaan ujung-ke-ujung 2x hingga 10x lebih cepat pada efisiensi energi yang sesuai. Gimlet mengatributkan keuntungan ini pada 2GB SRAM on-chip dan sekitar 150 TB/s bandwidth memori, yang memungkinkan model draft menghasilkan token kandidat dengan cukup cepat sehingga tebakan yang ditolak hampir tidak berbiaya. Salah satu co-penulis posting ini adalah CTO d-Matrix Sudeep Bhoja.
Corsair sekarang dikirim dalam volume ke pelanggan prioritas, dan d-Matrix merekrut insinyur di beberapa spesialisasi ketika kedua organisasi digabungkan. Pembeli berikutnya dari rak akselerator-GPU campuran akan menilainya berdasarkan seberapa cepat model berpindah dari evaluasi ke lalu lintas, dan jam itu sekarang berjalan pada perangkat lunak yang dimiliki d-Matrix.












