Mua lại

d-Matrix Mua lại Wallaroo để Điều khiển Inference trên Chip

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

d-Matrix đã mua lại Wallaroo.ai, một công ty sản xuất phần mềm để triển khai và điều khiển inference AI, trong một thỏa thuận mà công ty Santa Clara này đã công bố vào ngày 3 tháng 8 năm 2026. Việc mua lại này mang lại nền tảng, tài sản trí tuệ và nhân viên kỹ sư của Wallaroo vào d-Matrix, và đây là vụ mua lại thứ hai của công ty sản xuất chip này trong bốn tháng.

Lý do của việc mua lại này bắt nguồn từ cách d-Matrix bán silicon. Các bộ tăng tốc Corsair của họ được thiết kế để chạy bên cạnh GPU chứ không phải thay thế chúng, thực hiện giai đoạn giải mã của một yêu cầu mô hình ngôn ngữ, giai đoạn phát sinh token một lần, trong khi GPU xử lý giai đoạn tiền xử lý nặng. Việc làm cho sự phân chia này hoạt động trong một cụm trực tiếp là một công việc của phần mềm: một thứ gì đó phải quyết định哪 chip nhận được phần nào của mỗi yêu cầu, chuyển giao ngữ cảnh tích lũy giữa chúng, và mở rộng cả hai tầng độc lập khi lưu lượng truy cập thay đổi. Đó là lớp mà d-Matrix vừa mua.

Điều gì mà Wallaroo mang lại

Wallaroo bán một thời gian chạy và một mặt điều khiển đóng gói mô hình và đẩy chúng lên phần cứng x86, Arm và GPU trên đám mây, trên cơ sở, cạnh và môi trường hoàn toàn không có kết nối internet, với hỗ trợ cho các thời gian chạy LLM phổ biến bao gồm vLLM và SGLang. Các đội kỹ sư, sản phẩm và tiếp thị của họ đang tham gia d-Matrix, công ty này đã trích dẫn công việc của họ trong kiến trúc phần mềm, tính toán hiệu suất cao và hoạt động Kubernetes.

Hai công ty đã mô tả cùng một kiến trúc. Trong một bài đăng kỹ thuật ngày 16 tháng 3 năm 2026, người sáng lập và giám đốc điều hành Wallaroo Vid Jain và hai đồng nghiệp đã trình bày trường hợp cho việc chia tách tiền xử lý từ giải mã trên silicon hỗn hợp. Lưu lượng truy cập có chủ đích, họ viết, đến trong ba kích cỡ: khoảng 84% yêu cầu ngắn khoảng 2.000 token, khoảng 15% trong phạm vi 8.000-64.000 token, và dưới 1% ở 128.000 token hoặc nhiều hơn. Phần cuối cùng chiếm ưu thế thời gian GPU và chặn mọi thứ xếp hàng sau nó. Việc định tuyến-aware cache alone, các tác giả báo cáo, cắt giảm thời gian đến token đầu tiên trong trường hợp xấu nhất bằng 75% trên lưu lượng truy cập có chủ đích trong các thử nghiệm của họ.

Sid Sheth, người sáng lập và giám đốc điều hành d-Matrix, cho biết khách hàng đã nói với công ty rằng rào cản lớn nhất “không chỉ là hiệu suất, mà còn là sự phức tạp hoạt động khi đến đó.” Jain cho biết hai công ty chia sẻ quan điểm rằng inference là một vấn đề triển khai cũng như silicon.

Hai thỏa thuận trong bốn tháng

d-Matrix đã mua các bộ phận của một hệ thống inference mà họ không xây dựng. Vào tháng 4 năm 2026, họ mua lại hoạt động kinh doanh trung tâm dữ liệu của GigaIO, chọn lên hệ thống SuperNODE và vải nhớ dựa trên PCIe của FabreX cùng với một đội hệ thống cấp rack ở Carlsbad, California, trong khi GigaIO tiếp tục hoạt động độc lập trong tính toán cạnh. Corsair tự nó đã vào sản xuất đầy đủ vào ngày 9 tháng 6 năm 2026, được sản xuất với Alchip trên nút N6 của TSMC, sử dụng chiplet tính toán trong bộ nhớ dựa trên SRAM trên các chất nền hữu cơ với bộ nhớ LP-DDR5 thay vì chồng HBM và bao bì CoWoS, trong các rack chạy làm mát bằng không khí.

Trả tiền cho nó là một vòng Series C trị giá 275 triệu đô la được đóng vào ngày 12 tháng 11 năm 2025 với mức định giá 2 tỷ đô la, do BullhoundCapital, Triatomic Capital và Temasek dẫn đầu. Công ty cũng đã tập hợp các đối tác xung quanh nền tảng, bao gồm một quan hệ đối tác cơ sở hạ tầng độ trễ thấp với Infineon.

Mua lại lớp triển khai đang trở thành động thái tiêu chuẩn cho bất kỳ ai bán máy tính không phải của Nvidia (NVDA ). Qualcomm đã đóng thỏa thuận mua lại tất cả cổ phiếu của công ty khởi nghiệp biên dịch Modular (QCOM ) vào tháng 7 năm 2026, Nscale mua Anyscale để di chuyển lên ngăn xếp tính toán AI cùng tháng, và Nebius đã đồng ý mua lại Eigen AI trong một thỏa thuận trị giá 643 triệu đô la nhằm vào cơ sở hạ tầng inference. Silicon cần một ngăn xếp phần mềm thứ hai để trở nên hữu ích sẽ thua silicon được giao với một ngăn xếp.

Địa điểm kiểm tra sự kết hợp

Điểm chứng minh thương mại cho đến nay là Parasail, một đám mây inference đã nói vào ngày 7 tháng 7 năm 2026 rằng họ đang triển khai Corsair cùng với đội Hopper và Blackwell của NVIDIA, gửi tiền xử lý đến GPU và giải mã đến các bộ tăng tốc trên một mạng dựa trên hơn 40 trung tâm dữ liệu ở 15 quốc gia. Công nghệ định tuyến hạt nhân của Parasail thực hiện việc phân phối ở đó, chính xác là chức năng mà d-Matrix hiện sở hữu trong nhà.

Trường hợp hiệu suất dựa trên kết quả đo lường và mô hình được công bố bởi Gimlet Labs vào ngày 11 tháng 3 năm 2026. Chạy gpt-oss-120b với một mô hình dự thảo 1,6 tỷ tham số, công ty đã di chuyển bước giải mã suy đoán khỏi GPU và lên Corsair trong khi tiền xử lý và xác minh vẫn trên GPU, và báo cáo yêu cầu từ đầu đến cuối nhanh hơn 2 đến 10 lần ở hiệu suất năng lượng khớp. Gimlet cho rằng lợi ích này đến từ 2GB SRAM trên thẻ và khoảng 150 TB/s băng thông bộ nhớ, cho phép mô hình dự thảo tạo ra các token ứng viên nhanh chóng đến mức mà các ước đoán bị từ chối có chi phí thấp. Một trong những tác giả của bài đăng này là giám đốc công nghệ của d-Matrix Sudeep Bhoja.

Corsair hiện đang được giao hàng với số lượng lớn đến khách hàng ưu tiên, và d-Matrix đang tuyển dụng các kỹ sư trên nhiều chuyên môn khi hai tổ chức kết hợp. Người mua tiếp theo của một rack tăng tốc hỗn hợp GPU và bộ tăng tốc sẽ đánh giá nó dựa trên tốc độ mà một mô hình đi từ đánh giá đến lưu lượng truy cập, và đồng hồ đó hiện đang chạy trên phần mềm mà d-Matrix sở hữu.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.