Поглощения

d-Matrix приобрела Wallaroo для оркестровки вывода по нескольким чипам

mm
Добавьте Unite.AI в избранные источники в Google

d-Matrix приобрела Wallaroo.ai, производителя программного обеспечения для развертывания и оркестровки вывода ИИ, в сделке, о которой Санта-Клара компания по производству чипов объявила 3 августа 2026 года. Покупка привносит платформу Wallaroo, интеллектуальную собственность и инженерный персонал в d-Matrix, и это вторая приобретение компании за четыре месяца.

Обоснование заключается в том, как d-Matrix продает силикон. Ее ускорители Corsair предназначены для работы рядом с GPU, а не для их замены, принимая на себя фазу декодирования запроса языковой модели, память-зависимую половину, которая выдает токены один за другим, в то время как GPU обрабатывают предзаполнение. Сделать этот раздел работать в живом кластере – это задача программного обеспечения: что-то должно решить, какой чип получит какую часть каждого запроса, передать накопленный контекст между ними и масштабировать оба уровня независимо по мере сдвига трафика. Этот слой – это то, что d-Matrix только что купила.

Что привносит Wallaroo

Wallaroo продает runtime для обслуживания и контрольную плоскость, которые упаковывают модели и推ают их на аппаратное обеспечение x86, Arm и GPU в облаке, на локальных площадках, на краю и в полностью воздушных средах, с поддержкой общих runtime для больших языковых моделей, включая vLLM и SGLang. Ее инженерные, продуктовые и маркетинговые команды присоединяются к d-Matrix, которая сослалась на их работу в области программной архитектуры, высокопроизводительных вычислений и операций Kubernetes.

Две компании уже описывали одну и ту же архитектуру. В инженерном посте от 16 марта 2026 года основатель и генеральный директор Wallaroo Вид Джейн и два его коллеги изложили дело за разделение предзаполнения от декодирования на смешанном силиконе. Агентный трафик, написали они, поступает в трех размерах: примерно 84% коротких запросов длиной около 2000 токенов, около 15% в диапазоне 8000-64000 токенов и менее 1% более 128000 токенов. Этот последний сегмент монополизирует время GPU и блокирует все, что стоит в очереди за ним. Маршрутизация, осведомленная о кэше, одна, сообщили авторы, сократила время до первого токена в худшем случае на 75% на агентном трафике в их собственных тестах.

Сид Шет, основатель и генеральный директор d-Matrix, сказал, что клиенты сказали компании, что самым большим барьером “не только производительность, но и операционная сложность достижения этого”. Джейн сказал, что две компании разделяют точку зрения, что вывод – это столь же проблема развертывания, как и проблема силикона.

Две сделки за четыре месяца

d-Matrix покупает части системы вывода, которую она не построила. В апреле 2026 года она приобрела бизнес GigaIO в центре обработки данных, получив систему SuperNODE и фабрику FabreX на основе PCIe, а также команду систем на уровне стойки в Карлсбаде, Калифорния, в то время как GigaIO продолжала работать независимо на краю вычислений. Сам Corsair вошел в полную производство 9 июня 2026 года, изготовленный Alchip на узле TSMC N6, используя чиплеты с вычислениями в памяти на основе SRAM на органических подложках с памятью LP-DDR5 вместо стопок HBM и упаковки CoWoS, в стойках, которые работают воздушным охлаждением.

Платеж за это – 275 миллионов долларов США серии C, закрытой 12 ноября 2025 года при оценке в 2 миллиарда долларов США, которую возглавили BullhoundCapital, Triatomic Capital и Temasek. Компания также собирала партнеров вокруг платформы, включая партнерство по инфраструктуре с низкой задержкой с Infineon.

Покупка слоя развертывания становится стандартным ходом для всех, кто продает вычисления, не являющиеся Nvidia (NVDA ). Qualcomm закрыла свою всеакционную приобретение стартапа-компилятора Modular (QCOM ) в июле 2026 года, Nscale купила Anyscale, чтобы переместиться вверх по стеку вычислений в том же месяце, и Nebius согласилась приобрести Eigen AI в сделке на 643 миллиона долларов США, направленной на укрепление инфраструктуры вывода. Силикон, который нуждается во втором программном стеке, чтобы быть полезным, проигрывает силикону, который поставляется с ним.

Где парная проверка проходит

Коммерческая точка доказательства на данный момент – Parasail, облако вывода, которое 7 июля 2026 года заявило, что оно развертывает Corsair рядом с флотом NVIDIA Hopper и Blackwell, отправляя предзаполнение на GPU и декодирование на ускорители через сеть, которая опирается на более чем 40 центров обработки данных в 15 странах. Собственная технология маршрутизации ядер Parasail выполняет диспетчеризацию там, что является именно той функцией, которую d-Matrix теперь владеет внутри компании.

Случай производительности основан на измеренных и смоделированных результатах, опубликованных Gimlet Labs 11 марта 2026 года. Запуская gpt-oss-120b с моделью-черновиком на 1,6 миллиарда параметров, компания переместила спекулятивное декодирование с GPU на Corsair, в то время как предзаполнение и проверка остались на GPU, и сообщила о 2-10-кратном увеличении скорости запросов от конца до конца при сохраненной энергоэффективности. Gimlet приписывает прирост карте 2 ГБ на-чип SRAM и примерно 150 ТБ/с пропускной способности памяти, что позволяет модели-черновику производить кандидатские токены достаточно быстро, чтобы отклоненные предположения стоили мало. Один из соавторов публикации – технический директор d-Matrix Сudeep Bhoja.

Corsair теперь поставляется в объеме приоритетным клиентам, и d-Matrix набирает инженеров по нескольким специальностям, поскольку две организации объединяются. Следующий покупатель смешанного стойки GPU и ускорителя будет судить его по тому, как быстро модель переходит от оценки к обслуживанию трафика, и этот час теперь работает на программном обеспечении, которым владеет d-Matrix.

Тео Нэш - специалист, сгенерированный ИИ, в Unite.AI, освещающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают современный искусственный интеллект. Его работа сосредоточена на технических основах, лежащих в основе крупномасштабных рабочих нагрузок ИИ, включая центры данных, ускорители, сетевое взаимодействие и программные стеки, которые их объединяют.
С аналитической и инженерно-ориентированной точки зрения, Тео исследует, как достижения в области GPU, специального кремния, архитектур памяти и распределенных систем позволяют создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам между производительностью, энергоэффективностью, масштабируемостью и практическими ограничениями, которые формируют реальное развертывание инфраструктуры ИИ.
Статьи, написанные Тео Нэшем, сгенерированы ИИ и рассмотрены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.