Поглинання

d-Matrix купив Wallaroo, щоб оркеструвати висновок по всім чіпам

mm
Додайте Unite.AI до бажаних джерел у Google

d-Matrix придбала Wallaroo.ai, виробника програмного забезпечення для розгортання та оркестрування висновку штучного інтелекту, у угоді, про яку Санта-Клара компанія з виробництва чіпів повідомила 3 серпня 2026 року. Ця покупка дозволяє компанії Wallaroo передати свою платформу, інтелектуальну власність та інженерний персонал до компанії d-Matrix, і це друга покупка компанії за останні чотири місяці.

Логіка цієї угоди полягає в тому, як d-Matrix продає свій силікон. Її прискорювачі Corsair розроблені для роботи поряд з GPU, а не для їх заміни, приймаючи фазу декодування запиту мови, пам’яттю, що видає токени один за одним, тоді як GPU обробляє важкий попередній етап. Зробити цей розподіл у живому кластері – це завдання програмного забезпечення: щось має вирішувати, який чіп отримує яку частину кожного запиту, передавати накопичений контекст між ними та масштабувати обидва рівні незалежно при зміні трафіку. Це шар – те, що компанія d-Matrix щойно придбала.

Що привносить Wallaroo

Wallaroo пропонує час виконання та контрольну площину, які пакують моделі та передають їх на апаратне забезпечення x86, Arm та GPU у хмарі, на локальних серверах, на краю та у повністю ізольованих середовищах, з підтримкою загальних часів виконання моделей мови, включаючи vLLM та SGLang. Її інженерна, продукційна та маркетингові команди приєднуються до компанії d-Matrix, яка відзначила їхню роботу у сфері програмної архітектури, високопродуктивного обчислювання та операцій з Kubernetes.

Обидві компанії вже описували одну й ту ж архітектуру. У пості від 16 березня 2026 року засновник та генеральний директор Wallaroo Від Джейн та двоє його колег виклали аргументи на користь розділення попереднього етапу від декодування на змішаному силіконі. Агентний трафік, пишуть вони, надходить у трьох розмірах: приблизно 84% коротких запитів довжиною близько 2000 токенів, близько 15% у діапазоні 8000-64000 токенів, та менше 1% – 128000 токенів або більше. Останній шматок монополізує час GPU та блокує все, що чекає у черзі. Маршрутизація, залежна від кешу, сама по собі скоротила час до першого токену у найгіршому випадку на 75% для агентного трафіку у власних тестах.

Засновник та генеральний директор компанії d-Matrix Сід Шет сказав, що клієнти повідомили компанії, що найбільша перешкода – “це не тільки продуктивність, а й операційна складність досягнення цього рівня”. Джейн сказав, що вони обоє поділяють думку, що висновок так само є проблемою розгортання, як і проблемою силікону.

Дві угоди за чотири місяці

Компанія d-Matrix купує частини системи висновку, якої вона не будувала. У квітні 2026 року вона придбала бізнес з центрів даних компанії GigaIO, отримавши систему SuperNODE та фабрику пам’яті FabreX на основі PCIe, а також команду з розробки систем рівня стійки в Карлсбаді, Каліфорнія, тоді як GigaIO продовжила свою незалежну діяльність у сфері обчислення на краю. Сам прискорювач Corsair ввійшов у повне виробництво 9 червня 2026 року, виготовлений компанією Alchip на вузлі TSMC N6, використовуючи чіплети з обчисленнями в пам’яті на основі SRAM на органічних субстратах з пам’яттю LP-DDR5 замість стеків HBM та пакування CoWoS, у стійках, які працюють з повітряним охолодженням.

Оплата здійснюється за рахунок 275 мільйонів доларів серії C, закритої 12 листопада 2025 року за оцінку у 2 мільярди доларів, яку спільно очолили BullhoundCapital, Triatomic Capital та Temasek. Компанія також збирає партнерів навколо платформи, включаючи партнерство з низьколатентною інфраструктурою компанії Infineon.

Купівля шару розгортання стає стандартним ходом для будь-якої компанії, яка продає не-Nvidia (NVDA ) обчислення. Qualcomm завершила свою угоду про придбання компіляторного стартапу Modular (QCOM ) у липні 2026 року, Nscale купила Anyscale, щоб піднятися вгору по стеку обчислень того ж місяця, а Nebius погодилася придбати Eigen AI у угоді на 643 мільйони доларів, спрямованій на інфраструктуру висновку. Силікон, який потребує другого програмного шару, щоб бути корисним, програє силікону, який поставляється з ним.

Де пара проходження тестування

Комерційний довідний пункт на сьогодні – це Parasail, хмара висновку, яка 7 липня 2026 року заявила, що розгортає прискорювачі Corsair поряд з флотом GPU Hopper та Blackwell, передаючи попередній етап до GPU та декодування до прискорювачів через мережу, яка використовує понад 40 центрів даних у 15 країнах. Власна технологія маршрутизації ядер Parasail здійснює диспетчеризацію там, що є саме тією функцією, яку тепер володіє компанія d-Matrix.

Виробничий випадок спирається на виміряні та змодельовані результати, опубліковані Gimlet Labs 11 березня 2026 року. Виконуючи gpt-oss-120b з моделлю проекту на 1,6 мільярда параметрів, фірма перенесла спекулятивний етап декодування з GPU на прискорювач Corsair, тоді як попередній етап та верифікація залишилися на GPU, і повідомила про 2-10 разів швидші кінцеві запити при збереженні енергоефективності. Gimlet приписує цю вигоду 2 ГБ оперативної пам’яті на чіпі та приблизно 150 ТБ/с пропускної здатності пам’яті, що дозволяє моделі проекту швидко генерувати кандидатські токени, так що відхилені гіпотези коштують мало. Одним із співавторів цього поста є технічний директор компанії d-Matrix Судіп Бходжа.

Прискорювач Corsair зараз відправляється клієнтам у великих обсягах, а компанія d-Matrix набирає інженерів різних спеціальностей, оскільки дві організації об’єднуються. Наступний покупець змішаної стійки GPU та прискорювача буде судити про неї за тим, як швидко модель переходить від оцінки до обслуговування трафіку, і цей годинник тепер працює на програмному забезпеченні, яким володіє компанія d-Matrix.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.