Модели и платформы ИИ

Cerebras сообщает о 5‑кратном росте пропускной способности вывода благодаря дисагрегации

mm
Добавьте Unite.AI в избранные источники в Google

Cerebras Systems заявила 1 октября 2026 года, что в ранних результатах она увеличила пропускную способность вывода в 5 раз, используя технику под названием дисагрегация, при том же количестве систем Cerebras и без потери скорости генерации токенов. Об этом было объявлено в Дисагрегированный вывод с нуля, блоге компании, написанном Исаком Таем и Чжэнвэем Гао, который открывает запланированную серию материалов по этой теме.

Пост позиционирует серию для читателей, которые слышали термин дисагрегация или утверждение, что предзаполнение ограничено вычислительными ресурсами, а декодирование — памятью, и задавались вопросом, что это на самом деле означает. Он строит объяснение с нуля, начиная с того, как ускорители уравновешивают вычисления и перемещение данных.

Предзаполнение и декодирование предъявляют разные требования к аппаратуре

В посте арифметическая интенсивность определяется как количество операций с плавающей запятой, делённое на количество байтов, переданных между памятью и вычислительными блоками ускорителя. В одном из примеров добавление двух матриц выполняет 1 FLOP на каждые 6 перемещённых байтов, что соответствует арифметической интенсивности 0,167 FLOP на байт, и это соотношение остаётся постоянным при росте размеров матриц. Умножение матриц ведёт себя иначе: каждое выходное значение формируется из полной строки одного входа и полной колонки другого, поэтому загруженные значения участвуют в большем числе выходов, и арифметическая интенсивность растёт с размером входных данных.

В посте объясняется, что вывод представляет собой цепочку таких умножений матриц между фиксированными весами модели и её входными токенами, и происходит в двух фазах с разными профилями интенсивности. Во время предзаполнения весь запрос обрабатывается параллельно как крупная матричная операция, и реальные запросы могут содержать тысячи, а иногда и сотни тысяч токенов. Во время декодирования токены генерируются по одному, при этом модель полагается на KV‑кеш, который хранит ключи и значения, вычисленные для предыдущих токенов, чтобы переиспользовать их, а не пересчитывать.

Обе фазы всё равно должны передавать все веса модели, потенциально сотни гигабайт или терабайт, в вычислительные блоки для каждого генерируемого токена. В посте показано, что перемещение памяти остаётся почти постоянным, тогда как арифметическая интенсивность падает после предзаполнения, и указывается, что этот разрыв является причиной того, что увеличение чистой вычислительной мощности не обязательно ускоряет поступление токенов во время декодирования.

Дисагрегация разделяет вывод на отдельные пулы

В эксплуатации инференс‑сервер обычно обрабатывает множество запросов одновременно, и когда предзаполнение и декодирование работают на одном и том же оборудовании, вычислительно‑интенсивное предзаполнение может задерживать активные запросы декодирования. Планировщикам тогда приходится выбирать между быстрым получением первого токена для новых запросов, поддержанием плавного потокового ответа для активных запросов и максимизацией общей пропускной способности. Пакетирование позволяет конкурентным запросам совместно читать веса модели, но более крупные пакеты могут удлинить каждый шаг декодирования, поэтому общая пропускная способность может возрасти, в то время как каждый пользователь получает токены медленнее.

В посте дисагрегация описывается как шаблон проектирования систем, который запускает две фазы в отдельных аппаратных пулах. После разделения этапов операторы могут распределять оборудование, задавать политики пакетирования и независимо приоритизировать задержку или пропускную способность для каждой фазы: система со строгими целями по времени до первого токена может выделять больше ресурсов для предзаполнения, тогда как система, ориентированная на плавное потоковое воспроизведение, может предоставить декодированию более крупный или более плотно расписанный пул. Пулы также могут масштабироваться индивидуально.

Разделение вводит новое требование. После того как предзаполнение построит KV‑кеш, это специфическое для запроса состояние должно быть передано в пул декодирования, где оно загружается в память перед продолжением генерации, в то время как веса модели уже загружены в обоих пулах. В посте отмечается, что передача добавляет сетевые и координационные накладные расходы, любой из пулов может простаивать, если их ёмкости не соответствуют спросу, а добавленная задержка зависит от того, перемещается ли кеш между совместно расположенными машинами или между регионами. Делается вывод, что дисагрегация наиболее привлекательна при масштабах, где выгоды от независимого масштабирования и планирования пулов могут превзойти затраты на передачу и эксплуатацию, и что она меняет интерфейс управления обслуживающей системой, а не только сглаживает потоковое воспроизведение.

Разнородное оборудование, ранние результаты и партнёрства

Cerebras заявила, что возглавляет разработку разнородной дисагрегации, объединяя несколько типов чипов в одной системе вывода и назначая различное оборудование сегментам, ограниченным памятью или вычислениями. В посте сравнивается дизайн компании на уровне ваферного масштаба, который распределяет SRAM вместе с вычислениями по всей пластине, с GPU, которые перемещают данные модели из высокоскоростной памяти через более мелкие он‑чип памяти и кэши.

В опубликованной в посте диаграмме пиковой пропускной способности памяти, датированной 10 сентября 2026 года, указаны on-chip SRAM Cerebras WSE‑3 со скоростью 21 000 ТБ/с на пластину, а также безымянный on-chip SRAM‑ускоритель со скоростью 150 ТБ/с и GPU HBM4 со скоростью 23,3 и 22 ТБ/с. Диаграмма предупреждает, что показатели SRAM суммируют локальную пропускную способность памяти по всему процессору, тогда как показатели HBM измеряют трафик из внешней памяти, поэтому эти цифры описывают разные уровни памяти, а не измеренные скорости токенов.

В посте также воспроизводятся данные Artificial Analysis от 10 сентября 2026 г. для GPT-oss-120B, работающего с высоким уровнем рассуждений и 10 000 входных токенов. В списке указаны Cerebras — 1 669 токенов вывода в секунду, SambaNova — 708, Groq — 475, Microsoft Azure — 319, Nebius — 294 и Baseten — 293.

Cerebras заявила, что в традиционной агрегированной системе увеличение ёмкости требовало развертывания дополнительного оборудования, а использование ускорителей партнёров для обработки запросов позволило увеличить ёмкость в 5 раз в ранних тестах при том же размере WSE. Компания сообщила о заключении партнёрств с несколькими аппаратными партнёрами для вывода на рынок ещё более быстрых токенов, и диаграмма в посте показывает системы AWS Trainium и AMD Helios Instinct GPU среди вариантов оборудования для предварительного заполнения, питающих пул декодирования Cerebras.

В посте отмечается, что агентные приложения являются убедительным примером для гетерогенной дезагрегации, поскольку они часто включают длительные многократные диалоги, в которых контекст растёт с каждым вызовом модели, а задержки на каждом этапе накапливаются. Cerebras заявила, что в следующих выпусках будут рассмотрены задействованные аппаратные и программные стеки, а также экономические компромиссы при развертывании дезагрегированного вывода в масштабе.

Theo Nash — специалист, созданный ИИ, в Unite.AI, охватывающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают работу современных искусственных интеллектов. Его работа сосредоточена на технических основах крупномасштабных ИИ‑нагрузок, включая дата‑центры, ускорители, сетевые решения и программные стеки, связывающие их вместе.

С аналитической и инженерно‑ориентированной точки зрения Theo исследует, как прогресс в GPU, пользовательском кремнии, архитектурах памяти и распределённых системах позволяет создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам производительности, энергоэффективности, масштабируемости и практическим ограничениям, формирующим реальное внедрение ИИ‑инфраструктуры.

Статьи, написанные Theo Nash, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.