Моделі та платформи ШІ

Cerebras повідомляє про 5‑разове збільшення пропускної здатності виведення завдяки дисагрегації

mm
Додайте Unite.AI до бажаних джерел у Google

Cerebras Systems повідомила 1 жовтня 2026 року, що підвищила пропускну здатність виведення в 5 разів у ранніх результатах, використовуючи техніку під назвою дисагрегація, з тією ж кількістю систем Cerebras і без втрати швидкості генерації токенів. Інформація була опублікована у Дисагреговане виведення з нуля, блозі компанії, написаному Ісааком Тай та Чженвее Гао, який відкриває заплановану серію на цю тему.

У дописі серія представлена читачам, які чули про термін дисагрегація або про твердження, що заповнення обмежене обчисленнями, а декодування — пам’яттю, і задавалися питанням, що саме це означає. Пояснення будується з нуля, починаючи з того, як прискорювачі балансують арифметичні операції та переміщення даних.

Заповнення та декодування створюють різні вимоги до апаратури

У дописі арифметичну інтенсивність визначають як кількість операцій з плаваючою комою, поділену на кількість байтів, переданих між пам’яттю та обчислювальними блоками прискорювача. У одному з прикладів додавання двох матриць виконується 1 FLOP на кожні 6 байт переміщення, що дає арифметичну інтенсивність 0,167 FLOP на байт, і це співвідношення залишається постійним при збільшенні розмірів матриць. Множення матриць поводиться інакше: кожне вихідне значення будується з усієї рядка одного вхідного та всієї колонки іншого, тому завантажені значення впливають на більше виходів, і арифметична інтенсивність зростає зі збільшенням розміру вхідних даних.

У дописі пояснюється, що виведення — це ланцюжок таких множень матриць між фіксованими вагами моделі та її вхідними токенами, і він виконується в двох фазах з різними профілями інтенсивності. Під час заповнення весь запит обробляється паралельно як велика матрична операція, і реальні запити можуть містити тисячі, а іноді й сотні тисяч токенів. Під час декодування токени генеруються по одному, і модель покладається на KV‑кеш, який зберігає ключі та значення, обчислені для попередніх токенів, щоб їх можна було повторно використати, а не переобчислювати.

Обидві фази все ж повинні переміщувати всі ваги моделі, потенційно сотні гігабайт або терабайт, до обчислювальних блоків для кожного згенерованого токена. У дописі показано, що переміщення пам’яті залишається майже постійним, тоді як арифметична інтенсивність падає після заповнення, і зазначено, що ця різниця є причиною того, чому збільшення чистої обчислювальної потужності не обов’язково прискорює надходження токенів під час декодування.

Дисагрегація розділяє виведення на окремі пулі

У виробничих умовах сервер виведення зазвичай обробляє багато запитів одночасно, і коли заповнення та декодування працюють на одній апаратурі, обчислювально інтенсивне заповнення може затримувати активні запити декодування. Планувальники тоді мають вибирати між швидким отриманням нових запитів до їхнього першого токена, плавним потоковим передаванням активних відповідей та максимізацією загальної пропускної здатності. Пакетна обробка дозволяє одночасним запитам ділитися роботою з читання ваг моделі, але більші пакети можуть подовжити кожен крок декодування, тому загальна пропускна здатність може зростати, тоді як кожен користувач отримує токени повільніше.

У дописі дисагрегація описується як шаблон системного дизайну, який запускає дві фази в окремих апаратних пулах. Після розділення етапів оператори можуть розподіляти апаратуру, встановлювати політики пакетної обробки та пріоритезувати затримку або пропускну здатність для кожної фази окремо: система з жорсткими вимогами до часу до першого токена може зарезервувати більше ресурсів для заповнення, тоді як система, орієнтована на плавне потокове передавання, може надати декодуванню більший або більш щільно запланований пул. Пули також можна масштабувати індивідуально.

Розділення вводить нову вимогу. Після того, як заповнення створює KV‑кеш, цей специфічний для запиту стан має бути переданий у пул декодування, де він завантажується в пам’ять перед продовженням генерації, тоді як ваги моделі вже завантажені в обох пулах. У дописі зазначається, що передача додає мережеві та координаційні накладні витрати, що будь‑який пул може залишатися простою, якщо потужності не відповідають попиту, і що додаткова затримка залежить від того, чи кеш переміщується між спільно розташованими машинами чи між регіонами. Стверджується, що дисагрегація є найпривабливішою при масштабуванні, коли вигоди від незалежного розміру та планування пулів можуть переважити витрати на передачу та експлуатацію, і що вона змінює інтерфейс керування системою обслуговування, а не лише згладжує потокове передавання.

Різнорідна апаратура, ранні результати та партнерства

Cerebras заявила, що очолює розробку різнорідної дисагрегації, поєднуючи кілька типів чипів в одній системі виведення та призначаючи різну апаратуру сегментам, які обмежені пам’яттю або обчисленнями. У дописі порівнюється дизайн компанії на рівні пластини, який розподіляє SRAM разом з обчисленнями по всій пластині, з GPU, які передають дані моделі з пам’яті з високою пропускною здатністю через менші он-чіп пам’яті та кеші.

У дописі наведено опубліковану діаграму пікової пропускної здатності пам’яті, датовану 10 вересня 2026 року, де вказано, що вбудований у чип SRAM Cerebras WSE-3 досягає 21 000 ТБ/с на пластину, поряд з неназваним прискорювачем SRAM у чипі — 150 ТБ/с та GPU HBM4 — 23,3 і 22 ТБ/с. У діаграмі застерігають, що показники SRAM підсумовують локальну пропускну здатність пам’яті по всьому процесору, тоді як показники HBM вимірюють трафік з зовнішньої пам’яті, тому цифри описують різні рівні пам’яті, а не вимірювану швидкість токенів.

У дописі також відтворено дані Artificial Analysis від 10 вересня 2026 року для GPT-oss-120B, що працює у режимі високого міркування з 10 000 вхідних токенів. У ньому зазначено Cerebras зі швидкістю 1 669 вихідних токенів за секунду, SambaNova — 708, Groq — 475, Microsoft Azure — 319, Nebius — 294 та Baseten — 293.

Cerebras зазначила, що в традиційній агрегованій системі збільшення потужності вимагало розгортання більшої кількості обладнання, і що, використовуючи прискорювачі партнерів для обробки запитів, вона збільшила потужність у 5 разів у ранніх тестах з тим самим розміром WSE. Компанія повідомила про оголошення партнерств з кількома апаратними партнерами з метою виведення на ринок ще більш ультрашвидких токенів, а діаграма у дописі показує системи AWS Trainium та AMD Helios Instinct GPU серед варіантів апаратного поповнення, які живлять пул декодування Cerebras.

У дописі зазначено, що агентні застосунки є привабливим варіантом для гетерогенних дезагрегацій, оскільки вони часто включають довгі багатокрокові робочі процеси, у яких контекст зростає між викликами моделей, а затримки на кожному кроці накопичуються. Cerebras повідомила, що в наступних випусках будуть розглянуті залучені апаратні та програмні стеки та економічні компроміси впровадження дезагрегованого інференсу у масштабі.

Theo Nash є спеціалістом, створеним за допомогою ШІ, у Unite.AI, який охоплює AI‑інфраструктуру, обчислення та апаратні системи, що живлять сучасний штучний інтелект. Його робота зосереджена на технічних основах великих AI‑навантажень, включаючи дата‑центри, акселератори, мережі та програмні стеки, що їх об’єднують.

З аналітичної та інженерно‑орієнтованої точки зору, Тео досліджує, як прогрес у GPU, спеціальному кремнії, архітектурах пам’яті та розподілених системах дозволяє створювати нові покоління AI‑моделей. Він особливу увагу приділяє компромісам продуктивності, енергоефективності, масштабованості та практичним обмеженням, які формують реальне впровадження AI‑інфраструктури.

Статті, написані Theo Nash, створені за допомогою ШІ та перевірені редакційною командою Unite.AI, щоб забезпечити технічну точність, зрозумілість та відповідальне висвітлення швидко розвиваючогося ландшафту AI‑обчислень.