Моделі та платформи ШІ

Cerebras запускає GPT‑5.6 Sol від OpenAI зі швидкістю 750 токенів за секунду у новому тарифі Ultrafast

mm
Додайте Unite.AI до бажаних джерел у Google

Cerebras (CBRS ) зараз запускає флагманську модель OpenAI з швидкістю, яку жоден GPU‑хмарний сервіс публічно не зрівняв. 13 серпня 2026 року виробник чіпів ваферного масштабу оголосив, що він живить GPT‑5.6 Sol у новому тарифі OpenAI під назвою Ultrafast, забезпечуючи до 750 вихідних токенів за секунду і, за даними OpenAI, працює в 14‑раз швидше, ніж стандартна обробка. Ultrafast спочатку запускається в API OpenAI як обмежений попередній перегляд для вибраної групи клієнтів, а доступ розширюватиметься зі збільшенням потужностей.

Ключове твердження є конкретним: передова інтелектуальна система без штрафу за швидкість. GPT‑5.6 Sol — найпотужніша модель OpenAI, і на кремнії Cerebras вона генерує токени настільки швидко, що може працювати у реальному часі, а не лише у нічних пакетних завданнях. Обидві компанії позиціонують цей тариф як усунення компромісу між моделлю, достатньо розумною для високостискових завдань, і моделлю, достатньо швидкою для використання під час виконання роботи.

Числа швидкості, що стоять за Ultrafast

Показник у 750 вихідних токенів за секунду — це заголовок, але більш інформативні порівняння — це прямі випробування, опубліковані Cerebras. Порівняно зі швидкостями, повідомленими Artificial Analysis, компанія стверджує, що GPT‑5.6 Sol у Ultrafast працює в 11‑раз швидше, ніж Claude Fable 5, і в 5‑раз швидше, ніж Opus 4.8 у режимі Fast.

Cerebras також протестував цей тариф у повному проході Humanity’s Last Exam — тесту з 2 500 питань, складність якого відповідає рівню доктора наук. GPT‑5.6 Sol у Ultrafast відповів на всі 2 500 питань за 11 годин 11 хвилин; Claude Fable 5 знадобилося 78 годин 27 хвилин, щоб досягти подібних результатів: майже в 7‑раз повільніше, за словами Cerebras. У тесті GDP‑Val, що оцінює економічно цінну інтелектуальну роботу, компанія повідомляє про 5,6‑разове прискорення від початку до кінця порівняно зі стандартною обробкою без втрати якості.

Це оцінки, проведені постачальником, і Cerebras чітко зазначає це: порівняння Humanity’s Last Exam було проведено Cerebras 10 липня та 13‑15 липня 2026 року, а дані GDP‑Val походять з їх власного тестування 31 липня 2026 року. Ставте їх за власні вимірювання компанії, а не за незалежні результати.

Чому ваферний чіп переважає за затримкою

Механізм має значення, оскільки він пояснює, чому відносно невелика компанія‑виробник чіпів обслуговує найбільшу модель OpenAI з швидкостями, які GPU‑конкуренти не змогли досягти. Швидке виведення на великій моделі в основному є проблемою переміщення даних: на GPU ваги моделі доводиться постійно переносити між пам’яттю на кристалі та зовнішньою пам’яттю для генерації кожного наступного токену, і пропускна здатність пам’яті стає вузьким місцем.

Відповідь Cerebras полягає у усуненні цього переміщення. Їх Wafer‑Scale Engine розміщує 44 ГБ SRAM на одному чипі розміром з вафер, тому ваги моделі залишаються на кристалі, а токени проходять через шари, конвеєрно розташовані по ваферам без перерв. Оскільки ваги ніколи не залишають кремнію, підхід масштабуються разом з розміром моделі — це аргумент компанії, що перевага у швидкості зберігається зі зростанням передових моделей. Для економіки виведення це головна суть: вартість і затримка обслуговування моделі визначаються тим, наскільки швидко можна подавати ваги до обчислювальних блоків, і зберігання 44 ГБ на одному кристалі безпосередньо вирішує це.

Партнерство вартістю 10 мільярдів доларів досягає флагмана

Ultrafast — це найвидиміший продукт у межах відносин, що будувалися протягом місяців. OpenAI запросив Cerebras на 10 мільярдів доларів для обчислень з низькою затримкою на початку 2026 року, і цей запуск розміщує цю потужність за провідною моделлю компанії, а не за меншою чи спеціалізованою. OpenAI описує Ultrafast як «наступний крок» у партнерстві, спрямованому на забезпечення ультранизькозатримкових виведень у своїй платформі.

Для Cerebras це розташування має велике значення. Стартап давно стверджує, що його ваферна архітектура є оптимальною для виведення, навіть коли центр тяжіння ринку перебуває у постачальників GPU — конкуренція, що розгортається в галузі прискорювачів, коли incumbents переходять до вбудовування моделей безпосередньо у їхній кремній. Отримання шару обслуговування для флагманської моделі OpenAI дає Cerebras виробничий референсний акаунт на вершині ринку. Сама модель є опорою сімейства GPT‑5.6, запущеного OpenAI (Sol як флагман, поряд з збалансованим Terra та економічним Luna), тому Ultrafast прив’язує Cerebras до початку цього ряду.

Хто отримує його і для чого

OpenAI позиціонує цей тариф для чутливих до часу, високостискових завдань: реагування на інциденти під час перебігу збою, фінансові дослідження у динамічних ринкових умовах, підтримка клієнтів та голос у реальному часі, комерція та живі дослідницькі цикли, які раніше виконувалися вночі. Ранній доступ отримали компанії з галузей кодування, комерції та фінансів, серед яких Jane Street, Podium, Basis і Rogo.

«Збільшення швидкості, яке забезпечує Cerebras, вражає», — сказав Джон Крепеззі, AI Assistants у Jane Street, у заяві OpenAI. «Воно відкриває різні способи використання моделей і робить їх практичними для розробників, які можуть працювати більш сфокусовано та продуктивно разом із ними».

OpenAI навмисно обмежує розгортання. Компанія заявляє, що використовує період попереднього перегляду, щоб з’ясувати, де зміна швидкості в порядку величини створює найбільшу цінність, і розширить доступ зі зростанням потужностей. Як OpenAI, так і Cerebras приймають реєстрації на оновлення у міру розширення попереднього перегляду.

Що буде далі

У короткостроковій перспективі спостерігається потужність, а не можливості. Ultrafast — це обмежений попередній перегляд, і обидві компанії прив’язують будь‑яку ширшу доступність до зростання потужностей, а не до фіксованої дати — тому темп розширення варто стежити. Довгострокове питання — чи збережеться перевага on‑chip‑memory у Cerebras, коли моделі OpenAI масштабуватимуться, що саме й є ставкою, на якій базується ваферна архітектура.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.