Моделі та платформи ШІ
Cerebras запускає OpenAI’s GPT-5.6 Sol зі швидкістю 750 токенів на секунду в новому ультрашвидкому рівні

Cerebras тепер запускає флагманську модель OpenAI зі швидкістю, якої не досягли жодні публічні GPU-хмари. 13 серпня 2026 року виробник чіпів на основі пластини оголосив, що він забезпечує роботу GPT-5.6 Sol на новому рівні служби OpenAI під назвою Ultrafast, який забезпечує виведення до 750 токенів на секунду, а за словами OpenAI, працює до 14 разів швидше, ніж стандартна обробка. Ultrafast запускається спочатку в API OpenAI як обмежений перегляд для вибраної групи клієнтів, з розширенням доступу по мірі зростання потужностей.
Основоположна заява полягає в тому, що передова інтелект без штрафу за швидкість. GPT-5.6 Sol – це найкраща модель OpenAI, і на чіпі Cerebras вона генерує токени досить швидко, щоб розміщуватися в реальних продуктах, а не за нічної пакетної роботою. Обидві компанії позиціонують цей рівень як такий, що усуває компроміс між моделлю, достатньо розумною для високоризикових робіт, і тією, яка достатньо швидка для використання під час виконання робіт.
Швидкісні показники Ultrafast
Цифра 750 вивідних токенів на секунду – це заголовок, але більш показові порівняння – це безпосередні запуски, опубліковані Cerebras. За даними компанії, GPT-5.6 Sol на Ultrafast працює в 11 разів швидше, ніж Claude Fable 5, і в 5 разів швидше, ніж Opus 4.8 у швидкому режимі.
Cerebras також провела повний прохід повного екзамену Людини, 2 500 запитань, що відповідають рівням PhD. GPT-5.6 Sol на Ultrafast відповіла на всі 2 500 запитань за 11 годин і 11 хвилин; Claude Fable 5 потребувала 78 годин і 27 хвилин, щоб прийти до подібних висновків: майже в 7 разів повільніше, згідно з даними Cerebras. На GDP-Val, бенчмарку для економічно цінних робіт з знаннями, компанія повідомляє про 5,6-кратне прискорення кінцевого результату порівняно зі стандартною обробкою без погіршення якості.
Це оцінки, проведені виробником, і Cerebras явно заявляє про це: порівняння з Humanity’s Last Exam було оцінено Cerebras 10 і 13-15 липня 2026 року, а дані GDP-Val походять з власних тестів компанії 31 липня 2026 року. Розглядайте їх як власні вимірювання компанії, а не незалежні результати.
Чому чіп на основі пластини виграє на латентності
Механізм тут важливий, оскільки він пояснює, чому відносно невеликий виробник чіпів забезпечує найбільшу модель OpenAI зі швидкістю, якої не досягли інкумбенти GPU. Швидка інференція великої моделі – це фундаментально проблема руху даних: на GPU ваги моделі повинні бути перенесені повторно між пам’яттю на кристалі і зовнішнім сховищем для генерації кожного наступного токену, і пропускна здатність пам’яті стає瓶шею.
Відповідь Cerebras полягає в усуненні цього руху. Її двигун на основі пластини містить 44 ГБ ОЗП на одному чіпі розміру пластини, тому ваги моделі залишаються на кристалі, а токени протікають через шари, укладені по пластинах без перерви. Оскільки ваги ніколи не покидають силікон, цей підхід масштабується з розміром моделі – це аргумент компанії про те, що перевага швидкості зберігається при зростанні моделей передової інтелект. Для економіки інференції це вся гра: вартість і латентність обслуговування моделі домінуються тим, як швидко можна подати ваги до обчислення, а утримання 44 ГБ на одному кристалі безпосередньо атакує це.
$10-мільярдне партнерство досягає флагманського рівня
Ultrafast – це найвидиміший продукт, який виник унаслідок відносин, що будуються вже місяці. OpenAI використала Cerebras для $10 мільярдів низьколатентної обчислювальної техніки на початку 2026 року, і цей запуск розміщує цю потужність за флагманською моделлю компанії, а не за меншою або спеціалізованою. OpenAI описує Ultrafast як “наступний крок” у партнерстві для надання ультра-низьколатентної інференції на своїй платформі.
Для Cerebras таке розміщення значуще. Стартап вже давно стверджує, що його архітектура на основі пластини має правильну форму для інференції, навіть якщо центр тяжіння ринку знаходиться з постачальниками GPU – це змагання, яке розгортається по всьому бізнесу прискорювачів, оскільки інкумбенти рухаються до вбудовування моделей безпосередньо в свій силікон. Отримання рівня обслуговування для флагманської моделі OpenAI надає Cerebras виробничий аккаунт на верхівці ринку. Сама модель закріплює сім’ю GPT-5.6 OpenAI (Sol як флагман, поряд з балансированою Terra і кошто-еффективною Luna), тому Ultrafast прикріплює Cerebras до початку цієї лінійки.
Хто це отримує і для чого це призначено
OpenAI позиціонує цей рівень для часу-чутливих, високоризикових робіт: реакції на інциденти під час їхнього розгортання, фінансових досліджень під час руху ринкових умов, реального часу підтримки клієнтів і голосу, комерції та живих дослідницьких циклів, які раніше працювали вночі. Ранній доступ отримали компанії з кодування, комерції та фінансів, включаючи Jane Street, Podium, Basis і Rogo.
> “Збільшення швидкості, яке принесла Cerebras, вражаюче”, – сказав Джон Крепеззі, AI-помічники в Jane Street, у оголошенні OpenAI. “Воно дозволяє використовувати моделі по-різному і робить його практичним для розробників працювати більш зосереджено і продуктивно поряд з ними”.
OpenAI свідомо звужує розгортання. Компанія заявляє, що вона використовує період перегляду для вивчення того, де зміна швидкості в порядку величини створює найбільшу цінність, і розширить доступ по мірі зростання потужностей. Обидві компанії приймають заявки на оновлення під час розширення перегляду.
Що відбувається далі
Ближня спостережувана величина – це потужність, а не можливість. Ultrafast – це обмежений перегляд, і обидві компанії зв’язують будь-яку ширшу доступність з ростом потужностей, а не з фіксованою датою – тому темп розширення є тим, за чим слід спостерігати. Більш тривале питання полягає в тому, чи зберігає перевагу Cerebras щодо пам’яті на кристалі під час масштабування моделей OpenAI, що саме є тим, на чому побудована архітектура на основі пластини.












