Модели и платформы ИИ

Cerebras запускает GPT-5.6 Sol от OpenAI со скоростью 750 токенов в секунду в новом тарифе Ultrafast

mm
Добавьте Unite.AI в избранные источники в Google

Cerebras (CBRS ) теперь запускает флагманскую модель OpenAI на скорости, которой ни один облачный сервис на GPU публично не превзошёл. 13 августа 2026 года производитель чипов wafer‑scale объявил, что он обеспечивает работу GPT‑5.6 Sol в новом тарифе OpenAI под названием Ultrafast, предоставляя до 750 токенов вывода в секунду и, по сообщениям OpenAI, работает в 14 раз быстрее, чем стандартная обработка. Ultrafast сначала запускается в API OpenAI как ограниченный предварительный доступ для выбранной группы клиентов, а доступ будет расширяться по мере роста мощности.

Заявление в центре внимания конкретно: передовой интеллект без потери скорости. GPT‑5.6 Sol — самая мощная модель OpenAI, и на кремниевых решениях Cerebras она генерирует токены достаточно быстро, чтобы использоваться в реальном времени, а не в ночных пакетных заданиях. Обе компании позиционируют этот тариф как устраняющий компромисс между моделью, достаточно умной для задач с высоким риском, и моделью, достаточно быстрой для использования в процессе выполнения работы.

Цифры скорости Ultrafast

Показатель в 750 токенов вывода в секунду привлекает внимание, но более показательными являются сравнения в формате «лицом к лицу», опубликованные Cerebras. Согласно данным о скоростях вывода, предоставленным Artificial Analysis, компания утверждает, что GPT‑5.6 Sol в режиме Ultrafast работает в 11 раз быстрее, чем Claude Fable 5, и в 5 раз быстрее, чем Opus 4.8 в режиме Fast.

Cerebras также протестировал этот тариф на полном прохождении Humanity’s Last Exam — теста из 2500 вопросов уровня PhD. GPT‑5.6 Sol в режиме Ultrafast ответил на все 2500 вопросов за 11 часов 11 минут; Claude Fable 5 потребовал 78 часов 27 минут для получения сопоставимых результатов: почти в 7 раз медленнее, по оценке Cerebras. По результатам теста GDP‑Val, измеряющего эффективность экономически ценной интеллектуальной работы, компания сообщает о 5,6‑кратном ускорении от начала до конца по сравнению со стандартной обработкой без потери качества.

Это оценки, проведённые поставщиком, и Cerebras открыто указывает на это: сравнение по Humanity’s Last Exam было проведено Cerebras 10 июля и 13–15 июля 2026 года, а показатель GDP‑Val получен в их собственных тестах 31 июля 2026 года. Считайте их собственными измерениями компании, а не независимыми результатами.

Почему чип wafer‑scale выигрывает в задержке

Механизм имеет значение, потому что он объясняет, почему относительно небольшая компания‑производитель чипов обслуживает крупнейшую модель OpenAI с такой скоростью, которой пока не достигли конкуренты на GPU. Быстрая инференция большой модели по своей сути является проблемой перемещения данных: на GPU веса модели вынуждены многократно перемещаться между памятью на кристалле и внешним хранилищем для генерации каждого последующего токена, и пропускная способность памяти становится узким местом.

Ответ Cerebras — устранить это перемещение. Их Wafer‑Scale Engine размещает 44 ГБ SRAM на едином чипе размером с пластина, поэтому веса модели остаются на кристалле, а токены проходят через слои, конвейерно распределённые по пластинам без перерывов. Поскольку веса никогда не покидают кремний, подход масштабируется вместе с размером модели — это аргумент компании, что преимущество в скорости сохраняется по мере роста передовых моделей. Для экономики инференции это ключевой фактор: стоимость и задержка обслуживания модели определяются тем, насколько быстро можно подавать веса в вычислительные блоки, и хранение 44 ГБ на одном кристалле решает эту задачу напрямую.

Партнёрство на $10 млрд достигает флагмана

Ultrafast — самый заметный продукт в рамках отношений, развивающихся несколько месяцев. OpenAI партнёрствовал с Cerebras на сумму $10 млрд для вычислений с низкой задержкой в начале 2026 года, и этот запуск размещает эту мощность за флагманской моделью компании, а не за более мелкой или специализированной. OpenAI описывает Ultrafast как «следующий шаг» в партнёрстве, направленном на предоставление ультра‑низкозадержечной инференции на своей платформе.

Для Cerebras это размещение имеет большое значение. Стартап давно утверждает, что их архитектура wafer‑scale является оптимальной формой для инференции, даже когда центр рынка сосредоточен у поставщиков GPU — конкуренция, разыгрывающаяся в бизнесе ускорителей, когда incumbents переходят к встраиванию моделей непосредственно в их кремний. Получив слой обслуживания для флагманской модели OpenAI, Cerebras получает производственный референс‑клиент в верхней части рынка. Сама модель является опорой семейства GPT‑5.6, запущенного OpenAI (Sol как флагман, наряду с уравновешенным Terra и экономичным Luna), поэтому Ultrafast привязывает Cerebras к началу этой линейки.

Кому это предназначено и для чего

OpenAI позиционирует этот тариф для задач, требующих мгновенной реакции и высокого риска: реагирование на инциденты во время продолжающегося сбоя, финансовые исследования в условиях меняющихся рыночных условий, поддержка клиентов и голосовые сервисы в реальном времени, коммерция и живые исследовательские циклы, ранее выполнявшиеся в ночное время. Ранний доступ получили компании из сфер разработки, коммерции и финансов, включая Jane Street, Podium, Basis и Rogo.

«Увеличение скорости, обеспеченное Cerebras, впечатляет», — сказал Джон Крепеззи, AI Assistants в Jane Street, в объявлении OpenAI. «Это открывает новые способы использования моделей и делает их практичными для разработчиков, позволяя работать более сосредоточенно и продуктивно вместе с ними».

OpenAI намеренно ограничивает развертывание. Компания заявляет, что использует период предварительного доступа, чтобы понять, где изменение скорости в порядок величины создаёт наибольшую ценность, и будет расширять доступ по мере роста мощности. Как OpenAI, так и Cerebras принимают заявки на обновления по мере расширения предварительного доступа.

Что будет дальше

Ближайшее, что можно наблюдать, — это ёмкость, а не возможности. Ultrafast представляет собой ограниченный предварительный доступ, и обе компании связывают более широкую доступность с ростом мощности, а не с фиксированной датой — поэтому темп расширения следует отслеживать. Долгосрочный вопрос состоит в том, сохранится ли преимущество on‑chip‑memory от Cerebras по мере масштабирования моделей OpenAI, что как раз и является ставкой, на которой построена архитектура wafer‑scale.

Theo Nash — специалист, созданный ИИ, в Unite.AI, охватывающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают работу современных искусственных интеллектов. Его работа сосредоточена на технических основах крупномасштабных ИИ‑нагрузок, включая дата‑центры, ускорители, сетевые решения и программные стеки, связывающие их вместе.

С аналитической и инженерно‑ориентированной точки зрения Theo исследует, как прогресс в GPU, пользовательском кремнии, архитектурах памяти и распределённых системах позволяет создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам производительности, энергоэффективности, масштабируемости и практическим ограничениям, формирующим реальное внедрение ИИ‑инфраструктуры.

Статьи, написанные Theo Nash, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.