Модели и платформы ИИ
Cerebras запускает GPT-5.6 Sol от OpenAI со скоростью 750 токенов в секунду в новом ультрабыстром уровне

Cerebras теперь запускает флагманскую модель OpenAI со скоростью, которую не смогли повторить публично ни один из GPU-облачных сервисов. 13 августа 2026 года производитель чипов на основе пластины объявил, что он запускает GPT-5.6 Sol на новом уровне сервиса OpenAI под названием Ultrafast, который обеспечивает до 750 выходных токенов в секунду и, по данным OpenAI, запускает модель до 14 раз быстрее, чем стандартная обработка. Ultrafast запускается сначала в API OpenAI как ограниченный просмотр для выбранной группы клиентов, с расширением доступа по мере роста мощностей.
Центральное заявление – это конкретное: передовая интеллект без штрафа за скорость. GPT-5.6 Sol – это наиболее способная модель OpenAI, и на чипе Cerebras она генерирует токены достаточно быстро, чтобы быть интегрированной в реальные продукты, а не за ночной пакетной работой. Обе компании позиционируют уровень как устраняющий компромисс между моделью, достаточно умной для высокорискованной работы, и моделью, достаточно быстрой для использования во время работы.
Скоростные показатели Ultrafast
Цифра 750 выходных токенов в секунду – это заголовок, но более показательными являются сравнения, которые опубликовал Cerebras. По сравнению со скоростями вывода, сообщенными Artificial Analysis, компания утверждает, что GPT-5.6 Sol на Ultrafast работает в 11 раз быстрее, чем Claude Fable 5, и в 5 раз быстрее, чем Opus 4.8 в режиме Fast.
Cerebras также провел полный проход Humanity’s Last Exam, 2,500-вопросочный бенчмарк, ориентированный на уровень PhD. GPT-5.6 Sol на Ultrafast ответил на все 2,500 вопросов за 11 часов и 11 минут; Claude Fable 5 потребовал 78 часов и 27 минут, чтобы прийти к аналогичным выводам: почти в 7 раз медленнее, по данным Cerebras. На GDP-Val, бенчмарке для экономически ценной работы с знаниями, компания сообщает о 5,6-кратном ускорении обработки по сравнению со стандартной обработкой без ухудшения качества.
Это оценки, проведенные поставщиком, и Cerebras явно заявляет об этом: сравнение Humanity’s Last Exam было протестировано Cerebras 10 и 13-15 июля 2026 года, а цифра GDP-Val получена из собственного тестирования 31 июля 2026 года. Относитесь к ним как к собственным измерениям компании, а не к независимым результатам.
Почему чип на основе пластины выигрывает на задержке
Механизм имеет значение, поскольку он объясняет, почему относительно небольшой производитель чипов обслуживает флагманскую модель OpenAI со скоростями, которых не смогли повторить GPU-инкременты. Быстрое вывод на большой модели является фундаментально проблемой перемещения данных: на GPU веса модели должны быть перенесены повторно между памятью на чипе и внешним хранилищем для генерации каждого последующего токена, и пропускная способность памяти становится узким местом.
Ответ Cerebras – устранить это перемещение. Его Wafer-Scale Engine упаковывает 44 ГБ ОЗУ на один чип размером с пластину, поэтому веса модели остаются на чипе, и токены протекают через слои, запущенные на пластинах без перерыва. Поскольку веса никогда не покидают силикон, подход масштабируется с размером модели – что является аргументом компании о том, что преимущество скорости сохраняется при росте фронтовых моделей. Для экономики вывода это вся игра: стоимость и задержка обслуживания модели доминируются тем, как быстро можно подать веса на вычисление, и сохранение 44 ГБ на одном кристалле атакует это напрямую.
$10-миллиардное партнерство достигает флагмана
Ultrafast – это наиболее видимый продукт до сих пор построенных отношений. OpenAI выбрал Cerebras для $10 миллиардов в низкозадержной вычислительной технике ранее в 2026 году, и этот запуск ставит эту мощность за флагманскую модель компании, а не за меньшую или специализированную. OpenAI описывает Ultrafast как “следующий шаг” в партнерстве для предоставления сверхнизкой задержки вывода на своей платформе.
Для Cerebras размещение значимо. Стартап давно утверждает, что его архитектура на основе пластины имеет правильную форму для вывода, даже когда центр тяжести рынка находится с поставщиками GPU – это соревнование, разворачивающееся на рынке ускорителей, когда инкременты перемещаются в выпекание моделей непосредственно в их силикон. Размещение слоя обслуживания для флагманской модели OpenAI дает Cerebras производственный аккаунт-отсылку на вершине рынка. Сама модель закрепляет семейство GPT-5.6, запущенное OpenAI (Sol как флагман, наряду с сбалансированной Terra и экономически эффективной Luna), поэтому Ultrafast прикрепляет Cerebras к началу этой линейки.
Кто получает его и для чего он
OpenAI позиционирует уровень для времени-чувствительной, высокорисковой работы: реагирование на инциденты, пока сбой еще разворачивается, финансовые исследования, пока рыночные условия меняются, реальная поддержка клиентов и голос, коммерция и живые исследовательские циклы, которые ранее запускались ночью. Ранний доступ был предоставлен компаниям по кодированию, коммерции и финансам, включая Jane Street, Podium, Basis и Rogo.
> “Увеличение скорости, обеспеченное Cerebras, впечатляет”, – сказал Джон Крепеззи, AI-помощники в Jane Street, в объявлении OpenAI. “Оно позволяет использовать модели по-разному и делает их практичными для разработчиков, чтобы работать в более сосредоточенном и продуктивном порядке вместе с ними.”
OpenAI намеренно сохраняет узкий запуск. Компания утверждает, что она использует период предварительного просмотра, чтобы узнать, где изменение скорости в 10 раз создает наибольшую ценность, и будет расширять доступ по мере роста мощностей. И OpenAI, и Cerebras принимают заявки на обновления, пока предварительный просмотр расширяется.
Что происходит дальше
Ближайшее наблюдаемое – это мощность, а не способность. Ultrafast – это ограниченный просмотр, и обе компании связывают более широкую доступность с ростом мощностей, а не с фиксированной датой – поэтому темп расширения является тем, что нужно наблюдать. Более долгосрочный вопрос заключается в том, сохраняет ли Cerebras преимущество на уровне памяти на чипе, когда модели OpenAI масштабируются, что является именно той ставкой, на которую построена архитектура на основе пластины.












