AI 模型与平台
Cerebras 在全新 Ultrafast 级别下以每秒 750 令牌的速度运行 OpenAI 的 GPT-5.6 Sol

Cerebras (CBRS ) 现在以 GPU 云公开未能匹配的速度运行 OpenAI 的旗舰模型。2026 年 8 月 13 日,晶圆级芯片制造商 宣布,它在名为 Ultrafast 的全新 OpenAI 服务层上为 GPT-5.6 Sol 提供动力,最高可实现每秒 750 个输出令牌,并且根据 OpenAI 的说法,模型的运行速度比标准处理快至 14 倍。Ultrafast 首先在 OpenAI API 中作为有限预览向精选客户推出,随着容量的增长,访问范围将扩大。
核心主张非常明确:在不牺牲速度的前提下实现前沿智能。GPT-5.6 Sol 是 OpenAI 最强大的模型,在 Cerebras 硅片上生成令牌的速度足以直接嵌入实时产品,而不是只能在隔夜批处理后使用。两家公司都将此层级描述为消除“模型足够智能以处理高风险任务”与“模型足够快速以在任务进行时使用”之间的权衡。
Ultrafast 背后的速度数据
每秒 750 令牌的数字是标题,但更具说服力的比较是 Cerebras 发布的对比跑分。与 Artificial Analysis 报告的输出速度相比,公司称 Ultrafast 上的 GPT-5.6 Sol 的速度是 Claude Fable 5 的 11 倍,Fast 模式下的 Opus 4.8 的 5 倍。
Cerebras 还让该层级完整通过了 “Humanity’s Last Exam”——一套 2,500 题、相当于博士水平难度的基准测试。Ultrafast 上的 GPT-5.6 Sol 在 11 小时 11 分钟内回答完全部 2,500 题;Claude Fable 5 则需要 78 小时 27 分钟才能得出可比的结论——在 Cerebras 的说法中慢近 7 倍。在 GDP‑Val(经济价值知识工作基准)上,公司报告相较于标准处理实现了 5.6 倍的端到端加速,且质量没有下降。
这些都是厂商自行运行的评估,Cerebras 对此表述明确:Humanity’s Last Exam 的对比是由 Cerebras 于 2026 年 7 月 10 日及 7 月 13‑15 日进行的基准测试,GDP‑Val 数据来源于其 2026 年 7 月 31 日的内部测试。请将其视为公司自有测量,而非独立结果。
为何晶圆级芯片在延迟上占优势
机制至关重要,因为它解释了为何一家相对小的芯片公司能够以 GPU 竞争对手未能匹配的速度提供 OpenAI 最大的模型。大模型的快速推理本质上是数据移动问题:在 GPU 上,模型权重必须在芯片内存和外部存储之间反复搬运,以生成每个后续令牌,内存带宽因此成为瓶颈。
Cerebras 的解决方案是消除这种搬运。其晶圆级引擎在单块晶圆大小的芯片上集成了 44 GB SRAM,使模型权重始终驻留在芯片上,令牌在跨晶圆的层间流水线上无间断流动。由于权重从未离开硅片,这种架构能够随模型规模线性扩展——这正是公司声称其速度优势能够随前沿模型增长而保持的依据。就推理成本而言,这就是全部关键:服务模型的成本和延迟主要取决于向计算单元输送权重的速度,而将 44 GB 常驻单芯片直接解决了这一瓶颈。
10 亿美元合作伙伴关系触及旗舰模型
Ultrafast 是这段合作关系迄今最显眼的产品。OpenAI 在 2026 年初与 Cerebras 签订了价值 10 亿美元的低延迟计算合作,而此次发布则将该算力用于公司的顶级模型,而非较小或专用模型。OpenAI 将 Ultrafast 描述为合作的“下一步”,旨在为平台提供超低延迟推理。
对 Cerebras 来说,这一定位意义重大。该初创公司长期主张其晶圆级架构是推理的最佳形态,即便市场重心仍在 GPU 供应商——这是一场加速器行业的竞争,传统厂商正转向 将模型直接硬连线进硅片。为 OpenAI 旗舰模型提供服务层,使 Cerebras 获得了市场最高端的生产参考案例。该模型本身是 GPT-5.6 系列(以 Sol 为旗舰,配合平衡的 Terra 与成本效益高的 Luna),因此 Ultrafast 将 Cerebras 置于该系列的最前端。
谁能使用以及用途是什么
OpenAI 将此层级定位于时间敏感、高风险的工作场景:故障仍在发生时的事件响应、市场行情变化时的金融研究、实时客户支持与语音、商业以及过去需要隔夜运行的实时研究循环。早期访问已面向编码、商务和金融领域的公司开放,包括 Jane Street、Podium、Basis 和 Rogo。
“Cerebras 带来的速度提升令人印象深刻,” Jane Street 的 AI 助手负责人 John Crepezzi 在 OpenAI 的公告中表示。”这让模型的使用方式更加多样,也使开发者能够以更专注、更高效的方式与模型协同工作。”
OpenAI 故意将推广范围保持狭窄。公司称正在利用预览期了解数量级速度提升能够创造最大价值的场景,并将在容量提升后扩大访问。OpenAI 与 Cerebras 正在接受更新报名,随着预览范围扩大,更多用户将有机会加入。
接下来会怎样
近期最直观的指标是容量,而非能力。Ultrafast 仍是有限预览,两家公司将更广泛的可用性与容量增长挂钩,而非固定日期——因此扩张速度才是值得关注的关键。更长期的问题是,随着 OpenAI 模型规模扩大,Cerebras 的片上内存优势是否仍然成立,这正是晶圆级架构所押注的核心。












