AI 模型与平台

Cerebras 运行 OpenAI 的 GPT-5.6 Sol 以每秒 750 个令牌的速度在新 Ultrafast 级别中

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Cerebras 现在以其他 GPU 云尚未公开匹配的速度运行 OpenAI 的旗舰模型。2026 年 8 月 13 日,晶圆级芯片制造商 宣布 它支持 GPT-5.6 Sol 在一个名为 Ultrafast 的新 OpenAI 服务级别上,提供高达每秒 750 个输出令牌,并根据 OpenAI 的说法 ,该模型的运行速度比标准处理快 14 倍。Ultrafast 首先在 OpenAI API 中作为有限预览发布,仅面向一组选定的客户,随着容量的增长,访问权限将扩大。

核心主张是一个具体的主张:没有速度惩罚的前沿智能。GPT-5.6 Sol 是 OpenAI 最强大的模型,在 Cerebras 硅片上,它生成令牌的速度足够快,可以嵌入实时产品,而不是放在过夜批处理作业之后。两家公司都将该级别视为消除了在高风险工作中使用足够智能的模型和足够快速的模型之间的权衡。

Ultrafast 的速度数字

每秒 750 个输出令牌的数字是标题,但更有意义的比较是 Cerebras 发布的头对头运行。根据 Artificial Analysis 报告的输出速度,公司表示 Ultrafast 上的 GPT-5.6 Sol 比 Claude Fable 5 快 11 倍,比 Fast 模式下的 Opus 4.8 快 5 倍。

Cerebras 还对 Ultrafast 进行了完整的 Humanity’s Last Exam 测试,这是一个包含 2,500 个问题的基准测试,难度相当于博士水平。Ultrafast 上的 GPT-5.6 Sol 在 11 小时 11 分钟内回答了所有 2,500 个问题,而 Claude Fable 5 需要 78 小时 27 分钟才能得出类似的结论:在 Cerebras 的说法中,慢了近 7 倍。在 GDP-Val 基准测试中,公司报告称与标准处理相比,Ultrafast 的端到端速度提高了 5.6 倍,没有质量下降。

这些是供应商运行的评估,Cerebras 明确说明了这一点:Humanity’s Last Exam 比较是在 2026 年 7 月 10 日和 13-15 日进行的,GDP-Val 数字来自 2026 年 7 月 31 日的测试。将它们视为公司自己的测量结果,而不是独立结果。

为什么晶圆级芯片在延迟方面获胜

机制在这里很重要,因为它解释了为什么相对较小的芯片制造商能够以其他 GPU 巨头尚未匹配的速度提供 OpenAI 的最大模型。对大型模型进行快速推理本质上是一个数据移动问题:在 GPU 上,模型权重必须在芯片内存和外部存储之间反复传递以生成每个连续令牌,内存带宽成为瓶颈。

Cerebras 的解决方案是消除这种移动。其 Wafer-Scale Engine 将 44 GB 的 SRAM 打包到单个晶圆尺寸的芯片上,因此模型权重保持在芯片上,令牌流经晶圆上的管道层而不会中断。由于权重永远不会离开硅片,因此这种方法可以扩展到模型大小 —— 这是公司认为速度优势在前沿模型增长时仍然成立的论点。对于推理经济学来说,这就是全部游戏:服务模型的成本和延迟由权重传递到计算的速度决定,保持 44 GB 在一个芯片上直接解决了这个问题。

100 亿美元合作关系达到旗舰级别

Ultrafast 是一个已经建立数月的合作关系的最可见产品。OpenAI 已与 Cerebras 合作 ,价值 100 亿美元的低延迟计算,在 2026 年初,随着 Ultrafast 的推出,这项合作关系将其容量投入到 OpenAI 的顶级模型中,而不是较小或专用模型。OpenAI 将 Ultrafast 描述为“下一步”,以将超低延迟推理引入其平台。

对于 Cerebras 来说,这次合作非常重要。该初创公司长期以来一直认为其晶圆级架构是推理的正确形状,即使市场的重心仍然在 GPU 供应商身上 —— 这是一场正在加速器业务中展开的竞争,现有供应商正在将模型直接硬编码到其硅片中。为 OpenAI 的旗舰模型提供服务层使 Cerebras 在市场顶端获得了一个生产参考账户。该模型本身锚定了 GPT-5.6 家族 ,OpenAI 发布了该家族(Sol 作为旗舰,以及平衡的 Terra 和成本效益的 Luna ),因此 Ultrafast 将 Cerebras 连接到该产品线的前端。

谁能获得它以及它的用途

OpenAI 将该级别定位为时间敏感的高风险工作:在中断仍在发生时进行事件响应,在市场条件变化时进行金融研究,实时客户支持和语音、商务和实时研究循环,这些循环以前需要过夜运行。早期访问权已授予编码、商务和金融领域的公司,包括 Jane Street、Podium、Basis 和 Rogo。

> “Cerebras 带来的速度提升令人印象深刻”,OpenAI 宣布的 John Crepezzi,Jane Street 的 AI 助手说。“它使开发人员能够以不同的方式使用模型,并使他们能够以更专注和高效的方式与模型一起工作。”

OpenAI 故意保持了狭窄的推出范围。该公司表示,它正在利用预览期来学习一个数量级的速度变化在哪里创造了最大的价值,并将在容量增长时扩大访问权限。OpenAI 和 Cerebras 都正在接受更新的注册,随着预览的扩大。

接下来会发生什么

近期的可观察结果是容量,而不是能力。Ultrafast 是一个有限的预览,两家公司都将更广泛的可用性与容量增长而不是固定的日期联系起来 —— 因此,扩张的步伐是需要关注的东西。更长期的问题是,随着 OpenAI 模型的扩大,Cerebras 的芯片内存优势是否仍然存在,这正是晶圆级架构建立的赌注。ted 预览,并且两家公司都将更广泛的可用性与容量增长而不是固定的日期联系起来 —— 因此,扩张的步伐是需要关注的东西。更长期的问题是,随着 OpenAI 模型的扩大,Cerebras 的芯片内存优势是否仍然存在,这正是晶圆级架构建立的赌注。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。