AI 模型与平台
Cerebras 发布 Qwen3-235B:AI 速度、规模和成本的新时代

Cerebras Systems (CBRS ) 已正式发布 Qwen3-235B,一款具有全 131,000 个令牌上下文支持的尖端 AI 模型,设定了一个新的性能基准,用于推理、代码生成和企业级 AI 应用。现在,通过 Cerebras 推理云提供该模型,具有与最先进的边缘系统相当的能力——同时以 30 倍的速度和今天领先的封闭源模型的 1/10 的成本运行。
实时 AI 推理达到突破性速度
AI 推理历史上一直很慢,大型模型通常需要一分钟或更长时间才能响应复杂查询。Cerebras 消除了这个瓶颈。由其专有 Wafer-Scale Engine 3 (WSE-3) 提供支持,Qwen3-235B 达到了 每秒 1,500 个令牌,这是边缘 AI 推理的世界纪录。
这种性能转变了用户体验——将延迟从 60-120 秒缩短到仅 0.6 秒,即使处理高级推理任务或运行多步骤工作流程,如检索增强生成 (RAG)。根据 Artificial Analysis 的基准测试结果,目前没有其他提供商(开源或封闭)能够匹配这种推理速度的边缘级模型。
上下文的新标准:131K 令牌用于实际应用
与此发布同时,Cerebras 将其模型上下文窗口从 32K 扩展到 Qwen3-235B 支持的全部 131K 令牌。这一上下文大小的飞跃使模型能够摄取和推理大量数据——涵盖整个代码库、多文档存储库和长篇技术资料。
虽然 32K 上下文允许基本生成任务,但 131K 打开了生产级开发的大门。AI 现在可以作为深度代码协作者,实时合成数十个文件并管理复杂依赖项——使其成为软件工程、文档分析和科学计算等企业用例的理想选择。
为什么 Cerebras 与众不同:从头开始为 AI 设计的硬件
由一组开创性的计算机架构师、AI 研究人员和系统工程师创立,Cerebras Systems 采取了一个根本不同的方法来解决扩展生成 AI 的挑战。Cerebras 没有依赖 GPU 集群,而是围绕自己的芯片——Wafer-Scale Engine 3——构建了一个专用 AI 超级计算机。
该芯片与行业中的任何其他芯片都不一样。它的大小与餐盘相当,拥有数十万个 AI 优化核心和数十 GB 的芯片内存。这种设计允许计算和内存并排放置——消除了传统多 GPU 解决方案的延迟、带宽限制和编排复杂性。
通过集群其 CS-3 系统,Cerebras 可以创建能够轻松运行万亿参数模型的 AI 超级计算机——同时避免了分布式计算的技术负担。这一统一方法是其创纪录的推理速度和新高上下文能力的基础。
MoE 效率实现了显著的成本降低
Qwen3-235B 采用了 混合专家 (MoE) 架构——一种模型设计,根据输入仅激活内部专家的子集,从而大大提高计算效率。
因此,Cerebras 可以以低于封闭源替代品的价格点提供该模型。具体来说,推理以每百万输入令牌 0.60 美元和每百万输出令牌 1.20 美元的价格提供,相比 OpenAI、Anthropic 或 Google 的专有模型,成本降低了 90% 以上。
与 VS Code 中的 Cline 无缝集成
为了展示 Qwen3-235B 的速度和实际应用,Cerebras 与 Cline 合作,Cline 是领先的代理编码代理,目前已被超过 180 万开发人员安装在 Microsoft Visual Studio Code 中。
Cline 用户可以访问 Qwen3-32B,具有 64K 上下文,作为免费层的一部分。随着今天的公告,支持将扩展到包括 Qwen3-235B 和其全部 131K 上下文,实现开发人员以前无法在实时内实现的编辑器内推理和代码生成水平。
Saoud Rizwan,Cline 的 CEO 解释说,“随着 Cerebras 的推理,使用 Cline 的开发人员正在看到未来,因为 Cline 实时推理问题、阅读代码库并编写代码。所有事情发生得如此之快,以至于开发人员保持在流畅的状态,按照思维的速度迭代。这种快速推理不仅仅是好的——它向我们展示了当 AI真正跟上开发人员的步伐时会发生什么。”
对封闭模型的开放替代
Qwen3-235B 的性能与市场上一些最先进的 AI 模型相当,包括 Claude 4 Sonnet、Gemini 2.5 Flash 和 DeepSeek R1,如独立基准测试所验证。然而,Cerebras 以开放访问格式提供了这一点,提供了封闭模型所缺乏的透明度和可移植性。
这种开放模型方法使企业能够:
- 在专有数据上自定义和微调
- 在私有基础设施或混合云环境中部署 AI
- 避免供应商锁定和数据隐私风险
结合 Cerebras 的可扩展云平台和 CS-3 系统的可选本地部署,组织可以完全控制如何将 AI 应用于任务关键任务。
这对行业意味着什么
Qwen3-235B 的发布标志着一个转折点。Cerebras 重新定义了大型语言模型的可能性边界,结合了边缘智能、前所未有的速度和成本效率。
现在可以构建 AI 工具:
- 实时响应开发人员查询
- 在全文档或知识库上进行推理
- 实时在 IDE 内生成和调试生产级代码
- 扩展到企业级用例,而无需 GPU 扩散或六位数的月度推理账单
随着对 AI 基础设施的需求增长,Cerebras 表明您不需要在性能、价格和开放性之间做出妥协。从 Wafer-Scale Engine 到 Cerebras 推理云的硬件和软件协同设计,指向了一种新的 AI 部署模型——更快、更简单、更易访问。
最后的思考
通过发布 Qwen3-235B,具有 131K 上下文、超快推理和可承受的令牌定价,Cerebras Systems 将自己定位为少数真正挑战 GPU 驱动的现有企业的公司之一。对于企业、研究人员和开发人员来说,这次发布不仅仅是一个更快的模型——它是一个使实时、生产级、开放 AI 可及的转折点。












