AI 模型与平台

75% 天花板:当前方法下 AI 模型是否已经达到峰值性能?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AnthropicOpenAI 两家公司在两天内相继发布了前沿 AI 模型,两者在行业编码基准测试中均达到 74-75% 的准确率,表明当前 AI 架构可能已经达到性能天花板,同时采取了截然不同的分发和实施方法。

两家公司几乎同时发布的模型引发了人们对 AI 开发是否已经达到当前训练方法的瓶颈的根本性质疑,即使两家公司在如何向全球用户和开发者交付这些功能方面存在着巨大的差异。

基准收敛点向技术里程碑靠近

Claude Opus 4.1 由 Anthropic 于 8 月 5 日发布,在 SWE-bench Verified 基准测试中获得了 74.5% 的成绩,这是行业标准的编码基准测试。 OpenAI 的 GPT-5 于 8 月 7 日发布,在同一测试中获得了 74.9% 的成绩——这是一个统计学上的平局,表明两家公司尽管独立工作,但都将当前架构推到了类似的极限。

两家模型之间的 0.4% 差异在此类基准测试中属于统计噪声范围内。

然而,两家公司的架构方法却大不相同。 OpenAI 的 GPT-5 采用了多模型系统和智能路由——查询被定向到快速响应器以执行简单任务、推理模型以解决复杂问题,或者在计算资源有限时使用迷你版本。 Anthropic 的 Opus 4.1 则采用了单模型方法,优先考虑一致性而不是专用优化。

来源:Anthropic

分发策略揭示竞争哲学

OpenAI 将 GPT-5 立即提供给所有 ChatGPT 用户,包括免费层用户——这意味着每周有大约 7 亿活跃用户可以免费使用。同时,微软还将该模型集成到 GitHub Copilot、Visual Studio Code、M365 Copilot 和 Azure 平台中。

Anthropic 保持了更传统的访问限制,只为付费的 Claude 用户提供 Opus 4.1,以及通过 Claude Code 为开发者提供服务,并通过 API 提供访问。该公司似乎专注于为需要可靠、一致性能的开发者和企业提供服务,而不是最大化分发范围。

GPT-5 的定价很激进,开发者指出其具有有利的成本与能力比,这可能会迫使竞争对手调整其定价策略。

基础设施需求重塑行业经济

计算需求揭示了前沿 AI 开发的巨大规模。据报道,OpenAI 与 Oracle (ORCL ) 签订了 300 亿美元的年度合同,以获得数据中心服务,并使用 Microsoft (MSFT ) Azure 和 NVIDIA H200 GPU 训练了 GPT-5。 Meta 宣布计划在 2025 年alone 投资 720 亿美元用于 AI 基础设施。

两家公司均报告了实际应用中的显著改进,超出了原始基准测试。 OpenAI 表示,GPT-5 在启用网页搜索时“大约比 GPT-4o 少了 45% 的错误”,并且在思考模式下实现了类似于 o3 模型的结果,同时使用了 50-80% 少的令牌——这是一个显著的效率提升。

GitHub 报告称 Opus 4.1 在多文件代码重构中显示出“显著的性能提升”,而流行的 AI 编码助手 Cursor 将 GPT-5 描述为“非常聪明,易于控制”,根据 OpenAI 的开发者文档。

来源:OpenAI

技术天花板暗示着范式转变

跨公司的类似性能指标的收敛表明,当前的训练范式可能已经接近其极限。多个模型在编码基准测试中聚集在 74-75% 的准确率附近,表明下一次重大改进可能需要根本性的创新,而不是增量扩展。

OpenAI 的复杂路由系统和 Anthropic 的统一方法 之间的架构权衡反映了不同的哲学,没有明显的赢家。 GPT-5 的多模型系统提供了灵活性,但引入了潜在的故障点,而 Claude 的一致性可能会为了可靠性而牺牲专用性能。

前沿 AI 能力的民主化——两年前价值数千美元的功能现在免费提供——正在加速各行业的采用。这一从 AI 作为高级服务转变为基础设施的转变可能会使完全新的应用类别成为可能。

市场影响和下一步

行业观察者预计 Anthropic 将对 OpenAI 的定价策略做出回应,尽管可能不是通过直接的价格匹配。 Google 的 DeepMind 和 Meta,在这些公告期间相对沉默,预计将在未来几个月内采取行动。

两家公司发布模型的 48 小时窗口揭示了 AI 从实验技术转变为可靠基础设施的过程。当多家公司在基准测试中取得几乎相同的成绩,竞争开始转向部署效率、集成质量和服务可靠性。

实际改进比基准测试的霸主地位更重要。 SWE-bench Verified 测量了 AI 识别和修复开源软件中真实 bug 的能力,两家模型的成绩代表了自主编码能力的显著进步。

随着 AI 模型在推理和编码能力方面变得越来越复杂,竞争正在从原始性能指标转向实际实施和生产环境中的可靠性。令人惊讶的真相是:这种稳定性可能会带来比另一个突破更大的变革。

Alex 负责 Unite.AI 的 AI 驱动新闻业务,融合新闻、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作帮助确保新兴 AI 发展能够高效呈现,同时保持出版物的编辑标准。