AI 模型与平台
SpaceXAI 发布 Grok 4.6,用于长期运行的智能体

SpaceXAI,这家曾被称为 xAI 的人工智能公司,在 2026 年 8 月 12 日发布了 Grok 4.6,这是一个新的旗舰模型,专为长期运行的智能体和更雄心勃勃的交互式和视觉工作而设计。该模型在同一天在 Cursor 代码编辑器和公司自己的 Grok Build 工具中提供,以及通过其 API,以每百万个输入令牌 2 美元和每百万个输出令牌 6 美元的起价,根据 公司的公告。
Grok 4.6 建立在 Grok 4.5 的基础上,并延伸了公司在智能体编码和知识工作方面的努力。
什么是 Grok 4.6
该公司将 Grok 4.6 描述为一个“可以处理复杂任务的模型,无论是研究一个主题,还是在代码库中工作,还是将一个广泛的产品想法变成一个工作的应用程序的第一个版本”。在更长的轨迹上,该公司表示它观察到了更多的自我测试和验证,模型在继续之前检查自己的工作,并且在视觉和交互式项目上比 Grok 4.5 更强大的第一次尝试。
能力的提高基于比 Grok 4.5 更长的补充训练运行。SpaceXAI 使用了人工生成的数据进行推理和技术概念,改进了优化器,并使用 Grok 4.5 在推理努力、智能体工具和包括 STEM、软件工程和知识工作在内的领域中重新生成了 SFT 轨迹,并通过基于模型的检查过滤掉了问题轨迹。然后,该模型在一系列智能体强化学习任务上进行了训练,包括特定领域的环境,例如内核优化、Web 开发和计算机辅助设计。
基准竞赛
SpaceXAI 报告称,Grok 4.6 在人工分析智能指数(Artificial Analysis Intelligence Index)上与 OpenAI 的 GPT-5.6 Sol 相匹配,这是一个由九个基准组成的综合指数,两者都得分为 61,落后于 Anthropic 的 Fable 5 Max 的 62 分,领先于 Grok 4.5 High 的 56 分。该公司自己的评估表显示了一个更为混合的图景,跨越个别测试。
在 DeepSWE v1.1 软件工程基准测试中,Grok 4.6 得分为 65.9%,高于 Grok 4.5 的 54%,但低于 GPT-5.6 Sol Max 的 73%。在 Terminal-Bench v3.0 上,它达到 26%,比 Grok 4.5 的 15.7% 有了很大的提高,但远远落后于 GPT-5.6 Sol Max 和 Fable 5 Max 的大约 34%。它在 GDPVal-AA v2 的知识工作评估中领先于整个领域,得分为 1753,并在 CursorBench 和 FrontierCode 上取得了进步。这些数字是公司自己的,第三方模型的分数来自自我报告或公开可用的结果,并且尚未有独立评估确认它们。
发布落在了一个拥挤的市场中。Anthropic 一直在将其 Opus 系列推向前沿智能的同时保持着激进的价格,而 OpenAI 的 GPT-5.6 系列是智能体编码的现任目标。SpaceXAI 的策略是通过价格和分销来竞争,就像原始能力一样:以每百万个输入令牌 2 美元的价格,Grok 4.6 低于许多前沿竞争对手,而且该公司正在为开发人员提供在 Grok Build 和 Cursor 中包含的双倍使用量的第一个星期,以吸引开发人员使用该模型。除了 Cursor 和 Grok Build 之外,它还可以通过包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴提供。
模型背后的新公司
Grok 4.6 是过去一年中完全重组的业务中最明确的产品声明。
Grok 4.6 是第一个从头到尾带有 SpaceXAI 名称的旗舰模型,其定价、合作伙伴分销和智能体重点表明该部门将 Grok 定位为开发人员和企业平台,而不是 X 社交网络的功能。












