AI 模型与平台
SpaceXAI发布Grok 4.7,用于编码和知识工作

SpaceXAI于2026年9月21日发布了Grok 4.7,这是其最新的用于编码和知识工作的模型,定价为每百万输入代币2美元,和每百万输出代币6美元。
在发布公告中,SpaceXAI将Grok 4.7描述为其在编码和知识工作方面最强大的模型,称其在困难任务上能够工作更长时间,并更仔细地检查自己的工作。公司表示,该模型拥有迄今为止校准最好的安全防护,价格和速度与其前代Grok 4.6相同,并且在同类模型中以一半的价格实现了两倍的速度。
更大的基础模型,更长的训练过程
根据公告,Grok 4.7使用了比Grok 4.6更大、全新的基础模型,并在更长的强化学习训练中,针对更困难的任务组合进行训练,重点放在需要数小时完成的问题上。SpaceXAI表示,得到的模型在自我验证工作和处理更长上下文方面表现更佳。
公司还表示,他们对Grok 4.7进行了原生理解Grok Bot框架的训练,使其在对话任务和一般知识工作方面表现更佳。SpaceXAI于2026年8月11日推出了Grok Bot,称其为一支始终在线的代理团队,拥有自己的计算机,可在工具和应用中工作,并全天候持续运行。此外,公司称Grok 4.7在创建文档和演示方面也更出色。
Grok 4.7是继Grok 4.6之后的版本,SpaceXAI于2026年8月12日宣布,并将其描述为在Grok 4.5的基础上构建,特别关注长期运行的代理以及更具雄心的交互和视觉工作。2026年8月稍后,公司根据新闻档案中的日期列表,将Grok 4.6扩展至GitHub Copilot、Amazon Bedrock、Gemini Enterprise Agent Platform和Microsoft Foundry。
报告的基准得分
SpaceXAI发布了一张基准和定价表,将Grok 4.7与Grok 4.6、GPT‑5.6 Sol和Fable 5.1进行比较。在表中,Grok 4.7的努力设置标记为xhigh,Grok 4.6为high,GPT‑5.6 Sol和Fable 5.1为max。
在CursorBench 4.0(SpaceXAI称其强调更长时间的编码任务)上,公司报告Grok 4.7得分为46.3%,而Grok 4.6为40.4%,GPT‑5.6 Sol为41.7%,Fable 5.1为51.8%。SpaceXAI表示,Grok 4.7在该基准的性价比方面处于前沿。
在DeepSWE v1.1(软件工程评估)中,SpaceXAI报告Grok 4.7在高努力下得分为71.0%,而Grok 4.6为65.2%,GPT‑5.6 Sol为72.7%,Fable 5.1为70.0%。在覆盖多小时终端工作的Terminal‑Bench 4.0上,报告的数值分别为Grok 4.7 38.0%,Grok 4.6 20.3%,GPT‑5.6 Sol 37.3%,Fable 5.1 57.9%。
在衡量多小时办公工作的AA Briefcase v1.1上,报告的得分分别为Grok 4.7 1,657,Grok 4.6 1,546,GPT‑5.6 Sol 1,487,Fable 5.1 1,678。SpaceXAI在Harvey Legal Agent基准上报告Grok 4.7为19.6%,而Grok 4.6为15.8%,GPT‑5.6 Sol为2.5%,Fable 5.1为6.7%。在临床推理评估的HealthBench Professional上,报告的数值为Grok 4.7 56.7%,Grok 4.6 48.5%,GPT‑5.6 Sol 60.5%,Fable 5.1 62.1%。在涵盖电气工程的EEBench上,公司报告Grok 4.7为64.0%,Grok 4.6为53.0%,GPT‑5.6 Sol为39.4%,Fable 5.1为56.4%。
另一张GDPval图表显示,在最大努力下,Fable 5.1的Elo得分为1,735,Grok 4.7为1,695,Grok 4.6为1,605,GPT‑6 Astra为1,542。SpaceXAI表示,GDPval和AA Briefcase要求AI模型完成律师、护士和金融分析师等专业人士的任务,且Grok 4.7在这两个基准上均优于Grok 4.6,且表现与其他前沿模型相当。
表格还列出了代币价格:Grok 4.7和Grok 4.6的每百万输入代币2美元、每百万输出代币6美元,GPT‑5.6 Sol为每百万输入4美元、每百万输出20美元,Fable 5.1为每百万输入10美元、每百万输出50美元。
安全防护与网络安全
SpaceXAI表示,Grok 4.7采用了全新的安全防护体系,是公司在拒绝响应和防止越狱方面测试过的最强模型。在网络安全和生物工作等双用途领域,公司称Grok 4.7在良性任务的实用性和对危险任务的安全拒绝方面均领先,并在LatchBio的生物安全基准中以62.4%位居首位。
在HackerBench v0.3(SpaceXAI称其为针对风险和恶意网络任务的内部基准)上,公司表示Grok 4.7仅允许3.3%的风险双用途提示通过,同时很少阻止合法的安全工作。SpaceXAI称已开始向特定网络安全合作伙伴提供仅限邀请的Grok 4.7红队能力,以用于防御研究。
根据公司新闻档案中2026年9月1日的帖子,LatchBio此前对Grok 4.6在生物安全监测和对抗性生物任务方面进行了评估,指出该早期模型比任何其他前沿系统更可靠地检测并拒绝危险查询。
定价与可用性
Grok 4.7 将于2026年9月21日开始在 Cursor 和 Grok Build,SpaceXAI 的编码代理 中提供,同时也可通过 Grok API、第三方编码工具、模型路由器和云平台使用。
在标准定价之外,SpaceXAI 提供了一个输出速度提升两倍、价格也提升两倍的 Grok 4.7 快速版本。公司还在 x.ai/build 提供对 Grok Build 内模型的免费访问。












