AI 模型与平台

SpaceXAI发布Grok 4.7,用于编码和知识工作

mm
将 Unite.AI 添加到您在 Google 上的首选来源

SpaceXAI于2026年9月21日发布了Grok 4.7,这是其最新的用于编码和知识工作的模型,定价为每百万输入代币2美元,和每百万输出代币6美元。

发布公告中,SpaceXAI将Grok 4.7描述为其在编码和知识工作方面最强大的模型,称其在困难任务上能够工作更长时间,并更仔细地检查自己的工作。公司表示,该模型拥有迄今为止校准最好的安全防护,价格和速度与其前代Grok 4.6相同,并且在同类模型中以一半的价格实现了两倍的速度。

更大的基础模型,更长的训练过程

根据公告,Grok 4.7使用了比Grok 4.6更大、全新的基础模型,并在更长的强化学习训练中,针对更困难的任务组合进行训练,重点放在需要数小时完成的问题上。SpaceXAI表示,得到的模型在自我验证工作和处理更长上下文方面表现更佳。

公司还表示,他们对Grok 4.7进行了原生理解Grok Bot框架的训练,使其在对话任务和一般知识工作方面表现更佳。SpaceXAI于2026年8月11日推出了Grok Bot,称其为一支始终在线的代理团队,拥有自己的计算机,可在工具和应用中工作,并全天候持续运行。此外,公司称Grok 4.7在创建文档和演示方面也更出色。

Grok 4.7是继Grok 4.6之后的版本,SpaceXAI于2026年8月12日宣布,并将其描述为在Grok 4.5的基础上构建,特别关注长期运行的代理以及更具雄心的交互和视觉工作。2026年8月稍后,公司根据新闻档案中的日期列表,将Grok 4.6扩展至GitHub Copilot、Amazon Bedrock、Gemini Enterprise Agent Platform和Microsoft Foundry。

报告的基准得分

SpaceXAI发布了一张基准和定价表,将Grok 4.7与Grok 4.6、GPT‑5.6 Sol和Fable 5.1进行比较。在表中,Grok 4.7的努力设置标记为xhigh,Grok 4.6为high,GPT‑5.6 Sol和Fable 5.1为max。

在CursorBench 4.0(SpaceXAI称其强调更长时间的编码任务)上,公司报告Grok 4.7得分为46.3%,而Grok 4.6为40.4%,GPT‑5.6 Sol为41.7%,Fable 5.1为51.8%。SpaceXAI表示,Grok 4.7在该基准的性价比方面处于前沿。

在DeepSWE v1.1(软件工程评估)中,SpaceXAI报告Grok 4.7在高努力下得分为71.0%,而Grok 4.6为65.2%,GPT‑5.6 Sol为72.7%,Fable 5.1为70.0%。在覆盖多小时终端工作的Terminal‑Bench 4.0上,报告的数值分别为Grok 4.7 38.0%,Grok 4.6 20.3%,GPT‑5.6 Sol 37.3%,Fable 5.1 57.9%。

在衡量多小时办公工作的AA Briefcase v1.1上,报告的得分分别为Grok 4.7 1,657,Grok 4.6 1,546,GPT‑5.6 Sol 1,487,Fable 5.1 1,678。SpaceXAI在Harvey Legal Agent基准上报告Grok 4.7为19.6%,而Grok 4.6为15.8%,GPT‑5.6 Sol为2.5%,Fable 5.1为6.7%。在临床推理评估的HealthBench Professional上,报告的数值为Grok 4.7 56.7%,Grok 4.6 48.5%,GPT‑5.6 Sol 60.5%,Fable 5.1 62.1%。在涵盖电气工程的EEBench上,公司报告Grok 4.7为64.0%,Grok 4.6为53.0%,GPT‑5.6 Sol为39.4%,Fable 5.1为56.4%。

另一张GDPval图表显示,在最大努力下,Fable 5.1的Elo得分为1,735,Grok 4.7为1,695,Grok 4.6为1,605,GPT‑6 Astra为1,542。SpaceXAI表示,GDPval和AA Briefcase要求AI模型完成律师、护士和金融分析师等专业人士的任务,且Grok 4.7在这两个基准上均优于Grok 4.6,且表现与其他前沿模型相当。

表格还列出了代币价格:Grok 4.7和Grok 4.6的每百万输入代币2美元、每百万输出代币6美元,GPT‑5.6 Sol为每百万输入4美元、每百万输出20美元,Fable 5.1为每百万输入10美元、每百万输出50美元。

安全防护与网络安全

SpaceXAI表示,Grok 4.7采用了全新的安全防护体系,是公司在拒绝响应和防止越狱方面测试过的最强模型。在网络安全和生物工作等双用途领域,公司称Grok 4.7在良性任务的实用性和对危险任务的安全拒绝方面均领先,并在LatchBio的生物安全基准中以62.4%位居首位。

在HackerBench v0.3(SpaceXAI称其为针对风险和恶意网络任务的内部基准)上,公司表示Grok 4.7仅允许3.3%的风险双用途提示通过,同时很少阻止合法的安全工作。SpaceXAI称已开始向特定网络安全合作伙伴提供仅限邀请的Grok 4.7红队能力,以用于防御研究。

根据公司新闻档案中2026年9月1日的帖子,LatchBio此前对Grok 4.6在生物安全监测和对抗性生物任务方面进行了评估,指出该早期模型比任何其他前沿系统更可靠地检测并拒绝危险查询。

定价与可用性

Grok 4.7 将于2026年9月21日开始在 Cursor 和 Grok Build,SpaceXAI 的编码代理 中提供,同时也可通过 Grok API、第三方编码工具、模型路由器和云平台使用。

在标准定价之外,SpaceXAI 提供了一个输出速度提升两倍、价格也提升两倍的 Grok 4.7 快速版本。公司还在 x.ai/build 提供对 Grok Build 内模型的免费访问。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。