AI 模型与平台

Grok 4.6 登場於 GitHub Copilot 的八個開發表面

mm
将 Unite.AI 添加到您在 Google 上的首选来源

xAI 的 Grok 4.6 現已在 GitHub Copilot 中推出,距離該模型於 2026 年 8 月 12 日發布僅兩天,該公司於 2026 年 8 月 14 日宣布。該模型 —— xAI 目前的編碼旗艦,針對長期代理和多步驟工作 —— 可從 Copilot 的模型選擇器中選擇,適用於八個表面:VS Code、Visual Studio、Copilot CLI、Copilot 雲代理、Copilot 應用程序、JetBrains IDE、Xcode 和 Eclipse。

GitHub 的變更日誌 入口,於同日發布,確認推出涵蓋 Copilot Pro、Pro+、Max、Business 和 Enterprise 計劃。這種廣泛的推出對於新模型的添加是非常罕見的:JetBrains、Xcode 和 Eclipse 的支持使 Grok 4.6 面向開發人員,遠遠超出了 VS Code 核心,後者是大多數 Copilot 模型發布的集中地。

GitHub 表示,在其內部測試中,Grok 4.6 在需要持續推理和工具使用的長期任務中表現尤為出色,特別是在 VS Code 和 Copilot CLI 中的終端編碼。這與 xAI 在發布時對模型的描述相符。”Grok 4.6 建立在 Grok 4.5 的基礎上,特別關注長期代理和更雄心勃勃的交互和視覺工作,” 該公司在其發布帖子中寫道。

Grok 4.6 為模型選擇器帶來了什麼

Grok 4.6 帶著一組供應商報告的評估結果出現在 Copilot 中,將其置於當前編碼類別的頂部,帶有一個適用於所有自我報告數據的警示:這些是 xAI 的運行結果,運行在 xAI 選擇的測試平台上。在公司發布的評估表中,Grok 4.6 High 得分 61 分,在九個基準測試的綜合指數 —— 人工分析智慧指數中,與 OpenAI 的 GPT-5.6 Sol Max 相同,並落後於 Anthropic 的 Fable 5 Max 一分,後者得分 62 分。在 GDPVal-AA 知識工作評估中,Grok 4.6 得分 1753 分,相比 GPT-5.6 Sol Max 的 1728 分和 Fable 5 Max 的 1741 分。

在代理編碼基準測試中,差距更大。Grok 4.6 在 CursorBench v3.2 中得分 69.9%,領先 GPT-5.6 Sol Max 2.7 個百分點,落後 Fable 5 Max 0.6 個百分點。在 DeepSWE v1.1 中,Grok 4.6 得分 65.9%,遠超其前身 Grok 4.5 High 的 54%,但仍落後 GPT-5.6 Sol Max 的 73%。在 Terminal-Bench v3.0 中,該基準測試正是 GitHub 突出強調的終端工作類型,Grok 4.6 得分 26%,相比 GPT-5.6 Sol Max 的 34.6%,但仍然是 Grok 4.5 High 的 15.7% 的近乎兩倍。

根據 xAI 的描述,該模型的訓練配方結合了對精心策劃的推理和工程數據的長期補充訓練,搭配由 Grok 4.5 重新生成的監督微調軌跡,然後在代理任務中進行強化學習,包括內核優化、網頁開發和計算機輔助設計。從基準測試結果來看,Grok 4.6 在終端和代理基準測試中的世代間躍升是可以看到的,即使它不在每個衡量指標中領先。

關於存取和計費的細則

有兩個限制決定了誰可以看到該模型以及它的成本。首先,推出是逐步進行的:GitHub 表示,開發人員如果尚未在選擇器中看到 Grok 4.6,應該稍後再次查看,因為可用性將會擴大。其次,在 Copilot 的 Business 和 Enterprise 計劃中,Grok 4.6 的策略默認為關閉,管理員必須在 Copilot 設定中啟用它,才能讓席位選擇該模型。

關於計費,Grok 4.6 根據使用情況計費,而不是根據請求配額進行扣除。Grok 4.6 的價格為供應商列表價;xAI 的 API 價格從每百萬輸入令牌 2 美元和每百萬輸出令牌 6 美元開始,與 GitHub 對 Grok 4.5 在其價格表中的收費相同,這使得 Grok 4.6 的價格遠低於選擇器中的其他旗艦選項:GPT-5.6 Sol 的價格為每百萬輸入令牌 5 美元和每百萬輸出令牌 30 美元,Claude Opus 類模型的價格為每百萬輸入令牌 5 美元和每百萬輸出令牌 25 美元。

除了 Copilot 之外,Grok 4.6 仍可通過 xAI 的 API、Cursor、Grok Build 和合作夥伴(包括 OpenRouter、Vercel 和 Cloudflare)獲得。如 Unite.AI 對發布的報導所述,xAI 為該模型的第一周提供了 Grok Build 和 Cursor 的雙倍使用量,該時間窗口將於 2026 年 8 月 19 日關閉。

Copilot 整合延伸了 Grok 4.6 的發布模式,即在 xAI 自有的工具和 Cursor 中發布,然後出現在最大的第三方編碼助手中。隨著 Business 和 Enterprise 政策閘門現在掌握在管理員手中,該模型的企業采納速度將在 Copilot 設定中顯示,遠早於它在任何排行榜中顯示。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。