AIモデルとプラットフォーム

SpaceXAIがコーディングと知識作業向けにGrok 4.7をリリース

mm
Unite.AI を Google の優先ソースに追加

SpaceXAIは2026年9月21日に、コーディングと知識作業向けの最新モデルであるGrok 4.7をリリースし、入力トークン1百万あたり2ドル、出力トークン1百万あたり6ドルからの価格設定としました。

リリース発表では、SpaceXAIはGrok 4.7をコーディングと知識作業向けの最も高性能なモデルと位置付け、難しいタスクでの実行時間が長く、自己の作業をより慎重にチェックすると述べています。同社は、このモデルがこれまでで最も校正されたセーフガードを備えており、前モデルのGrok 4.6と同じ価格と速度で提供され、比較対象モデルの半額で2倍の速度を実現していると述べています。

ベースモデルの拡大、トレーニング期間の延長

発表によると、Grok 4.7はGrok 4.6よりも新しく、より大きなベースモデルを使用し、タスクが難しく時間がかかる問題に重点を置いた、より長い強化学習の実行でトレーニングされたとされています。SpaceXAIは、結果として得られたモデルは自己の作業の検証と長いコンテキストの管理に優れていると述べています。

同社はまた、Grok 4.7がGrok Botハーネスをネイティブに理解できるようにトレーニングしたと述べており、会話タスクや一般的な知識作業での性能が向上しています。SpaceXAIは2026年8月11日にGrok Botを導入し、常時稼働するエージェントのチームで、独自のコンピュータを持ち、ツールやアプリ内で作業し、24時間稼働し続けると説明しました。さらに、同社はGrok 4.7が文書やプレゼンテーションの作成においても優れていると述べています。

Grok 4.7はGrok 4.6の後継モデルであり、SpaceXAIは2026年8月12日に発表した際に、Grok 4.5を基盤とし、長時間稼働エージェントとより野心的なインタラクティブ・ビジュアル作業に特化したものとして説明しました。2026年8月下旬には、同社はニュースアーカイブの日時付きリストに基づき、Grok 4.6をGitHub Copilot、Amazon Bedrock、Gemini Enterprise Agent Platform、Microsoft Foundryへ拡張しました。

報告されたベンチマークスコア

SpaceXAIはGrok 4.7とGrok 4.6、GPT-5.6 Sol、Fable 5.1を比較したベンチマークと価格表を公開しました。表では、Grok 4.7は「xhigh」設定、Grok 4.6は「high」設定、GPT-5.6 SolとFable 5.1は「max」設定で掲載されています。

SpaceXAIが長時間のコーディングタスクを重視すると述べるCursorBench 4.0において、同社はGrok 4.7が46.3%のスコアを獲得し、Grok 4.6は40.4%、GPT-5.6 Solは41.7%、Fable 5.1は51.8%だったと報告しています。SpaceXAIは、このベンチマークにおいてGrok 4.7が価格性能の最前線に位置すると述べています。

ソフトウェアエンジニアリング評価であるDeepSWE v1.1において、SpaceXAIは高い努力度でGrok 4.7が71.0%を記録し、Grok 4.6が65.2%、GPT-5.6 Solが72.7%、Fable 5.1が70.0%であると報告しています。複数時間にわたるターミナル作業を対象としたTerminal‑Bench 4.0では、Grok 4.7が38.0%、Grok 4.6が20.3%、GPT-5.6 Solが37.3%、Fable 5.1が57.9%という数値が示されています。

複数時間のオフィス作業を測定するAA Briefcase v1.1では、Grok 4.7が1,657点、Grok 4.6が1,546点、GPT-5.6 Solが1,487点、Fable 5.1が1,678点と報告されています。SpaceXAIはHarvey Legal Agent BenchmarkでGrok 4.7が19.6%、Grok 4.6が15.8%、GPT-5.6 Solが2.5%、Fable 5.1が6.7%であると報告しています。臨床推論評価のHealthBench Professionalでは、Grok 4.7が56.7%、Grok 4.6が48.5%、GPT-5.6 Solが60.5%、Fable 5.1が62.1%という結果です。電気工学を対象としたEEBenchでは、Grok 4.7が64.0%、Grok 4.6が53.0%、GPT-5.6 Solが39.4%、Fable 5.1が56.4%と報告されています。

別のGDPvalチャートでは、最大努力でFable 5.1が1,735、Grok 4.7が1,695、Grok 4.6が1,605、GPT-6 Astraが1,542のEloスコアを示しています。SpaceXAIは、GDPvalとAA Briefcaseが弁護士、看護師、金融アナリストなどの専門家が行うタスクにAIモデルに取り組ませるものであり、Grok 4.7は両ベンチマークでGrok 4.6を上回り、他の最先端モデルと同等の性能を示すと述べています。

表にはトークン価格も掲載されており、Grok 4.7およびGrok 4.6は入力1百万トークンあたり2ドル、出力1百万トークンあたり6ドル、GPT-5.6 Solはそれぞれ4ドルと20ドル、Fable 5.1は10ドルと50ドルとなっています。

セーフガードとサイバーセキュリティ

SpaceXAIは、Grok 4.7が全く新しいセーフガードスタックで構築され、拒否応答とジャイルブレイク耐性に関して同社がテストした中で最も強力なモデルであると述べています。サイバーセキュリティや生物学的作業といったデュアルユース領域において、Grok 4.7は善良なタスクの有用性と危険なタスクの安全な拒否の両面でリードしており、LatchBioのバイオセーフティベンチマークで62.4%の最高点を記録しています。

SpaceXAIがリスクの高い悪意あるサイバータスク向けの独自ベンチマークと説明するHackerBench v0.3では、Grok 4.7はリスクのあるデュアルユースプロンプトのうちわずか3.3%しか通過させず、正当なセキュリティ作業はほとんどブロックしないと同社は述べています。また、SpaceXAIは選択されたサイバーセキュリティパートナーに対し、Grok 4.7のレッドチーム機能への招待制アクセスを防衛研究向けに提供し始めたとしています。

LatchBioは、同社のニュースアーカイブに2026年9月1日の投稿があると述べており、以前のGrok 4.6をバイオセキュリティ監視と敵対的生物タスクで評価しました。その投稿では、当該モデルが他の最先端システムよりも危険なクエリを検出し拒否する信頼性が高いと述べられています。

価格と利用可能性

Grok 4.7 は 2026年9月21日から Cursor と Grok Build、SpaceXAIのコーディングエージェント で利用可能であり、Grok API、サードパーティのコーディングハーネス、モデルルーターやクラウドプラットフォームでも利用できます。

標準価格に加えて、SpaceXAI は出力速度が2倍で価格も2倍の高速バージョンの Grok 4.7 を提供しています。同社はまた、Grok Build 内でモデルへの無料アクセスを x.ai/build で提供しています。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。