AIモデルとプラットフォーム

ジェミニ 3.1 Pro が記録的な推論性能を達成

mm
Unite.AI を Google の優先ソースに追加

Google (GOOGL ) は 2 月 19 日に、ジェミニ 3.1 Pro をリリースしました。これは、同社のフラグシップ AI モデルであり、推論性能を 2 倍以上向上させながら、前世代モデルと同じ価格を維持しています。

最も注目すべき数字は、ARC-AGI-2 というベンチマークで、ジェミニ 3.1 Pro が 77.1% のスコアを獲得したことです。ジェミニ 3 Pro は 31.1% のスコアでした。その 46 パーセントポイントのジャンプは、どのフロンティア モデル ファミリーでも最大の単一世代の推論性能向上です。

モデルは、Google のコンシューマーと開発者向けプラットフォームで即時に利用可能です。AI Pro と AI Ultra プランを使用する Gemini アプリユーザーは、使用制限が高くなった状態でアクセスできます。開発者は、AI Studio、Vertex AI、Gemini CLI、Antigravity、Android Studio で Gemini API を使用して 3.1 Pro にアクセスできます。NotebookLM も、Pro と Ultra サブスクライバー向けにアップグレードされます。

価格は、200,000 トークン未満のプロンプトの場合、1,000 万トークンあたり 2 ドルで維持され、より長いコンテキストの場合、4 ドルに増加します。出力コストは、1,000 万トークンあたり 12 ドルです。すでに API を使用してジェミニ 3 Pro を使用している場合、アップグレードは無料です。

ベンチマーク性能の向上

モデルカードによると、ジェミニ 3.1 Pro は 18 のベンチマークのうち 12 で 1 位を獲得しています。ARC-AGI-2 以外の特筆すべき点としては、GPQA ダイヤモンドで 94.3%、LiveCodeBench Pro で 2,887 Elo (すべてのフロンティア モデルの中で最高スコア) などがあります。

Humanity’s Last Exam というベンチマークでは、3.1 Pro が 44.4% のスコアを獲得しました。これは、ジェミニ 3 Pro の 37.5% と GPT-5.2 の 34.5% よりも高いスコアです。マルチリンガル MMLU ベンチマークでは 92.6%、128,000 トークンの長コンテキスト精度は 84.9% です。

モデルは、1,000,000 トークンの入力コンテキストウィンドウを保持し、最大 64,000 トークンの出力トークンを生成します。これは、コード全体をインジェストし、1 回のセッションで大量のコードブロックを生成する必要がある AI コーディングツールと同じ仕様です。

3.1 Pro が先行していない分野も重要です。SWE-Bench Verified というベンチマークでは、実際のソフトウェアエンジニアリングタスクをテストし、80.6% のスコアを獲得しました。これは、Anthropic の Claude Opus 4.6 の 80.8% にわずかに劣ります。ギャップは小さいですが、Anthropic が実用的コーディングタスクで依然としてナローエッジを維持していることを示しています。

ダイナミック思考の変化

ジェミニ 3.1 Pro では、デフォルトでダイナミック思考を使用します。これは、モデルが各プロンプトの複雑さに基づいて内部推論の量を調整するアプローチです。シンプルな質問には迅速な回答が返り、複雑なマルチステップ問題には、モデルがより深い処理チェーンを実行してから回答を生成します。

開発者は、API の thinking_level パラメータを使用してこの動作を制御できます。これは、内部推論の最大深度を設定するものです。これは、推論モデルにおけるトレードオフに対処するものです。推論を拡張すると、困難な問題の精度が向上しますが、シンプルなクエリでは待ち時間とコストが増加します。ダイナミック思考は、このトレードオフを自動化しようとします。

この機能は、業界全体のより広範なシフトを反映しています。OpenAI の o シリーズ モデルは、選択可能なモードとしてチェーン オブ ソート推論を導入しました。Anthropic の Claude は、オプトイン機能として拡張思考を使用します。Google のアプローチは、デフォルトでダイナミック思考を使用し、強度を変化させることで、ほとんどのユーザーがモデルにどれだけ「深く」考えるかを管理するのではなく、モデル自体に決定させることを賭けています。

競争フィールドの狭まり

ジェミニ 3.1 Pro は、ベンチマークのリーダーシップが毎月変更される市場に登場しました。Google のジェミニ 3 は、OpenAI に「コード レッド」を引き起こし、1 か月以内に GPT-5.2 を生み出しました。Anthropic は、Claude の更新を加速するペースで出荷しています。各リリースは、モデルのギャップを狭め、プラットフォームの選択を、生の能力ではなく、エコシステムと価格に依存するようにしています。

Google の利点は、配布です。ジェミニ 3.1 Pro は、数百万人によって使用される製品に直接組み込まれています。Gmail、Docs、Search、および パーソナル インテリジェンス 機能は、モデルをユーザーのパーソナル データに接続します。モデルはまた、Gemini Enterprise と Gemini CLI を動かします。開発者と企業は、すでに使用しているツールを介してアクセスできます。

開発者がフロンティア モデルを選択する場合、価格の決定はより簡単になりました。1,000 万トークンあたり 2 ドルの価格で、ジェミニ 3.1 Pro は、OpenAI と Anthropic のフラグシップ価格を下回り、同等の能力を提供します。3 Pro からの無料アップグレードにより、既存のユーザーに対する移行の摩擦がなくなりました。

推論の向上は、エージェント アプリケーションに最も重要です。エージェントは、計画を立て、多段階のタスクを実行し、ツールを自律的に使用する AI システムです。ARC-AGI-2 は、エージェントがトレーニング データでカバーされていない問題に遭遇したときに必要な、まったく新しいパターン認識の種類をテストします。77.1% のスコアを獲得したモデルは、31.1% のスコアを獲得したモデルよりも、未知の状況をはるかに信頼性の高い方法で処理します。

これらのベンチマークの向上が、現実世界の改善に比例するかどうかは、Google が今後数週間で答えなければなりません。ベンチマークは、特定の機能を制御された条件下で測定します。実際のユーザー エクスペリエンスは、モデルが人々が投げかけるタスクの予測不可能な範囲でどのように実行されるかによって決まります。ARC-AGI-2 のジャンプは、3.1 Pro がこれまでのどのモデルよりも新規性をよりうまく処理することを示唆しています。ユーザーがその機能をどのように使用するかが、数字が重要かどうかを決定します。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。