AIモデルとプラットフォーム

アンソロジック、Claude Opus 4.1 をリリース – コーディングベンチマークを打ち破る

mm
Unite.AI を Google の優先ソースに追加

アンソロジックは、Claude Opus 4.1 をリリースしました。これは、同社のフラッグシップ AI モデルであり、リアルワールドのコーディング タスクで 74.5% の精度を達成し、新しいベンチマーク レコードを樹立しながら、前身モデルの価格を維持しています。

このアップデートは、AI 業界が OpenAI の GPT-5 リリース を予測している中で、戦略的な動きです。アンソロジックは、複雑なプログラミング チャレンジと自律タスク完了に優れた競合他社の代替品として、最新のモデルを位置付けました。同社は、近い将来に「大幅な改善」を約束しており、主要 AI 開発企業間の競争が激化することを示唆しています。

主要なパフォーマンスの改善

アンソロジックの発表によると、Claude Opus 4.1 は、前身モデルのパフォーマンスを 3 つの重要な分野で改善しました。多段階の推論を必要とするエージェント タスク、リアルワールドのコーディング アプリケーション、分析的推論能力です。

このモデルは、SWE-bench Verified ベンチマーク で 74.5% のスコアを達成しました。これは、オープンソース ソフトウェアの実際のバグを識別および修正する AI の能力を測定し、前身モデルの Claude Opus 4 のスコア 72.5% を上回り、OpenAI の o シリーズ モデルよりも約 5 パーセント点上回りました。

GitHub は、多ファイル コード リファクタリング機能の強化を特に強調しました。一方、Rakuten Group は、大規模なコードベース内で新しいバグを導入せずに修正を特定するモデルの精度を強調しました。コーディング スタートアップの Windsurf は、Opus 4.1 がジュニア デベロッパー ベンチマークで Opus 4 よりも 1 標準偏差の改善を示したと報告しました。これは、Sonnet 3.7 から Sonnet 4 への前回のジャンプと比較できます。

利用の可用性と統合

アップグレード モデルは、有料の Claude ユーザー向けに Web インターフェイスと Claude Code を介して、また Anthropic の API、Amazon (AMZN ) Bedrock、Google Cloud の Vertex AI を介してすぐに利用可能になります。開発者は、価格の増加なしで API タグを使用して新しいモデルにアクセスできます。価格構造は、Claude をエンタープライズ マーケットで競争力を持たせているものです。

ソフトウェア エンジニアリング以外に、Claude Opus 4.1 はデータ分析および研究タスクでの機能強化を示しています。アンソロジックは、複雑な多段階操作を横断してコンテキストを維持するモデルの能力である「詳細追跡およびエージェント検索」の改善を強調しました。これは、自律的な問題解決を必要とする エンタープライズ アプリケーション にとって重要な機能です。

業界の状況と競争

リリースのタイミングは、業界が OpenAI の GPT-5 リリース を予測している中で意図的であると見受けられます。The Information によると、GPT-5 はプログラミング、数学、エージェント ベースのタスクに焦点を当てると予想されますが、分析家は改善が漸進的ではなく革命的ではない可能性があると予測しています。

Claude モデルの迅速なイテレーション – このアップデートは、5 月の Claude 4 ファミリーのリリースからわずか 3 か月でリリースされた – は、企業がエンタープライズおよび開発者向けツールの市場シェアを争う中で、AI 開発のペースが加速していることを反映しています。これは、アンソロジックが OpenAI よりも安全性に重点を置いた代替品として自己位置付けしながら、競合するパフォーマンス メトリックを維持してきた歴史に沿ったものです。

技術的な詳細と実装

システム カード システム カード によると、Claude Opus 4.1 は、拡張思考モードの有無に関係なく動作可能なハイブリッド推論モデルです。SWE-bench Verified や Terminal-Bench などのベンチマークでは、モデルの結果は拡張思考なしで達成されましたが、GPQA Diamond や MMMU などの他のベンチマークでは、最大 64K トークンの拡張思考容量が使用されました。

モデルの SWE-bench テストでは、アンソロジックが Claude 4 ファミリー全体で採用してきた同じシンプルなスケルトンが使用されました。モデルの bash ツールと、文字列置換を介して動作するファイル編集ツールのみが提供されました。このミニマリスト アプローチは、より複雑な実装と比較して業界をリードする結果を達成しました。

今後の展望

アンソロジックは、すべてのユーザーに Opus 4 から新しいバージョンへのアップグレードを推奨しています。同社は、開発者向けの技術仕様を含む包括的なドキュメントを提供しています。また、モデル ページ も利用可能です。

アンソロジックと OpenAI の両社が重要なリリースを準備しているため、来週は次世代の AI 機能のリーダーシップを決定する上で重要な時期になる可能性があります。AI モデルが推論およびコーディング能力でより高度になるにつれて、競争は生のパフォーマンス メトリックから実用的な実装と生産環境での信頼性への移行しています。

FAQ (Claude Opus 4.1)

Claude Opus 4.1 は、以前のバージョンと比較して、コーディングおよび推論タスクをどのように改善しますか?

Claude Opus 4.1 は、SWE-bench Verified で 74.5% (Opus 4 では 72.5%) のスコアを達成しました。多ファイル コード リファクタリング、複雑なコードベースでの詳細追跡、多段階の推論タスクをより効果的に処理できるエージェント検索機能が改善されています。

Claude Opus 4.1 のコーディングおよび AI エージェントにおける主要なリアルワールド アプリケーションは何ですか?

このモデルは、大規模なコードベースで新しいバグを導入せずにバグを修正する、複数のファイルを横断してコードをリファクタリングする、データ分析、研究タスクでコンテキストを維持することに優れています。したがって、エンタープライズ ソフトウェア開発と自動化されたワークフロー最適化に適しています。

Claude Opus 4.1 の SWE-bench でのパフォーマンスは、そのコーディング機能をどのように反映していますか?

SWE-bench Verified は、オープンソース ソフトウェアの実際のバグを識別および修正する AI の能力を測定し、Claude Opus 4.1 の 74.5% のスコアは、最高の公開スコアを表し、OpenAI の o シリーズ モデルよりも約 5 パーセント点上回っています。

Claude Opus 4.1 と GitHub Copilot または ChatGPT のような他の AI モデルの主な違いは何ですか?

GitHub Copilot がコード補完に重点を置いているのに対し、Claude Opus 4.1 はデバッグとリファクタリングを含む完全な問題解決ワークフローを処理します。また、複雑なタスク用に拡張思考モードと迅速な応答モードを切り替えることができるハイブリッド推論モードを提供します。これは、標準の ChatGPT 実装では使用できない機能です。

開発者と企業は、Claude Opus 4.1 をどのようにワークフローとプラットフォームに統合できますか?

開発者は、API タグ「claude-opus-4-1-20250805」、Amazon Bedrock、Google Cloud Vertex AI、または Claude Code を介してコマンドライン統合で Claude Opus 4.1 にアクセスできます。Opus 4 と同じ価格で、既存の実装にはコードの変更は必要ありません。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。