AIモデルとプラットフォーム

アンソロジックのOpus 5がフロンティアインテリジェンスに近づく

mm
Unite.AI を Google の優先ソースに追加
A person at a desk at night reading a long streaming reply in a warm-toned AI assistant chat interface, with a two-bar capability-versus-cost chart glowing on a second screen.

アンソロジックは2026年7月24日、Claude Opus 5をリリースしました。これは、同社の最も新しいOpusクラスのモデルで、同社自身の説明によると、より高価なフロンティアモデルであるFable 5の知能に近づいた毎日の仕事のための馬力です。Opus 5は、アンソロジックのアプリ、API、および主要なクラウドプラットフォームで利用可能です。価格は、1ミリオン入力トークンあたり5ドル、1ミリオン出力トークンあたり25ドルで、それに代わるモデルであるOpus 4.8と同じです。

リリースにより、Opus 5はアンソロジックのMaxサブスクリプションのデフォルトモデルとなり、Proで利用可能な最も強力なオプションとなりました。同社は、これを能力の天井ではなく、日常使用のために調整されたモデルとして推しています。開発者は、理由付けの深さとトークンのコストをトレードすることができるエフォート設定を提供しています。

アンソロジックのベンチマークの結果

アンソロジックは、自身のコーディングと知識作業の評価において、Opus 5がFrontier-BenchやGDPval-AAなどのテストで最先端であると報告しています。一方で、サイバーセキュリティタスクでは、Mythos 5モデルに後れを取っているとされています。同社によると、Opus 5は、Opus 4.8のFrontier-Benchのスコアを2倍以上に増やし、コストを下げたということです。また、最大の努力において、CursorBenchコーディング評価でFable 5のピークに近づき、コストは半分以下であるとも述べています。さらに、ARC-AGI 3という、モデルが見たことがない新しい問題を中心に構築されたテストでは、次善のモデルの結果を3倍にしたということです。OSWorldコンピュータ使用ベンチマークでは、Opus 5がFable 5のベスト結果を上回ったと述べています。

アンソロジックは、この飛躍を、生のスコアではなく、判断力の問題として説明しています。同社は、Opus 5が機械部品の図面を受け取ったが、画像を表示する方法がないというテストを行ったと述べています。モデルは、自身のコンピュータビジョンパイプラインを書き、生のピクセルから幾何学を取り出し、部品を再構築しました。同社によると、このタスクは、他の競合モデルの5回の試行でも解決できなかったということです。

これらは、ベンダーが報告した数字であり、アンソロジック自身のハーネスで実行されています。まだ、独立した評価者によってこれが再現されていません。これは、通常よりも重要な区別です。なぜなら、見出しとなる主張は、Opus 5がリーダーボードを上回ったということではなく、フロンティアに近い結果を中級の価格で提供するということだからです。アンソロジックが開示している外部チェックは、イギリスのAIセキュリティ研究所によるOpus 5の初期チェックポイントのサイバーレンジテストで、モデルのシステムカードに記載されています。

ラインナップのギャップを埋める

リリースにより、アンソロジックは2026年のラインナップに存在したギャップを埋めました。Sonnet 5は、2026年6月30日にリリースされ、Opusレベルの作業をOpusの価格の小さな部分で提供しました。一方、MythosクラスのFable 5は、2026年6月9日にリリースされ、Opusの上位に位置し、2倍のコストでした。これにより、Opusティアは両側から圧迫されました。Opus 5により、Max、Team、Enterpriseの顧客は、FableまたはMythosの料金を支払うことなく、フロンティアに近いオプションを利用できるようになりました。

長いエージェントワークロードを実行するチームの場合、タスクごとのコストはトークンあたりの価格よりも重要です。アンソロジックは、この数学を利用しています。同社によると、Opus 5は、Opus 4.8よりも少ないステップで作業を完了し、ツールの呼び出しも少なくなります。また、約2.5倍の速度で実行されるFastモードを提供し、ベース価格の2倍です。

セーフティとシステムカードの注意事項

アンソロジックのシステムカードによると、Opus 5は、同社の自動化された行動監査において、最も整合性のあるモデルです。Sonnet 5、Opus 4.8、フロンティアティアのFable 5よりも、モデル憲章への準拠性で先行しています。また、テストしたモデルのうち、不正使用との協力率が最も低いモデルでもあります。これらは、アンソロジックの内部監査からの自己評価であり、外部の発見ではありません。

同社は、モデルが「Opus 4.8よりも事実の主張をわずかに多くするが、全体的にはより正確である」と述べています。また、Mythos 5よりも、生物学研究と攻撃的なサイバーセキュリティで後れを取っていると述べています。内部の生物学の演習では、モデルは自己検証ループに繰り返し取り組み、Mythos 5が完了したタンパク質設計のセットを提供できませんでした。

サイバーセキュリティ対策について、アンソロジックは、Opus 5のクラシファイアをFable 5のものに基づいてモデル化しましたが、約85%少ない頻度で介入することを予想しています。モデルは、防御的なソースコードの脆弱性を探す作業を実行することが許可されていますが、コンパイルされたバイナリのスキャン、ペネトレーションテスト、エクスプロイト生成はまだブロックされています。クラシファイアがトリガーするリクエストは、デフォルトでOpus 4.8にフォールバックします。FableやMythosとは異なり、Opus 5には、一般的なアクセスに対するデータ保持要件はありません。

実用的なテストは、独立した評価者がアンソロジックが報告しているコーディングと推論の利点を再現するか、同社の監査以外の環境で整合性の改善が持続するかどうかです。そうでない場合、Opus 5が変える最も明確なことは、アンソロジック自身のカタログにおける近フロンティア能力の価格です。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。