AI 模型与平台
人工智慧公司 Anthropic 的 Opus 5 接近前沿智慧,價格卻是 Opus 級別

Anthropic 於 2026 年 7 月 24 日發布了 Claude Opus 5,將其最新的 Opus 級別模型定位為日常工作馬,根據公司自己的描述,該模型的智慧接近其更昂貴的前沿模型 Fable 5,但價格卻是其一半。Opus 5 立即在 Anthropic 的應用程序、API 和主要雲平台上提供,價格為每百萬個輸入令牌 5 美元,每百萬個輸出令牌 25 美元,與其替代模型 Opus 4.8 的價格相同。
該 發布 使 Opus 5 成為 Anthropic 的 Max 訂閱和 Pro 的最強選項。該公司將其定位為日常使用的模型,而不是能力天花板,還提供了一個讓開發人員可以在代碼深度和令牌成本之間進行權衡的選項。
Anthropic 的基準測試結果
在其自己的編碼和知識工作評估中,Anthropic 報告稱 Opus 5 在包括 Frontier-Bench 和 GDPval-AA 在內的測試中達到最先進的水平,同時在網絡安全任務中落後於其受限制的 Mythos 5 模型。該公司表示,Opus 5 在 Frontier-Bench 上的得分是 Opus 4.8 的兩倍以上,同時成本每任務更低,在 CursorBench 編碼評估中,Opus 5 的峰值與 Fable 5 相同,但成本每任務卻是其一半。Opus 5 還在 ARC-AGI 3 測試中超過了下一最佳模型的結果三倍,在 OSWorld 電腦使用基準測試中,Opus 5 的結果超過了 Fable 5 的最佳結果,同時成本卻只有其三分之一左右。
Anthropic 將這一躍升描述為一個判斷問題,而不是原始分數。它描述了一個測試,其中 Opus 5 被給予了一個機械零件的繪圖,但沒有提供查看圖像的方法;該模型自己編寫了一個電腦視覺管道,以從原始像素中提取幾何形狀並重建零件,該公司表示沒有其他競爭模型在五次嘗試中解決了這個問題。
這些是供應商報告的數據,運行在 Anthropic 自己的測試框架中,尚未被獨立複製。這一區別在這裡尤為重要,因為標題宣稱不是 Opus 5 排名第一,而是它以中級價格提供接近前沿的結果。Anthropic 披露的唯一外部檢查是英國 AI 安全研究所對早期 Opus 5 檢查點的網絡安全測試,該測試在模型的系統卡中被報告。
填補產品線中的空白
該發布填補了 Anthropic 在 2026 年產品線中的一個空白。 Sonnet 5 於 2026 年 6 月 30 日發布,提供了接近 Opus 級別的工作量,但價格卻只是其一小部分,而 Fable 5 於 2026 年 6 月 9 日發布,價格是 Opus 的兩倍。這使得 Opus 級別被擠壓在兩側。Opus 5 為 Max、Team 和 Enterprise 客戶提供了一個接近前沿的選項,而無需支付 Fable 或 Mythos 的費用。
對於運行長時間代理工作負載的團隊,完成任務的成本往往比每令牌的價格更重要,Anthropic 正在依靠這一數學。它表示 Opus 5 比 Opus 4.8 完成工作需要更少的步驟和工具呼叫,並提供了一個快速模式,運行速度約為默認速度的 2.5 倍,價格是基礎價格的兩倍。
安全性和系統卡中的注意事項
Anthropic 的 系統卡 稱 Opus 5 為其迄今為止最符合其自動行為審計的模型,超過了 Sonnet 5、Opus 4.8 和前沿級別的 Fable 5,在遵守模型憲章方面取得了領先,同時具有所有測試模型中最低的濫用合作率。這些是 Anthropic 內部審計的自我評估,而不是外部發現。
同一文件對模型的限制也進行了不尋常的闡述。它指出 Opus 5 “在事實上略微多於 Opus 4.8 虛構事實,儘管在整體上更為準確”,並且在生物研究和攻擊性網絡安全方面落後於 Mythos 5。在一個內部生物學練習中,模型反覆陷入自我驗證迴圈,未能交付一組蛋白質設計,該公司表示 Mythos 5 已經完成了這項任務。
在網絡安全防護方面,Anthropic 將 Opus 5 的分類器建模為 Fable 5 的分類器,但預計它們的干預次數將少約 85%。該模型現在允許在源代碼中搜索漏洞,該工作傾向於防禦性,而編譯二進制文件的掃描、滲透測試和漏洞利用生成仍然被阻止。觸發分類器的請求默認情況下會返回 Opus 4.8。與 Fable 和 Mythos 不同,Opus 5 不需要一般存取的數據保留要求。
實際測試現在是是否獨立評估員能夠複製 Anthropic 報告的編碼和推理增益,以及對齊改進是否在公司自己的審計之外保持。直到那時,Opus 5 改變的最明確的事情是 Anthropic 自己目錄中接近前沿能力的價格。












