Claude Opus 5.5 在 Artificial Analysis Coding Agent Index 取得 66 分
在 Claude Code 以 max effort 運行時,Claude Opus 5.5 在 Artificial Analysis Coding Agent Index 取得 66 分,是 Artificial Analysis 測得的最高分數。這比 Opus 5 的 60 分高 6 分,亦比 Claude Fable 5.1 的 62 分高 4 分。該指數對 Terminal-Bench 4.0、DeepSWE v1.1 和 SWE-Atlas-QnA 給予同等權重。
Opus 5.5 在 Terminal-Bench 4.0 達到 63.1%,高於 Opus 5 的 54.5%;在 DeepSWE v1.1 達到 68.4%,高於 62.5%;在 SWE-Atlas-QnA 達到 66.4%,高於 62.1%。升幅最大的是 Terminal-Bench,增加 8.6 個百分點。
Artificial Analysis 表示,Anthropic 把 Opus 定價下調至每百萬輸入 token 4 美元、每百萬輸出 token 20 美元,Opus 5 則為 5 美元和 25 美元,並把快取讀取由每百萬 0.50 美元下調至 0.20 美元。Opus 5.5 的每項任務成本仍為 13.04 美元,比 Opus 5 的 10.79 美元高 21%,因為它每項任務約使用 1,560 萬 token,對比約 1,140 萬,其中輸出 token 約為 2.4 倍。在這次比較中,沒有成本更低的模型達到相同分數。