Artificial Analysis 给 Claude Sonnet 5.5 打出 56 分,比 Opus 5.5 低 2 分
Artificial Analysis 称,Anthropic 已推出 Claude Sonnet 5.5,其在最高力度下的 Intelligence Index 得分为 56。这比 Sonnet 5 高 18 分,比 Opus 5.5(最高力度)低 2 分,在该指数上排名第二。
在最高力度下,Sonnet 5.5 在 Terminal-Bench 4.0 上达到 64%,Opus 5.5 与 GPT-6 Astra 均为 60%。Artificial Analysis 还报告,它在 AA-Briefcase(1811 对 1822 Elo)、GDPval-AA(1844 对 1846 Elo)和 AutomationBench-AA(71% 对 70%)上与 Opus 5.5 接近持平,但 token 用量高得多。它在每项 Intelligence Index 任务上约使用 193,000 个输出 token,是 Artificial Analysis 测得的最高用量——大约比 Opus 5.5(最高力度)或 Sonnet 5(最高力度)多 60%,约为 GPT-6 Astra(最高力度)的 7 倍。
在 AA-Omniscience 上,Sonnet 5.5 的事实准确率为 54%,Opus 5.5 为 66%,幻觉率更低,为 47%,后者为 59%。它在 Humanity’s Last Exam 和 SciCode 上也大约低 6 分。Token 价格与 Sonnet 5 相同:输入每百万 token 2 美元,输出每百万 token 10 美元,缓存写入 2.50 美元,缓存读取 0.20 美元。Artificial Analysis 估计每项任务成本为 7.60 美元,比 Sonnet 5 大约高 50%,并称该模型不在其智能与成本的前沿上;在较低力度下,GPT-6 Astra 或 Sol 配置能以更低成本提供同等表现,而高力度设置仅略落后于 GPT-6 Sol,每项任务成本实际上相同。
100 万 token 的上下文窗口没有变化,仍支持图像和文本输入。测试了五种力度设置,Sonnet 5.5 在约 0.1% 的 Intelligence Index 任务中回退到 Sonnet 5,主要出现在 Terminal-Bench 4.0。结果来自预发布部署,Anthropic 发现其中存在一个会降低结构化输出请求质量的 bug。Anthropic 称该 bug 已在公开发布中修复,并预计变化极小,或当前成绩略微低估了实际表现。Artificial Analysis 计划重新运行相关评测。