Did Codex Reset
GitHub

QQ·微信群

Artificial Analysis 給 Claude Sonnet 5.5 打出 56 分,比 Opus 5.5 低 2 分

Artificial Analysis

Artificial Analysis 稱,Anthropic 已推出 Claude Sonnet 5.5,其在最高力度下的 Intelligence Index 得分為 56。這比 Sonnet 5 高 18 分,比 Opus 5.5(最高力度)低 2 分,在該指數上排名第二。

在最高力度下,Sonnet 5.5 在 Terminal-Bench 4.0 上達到 64%,Opus 5.5 與 GPT-6 Astra 均為 60%。Artificial Analysis 亦報告,它在 AA-Briefcase(1811 對 1822 Elo)、GDPval-AA(1844 對 1846 Elo)和 AutomationBench-AA(71% 對 70%)上與 Opus 5.5 接近持平,但 token 用量高得多。它在每項 Intelligence Index 任務上約使用 193,000 個輸出 token,是 Artificial Analysis 測得的最高用量——大約比 Opus 5.5(最高力度)或 Sonnet 5(最高力度)多 60%,約為 GPT-6 Astra(最高力度)的 7 倍。

在 AA-Omniscience 上,Sonnet 5.5 的事實準確率為 54%,Opus 5.5 為 66%,幻覺率較低,為 47%,後者為 59%。它在 Humanity’s Last Exam 和 SciCode 上亦大約低 6 分。Token 價格與 Sonnet 5 相同:輸入每百萬 token 2 美元,輸出每百萬 token 10 美元,快取寫入 2.50 美元,快取讀取 0.20 美元。Artificial Analysis 估計每項任務成本為 7.60 美元,比 Sonnet 5 大約高 50%,並稱該模型不在其智能與成本的前沿上;在較低力度下,GPT-6 Astra 或 Sol 配置能以更低成本提供同等表現,而高力度設定僅略為落後於 GPT-6 Sol,每項任務成本實際上相同。

100 萬 token 的上下文視窗沒有變化,仍支援圖像和文字輸入。測試了五種力度設定,Sonnet 5.5 在約 0.1% 的 Intelligence Index 任務中回退到 Sonnet 5,主要出現在 Terminal-Bench 4.0。結果來自預發布部署,Anthropic 發現其中存在一個會降低結構化輸出請求質素的 bug。Anthropic 稱該 bug 已在公開發布中修復,並預計變化極小,或目前成績略為低估了實際表現。Artificial Analysis 計劃重新運行相關評測。