Artificial Analysis 在其智能指數中為 Claude Haiku 5.5 評出 43 分
Artificial Analysis 在其智能指數(Intelligence Index)中為 Claude Haiku 5.5 評出 43 分,比一年前的上一代 Haiku 高出 26 分。上下文窗口為 100 萬 token,高於 Claude 4.5 Haiku 的 20 萬 token。該模型支援文字與圖像輸入,輸出為文字。
在最大推理力度(maximum effort)下,此得分略高於 GLM-5.3 Flash(42 分)、Gemini 3.8 Flash(41 分)及 GPT-6 Luna(38 分),與 Kimi K3(44 分)相當,比最大推理力度下的 Claude Sonnet 5.5(56 分)低 13 分。在同一指數下,最大推理力度每項任務使用約 162,000 個輸出 token,約為最大推理力度下 GPT-6 Luna(約 50,000 個)的三倍。由 xhigh 提升至 max 可增加 2 分,但 token 消耗約為 1.8 倍。在同為 38 分的情況下,high 推理力度每項任務使用約 55,000 個 token,而 GPT-6 Luna 在最大推理力度下約為 50,000 個。
在 Artificial Analysis 針對實際知識工作任務的私有評測 AA-Briefcase 中,該模型在最大推理力度下達到 1,578 Elo,領先 Kimi K3 與 GLM-5.3,並與最大推理力度下的 Muse Spark 1.3 相當。在 Terminal-Bench 4.0 上其得分為 33%,高於 Haiku 4.5 的 0%,與 GLM-5.3 Flash 持平,並領先 Gemini 3.8 Flash(20%)及 GPT-6 Luna(13%)。
AA-Omniscience 準確度為 36%,相比之下 Gemini 3.8 Flash 為 55%,GPT-6 Luna 為 44%。Artificial Analysis 表示,差距部分來自模型更願意承認自己不知道:其幻覺率為 40%,而其餘兩款模型分別為 55% 與 77%。在 AutomationBench-AA 上,該模型得分為 35%,而該三款模型為 53%–60%。Artificial Analysis 表示,發布前測試中的安全拒絕問題導致過度拒絕,Anthropic 正在處理修復方案,該機構將重新進行評測並預期得分會上升。
5 分鐘快取寫入費用方面,提示詞不超過 100,000 token 時為每百萬 token 0.125 美元,超出部分為 0.625 美元。Artificial Analysis 表示其網站尚未反映分階定價,因此 Haiku 5.5 的暫定成本數據未有計入超過 100,000 token 的較高費率。