# Artificial Analysis 在其智能指數中為 Claude Haiku 5.5 評出 43 分

Artificial Analysis 為 Claude Haiku 5.5 評出 43 分，較上一代 Haiku 提高 26 分，並報告其具備 100 萬 token 上下文窗口。評測結果亦涵蓋 token 用量、終端任務、事實準確度，以及該機構指可能被低估的 AutomationBench 得分。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/8ea1e06cf2394d288f5b2a05.html

Content language: zh-HK
Localization state: translated

來源：Artificial Analysis · 發布於 8/10/2026 03:33:25

Artificial Analysis 在其智能指數（Intelligence Index）中為 Claude Haiku 5.5 評出 43 分，比一年前的上一代 Haiku 高出 26 分。上下文窗口為 100 萬 token，高於 Claude 4.5 Haiku 的 20 萬 token。該模型支援文字與圖像輸入，輸出為文字。

在最大推理力度（maximum effort）下，此得分略高於 GLM-5.3 Flash（42 分）、Gemini 3.8 Flash（41 分）及 GPT-6 Luna（38 分），與 Kimi K3（44 分）相當，比最大推理力度下的 Claude Sonnet 5.5（56 分）低 13 分。在同一指數下，最大推理力度每項任務使用約 162,000 個輸出 token，約為最大推理力度下 GPT-6 Luna（約 50,000 個）的三倍。由 xhigh 提升至 max 可增加 2 分，但 token 消耗約為 1.8 倍。在同為 38 分的情況下，high 推理力度每項任務使用約 55,000 個 token，而 GPT-6 Luna 在最大推理力度下約為 50,000 個。

在 Artificial Analysis 針對實際知識工作任務的私有評測 AA-Briefcase 中，該模型在最大推理力度下達到 1,578 Elo，領先 Kimi K3 與 GLM-5.3，並與最大推理力度下的 Muse Spark 1.3 相當。在 Terminal-Bench 4.0 上其得分為 33%，高於 Haiku 4.5 的 0%，與 GLM-5.3 Flash 持平，並領先 Gemini 3.8 Flash（20%）及 GPT-6 Luna（13%）。

AA-Omniscience 準確度為 36%，相比之下 Gemini 3.8 Flash 為 55%，GPT-6 Luna 為 44%。Artificial Analysis 表示，差距部分來自模型更願意承認自己不知道：其幻覺率為 40%，而其餘兩款模型分別為 55% 與 77%。在 AutomationBench-AA 上，該模型得分為 35%，而該三款模型為 53%–60%。Artificial Analysis 表示，發布前測試中的安全拒絕問題導致過度拒絕，Anthropic 正在處理修復方案，該機構將重新進行評測並預期得分會上升。

5 分鐘快取寫入費用方面，提示詞不超過 100,000 token 時為每百萬 token 0.125 美元，超出部分為 0.625 美元。Artificial Analysis 表示其網站尚未反映分階定價，因此 Haiku 5.5 的暫定成本數據未有計入超過 100,000 token 的較高費率。

Tags: Claude Haiku 5.5, Artificial Analysis, Anthropic, 基準測試, 智能指數

[查看主帖原文](https://x.com/ArtificialAnlys/status/2107911905822351609)
