# Artificial Analysis 在其智能指数中给 Claude Haiku 5.5 评出 43 分

Artificial Analysis 给 Claude Haiku 5.5 评出 43 分，比一年前的前代 Haiku 高出 26 分，并报告其拥有 100 万 token 上下文窗口。测试结果还涵盖 token 消耗量、终端任务、事实准确率，以及该机构认为可能被低估的 AutomationBench 得分。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/8ea1e06cf2394d288f5b2a05.html

Content language: zh-CN
Localization state: translated

来源：Artificial Analysis · 发布于 2026/10/8 03:33:25

Artificial Analysis 在其智能指数（Intelligence Index）中给 Claude Haiku 5.5 评出 43 分，比一年前的前代 Haiku 高出 26 分。上下文窗口为 100 万 token，高于 Claude 4.5 Haiku 的 20 万 token。该模型支持文本与图像输入，输出为文本。

在最大推理力度（maximum effort）下，该得分略高于 GLM-5.3 Flash（42 分）、Gemini 3.8 Flash（41 分）和 GPT-6 Luna（38 分），与 Kimi K3（44 分）相当，比最大推理力度下的 Claude Sonnet 5.5（56 分）低 13 分。在同一指数中，最大推理力度下每项任务使用约 162,000 个输出 token，大约是最大推理力度下 GPT-6 Luna（约 50,000 个）的三倍。从 xhigh 提升至 max 会增加 2 分，但 token 消耗约为 1.8 倍。在同为 38 分的情况下，high 推理力度每项任务使用约 55,000 个 token，而 GPT-6 Luna 在最大推理力度下约为 50,000 个。

在 Artificial Analysis 针对现实知识工作任务的私有评测 AA-Briefcase 中，该模型在最大推理力度下达到 1,578 Elo 分数，领先于 Kimi K3 和 GLM-5.3，与最大推理力度下的 Muse Spark 1.3 相当。在 Terminal-Bench 4.0 上，其得分为 33%，高于 Haiku 4.5 的 0%，与 GLM-5.3 Flash 持平，并领先于 Gemini 3.8 Flash（20%）和 GPT-6 Luna（13%）。

AA-Omniscience 准确率为 36%，而 Gemini 3.8 Flash 为 55%，GPT-6 Luna 为 44%。Artificial Analysis 表示，部分差距源于该模型更愿意承认自身不知道：其幻觉率为 40%，而另外两款模型分别为 55% 和 77%。在 AutomationBench-AA 上，该模型得分为 35%，而这三款模型为 53%–60%。Artificial Analysis 表示，发布前测试中的安全拒绝问题导致了过度拒绝，Anthropic 正在修复，该机构后续将重新评测并预计分数会有所提升。

5 分钟缓存写入费用为：提示词不超过 100,000 token 时每百万 token 0.125 美元，超过后为 0.625 美元。Artificial Analysis 表示其网站尚未体现分档定价，因此 Haiku 5.5 的临时成本数据未计入超过 100,000 token 的更高费率。

Tags: Claude Haiku 5.5, Artificial Analysis, Anthropic, 基准测试, 智能指数

[查看主帖原文](https://x.com/ArtificialAnlys/status/2107911905822351609)
