Artificial Analysis、独自知能指数で Claude Haiku 5.5 を 43 点と評価
Artificial Analysis は、独自の知能指数(Intelligence Index)において Claude Haiku 5.5 を 43 点と評価した。これは 1 年前の前世代 Haiku を 26 点上回る。コンテキストウィンドウは Claude 4.5 Haiku の 20 万トークンから 100 万トークンに拡大した。同モデルはテキストと画像の入力を受け付け、テキストを出力する。
最大エフォート(maximum effort)でのスコアは、GLM-5.3 Flash(42 点)、Gemini 3.8 Flash(41 点)、GPT-6 Luna(38 点)をわずかに上回り、Kimi K3(44 点)と同等で、最大エフォート時の Claude Sonnet 5.5(56 点)を 13 点下回る。同指数において、最大エフォート時は 1 タスクあたり約 16 万 2000 の出力トークンを消費し、最大エフォート時の GPT-6 Luna(約 5 万トークン)の約 3 倍となる。xhigh から max に変更するとスコアは 2 点上昇するが、トークン消費量は約 1.8 倍になる。スコアが同等の 38 点の場合、high エフォートでは 1 タスクあたり約 5 万 5000 トークンを消費し、最大エフォート時の GPT-6 Luna の約 5 万トークンとほぼ同水準となる。
実用的なナレッジワークタスクを扱う Artificial Analysis 独自の非公開評価「AA-Briefcase」では、最大エフォート時に 1,578 Elo に達し、Kimi K3 や GLM-5.3 を上回り、最大エフォート時の Muse Spark 1.3 と同等となった。Terminal-Bench 4.0 では 33% を記録し、Haiku 4.5 の 0% から上昇、GLM-5.3 Flash と同等で、Gemini 3.8 Flash(20%)および GPT-6 Luna(13%)を上回った。
AA-Omniscience の正確性は 36% で、Gemini 3.8 Flash の 55%、GPT-6 Luna の 44% と比較される。Artificial Analysis によると、この差の一因は「分からない」と認める傾向が強い点にあり、ハルシネーション率は 40%(他 2 モデルは 55% および 77%)にとどまる。AutomationBench-AA でのスコアは 35% で、これら 3 モデルの 53〜60% を下回る。Artificial Analysis は、リリース前テストでの安全性に基づく拒絶の問題が過剰拒絶を引き起こしたと説明しており、Anthropic が修正作業を進めているため、再評価を実施すればスコアは上昇する見込みだとしている。
5 分間のキャッシュ書き込み料金は、プロンプトが 10 万トークン以下の場合は 100 万トークンあたり 0.125 ドル、10 万トークンを超える場合は 0.625 ドルである。Artificial Analysis によると、自社サイトには段階的価格設定がまだ反映されていないため、Haiku 5.5 の暫定コスト試算値には 10 万トークン超の割高な料金が含まれていない。