Did Codex Reset
GitHub

Artificial Analysis、Claude Sonnet 5.5を56点と評価、Opus 5.5より2点下回る

Artificial Analysis

Artificial Analysisによると、AnthropicはClaude Sonnet 5.5を公開し、最大effortのIntelligence Indexで56点を記録した。Sonnet 5を18点上回り、Opus 5.5(最大)を2点下回って、同指数で2位となった。

最大effortでは、Sonnet 5.5のTerminal-Bench 4.0の成績は64%で、Opus 5.5とGPT-6 Astraはいずれも60%だった。Artificial Analysisは、AA-Briefcase(1811対1822 Elo)、GDPval-AA(1844対1846 Elo)、AutomationBench-AA(71%対70%)でもOpus 5.5とほぼ同等だった一方、トークン使用量は大幅に多かったとも報告している。Intelligence Indexの1タスクあたり約193,000出力トークンを使用し、これはArtificial Analysisが測定した最大量で、Opus 5.5(最大)またはSonnet 5(最大)より約60%多く、GPT-6 Astra(最大)の約7倍だった。

AA-Omniscienceでは、Sonnet 5.5の事実正答率は54%で、Opus 5.5の66%を下回った。幻覚率は47%で、Opus 5.5の59%より低かった。Humanity’s Last ExamとSciCodeでも約6点低かった。トークン価格はSonnet 5と同じで、入力100万トークンあたり2ドル、出力100万トークンあたり10ドル、キャッシュ書き込みは2.50ドル、キャッシュ読み取りは0.20ドル。Artificial Analysisは1タスクあたりのコストを7.60ドルと見積もり、Sonnet 5より約50%高いとし、同モデルは知能対コストのフロンティアから外れていると述べている。より低いeffortでは、GPT-6 AstraまたはSolの構成がより低いコストで同等の性能を出し、高いeffort設定はGPT-6 Solにわずかに後れ、1タスクあたりのコストは実質的に同じだった。

画像とテキストを入力できる100万トークンのコンテキストウィンドウに変更はなかった。5段階のeffort設定がテストされ、Sonnet 5.5はIntelligence Indexのタスクの約0.1%でSonnet 5にフォールバックし、主にTerminal-Bench 4.0で起きた。結果はプレリリース版のデプロイによるもので、Anthropicは構造化出力リクエストの品質を低下させるバグを発見した。Anthropicによると、このバグは一般公開版で修正済みで、変化は最小限か、性能がわずかに過小評価されていると見込んでいる。Artificial Analysisは関連する評価を再実行する予定だ。