Opus 5.5はOpus 5よりタスクあたりのトークン使用量が37%多い
Artificial Analysisによると、Claude Opus 5.5はCoding Agent Indexのタスクあたり1560万トークンを使用し、Opus 5の1140万トークンを上回る。キャッシュ入力は1090万から1460万に増え、出力は13万7000から33万3000へと2倍を超える。
Artificial Analysisによると、Claude Opus 5.5はCoding Agent Indexのタスクあたり1560万トークンを使用し、Opus 5の1140万トークンを上回る。キャッシュ入力は1090万から1460万に増え、出力は13万7000から33万3000へと2倍を超える。
Claude Codeの最大努力設定で、Artificial AnalysisはOpus 5.5を66と測定した。Opus 5の60、Claude Fable 5.1の62を上回る。タスクあたりの費用は13.04ドルで、トークン単価は下がったものの、Opus 5の10.79ドルより高い。
Artificial AnalysisのText to Image Leaderboardで、60億パラメータのMing-Image-0.1-DesignはUI/UXデザインで81モデル中17位、オープンウェイトモデルでは首位となり、総合では160モデル中45位だった。MITライセンスで公開され、RGBA出力に対応する。評価は2K解像度、推論12ステップで行われた。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna、GPT-6 Solは、異なる推論エフォートにわたって、Artificial AnalysisのIntelligence Indexとタスクあたりコストのパレートフロンティア上に新たに11点を占めている。Claude Opus 5.5(max with fallback)はタスクあたり5.98ドルで58点を記録し、同指数で最高の結果となった。
Artificial AnalysisのPronunciation Robustnessベンチマークで、Gemini 3.8 Flash TTSは89.5%を記録し、Gemini 3.1 Flash TTS、SpaceXAI TTS、Gemini 3.8 Flash-Lite TTSを上回った。個別の発音カテゴリーの首位は、複数のモデルに分かれている。
Artificial AnalysisはGemini 3.8 Flash-Lite TTSを100万文字あたり22.07ドルとしている。いずれもGemini 3.1 Flash TTSとSpaceXAI TTSより高く、Eleven v3より低い。
この試算は Opus 5(max)の5.86ドルに近い。トークン使用量の増加は、基本料金の20%引き下げと、キャッシュ読み取り料金をさらに0.20ドルまで下げる措置で相殺されている。
Artificial Analysisによると、GPT-6 SolとLunaは同社のIntelligence Indexで前モデルと同程度のスコアを、約半分のコストで記録した。コスト低下は、トークン価格がおよそ50%下がったことによる。
Artificial Analysisは、新たな9言語のリーダーボードすべてで首位に立つオープンウェイトの音声合成モデルは1つもないとしている。首位はHiggs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS、Breeze TTS 2に分かれている。
Artificial AnalysisはControlled Voice Arenaを拡張し、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語向けに、それぞれ独立したテキスト読み上げのリーダーボードを設けた。順位は各言語で書かれたプロンプト、標準化されたクローン音声、母語話者による選好投票に基づく。
多言語対応のControlled Voice Arenaリーダーボードは、テキスト読み上げモデルを新たに9言語で比較する。言語を選べるリーダーボード、公開投票アリーナ、ベンチマーク手法が公開されている。
Artificial Analysisのランキングで、9言語すべてを首位とするオープンウェイトの音声合成モデルはない。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS、Breeze TTS 2が、それぞれ異なる言語でオープンウェイト分野の首位に立ち、各ボードに含まれるオープンウェイトモデルは2〜6件にとどまる。
Controlled Voice Arenaは、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語のテキスト読み上げモデルを順位付けするようになった。CartesiaのSonicファミリーが9つのボードのうち8つで首位に立ち、Inworld AIのRealtime TTS-2は標準中国語で1位となった。
Artificial Analysisは、StepAudio 3 ASRの文字起こし速度係数を実時間の88倍と報告している。3つのより速いシステムより遅く、ElevenLabs Scribe v2およびGemini 3.5 Transcribeに近く、Fun-Realtime-ASR-previewより速い。
Artificial Analysisによると、StepFunのStepAudio 3 ASRはStepFun API経由で非ストリーミングの文字起こしに利用でき、AA-WER IndexのWERは1.7%でAlibabaのFun-Realtime-ASR-previewと同率、StepAudio 2.5 ASRの4.7%から低下した。文字起こし速度は実時間の88倍、料金は1時間あたり0.40ドル。
StepFunは、Step 5 PreviewがIntelligence Indexで44、タスクあたり$0.71となったArtificial Analysisの結果を強調し、10月15日にさらに発表があるとした。評価では、ファーストパーティAPIアクセスを備え、10月15日にオープンウェイトを予定する600B/27B MoEフラッグシップと説明されている。