Opus 5.5 每項任務的 token 用量比 Opus 5 多 37%
Artificial Analysis 表示,Claude Opus 5.5 在 Coding Agent Index 每項任務使用 1560 萬個 token,Opus 5 則為 1140 萬個。快取輸入由 1090 萬增至 1460 萬,輸出由 13.7 萬增加超過一倍至 33.3 萬。
Artificial Analysis 表示,Claude Opus 5.5 在 Coding Agent Index 每項任務使用 1560 萬個 token,Opus 5 則為 1140 萬個。快取輸入由 1090 萬增至 1460 萬,輸出由 13.7 萬增加超過一倍至 33.3 萬。
在 Claude Code 以 max effort 運行時,Artificial Analysis 測得 Opus 5.5 為 66 分,高於 Opus 5 的 60 分及 Claude Fable 5.1 的 62 分。其每項任務成本為 13.04 美元,儘管 token 價格較低,仍高於 Opus 5 的 10.79 美元。
在 Artificial Analysis 的 Text to Image 排行榜上,60 億參數的 Ming-Image-0.1-Design 於 UI/UX 設計類別排第 17(共 81 名),並在開源權重模型中居首;整體則排第 45(共 160 名)。該模型以 MIT 授權發布,支援 RGBA 輸出,並以 2K 解析度、12 步推理進行評測。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 與 GPT-6 Sol,在不同推理力度下,合共為 Artificial Analysis 的 Intelligence Index 對每項任務成本 Pareto 前沿貢獻 11 個新點。Claude Opus 5.5(max with fallback)得分 58,每項任務成本 5.98 美元,是該指數的最高結果。
在 Artificial Analysis 的 Pronunciation Robustness 基準測試中,Gemini 3.8 Flash TTS 得分 89.5%,領先 Gemini 3.1 Flash TTS、SpaceXAI TTS 及 Gemini 3.8 Flash-Lite TTS。個別發音類別的領先位置由多個模型分別取得。
Artificial Analysis 列出 Gemini 3.8 Flash-Lite TTS 為每百萬字元 22.07 美元。兩者均高於 Gemini 3.1 Flash TTS 與 SpaceXAI TTS,並低於 Eleven v3。
這個估算接近 Opus 5(max)的 5.86 美元。較高的 token 用量,被基礎價格下調 20%,以及快取讀取價格進一步降至 0.20 美元所抵銷。
Artificial Analysis 指,GPT-6 Sol 與 Luna 在其 Intelligence Index 的得分與前代相近,成本約為一半;降幅來自代幣價格約低 50%。
Artificial Analysis 發現,沒有單一開源權重文字轉語音模型在全部九個新語言排行榜領先。領先位置分屬 Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS 和 Breeze TTS 2。
Artificial Analysis 已擴展 Controlled Voice Arena,為日語、普通話、印地語、西班牙語、德語、法語、葡萄牙語、越南語和阿拉伯語分別設立文字轉語音排行榜。排名採用各語言原生提示、標準化克隆語音,以及母語者的偏好投票。
多語言 Controlled Voice Arena 排行榜比較 9 種新語言的文字轉語音模型。可按語言選擇的排行榜、公開投票競技場及評測方法均已提供。
在 Artificial Analysis 的排名中,沒有單一開源權重文字轉語音模型在全部九種語言領先。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS 與 Breeze TTS 2 各自在不同語言的開源權重組別居首,而每個榜單只收錄 2 至 6 個開源權重模型。
Controlled Voice Arena 現為日語、普通話、印地語、西班牙語、德語、法語、葡萄牙語、越南語及阿拉伯語的文字轉語音模型排名。Cartesia 的 Sonic 系列在九個榜單中的八個領先,Inworld AI 的 Realtime TTS-2 則在普通話榜排名第一。
Artificial Analysis 報告,StepAudio 3 ASR 的轉錄速度為即時的 88 倍,落後三個更快的系統,接近 ElevenLabs Scribe v2 與 Gemini 3.5 Transcribe,並領先 Fun-Realtime-ASR-preview。
Artificial Analysis 表示,StepFun 的 StepAudio 3 ASR 已可透過 StepFun API 作非串流轉錄,在 AA-WER Index 的詞錯率為 1.7%,與阿里巴巴的 Fun-Realtime-ASR-preview 並列,並由 StepAudio 2.5 ASR 的 4.7% 下降。轉錄速度為即時的 88 倍,費用為每小時 0.40 美元。
StepFun 強調 Artificial Analysis 結果顯示,Step 5 Preview 於 Intelligence Index 取得 44 分,每項任務成本為 0.71 美元,並將於 10 月 15 日公布更多消息。該評測描述這是一款 6000 億/270 億參數的 MoE 旗艦模型,提供第一方 API 存取,並計劃於 10 月 15 日開放權重。