Opus 5.5 每项任务的 token 用量比 Opus 5 高 37%
Artificial Analysis 称,Claude Opus 5.5 在 Coding Agent Index 每项任务中使用 1560 万 token,而 Opus 5 为 1140 万。缓存输入从 1090 万增至 1460 万,输出从 13.7 万增至 33.3 万,增幅超过一倍。
Artificial Analysis 称,Claude Opus 5.5 在 Coding Agent Index 每项任务中使用 1560 万 token,而 Opus 5 为 1140 万。缓存输入从 1090 万增至 1460 万,输出从 13.7 万增至 33.3 万,增幅超过一倍。
在 Claude Code 的最高努力档,Artificial Analysis 测得 Opus 5.5 为 66 分,高于 Opus 5 的 60 分和 Claude Fable 5.1 的 62 分。其单任务成本为 13.04 美元,尽管 token 价格更低,仍高于 Opus 5 的 10.79 美元。
在 Artificial Analysis 的 Text to Image 排行榜上,60 亿参数的 Ming-Image-0.1-Design 在 UI/UX 设计类别中位列 81 个模型中的第 17,并在开源权重模型中排名第一;综合排名为 160 个模型中的第 45。该模型以 MIT 许可证发布,支持 RGBA 输出,评测分辨率为 2K,推理步数为 12。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 在不同推理强度下,为 Artificial Analysis 的 Intelligence Index 与单任务成本帕累托前沿贡献了 11 个新点。Claude Opus 5.5(max with fallback)得分为 58,单任务成本 5.98 美元,是该指数上的最高结果。
在 Artificial Analysis 的 Pronunciation Robustness 基准测试中,Gemini 3.8 Flash TTS 得分为 89.5%,领先于 Gemini 3.1 Flash TTS、SpaceXAI TTS 和 Gemini 3.8 Flash-Lite TTS。各单项发音类别的领先位置由多个模型分占。
Artificial Analysis 将 Gemini 3.8 Flash-Lite TTS 列为每百万字符 22.07 美元。两者均高于 Gemini 3.1 Flash TTS 和 SpaceXAI TTS,低于 Eleven v3。
这一估算接近 Opus 5(max)的 5.86 美元。更高的 token 用量被基础价格下调 20%,以及缓存读取价格进一步降至 0.20 美元所抵消。
Artificial Analysis 称,GPT-6 Sol 与 Luna 在其 Intelligence Index 上的得分与前代相近,成本约为前代的一半;成本下降主要来自 token 价格约降低 50%。
Artificial Analysis发现,没有单一开放权重文本转语音模型在全部九个新语言排行榜上领先。领先位置由Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS和Breeze TTS 2分占。
Artificial Analysis 已将 Controlled Voice Arena 扩展至日语、普通话、印地语、西班牙语、德语、法语、葡萄牙语、越南语和阿拉伯语,并为每种语言单独设立文本转语音排行榜。排名采用该语言的母语提示词、标准化克隆语音,以及母语使用者的偏好投票。
多语言 Controlled Voice Arena 排行榜比较 9 种新语言的文本转语音模型。现已提供可按语言筛选的排行榜、公开投票竞技场和评测方法。
在 Artificial Analysis 的排名中,没有任何单一开放权重文本转语音模型在全部九种语言上领先。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS 和 Breeze TTS 2 分别在不同语言的开放权重榜上居首,且每个榜单只收录 2 到 6 个开放权重模型。
Controlled Voice Arena 现已对日语、普通话、印地语、西班牙语、德语、法语、葡萄牙语、越南语和阿拉伯语的文本转语音模型进行排名。Cartesia 的 Sonic 系列在九个榜单中的八个领先,Inworld AI 的 Realtime TTS-2 在普通话榜单排名第一。
Artificial Analysis 报告,StepAudio 3 ASR 的转写速度为实时的 88 倍,落后于三个更快的系统,接近 ElevenLabs Scribe v2 与 Gemini 3.5 Transcribe,并领先于 Fun-Realtime-ASR-preview。
Artificial Analysis 称,StepFun 的 StepAudio 3 ASR 已可通过 StepFun API 进行非流式转写,在 AA-WER Index 上的词错误率为 1.7%,与阿里巴巴的 Fun-Realtime-ASR-preview 并列,低于 StepAudio 2.5 ASR 的 4.7%。其转写速度为实时的 88 倍,价格为每小时 0.40 美元。
StepFun 强调了 Artificial Analysis 的结果,Step 5 Preview 在 Intelligence Index 上得分为 44,每项任务 $0.71,并将于 10 月 15 日公布更多内容。该评估将其描述为 600B/27B MoE 旗舰模型,提供第一方 API 访问,并计划于 10 月 15 日开放权重。