Arena.ai 推出重新设计的排行榜概览
新概览汇总新加入模型、分类表现、能力说明和 Arena 动态的实时信号,并可展示 GPT-6 Sol、Claude Opus 5.5 等模型的跨竞技场分数。
新概览汇总新加入模型、分类表现、能力说明和 Arena 动态的实时信号,并可展示 GPT-6 Sol、Claude Opus 5.5 等模型的跨竞技场分数。
Arena.ai 表示,已生成 Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 的并排输出,Claude Opus 5.5 的评分即将公布。
使用相同的 /design 提示,Command Code 给 DeepSeek-V4.1-Flash 打出 9/10、费用 0.024 美元,给 Mimo-V2.6-Flash 打出 8/10、费用 0.018 美元,给 Grok-4.7 打出 3/10、费用 0.35 美元。
Artificial Analysis 已将 Controlled Voice Arena 扩展至日语、普通话、印地语、西班牙语、德语、法语、葡萄牙语、越南语和阿拉伯语,并为每种语言单独设立文本转语音排行榜。排名采用该语言的母语提示词、标准化克隆语音,以及母语使用者的偏好投票。
Controlled Voice Arena 现已对日语、普通话、印地语、西班牙语、德语、法语、葡萄牙语、越南语和阿拉伯语的文本转语音模型进行排名。Cartesia 的 Sonic 系列在九个榜单中的八个领先,Inworld AI 的 Realtime TTS-2 在普通话榜单排名第一。
OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。
OpenAI 表示将支持独立评估,并在训练、评估和部署环节提供深入访问,同时概述四个优先领域以及严谨、安全、独立开展工作的原则。