Arena.ai 推出重新設計的 Leaderboard Overview
新總覽匯集新加入模型、分類表現、能力筆記同 Arena 新聞的即時訊號,並可顯示 GPT-6 Sol、Claude Opus 5.5 等模型的跨 arena 分數。
新總覽匯集新加入模型、分類表現、能力筆記同 Arena 新聞的即時訊號,並可顯示 GPT-6 Sol、Claude Opus 5.5 等模型的跨 arena 分數。
Arena.ai 表示,已生成 Anthropic 的 Claude Opus 5.5 與 OpenAI 的 GPT-6 Sol 的並排輸出,並指 Claude Opus 5.5 的分數即將公布。
在相同的 /design 提示下,Command Code 給 DeepSeek-V4.1-Flash 9/10、成本 0.024 美元,Mimo-V2.6-Flash 8/10、成本 0.018 美元,Grok-4.7 3/10、成本 0.35 美元。
Artificial Analysis 已擴展 Controlled Voice Arena,為日語、普通話、印地語、西班牙語、德語、法語、葡萄牙語、越南語和阿拉伯語分別設立文字轉語音排行榜。排名採用各語言原生提示、標準化克隆語音,以及母語者的偏好投票。
Controlled Voice Arena 現為日語、普通話、印地語、西班牙語、德語、法語、葡萄牙語、越南語及阿拉伯語的文字轉語音模型排名。Cartesia 的 Sonic 系列在九個榜單中的八個領先,Inworld AI 的 Realtime TTS-2 則在普通話榜排名第一。
OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。
OpenAI 表示,將支持獨立評估,並在訓練、評估和部署各階段提供深入存取權;同時概述四個優先領域,以及嚴謹、安全且獨立工作的原則。