Arena.aiが再設計したLeaderboard Overviewを公開
新しい概要ページは、新たに追加されたモデル、カテゴリー別の成績、能力に関する所見、Arenaのニュースといったライブの指標をまとめ、GPT-6 SolやClaude Opus 5.5などのモデルについてアリーナ横断のスコアを表示できる。
新しい概要ページは、新たに追加されたモデル、カテゴリー別の成績、能力に関する所見、Arenaのニュースといったライブの指標をまとめ、GPT-6 SolやClaude Opus 5.5などのモデルについてアリーナ横断のスコアを表示できる。
Arena.aiは、AnthropicのClaude Opus 5.5とOpenAIのGPT-6 Solについて並べた出力を生成したと述べ、Claude Opus 5.5のスコアは近日公開予定だとしている。
同じ /design プロンプトで、Command CodeはDeepSeek-V4.1-Flashに9/10($0.024)、Mimo-V2.6-Flashに8/10($0.018)、Grok-4.7に3/10($0.35)を付けた。
Artificial AnalysisはControlled Voice Arenaを拡張し、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語向けに、それぞれ独立したテキスト読み上げのリーダーボードを設けた。順位は各言語で書かれたプロンプト、標準化されたクローン音声、母語話者による選好投票に基づく。
Controlled Voice Arenaは、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語のテキスト読み上げモデルを順位付けするようになった。CartesiaのSonicファミリーが9つのボードのうち8つで首位に立ち、Inworld AIのRealtime TTS-2は標準中国語で1位となった。
OpenAIの2モデルはArenaで試すことができ、実世界のエージェント型タスクへの投票がリーダーボードに反映される。Arena.aiによると、petergostevは同一のプロンプトと最大推論設定でGPT-6 SolとGPT-5.6 Solも比較している。
OpenAIは、学習、評価、デプロイの各段階にわたる深いアクセスを伴う独立評価を支援すると述べ、厳格で安全かつ独立した作業のための4つの優先分野と原則を示している。