Arena.aiが再設計したLeaderboard Overviewを公開
新しい概要ページは、新たに追加されたモデル、カテゴリー別の成績、能力に関する所見、Arenaのニュースといったライブの指標をまとめ、GPT-6 SolやClaude Opus 5.5などのモデルについてアリーナ横断のスコアを表示できる。
新しい概要ページは、新たに追加されたモデル、カテゴリー別の成績、能力に関する所見、Arenaのニュースといったライブの指標をまとめ、GPT-6 SolやClaude Opus 5.5などのモデルについてアリーナ横断のスコアを表示できる。
Arena.aiはCode Arena WebDevでClaude Opus 5.5(Max)を1,818ポイントで首位とし、GPT-6 Astra(Max)を26ポイント、Opus 5(Max)を126ポイント上回った。Claudeは、このモデルが大半のタスクでClaude Fable 5.1と同等の水準で、運用コストはOpus 5より40%低いとしている。
Arena.aiはSpaceXAIのGrok 4.7(xHigh)を1,632ポイントとし、Grok 4.6(High)を16ポイント、6順位上回る。SimulationsとConsumer Productも順位を上げている。
多言語対応のControlled Voice Arenaリーダーボードは、テキスト読み上げモデルを新たに9言語で比較する。言語を選べるリーダーボード、公開投票アリーナ、ベンチマーク手法が公開されている。
Artificial Analysisのランキングで、9言語すべてを首位とするオープンウェイトの音声合成モデルはない。Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS、Breeze TTS 2が、それぞれ異なる言語でオープンウェイト分野の首位に立ち、各ボードに含まれるオープンウェイトモデルは2〜6件にとどまる。
Controlled Voice Arenaは、日本語、標準中国語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語のテキスト読み上げモデルを順位付けするようになった。CartesiaのSonicファミリーが9つのボードのうち8つで首位に立ち、Inworld AIのRealtime TTS-2は標準中国語で1位となった。
Arena.aiはQwen-Image-2.1に1,228点を与え、オープンモデルで首位、総合17位とした。Gemini-3-pro-image-previewには4点、GPT-Image-1.5-high-fidelityには11点及ばない。