Arena.ai、Code Arena WebDevでGPT-6 Luna(Max)を24位にランク
GPT-6 Luna(Max)は1,593点で、41位のGPT-5.6 Luna(xHigh)を74点上回る。Arena.aiによると、100万トークンあたりの混合価格0.40ドルでGemini 3.7 Flash HighおよびQwen 3.8-27Bと同等だという。
GPT-6 Luna(Max)は1,593点で、41位のGPT-5.6 Luna(xHigh)を74点上回る。Arena.aiによると、100万トークンあたりの混合価格0.40ドルでGemini 3.7 Flash HighおよびQwen 3.8-27Bと同等だという。
Arena.aiによると、Claude Opus 5.5(Max)はCode Arena WebDevのランキングで首位。ブレンド価格は100万トークンあたり16ドルで、次点のGPT-6 Astra(Max)より60%低い。スコアはArena.aiのグローバルコミュニティによる実際の利用に基づく。
Arena.aiは、Claude Opus 5.5(Max)がブレンド価格で100万トークンあたり16ドルという水準で最高性能を実現すると述べ、その価格性能点がパレートフロンティアを塗り替えると説明している。
Arena.aiはCode Arena WebDevでClaude Opus 5.5(Max)を1,818ポイントで首位とし、GPT-6 Astra(Max)を26ポイント、Opus 5(Max)を126ポイント上回った。Claudeは、このモデルが大半のタスクでClaude Fable 5.1と同等の水準で、運用コストはOpus 5より40%低いとしている。
WebCraftBenchは、エージェントに稼働中のアプリを使わせたうえで、見た目、使いやすさ、元の依頼を満たしたかを採点する。Tencent Hyは、検証済み197組で人間の好みとの一致が85.3%だったと報告している。
Arena.aiは、両アリーナでQwen-Image-2.1をオープンソースモデルの首位に置いている。Image Editでは1,367点で総合16位となり、15位のGPT-Image-1.5-high-fidelityに3点及ばない。
OpenAIの2モデルはArenaで試すことができ、実世界のエージェント型タスクへの投票がリーダーボードに反映される。Arena.aiによると、petergostevは同一のプロンプトと最大推論設定でGPT-6 SolとGPT-5.6 Solも比較している。
OpenAIのGPT-6 SolとGPT-6 Lunaは、Arena.aiのAgent Arenaで試せるようになり、スコアは今後公開される。Code ArenaではWebDev、Text、Vision、Search、Documentでも利用できる。OpenAIは、両モデルがGPT-6 Astraを基盤にしており、API価格はGPT-5.6のプロモーション価格より50%低いと述べている。
Arena.aiはQwen-Image-2.1に1,228点を与え、オープンモデルで首位、総合17位とした。Gemini-3-pro-image-previewには4点、GPT-Image-1.5-high-fidelityには11点及ばない。