Arena.ai 將 GPT-6 Luna(Max)列為 Code Arena WebDev 第 24 名
GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
Arena.ai 表示,Claude Opus 5.5(Max)在其 Code Arena WebDev 排名中居首,混合價格為每百萬 token 16 美元,較排名次席的 GPT-6 Astra(Max)低 60%。分數基於 Arena.ai 全球社群的實時使用。
Arena.ai 將 Claude Opus 5.5 (Max) 列為 Code Arena WebDev 第一,得分 1,818,領先 GPT-6 Astra (Max) 26 分,並較 Opus 5 (Max) 高出 126 分。Claude 表示,該模型在大多數任務上的表現與 Claude Fable 5.1 相當,運行成本較 Opus 5 低 40%。
WebCraftBench 讓代理實際使用線上應用,再就美感、可用性,以及是否滿足原始要求評分。Tencent Hy 表示,在 197 組經驗證的配對中,與人類偏好的吻合率為 85.3%。
Arena.ai 報告指,OpenAI 的 GPT-6 Sol(Max)取得 1,689 分,在 Code Arena: WebDev 排第四,綜合價格為每百萬 token 8 美元。分數較 GPT-5.6 Sol(xHigh)高 72 分,而 Arena.ai 表示 GPT-6 Luna 的分數仍待公布。
Arena.ai 給 SpaceXAI 的 Grok 4.7(xHigh)評為 1,632 分,較 Grok 4.6(High)高 16 分、排名上升 6 位。Simulations 與 Consumer Product 的排名亦有上升。