Arena.ai 将 GPT-6 Luna(Max)在 Code Arena WebDev 中排在第 24 位
GPT-6 Luna(Max)得分为 1,593 分,比排在第 41 位的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 称,它与 Gemini 3.7 Flash High 和 Qwen 3.8-27B 表现相当,综合价格为每百万 token 0.40 美元。
GPT-6 Luna(Max)得分为 1,593 分,比排在第 41 位的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 称,它与 Gemini 3.7 Flash High 和 Qwen 3.8-27B 表现相当,综合价格为每百万 token 0.40 美元。
Arena.ai 称,Claude Opus 5.5 (Max) 在其 Code Arena WebDev 排名中位列第一,混合价格为每百万 token 16 美元,比排名其后的 GPT-6 Astra (Max) 低 60%。评分基于 Arena.ai 全球社区的实时使用。
Arena.ai 将 Claude Opus 5.5(Max)排在 Code Arena WebDev 第一,得分为 1,818 分,领先 GPT-6 Astra(Max)26 分,高出 Opus 5(Max)126 分。Claude 表示,该模型在大多数任务上与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。
WebCraftBench 让智能体使用正在运行的应用,再对美观度、可用性以及是否满足原始请求进行评分。Tencent Hy 称,在 197 组经人工验证的配对上,其结果与人类偏好的一致率为 85.3%。
Arena.ai 报告称,OpenAI 的 GPT-6 Sol (Max) 在 Code Arena: WebDev 中获得 1,689 分,排名第四,输入与输出混合价格为每百万 token 8 美元。该分数比 GPT-5.6 Sol (xHigh) 高 72 分,而 Arena.ai 表示 GPT-6 Luna 的分数仍待公布。
Arena.ai 给 SpaceXAI 的 Grok 4.7(xHigh)打出 1,632 分,比 Grok 4.6(High)高出 16 分、领先 6 个名次。Simulations 与 Consumer Product 的排名也有上升。