Arena.ai 将 GPT-6 Luna(Max)在 Code Arena WebDev 中排在第 24 位
GPT-6 Luna(Max)得分为 1,593 分,比排在第 41 位的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 称,它与 Gemini 3.7 Flash High 和 Qwen 3.8-27B 表现相当,综合价格为每百万 token 0.40 美元。
GPT-6 Luna(Max)得分为 1,593 分,比排在第 41 位的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 称,它与 Gemini 3.7 Flash High 和 Qwen 3.8-27B 表现相当,综合价格为每百万 token 0.40 美元。
Arena.ai 称,Claude Opus 5.5 (Max) 在其 Code Arena WebDev 排名中位列第一,混合价格为每百万 token 16 美元,比排名其后的 GPT-6 Astra (Max) 低 60%。评分基于 Arena.ai 全球社区的实时使用。
Arena.ai 称,Claude Opus 5.5(Max)以每百万 token 综合 16 美元的价格实现顶尖性能,并将这一性价比点描述为重塑了帕累托前沿。
Arena.ai 将 Claude Opus 5.5(Max)排在 Code Arena WebDev 第一,得分为 1,818 分,领先 GPT-6 Astra(Max)26 分,高出 Opus 5(Max)126 分。Claude 表示,该模型在大多数任务上与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。
WebCraftBench 让智能体使用正在运行的应用,再对美观度、可用性以及是否满足原始请求进行评分。Tencent Hy 称,在 197 组经人工验证的配对上,其结果与人类偏好的一致率为 85.3%。
Arena.ai 将 Qwen-Image-2.1 在两个榜单中均列为开源模型第一。在图像编辑榜上,它获得 1,367 分,总排名第 16,落后 GPT-Image-1.5-high-fidelity 三分。
OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。
OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 现可在 Arena.ai 的 Agent Arena 中测试,分数尚未公布;也可在 Code Arena 的 WebDev、Text、Vision、Search 与 Document 类别中测试。OpenAI 称,这两款模型建立在 GPT-6 Astra 的进展之上,API 价格比 GPT-5.6 的促销价低 50%。
Arena.ai 给 Qwen-Image-2.1 评出 1,228 分,在开源模型中排名第一,总榜第 17,比 Gemini-3-pro-image-preview 低 4 分,比 GPT-Image-1.5-high-fidelity 低 11 分。