Arena.ai 称 Claude Opus 5.5(Max)以每百万 token 16 美元实现顶尖性能 AArena.ai1天15小时43分钟前 Arena.ai 称,Claude Opus 5.5(Max)以每百万 token 综合 16 美元的价格实现顶尖性能。它将这一性价比点描述为重塑了帕累托前沿。 #claude-opus#arena.ai#模型定价#llm
Arena.ai 将 Claude Opus 5.5 (Max) 列为 Code Arena WebDev 第一Arena.ai 称,Claude Opus 5.5 (Max) 在其 Code Arena WebDev 排名中位列第一,混合价格为每百万 token 16 美元,比排名其后的 GPT-6 Astra (Max) 低 60%。评分基于 Arena.ai 全球社区的实时使用。
Claude Opus 5.5(Max)在 Arena.ai Code Arena WebDev 中排名第一Arena.ai 将 Claude Opus 5.5(Max)排在 Code Arena WebDev 第一,得分为 1,818 分,领先 GPT-6 Astra(Max)26 分,高出 Opus 5(Max)126 分。Claude 表示,该模型在大多数任务上与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。
Arena.ai 将 GPT-6 Luna(Max)在 Code Arena WebDev 中排在第 24 位GPT-6 Luna(Max)得分为 1,593 分,比排在第 41 位的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 称,它与 Gemini 3.7 Flash High 和 Qwen 3.8-27B 表现相当,综合价格为每百万 token 0.40 美元。
Tencent Hy 推出面向 AI 构建网页应用的 WebCraftBenchWebCraftBench 让智能体使用正在运行的应用,再对美观度、可用性以及是否满足原始请求进行评分。Tencent Hy 称,在 197 组经人工验证的配对上,其结果与人类偏好的一致率为 85.3%。
Arena.ai 称 GPT-6 Sol 与 GPT-6 Luna 的评分即将公布OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。