Arena.ai 表示 Claude Opus 5.5 (Max) 以每百萬 token 16 美元達到頂尖表現 AArena.ai1天15小時44分鐘前 Arena.ai 表示,Claude Opus 5.5 (Max) 以每百萬 token 16 美元的混合價格達到頂尖表現,並形容該性價比位置正在重塑帕累托前沿。 #claude-opus#arena.ai#模型定價#llm
Arena.ai 將 Claude Opus 5.5(Max)列為 Code Arena WebDev 第一Arena.ai 表示,Claude Opus 5.5(Max)在其 Code Arena WebDev 排名中居首,混合價格為每百萬 token 16 美元,較排名次席的 GPT-6 Astra(Max)低 60%。分數基於 Arena.ai 全球社群的實時使用。
Claude Opus 5.5 (Max) 在 Arena.ai Code Arena WebDev 排名第一Arena.ai 將 Claude Opus 5.5 (Max) 列為 Code Arena WebDev 第一,得分 1,818,領先 GPT-6 Astra (Max) 26 分,並較 Opus 5 (Max) 高出 126 分。Claude 表示,該模型在大多數任務上的表現與 Claude Fable 5.1 相當,運行成本較 Opus 5 低 40%。
Arena.ai 將 GPT-6 Luna(Max)列為 Code Arena WebDev 第 24 名GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
Tencent Hy 推出 WebCraftBench,評估 AI 構建的網頁應用WebCraftBench 讓代理實際使用線上應用,再就美感、可用性,以及是否滿足原始要求評分。Tencent Hy 表示,在 197 組經驗證的配對中,與人類偏好的吻合率為 85.3%。
Arena.ai 表示 GPT-6 Sol 與 GPT-6 Luna 的分數即將公布OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。