Arena.ai 將 GPT-6 Luna(Max)列為 Code Arena WebDev 第 24 名
GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
GPT-6 Luna(Max)得分 1,593 分,比排名第 41 的 GPT-5.6 Luna(xHigh)高 74 分。Arena.ai 表示,它與 Gemini 3.7 Flash High 及 Qwen 3.8-27B 表現相當,混合價格為每百萬 token 0.40 美元。
Arena.ai 表示,Claude Opus 5.5(Max)在其 Code Arena WebDev 排名中居首,混合價格為每百萬 token 16 美元,較排名次席的 GPT-6 Astra(Max)低 60%。分數基於 Arena.ai 全球社群的實時使用。
Arena.ai 表示,Claude Opus 5.5 (Max) 以每百萬 token 16 美元的混合價格達到頂尖表現,並形容該性價比位置正在重塑帕累托前沿。
Arena.ai 將 Claude Opus 5.5 (Max) 列為 Code Arena WebDev 第一,得分 1,818,領先 GPT-6 Astra (Max) 26 分,並較 Opus 5 (Max) 高出 126 分。Claude 表示,該模型在大多數任務上的表現與 Claude Fable 5.1 相當,運行成本較 Opus 5 低 40%。
WebCraftBench 讓代理實際使用線上應用,再就美感、可用性,以及是否滿足原始要求評分。Tencent Hy 表示,在 197 組經驗證的配對中,與人類偏好的吻合率為 85.3%。
Arena.ai 在兩項榜單均將 Qwen-Image-2.1 列為開源模型首位。圖像編輯得分 1,367,總排名第 16,落後 GPT-Image-1.5-high-fidelity 三分。
OpenAI 的兩個模型現可在 Arena 測試,針對真實世界代理任務的投票會計入排行榜。Arena.ai 表示,petergostev 亦以相同提示詞、並將兩個模型都設為最高推理,比較了 GPT-6 Sol 與 GPT-5.6 Sol。
OpenAI 的 GPT-6 Sol 同 GPT-6 Luna 現可於 Arena.ai 的 Agent Arena 測試,分數仍未公布;亦可於 Code Arena 的 WebDev、Text、Vision、Search 同 Document 類別使用。OpenAI 表示,兩款模型建基於 GPT-6 Astra,API 價格較 GPT-5.6 推廣價低 50%。
Arena.ai 給予 Qwen-Image-2.1 1,228 分,並在開源模型中排第一、總排名第 17,落後 Gemini-3-pro-image-preview 四分,落後 GPT-Image-1.5-high-fidelity 11 分。