Did Codex Reset
GitHub

QQ·微信群

Databricks 测试发现 Opus 5.5 与 GPT-6 Luna 拓展编程的成本与质量前沿

Patrick Wendell

Patrick Wendell 表示,Databricks 对 2,400 名工程师在线工作负载的分析,连同离线评测,发现前一周发布的三个模型中有两个明显拓展了成本与质量前沿:Opus 5.5 与 GPT-6 Luna。

在这项比较中,Opus 5.5 是质量最高的中端模型。它超过了此前所有 Opus 模型、GPT-6 Sol 和 GPT-5.6 Sol,并在离线和在线分析中都将相同任务的成本较 Opus 4.8 降低 20%。Databricks 正鼓励将 Opus 5.5 作为日常编程的默认模型。

在 Databricks 测试的每一项离线基准以及观察到的在线使用中,GPT-6 Luna 每个任务的成本至少比 Opus 5.5 低 20 倍。在其难度最高的评测套件之一上,Luna 大致达到 Opus 4.6 的水平,同时每个任务的成本比当时的 Opus 4.6 低 99.3%。Wendell 称,这大约相当于约九个月内成本降低约 100 倍。他表示,关于 Luna 质量的这一发现仍是初步结果,Databricks 仍在更广泛的离线和在线测试中评估它。

生产环境使用 Unity Gateway 在各模型间路由工作负载并追踪智能体交互,终端用户所用 harness 包括 Omingent、Claude Code、Codex 和 Cursor。