Did Codex Reset
GitHub

QQ·微信群

Databricks 測試發現 Opus 5.5 與 GPT-6 Luna 拓展編程的成本與質素前沿

Patrick Wendell

Patrick Wendell 表示,Databricks 對 2,400 名工程師線上工作負載的分析,連同離線評測,發現前一週發布的三個模型中有兩個明顯拓展了成本與質素前沿:Opus 5.5 與 GPT-6 Luna。

在這項比較中,Opus 5.5 是質素最高的中階模型。它超過了此前所有 Opus 模型、GPT-6 Sol 和 GPT-5.6 Sol,並在離線和線上分析中都將相同任務的成本較 Opus 4.8 降低 20%。Databricks 正鼓勵將 Opus 5.5 作為日常編程的預設模型。

在 Databricks 測試的每一項離線基準以及觀察到的線上使用中,GPT-6 Luna 每個任務的成本至少比 Opus 5.5 低 20 倍。在其難度最高的評測套件之一上,Luna 大致達到 Opus 4.6 的水平,同時每個任務的成本比當時的 Opus 4.6 低 99.3%。Wendell 稱,這大約相當於約九個月內成本降低約 100 倍。他表示,關於 Luna 質素的這一發現仍是初步結果,Databricks 仍在更廣泛的離線和線上測試中評估它。

生產環境使用 Unity Gateway 在各模型間路由工作負載並追蹤智能體互動,終端用戶所用 harness 包括 Omingent、Claude Code、Codex 和 Cursor。