Did Codex Reset
GitHub

DatabricksのテストでOpus 5.5とGPT-6 Lunaがコーディングのコストと品質のフロンティアを拡大

Patrick Wendell

Patrick Wendell氏によると、Databricksが2,400人のエンジニアのオンラインワークロードを分析し、オフライン評価も合わせた結果、前週に公開された3つのモデルのうち2つ、Opus 5.5とGPT-6 Lunaが、コストと品質のフロンティアを明確に広げている。

この比較では、Opus 5.5が最も高品質な中位モデルだった。これまでのすべてのOpusモデル、GPT-6 Sol、GPT-5.6 Solを上回り、オフラインとオンラインの両方の分析で、同一タスクのコストをOpus 4.8比で20%削減した。Databricksは、Opus 5.5をコーディングの日常的な既定モデルとして推奨している。

Databricksがテストしたすべてのオフラインベンチマークと、観測されたオンライン利用の双方で、GPT-6 Lunaのタスク当たりコストはOpus 5.5の少なくとも20分の1だった。最も難しい評価スイートの一つでは、LunaはOpus 4.6とほぼ同等の結果を出しながら、当時のOpus 4.6よりタスク当たりコストが99.3%低かった。Wendell氏は、これを約9カ月で約100分の1へのコスト削減だと説明している。同氏は、Lunaの品質に関するこの結果は暫定的であり、Databricksはより幅広いオフラインとオンラインのテストで引き続き評価していると述べている。

本番環境ではUnity Gatewayを使い、ワークロードを各モデルへ振り分け、エージェント間のやり取りを追跡した。エンドユーザーのharnessには、Omingent、Claude Code、Codex、Cursorが含まれる。