Did Codex Reset
GitHub

Databricks 테스트에서 Opus 5.5와 GPT-6 Luna가 코딩의 비용·품질 경계를 확대

Patrick Wendell

Patrick Wendell은 Databricks가 엔지니어 2,400명의 온라인 워크로드를 분석하고 오프라인 평가를 함께 검토한 결과, 전주에 출시된 세 모델 가운데 두 모델인 Opus 5.5와 GPT-6 Luna가 비용·품질 경계를 분명히 넓혔다고 밝혔다.

이 비교에서 Opus 5.5는 품질이 가장 높은 중위 모델이었다. 이전의 모든 Opus 모델과 GPT-6 Sol, GPT-5.6 Sol을 앞질렀고, 오프라인과 온라인 분석 모두에서 같은 작업의 비용을 Opus 4.8 대비 20% 줄였다. Databricks는 Opus 5.5를 코딩의 일상 기본 모델로 권하고 있다.

Databricks가 시험한 모든 오프라인 벤치마크와 관측된 온라인 사용에서 GPT-6 Luna의 작업당 비용은 Opus 5.5보다 최소 20배 낮았다. 가장 어려운 평가 스위트 가운데 하나에서는 Luna가 Opus 4.6과 대략 비슷한 수준을 보이면서, 당시 Opus 4.6보다 작업당 비용이 99.3% 낮았다. Wendell은 이를 약 9개월 동안 비용이 약 100분의 1로 줄어든 결과라고 설명했다. 그는 Luna 품질에 대한 이 결과가 예비 단계이며, Databricks가 더 넓은 오프라인·온라인 테스트에서 계속 평가하고 있다고 밝혔다.

프로덕션 환경에서는 Unity Gateway로 워크로드를 모델 사이에 라우팅하고 에이전트 상호작용을 추적했다. 최종 사용자가 쓴 harness에는 Omingent, Claude Code, Codex, Cursor가 포함됐다.