Did Codex Reset
GitHub

Arena.ai, Agent Arena에서 GPT-6 Luna(Max)를 23위로 평가

Arena.ai

Arena.ai는 GPT-6 Luna(Max)를 Agent Arena 23위에 올렸으며, 8,000건의 실제 에이전트 세션에서 순개선은 +1.6%다. 이 모델은 파레토 프론티어에 있지 않다. 작업당 중앙값 비용은 $0.05로, GPT-6 Sol(Max)의 $0.82보다 94%, GPT-6 Astra(Max)의 $2.59보다 98% 낮다.

순개선 점수는 22위 GPT 5.5와 0.09퍼센트포인트 이내이며, 중앙값 비용은 그 모델의 작업당 $0.56보다 91% 낮다. −0.9%로 29위인 GPT-5.6 Luna(xHigh)와 비교하면 순위가 6계단 올랐다. Arena.ai가 제시한 GPT-6 Luna의 GPT-5.6 Luna 대비 가장 뚜렷한 향상은 Confirmed Success가 33위 −4.6% 대비 17위 +4.6%, Bash Recovery가 27위 +2.2% 대비 21위 +4.2%다.