Did Codex Reset
GitHub

Arena.ai, Code·Work·Chat 부문 Agent Arena 순위 공개

Arena.ai

Arena.ai는 2026년 10월 5일 기준 Agent Arena 부문별 순위를 공개하고, Code, Work, Chat 전반에 걸친 에이전트 문제 해결 성능을 평가했다. 이 순위는 실제 작업에서 수집한 실시간 실행 추적 기록을 활용해 현재 최첨단 기준 대비 순수 개선도를 측정한다.

모든 카테고리에서 Anthropic 모델이 1위를 차지했다. Claude Fable 5.1 (Max)는 Code와 Work 부문 1위, Chat 부문 2위를 기록했다. Claude Sonnet 5.5 (Max)는 Chat 부문에서 1위에 올랐으며, Code에서 4위, Work에서 5위를 차지했다.

OpenAI의 GPT 6 Astra (Max)는 3개 카테고리 모두에서 상위 4위 안에 들었으며, Code 부문 2위, Work와 Chat 부문에서 각각 4위를 기록했다. Arena.ai는 Code와 Work 순위의 일치도가 Chat보다 높다고 언급했다. 예를 들어 Gemini 4 Argon (High)는 Code에서 14위, Work에서 12위를 기록했으나 Chat에서는 5위에 올랐다.