Did Codex Reset
GitHub

Artificial Analysis, Claude Sonnet 5.5에 56점…Opus 5.5보다 2점 낮아

Artificial Analysis

Artificial Analysis에 따르면 Anthropic이 Claude Sonnet 5.5를 출시했고, 최대 effort의 Intelligence Index 점수는 56점이었다. Sonnet 5보다 18점 높고 Opus 5.5(최대)보다 2점 낮아 해당 지수에서 2위다.

최대 effort에서 Sonnet 5.5는 Terminal-Bench 4.0에서 64%를 기록했고, Opus 5.5와 GPT-6 Astra는 모두 60%였다. Artificial Analysis는 AA-Briefcase(1811 대 1822 Elo), GDPval-AA(1844 대 1846 Elo), AutomationBench-AA(71% 대 70%)에서도 Opus 5.5와 거의 대등했지만 토큰 사용량은 훨씬 많았다고 보고했다. Intelligence Index 작업당 약 193,000개의 출력 토큰을 사용했는데, 이는 Artificial Analysis가 측정한 최대 규모로 Opus 5.5(최대) 또는 Sonnet 5(최대)보다 약 60% 많고 GPT-6 Astra(최대)의 약 7배다.

AA-Omniscience에서 Sonnet 5.5의 사실 정확도는 54%로 Opus 5.5의 66%보다 낮았고, 환각률은 47%로 Opus 5.5의 59%보다 낮았다. Humanity’s Last Exam과 SciCode에서도 약 6점 낮았다. 토큰 가격은 Sonnet 5와 같아 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며, 캐시 쓰기는 2.50달러, 캐시 읽기는 0.20달러다. Artificial Analysis는 작업당 비용을 7.60달러로 추산해 Sonnet 5보다 약 50% 높다고 했고, 이 모델은 지능 대비 비용 프론티어에서 벗어나 있다고 밝혔다. 더 낮은 effort에서는 GPT-6 Astra 또는 Sol 구성이 더 낮은 비용으로 동등한 성능을 제공하며, 높은 effort 설정은 GPT-6 Sol에 근소하게 뒤지고 작업당 비용은 사실상 같다.

이미지와 텍스트 입력을 지원하는 100만 토큰 컨텍스트 창은 그대로다. 다섯 가지 effort 설정을 시험했으며, Sonnet 5.5는 Intelligence Index 작업의 약 0.1%에서 Sonnet 5로 되돌아갔고 주로 Terminal-Bench 4.0에서 발생했다. 결과는 사전 공개 배포에서 나온 것이며, Anthropic은 구조화 출력 요청의 품질을 떨어뜨리는 버그를 확인했다. Anthropic은 이 버그가 공개 출시에서 수정됐으며, 변화가 아주 작거나 성능이 약간 낮게 평가됐을 것으로 예상한다고 밝혔다. Artificial Analysis는 관련 평가를 다시 실행할 계획이다.