Did Codex Reset
GitHub

Sonnet 5.5, Ibragim의 my-mini-bench에서 Opus 5.5 High와 같은 성적, 시간과 비용은 더 낮아

Pi

Ibragim은 my-mini-bench에서 Claude Sonnet 5.5와 Opus 5.5 High를 비교했다. 작업은 자신의 업무에서 가져왔으며 데이터 변환, 프론트엔드, 리팩터링, 작업 평가 실행이 포함된다. 설정은 작업 10개를 각각 3회 실행하고 추론 수준은 High이며, harbor를 통한 pi-agent와 Claude Code에서 진행했다.

pi에서 Sonnet 5.5와 Opus 5.5 High는 모두 30회 중 30회를 통과했다. Sonnet 5.5는 작업당 평균 46초, 0.10달러였고 Opus 5.5 High는 103초, 0.30달러로, 약 2.2배 빠르고 약 3배 저렴했다.

pi의 Sonnet 5와 비교하면 Sonnet 5.5는 통과 횟수가 30회 중 25회에서 30회로, 턴 수가 12.7에서 4.3으로, 출력 토큰이 17.7k에서 6.5k로 바뀌었다. Ibragim은 궤적이 파일 읽기, 코드 작성, 테스트에 대한 다른 접근을 보여 준다고 말한다. 그는 이 벤치마크가 이미 포화됐으며, 자신의 작업을 완료하면서도 더 저렴하고 빠른 구성을 찾는 데 쓴다고 말한다.