Did Codex Reset
GitHub

Sonnet 5.5、Ibragim の my-mini-bench で Opus 5.5 High と同等、時間とコストはより低い

Pi

Ibragim は my-mini-bench で Claude Sonnet 5.5 と Opus 5.5 High を比較した。タスクは自身の作業から取り、データ変換、フロントエンド、リファクタリング、タスク評価の実行が含まれる。設定は 10 タスクを各 3 回、推論レベルは High で、harbor 経由の pi-agent と Claude Code で実行した。

pi では、Sonnet 5.5 と Opus 5.5 High がいずれも 30 回中 30 回を通過した。Sonnet 5.5 の平均はタスクあたり 46 秒、0.10 ドルで、Opus 5.5 High は 103 秒、0.30 ドルだった。およそ 2.2 倍速く、約 3 倍安い。

pi の Sonnet 5 と比べ、Sonnet 5.5 は通過数が 30 回中 25 回から 30 回へ、ターン数が 12.7 から 4.3 へ、出力トークンが 17.7k から 6.5k へ変わった。Ibragim によると、軌跡はファイルの読み取り、コードの記述、テストへの取り組み方が異なることを示している。彼は、このベンチマークはすでに飽和しており、自分のタスクを完了しつつ、より安く速い構成を見つけるために使っていると述べている。