Did Codex Reset
GitHub

QQ·微信群

Sonnet 5.5 在 Ibragim 的 my-mini-bench 上与 Opus 5.5 High 成绩相同,耗时和成本更低

Pi

Ibragim 在 my-mini-bench 上比较了 Claude Sonnet 5.5 与 Opus 5.5 High,任务来自他自己的工作:数据转换、前端、重构,以及运行任务评测。测试设置为 10 项任务各运行 3 次,推理级别为 High,环境是通过 harbor 使用的 pi-agent 和 Claude Code。

在 pi 中,Sonnet 5.5 与 Opus 5.5 High 均通过 30 次运行中的 30 次。Sonnet 5.5 平均每项任务耗时 46 秒、花费 0.10 美元,Opus 5.5 High 为 103 秒、0.30 美元,大约快 2.2 倍、便宜约 3 倍。

相对 pi 中的 Sonnet 5,Sonnet 5.5 的通过数从 30 次中的 25 次升至 30 次,轮次从 12.7 降至 4.3,输出 token 从 17.7k 降至 6.5k。Ibragim 表示,轨迹显示它在读取文件、编写代码和测试上采用了不同做法。他说该基准已经饱和,他用它来寻找仍能完成自己任务、同时更便宜、更快的配置。