Sonnet 5.5 在 Ibragim 的 my-mini-bench 上與 Opus 5.5 High 成績相同,耗時和成本更低
Ibragim 在 my-mini-bench 上比較了 Claude Sonnet 5.5 與 Opus 5.5 High,任務來自他自己的工作:數據轉換、前端、重構,以及運行任務評測。測試設置為 10 項任務各運行 3 次,推理級別為 High,環境是透過 harbor 使用的 pi-agent 和 Claude Code。
在 pi 中,Sonnet 5.5 與 Opus 5.5 High 均通過 30 次運行中的 30 次。Sonnet 5.5 平均每項任務耗時 46 秒、花費 0.10 美元,Opus 5.5 High 為 103 秒、0.30 美元,大約快 2.2 倍、便宜約 3 倍。
相對 pi 中的 Sonnet 5,Sonnet 5.5 的通過數從 30 次中的 25 次升至 30 次,輪次從 12.7 降至 4.3,輸出 token 從 17.7k 降至 6.5k。Ibragim 表示,軌跡顯示它在讀取檔案、編寫程式碼和測試上採用了不同做法。他說該基準已經飽和,他用它來尋找仍能完成自己任務、同時更便宜、更快的配置。