Did Codex Reset
GitHub

QQ·微信群

研究發現精簡 Agent 框架提示詞與工具最多可降低 3 倍成本

DAIR.AI

一篇研究論文評估了在底層模型維持不變的情況下,更換 Agent 運行框架對性能的影響,測試涵蓋了 Claude Code、mini-SWE-agent 和 OpenCode 在 SWE-bench Verified 上的 447 個任務。Claude Code 與 mini-SWE-agent 的成績差距在 5 分以內;更換框架對結果的影響幅度與重複運行同一框架大致相當,兩者在包含 45 個任務的高難度子集中均改變了 13% 任務的結果。

研究結果顯示,保持框架系統提示詞和工具定義精簡,可在不損害準確率的情況下將 Token 成本最高削減 3 倍。成本差異的主要原因在於系統提示詞和工具定義會在每一步中被重複發送,隨著 Agent 運行軌跡拉長,累積的 Token 用量呈倍數增加。