# エージェントハーネスのプロンプトとツール簡素化でコストを最大3倍削減、研究で判明

SWE-bench Verified上で同一モデルを用いClaude Code、mini-SWE-agent、OpenCodeを比較した研究によると、ハーネスのプロンプトとツールのスキーマを最小限に抑えることで、精度を落とさずにコストを最大3倍削減できることが分かった。

Language: ja
Time zone: Asia/Tokyo

HTML: https://didcodexreset.com/ja/news/4170bf189ce541aa9635194f.html

Content language: ja
Localization state: translated

出典：DAIR.AI · 2026/10/8 05:03:16 公開

ある[研究論文](https://academy.dair.ai/papers/what-does-a-harness-buy-tokens-mostly-2610.04433)は、基盤となるモデルを固定した状態でエージェントハーネスを変更することが性能にどう影響するかを評価し、SWE-bench Verifiedの447タスクにおいてClaude Code、mini-SWE-agent、OpenCodeをテストした。Claude Codeとmini-SWE-agentのスコア差は5ポイント以内にとどまり、ハーネスの変更による結果の違いは同一ハーネスを再実行した場合とほぼ同程度で、45タスクの高難度サブセットではいずれも13%のタスクで結果が変化した。

この研究結果は、ハーネスのシステムプロンプトやツールスキーマをコンパクトに保つことで、精度を損なうことなくトークンコストを最大3倍削減できることを示している。コスト差が生じた要因は、各ステップでシステムプロンプトとツール定義が再送信され、エージェントの実行ステップが長くなるにつれて累積トークン使用量が急増したことにある。

Tags: SWE-bench, AIエージェント, Claude Code, ベンチマーク

[元の投稿を見る](https://x.com/dair_ai/status/2107920656788767098)
