UT Austin の研究、トークンを削るコンテキスト圧縮がコーディングエージェントを遅くする可能性
UT Austin によるコーディングエージェントのコンテキスト圧縮に関する研究は、SWE-bench Verified と Terminal-Bench で約 35,000 回のエージェント実行を行った。研究では、コンテキストの圧縮方法、圧縮の発動タイミング、削除量という 3 つの決定を別々に変えた。elvis の報告によると、Qwen を使う Terminal-Bench では、約 3 分の 1 のトークンを使うポリシーが、完全なコンテキストを保持する場合より 20% から 80% 長くかかることがある。
ステップで発動するポリシーは 1 ステップあたりのトークン削減量が最大だが、モデル呼び出しが 10% から 27% 多く必要になる。しきい値で発動するポリシーはトークンを 22% から 55% 削減し、呼び出し回数は完全なコンテキストに近い。結果はモデルによっても異なる。elvis によると、Qwen でうまく機能するポリシーは Devstral を 38.7% まで落とし、遅くするため、ポリシーを選ぶ前に各モデルでレイテンシとコストを測定すべきだ。論文は Beyond Token Savings: A Systematic Study of Context Compression in LLM Agents。