UT Austin 研究发现,削减 token 的上下文压缩可能拖慢编码智能体
UT Austin 一项关于编码智能体上下文压缩的研究,在 SWE-bench Verified 和 Terminal-Bench 上进行了近 35,000 次智能体运行。研究分别改变了三个决策:上下文如何压缩、压缩何时触发,以及压缩掉多少内容。elvis 报告称,在 Qwen 的 Terminal-Bench 上,使用约三分之一 token 的策略,耗时可能比保留完整上下文多 20% 到 80%。
按步触发的策略每步削减的 token 最多,但需要多 10% 到 27% 的模型调用。阈值触发的策略削减 22% 到 55% 的 token,调用次数接近保留完整上下文。结果也因模型而异:elvis 表示,一个对 Qwen 效果很好的策略,会使 Devstral 降到 38.7% 并变慢,因此选择策略前应针对每个模型测量延迟和成本。论文是 Beyond Token Savings: A Systematic Study of Context Compression in LLM Agents。