Did Codex Reset
GitHub

QQ·微信群

UT Austin 研究發現,削減 token 的上下文壓縮可能拖慢編碼智能體

elvis

UT Austin 一項關於編碼智能體上下文壓縮的研究,在 SWE-bench Verified 和 Terminal-Bench 上進行了近 35,000 次智能體運行。研究分別改變三個決策:上下文如何壓縮、壓縮何時觸發,以及壓縮掉多少內容。elvis 報告稱,在 Qwen 的 Terminal-Bench 上,使用約三分之一 token 的策略,耗時可能比保留完整上下文多 20% 至 80%。

按步觸發的策略每步削減的 token 最多,但需要多 10% 至 27% 的模型呼叫。閾值觸發的策略削減 22% 至 55% 的 token,呼叫次數接近保留完整上下文。結果也因模型而異:elvis 表示,一個對 Qwen 效果很好的策略,會使 Devstral 降到 38.7% 並變慢,因此選擇策略前應針對每個模型量度延遲和成本。論文是 Beyond Token Savings: A Systematic Study of Context Compression in LLM Agents。