AutoCompact 訓練編程智能體決定何時壓縮上下文
AutoCompact 訓練編程智能體決定何時壓縮上下文、保留哪些工作狀態以及如何恢復。評審器會審查基礎智能體的壓縮決策,並在這些決策執行前替換有缺陷的決策。修正後的軌跡用於監督微調,隨後帶任務成功獎勵的強化學習會同時訓練編碼和壓縮。論文發布在 arXiv。
通過率在 SWE-bench Verified 上提高 9.2 點,在 SWE-PolyBench Verified 上提高 5.0 點。即使使用從未溢出的 256K 視窗,這一提升仍然存在,因此當上下文空間不是限制時,學習到的壓縮仍然有幫助。作者將這種主動壓縮稱為模型-執行框架協同設計:執行框架提供壓縮機制,而模型學習何時調用它、保留什麼以及如何繼續。