UT Austin 연구, 토큰을 줄이는 컨텍스트 압축이 코딩 에이전트를 느리게 할 수 있어
UT Austin의 코딩 에이전트 컨텍스트 압축 연구는 SWE-bench Verified와 Terminal-Bench에서 약 35,000회의 에이전트 실행을 수행했다. 연구는 컨텍스트 압축 방식, 압축 발동 시점, 삭제량이라는 세 가지 결정을 각각 달리했다. elvis는 Qwen을 사용한 Terminal-Bench에서 약 3분의 1의 토큰을 쓰는 정책이 전체 컨텍스트를 유지할 때보다 20%에서 80% 더 오래 걸릴 수 있다고 보고했다.
스텝 트리거 정책은 스텝당 토큰을 가장 많이 줄이지만 모델 호출이 10%에서 27% 더 필요하다. 임계값 트리거 정책은 토큰을 22%에서 55% 줄이고, 호출 횟수는 전체 컨텍스트에 가깝다. 결과는 모델에 따라도 다르다. elvis에 따르면 Qwen에서 잘 작동하는 정책은 Devstral을 38.7%로 떨어뜨리고 더 느리게 만든다. 따라서 정책을 고르기 전에 각 모델에서 지연 시간과 비용을 측정해야 한다. 논문은 Beyond Token Savings: A Systematic Study of Context Compression in LLM Agents이다.