Did Codex Reset
GitHub

ActiveSaddler는 에이전트 하네스를 최적화하면서 시나리오를 조정한다

DAIR.AI

ActiveSaddler는 반복되는 실패를 실패 패턴으로 묶고, 각 패턴을 비정상 밴딧의 arm으로 취급한다. 하네스가 각 패턴에서 얼마나 더 배울 수 있는지 추적하고, 알려진 약점을 다시 보는 것과 새로운 약점을 찾는 것 사이에 예산을 나눈다.

DAIR.AI에 따르면 현재 하네스 최적화기는 하네스가 업데이트되는 방식을 바꾸지만 학습 시나리오는 고정해 둔다. 그래서 하네스가 개선될수록 정보가 없어지는 작업에서 계속 피드백을 받는다. ActiveSaddler는 그 시나리오도 조정한다. 동일한 최적화기에서 고정된 시나리오 순서와 비교해 테스트 Pass@1이 GAIA2에서 4.4점, Terminal-Bench 2.0에서 7.5점 향상된다. 논문은 ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization이다.