Did Codex Reset
GitHub

CMU 논문, 솔버를 바꾸지 않고 에이전트 하네스를 편집하는 4B 제안 모델 훈련

elvis

CMU 논문 Harness Learning Enables Generalizable Test-Time Adaptation은 솔버 모델의 가중치를 바꾸는 대신 에이전트의 하네스 코드를 편집해 에이전트를 개선하는 제안 모델을 강화 학습으로 훈련한다.

제안 모델은 과제, 현재 하네스, 실행 보고서를 읽고 코드 편집을 작성한다. 보상은 수정된 하네스의 점수이며, 솔버 모델은 고정된 채로 유지된다.

훈련된 4B 제안 모델은 Reasoning Gym 단일 단계 수정에서 35B 교사 모델을 능가하며, 훈련에서 본 적 없는 과제군도 포함한다. HotpotQA에서 훈련된 제안 모델은 MuSiQue와 2WikiMultihopQA에서 하네스를 계속 개선한다.