Did Codex Reset
GitHub

#harness-learning

모든 AI 뉴스 보기
TGRSS 피드총 1건

CMU 논문, 솔버를 바꾸지 않고 에이전트 하네스를 편집하는 4B 제안 모델 훈련

이 하네스 학습 논문은 강화 학습으로 제안 모델이 과제, 현재 하네스, 실행 보고서를 바탕으로 하네스 코드를 수정하도록 한다. 훈련된 4B 제안 모델은 Reasoning Gym 단일 단계 수정에서 35B 교사 모델을 능가하며, HotpotQA 훈련은 MuSiQue와 2WikiMultihopQA로 전이된다.