Did Codex Reset
GitHub

QQ·微信群

CMU 論文訓練 4B 提案模型編輯智能體 harness,唔改求解器

elvis

CMU 一篇論文 Harness Learning Enables Generalizable Test-Time Adaptation 用強化學習訓練提案模型,透過編輯智能體嘅 harness 代碼,而唔係改變求解器模型嘅權重嚟改進智能體。

提案模型讀取任務、當前 harness 同執行報告,然後寫出代碼編輯。佢嘅獎勵係修訂後 harness 嘅得分,求解器模型保持不變。

訓練後嘅 4B 提案模型喺 Reasoning Gym 單步修訂上超越其 35B 教師模型,包括訓練中從未見過嘅任務族。喺 HotpotQA 上訓練嘅提案模型能夠喺 MuSiQue 同 2WikiMultihopQA 上持續改進 harness。