CMUの論文、ソルバーを変えずにエージェントのハーネスを編集する4B提案モデルを訓練
このハーネス学習論文は強化学習を用いて、提案モデルがタスク、現在のハーネス、実行レポートからハーネスコードを修正する。訓練された4B提案モデルはReasoning Gymの単一ステップ改訂で35B教師モデルを上回り、HotpotQAでの訓練はMuSiQueと2WikiMultihopQAに転移する。
このハーネス学習論文は強化学習を用いて、提案モデルがタスク、現在のハーネス、実行レポートからハーネスコードを修正する。訓練された4B提案モデルはReasoning Gymの単一ステップ改訂で35B教師モデルを上回り、HotpotQAでの訓練はMuSiQueと2WikiMultihopQAに転移する。