Harness-Aware Distillationにより小型モデルエージェントのALFWorld成功率が63.4%に向上
arXiv論文によると、研究チームは実行ハーネスとともに動作する小型言語モデルエージェント向けフレームワーク「Harness-Aware Distillation」を発表した。この手法は、同一の教師モデルに対してハーネス情報の有無両方の条件で問い合わせを行い、ハーネスデータが存在するときに選ばれた行動を生徒モデルが優先して選択するよう訓練する。フィルター機能により、優先行動がハーネスの記録と矛盾する候補ペアは除外され、タスク報酬や成功ラベルなしで動作する。
研究チームの観察によると、オンポリシー蒸留にハーネスデータを単に追加するだけでは、ALFWorldにおける生徒モデルのハーネス利用率は65.7%から73.1%に上昇したものの、タスク成功率は43.1%〜43.5%と横ばいにとどまった。一方、Harness-Aware Distillationを適用した生徒モデルは、未知のALFWorldタスクで63.4%の成功率を達成し、最高ベースラインの47.0%および8Bの教師モデルを上回った。また、訓練済み生徒モデルは行き詰まり(stall)の59.7%を回避できたのに対し、ベースラインは未訓練生徒ベースラインの46.8%付近にとどまった。