最もきれいな公開ターミナルエージェント向けRLコレクションでも、Salesforce AI Researchの監査を通過したのは35.8%
Salesforce AI Researchは、ターミナルエージェント向けの公開強化学習コレクションを監査した。最もきれいなコレクションでも、環境のうち通過したのは35.8%だけだった。ほかの公開コレクション2件のクリーン率は10.1%と3.3%だった。監査では、報酬の誤りが両方向で見つかった。タスクをせずに漏れた解答をコピーしたり、弱い検証器を通過したりするだけで報酬1を与える環境がある一方、参照解答やオラクルが誤っているために正しい解へ報酬0を与える環境もある。
著者らの手法RIVERは、欠陥のある環境を除外し、以前のコマンドをほぼ同じ出力で繰り返すターンにペナルティを与える。彼らの主張では、RLが主に形づけるのは事前学習とSFTですでに身につけた行動であり、行動前の確認、終了前の検証、失敗し続ける方針の放棄が含まれる。
環境数の上限を3.5Kに固定した場合、River-8Bは4つのターミナルベンチマークで平均19.4だった。同じコレクションから無作為に抽出した3.5K環境でのRLは17.7だった。著者が評価した公開のRL学習済み8Bモデルのうち、River-8Bは4つすべてのベンチマークで最も高かった。2Bから27Bまでのモデルについて、TMaxの環境の30%未満を使い、RIVERはTerminal-Bench-LiteでのRLの向上幅を106%、Terminal-Bench v2.1で30%増やすと報告している。論文はLearning generalizable behaviors for terminal agents。