Did Codex Reset
GitHub

QQ·微信群

Salesforce AI Research 審核最乾淨的公開終端代理 RL 資料集,僅 35.8% 通過

DAIR.AI

Salesforce AI Research 審核了面向終端代理的公開強化學習資料集。最乾淨的資料集中,只有 35.8% 的環境通過。另外兩個公開資料集的乾淨比例分別為 10.1% 和 3.3%。審核發現雙向獎勵錯誤:部分環境在未完成任務的情況下,因複製外洩答案或通過薄弱驗證器而給予獎勵 1;另一些環境則因參考答案或 oracle 有誤,把正確解法評為獎勵 0。

作者提出的方法 RIVER 會過濾有缺陷的環境,並懲罰以幾乎相同輸出重複先前指令的回合。他們認為,RL 主要塑造預訓練和 SFT 中已經學到的行為,包括行動前先檢查、完成前先驗證,以及放棄持續失敗的做法。

在環境預算維持 3.5K 的情況下,River-8B 在四項終端基準測試的平均分為 19.4,而從同一資料集隨機抽取 3.5K 個環境進行 RL 的平均分為 17.7。在作者評估的公開 RL 訓練 8B 模型中,River-8B 在全部四項基準測試都最好。他們報告,在 2B 至 27B 的模型上,並使用少於 TMax 30% 的環境時,RIVER 把 Terminal-Bench-Lite 上的 RL 增益提高 106%,把 Terminal-Bench v2.1 上的增益提高 30%。論文為 Learning generalizable behaviors for terminal agents。