最干净的公开终端智能体 RL 集合中,仅 35.8% 通过 Salesforce AI Research 审计
Salesforce AI Research 审计了面向终端智能体的公开强化学习集合。最干净的集合中,仅有 35.8% 的环境通过。另外两个公开集合的干净比例分别为 10.1% 和 3.3%。审计发现奖励错误存在于两个方向:有些环境会在复制泄露答案、或未完成任务却通过薄弱验证器时给出奖励 1;另一些环境则因参考答案或 oracle 有误,给正确解打出奖励 0。
作者的方法 RIVER 会过滤缺陷环境,并惩罚重复先前命令且输出几乎相同的回合。他们认为,RL 主要塑造预训练和 SFT 中已经学到的行为,包括行动前检查、结束前验证,以及放弃持续失败的做法。
在环境预算固定为 3.5K 的条件下,River-8B 在四项终端基准上的平均分为 19.4,而从同一集合随机抽取 3.5K 个环境进行 RL 的平均分为 17.7。在作者评估的开源 RL 训练 8B 模型中,River-8B 在全部四项基准上均为最佳。他们报告,在 2B 到 27B 的模型上,使用不到 TMax 30% 的环境时,RIVER 使 Terminal-Bench-Lite 上的 RL 增益提高 106%,Terminal-Bench v2.1 上提高 30%。论文为 为终端智能体学习可泛化行为。