最干净的公开终端智能体 RL 集合中,仅 35.8% 通过 Salesforce AI Research 审计
Salesforce AI Research 将该集合的干净比例定为 35.8%,另外两个分别为 10.1% 和 3.3%,并发现两个方向的奖励错误。作者称,用于过滤缺陷环境的 RIVER 在使用不到 TMax 30% 环境的情况下,使 Terminal-Bench-Lite 上的 RL 增益提高 106%,Terminal-Bench v2.1 上提高 30%。
Salesforce AI Research 将该集合的干净比例定为 35.8%,另外两个分别为 10.1% 和 3.3%,并发现两个方向的奖励错误。作者称,用于过滤缺陷环境的 RIVER 在使用不到 TMax 30% 环境的情况下,使 Terminal-Bench-Lite 上的 RL 增益提高 106%,Terminal-Bench v2.1 上提高 30%。