가장 깨끗한 공개 터미널 에이전트 RL 컬렉션 중 Salesforce AI Research 감사를 통과한 비율은 35.8%뿐
Salesforce AI Research는 터미널 에이전트용 공개 강화학습 컬렉션을 감사했다. 가장 깨끗한 컬렉션의 환경 중 35.8%만 통과했다. 다른 공개 컬렉션 두 곳은 깨끗한 비율이 10.1%와 3.3%였다. 감사에서는 양방향 보상 오류가 확인됐다. 일부 환경은 유출된 답을 베끼거나 과제를 수행하지 않고 약한 검증기만 통과해도 보상 1을 주고, 다른 환경은 참조 답이나 오라클이 틀려 올바른 해법에 보상 0을 준다.
저자들의 방법 RIVER는 결함 있는 환경을 걸러내고, 이전 명령과 거의 같은 출력을 반복하는 턴에 페널티를 준다. 이들은 RL이 주로 사전학습과 SFT에서 이미 학습한 행동을 다듬는다고 주장한다. 여기에는 행동 전 점검, 종료 전 검증, 계속 실패하는 접근의 포기가 포함된다.
예산을 3.5K 환경으로 고정했을 때 River-8B는 네 개 터미널 벤치마크에서 평균 19.4를 기록해, 같은 컬렉션에서 무작위로 뽑은 3.5K 환경으로 RL을 진행한 경우의 17.7과 비교됐다. 저자들이 평가한 공개 RL 학습 8B 모델 가운데 River-8B가 네 벤치마크 모두에서 가장 좋았다. 2B부터 27B 모델에 걸쳐 TMax 환경의 30% 미만을 쓰면서, 이들은 RIVER가 Terminal-Bench-Lite에서 RL 이득을 106%, Terminal-Bench v2.1에서 30% 늘린다고 보고한다. 논문은 Learning generalizable behaviors for terminal agents이다.