Adithya S K, 검증 가능한 RL 과제 5,000개 이상을 담은 SmolDataEnvs 공개
SmolDataEnvs는 코드와 데이터 과학 분야에서 소형 모델을 점진적으로 개선하기 위한, 검증 가능한 강화학습 환경 과제 5,000개 이상을 모은 오픈소스 자료다. 이번 공개에는 환경, 평가, 학습 자료가 포함된다.
SmolDataEnvs는 코드와 데이터 과학 분야에서 소형 모델을 점진적으로 개선하기 위한, 검증 가능한 강화학습 환경 과제 5,000개 이상을 모은 오픈소스 자료다. 이번 공개에는 환경, 평가, 학습 자료가 포함된다.
Salesforce AI Research는 양방향 보상 오류를 확인한 뒤 해당 컬렉션의 깨끗한 비율을 35.8%, 다른 두 컬렉션은 10.1%와 3.3%로 제시했다. 저자들은 결함 환경을 걸러내는 RIVER가 TMax 환경의 30% 미만을 쓰면서도 Terminal-Bench-Lite에서 RL 이득을 106%, Terminal-Bench v2.1에서 30% 늘린다고 말한다.
Codex 플래너와 크리에이터가 각 스킬을, 그 스킬 자체의 품질 기준에서 가져온 루브릭을 사용해 테스트된 터미널 워크플로로 바꾼다. 결과만 반영한 RL은 Terminal-Bench 2.1에서 Qwen3.8-27B를 49.4%에서 54.1%로 올렸고, 루브릭을 추가하면 50.1%에 그쳤지만 궤적 비교에서는 더 많이 앞섰다.