Did Codex Reset
GitHub

#reinforcement-learning

모든 AI 뉴스 보기
TGRSS 피드총 3건

가장 깨끗한 공개 터미널 에이전트 RL 컬렉션 중 Salesforce AI Research 감사를 통과한 비율은 35.8%뿐

Salesforce AI Research는 양방향 보상 오류를 확인한 뒤 해당 컬렉션의 깨끗한 비율을 35.8%, 다른 두 컬렉션은 10.1%와 3.3%로 제시했다. 저자들은 결함 환경을 걸러내는 RIVER가 TMax 환경의 30% 미만을 쓰면서도 Terminal-Bench-Lite에서 RL 이득을 106%, Terminal-Bench v2.1에서 30% 늘린다고 말한다.

NVIDIA의 Skill2Env, 공개 Agent Skills를 7,971개 터미널 작업으로 컴파일

Codex 플래너와 크리에이터가 각 스킬을, 그 스킬 자체의 품질 기준에서 가져온 루브릭을 사용해 테스트된 터미널 워크플로로 바꾼다. 결과만 반영한 RL은 Terminal-Bench 2.1에서 Qwen3.8-27B를 49.4%에서 54.1%로 올렸고, 루브릭을 추가하면 50.1%에 그쳤지만 궤적 비교에서는 더 많이 앞섰다.