Did Codex Reset
GitHub

NVIDIA의 Skill2Env, 공개 Agent Skills를 7,971개 터미널 작업으로 컴파일

DAIR.AI

NVIDIA의 Skill2Env는 공개된 각 Agent Skill을 강화학습용 실행 가능 터미널 작업으로 컴파일한다. Codex 플래너는 SKILL.md 번들을 읽고 관련 공개 자료를 조사한 뒤 스킬을 워크플로로 나눈다. 이어서 Codex 크리에이터가 프로그램 방식의 테스트와 해당 스킬 자체의 품질 기준에서 가져온 행동 루브릭으로 각 작업을 만든다.

약 3,400개의 크롤링된 스킬에서 파이프라인은 13개 영역에 걸쳐 7,971개 작업을 만들었으며, 소프트웨어 엔지니어링은 전체의 4분의 1 미만이다. GPT-5.6 Sol로 생성하는 데 API 사용 비용이 9만 달러를 넘었다. 관련 글은 Skill2Env 논문이다.

결과만 반영한 RL을 300단계 진행한 뒤 Qwen3.8-27B는 Terminal-Bench 2.1에서 49.4%에서 54.1%로, 직접 검증한 홀드아웃 벤치마크 S2EBench의 pass@1에서는 33.4%에서 37.7%로 올랐다. 보상에 루브릭을 더하면 벤치마크 상승 폭은 더 작아 Terminal-Bench 2.1에서 50.1%였다. 원본 SKILL.md가 주어진 상태에서 심사자는 작업의 73.0%에서 루브릭으로 학습한 모델의 궤적을 기본 모델보다 선호했고, 결과만 반영한 모델은 54.5%였다.