CoreWeave, 강화학습 환경에서 실시간 모델 가중치 업데이트 지원하는 RL Rollouts 발표
CoreWeave는 강화학습 훈련 루프의 지연 시간을 줄이기 위해 RL Rollouts를 출시했다. 이 시스템은 각 체크포인트마다 재배포하고 트레이너를 일시 중지하는 대신, 진행 중인 요청을 방해하지 않고 가동 중인 배포 환경에 새 가중치를 로드하여 표준 재배포 주기보다 약 15배 빠르게 작동한다.
NVIDIA와 You.com은 웹 검색용 Nemotron 3.5 Lightning 사후 학습에 RL Rollouts를 사용했다. CoreWeave의 분석 보고서에 따르면, 이 워크플로를 통해 도구 호출을 30.24% 줄이면서 BrowseComp 정확도를 36.97%에서 45.45%로 끌어올렸다.