# CoreWeave, 강화학습 환경에서 실시간 모델 가중치 업데이트 지원하는 RL Rollouts 발표

CoreWeave가 강화학습 진행 중 처리 중인 요청을 중단하지 않고 가동 중인 추론 배포에 새 모델 가중치를 직접 로드하는 인프라 기능인 RL Rollouts를 발표했다. NVIDIA와 You.com은 웹 검색용 Nemotron 3.5 Lightning의 사후 학습에 이 기능을 활용했다.

Language: ko
Time zone: Asia/Seoul

HTML: https://didcodexreset.com/ko/news/7d272fee56214976873cd673.html

Content language: ko
Localization state: translated

출처: CoreWeave · 2026. 10. 7. 04:28:58 게시

CoreWeave는 강화학습 훈련 루프의 지연 시간을 줄이기 위해 RL Rollouts를 출시했다. 이 시스템은 각 체크포인트마다 재배포하고 트레이너를 일시 중지하는 대신, 진행 중인 요청을 방해하지 않고 가동 중인 배포 환경에 새 가중치를 로드하여 표준 재배포 주기보다 약 15배 빠르게 작동한다.

NVIDIA와 You.com은 웹 검색용 Nemotron 3.5 Lightning 사후 학습에 RL Rollouts를 사용했다. CoreWeave의 [분석 보고서](https://crwv.co/utdYc)에 따르면, 이 워크플로를 통해 도구 호출을 30.24% 줄이면서 BrowseComp 정확도를 36.97%에서 45.45%로 끌어올렸다.

Tags: CoreWeave, 강화학습, NVIDIA, Nemotron

[원문 게시물 보기](https://x.com/CoreWeave/status/2107552496512094239)
