# CoreWeaveが強化学習向けにモデル重みをリアルタイム更新する「RL Rollouts」を発表

CoreWeaveは、強化学習中に進行中のリクエストを中断することなく、稼働中の推論デプロイに新しいモデルの重みを直接ロードするインフラ機能「RL Rollouts」を発表した。NVIDIAとYou.comはこの機能を利用し、Web検索向けにNemotron 3.5 Lightningの事後学習を行った。

Language: ja
Time zone: Asia/Tokyo

HTML: https://didcodexreset.com/ja/news/7d272fee56214976873cd673.html

Content language: ja
Localization state: translated

出典：CoreWeave · 2026/10/7 04:28:58 公開

CoreWeaveは、強化学習のトレーニングループにおけるレイテンシを削減するため、RL Rolloutsの提供を開始した。チェックポイントごとに再デプロイしてトレーナーを一時停止する代わりに、処理中のリクエストを中断することなく稼働中のデプロイに新しい重みをロードし、標準的な再デプロイサイクルと比べて約15倍高速に動作する。

NVIDIAとYou.comは、Web検索向けNemotron 3.5 Lightningの事後学習にRL Rolloutsを使用した。CoreWeaveの[分析](https://crwv.co/utdYc)によると、このワークフローによってツール呼び出しが30.24%削減され、BrowseCompの精度が36.97%から45.45%に向上した。

Tags: CoreWeave, 強化学習, NVIDIA, Nemotron

[元の投稿を見る](https://x.com/CoreWeave/status/2107552496512094239)
