# CoreWeave 推出 RL Rollouts，支援強化學習中的即時模型權重更新

CoreWeave 推出基礎設施功能 RL Rollouts。該功能可在強化學習過程中直接將新模型權重載入至運作中的推論部署，且不會中斷進行中的請求。NVIDIA 與 You.com 已使用該功能對用於網絡搜尋的 Nemotron 3.5 Lightning 進行後訓練。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/7d272fee56214976873cd673.html

Content language: zh-HK
Localization state: translated

來源：CoreWeave · 發布於 7/10/2026 03:28:58

CoreWeave 推出 RL Rollouts，以減少強化學習訓練循環中的延遲。該系統無需在每個檢查點重新部署並暫停訓練器，而是直接將新權重載入至運作中的部署，且不會中斷正在進行的請求，運作速度約為標準重新部署週期的 15 倍。

NVIDIA 與 You.com 使用 RL Rollouts 對用於網絡搜尋的 Nemotron 3.5 Lightning 進行後訓練。根據 CoreWeave 的[詳細分析](https://crwv.co/utdYc)，該工作流程將 BrowseComp 準確率由 36.97% 提升至 45.45%，同時減少了 30.24% 的工具調用。

Tags: CoreWeave, 強化學習, NVIDIA, Nemotron

[查看主帖原文](https://x.com/CoreWeave/status/2107552496512094239)
