# CoreWeave 推出 RL Rollouts，支持强化学习中的实时模型权重更新

CoreWeave 推出基础设施功能 RL Rollouts。该功能可在强化学习过程中将新模型权重直接加载到运行中的推理部署中，且不会中断正在处理的请求。NVIDIA 和 You.com 已使用该功能对用于网络搜索的 Nemotron 3.5 Lightning 进行了后训练。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/7d272fee56214976873cd673.html

Content language: zh-CN
Localization state: translated

来源：CoreWeave · 发布于 2026/10/7 03:28:58

CoreWeave 推出 RL Rollouts，以降低强化学习训练循环中的延迟。该系统无需在每个检查点重新部署并暂停训练器，而是直接将新权重加载到运行中的部署中，且不会中断正在进行的请求，运行速度约为标准重新部署周期的 15 倍。

NVIDIA 和 You.com 使用 RL Rollouts 对用于网络搜索的 Nemotron 3.5 Lightning 进行了后训练。据 CoreWeave 的[分析说明](https://crwv.co/utdYc)，该工作流程将 BrowseComp 准确率从 36.97% 提升至 45.45%，同时将工具调用次数减少了 30.24%。

Tags: CoreWeave, 强化学习, NVIDIA, Nemotron

[查看主帖原文](https://x.com/CoreWeave/status/2107552496512094239)
