Did Codex Reset
GitHub

QQ·微信群

Tencent Hy 将临界批量大小理论扩展到在线 LLM 强化学习

Tencent Hy

Tencent Hy 的在线 LLM 强化学习研究重新审视了经典临界批量大小理论,并将其扩展到模型自行生成训练数据、且 rollout 生成与训练扩展方式不同的场景。

在 GRPO 与 PPO 上,Tencent Hy 发现重新调整学习率可以在有界的批量大小范围内保持单条回复的学习量。在固定硬件上,增大批量最多可将 PPO 生成阶段吞吐量提升 2.29 倍,而其测得的最佳 GRPO 配置达到同一验证目标的时间减少 29%。