Tencent Hy 将临界批量大小理论扩展到在线 LLM 强化学习
Tencent Hy 表示,重新调整学习率可以在有界的批量大小范围内,使 GRPO 与 PPO 的单条回复学习量保持不变。在固定硬件上,增大批量最多可将 PPO 生成阶段吞吐量提升 2.29 倍;其测得的最佳 GRPO 配置达到同一验证目标的时间减少 29%。
Tencent Hy 表示,重新调整学习率可以在有界的批量大小范围内,使 GRPO 与 PPO 的单条回复学习量保持不变。在固定硬件上,增大批量最多可将 PPO 生成阶段吞吐量提升 2.29 倍;其测得的最佳 GRPO 配置达到同一验证目标的时间减少 29%。