Tencent Hy 將臨界批次大小理論延伸至線上 LLM 強化學習
Tencent Hy 表示,在有限的批次大小範圍內,重新調整學習率可於 GRPO 與 PPO 中維持每個回應的學習效果。在固定硬件上,加大批次可將 PPO 生成階段吞吐量最高提升 2.29 倍;其實測最佳的 GRPO 配置達到同一驗證目標的時間少 29%。
Tencent Hy 表示,在有限的批次大小範圍內,重新調整學習率可於 GRPO 與 PPO 中維持每個回應的學習效果。在固定硬件上,加大批次可將 PPO 生成階段吞吐量最高提升 2.29 倍;其實測最佳的 GRPO 配置達到同一驗證目標的時間少 29%。