Tencent Hy 將臨界批次大小理論延伸至線上 LLM 強化學習
Tencent Hy 的線上 LLM 強化學習研究重訪經典臨界批次大小理論,並將其延伸至模型自行生成訓練數據,以及 rollout 生成與訓練以不同方式擴展的設定。
在 GRPO 與 PPO 中,Tencent Hy 發現,於有限的批次大小範圍內重新調整學習率,可維持每個回應的學習效果。在固定硬件上,加大批次可將 PPO 生成階段吞吐量最高提升 2.29 倍;其實測最佳的 GRPO 配置達到同一驗證目標的時間少 29%。
Tencent Hy 的線上 LLM 強化學習研究重訪經典臨界批次大小理論,並將其延伸至模型自行生成訓練數據,以及 rollout 生成與訓練以不同方式擴展的設定。
在 GRPO 與 PPO 中,Tencent Hy 發現,於有限的批次大小範圍內重新調整學習率,可維持每個回應的學習效果。在固定硬件上,加大批次可將 PPO 生成階段吞吐量最高提升 2.29 倍;其實測最佳的 GRPO 配置達到同一驗證目標的時間少 29%。