Tencent Hy、クリティカルバッチサイズ理論をオンラインLLM強化学習へ拡張
Tencent HyのオンラインLLM強化学習に関する研究は、古典的なクリティカルバッチサイズ理論を再検討し、モデルが自身の学習データを生成し、ロールアウト生成と学習のスケールが異なる設定へ拡張している。
GRPOとPPOの双方で、Tencent Hyは、学習率の再調整により一定範囲のバッチサイズにわたって応答あたりの学習量を維持できると見いだした。固定ハードウェアでは、バッチサイズを拡大するとPPOの生成段階のスループットが最大2.29倍向上し、測定上最良のGRPO構成は同じ検証目標に29%短い時間で到達した。