Did Codex Reset
GitHub

#grpo

すべてのAIニュースを見る

Tencent Hy、クリティカルバッチサイズ理論をオンラインLLM強化学習へ拡張

Tencent Hyによると、学習率の再調整により、GRPOとPPOの双方で、一定範囲のバッチサイズにわたって応答あたりの学習量を維持できる。固定ハードウェアでは、バッチサイズを大きくするとPPOの生成段階のスループットが最大2.29倍向上し、測定上最良のGRPO構成は同じ検証目標に29%短い時間で到達した。