Tencent Hy, 임계 배치 크기 이론을 온라인 LLM RL로 확장
Tencent Hy는 학습률 재조정이 GRPO와 PPO에서 일정 범위의 배치 크기에 걸쳐 응답당 학습량을 유지할 수 있다고 밝혔다. 고정된 하드웨어에서 배치 크기를 키우면 PPO 생성 단계 처리량이 최대 2.29배 개선되며, 측정된 최적 GRPO 구성은 같은 검증 목표에 29% 더 짧은 시간에 도달한다.
Tencent Hy는 학습률 재조정이 GRPO와 PPO에서 일정 범위의 배치 크기에 걸쳐 응답당 학습량을 유지할 수 있다고 밝혔다. 고정된 하드웨어에서 배치 크기를 키우면 PPO 생성 단계 처리량이 최대 2.29배 개선되며, 측정된 최적 GRPO 구성은 같은 검증 목표에 29% 더 짧은 시간에 도달한다.