Did Codex Reset
GitHub

Tencent Hy, 임계 배치 크기 이론을 온라인 LLM RL로 확장

Tencent Hy

Tencent Hy의 온라인 LLM 강화학습 연구는 고전적인 임계 배치 크기 이론을 다시 살펴보고, 모델이 자체 학습 데이터를 생성하며 롤아웃 생성과 학습의 확장 방식이 서로 다른 설정으로 이를 확장한다.

GRPO와 PPO 전반에서 Tencent Hy는 학습률 재조정이 일정 범위의 배치 크기에 걸쳐 응답당 학습량을 유지할 수 있음을 확인했다. 고정된 하드웨어에서 배치 크기를 키우면 PPO 생성 단계 처리량이 최대 2.29배 개선되고, 측정된 최적 GRPO 구성은 같은 검증 목표에 29% 더 짧은 시간에 도달한다.