Did Codex Reset
GitHub

#grpo

모든 AI 뉴스 보기
TGRSS 피드총 1건

Tencent Hy, 임계 배치 크기 이론을 온라인 LLM RL로 확장

Tencent Hy는 학습률 재조정이 GRPO와 PPO에서 일정 범위의 배치 크기에 걸쳐 응답당 학습량을 유지할 수 있다고 밝혔다. 고정된 하드웨어에서 배치 크기를 키우면 PPO 생성 단계 처리량이 최대 2.29배 개선되며, 측정된 최적 GRPO 구성은 같은 검증 목표에 29% 더 짧은 시간에 도달한다.