Did Codex Reset
GitHub

#tencent-hy

모든 AI 뉴스 보기
TGRSS 피드총 4건

Tencent Hy, 임계 배치 크기 이론을 온라인 LLM RL로 확장

Tencent Hy는 학습률 재조정이 GRPO와 PPO에서 일정 범위의 배치 크기에 걸쳐 응답당 학습량을 유지할 수 있다고 밝혔다. 고정된 하드웨어에서 배치 크기를 키우면 PPO 생성 단계 처리량이 최대 2.29배 개선되며, 측정된 최적 GRPO 구성은 같은 검증 목표에 29% 더 짧은 시간에 도달한다.