Did Codex Reset
GitHub

#post-training

모든 AI 뉴스 보기
TGRSS 피드총 1건

Meta Superintelligence Labs 논문이 RL 후학습의 Sharpening Tax(샤프닝 세금)를 설명

42쌍의 베이스 모델과 후학습 모델에서, 가벼운 하네스를 갖춘 베이스 모델은 샘플 수가 많을 때 RL 후학습 버전보다 더 많은 에이전트 작업을 해결하는 경우가 많다. 후학습 버전은 여전히 pass@1에서 앞선다. 저자들의 PTGS 방법은 RL 중 추정 난이도를 바탕으로 각 프롬프트의 샘플링 온도를 설정해 더 작은 세금을 내고 pass@1도 높인다.