Meta Superintelligence Labs 논문이 RL 후학습의 Sharpening Tax(샤프닝 세금)를 설명
42쌍의 베이스 모델과 후학습 모델에서, 가벼운 하네스를 갖춘 베이스 모델은 샘플 수가 많을 때 RL 후학습 버전보다 더 많은 에이전트 작업을 해결하는 경우가 많다. 후학습 버전은 여전히 pass@1에서 앞선다. 저자들의 PTGS 방법은 RL 중 추정 난이도를 바탕으로 각 프롬프트의 샘플링 온도를 설정해 더 작은 세금을 내고 pass@1도 높인다.