Did Codex Reset
GitHub

Meta Superintelligence Labs 논문이 RL 후학습의 Sharpening Tax(샤프닝 세금)를 설명

DAIR.AI

Meta Superintelligence Labs는 둘 다 충분한 샘플을 받으면, 가벼운 하네스를 갖춘 베이스 모델이 RL 후학습 버전보다 더 많은 에이전트 작업을 해결하는 경우가 많다고 보고한다. 후학습 모델은 pass@1에서 앞서지만, K가 클 때 베이스 모델은 BFCL v4 multi-turn, ACEBench, WebShop에서 후학습 모델이 결코 해결하지 못한 작업을 자주 해결한다.

저자들은 후학습이 각 작업을 항상 해결되거나 결코 해결되지 않는 쪽으로 밀어 일관성을 높이는 동시에 커버리지를 낮춘다고 말한다. 그들은 잃어버린 테스트 시점 확장성을 Sharpening Tax(샤프닝 세금)라고 부른다. 42쌍의 베이스 모델과 후학습 모델에서 이 현상은 대부분의 설정에서 나타나고, 모델 크기가 커질수록 증가하며, 소수의 롤아웃으로 추정할 수 있다.

그들의 해결책인 PTGS는 RL 중 각 프롬프트의 추정 난이도로부터 샘플링 온도를 설정한다. 더 작은 세금을 내고 pass@1도 높인다. 논문은 Sharpening Tax in post-training이다.