Did Codex Reset
GitHub

Meta Superintelligence Labs の論文が RL ポストトレーニングにおける Sharpening Tax(シャープニング税)を説明

DAIR.AI

Meta Superintelligence Labs は、両方に十分なサンプルを与えると、軽量ハーネスを備えたベースモデルが RL ポストトレーニング版より多くのエージェントタスクを解くことがしばしばあると報告している。ポストトレーニング済みモデルは pass@1 で勝るが、K が大きいと、ベースモデルは BFCL v4 multi-turn、ACEBench、WebShop でポストトレーニング済みモデルが決して解かないタスクをしばしば解く。

著者らによると、ポストトレーニングは各タスクを常に解決されるか決して解決されないかの方向へ押しやり、一貫性を高める一方でカバレッジを下げる。失われたテスト時スケーラビリティを彼らは Sharpening Tax(シャープニング税)と呼ぶ。42 組のベースモデルとポストトレーニング済みモデルのペアでは、それはほとんどの設定で現れ、モデルサイズとともに増大し、少数のロールアウトから推定できる。

彼らの修正法である PTGS は、RL 中に各プロンプトの推定難易度からそのサンプリング温度を設定する。支払う税はより小さく、pass@1 も高める。論文は Sharpening Tax in post-training。