Did Codex Reset
GitHub

#sharpening-tax

すべてのAIニュースを見る

Meta Superintelligence Labs の論文が RL ポストトレーニングにおける Sharpening Tax(シャープニング税)を説明

42 組のベースモデルとポストトレーニング済みモデルのペアでは、軽量ハーネスを備えたベースモデルが大量サンプルでは、RL ポストトレーニング版より多くのエージェントタスクを解くことがしばしばある。ポストトレーニング版は依然として pass@1 で勝る。著者らの PTGS 手法は、RL 中の推定難易度に基づいて各プロンプトのサンプリング温度を設定し、税をより小さくし、pass@1 も引き上げる。