Meta Superintelligence Labs 論文描述 RL 後訓練中的 Sharpening Tax(銳化稅)
在 42 對基礎模型與後訓練模型中,配備輕量測試框架的基礎模型在樣本數很大時,往往比其 RL 後訓練版本解決更多智能代理任務,而後者仍在 pass@1 上勝出。作者的 PTGS 方法在 RL 期間根據估計難度為每個提示設定採樣溫度,支付較小的稅,同時提高 pass@1。
在 42 對基礎模型與後訓練模型中,配備輕量測試框架的基礎模型在樣本數很大時,往往比其 RL 後訓練版本解決更多智能代理任務,而後者仍在 pass@1 上勝出。作者的 PTGS 方法在 RL 期間根據估計難度為每個提示設定採樣溫度,支付較小的稅,同時提高 pass@1。