Did Codex Reset
GitHub

QQ·微信群

Meta Superintelligence Labs 論文描述 RL 後訓練中的 Sharpening Tax(銳化稅)

DAIR.AI

Meta Superintelligence Labs 報告,當兩者都取得足夠樣本時,配備輕量測試框架的基礎模型往往比其 RL 後訓練版本解決更多智能代理任務。後訓練模型在 pass@1 上勝出,但在 K 很大時,基礎模型經常能解決後訓練模型在 BFCL v4 multi-turn、ACEBench 和 WebShop 上從未解決的任務。

作者表示,後訓練會把每項任務推向永遠解決或永遠不解決,提高一致性,同時降低覆蓋範圍。他們把失去的測試時可擴展性稱為 Sharpening Tax(銳化稅)。在 42 對基礎模型與後訓練模型中,它出現在大多數設定中,隨模型規模增長,並可從少量 rollout 估計。

他們的修正方法 PTGS 在 RL 期間根據每個提示的估計難度設定其採樣溫度。它支付較小的稅,同時提高 pass@1。論文為 Sharpening Tax in post-training。