Did Codex Reset
GitHub

QQ·微信群

Critical-State RL 只訓練會改變結果的那一次工具調用

DAIR.AI

Critical-State RL 針對多輪工具使用,只訓練動作會改變結果的那一次調用,而不是把獎勵分攤到整條軌跡。當獎勵取決於後續輪次時,其變化有很大一部分來自下游發生的事。

該方法用嵌套取樣,把當前動作造成的獎勵變化與下游雜訊分開,再用 contextual-bandit 更新只訓練所選調用。在 BFCL v4 的 missing-function 任務上,訓練所選輪次大約增加 14 分,而訓練另一個候選輪次則使準確率持平或下降。

DAIR.AI 指向 Critical-State RL 論文。