Did Codex Reset
GitHub

QQ·微信群

Critical-State RL 只训练会改变结果的那一次工具调用

DAIR.AI

Critical-State RL 针对多轮工具使用,只训练动作会改变结果的那一次调用,而不是把奖励分摊到整条轨迹。当奖励取决于后续轮次时,其变化有很大一部分来自下游发生的事。

该方法用嵌套采样,把当前动作造成的奖励变化与下游噪声分开,再用 contextual-bandit 更新只训练所选调用。在 BFCL v4 的 missing-function 任务上,训练所选轮次大约增加 14 分,而训练另一个候选轮次则使准确率持平或下降。

DAIR.AI 指向 Critical-State RL 论文。