Critical-State RL 只训练会改变结果的那一次工具调用
DAIR.AI 介绍了 Salesforce AI Research 的一种方法:找出多轮工具调用中动作会改变后续奖励的那一次,并只更新这一次调用。在 BFCL v4 的 missing-function 任务上,训练所选轮次大约增加 14 分。
DAIR.AI 介绍了 Salesforce AI Research 的一种方法:找出多轮工具调用中动作会改变后续奖励的那一次,并只更新这一次调用。在 BFCL v4 的 missing-function 任务上,训练所选轮次大约增加 14 分。