SkillLift 论文报告演化智能体技能的 token 成本降低 40–70%
DAIR.AI 介绍了一篇关于 SkillLift 的论文,这是一种演化智能体技能提示的方法,无需对每个候选修订运行完整智能体 rollout 来打分。SkillLift 训练一个评分标准,使其与真实结果在两个技能中哪个更好上保持一致,理由是排序所需的 oracle 运行次数少于预测每个分数。
一个 内循环 在零 rollout 成本下对照冻结的评分标准修订技能。一个 外循环 花费少量真实 rollout,通过秩相关重新对齐评分标准。该帖文称,rollout 成本是技能自我演化通常只修补已观察到的失败的原因。
在 SkillsBench 和 WildClawBench(147 项任务)上,使用三个模型,SkillLift 据称在全部六种组合中均优于 SkillOpt 和 CoEvoSkills,即使这些基线获得了两倍的 token 预算,并以 少 40% 到 70% 的 token 达到目标性能。论文:https://academy.dair.ai/papers/skilllift-learning-dense-rubrics-from-sparse-oracles-for-efficient-skill-evoluti-2609.15396