SkillLift 論文報告演進智能體技能的 token 成本降低 40–70%
DAIR.AI 重點介紹一篇關於 SkillLift 的論文,這是一種演進智能體技能提示的方法,無需執行完整智能體 rollout 來為每個候選修訂評分。SkillLift 訓練一個評分準則,使其與真實結果就兩個技能何者較佳達成一致,理由是排名所需的 oracle 運行次數少於預測每個分數。
內迴圈 對照凍結的評分準則修訂技能,無需 rollout 成本。外迴圈 花費少量真實 rollout,以排名相關性重新對齊評分準則。該帖文表示,rollout 成本正是技能自我演進通常只修補已觀察到的失敗的原因。
在 SkillsBench 和 WildClawBench(147 項任務)上,使用三個模型,SkillLift 據報在全部六種組合中擊敗 SkillOpt 和 CoEvoSkills,即使這些基線獲得雙倍 token 預算,並以 少 40 to 70% 的 token 達到目標表現。論文:https://academy.dair.ai/papers/skilllift-learning-dense-rubrics-from-sparse-oracles-for-efficient-skill-evoluti-2609.15396