Did Codex Reset
GitHub

SkillLift 논문, 에이전트 스킬 진화에 토큰 비용 40–70% 감소 보고

DAIR.AI

DAIR.AI가 모든 후보 수정본을 채점하려고 전체 에이전트 롤아웃을 실행하지 않고 에이전트 스킬 프롬프트를 진화시키는 방법인 SkillLift에 관한 논문을 조명했다. SkillLift는 두 스킬 중 어느 것이 더 나은지에 대한 실제 결과와 일치하도록 루브릭을 훈련하는데, 순위 매기기가 각 점수를 예측하는 것보다 오라클 실행이 더 적게 필요하다는 근거에서다.

내부 루프는 롤아웃 비용 없이 고정된 루브릭에 맞춰 스킬을 수정한다. 외부 루프는 순위 상관으로 루브릭을 재정렬하기 위해 몇 번의 실제 롤아웃을 사용한다. 해당 게시물은 롤아웃 비용이 스킬 자기 진화가 보통 관찰된 실패만 패치하는 이유라고 말한다.

SkillsBench와 WildClawBench (147개 태스크)에서 세 가지 모델로, SkillLift는 해당 베이스라인에 토큰 예산을 두 배로 주었을 때도 여섯 가지 조합 모두에서 SkillOpt와 CoEvoSkills를 능가했으며, 40 to 70% 더 적은 토큰으로 목표 성능에 도달했다고 한다. 논문: https://academy.dair.ai/papers/skilllift-learning-dense-rubrics-from-sparse-oracles-for-efficient-skill-evoluti-2609.15396