Taste-Bench 最佳模型选出更优方向的比例为 59.7%
微软及合作者的一篇论文衡量前沿智能体在长任务决策点选择更优方向的频率。在 Taste-Bench 上,每道题都是轨迹中的一个点,此时有多个方向开放,其中一条通向更好结果。这些分叉从工程和研究运行中的并行尝试与绕路自动挖掘。最佳模型的正确率为 59.7%。
决定性证据出现在轨迹更后段的分叉难度高得多,增大推理预算并不能提高准确率。作者将教师模型对结果的判断蒸馏到学生模型中,从而提高留出集 SWE-bench Pro 任务的端到端成功率。
论文见 arXiv,并配有 Chat with Paper 页面。