Did Codex Reset
GitHub

QQ·微信群

#microsoft

查看全部AI快讯
TGRSS 订阅共 3 条

Taste-Bench 最佳模型选出更优方向的比例为 59.7%

微软及合作者的一篇论文报告,在长周期工程与研究任务中选择更优开放方向时,最佳模型正确回答 59.7% 的 Taste-Bench 问题。由后续证据决定的分叉难度高得多,增加推理预算并不能提高准确率,而将教师模型对结果的判断蒸馏到学生模型后,可提高留出集 SWE-bench Pro 任务的成功率。