最佳 Taste-Bench 模型有 59.7% 時間選出較佳方向
微軟與合作者的論文指出,在長程工程與研究任務中選擇較佳的開放方向時,最佳模型答對 59.7% 的 Taste-Bench 問題。由較後證據決定的分岔難度高得多,加大推理預算不會提高準確率;把教師對結果的判斷蒸餾到學生模型,則能提升在留出的 SWE-bench Pro 上的成功率。
微軟與合作者的論文指出,在長程工程與研究任務中選擇較佳的開放方向時,最佳模型答對 59.7% 的 Taste-Bench 問題。由較後證據決定的分岔難度高得多,加大推理預算不會提高準確率;把教師對結果的判斷蒸餾到學生模型,則能提升在留出的 SWE-bench Pro 上的成功率。