Did Codex Reset
GitHub

QQ·微信群

最佳 Taste-Bench 模型有 59.7% 時間選出較佳方向

elvis

微軟與合作者的論文量度前沿代理在長任務的決策點選出較佳方向的頻率。在 Taste-Bench 上,每條問題都是軌跡中的一個節點,當時有多個方向仍然開放,其中一個會帶來較佳結果。這些分岔從工程與研究運行中的並行嘗試和繞路自動挖掘而來。最佳模型答對 59.7%。

決定性證據在軌跡較後才出現的分岔難度高得多,加大推理預算亦不會提高準確率。作者把教師對結果的判斷蒸餾到學生模型,從而提升在留出的 SWE-bench Pro 任務上的端到端成功率。

論文見 arXiv,並附有配套的 Chat with Paper 頁面。