Did Codex Reset
GitHub

Taste-Benchで最高のモデルは、より良い方向を59.7%の割合で選ぶ

elvis

Microsoftらの論文は、長期タスクの判断地点で、フロンティアのエージェントがより良い方向を選ぶ割合を測っている。Taste-Benchの各設問は、軌道上で複数の方向が開いており、そのうち一つがより良い結果につながる地点である。分岐は、エンジニアリングと研究の実行における並行試行と回り道から自動的に抽出される。最高のモデルの正答率は59.7%だった。

判断材料が軌道の後半に現れる分岐ははるかに難しく、推論予算を増やしても精度は上がらない。著者らは、結果に対する教師の判断を生徒モデルへ蒸留し、未使用のSWE-bench Proタスクにおけるエンドツーエンドの成功率を高めた。

論文はarXivで公開され、付随するChat with Paperのページもある。