Did Codex Reset
GitHub

Taste-Bench 최고 모델, 더 나은 방향을 59.7% 선택

elvis

Microsoft와 동료들의 논문은 프런티어 에이전트가 긴 과제의 결정 지점에서 더 나은 방향을 얼마나 자주 고르는지 측정한다. Taste-Bench의 각 문항은 궤적에서 여러 방향이 열려 있고 그중 하나가 더 나은 결과로 이어지는 지점이다. 분기점은 엔지니어링·연구 실행의 병렬 시도와 우회에서 자동으로 추출된다. 최고 모델의 정답률은 59.7%다.

궤적 후반에 결정 근거가 나타나는 분기점은 훨씬 어렵고, 추론 예산을 키워도 정확도는 오르지 않는다. 저자들은 교사의 결과 판단을 학생 모델에 증류했고, 이는 홀드아웃 SWE-bench Pro 과제의 엔드투엔드 성공을 높인다.

논문은 arXiv에서 볼 수 있으며, 함께 제공되는 Chat with Paper 페이지도 있다.