Taste-Bench 최고 모델, 더 나은 방향을 59.7% 선택
Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.
Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.