논문, Jev의 yes/no 점수 하나로 정렬 실패를 표시
한 논문은 TypeSafe AI의 Jev가 추가 학습 없이 정렬 실패와 양호한 응답을 중앙값 AUROC 0.886으로 구분했다고 보고한다. 19개 벤치마크에서 Jev 1회 평가 비용은 0.30달러로, 해당 벤치마크가 쓰는 LLM 판정자의 18.96달러와 비교됐다.
한 논문은 TypeSafe AI의 Jev가 추가 학습 없이 정렬 실패와 양호한 응답을 중앙값 AUROC 0.886으로 구분했다고 보고한다. 19개 벤치마크에서 Jev 1회 평가 비용은 0.30달러로, 해당 벤치마크가 쓰는 LLM 판정자의 18.96달러와 비교됐다.