JEV 캐스케이드는 GPT-6 정확도의 99%를 약 57% 비용으로 유지
Jev-as-a-Judge를 소개하는 논문은 대부분의 평가에 저렴한 판정 모델을 쓰고, 불확실한 호출만 프론티어 모델로 보내야 한다고 본다. 이 방식은 TypeSafe AI의 판정 전용 모델인 JEV로 시험했다. 510개 홀드아웃 선호 쌍에서 JEV의 확신 있는 판정을 받아들이고 나머지는 GPT-6 Astra로 올린 캐스케이드는 GPT-6 정확도의 99%를 비용의 약 57%로 유지했다.
JEV는 판정과 라벨 확률을 반환하며 추론 텍스트는 생성하지 않는다. 판정 1,000건당 비용은 $0.044이고 지연 시간 중앙값은 0.152초로, GPT-6의 $12.182와 1.885초보다 약 277배 저렴하다.
일반적인 선호와 근거 기반 사실성에서 JEV는 GPT-6와 3점 이내를 유지한다. RewardBench에서는 92.2% 대 93.5%, HaluEval에서는 87.5% 대 86.7%다. 도출 과정을 검증하거나 정교하게 작성된 오답을 거부해야 하는 과제에서는 격차가 9점에서 20점으로 커지며, JudgeBench에서는 78.6% 대 93.1%다. 여러 벤치마크에서 JEV와 GPT-6의 격차는 낮은 확신 판정에 집중된다. 상향 임계값은 모든 폴백 모델로 전이되지 않아, 저자들은 자체 데이터에서 설정할 것을 권한다. 논문은 Jev-as-a-Judge: accept when confident, escalate when unsure다.