JEV 级联以约 57% 的费用保留 GPT-6 99% 的准确率
一篇介绍 Jev-as-a-Judge 的论文发现,大多数评测应使用低成本评判模型,只把不确定的判定交给前沿模型。论文用 TypeSafe AI 的纯决策评判模型 JEV 检验了这一做法。在 510 对留出偏好样本上,级联方案接受 JEV 的高置信判定,并将其余判定升级至 GPT-6 Astra,以约为 GPT-6 费用 57% 的成本保留了其 99% 的准确率。
JEV 返回判定结果和标签概率,不生成推理文本。每 1,000 次判定费用为 0.044 美元,中位延迟 0.152 秒;GPT-6 则为 12.182 美元和 1.885 秒,JEV 约便宜 277 倍。
在常规偏好判断和基于证据的事实性评测上,JEV 与 GPT-6 的差距保持在 3 个百分点以内:RewardBench 上为 92.2% 对 93.5%,HaluEval 上为 87.5% 对 86.7%。在需要核验推导过程或拒绝写得很详尽的错误答案的任务上,差距扩大到 9 至 20 个百分点,其中包括 JudgeBench 上的 78.6% 对 93.1%。在若干基准测试中,JEV 与 GPT-6 的差距集中在其低置信判定上。升级阈值并不能迁移到每一个回退模型,因此作者建议基于自身数据设定。论文为 Jev-as-a-Judge: accept when confident, escalate when unsure。