Did Codex Reset
GitHub

QQ·微信群

JEV 級聯以約 57% 費用保留 GPT-6 準確率的 99%

DAIR.AI

一篇介紹 Jev-as-a-Judge 的論文指出,多數評估應使用便宜的評判,只把不確定的判定送交前沿模型。論文以 TypeSafe AI 只輸出判定的評判 JEV 測試這套做法。在 510 組留出偏好配對上,一套級聯接納 JEV 有信心的判定,並把其餘個案升級至 GPT-6 Astra,以約 57% 的費用保留了 GPT-6 準確率的 99%。

JEV 回傳判定與標籤概率,不產生推理文本。每 1,000 次判定收費 0.044 美元,中位延遲 0.152 秒;GPT-6 則為 12.182 美元及 1.885 秒,JEV 約便宜 277 倍。

在一般偏好與有證據依據的事實性任務上,JEV 與 GPT-6 的差距維持在 3 個百分點以內:RewardBench 為 92.2% 對 93.5%,HaluEval 為 87.5% 對 86.7%。在需要核對推導,或拒絕一篇寫得詳盡卻錯誤的答案的任務上,差距擴大至 9 至 20 個百分點,其中包括 JudgeBench 的 78.6% 對 93.1%。在多項基準上,JEV 與 GPT-6 的差距集中在其低信心判定。升級閾值並非對每個後備模型都能轉移,因此作者建議按自身數據設定。論文為 Jev-as-a-Judge:有信心便接納,不確定便升級。