Did Codex Reset
GitHub

JEVのカスケードは料金の約57%でGPT-6の精度の99%を維持

DAIR.AI

Jev-as-a-Judgeを提案する論文は、評価の大半は安価な審査モデルに任せ、不確かな判定だけをフロンティアモデルへ送るべきだとしている。この手法を、TypeSafe AIの判定専用審査モデルであるJEVで検証した。510件のホールドアウト選好ペアでは、JEVが確信を持って出した判定を採用し、残りをGPT-6 Astraへエスカレーションするカスケードが、GPT-6の精度の99%をその料金の約57%で維持した。

JEVは判定とラベルの確率を返し、推論テキストは生成しない。費用は判定1,000件あたり0.044ドル、レイテンシの中央値は0.152秒で、GPT-6の12.182ドル、1.885秒と比べて約277倍安い。

通常の選好と根拠に基づく事実性では、JEVはGPT-6との差を3ポイント以内に収めている。RewardBenchでは92.2%対93.5%、HaluEvalでは87.5%対86.7%だった。導出の確認や、精緻に書かれた誤答の棄却を要する課題では差が9〜20ポイントに広がり、JudgeBenchでは78.6%対93.1%となった。複数のベンチマークでは、JEVとGPT-6の差は確信度の低い判定に集中している。エスカレーションの閾値はすべてのフォールバックモデルへそのまま移らなかったため、著者らは自らのデータで設定することを推奨している。論文はJev-as-a-Judge: accept when confident, escalate when unsure。