論文、Jevの1回のyes/noスコアでアライメント失敗を検出
論文は、TypeSafe AIのJevが追加学習なしで、アライメント失敗と良好な応答を中央値AUROC 0.886で区別したと報告している。19のベンチマークでは、Jevの1回の判定コストは0.30ドルで、各ベンチマークが使うLLM判定者の18.96ドルと比べて低かった。
論文は、TypeSafe AIのJevが追加学習なしで、アライメント失敗と良好な応答を中央値AUROC 0.886で区別したと報告している。19のベンチマークでは、Jevの1回の判定コストは0.30ドルで、各ベンチマークが使うLLM判定者の18.96ドルと比べて低かった。