論文、Jevの1回のyes/noスコアでアライメント失敗を検出
研究者は、既存の44ベンチマークからRLCDAlignBenchを構築した。対象は、追従、ジェイルブレイク、欺瞞、プロンプトインジェクション、報酬ハッキングを含む10種類の失敗である。この手法は、モデルの応答について汎用のyes/no質問をJevに1つ出し、その確率をスコアとして使う。TypeSafe AIの較正済み意思決定モデルであるJevは、1回の呼び出しで同一入力に関する複数の型付き質問に答えられ、それぞれに独自の確率が付く。
論文によると、StrongREJECTでは、JevはGPT-4o-miniスコアラーと人間ラベルとの一致度が同等で、応答の順位付けはより良く、AUROCは0.971対0.929だった。Jevがベンチマークのラベルと自信を持って食い違った箇所では、3つのベンチマークでラベル誤りを見つけた。質問の文言による差は小さかったが、閾値はベンチマーク間で転用できず、ラベル付き10件で1つを適合させると中央値F1は0.706から0.793に上がった。