論文用一次 Jev 是/否評分標記對齊失敗
研究人員用 44 個現有基準構建了 RLCDAlignBench,涵蓋十類失敗,包括諂媚、越獄、欺騙、提示注入和獎勵黑客。該方法向 Jev 提出一個關於模型回應的通用是/否問題,並把該概率用作分數。Jev 是 TypeSafe AI 的校準決策模型,可在一次呼叫中回答關於同一輸入的多個分類型問題,每個問題都有各自的概率。
論文稱,在 StrongREJECT 上,Jev 與 GPT-4o-mini 評分器在人類標籤上的一致性相當,且對回應的排序更好,AUROC 為 0.971,對照為 0.929。在 Jev 自信地與基準標籤不一致的地方,它在三項基準中發現了標籤錯誤。問題措辭影響不大,但閾值不能跨基準遷移;用 10 條已標註樣本擬合一個閾值後,中位 F1 從 0.706 升至 0.793。