论文用一次 Jev 是/否评分标记对齐失败
研究人员用 44 个现有基准构建了 RLCDAlignBench,覆盖十类失败,包括谄媚、越狱、欺骗、提示注入和奖励黑客。该方法向 Jev 提出一个关于模型回答的通用是/否问题,并把该概率用作分数。Jev 是 TypeSafe AI 的校准决策模型,可在一次调用中回答关于同一输入的多个分类型问题,每个问题都有各自的概率。
论文称,在 StrongREJECT 上,Jev 与 GPT-4o-mini 评分器在人类标签上的一致性相当,且对回答的排序更好,AUROC 为 0.971,对照为 0.929。在 Jev 自信地与基准标签不一致的地方,它在三项基准中发现了标签错误。问题措辞影响不大,但阈值不能跨基准迁移;用 10 条已标注样本拟合一个阈值后,中位 F1 从 0.706 升至 0.793。