논문, Jev의 yes/no 점수 하나로 정렬 실패를 표시
연구자들은 기존 벤치마크 44개로 RLCDAlignBench를 만들었으며, 아첨, 탈옥, 기만, 프롬프트 인젝션, 보상 해킹을 포함한 열 가지 실패 유형을 다룬다. 이 방법은 모델 응답에 대한 일반적인 yes/no 질문 하나를 Jev에 묻고, 그 확률을 점수로 사용한다. TypeSafe AI의 보정된 의사결정 모델인 Jev는 한 번의 호출로 동일 입력에 대한 여러 유형의 질문에 답할 수 있으며, 질문마다 별도의 확률이 있다.
논문에 따르면 StrongREJECT에서 Jev는 GPT-4o-mini 채점기의 인간 라벨 일치도와 같았고 응답 순위는 더 나았으며, AUROC는 0.971 대 0.929였다. Jev가 벤치마크 라벨과 확신 있게 불일치한 지점에서는 세 개 벤치마크의 라벨 오류를 찾았다. 질문 표현의 영향은 작았지만 임계값은 벤치마크 간에 이전되지 않았고, 라벨이 있는 10개 항목으로 하나를 맞추자 중앙값 F1이 0.706에서 0.793으로 올랐다.