Did Codex Reset
GitHub

논문, Jev의 yes/no 점수 하나로 정렬 실패를 표시

elvis

연구자들은 기존 벤치마크 44개로 RLCDAlignBench를 만들었으며, 아첨, 탈옥, 기만, 프롬프트 인젝션, 보상 해킹을 포함한 열 가지 실패 유형을 다룬다. 이 방법은 모델 응답에 대한 일반적인 yes/no 질문 하나를 Jev에 묻고, 그 확률을 점수로 사용한다. TypeSafe AI의 보정된 의사결정 모델인 Jev는 한 번의 호출로 동일 입력에 대한 여러 유형의 질문에 답할 수 있으며, 질문마다 별도의 확률이 있다.

논문에 따르면 StrongREJECT에서 Jev는 GPT-4o-mini 채점기의 인간 라벨 일치도와 같았고 응답 순위는 더 나았으며, AUROC는 0.971 대 0.929였다. Jev가 벤치마크 라벨과 확신 있게 불일치한 지점에서는 세 개 벤치마크의 라벨 오류를 찾았다. 질문 표현의 영향은 작았지만 임계값은 벤치마크 간에 이전되지 않았고, 라벨이 있는 10개 항목으로 하나를 맞추자 중앙값 F1이 0.706에서 0.793으로 올랐다.

결과는 arXiv 논문에 보고되어 있으며, 논문 채팅도 이용할 수 있다.