Did Codex Reset
GitHub

Artificial Analysis, Cyber Index를 세 벤치마크의 평균으로 산출하고 안전 거부는 0점으로 처리

Artificial Analysis

Artificial Analysis는 Cyber Index가 CWE-Bench-AA, DeepsecBench-AA, CyberGym-E2E-AA의 점수를 평균한 것이라고 밝혔다. 모델이 안전상의 이유로 거부한 과제는 0점이다. 이러한 안전 차단은 실패와 별도로 보고되므로, 거부와 모델이 과제를 시도했지만 성공하지 못한 경우를 구분할 수 있다.

채점 규칙은 Cyber Index 방법론에 있다. 전체 결과는 Artificial Analysis Cyber Index 평가 페이지에서 확인할 수 있다.