Artificial Analysis, Cyber Index를 세 벤치마크의 평균으로 산출하고 안전 거부는 0점으로 처리
Artificial Analysis는 Cyber Index가 CWE-Bench-AA, DeepsecBench-AA, CyberGym-E2E-AA의 평균이라고 밝혔다. 모델이 안전상의 이유로 거부한 과제는 0점으로 처리되며, 다른 실패와 별도로 보고된다.
Artificial Analysis는 Cyber Index가 CWE-Bench-AA, DeepsecBench-AA, CyberGym-E2E-AA의 평균이라고 밝혔다. 모델이 안전상의 이유로 거부한 과제는 0점으로 처리되며, 다른 실패와 별도로 보고된다.
Artificial Analysis가 CollinearAI, IBM, NVIDIA, Vercel과 함께 Cyber Index와 Cyber Index Alliance를 출시했다. 이 지수는 AI 에이전트가 취약점을 찾아 수정하는 능력을 평가하는 세 가지 공개 벤치마크를 결합하며, Grok 4.7(xhigh)과 MiMo-V2.6-Pro가 56점으로 선두다.