Artificial Analysis, 기업 AI 방어용 Cyber Index 공개
Artificial Analysis는 기업 사이버 방어 작업에서 AI 모델의 성능을 평가하기 위해 Artificial Analysis Cyber Index와 Cyber Index Alliance를 출시했다. 출범 파트너는 CollinearAI, IBM, NVIDIA, Vercel이다. 이 지수는 파트너가 제공한 세 가지 공개 벤치마크를 결합해 에이전트가 취약점을 찾아 수정하는 능력을 측정한다.
CollinearAI의 CWE-Bench-AA는 감사와 패치를 다루며, OWASP Top 10(2025)의 전체 10개 범주와 C/C++, Go, Java, JavaScript/TypeScript, Python, Rust를 아우르는 120개 held-out 과제로 구성된다. Vercel의 DeepsecBench-AA는 발견만 분리해 평가한다. 코드베이스와 예산이 주어지면 에이전트는 모든 취약점을 찾아야 하며, 인간 보안 검토자의 발견 결과와 비교해 점수를 받는다. 실제 취약점을 찾으면 점수를 얻고, 무해한 코드를 취약하다고 표시하면 감점된다. BerkeleyRDI의 CyberGym-E2E-AA는 엔드투엔드로 진행된다. 메모리 안전성 버그를 찾고, 충돌을 유발하는 개념 증명을 작성한 뒤, 충돌이 더 이상 재현되지 않도록 패치한다.
Cyber Index에서는 Grok 4.7(xhigh)과 MiMo-V2.6-Pro가 56점으로 선두이며, GPT-6 Luna(max) 53점, GLM-5.3-Flash 50점, Muse Spark 1.3(xhigh) 44점이 뒤를 이었다. Artificial Analysis는 안전 거부가 GPT-6 Sol(max), GPT-6 Astra(max), Claude Opus 5.5(max with fallback), Claude Fable 5.1(max with fallback), Gemini 3.8 Flash(high)의 성적을 끌어내린다고 밝혔다. 이들 모델은 지수에서 32~38%에 해당하는 과제를 거부하며 선두보다 19~31점 뒤처진다. 격차의 대부분은 CyberGym-E2E-AA에서 발생한다. GPT-6 Sol과 GPT-6 Astra는 모든 과제를 거부하고, Claude Opus 5.5는 98%, Claude Fable 5.1은 99%를 거부한다.