Artificial Analysis 推出面向企业 AI 防御的 Cyber Index
Artificial Analysis 推出 Artificial Analysis Cyber Index 与 Cyber Index Alliance,用以评估 AI 模型在企业网络防御任务上的表现。首发合作伙伴为 CollinearAI、IBM、NVIDIA 与 Vercel。该指数整合三项由合作方贡献的开放基准,衡量智能体发现并修复漏洞的能力。
来自 CollinearAI 的 CWE-Bench-AA 覆盖审计与修补,包含 120 项保留任务,涵盖全部十个 OWASP Top 10(2025)类别,以及 C/C++、Go、Java、JavaScript/TypeScript、Python 与 Rust。来自 Vercel 的 DeepsecBench-AA 单独衡量发现能力:给定代码库与预算,智能体必须找出每一处漏洞,并对照人类安全审查员的发现计分;真实漏洞会得到加分,把无害代码标为有漏洞则会受罚。来自 BerkeleyRDI 的 CyberGym-E2E-AA 进行端到端测试:找出内存安全缺陷,编写可触发崩溃的概念验证,再打补丁,使崩溃不再复现。
Grok 4.7(xhigh)与 MiMo-V2.6-Pro 以 56 分领跑 Cyber Index,其后是 GPT-6 Luna(max)53 分、GLM-5.3-Flash 50 分、Muse Spark 1.3(xhigh)44 分。Artificial Analysis 表示,安全拒绝拖累了 GPT-6 Sol(max)、GPT-6 Astra(max)、Claude Opus 5.5(max with fallback)、Claude Fable 5.1(max with fallback)与 Gemini 3.8 Flash(high)。这些模型拒绝的任务占指数的 32%–38%,落后领先者 19 至 31 分。差距主要来自 CyberGym-E2E-AA:GPT-6 Sol 与 GPT-6 Astra 拒绝全部任务,Claude Opus 5.5 拒绝 98%,Claude Fable 5.1 拒绝 99%。