Artificial Analysis 推出面向企業 AI 防禦的 Cyber Index
Artificial Analysis 推出 Artificial Analysis Cyber Index 與 Cyber Index Alliance,用以評估 AI 模型在企業網絡防禦任務上的表現。首發合作夥伴為 CollinearAI、IBM、NVIDIA 與 Vercel。該指數整合三項由合作方貢獻的開放基準,衡量智能體發現並修復漏洞的能力。
來自 CollinearAI 的 CWE-Bench-AA 涵蓋審計與修補,包含 120 項保留任務,覆蓋全部十個 OWASP Top 10(2025)類別,以及 C/C++、Go、Java、JavaScript/TypeScript、Python 與 Rust。來自 Vercel 的 DeepsecBench-AA 單獨衡量發現能力:給定程式碼庫與預算,智能體必須找出每一處漏洞,並對照人類安全審查員的發現計分;真實漏洞會得到加分,把無害程式碼標為有漏洞則會受罰。來自 BerkeleyRDI 的 CyberGym-E2E-AA 進行端到端測試:找出記憶體安全缺陷,編寫可觸發崩潰的概念驗證,再打補丁,使崩潰不再重現。
Grok 4.7(xhigh)與 MiMo-V2.6-Pro 以 56 分領跑 Cyber Index,其後是 GPT-6 Luna(max)53 分、GLM-5.3-Flash 50 分、Muse Spark 1.3(xhigh)44 分。Artificial Analysis 表示,安全拒絕拖累了 GPT-6 Sol(max)、GPT-6 Astra(max)、Claude Opus 5.5(max with fallback)、Claude Fable 5.1(max with fallback)與 Gemini 3.8 Flash(high)。這些模型拒絕的任務佔指數的 32%–38%,落後領先者 19 至 31 分。差距主要來自 CyberGym-E2E-AA:GPT-6 Sol 與 GPT-6 Astra 拒絕全部任務,Claude Opus 5.5 拒絕 98%,Claude Fable 5.1 拒絕 99%。