Artificial Analysis、企業向けAI防御のCyber Indexを公開
Artificial Analysisは、企業のサイバー防御タスクにおけるAIモデルの性能を評価するため、Artificial Analysis Cyber IndexとCyber Index Allianceを公開した。立ち上げ時のパートナーはCollinearAI、IBM、NVIDIA、Vercel。同指数は、パートナーが提供した3つのオープンベンチマークを組み合わせ、エージェントが脆弱性を発見し修正する能力を測定する。
CollinearAIのCWE-Bench-AAは監査と修正を対象とし、OWASP Top 10(2025)の全10カテゴリーと、C/C++、Go、Java、JavaScript/TypeScript、Python、Rustをカバーする120件のheld-outタスクで構成される。VercelのDeepsecBench-AAは発見だけを切り出して評価する。コードベースと予算が与えられたエージェントは、すべての脆弱性を見つけなければならず、人間のセキュリティレビュアーの指摘と比較されて採点される。実際の脆弱性を見つければ加点され、無害なコードを脆弱だと判定すると減点される。BerkeleyRDIのCyberGym-E2E-AAはエンドツーエンドで実施する。メモリ安全性のバグを見つけ、クラッシュを引き起こす概念実証を作成し、クラッシュが再現しなくなるよう修正する。
Cyber IndexではGrok 4.7(xhigh)とMiMo-V2.6-Proが56点で首位、続いてGPT-6 Luna(max)が53点、GLM-5.3-Flashが50点、Muse Spark 1.3(xhigh)が44点だった。Artificial Analysisによると、安全上の拒否がGPT-6 Sol(max)、GPT-6 Astra(max)、Claude Opus 5.5(max with fallback)、Claude Fable 5.1(max with fallback)、Gemini 3.8 Flash(high)の成績を抑えている。これらのモデルは指数の32~38%に相当するタスクを拒否し、首位から19~31点遅れている。差の大部分はCyberGym-E2E-AAによるもので、GPT-6 SolとGPT-6 Astraは全タスクを拒否し、Claude Opus 5.5は98%、Claude Fable 5.1は99%を拒否した。