GLM-5.3のExploitBenchスコアは12%、Claude Mythosの14%に迫る
DeepLearning.AIの週次レターは、オープンモデルのGLM-5.3がサイバーセキュリティ課題でClaude Mythosにほぼ匹敵すると述べている。Anthropicによれば、GLM-5.3はExploitBenchのエクスプロイト課題の12%を、Claude Mythosは14%を解いた。
同レターは、20.40ドル分のトークンでGoogle Chromeの最近のセキュリティエクスプロイトが見つかったと述べている。Andrew Ngは、こうした能力が不適切な手に渡る懸念はエンジニアリング上の問題として扱うべきであり、防御側が長期的な優位を持つと記している。