Did Codex Reset
GitHub

QQ·微信群

GLM-5.3 在 ExploitBench 得分 12%,接近 Claude Mythos 的 14%

DeepLearning.AI

DeepLearning.AI 的每週通訊指,開放模型 GLM-5.3 在網絡安全任務上接近 Claude Mythos。據 Anthropic 稱,GLM-5.3 解決了 ExploitBench 漏洞利用任務的 12%,Claude Mythos 解決了 14%。

通訊稱,價值 20.40 美元的 token 發現了 Google Chrome 中一項近期安全漏洞利用。Andrew Ng 寫道,對這些能力落入不當之手的擔憂應作為工程問題處理,而防守方擁有長期優勢。