Did Codex Reset
GitHub

#andrew-ng

すべてのAIニュースを見る

GLM-5.3のExploitBenchスコアは12%、Claude Mythosの14%に迫る

DeepLearning.AIの週次レターはAnthropicの数値を引き、GLM-5.3がExploitBenchのエクスプロイト課題の12%を、Claude Mythosが14%を解いたと示している。また、20.40ドル分のトークンでGoogle Chromeの最近のセキュリティエクスプロイトが見つかったとも述べている。