Did Codex Reset
GitHub

GLM-5.3, ExploitBench 점수 12%…Claude Mythos 14%에 근접

DeepLearning.AI

DeepLearning.AI 주간 레터는 오픈 모델 GLM-5.3이 사이버보안 과제에서 Claude Mythos에 거의 맞먹는다고 전했다. Anthropic에 따르면 GLM-5.3은 ExploitBench 익스플로잇 과제의 12%를, Claude Mythos는 14%를 해결했다.

레터는 20.40달러어치 토큰으로 Google Chrome의 최근 보안 익스플로잇을 찾았다고 밝혔다. Andrew Ng는 이런 능력이 잘못된 손에 들어갈 우려를 엔지니어링 문제로 다뤄야 하며, 방어 측이 장기적 우위를 갖는다고 썼다.