跳到正文
原文
Simon Willison·· 7 天前AI 评分59

Anthropic Frontier Red Team:GLM-5.3 在二进制漏洞利用基准上 4% 试验中实现完整控制流劫持

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在 100 道内部 Binary Exploitation 基准随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期模型如 Claude Opus 4.6 和 GLM-5.2 则无一成功,作者认为一个有意义的门槛已被跨过。

来源:Simon Willison · simonwillison.net