Simon Willison·· 18 小时前精选AI 评分67
Anthropic 红队评测显示 GLM-5.3 与 Claude Mythos 具备二进制漏洞利用能力
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic 前沿红队在内部二进制漏洞利用基准的 100 项随机任务评测中发现,Claude Mythos Preview 和 GLM-5.3 分别在 6% 和 4% 的测试中实现了完整控制流劫持。该团队指出,早期的 Claude Opus 4.6 与 GLM-5.2 在所有测试中均未成功,新一代模型已跨过具备高阶网络能力的关键门槛。
推荐理由
材料给出了前沿模型在二进制漏洞利用评测中的量化对比,读者可以据此了解高阶网络安全能力的演进跨越。
来源:Simon Willison · simonwillison.net