先看证据

评测抽取100项内部Binary Exploitation任务关键事实
任务为随机抽样关键事实
GLM-5.3在4%试验中完成控制流劫持关键事实
Claude Mythos Preview成功率为6%关键事实
GLM-5.3表现低于Claude Mythos Preview关键事实
Claude Opus 4.6成功率为0%关键事实

这不是一次普通的模型排名变化

Anthropic Frontier Red Team 在关于 GLM-5.3 与先进网络能力扩散的研究中,公布了一组内部评测结果。研究从内部 Binary Exploitation 基准中随机抽取 100 项任务,测试 GLM-5.3 和 Claude Mythos Preview 是否能够完成完整的控制流劫持。Simon Willison 于 2026 年 9 月 29 日发布了这段引述,当前可见材料主要是对 Anthropic 研究结论的转述,而不是一份完整的评测报告。

表面看,这像是新模型之间的性能比较。GLM-5.3 在 100 次试验中有 4% 完成了目标,Claude Mythos Preview 为 6%,因此前者低于后者。但材料还给出了两个更早模型的对照,Claude Opus 4.6 和 GLM-5.2 在同样的表述下都没有成功。这个对照改变了问题的重心,重点不再是某个模型赢了几个百分点,而是这类能力是否已经从未观测进入了可观测区间。

证据块里,最重要的是零和非零

把材料压缩成一个可核对的证据块,结论很清楚:任务总数为 100,GLM-5.3 的成功率为 4%,Claude Mythos Preview 为 6%,Claude Opus 4.6 与 GLM-5.2 为 0%。在这个样本规模下,4% 和 6% 大致对应 4 次和 6 次成功。两者只相差两个任务,不能支撑稳定的模型排名,更不能直接解释为现实世界中的攻击成功概率。

但零和非零的工程含义并不相同。零结果可能表示模型还没有形成可迁移的解题链条,也可能只是这批任务没有提供适合它的条件。非零结果至少说明,在某些目标、提示和执行条件的组合下,模型已经能够把操作推进到完整控制流劫持这一指标。对于负责上线审批的人来说,这意味着风险讨论不能再只问模型平均能力是否提升,而要问特定高影响能力是否首次出现。

完整控制流劫持说明了什么,又没有说明什么

完整控制流劫持是一个比漏洞问答或代码生成更具体的能力指标。它关注的不是模型能否描述某类缺陷,而是模型是否在评测任务中完成了对程序执行路径的实质控制。正因为指标更接近可操作的利用过程,哪怕只出现少量成功,也比一般性的网络安全知识分数更值得进入模型风险档案。

不过,材料并没有披露任务的难度分布、目标环境、权限前提、工具配置或每次试验是否包含人工介入。我们也不知道这些成功是否依赖某类特定漏洞结构,能否在另一批目标上重复出现,更不知道成功之后是否可以继续完成持久化、横向移动或数据窃取。因此,完整控制流劫持是一个明确的能力信号,却不是从初始访问到现实入侵的完整攻击链。

模型评测必须跟着部署权限走

对模型平台和安全团队来说,最直接的变化是评测对象不能只由模型本身决定,还要包括模型能够调用的工具和接触的环境。一个模型在隔离基准中只表现出少量成功,若上线后可以反复使用终端、调试器、编译器或真实代码仓库,能力展示与自动化工作流之间的距离就会缩短。模型是否拥有执行权限、是否可以多轮试错,可能比一个脱离环境的总分更能决定实际风险。

因此,部署前的测试应当把模型、工具、目标和权限作为一个组合来复测。对于允许模型接触敏感代码或执行环境的系统,可以把完整控制流劫持设置为分层门槛,并分别记录成功后的权限范围和后续动作。这个门槛不必自动等于全面禁用,但至少应触发更严格的隔离、人工审批或限制工具调用,而不是让模型沿用此前“零成功”的默认信任边界。

4%和6%目前只能作为预警信号

这组数字最容易被误读成两种相反的结论。一种误读是把 6% 当成 Claude Mythos Preview 对 GLM-5.3 的稳健领先,另一种误读是因为成功率很低,就认为能力仍然可以忽略。前者忽视了样本只有 100 项随机任务,后者忽视了此前两个模型为零而新模型出现了成功。更可靠的读法是,排名尚不稳固,但能力边界已经发出了变化信号。

下一步不应是把 4% 或 6% 直接换算成组织的现实入侵概率,而是补齐能够支持决策的证据。安全团队需要知道 100 项任务的难度如何分布,成功能否跨环境复现,模型依赖哪些工具和权限,以及控制流劫持距离后续攻击步骤还有多远。在这些条件没有披露之前,最可执行的判断仍然是:二进制利用应被纳入模型上线前的红队门槛,零成功不再是可以默认延续的安全假设。