post cover

AI 热点快报:GLM-5.3 发布,开源模型首次在漏洞发现上超过闭源受限模型(2026-08-15)


事件与背景

8 月 14 日,智谱 Z.ai 发布 GLM-5.3,官方博客标题直接点出它的特别之处——「Frontier Coding with Emergent Cyber Capabilities」(前沿编码 + 涌现的网络攻防能力)。GLM-5.3 与 5.2 共用同一底座,所有提升全部来自后训练(IndexShare 长上下文 + SAO 长程 RL + slime 异步训练框架的继续扩展),官方称内部 Z.ai Code Bench 较 5.2 提升约 50%,Terminal Bench 3.0 从 4.6 跳到 28.3,拿下开源模型 SOTA(闭源对比:Fable 5 为 33.7、GPT-5.6 Sol 为 34.6)。

更值得关注的是「涌现的 cyber 能力」:在 CyberGym 漏洞发现基准上 GLM-5.3 拿到 84.5%,首次超过 Anthropic Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%),成为该基准第一名;ExploitBench 达到 54.4%,是 5.2(24.4%)的两倍以上(Mythos 5 为 78.0、Sol 为 76.5);常规编码基准 DeepSWE v1.1 为 66.9,逼近 Kimi K3 的 67.5,仅次于 Fable 5(69.7)与 Sol(72.7)。团队还与国内安全团队合作在真实代码库上验证:经专家复核与去重后,共发现 269 个项目的 2,436 个漏洞,其中 1,097 个为中高危,最老的漏洞可追溯到 1981 年(平均存在 26.6 年才被发现);Z.ai 为此建立了公开的 Security Disclosure Ledger 跟踪披露进度(目前 53 个已公开、2,383 个仍在保密期)。权重将在发布两周后、完成安全评估与加固后开源。

同窗口还有两件支撑性事件:一是 Qwen 3.8 27B 上线 HuggingFace(992 分):27B 小模型自带视觉与推理、256K 上下文,17GB 显存即可本地跑,开源模型继续向「人人可跑」下沉;二是 HN 上 819 分的文章《Why does Opus 5 feel worse to work with?》,开发者普遍觉得 Opus 5 更「难用」——它倾向大胆假设而不是停下来问问题。Hacker News 上 GLM-5.3 讨论帖(HN 链接)已超过 1050 分,居今日榜首。此外 API 有一处破坏性变更:GLM-5.3 不再支持关闭思考(thinking.type: disabled),只提供 low/high/max 三档 reasoning_effort,存量调用需要迁移。

为什么现在重要

  1. 「网络攻防能力」成为前沿模型的硬指标。 GLM-5.3 让 CyberGym/ExploitBench 这类基准第一次进入模型发布的标配对比表,且开源模型在漏洞发现上首次反超被美国白名单管制、普通人用不到的 Mythos 5。能力维度从「编码/推理」扩展到「攻防」,安全团队选型时多了一条此前不存在的硬指标。

  2. 开源与闭源受限模型的能力格局出现拐点信号。 官方数据呈现清晰规律:越靠近利用链顶端(exploit),5.3 相对 5.2 的提升越大(ExploitGym 从 29/39 到 105/130),尽管 Mythos(181/247)与 Sol(216/293)仍领先——「能力增长最快的地方,恰恰是我们最落后的地方」。这意味着下一两个版本内,开源模型在完整利用链上追平闭源受限模型并非不可能。

  3. 安全能力民主化 vs 白名单监管的路线之争被摆上台面。 美国一侧:Mythos/Fable 被政府逐客户审批、OpenAI 要求 TAC 认证、Claude 的 cyber 能力实时受限;中国一侧:智谱直接发布带 cyber 能力的模型并承诺两周后开源权重。HN 高赞评论点出残酷后果——「攻击者用开源模型,防御者却在等审批」;评论区已有安全从业者晒出实测:用 GLM 订阅跑红队场景,包括 WP 插件 0-day、RCE、内核 exploit 适配,而同样的任务在 Opus/Fable 上会直接拒绝。攻防天平短期会向攻击者倾斜。

  4. 两周开源 + 披露台账 = 新的可信度范式。 Z.ai 没有只发 benchmark,而是公开 2,436 个真实漏洞的披露台账(CVE、严重度、存续年限),并把开源延迟到安全加固之后——这套「先评估、后开源、全程可查」的做法,比美国厂商的「只对白名单开放」多了一个可供社区检验的中间态。

  5. 对中文开发者是直接利好。 GLM-5.3 官方支持 Claude Code / OpenCode / ZCode 等 harness(接入文档),订阅制改为点数制且非高峰时段(工作日 14:00-18:00 之外,含周末)只扣一半点数;官方配套的 ZCode 声称缓存命中率 98%+、8 月 31 日前还有 1.5 倍额度加成,安全/审计类任务的门槛被明显拉低。

工程师/产品人今天能做什么

  1. 用 GLM-5.3 跑一轮你自己的安全相关任务:代码审计、依赖漏洞排查、红队场景。官方支持在 Claude Code/OpenCode 中切换模型,接入方式见 docs.z.ai/devpack/overview

  2. 检查 API 迁移:GLM-5.3 不再支持 thinking.type: disabled,必须改为 enabled 并设置 reasoning_effort(low/high/max,编码推荐 max);不迁移会直接请求失败。

  3. 把「开源 cyber 模型」纳入威胁模型:假设攻击者现在就能低成本使用带漏洞发现能力的开源模型,本周至少对外网资产做一次基于 agent 的漏洞扫描演练,优先覆盖 5.2 时代就暴露过的插件/内核类问题。

  4. 关注两周后的权重发布:提前规划本地/自托管部署(可参考 unsloth 的量化与运行指南),评估把它接入现有安全流水线的成本。

  5. 若团队做安全服务/产品:研究 Z.ai 的披露台账机制(cvd.z.ai)作为「AI 漏洞发现 + 负责任的披露」的参考实现,考虑在自家流程里引入类似的公开台账。

待观察

  1. 两周后开源时 cyber 能力是否被「加固」削弱——HN 上已有「Cybersecurity capability might be nerfed」的担忧,权重版与 API 版能力是否一致待验证。

  2. 美国监管的下一步反应:面对开源 cyber 模型,出口管制/白名单政策是否会从闭源模型扩展到权重与开源生态。

  3. Z.ai 能否把 2,383 个保密期漏洞全部走完披露流程,以及 GLM-5.4 在 ExploitBench(当前 54.4 vs Mythos 78.0)上的追赶速度。