post cover

GLM-5.3:仅靠后训练逼近前沿,突现 cyber 能力引热议(2026-08-15)


本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Hacker News 社区讨论 原文标题:GLM-5.3: Frontier coding with emergent cyber capabilities 原文链接:https://news.ycombinator.com/item?id=49294997 原文发布:2026-08-14 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。

译者按

8 月 14 日智谱(Z.ai)发布 GLM-5.3,官方博客开篇一句”后训练缩放就是 GLM-5.3 的全部”(Scaling post-training is all we did)直接引爆英文圈,半天内冲到 Hacker News 1101 分、543 条评论,与同日登顶的 Qwen 3.8 27B 一起构成”中国模型发布潮”。这条帖子的特别之处在于安全维度:官方标题里的”emergent cyber capabilities”(突现网络攻击能力)加上配套上线的漏洞协调披露页 cvd.z.ai,让讨论从常规的”又强了多少”延伸到后训练路线、开源协议收紧与攻防博弈。对本博客读者,它正好接续 6 月 18 日翻译的 Simon Willison 评 GLM-5.2——两个月前 GLM-5.2 刚以 MIT 协议全量开源 753B 模型,如今同一家族仅靠后训练就把能力推到闭源前沿附近。需要说明:z.ai 官方博客正文不在白名单内(©),本文仅翻译 HN 讨论串本身(CC BY-NC-SA)。

正文

发帖原文

GLM-5.3: Frontier coding with emergent cyber capabilities 链接:https://z.ai/blog/glm-5.3(官方博客,© 未转载) HN 讨论:1101 分 / 543 评论,发布于 2026-08-14

帖子本身是纯链接帖(无发帖人正文),核心信息来自评论区对官方公告的转述与讨论。综合评论区可确认的事实:

  • GLM-5.3:定位”前沿编码 + 突现 cyber(网络安全)能力”;官方称**“后训练缩放就是全部”**,即基座模型未变,能力提升全部来自后训练(post-training);
  • 权重将在发布约两周后公开,官方口径是”待安全评估与加固完成后”;
  • 社区估算总参数约 730B(MoE),评论普遍惊叹其”性能/参数比”(此为社区猜测,官方未公布具体参数);
  • 非多模态模型(无图像输入),多名评论者认为这是主要短板;
  • 发布当天尚无 HuggingFace 权重链接,OpenRouter 上也还没有 API(评论时点);
  • 智谱同步上线漏洞协调披露页 cvd.z.ai,据评论区称正大规模扫描开源与流行软件并披露 CVE,多数处于 embargo(禁运期)内;
  • 官方公布的 exploitation chain(攻击利用链)基准中,闭源前沿 Mythos 5 仍以 181 / 247 个任务领先,且越靠近利用链上游、差距越大;
  • 订阅制 API 已可升级(评论区实测从 $18 档升到 $80 档),并可将模型接入 Claude Code 等外部 harness。

社区精彩评论精选

一、发布潮与第一印象

1. (@newyankee)

“今天的发布潮太猛了。对于不亲自在复杂真实场景里测试所有这些模型的人来说,真的很难判断该用哪个(除了看价格)。”

2. (@anana_)

“这是 AI 模型发布的一周。”

3. (@moinism)

“Google:这是我们 flash 模型系列的新一代,打个折,求你了,谢谢。Z.ai:这是我们新一代,与 Fable/Sol 并驾齐驱,权重两周后开源。“

二、后训练缩放:同参数基座的”魔法”

4. (@wxw)

“‘后训练缩放就是 GLM-5.3 的全部。‘我爱这个开篇句。而且,哇,结果太惊人了。‘随着 Agent 能力提升,后训练缩放的难点正从模型本身转移到环境上。’”

5. (@Ruca_AI)

“同一个基座模型,仅靠后训练就带来这么大的提升,有点离谱。等权重发布后,我真的很想知道 GLM-5.3 在混乱的真实仓库上表现如何。”

6. (@jjice)

“我理解得对吗——这只是个约 730B 参数的 MoE?这听起来是难以置信的每参数性能。新的 DeepSeek 也以约 280B 让我印象深刻,还有最近的 30B 级 Qwen 和 Muse。我真心觉得这些模型的性能/规模比更有意思——自私地说,因为它让我对未来几年能在自己机器上跑的东西充满信心。这进步简直不可思议。”

7. (@fcanesin)

“GLM-5.3 进一步证明:目前所有 >1T 参数的模型都训练不足。我看了近期开源模型(参数已知的那些)的智能密度(https://www.pasteboard.co/6q2-5f92mtj9.png ),以 DS-v4-flash 为上界的话,GLM-5.x 还能把性能再翻三倍。”

8. (@bertili)

“这大致会与 Kimi K3 相当,但只用它三分之一的参数。就在 4 周前,‘Kimi K3 时刻’还被视作对闭源 AI 的威胁;不到一个月,Z.ai 就把参数/显存门槛砍到了三分之一。祝贺 Z.ai 和所有默默’煮青蛙’的中国研究者。“

三、“突现 cyber 能力”与安全披露

9. (@SwellJoe)

“他们这次是认真对待安全了,还搞了自己的披露页面,就像 Anthropic 为 Mythos 做的那样。https://cvd.z.ai/

10. (@z4y5f3)

“看起来他们正在大规模扫描开源和流行软件,并披露发现的漏洞:https://cvd.z.ai/ 。其中大部分还在 embargo(禁运)期内,但这里似乎有大量来自各类流行软件的 CVE,很多被评为严重或高危。我理解’反正也没人在主动找’这个论点,但这类扫描的成本难道不是每周都在降吗?Anthropic 的 Project Glasswing 按理说早就该找到这些了。”

11. (@aand16)

“‘Mythos 5 在 181 和 247 个任务上仍遥遥领先。三个模型(指 GLM-5.3 等)的模式是一致的:基准越靠近利用链上游,与闭源前沿的差距就越大。能力增长最快的地方,恰恰是我们落后最多的地方。‘我很欣赏他们没有借机自吹自擂。”

12. (@leobuskin)

“我昨天买了 $18 的 GLM 官方订阅(5.2,不过新模型版本已经泄露在一些文档里了),把它接进 Claude Code harness……然后我几乎立刻升到了 $80 档。这是第一个同意做正经安全研究(红队场景)并顺利执行的模型——包括 WordPress 插件里的 0-day、RCE、6.8 内核 exploit 适配等等——还是在我用另一个 GLM Agent 当防守方对打的情况下(顺着 HF 上的故事玩的)!我理解这类模型可能被恶意行为者利用,但让它公开可用是公平的(紧急时刻它也能站在你这边)。我认为这才是让世界变好的方式,而不是那些护栏。”

13. (@cubefox)

“‘开源:我们将在发布两周后、安全评估与加固完成后公开权重。‘什么安全评估?什么安全加固?他们已经评估过了,并且发现它在利用安全漏洞方面能力极强。所以我们已经知道它并不’安全’,而他们似乎也没打算对此做任何事。还有什么比黑客攻击更危险?生物武器研究?我也不觉得中国实验室在防这个。“

四、开放权重与协议之争

14. (@maxloh)

“还没有 HuggingFace 链接。我希望他们能用真正的 FOSS 协议发布。Kimi 和 Qwen 现在都在转向受限使用协议(restricted-usage license),虽然这仍比美国的闭源模型好,但相对于中国开源 LLM 文化来说是一种倒退。”

15. (@virgildotcodes)

“OpenAI 和 Anthropic 干脆把 cyber 模型开放给人们用算了。否则我们将面对这样的世界:攻击者用开源+闭源模型,去打一个规模小得多的维护者群体——他们多半重度依赖 Anthropic 和 OpenAI,而且想获批用上’本月热门开源模型’对他们来说也不是简单的事。”

16. (@adrian_b)

“GLM-5.3 的模型权重将在两周内公开。“

五、真实体验与吐槽

17. (@jjcm)

“还是我在 Gemini 3.7 Flash 帖子里做的那个 image→HTML 测试。注意 GLM 不是多模态的,但它居然还是产出了差不多的结果——方法是写个 Python 脚本去检查图片、提取元素。原图:https://image.non.io/neonRamenDesigns.webp ;GLM 5.3 版:https://html.non.io/neonRamenGLM5.3 ;Opus 5 对比版:https://html.non.io/neonRamen 。没有视觉能力还能做到这样,相当出色。它提取了这么多细节,我挺惊讶的。Opus 那版还是明显更好,但考虑到它是多模态,这也在意料之中。期待 Z.ai 未来版本在这项上的表现。”

18. (@zmmmmm)

“又缺多模态?能看图(截图)在实际使用中太有价值了——我猜只要基准里不测,就没人会去关注它。但这直接让它在我的几个主要用例里出局。”

19. (@knguyen0105)

“过去一周,因为最近的’K3 时刻’,我同时试了 K3 和 GLM 5.2。GLM 对我的场景更好用:更快、话更少。看到 5.3 的这些改进,我等不及要试试——对我来说这可能成为 Claude Code 的真正替代品。“

六、全局视角

20. (@postatic)

“听我说,GLM、Kimi、DeepSeek 和 Qwen 就该联合起来,搞出那个能打败前沿实验室模型的’终极模型’——哪怕只是为了刷榜(benchmaxxing)——纯粹制造热度和混乱,搅黄 OpenAI 和 Anthropic 那些万亿美元 IPO 的谈判。”

21. (@tw1984)

“想象一下没有这些开放权重模型的世界——我们大概得把房子做反向抵押贷款,才能付得起给那些万亿美元公司的 token 费,换来用他们模型的权利。“

译者注

  1. GLM 系列与本博客的时间线:6 月 16 日智谱以 MIT 协议全量开源 753B 参数的 GLM-5.2(Simon Willison 评测见延伸阅读),7 月 11 日本博客还落地过用 colibri 在消费级电脑跑 GLM-5.2 744B 的实践。GLM-5.3 官方口径是”基座不变、只做后训练”,这与中国模型圈近期”后训练即护城河”的讨论高度吻合(DeepSeek V4 Flash / V4 Pro 也走类似路线)。
  2. “cyber” 一词的词义之争:不少评论者(@jameshart、@rob74、@bsenftner、@sfn42)吐槽标题里的 “cyber” 含义含糊——如今它被用作 “cybersecurity / cyberwarfare”(网络安全/网络战)的简称,就像 “crypto” 从”密码学”变成”加密货币”一样。文中按社区通行理解译为”网络攻击/网络安全能力”。
  3. exploitation chain(攻击利用链)基准:从漏洞发现、分析、武器化到实际利用的完整攻击链式评估,比单纯的”写代码”更能反映模型在真实攻防中的价值。评论区转述的官方数据是:Mythos 5 在 181/247 个任务上领先,且越靠近利用链上游差距越大——这被解读为”能力增长最快处恰恰是落后最多处”。
  4. cvd.z.ai 与协调漏洞披露:cvd = Coordinated Vulnerability Disclosure(协调漏洞披露)。智谱用模型大规模扫描开源软件并披露 CVE(多数处于 embargo 期),评论区既有赞赏(对标 Anthropic 的 Project Glasswing / Mythos 披露流程),也有质疑(“什么安全评估?”),还有观点认为这正是”突现 cyber 能力”的现实注脚。
  5. 受限使用协议趋势:@maxloh 提到的 Kimi/Qwen 转向 restricted-usage license,是 2026 年夏季英文圈对中国开源模型社区的核心争议之一——“开放权重”不等于”开放协议”,这也与 8 月 3 日 Qwen3.8-Max 帖子里的讨论一脉相承。
  6. Fable / Sol / Mythos:英文圈对前沿闭源模型的通行代称(Anthropic 系 Mythos/Fable、OpenAI 系 Sol 等),本博客 7 月 29 日、8 月 6 日、8 月 8 日已翻译过相关前沿实验室安全事件,可对照阅读。

延伸阅读