post cover

AI 热点快报:GLM-5.3 开源权重发布,纯后训练路线冲顶 agentic 编程(2026-08-29)


事件与背景

北京时间 8 月 28 日深夜,智谱旗下 Z.ai 发布 GLM-5.3 并开放模型页,消息以 “GLM-5.3 is now open-weight” 冲上 Hacker News 首页(331 分 / 125 评论)。官方博客开宗明义:“Scaling post-training is all we did for GLM-5.3”——GLM-5.3 与 GLM-5.2 共用同一基座模型,全部提升来自后训练(数据与 RL 算力的堆叠),而非换用更大的基座;配套技术栈包括 IndexShare 长上下文方案、长程任务 RL 框架与 THUDM/slime 异步训练系统。

GLM 系列是过去一年开源权重阵营发布最勤、迭代最快的模型家族之一,GLM-5.3 是其第五代的最新增量。关键数据(官方博客与模型卡):Z.ai Code Bench 较 GLM-5.2 提升 50%;Terminal Bench 3.0 从 4.6 跃升至 28.3(同期 Kimi K3 为 17.4);DeepSWE v1.1 66.9 vs 46.2;SWE-Marathon v1.1 42.5 vs 19.4;Agents’ Last Exam(ALE-CLI)28.5 vs 23.8,均为开源权重 SOTA。API 方面支持 low/high/max 三档思考强度、不再支持关闭思考;GLM-5.3 已向全部 GLM Coding Plan 订阅者开放,并启用新的点数制配额。

来源:

为什么现在重要

  1. “纯后训练”路线证明基座规模不再是唯一杠杆。 Terminal Bench 3.0 上约 6 倍的跃升、编码与长程任务的全面上涨,全部来自数据与 RL 堆叠而非更换基座。影响判断:这为资源有限的团队提供了一条可复制的”后训练增强”路径,基座军备竞赛的相对重要性被进一步稀释。

  2. 更强的 agent 能力叠加更省的 token 消耗。 官方数据:Max 档 34.5% 仅耗约 7.5 万输出 token(GLM-5.2 为 23.4% @ 9.6 万);High 档 31.4% @ 5 万 token,反超 Claude Opus 4.8(29.5% @ 12 万)。影响判断:长程 agent 任务的单位成本正在结构性下降,原本不划算的自动化场景开始变得可行。

  3. 点数制 + 错峰五折:推理定价进入”用电低谷”模式。 GLM Coding Plan 按输入/缓存输入/输出分别计点,周一至周五 14:00–18:00(UTC+8)以外的时段全部按 50% 计费。影响判断:面向 7×24 agent 工作负载的精细化定价竞争已经开打,批量任务的调度策略本身正在成为成本变量。

  4. 涌现的”网络能力”把安全议题推回台前。 CyberGym(漏洞发现)84.5 分居对比表第一;ExploitBench 54.4 是 GLM-5.2 的两倍多(仍低于闭源 Fable 5 的 78 与 GPT-5.6 Sol 的 76.5)。影响判断:开源权重与强攻防能力的组合,将同时重塑安全攻防格局与开源模型的监管议程。

  5. 前沿模型发布进入按周/按小时竞速。 继 DeepSeek V4 Pro、Qwen3.8、Grok 4.6 之后,GLM-5.3 再次刷新开源编码模型上限。影响判断:模型选型与评估不能按季度滚动,团队需要建立持续的基准回归机制,把模型评测变成常态化预算项。

工程师/产品人今天能做什么

  1. 在 ZCode、Claude Code 或 OpenCode 中接入 GLM-5.3 API,用自己项目的真实长程任务(跨仓库重构、缺陷修复、端到端测试)跑一轮对比,同时记录 token 消耗与成功率。
  2. 阅读技术报告(arXiv 2602.15763)与 IndexShare 长上下文论文(arXiv 2603.12201),评估其长上下文与长程 RL 思路能否借鉴到自研 agent/RAG 架构。
  3. 若使用 GLM Coding Plan,把批量与夜间任务调度到非高峰时段,用错峰五折优化推理成本,并核算缓存命中对点数的边际影响。
  4. 安全团队把”漏洞发现/利用链”能力纳入模型选型评估清单,为开源权重模型制定使用边界与审计策略,并提前评估双用途模型的合规要求。
  5. 跟踪 Hugging Face 上 zai-org/GLM-5.3 仓库(目前可见 141 个 safetensors 权重分片)与 glm-5.3 自定义许可条款,评估自托管与微调可行性。

待观察

  • 官方称权重将在”发布两周后、安全评估与加固完成后”开放,但 HF 仓库已出现完整权重分片——“先上模型卡、再放权重”本身已成为开源模型发布的常见节奏,实际可用性应以仓库可下载文件与许可条款为准,需持续确认。
  • 同周监管信号:8 月 27 日美国北加州联邦法院裁定特朗普政府对 Anthropic 的黑名单认定违法,并指政府行政记录”单薄”(法院裁定原文 PDF),对依赖政府与国防合同的 AI 厂商将产生连锁影响。
  • 开源游戏引擎 Luanti 因”无依据的 AI 版权通知”被 Google Play 下架(官方说明),AI 生成的滥用型 DMCA 通知或倒逼平台改进申诉机制。