post cover

AI 热点快报:智谱用 10 万+ 张国产加速器跑起全部生产推理,Infra Agent 参与优化自己的推理栈(2026-09-18)


事件与背景

9 月 17 日,智谱(Z.ai)在官方博客发布技术长文《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》。 文章同时在 Hacker News 首页被推荐,拿到 292 分、226 条评论。它披露的两件事各自都够分量:一是 GLM-5.3-Flash 的全部生产推理跑在「超过 10 万张国产 AI 加速器」组成的集群上,整套生产级推理服务是从零搭起来的;二是这套系统大部分工作由 GLM-5.3 驱动的 Infra Agent 完成,不是由基础设施工程师团队独立完成。

先看硬件与推理栈这条线。文章承认客观条件很难:芯片的显存容量与带宽受限,同时要支持新模型架构、100 万 token 上下文窗口和多模态请求,生态不成熟、kernel 支持不完整,很多本该有文档的部分只能靠猜。最终落地的优化是组合拳——线性注意力与 LM Head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合精度 KV cache 量化、Layer Split,再加上 Encode-Prefill-Decode(EPD)分离式架构;官方称这些优化把端到端服务性能提升约 3 倍,硬件利用效率与单 token 成本「达到与主流 NVIDIA GPU 相当的水平」。从首次跑通到生产就绪,用时不到两周

模型侧的市场验证也给了具体数字:GLM-5.3-Flash 曾以匿名模型名 Ox-Alpha 在 OpenCode 和 OpenRouter 上实测,上线一周内成为两个平台使用量最高的模型,六天内处理超过 62 万亿 token

真正有信号价值的是他们复盘出的工程方法论。 智谱把它叫做「dense feedback」(密集反馈),核心论断是:agent 之所以能在推理系统上做出真实的性能收益,靠的不是更会写代码,而是系统能否持续提供可归因的反馈。他们给出三条判据:反馈要足够局部(能落到具体 kernel、输入形状、线程、执行区间、代码路径,而不是只告诉你「吞吐掉了 20%」);获取要便宜及时(能用一次 kernel test 或本地 microbenchmark 回答的问题,不应该每次都跑全服务压测);必须支持客观验证(靠参考实现与对照实验,而不是运行时信号的相关性)。文章给了三个可核对的案例:

  • 数值精度:KDA kernel 的 Context Parallelism 路径里,tl.dot 对 FP32 输入默认走 TF32 计算,误差在长上下文下累积放大;修复是显式设置 input_precision="tf32x3",该修复已上游合入 Flash Linear Attention 的 PR #1180。
  • 跨语言并发:KV Transfer 与 DeepEP 的协作出现瓶颈,根因是 DeepEP v1.2.1 的 intranode_dispatch / intranode_combine 未释放 Python GIL,导致同进程的 Mooncake Transfer 线程拿不到锁;修复后「Prefill + KV Transfer」相对纯 Prefill 的性能差距从 >20% 降到 <1%
  • kernel 调优:引入 ReplaySSM 用算力换显存后,KDA Decode kernel 时间先升(v0→v1);除法优化让 v1 缩短 9.6%;agent 随后发现原实现沿 V 维切 tile,导致同一份 FP32 归一化与门控计算被重复做了 4 次,把 tile 合并进单个 thread block、中间结果留在寄存器、用一次 warp 级归约替代后,相对 v2 取得 1.71× 加速

值得注意的是文章的克制:智谱明确写了「我们还没有到达递归自我改进」,选目标、划边界、评估风险仍然是人(工程师)的职责,人负责定义目标与系统约束、搭建 agent 能直接使用的反馈环境、评审涉及数值语义/异步并发/生产风险的关键改动。

来源(均经 curl 验证返回 200):

为什么现在重要

  1. 「国产加速器 + 自研推理栈」从可行性论证进入了生产口径。 这次是「全部生产流量跑在上面」加上明确的技术清单,而非单点验证。影响判断:如果你在做推理成本模型或采购决策,「国产卡只能跑小模型/只能做离线」这条默认假设需要重新评估。

  2. 单 token 成本与 NVIDIA 持平的官方主张,直接压向整条推理价格曲线。 文章同时给出 3× 端到端提升与「成本相当」两个口径。影响判断:任何按 GPU 时租推导的单位成本模型都值得重算一遍,尤其是长上下文与多模态这两类最吃显存和带宽的负载。

  3. agent 在基础设施工程上的 ROI 第一次有可复述的细节。 「两周从首次跑通到生产就绪、吞吐 3×」不再是一句宣传语,而是配有 kernel、GIL、tile 三个层次的具体改动。影响判断:把 agent 用于系统级优化(而非只用于写业务代码)的项目,现在有了一个可对标的参照样本,也有了可以拿来写立项书的证据结构。

  4. 瓶颈被定位在「反馈工程」而不是「模型能力」上——这是团队今天就能动手的部分。 文章反复强调「端到端指标能告诉 agent 变差了,但不能告诉它为什么」,因此要把正确性测试、运行日志、执行 trace、运行时事件、微基准和端到端指标组织成 agent 可直接调用的工作流。影响判断:把可观测性投资当作 agent 能力投资来算预算,这比等下一个更强的模型更早见效。

  5. 「匿名上架、用真实使用量验证、再认领」正在成为一种新的分发范式。 Ox-Alpha 在 OpenCode 与 OpenRouter 上匿名跑出六天 62 万亿 token、双平台第一之后才公开身份。影响判断:你正在评测的「匿名模型」很可能来自头部实验室,这改变了模型选型的时机与信息结构。

工程师/产品人今天能做什么

  1. 用三条判据给自己的 agent 做一次体检。 列出 agent 每次迭代实际能拿到的反馈信号,把「端到端指标」标成不可归因,然后针对 top-3 故障类型各补一个局部验证手段(kernel/单元对比、本地微基准、单请求 trace)。判断标准很具体:能否在一次改动后 1 分钟内回答「是哪一层变差了」。

  2. 把「每次改动都跑全量压测」换成内核级对照测试。 文章的做法是把并行策略到 kernel 的映射写下来,让 agent 在本地先验证正确性再上生产验收。如果你的 CI 里最慢的一环正是端到端基准,这是投入产出比最高的重构。

  3. 建一个「优化骨架库」,把隐性经验显式化。 智谱让 agent 从 SGLang、Flash Linear Attention、DeepGEMM 等项目里抽取优化技巧,连同适用条件、变换方法、资源约束、验证证据一起沉淀,已验证的结论回流骨架库。你可以先做一个最小版本:把团队里三条最值钱的性能优化经验写成「条件 + 方法 + 证据」三栏。

  4. 搜一遍自己 kernel 里的默认精度陷阱。 tl.dot 这类算子对 FP32 输入默认走 TF32、在长上下文下静默累积误差——这是长上下文服务里最隐蔽的一类正确性事故。在自研或 fork 的 kernel 里查默认精度设置,比事后调指标便宜得多。

  5. 若在评估异构/国产推理,把他们的清单当验收项。 显存与带宽受限下的量化组合(W8A8 + 混合精度 KV cache)、EPD 分离式架构、context 并行下的数值精度回归测试、以及并行策略↔kernel 映射表——这四项可以直接变成你的选型打分表。

待观察

  1. 3× 提升与「单 token 成本与 NVIDIA 持平」目前都是官方口径,尚无第三方复测。 文章未披露具体芯片型号、互联拓扑与基准负载配置,因此这两个数字无法在外部独立校验;同时 HN 讨论中对「集群是否足够便宜到支撑这一价格」也有疑问。建议把它当作方向性证据而非采购依据。

  2. 「10 万张加速器全链路国产」这一说法在 HN 讨论中被直接质疑(涉及光刻、内存、设计等环节是否同样本地化),官方文章没有给出答案。另外,HN 评论里出现了针对该模型来源的其他指控,因无可靠证据,本文不予采信、也不引用。

  3. 同日其他 AI 相关热点的来源未通过验证,已按流程排除: 经济学人「AI 已超越部分顶尖人类预测者」(curl 返回 000,连接失败)、Gowers 博客「我为何没有签署菲尔兹奖得主联署信」(403)、Fujitsu MONAKA CPU 发布(429 限流)。这三条均未作为本文来源,URL 与数据不予引用。