post cover

AI 热点快报:Google 发布 DiffusionGemma 技术报告——扩散式 LLM 以约 1500 tok/s 冲击自回归范式(2026-08-21)


事件与背景

8 月 20 日,Google 团队在 arXiv 发布《DiffusionGemma Technical Report》,首次公开了这款离散扩散(discrete diffusion)大语言模型的完整技术细节,随即登上 Hacker News 首页并引发工程师热议(142 分,讨论集中在实测性能与范式前景)。

核心事实(均来自报告摘要原文):

  • 生成方式:不再逐 token 自回归解码,而是每次迭代并行精化 256 个 token 的块,绕开传统 LLM 的顺序解码瓶颈。
  • 模型来源:并非从零训练,而是对 Gemma 4 的 MoE 模型(3.8B 激活参数 / 25.2B 总参数)微调而来;两阶段训练(SFT 教双向去噪 + RL 与采样器蒸馏)只用了原模型不到 10% 的训练 token 预算
  • 性能:平均每个前向约生成 20 个 token,单张 H100 上约 1500 输出 token/秒——比采用最先进投机解码(speculative decoding)的自回归模型还快。
  • 能力保留:思考模式(thinking mode)、多模态输入、长上下文均保留;即使做了扩散微调,仍可回退到自回归生成(仅轻微降级),指向扩散-自回归混合解码的可行路径。
  • 训练管线:第一阶段用监督微调教会模型双向去噪,第二阶段用强化学习加采样器蒸馏同时优化生成质量与推理效率——这套”改造而非从零训练”的配方是报告最值得抄作业的部分。

相关来源(均经 curl 验证返回 200):

为什么现在重要

1. 非自回归生成从论文走向可运行权重,是生成范式的工程化验证。 扩散式 LLM 并非新概念,但过去多为学术演示;这次是带完整工程细节、可直接在 vLLM 里跑起来的开放权重模型。影响判断:如果”并行块去噪”路线成立,KV cache、投机解码、预填充/解码拆分等一整代推理优化技术的优先级都要重估。

2. “扩散化”可能是对存量模型的低成本改造路径。 用不到 10% 的训练预算把成熟自回归模型改造成扩散模型,意味着各团队不必从零预训练就能跟进这一范式。影响判断:这会把扩散 LLM 的门槛从”少数实验室”拉低到”有微调能力的团队”,范式扩散速度可能远超预期。

3. 推理成本经济学被重写。 1500 tok/s 意味着长文生成、agent 循环、代码草稿这类”输出密集型”场景的延迟和单位成本出现数量级变化窗口。影响判断:以 token 计价的推理市场,很快会出现”扩散版”与”自回归版”的同级产品定价倒挂。

4. 生态响应极快,推理栈正在成型。 HN 上有工程师实测 vLLM 可跑、单张 5090 上 nvfp4 版本稳定超过 900 TPS;社区已出现 macOS 与 Rust+CUDA 的从零复现。影响判断:扩散推理不是”等一等”的远期话题,工具链已开始被社区填上。

5. 质量差距依然真实,范式转折不等于全面替代。 同一批 HN 实测指出它”明显不如原版 26B-A4B”,且缺结构化输出、部分工具调用会错。影响判断:当前定位是”速度优先”的差异化赛道,而非自回归的即时代替品——这恰恰是工程选型最该看清的边界。对中文生态的直接启示:一旦国产模型厂商跟进”MoE 改造扩散化”路线,推理成本优势会快速传导到 API 定价与端侧部署,中文开发者应提前在技术雷达上占位。

工程师/产品人今天能做什么

  1. 读报告 + 可视化指南,先建立”离散扩散 vs 自回归”的正确心智模型(256 token 块、双向去噪、采样器蒸馏这几个概念 30 分钟能过完)。
  2. 在 vLLM 上实测 nvfp4 版本,记录自己硬件上的真实 TPS 与输出质量;注意其结构化输出与工具调用的已知缺陷,别直接放进生产链路。
  3. 对输出密集型场景做 A/B:agent 日志、批量摘要、代码草稿等”重输出”任务,对比 DiffusionGemma 与”自回归 + 投机解码”的延迟/成本/质量三角。
  4. 关注社区复现项目(如 mmastrac/diffgemma),评估 Apple silicon 与自建推理栈的适配性——Mac 上并行扩散目前并不占优,别被 H100 数字误导。
  5. 把”扩散-AR 混合解码”列入路线图观察项:报告明确指出混合路径可行,一旦官方或社区验证,现有推理服务只需增量改造即可受益。

待观察

  1. 权重与服务的正式渠道:报告称 open-weight,但 deepmind.google 模型页与官方博客在自动化环境下不可达,具体下载入口与 API 定价以官方为准(本次未能直接核验)。
  2. 质量差距的弥合曲线:结构化输出、工具调用、复杂推理何时补齐,决定它能否从”速度玩具”进入 agent 生产链路。
  3. 更大规模与后续路线:报告只覆盖 3.8B 激活参数的改造;更大 MoE、以及 HN 评论提到的对 noise-prediction 策略本身的质疑(Kaiming He 相关工作),都值得跟踪。