post cover

Simon Willison:Meta 携 30B 开源模型 Muse Glimmer 重返开放权重赛道——为常驻本地 Agent 而生,HN 1128 分登顶(2026-08-11)


本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:Introducing Muse Glimmer 原文链接:https://simonwillison.net/2026/Aug/10/introducing-muse-glimmer/ 原文发布:2026-08-10 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。

【译者按】

Meta 重返开放权重赛道了。8 月 10 日,Meta 发布全新 30B 参数模型 Muse Glimmer,采用干净的 Apache 2.0 协议(告别过去饱受诟病的 Llama 附加限制条款),并明确将其定位为”为常驻本地(always-on local)Agent 工作流优化”。这条消息直接登顶 Hacker News,1128 分 / 610 评论,是今天英文技术圈最热的事件。Simon Willison 在第一时间用 LM Studio 和 llm-coding-agent 插件实测了 18.16GB 量化版,跑了代码库探索、视觉描述等真实任务,给出了非常接地气的第一手体验。对中文圈读者来说,这篇的价值在于:一是 Meta 开源策略转向(从 Llama 时代的”伪开源”到 Apache 2.0)直接影响国内开源模型生态的竞争格局;二是评论区围绕”30B 本地模型 vs Qwen3.8 27B / DeepSeek V4 Flash”的对比,恰好呼应了国内模型出海与本地部署的热潮。

【正文】

Introducing Muse Glimmer(2026 年 8 月 10 日 · Link Blog)

Meta 回到了开放权重游戏里!Muse Glimmer 是一个全新的 30B 模型,采用干净的 Apache 2.0 协议(相比过去那些别扭的 Llama 许可证,这是明显进步)。

他们声称这个模型针对的正是我在本地模型中寻找的那几类能力:

端到端 Agent 任务完成(End-to-end Agentic Task Completion):Muse Glimmer 在 DeepSearch QA、MCP-Atlas、𝛕-Bench(τ-Bench)和 SWE-Bench 等全任务基准上取得了不错的成功率——这些基准衡量的是它在脚手架(scaffold)内工作、编写和调试代码、以及从头到尾解决多轮请求的能力。

可靠的工具调用(Reliable Tool Use):该模型能处理各种函数调用,在长工作流中以精确的 schema 调用工具。

多步推理(Multi-Step Reasoning):Muse Glimmer 能在长视野上串联推理,在复杂、扩展的工作流中维持连贯的计划。[……]

这是我用 LM Studio 的 18.16 GB 版本模型生成的一只鹈鹕

各个部件都在,但拼得相当凌乱。

我还用我的 llm-coding-agent 插件试了它,对一份全新的 Datasette 代码库跑了这个提示词:

how does auth work?

这里是它的回答,位于一段长长的、展示它探索代码库时所有工具调用的转录记录的末尾。我用的是 llm-lmstudio,并应用了这个补丁以升级到与 LLM 0.32 兼容。

我非常喜欢这个尺寸的模型:只要机器有 32GB 或以上内存(我的有 128GB),它就能留下充足的空间同时运行其他应用。

Glimmer 是一个视觉模型,所以我让它描述这张图片:

llm -m lmstudio/meta/muse-glimmer -a https://static.inaturalist.org/photos/714731804/large.jpg 'describe image'

岩石上的两只鹈鹕

这是它给出的回答

照片展示了一片岩石防波堤式的海岸线,天空阴沉,水面平滑呈灰色,柔焦背景中有一条模糊的码头/防波堤线。

前景中,两只大型褐色鹈鹕(Pelecanus occidentalis,褐鹈鹕)栖息在杂乱的白灰色石块上。它们具有该物种标志性的长而下弯的黄橙色喙、巨大的喉囊、修长的脖颈,以及背部与翅膀上斑驳的褐灰色羽毛。左侧那只鹈鹕略微转向镜头,似乎在整理羽毛或将喙抵在胸前;头顶和后颈可见一片浅白色斑块,一小撮羽毛竖立成冠。右侧那只基本正面/偏右朝向,头抬起,喙指向下方偏右,同样有浅色头部斑纹,深色带纹的翅羽清晰可见。

两只鹈鹕周围的岩石间散落着几只小得多的深色鸟类——灰褐色羽毛的海鸥/燕鸥类。最左边岩石上站着一只深色鸟,另一只褐色鸟站在右侧鹈鹕的右边,右下前景有一只带红色喙的灰色鸟,画面最右缘还有一只小深色鸟。

整体光线平坦而漫射,水面和天空呈现出柔和、近乎单色的色调,与纹理化的岩石和鹈鹕精细的羽毛形成对比。构图以两只大鸟为主体,衬着平静的水面和低矮的岩石栖木。

【社区精彩评论精选】(Hacker News 热帖 1128 分 / 610 评论)

以下评论来自 Hacker News 讨论帖(CC BY-NC-SA 4.0),按内容质量精选:

@scrlk链接):有意思,看看本周发布的 Qwen3.8 27B 跟它比怎么样。看来稠密(dense)30B 又流行起来了?补充:Muse Spark 1.2 的开源权重版本也将发布:Alexandr Wang 的推文

@solarkraft链接):哇,Meta 回来了(至少暂时是)!我喜欢这类模型。多 token 预测(MTP)让稠密模型能以接近 MoE 模型的速度运行,同时智能程度高得多。帖子的标题(“开放权重的 30B 本地编程模型”)其实说错了:这应该是一个通用 Agent 模型。它还自带预量化版本和 MTP/drafter 模型。看起来不错!

@ache链接):有趣,但看起来像是对(Spark 和)更大的开源权重模型的精心蒸馏。相比 Qwen3.6 27B 的进步不错,但也没那么惊艳——那可是四个月前的模型了。(他们拿 27B 稠密模型而不是 35B MoE 来对比,这点值得表扬,更公平。)Qwen3.8 27B 很可能会在大多数基准上碾压 Glimmer-30B。

@petcat链接):作为业界一员,我希望别再把这些东西叫”开放权重”了,因为太容易和真正的”开源”混淆,而它们并不是。Photoshop 源码 + OSI 许可证 = 能在自己电脑上跑的开源 Photoshop 二进制 = 开放权重的 Photoshop SaaS 网页应用 = 封闭、专有(Opus、GPT 等)。“开放权重”模型仍然只是二进制大块,完全不……

@Gecko4072链接):我认为最理想的是能跑在单块 DGX Spark 上、且能与 DSV4 Flash 731 竞争的模型。Flash 已经是游戏规则改变者了。希望 Meta 有计划,就像当年的 70B 一样。V4 Flash 够聪明,能应付任何用途,但稍微有点大;27B-30B 又不够聪明。

@sajithdilshan链接):本地跑它仍然需要 32-64GB 内存。德国一台 64GB M5 芯片 MacBook Pro 要 4000 多欧元。更实用的模型应该是语言特定(比如 Python 或 JVM 语言)、擅长工具调用和推理的。也许这样还能进一步缩小。

@GodelNumbering链接):扎克伯格的帖子:”……我们很快也会发布 Muse Spark 1.2 的权重,这是我们最新的基础模型……”这才是更大的新闻——对自托管爱好者是好事,也是战略上很聪明的护城河动作。

@avaer链接):我哀叹那些说这在任何意义上”洗白了” Meta(这家公司)的评论。发布这些东西的研究人员几乎和 Meta 没什么关系,只是被这家”屠宰场”供养着。你不是客户,你是……

@mmaunder链接):还记得吗,以前企业网站需要 200 台服务器,因为 Apache 每个连接用一个进程或线程——而 Nginx 一夜之间把它压进了一台机器。LLM 的这一刻快到了。它将把我们带离……

@hypfer链接):把玩了这个模型一阵子,我相当确信它不是在编程领域竞争的。它能做编程,但它的真正卖点似乎是对护栏(guardrails)和安全对齐的不同处理方式。要么是这样,要么是唯一的……

@wxw链接):Meta 明显在把战略改回他们最初的”前沿开源”,但这一次他们面对的竞争更多来自领先的中国实验室。我完全支持,而且我认为 Glimmer 是对可本地托管的……

@brumbelow链接):这样一来,最近 Meta 模型的”安全事件”就说得通了。

@catoc链接):我个人永远不会信任 Meta 的编码 Agent 或 Agent 框架。我赞成他们的开源模型路线,但真的信任 Meta……保护我的隐私和数据……当它跑在我自己的硬件上……绝。不。可。能。

【译者注】

  1. Apache 2.0 vs Llama 许可证:Simon 说的”别扭的 Llama 许可证”指 Llama 系列(尤其 Llama 2/3)自带的附加使用条款——月活超过 7 亿用户需申请商用授权、禁止用模型输出训练其他模型等限制。Muse Glimmer 改用 Apache 2.0,意味着可以自由商用、修改、再分发,这也是 HN 评论区普遍叫好的原因。
  2. 常驻本地 Agent(always-on local agent workflows):指模型持续在本地设备上运行、随时响应 Agent 任务(工具调用、代码操作、多轮请求)的工作模式,而不是像云端 API 那样按请求计费。这对应国内”本地部署 + 私有化 Agent”的潮流(如企业把 Qwen/DeepSeek 部署到内网做 coding agent)。
  3. 基准术语:τ-Bench 测 Agent 在模拟环境中的多轮工具调用与状态跟踪能力;SWE-Bench 测真实 GitHub issue 修复;MCP-Atlas 测 MCP 协议生态下的工具调用;DeepSearch QA 测深度检索问答。这些都是”Agent 能力”而非单纯”聊天能力”的评测。
  4. MTP / drafter 模型:多 token 预测(Multi-Token Prediction)让模型一次预测多个 token,配合草稿模型(drafter)做投机解码(speculative decoding),可在不牺牲质量的前提下显著提速——这是 30B 稠密模型能在本地”跑得动”的关键技术。
  5. 与中文圈生态的对照:评论区反复出现的 Qwen3.8 27B(本周发布)与 DeepSeek V4 Flash(本博客 07-31 已翻译)正是中国开源模型的代表;“Meta 重返开源将直接面对中国实验室的竞争”是这次讨论的焦点之一。另外 @brumbelow 那句”安全事件说得通了”呼应了本博客 08-06 翻译的 Meta 模型测试中意外入侵其他公司事件——Meta 近期开源动作与安全风波形成了有趣对照。

【延伸阅读】