post cover

AI 热点快报:Redis 之父把前沿模型搬回本地——ds4 用 2-bit 量化 + 磁盘 KV 缓存,让 284B 级 MoE 跑进消费级机器(2026-10-04)


事件与背景

  • 10 月 2 日,Hacker News 首页出现一条故事:From the creator of Redis; run LLM locally with ds4(321 分,作者 fibo),指向 dwarfstar.sh。故事主角是 DwarfStar 4(简称 ds4),由 Redis 作者 Salvatore Sanfilippo(antirez) 主导;官方 About 页把他写成「which is best known as the creator of Redis」。
  • 这不只是「又一个人写推理引擎」。ds4 的位置有点特殊:一边是 Redis 作者本人的工程信誉,一边是「开源权重正逼近前沿」的现实——当 DeepSeek、GLM、Qwen 的开源权重足够强,「把它压进自己拥有的机器」就从爱好者话题变成了可核算的工程问题。
  • ds4 的自我定位不是又一个模型,而是一台推理引擎:官方 About 页的原话是把它当成「the local inference engine that treats『run a frontier model on your own machine』as an engineering problem, not a compromise」。它由自包含的 C 代码写成、MIT 许可,并明确声明「不是通用 GGUF 运行器」——只跟随少数几个最好的开源权重,模型出现更好的替换就会被移除(模型支持「intentionally opportunistic」)。
  • 目前支持的模型:DeepSeek V4 Flash(含实验性视觉模型)、DeepSeek V4.1 Flash、GLM 5.2 / 5.3、GLM 5.3 Flash、DeepSeek V4 PRO、Qwen3.8 Flash Next。
  • 支持硬件:Metal(主目标,96GB+ Mac;内存不够可走 SSD streaming)、NVIDIA CUDA(DGX Spark 是主目标,也支持 Ada Lovelace 多卡,包括 L40S)、ROCm(Strix Halo 一类,如 Framework Desktop)。
  • 三项关键技术:其一,非对称 2-bit 量化——只压路由专家(routed experts),保留关键共享路径的高精度;其二,KV 缓存当作磁盘公民——按渲染后提示词前缀的 SHA1 落盘,重启后按同一前缀哈希直接恢复,不必整段重新 prefill;其三,一套引擎三种接口:./ds4(CLI)、./ds4-server(本地 HTTP API,可接 Claude Code / Codex CLI / opencode / pi)、./ds4-agent(持久编码会话),三者共用同一份模型状态与缓存。
  • 官方给出的量级数据:Qwen3.8 Flash Next Q2 可在 64GB Apple Silicon Mac 上运行(部分权重从 SSD 流式加载);8×L40S 的 Flash 配置达到约 126 t/s 聚合生成、16 路会话;两台 128GB Mac 走 RDMA 张量并行可跑 4-bit DeepSeek Flash 或 GLM 5.3 Flash。这些均为厂商自报基准。
  • 同窗口的另一条呼应:10 月 3 日(德国统一日),Aleph Alpha 发布 Kolibri——一个 78B 总参 / 3B 激活的英德 MoE,1M 上下文、Apache 2.0 开放权重,主打公共部门/工业/航天的「主权 AI」。和 ds4 一样,都指向「高效 MoE + 开放权重 + 可自持部署」这条线。
  • 社区讨论是「真动手」型的(HN 讨论页本机不可达,以下取自 hn.algolia.com 的评论原文):有人直接质疑「the problem is the dsv4 checkpoint so quantized isn’t very good」,把焦点放在量化后的 DeepSeek V4 质量;有贡献者称自己实现了 fused TQ,让 Qwen3.8 Flash Next 在 128GB M5 Max 上达到 1M 上下文(对应 PR #1115);还有人受 DwarfStar 启发,为 Intel Xe-LP 32GB 笔记本写了同类引擎(跑量化 Gemma-4)。
  • 主要来源(均已用 curl -L 验证返回 200):ds4 主页、antirez/ds4 仓库、README(主源)、quickstart 文档、antirez 博文:Not just development, distribution of software may change as well、Aleph Alpha Kolibri 公告。验证失败、不予引用:news.ycombinator.com 讨论页(item 49936575)从本机返回 000 超时,HN 分数/评论数改由 hn.algolia.com API 获取;huggingface.co/Aleph-Alpha/Kolibri 同样 000,故 Kolibri 事实以 Aleph Alpha 官方博客为准。

为什么现在重要

  1. 前沿能力开始「回到自己机器」。 ds4 的立论是一句话:「AI is too critical to be only a service provided by others」。当 284B 级 MoE 能用 2-bit 量化跑在 64–128GB 消费级机器上,采购问题就从「买多少 API 额度」变成「买多大的机器」。影响:把「本地可跑」正式纳入架构选项,尤其是数据不能出内网的场景。

  2. 低比特量化已不是玩具。 非对称 2-bit 只压路由专家、保留共享路径——这正是 MoE 结构红利。影响:评估模型时先看 active 参数与专家结构,而不是总参数量;过去「跑不动」的大模型,可能靠结构感知量化直接进入你的硬件预算。

  3. 磁盘 KV 缓存让长上下文在消费级 SSD 上可用。 按提示词前缀哈希落盘、命中即恢复,重启不必整段 prefill。影响:对 agent、长文档、代码库问答这类「同一前缀反复调用」的负载,本地推理的延迟模型会明显区别于「每次全量重算」。

  4. 多后端 = 削弱 CUDA 单一依赖。 Metal / CUDA / ROCm 三线并进,甚至在较老的 Ada Lovelace 卡上也能跑新模型。影响:硬件选型自由度上升,「必须买最新 N 卡」不再是唯一路径。

  5. 「AI 时代的两条新规范」被写进同一份 README:AI 代码披露 + 分发方式之变。 README 明说本项目由 AI coding agents 强力协助、人类主导想法与测试调试,并致谢 llama.cpp / GGML;antirez 又在博文里主张,编码 agent 让用户能低成本深度改软件,所以项目不必覆盖所有配置,而应成为「最大用例的模板」——ds4 因此刻意不打 tag、不发 release,文档同时面向人和 agent。影响:代码出处与「一次发布」的语义都需要重新定义,值得在你的项目里建立同类披露与「面向 agent 的文档」惯例。

  6. 本地推理引擎正在变成 coding agent 的后端。 ds4-server 暴露的是本地 HTTP API,官方文档直接给出接 Claude Code、Codex CLI、opencode、pi 的路径,ds4-agent 本身就是一个持久的编码会话。影响:你不必换掉手上的 agent 工具,只要把后端从云 API 换成本地引擎——这让「同一工具、可切换后端」成为隐私敏感团队的现实选项。

工程师/产品人今天能做什么

  1. 跑一次基线。 在 64GB+ Apple Silicon(或有消费级/数据中心 GPU)的机器上,按 quickstart 装 ds4,跑 Qwen3.8 Flash Next Q2 或 DeepSeek V4.1 Flash,记录 prefill / 生成速度与内存占用,作为「本地 vs API」的可比数字。
  2. 挑一个前缀高度重复的敏感负载。 用 ds4-server 的本地 HTTP API 接上你现有的 Claude Code / Codex CLI,对同一段代码库或长文档做多轮问答,对比隐私、成本与延迟。
  3. 按结构而非总参数评估模型。 拿你实际要用的开源权重,先看 active 参数与专家布局,再判断 2-bit / 低比特路线能否进你的内存预算。
  4. 把推理后端抽象出来。 检查模型调用是否与厂商/key 解耦,为「同一模型既走云又走本地」留出切换开关。
  5. 给项目加一页 AI 使用披露。 写清哪些部分由 AI 辅助生成、依赖了哪些上游(如 llama.cpp / GGML),把作者、依赖、验证三件事讲明白。

待观察

  • 2-bit 的质量损失边界。 官方称这些模型「tolerate aggressive routed-expert quantization」,但目前公开的是自述与自家基准,缺独立第三方对低比特下推理/代码质量的评测;社区已出现 ds4go、club-3090 等移植与 fork,后续值得盯。
  • 「本地可跑」能否进生产。 SSD streaming 的真实速度、长时间稳定性、多用户并发(官方 8×L40S 126 t/s 为厂商自报)都需要在真实负载下复现。
  • 同周的 Kolibri 与 ds4 形成呼应。 若「高效 MoE + 开放权重」持续成熟,「主权 / 自持推理」可能从合规话题变成常规工程选项。