DeepSeek V4 Pro 0813 发布:API 独供、涨价在即,HN 963 分热议性价比与推理档位(2026-08-13)
本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:DeepSeek V4 Pro 0813 (on OpenRouter) 原文链接:https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/ 原文发布:2026-08-12 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。
【译者按】
DeepSeek 又一次以”闷声发大财”的方式上线了新模型:8 月 13 日,DeepSeek V4 Pro 0813 仅通过 API 提供(OpenRouter 抢先上架),官方连个像样的公告页都没有。但它的价格极具杀伤力——评论区实测约比 Opus 4.8 便宜 20 倍,直接把这条消息顶到 Hacker News 第二名(963 分 / 410 评论)。本文翻译 Simon Willison 的即时点评:他注意到该模型低/中/高三档推理设置画出的鹈鹕差异极大(此前从未在其他模型上见过),并梳理了评测数据从 DeepSeek 官方微信群 → Reddit(被删)→ HN 的传播链——这本身就是中文圈”微信群发布、海外发酵”现象的绝佳样本。对中文圈读者来说,这篇的价值在于:V4 Pro 0813 定价与 V4 Flash 0731(本博客 07-31 已翻译)形成”涨价在即”的连续剧,而评论区围绕性价比、pass@1 可靠性、数据出境等话题的争论,恰好与国内开发者关心的问题同频。
【正文】
DeepSeek V4 Pro 0813(on OpenRouter)(2026 年 8 月 12 日 · Link Blog)
最新的 DeepSeek Pro 模型现已可用,仅通过 API 提供。我不得不链接到 OpenRouter,因为 DeepSeek 没有为他们这款新模型准备任何像样的公告页面。
我还无法确认他们是否计划发布开放权重,但鉴于 4 月的 deepseek-ai/DeepSeek-V4-Pro 和 7 月的 deepseek-ai/DeepSeek-V4-Flash-0731 权重都已经放出,看起来很有可能。
有意思的是,我在低、中、高三个不同的推理档位下得到了看起来非常不同的鹈鹕。我还没有从其他任何模型上注意到过这种差异:
低(Low):

中(Medium):

高(High):

至于基准测试……据我所知,这些数据先发布在 DeepSeek 官方微信群,然后被复制粘贴到 Reddit 的一个帖子(被版主以”低质量”为由删除),再被复制进 Hacker News 上的这张 ASCII 表格。
以下为 HN 评论 @scrlk 贴出的完整基准表(CC BY-NC-SA 4.0 讨论帖内容):
| 基准 | DS-V4-Pro 0813 | DS-V4-Flash 0731 | DS-V4-Pro Preview | DS-V4-Flash Preview | GLM-5.2 | Kimi-K3 | Opus-4.8 | Fable 5(含 fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE(无/有工具) | 42.7/60.0 | 37.8/51.5 | 37.7/48.2 | 34.8/45.1 | 40.5/54.7 | 43.5/56.0 | 49.8/57.9 | 53.3/63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 61.8 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 39.4 | 48.9 | - | 69.7 | - |
| Cybergym | 83.3 | 76.7 | 52.7 | 38.7 | - | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 7.3 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 49.7 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents’ Last Exam | 25.7 | 25.2 | 16.5 | 15.8 | 23.8 | 27.6 | 25.7 | - |
| AutomationBench(Public) | 31.8 | 25.1 | 12.8 | 10.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack | 71.1 | 68.7 | 41.8 | 37.0 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard | 67.2 | 59.6 | 31.1 | 25.8 | 54.5 | 63.0 | 71.7 | 68.3 |
【社区精彩评论精选】(Hacker News 热帖 963 分 / 410 评论)
以下评论来自 Hacker News 讨论帖(CC BY-NC-SA 4.0),按内容质量精选:
@aabdi(链接):定价页显示,它和 Opus 4.8 有竞争力,但弱于 Sol 或 Fable。价格大约便宜 20 倍。
@jklmnopqrstuvw(链接):在 Codex CLI 里同时测了 DS V4 Pro 0813 和 Grok 4.6(都走 OpenRouter),给我的项目做同一个新功能开发。DeepSeek 4 Pro:干了 12 分 02 秒,花费 $0.12,有 bug。Grok 4.6:干了 3 分 18 秒,花费 $1.41,没 bug。
@freakynit(链接):刚通过 OpenRouter 测了,给完全相同的任务:扫描现有仓库,生成一个 docker-compose 文件部署到 caddy 服务器后面,某些端口段已被占用,服务需要从外部签发通配符证书,PostgreSQL 需要内置……我同时测了这个模型和 gpt-5.6-terra-high。结果:这个模型出了一些问题,terra 一个都没有。这些结果和我之前用最新 Flash 版的观察一致。基准测试说的和我的实际观察不一样。项目简单的时候它们还不错……一旦复杂就不行了。
@minraws(链接):DeepSeek V4 Pro 0813 是我试过的最不可靠的模型。它在 pass@3 上出奇地好——论任务完成率你也许能让它追平 Sol 或 Fable——但 pass@1 一塌糊涂,非常容易出错,绝大多数基准都表现糟糕。我不确定原因,但我怀疑可能是 GRPO。
@simjnd(链接):DeepSeek V4 Flash 0731 以这么小的模型(和价格)实现了如此巨大的能力跃升,以至于我对这次发布有点失望。我给我的 Agent 拴着很短的缰绳,用它们高度交互地头脑风暴、讨论架构,然后写代码(尤其是原型),Flash 在我需要的一切上都碾压。也许我的野心比起需要 Fable/Sol 级模型的人太 tame 了,但可预见的未来我大概会留在 Flash,不升 Pro。
@hemkeshr(链接):我对 V4 Pro 期望很高,尤其是 V4 Flash 0731 在同类 Flash 模型里表现那么出色。结果真令人失望。
@nthypes(链接):在近一半的基准上仍然落后于 Kimi-K3。
@Gecko4072(链接):正在官方 DeepSeek API 上飞速烧钱。而且他们从今天开始涨价。V4 Flash 0731 仍然感觉是过去几个月(可能还有未来)最出众的模型。
@monster_truck(链接):让它在我的交通模拟器/分布式物理引擎上全力跑了一整天(2B token 花了约 $12.50,50% 缓存命中),它找到了一些相当显著的优化空间,而且没有引入任何新问题。我很满意。
@yipinwong(链接):比 Luna 差,还比 Luna 贵。继续用 Luna,不把我的数据发给 DeepSeek(中国)。
@eshack94(链接):看来目前唯一可用的端点(写这条时)要求你在 OpenRouter 隐私设置里开启”允许使用请求数据训练的付费端点”。希望很快出现不拿数据训练的其他付费供应商。
@schmorptron(链接):过去的 DeepSeek 模型和现在这些新 checkpoint 在 ArtificialAnalysis 的 AA-Omniscience 和幻觉率基准上得分都很差。不知道原因是什么?也许他们比其他家更过度押注编码?我在(编码)使用中还没注意到这一点,有人见过它比其他模型更容易编造潜在根因或其他臆测内容吗?
@LeonKnst(链接):我觉得有趣的是,采用率受”势头”影响有多大。这些中国模型有些能力出奇地强,但开发者往往默认选择那些已经是”行业标准”的模型。
@xbmcuser(链接):你们读小字了吗?他们计划未来大幅提价。
【译者注】
- OpenRouter:聚合多家 LLM API 的中转平台,统一接口按量计费,常是模型”抢先首发”的渠道。DeepSeek 官方没有为新模型做公告页,因此 Simon 只能链到 OpenRouter 的商品页。
- “推理档位”(reasoning levels):API 里的 low/medium/high 参数,控制模型在回答前进行多少推理(thinking)计算。Simon 发现三档画出的鹈鹕差异极大——低档是扁平矢量、高档多了三角旗和音符等细节——这是他”鹈鹕基准”系列的新发现(本博客 07-17 已翻译过他对 Kimi K3 的鹈鹕测试)。
- 基准术语速查:HLE(Humanity’s Last Exam,人类终极考试,无/有工具两档);Terminal Bench 2.1 测终端/命令行 Agent 任务;NL2Repo 测从自然语言生成整个代码仓库;Cybergym 测网络安全任务;DeepSWE 测深度软件工程(真实 issue 修复);Toolathlon-Verified 测工具调用;Agents’ Last Exam / AutomationBench 测 Agent 通用能力;DSBench 测全栈与困难级开发。表格里 Kimi-K3 的 NL2Repo/Agents’ Last Exam 为空,是官方未公布,不代表 0。
- pass@1 与 GRPO:pass@1 指模型”一次尝试就成功”的概率;@minraws 的观察是 V4 Pro 0813 pass@3(多次采样取最优)很强但 pass@1 很弱,即”单次输出不稳定、靠多次采样兜底”。GRPO 是 DeepSeek 开源的强化学习算法(Group Relative Policy Optimization),被怀疑与这种”多尝试才稳定”的行为有关。
- “涨价在即”的定价连续剧:评论区多人提到 DeepSeek 当天开始上调 API 价格、未来还会大幅提价。这与 V4 Flash 0731”白菜价小模型”的定位形成对照——也解释了为什么有人抢在涨价前冲量(@cjg007:“在 V4 Pro 0813 涨价之前,我预计会有一波疯狂流量,希望服务器撑得住”)。
- 与中文圈生态的对照:评测数据从 DeepSeek 官方微信群流出 → Reddit r/LocalLLaMA 被删 → HN ASCII 表格,印证了国内 AI 圈”官方群发布、海外二次发酵”的典型传播路径;评论区反复出现的 Kimi-K3 / GLM-5.2 / Qwen 与 Luna(另一款中国出海模型)对比,也说明海外开发者正把中国模型群当作性价比主力。数据出境顾虑(@yipinwong 不愿把数据发给中国的 DeepSeek)则是海外视角下绕不开的议题。